Дом
Компания Moonshot AI и Университет Цинхуа представили архитектуру PrfaaS, призванную устранить «узкое место» в вычислительной мощности крупных моделей
Новые технологии позволяют преодолеть ограничения производительности крупных языковых моделей (LLM). Недавно исследователи из Moonshot AI (Moonshot) и Университета Цинхуа представили новую архитектуру под названием Prefill-as-a-Service (PrfaaS). Это исследование решает проблему аппаратных ограничений при развертывании сервисов на основе крупных моделей в центрах обработки данных за счет оптимизации распределения вычислительных ресурсов, что позволяет значительно повысить эффективность инференса.

Технический прорыв: «хирургическое» разделение этапов предварительного заполнения и декодирования
В настоящее время процесс инференса для больших языковых моделей состоит из двух отдельных фаз:
Фаза предварительного заполнения: эта фаза требует интенсивных вычислений, она обрабатывает входные данные и генерирует кэш «ключ-значение» (KVCache).
Фаза декодирования: эта фаза требует большой пропускной способности памяти и генерирует выходные данные слово за словом.
В традиционных архитектурах обе фазы обычно обрабатываются в одном и том же центре обработки данных или даже на одном и том же сервере. Поскольку они имеют разные потребности в аппаратных ресурсах, такое «принудительное объединение» часто создает дисбаланс в распределении вычислительных ресурсов и пропускной способности, что приводит к перегрузке сервиса.
Основная инновация: эффективное межрегиональное взаимодействие
Основная особенностьPrfaaS — реализация развязанного сервиса. Он переносит вычислительно-емкие задачи предварительного заполнения на специализированные кластеры с высокой вычислительной мощностью. После завершения задачи система использует стандартный Ethernet для удаленной передачи сгенерированного KVCache в локальный кластер декодирования.
Такая конструкция устраняет ограничения физического пространства, позволяя выполнять предварительное заполнение и декодирование одновременно в разных дата-центрах. Для обеспечения эффективной передачи PrfaaS использует механизм планирования с двумя временными масштабами, который гибко распределяет ресурсы с учетом колебаний трафика в реальном времени, в сочетании с точной маршрутизацией, чтобы предотвратить задержки запросов с длинным текстом из-за неравномерного распределения ресурсов.
Результаты тестирования: оптимизация пропускной способности и задержки
Данные исследований показывают, что архитектура PrfaaS демонстрирует замечательную производительность в реальных приложениях:
Пропускная способность сервиса увеличилась на 54%, что значительно повысило количество запросов, обрабатываемых за единицу времени.
Задержка ответа значительно уменьшилась, что ускорило генерацию первого токена с точки зрения пользователя.
Максимальное использование ресурсов за счет разделения вычислительных, сетевых и хранилищных подсистем, что позволяет избежать проблем с перегрузкой, характерных для традиционных архитектур.
Сотрудничество между Moonshot AI и Университетом Цинхуа не только предлагает новые инженерные подходы к крупномасштабному вычислению ИИ, но и закладывает основу для будущих межрегиональных вычислительных сетей. Эта модель Prefill-as-a-Service может стать ключевой вехой на пути к промышленному внедрению крупных моделей.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (1)
Новые технологии позволяют преодолеть ограничения производительности крупных языковых моделей (LLM). Недавно исследователи из Moonshot AI (Moonshot) и Университета Цинхуа представили новую архитектуру под названием Prefill-as-a-Service (PrfaaS). Это исследование решает проблему аппаратных ограничений при развертывании сервисов на основе крупных моделей в центрах обработки данных за счет оптимизации распределения вычислительных ресурсов, что позволяет значительно повысить эффективность инференса.

Технический прорыв: «хирургическое» разделение этапов предварительного заполнения и декодирования
В настоящее время процесс инференса для больших языковых моделей состоит из двух отдельных фаз:
Фаза предварительного заполнения: эта фаза требует интенсивных вычислений, она обрабатывает входные данные и генерирует кэш «ключ-значение» (KVCache).
Фаза декодирования: эта фаза требует большой пропускной способности памяти и генерирует выходные данные слово за словом.
В традиционных архитектурах обе фазы обычно обрабатываются в одном и том же центре обработки данных или даже на одном и том же сервере. Поскольку они имеют разные потребности в аппаратных ресурсах, такое «принудительное объединение» часто создает дисбаланс в распределении вычислительных ресурсов и пропускной способности, что приводит к перегрузке сервиса.
Основная инновация: эффективное межрегиональное взаимодействие
Основная особенность
Такая конструкция устраняет ограничения физического пространства, позволяя выполнять предварительное заполнение и декодирование одновременно в разных дата-центрах. Для обеспечения эффективной передачи PrfaaS использует механизм планирования с двумя временными масштабами, который гибко распределяет ресурсы с учетом колебаний трафика в реальном времени, в сочетании с точной маршрутизацией, чтобы предотвратить задержки запросов с длинным текстом из-за неравномерного распределения ресурсов.
Результаты тестирования: оптимизация пропускной способности и задержки
Данные исследований показывают, что архитектура PrfaaS демонстрирует замечательную производительность в реальных приложениях:
Пропускная способность сервиса увеличилась на 54%, что значительно повысило количество запросов, обрабатываемых за единицу времени.
Задержка ответа значительно уменьшилась, что ускорило генерацию первого токена с точки зрения пользователя.
Максимальное использование ресурсов за счет разделения вычислительных, сетевых и хранилищных подсистем, что позволяет избежать проблем с перегрузкой, характерных для традиционных архитектур.
Сотрудничество между Moonshot AI и Университетом Цинхуа не только предлагает новые инженерные подходы к крупномасштабному вычислению ИИ, но и закладывает основу для будущих межрегиональных вычислительных сетей. Эта модель Prefill-as-a-Service может стать ключевой вехой на пути к промышленному внедрению крупных моделей.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











