Дом
Компания Moonshot AI и Университет Цинхуа предлагают архитектуру PrfaaS для центров обработки данных
Поскольку крупные языковые модели (LLM) требуют все большей вычислительной мощности при выполнении логических операций, традиционные архитектуры сервисов сталкиваются с «узкими местами». Компания Moonshot AI в сотрудничестве с исследовательской группой из Университета Цинхуа представила новую архитектуру под названием Pre-filling as a Service (PrfaaS), призванную преодолеть ограничения, связанные с дата-центрами и вычислительными ресурсами в сервисах LLM.

Процесс вывода заключений в крупных языковых моделях обычно делится на две фазы: предварительное заполнение (pre-filling) и декодирование. Этап предварительного заполнения является вычислительно интенсивным: модель обрабатывает входные данные и создает кэш «ключ-значение» (KVCache). Этап декодирования требует высокой пропускной способности памяти и генерирует выходные данные последовательно. Традиционные конфигурации требуют, чтобы оба этапа выполнялись в пределах одного и того же центра обработки данных, что приводит к ограничениям по вычислительной мощности и пропускной способности.
PrfaaS обеспечивает эффективное межцентровое обслуживание за счет переноса задач предварительного заполнения на выделенные кластеры с высокой вычислительной мощностью, используя стандартную сеть Ethernet для передачи сгенерированного KVCache в локальные кластеры декодирования. Исследования показывают, что эта архитектура повышает производительность обработки, обеспечивая увеличение пропускной способности сервиса на 54 % по сравнению с традиционными моделями. Реальные примеры из практики также демонстрируют более низкую задержку и более высокую эффективность.
Архитектура PrfaaS разделяет три основные подсистемы — вычислительную, сетевую и хранилища — и управляет каждой из них независимо. Точный механизм маршрутизации обеспечивает эффективную передачу длинных запросов, предотвращая перегрузки, возникающие из-за неравномерного распределения ресурсов, характерного для традиционных подходов. Кроме того, механизм планирования с двумя временными масштабами адаптируется к изменяющимся моделям трафика, дополнительно оптимизируя использование ресурсов.
По мере роста спроса на вычисления, охватывающие несколько центров обработки данных, и появления нового оборудования PrfaaS предлагает многообещающее решение для будущих приложений искусственного интеллекта.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (10)
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐
Поскольку крупные языковые модели (LLM) требуют все большей вычислительной мощности при выполнении логических операций, традиционные архитектуры сервисов сталкиваются с «узкими местами». Компания Moonshot AI в сотрудничестве с исследовательской группой из Университета Цинхуа представила новую архитектуру под названием Pre-filling as a Service (PrfaaS), призванную преодолеть ограничения, связанные с дата-центрами и вычислительными ресурсами в сервисах LLM.

Процесс вывода заключений в крупных языковых моделях обычно делится на две фазы: предварительное заполнение (pre-filling) и декодирование. Этап предварительного заполнения является вычислительно интенсивным: модель обрабатывает входные данные и создает кэш «ключ-значение» (KVCache). Этап декодирования требует высокой пропускной способности памяти и генерирует выходные данные последовательно. Традиционные конфигурации требуют, чтобы оба этапа выполнялись в пределах одного и того же центра обработки данных, что приводит к ограничениям по вычислительной мощности и пропускной способности.
PrfaaS обеспечивает эффективное межцентровое обслуживание за счет переноса задач предварительного заполнения на выделенные кластеры с высокой вычислительной мощностью, используя стандартную сеть Ethernet для передачи сгенерированного KVCache в локальные кластеры декодирования. Исследования показывают, что эта архитектура повышает производительность обработки, обеспечивая увеличение пропускной способности сервиса на 54 % по сравнению с традиционными моделями. Реальные примеры из практики также демонстрируют более низкую задержку и более высокую эффективность.
Архитектура PrfaaS разделяет три основные подсистемы — вычислительную, сетевую и хранилища — и управляет каждой из них независимо. Точный механизм маршрутизации обеспечивает эффективную передачу длинных запросов, предотвращая перегрузки, возникающие из-за неравномерного распределения ресурсов, характерного для традиционных подходов. Кроме того, механизм планирования с двумя временными масштабами адаптируется к изменяющимся моделям трафика, дополнительно оптимизируя использование ресурсов.
По мере роста спроса на вычисления, охватывающие несколько центров обработки данных, и появления нового оборудования PrfaaS предлагает многообещающее решение для будущих приложений искусственного интеллекта.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐











