Дом
Компании ZhiPu и TileRT представили высокоскоростной API GLM-5.1 со скоростью 400 токенов в секунду, установив новый мировой рекорд
Сегодня компания Zhipu официально запустила API GLM-5.1 Highspeed (GLM-5.1-highspeed) для избранных корпоративных клиентов. Эта модель демонстрирует впечатляющую скорость вывода результатов — 400 токенов в секунду, что превосходит действующий мировой рекорд скорости среди API на базе крупных моделей.
Это ставит под сомнение укоренившееся в отрасли убеждение, что «высокопроизводительные модели сопряжены с высокой задержкой» или «быстрые модели обязательно должны быть лёгкими». Версия GLM-5.1 Highspeed — это первая отечественная крупная модель, которая в производственной среде одновременно обеспечивает возможности модели премиум-класса и сверхнизкую задержку, избавляя пользователей от необходимости выбирать между качеством модели и скоростью.

Преобразование пользовательского опыта в сценариях, где скорость имеет решающее значение
В задачах с длительным циклом выполнения и сложных производственных средах повышение скорости коренным образом изменило подход к разработке продуктов:
Программирование с помощью ИИ (кодирующий агент): используя мощные возможности GLM-5.1, новая модель мгновенно отвечает на запросы. Она понимает инженерный контекст, непрерывно генерируя код и совершенствуя решения. В проектах реконструкции, требующих десятков вызовов, она устраняет совокупное время ожидания, составляющее несколько минут.
Динамическое моделирование в реальном времени: во время полевых испытаний 3D-карт игроки управляют движением персонажа и вводят текст, а модель мгновенно завершает моделирование, динамически обновляя сцену в реальном времени.
Параллельное планирование роя агентов: при выполнении задач с большим охватом модель обрабатывает сложные веб-страницы за 30 секунд и мгновенно распределяет 50 различных личностей для параллельного ответа, демонстрируя прототип новой операционной системы.
Подробное изучение ключевой технологии: высокопроизводительный движок инференса TileRT
Стабильная пропускная способность на производственном уровне в 400 TPS является результатом оптимизации на системном уровне, проведённой командами Zhipu GLM и TileRT:
Уровень движка инференса (статическое планирование AOT на этапе компиляции TileRT):
Традиционные основные фреймворки используют операторы (оператор/ядро) в качестве базовой единицы планирования. В сценариях с одним токеном и небольшими партиями это увеличивает накладные расходы на планирование, доступ к памяти и синхронизацию. TileRT полностью исключает динамическое планирование на уровне выполнения, вместо этого статически планируя весь вычислительный граф в постоянную память GPU persistent Engine Kernel во время компиляции (AOT). В пределах одного графического процессора вычисления, асинхронный ввод-вывод и обмен данными разбиваются на микрозадачи на уровне тайлов. Весь процесс инференции запускает только одно ядро, при этом промежуточные результаты передаются напрямую через регистры, общую память и кэш L2 без записи обратно в глобальную память.
Уровень системы планирования:
Благодаря динамической группировке, объединению запросов и оптимизации планирования кэша «ключ-значение» (KV) задержка в конце цикла в сценариях с высокой степенью параллелизма значительно сокращается.
Уровень инфраструктуры:
В масштабах нескольких карт TileRT расширяет концепцию Warp Specialization в пределах одного SM на всю топологию NVL из 8 карт. Различные ранги GPU специализируются на выполнении различных рабочих задач в зависимости от вычислительной плотности и зависимостей данных, что в сочетании с сетевыми связями и балансировкой нагрузки обеспечивает совместную оптимизацию, гарантируя высокую производительность и стабильную работу.
Доступность и доступ
Версия GLM-5.1 Highspeed идеально подходит для программирования в области искусственного интеллекта, взаимодействия в режиме реального времени, принятия бизнес-решений и голосовых приложений реального времени, требующих чрезвычайно низкой задержки отклика. Сервис теперь официально доступен на платформе Zhipu MaaS и открыт для избранных корпоративных клиентов
Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (0)
Сегодня компания Zhipu официально запустила
Это ставит под сомнение укоренившееся в отрасли убеждение, что «высокопроизводительные модели сопряжены с высокой задержкой» или «быстрые модели обязательно должны быть лёгкими». Версия GLM-5.1 Highspeed — это первая отечественная крупная модель, которая в производственной среде одновременно обеспечивает возможности модели премиум-класса и сверхнизкую задержку, избавляя пользователей от необходимости выбирать между качеством модели и скоростью.

Преобразование пользовательского опыта в сценариях, где скорость имеет решающее значение
В задачах с длительным циклом выполнения и сложных производственных средах повышение скорости коренным образом изменило подход к разработке продуктов:
Программирование с помощью ИИ (кодирующий агент): используя мощные возможности GLM-5.1, новая модель мгновенно отвечает на запросы. Она понимает инженерный контекст, непрерывно генерируя код и совершенствуя решения. В проектах реконструкции, требующих десятков вызовов, она устраняет совокупное время ожидания, составляющее несколько минут.
Динамическое моделирование в реальном времени: во время полевых испытаний 3D-карт игроки управляют движением персонажа и вводят текст, а модель мгновенно завершает моделирование, динамически обновляя сцену в реальном времени.
Параллельное планирование роя агентов: при выполнении задач с большим охватом модель обрабатывает сложные веб-страницы за 30 секунд и мгновенно распределяет 50 различных личностей для параллельного ответа, демонстрируя прототип новой операционной системы.
Подробное изучение ключевой технологии: высокопроизводительный движок инференса TileRT
Стабильная пропускная способность на производственном уровне в 400 TPS является результатом оптимизации на системном уровне, проведённой командами Zhipu GLM и TileRT:
Уровень движка инференса (статическое планирование AOT на этапе компиляции TileRT):
Традиционные основные фреймворки используют операторы (оператор/ядро) в качестве базовой единицы планирования. В сценариях с одним токеном и небольшими партиями это увеличивает накладные расходы на планирование, доступ к памяти и синхронизацию. TileRT полностью исключает динамическое планирование на уровне выполнения, вместо этого статически планируя весь вычислительный граф в постоянную память GPU persistent Engine Kernel во время компиляции (AOT). В пределах одного графического процессора вычисления, асинхронный ввод-вывод и обмен данными разбиваются на микрозадачи на уровне тайлов. Весь процесс инференции запускает только одно ядро, при этом промежуточные результаты передаются напрямую через регистры, общую память и кэш L2 без записи обратно в глобальную память.
Уровень системы планирования:
Благодаря динамической группировке, объединению запросов и оптимизации планирования кэша «ключ-значение» (KV) задержка в конце цикла в сценариях с высокой степенью параллелизма значительно сокращается.
Уровень инфраструктуры:
В масштабах нескольких карт TileRT расширяет концепцию Warp Specialization в пределах одного SM на всю топологию NVL из 8 карт. Различные ранги GPU специализируются на выполнении различных рабочих задач в зависимости от вычислительной плотности и зависимостей данных, что в сочетании с сетевыми связями и балансировкой нагрузки обеспечивает совместную оптимизацию, гарантируя высокую производительность и стабильную работу.
Доступность и доступ
Версия GLM-5.1 Highspeed идеально подходит для программирования в области искусственного интеллекта, взаимодействия в режиме реального времени, принятия бизнес-решений и голосовых приложений реального времени, требующих чрезвычайно низкой задержки отклика. Сервис теперь официально доступен на
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











