Дом
Zhipu представила скоростную версию GLM-5.1: 400 токенов/с — новый мировой рекорд по API

22 мая компания Zhipu (02513.HK) вызвала настоящий резонанс как на рынках капитала, так и в технологической отрасли. В ходе торговой сессии ее акции подскочили более чем на 22%, в результате чего рыночная капитализация компании превысила 450 млрд гонконгских долларов. В тот же день компания представила новый важный продукт для корпоративных клиентов: GLM-5.1 Highspeed API (GLM-5.1-highspeed).
В реальных тестах эта модель демонстрирует впечатляющую производительность — 400 токенов/с (400 токенов в секунду), преодолевая текущий предел скорости официальных API от крупнейших мировых поставщиков больших моделей. Чтобы лучше представить себе масштаб: объем текста, который создатель мог бы произвести за несколько дней непрерывной работы, теперь можно создать всего за минуту. Задача по реинжинирингу системы, на выполнение которой инженеру потребовалось бы три дня набор текста, может быть полностью выполнена за время, необходимое для того, чтобы выпить чашку кофе.
Ключевые особенности:
Нарушение стереотипов: традиционно в отрасли считалось, что «быстро» означает «малое или лёгкое». Zhipu — первый отечественный поставщик крупных моделей, сумевший органично совместить **«полномасштабные флагманские возможности» и «крайне низкую задержку»**.
Впечатляющие достижения: скорость вывода достигает 400 токенов/с, поддерживается контекстное окно длиной 200K, а максимальный размер одного вывода составляет 128K токенов.
Лежащая в основе «черная» технология: эта модель, разработанная в результате тесного сотрудничества между командой GLM компании Zhipu и командой TileRT, перестраивает всю экосистему вывода на системном уровне.
Целевое пилотное тестирование: в настоящее время доступно для избранных корпоративных клиентов через открытую платформу MaaS (Model as a Service) компании Zhipu.
На что на самом деле похож «мгновенный ответ»? Прорыв в сценариях, чувствительных к скорости
За последний год возможности взаимодействия кода (программирования) и агента (искусственного интеллекта) в отечественных крупных моделях значительно продвинулись. Однако «скорость» оставалась основным узким местом для задач с длинными цепочками и высокой частотой взаимодействия. Zhipu отмечает, что переход от использования крупных моделей в качестве «инструментов» к их использованию в качестве «партнеров в режиме реального времени» становится по-настоящему трансформационным при скорости 400 токенов/с:
Программирование с помощью ИИ (кодирующий агент): традиционные интеллектуальные агенты часто требуют десятков межфайловых вызовов и согласования длинных текстов. Задержка в ответе всего на несколько секунд может растянуть выполнение всей задачи до более чем десяти минут. С высокоскоростной версией написание кода ощущается как работа в 10 раз быстрее — функции, интерфейсы и лежащие в основе цепочки вызовов разворачиваются мгновенно по мере ввода пользователем, устраняя любое время ожидания, связанное с крупномасштабной доработкой кода.
Взаимодействие в реальном времени и 3D-игры: чрезвычайно низкая задержка позволяет модели обрабатывать динамическое генерацию в реальном времени в игровых мирах, мгновенное построение веб-интерфейса и немедленные изменения состояния системы на основе непрерывного ввода пользователя — и все это без задержек.
Кластеры бизнес-решений: в многоагентном параллельном моделировании и анализе больших данных в реальном времени высокоскоростная версия поддерживает выполнение сложных многоличностных параллельных ответов кластера веб-агентов за 30 секунд, что значительно повышает предельный уровень эффективности высокочастотной количественной оценки и моделирования.
Бесперебойная голосовая связь в реальном времени: в сценариях коучинга с использованием ИИ и интеллектуального обслуживания клиентов сверхбыстрый отклик сводит задержку от распознавания речи (ASR) до синтеза (TTS) практически к нулю, обеспечивая по-настоящему естественный, равномерный и похожий на человеческий поток разговора.
Расшифровка трёх уровней «чёрных технологий»: как мы достигли скорости 400 токенов/с?
Этот мировой рекорд скорости в первую очередь является результатом оптимизации на системном уровне, совместно разработанной командой GLM компании Zhipu и командой TileRT. Показатель 400 токенов/с — это не эффектный «пиковый момент», а стабильная, готовая к производственному использованию возможность. Логика оптимизации, лежащая в основе этого достижения, состоит из трёх уровней:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Уровень механизма инференса (глубокая настройка TileRT): Опираясь на уникальную сетевую архитектуру GLM-5.1, команда полностью переписала наиболее критический путь инференса и базовые операторы, что позволило пропускной способности одного графического процессора и эффективности аппаратного выполнения приблизиться к физическим пределам.
Уровень системы планирования (интеллектуальное объединение): внедрены технологии высокоагрессивного динамического пакетирования, объединения запросов и революционная оптимизация планирования KV-кеша, что позволяет эффективно решать проблемы задержки в хвостовой части, с которыми сталкиваются традиционные модели при высокой параллельности и множественных пользовательских запросах.
Уровень инфраструктуры (Cluster Collaboration): комплексная совместная оптимизация на аппаратном уровне, охватывающая развертывание сетей, топологию сетевых каналов и сверхвысокочастотную балансировку нагрузки кластера инференса, гарантирует передачу вычислительной мощности без потерь по всему конвейеру.
Переоценка отрасли: вторая половина пути ИИ — это урегулирование вопросов «ценности и времени»
Как подчеркнули ведущие международные аналитические институты, такие как UBS, на недавних технологических форумах по фондовому рынку в Гонконге, нынешний раунд переоценки отрасли под влиянием ИИ принципиально отличается от «монетизации трафика и времени» эпохи мобильного интернета. Философия получения дохода и выживания в сфере ИИ заключается не в том, чтобы удерживать пользователей в «ловушке» программного обеспечения, а в том, чтобы «помогать пользователям и предприятиям экономить время, повышать эффективность и делиться созданной ценностью».
Версия GLM-5.1 Highspeed от Zhipu напрямую решает эту проблему. Сокращая затраты и время на генерацию каждого токена до доли от первоначальных значений, она позволяет предприятиям избавиться от необходимости идти на болезненные компромиссы между «высоким интеллектом (выбор большой, но медленной модели)» и «скоростью (выбор маленькой, но неэффективной модели)».
Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (0)

22 мая компания Zhipu (02513.HK) вызвала настоящий резонанс как на рынках капитала, так и в технологической отрасли. В ходе торговой сессии ее акции подскочили более чем на 22%, в результате чего рыночная капитализация компании превысила 450 млрд гонконгских долларов. В тот же день компания представила новый важный продукт для корпоративных клиентов: GLM-5.1 Highspeed API (GLM-5.1-highspeed).
В реальных тестах эта модель демонстрирует впечатляющую производительность — 400 токенов/с (400 токенов в секунду), преодолевая текущий предел скорости официальных API от крупнейших мировых поставщиков больших моделей. Чтобы лучше представить себе масштаб: объем текста, который создатель мог бы произвести за несколько дней непрерывной работы, теперь можно создать всего за минуту. Задача по реинжинирингу системы, на выполнение которой инженеру потребовалось бы три дня набор текста, может быть полностью выполнена за время, необходимое для того, чтобы выпить чашку кофе.
Ключевые особенности:
Нарушение стереотипов: традиционно в отрасли считалось, что «быстро» означает «малое или лёгкое». Zhipu — первый отечественный поставщик крупных моделей, сумевший органично совместить **«полномасштабные флагманские возможности» и «крайне низкую задержку»**.
Впечатляющие достижения: скорость вывода достигает 400 токенов/с, поддерживается контекстное окно длиной 200K, а максимальный размер одного вывода составляет 128K токенов.
Лежащая в основе «черная» технология: эта модель, разработанная в результате тесного сотрудничества между командой GLM компании Zhipu и командой TileRT, перестраивает всю экосистему вывода на системном уровне.
Целевое пилотное тестирование: в настоящее время доступно для избранных корпоративных клиентов через открытую платформу MaaS (Model as a Service) компании Zhipu.
На что на самом деле похож «мгновенный ответ»? Прорыв в сценариях, чувствительных к скорости
За последний год возможности взаимодействия кода (программирования) и агента (искусственного интеллекта) в отечественных крупных моделях значительно продвинулись. Однако «скорость» оставалась основным узким местом для задач с длинными цепочками и высокой частотой взаимодействия. Zhipu отмечает, что переход от использования крупных моделей в качестве «инструментов» к их использованию в качестве «партнеров в режиме реального времени» становится по-настоящему трансформационным при скорости 400 токенов/с:
Программирование с помощью ИИ (кодирующий агент): традиционные интеллектуальные агенты часто требуют десятков межфайловых вызовов и согласования длинных текстов. Задержка в ответе всего на несколько секунд может растянуть выполнение всей задачи до более чем десяти минут. С высокоскоростной версией написание кода ощущается как работа в 10 раз быстрее — функции, интерфейсы и лежащие в основе цепочки вызовов разворачиваются мгновенно по мере ввода пользователем, устраняя любое время ожидания, связанное с крупномасштабной доработкой кода.
Взаимодействие в реальном времени и 3D-игры: чрезвычайно низкая задержка позволяет модели обрабатывать динамическое генерацию в реальном времени в игровых мирах, мгновенное построение веб-интерфейса и немедленные изменения состояния системы на основе непрерывного ввода пользователя — и все это без задержек.
Кластеры бизнес-решений: в многоагентном параллельном моделировании и анализе больших данных в реальном времени высокоскоростная версия поддерживает выполнение сложных многоличностных параллельных ответов кластера веб-агентов за 30 секунд, что значительно повышает предельный уровень эффективности высокочастотной количественной оценки и моделирования.
Бесперебойная голосовая связь в реальном времени: в сценариях коучинга с использованием ИИ и интеллектуального обслуживания клиентов сверхбыстрый отклик сводит задержку от распознавания речи (ASR) до синтеза (TTS) практически к нулю, обеспечивая по-настоящему естественный, равномерный и похожий на человеческий поток разговора.
Расшифровка трёх уровней «чёрных технологий»: как мы достигли скорости 400 токенов/с?
Этот мировой рекорд скорости в первую очередь является результатом оптимизации на системном уровне, совместно разработанной командой GLM компании Zhipu и командой TileRT. Показатель 400 токенов/с — это не эффектный «пиковый момент», а стабильная, готовая к производственному использованию возможность. Логика оптимизации, лежащая в основе этого достижения, состоит из трёх уровней:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Уровень механизма инференса (глубокая настройка TileRT): Опираясь на уникальную сетевую архитектуру GLM-5.1, команда полностью переписала наиболее критический путь инференса и базовые операторы, что позволило пропускной способности одного графического процессора и эффективности аппаратного выполнения приблизиться к физическим пределам.
Уровень системы планирования (интеллектуальное объединение): внедрены технологии высокоагрессивного динамического пакетирования, объединения запросов и революционная оптимизация планирования KV-кеша, что позволяет эффективно решать проблемы задержки в хвостовой части, с которыми сталкиваются традиционные модели при высокой параллельности и множественных пользовательских запросах.
Уровень инфраструктуры (Cluster Collaboration): комплексная совместная оптимизация на аппаратном уровне, охватывающая развертывание сетей, топологию сетевых каналов и сверхвысокочастотную балансировку нагрузки кластера инференса, гарантирует передачу вычислительной мощности без потерь по всему конвейеру.
Переоценка отрасли: вторая половина пути ИИ — это урегулирование вопросов «ценности и времени»
Как подчеркнули ведущие международные аналитические институты, такие как UBS, на недавних технологических форумах по фондовому рынку в Гонконге, нынешний раунд переоценки отрасли под влиянием ИИ принципиально отличается от «монетизации трафика и времени» эпохи мобильного интернета. Философия получения дохода и выживания в сфере ИИ заключается не в том, чтобы удерживать пользователей в «ловушке» программного обеспечения, а в том, чтобы «помогать пользователям и предприятиям экономить время, повышать эффективность и делиться созданной ценностью».
Версия GLM-5.1 Highspeed от Zhipu напрямую решает эту проблему. Сокращая затраты и время на генерацию каждого токена до доли от первоначальных значений, она позволяет предприятиям избавиться от необходимости идти на болезненные компромиссы между «высоким интеллектом (выбор большой, но медленной модели)» и «скоростью (выбор маленькой, но неэффективной модели)».
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











