Hogar
ZhiPu y TileRT lanzan la API de alta velocidad GLM-5.1 a 400 tokens por segundo, estableciendo un nuevo récord mundial
Zhipu ha lanzado hoy oficialmente la API GLM-5.1 Highspeed (GLM-5.1-highspeed) para una selección de clientes empresariales. Este modelo alcanza una notable velocidad de salida de 400 tokens/s, superando el actual récord mundial de velocidad para las API de modelos grandes.
Esto pone en tela de juicio la creencia arraigada en el sector de que «los modelos de alto rendimiento conllevan una alta latencia» o de que «los modelos rápidos son necesariamente ligeros». La versión GLM-5.1 Highspeed es el primer modelo a gran escala nacional que ofrece capacidades de modelo de primera calidad y una latencia ultrabaja al mismo tiempo en entorno de producción, lo que libera a los usuarios de tener que sacrificar la calidad del modelo a cambio de la velocidad.

Transformando la experiencia del usuario en escenarios en los que la velocidad es fundamental
En tareas de largo alcance y entornos de producción complejos, el aumento de velocidad ha cambiado radicalmente la forma en que se diseñan los productos:
Programación de IA (agente de codificación): Aprovechando las potentes capacidades de GLM-5.1, el nuevo modelo ofrece respuestas instantáneas a las consultas. Comprende el contexto de ingeniería al tiempo que genera código y perfecciona soluciones de forma continua. En proyectos de reconstrucción que requieren docenas de llamadas, elimina el tiempo de espera acumulado de varios minutos.
Modelado dinámico en tiempo real: en pruebas de campo con mapas 3D, los jugadores controlan el movimiento de un personaje e introducen texto, y el modelo completa al instante el modelado, actualizando dinámicamente la escena en tiempo real.
Programación paralela de enjambres de agentes: en tareas de largo alcance, el modelo procesa páginas web complejas en menos de 30 segundos y programa al instante a 50 personalidades diferentes para que respondan en paralelo, lo que pone de manifiesto el prototipo de un nuevo sistema operativo.
Análisis en profundidad de la tecnología central: motor de inferencia de alto rendimiento TileRT
El rendimiento estable a nivel de producción de 400 TPS es el resultado de la optimización a nivel de sistema llevada a cabo por el equipo GLM de Zhipu y el equipo de TileRT:
Capa del motor de inferencia (programación estática AOT durante el periodo de compilación de TileRT):
Los marcos tradicionales más extendidos utilizan operadores (operador/núcleo) como unidad básica de programación. En escenarios de un solo token y de lotes pequeños, esto aumenta la sobrecarga de programación, acceso a la memoria y sincronización. TileRT elimina por completo la programación dinámica en la capa de tiempo de ejecución y, en su lugar, programa de forma estática todo el grafo de cálculo en una GPU persistente persistent Engine Kernel durante la compilación (AOT). Dentro de una misma GPU, el cálculo, la E/S asíncrona y la comunicación se descomponen en microtareas a nivel de mosaico. Todo el proceso de inferencia ejecuta un único núcleo, y los resultados intermedios se transmiten directamente a través de registros, memoria compartida y caché L2, sin necesidad de volver a escribirlos en la memoria global.
Capa del sistema de programación:
Mediante el agrupamiento dinámico en lotes, la fusión de solicitudes y la optimización de la programación de la caché KV, se reduce significativamente la latencia residual en escenarios de alta concurrencia.
Capa de infraestructura:
A escala de múltiples tarjetas, TileRT amplía el concepto de Warp Specialization dentro de un único SM a toda la topología NVL de 8 tarjetas. Los distintos rangos de GPU se especializan en diferentes trabajadores en función de la densidad computacional y las dependencias de datos, combinados con enlaces de red y equilibrio de carga para una optimización colaborativa, lo que garantiza un alto rendimiento y un funcionamiento estable.
Disponibilidad y acceso
La versión GLM-5.1 Highspeed es ideal para la programación de IA, la interacción en tiempo real, la toma de decisiones empresariales y las aplicaciones de voz en tiempo real que exigen una latencia de respuesta extremadamente baja. El servicio ya está disponible oficialmente en la plataforma Zhipu MaaS y está abierto a determinados clientes empresariales.
Artículo relacionado
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Zhipu ha lanzado hoy oficialmente la
Esto pone en tela de juicio la creencia arraigada en el sector de que «los modelos de alto rendimiento conllevan una alta latencia» o de que «los modelos rápidos son necesariamente ligeros». La versión GLM-5.1 Highspeed es el primer modelo a gran escala nacional que ofrece capacidades de modelo de primera calidad y una latencia ultrabaja al mismo tiempo en entorno de producción, lo que libera a los usuarios de tener que sacrificar la calidad del modelo a cambio de la velocidad.

Transformando la experiencia del usuario en escenarios en los que la velocidad es fundamental
En tareas de largo alcance y entornos de producción complejos, el aumento de velocidad ha cambiado radicalmente la forma en que se diseñan los productos:
Programación de IA (agente de codificación): Aprovechando las potentes capacidades de GLM-5.1, el nuevo modelo ofrece respuestas instantáneas a las consultas. Comprende el contexto de ingeniería al tiempo que genera código y perfecciona soluciones de forma continua. En proyectos de reconstrucción que requieren docenas de llamadas, elimina el tiempo de espera acumulado de varios minutos.
Modelado dinámico en tiempo real: en pruebas de campo con mapas 3D, los jugadores controlan el movimiento de un personaje e introducen texto, y el modelo completa al instante el modelado, actualizando dinámicamente la escena en tiempo real.
Programación paralela de enjambres de agentes: en tareas de largo alcance, el modelo procesa páginas web complejas en menos de 30 segundos y programa al instante a 50 personalidades diferentes para que respondan en paralelo, lo que pone de manifiesto el prototipo de un nuevo sistema operativo.
Análisis en profundidad de la tecnología central: motor de inferencia de alto rendimiento TileRT
El rendimiento estable a nivel de producción de 400 TPS es el resultado de la optimización a nivel de sistema llevada a cabo por el equipo GLM de Zhipu y el equipo de TileRT:
Capa del motor de inferencia (programación estática AOT durante el periodo de compilación de TileRT):
Los marcos tradicionales más extendidos utilizan operadores (operador/núcleo) como unidad básica de programación. En escenarios de un solo token y de lotes pequeños, esto aumenta la sobrecarga de programación, acceso a la memoria y sincronización. TileRT elimina por completo la programación dinámica en la capa de tiempo de ejecución y, en su lugar, programa de forma estática todo el grafo de cálculo en una GPU persistente persistent Engine Kernel durante la compilación (AOT). Dentro de una misma GPU, el cálculo, la E/S asíncrona y la comunicación se descomponen en microtareas a nivel de mosaico. Todo el proceso de inferencia ejecuta un único núcleo, y los resultados intermedios se transmiten directamente a través de registros, memoria compartida y caché L2, sin necesidad de volver a escribirlos en la memoria global.
Capa del sistema de programación:
Mediante el agrupamiento dinámico en lotes, la fusión de solicitudes y la optimización de la programación de la caché KV, se reduce significativamente la latencia residual en escenarios de alta concurrencia.
Capa de infraestructura:
A escala de múltiples tarjetas, TileRT amplía el concepto de Warp Specialization dentro de un único SM a toda la topología NVL de 8 tarjetas. Los distintos rangos de GPU se especializan en diferentes trabajadores en función de la densidad computacional y las dependencias de datos, combinados con enlaces de red y equilibrio de carga para una optimización colaborativa, lo que garantiza un alto rendimiento y un funcionamiento estable.
Disponibilidad y acceso
La versión GLM-5.1 Highspeed es ideal para la programación de IA, la interacción en tiempo real, la toma de decisiones empresariales y las aplicaciones de voz en tiempo real que exigen una latencia de respuesta extremadamente baja. El servicio ya está disponible oficialmente en la
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se











