Hogar
Zhipu presenta la versión «Speed» de GLM-5.1: 400 tokens/s, un nuevo récord mundial en API

El 22 de mayo, Zhipu (02513.HK) causó sensación tanto en los mercados de capitales como en el sector tecnológico. Sus acciones se dispararon más de un 22 % durante la jornada bursátil, lo que elevó su valor de mercado por encima de los 450 000 millones de HKD. Ese mismo día, la empresa lanzó un importante producto nuevo dirigido a clientes empresariales: la API de alta velocidad GLM-5.1 (GLM-5.1-highspeed).
En pruebas reales, este modelo alcanza la impresionante cifra de 400 tokens/s (400 tokens por segundo), superando el límite de velocidad actual de las API oficiales de los principales proveedores mundiales de modelos a gran escala. Para ponerlo en perspectiva: el volumen de texto que un creador podría producir tras días de trabajo ininterrumpido ahora se puede completar en tan solo un minuto. Una tarea de reingeniería de sistemas que a un ingeniero le llevaría tres días escribiendo puede ejecutarse por completo en el tiempo que se tarda en tomarse una taza de café.
Aspectos destacados:
Rompiendo convenciones: tradicionalmente, el sector daba por sentado que «rápido» significaba «pequeño o ligero». Zhipu es el primer proveedor nacional de modelos a gran escala que logra una combinación perfecta de **«capacidades emblemáticas a gran escala» y «latencia extremadamente baja»**.
Logros destacados: La velocidad de salida alcanza los 400 tokens/s, admite una ventana de contexto de 200K y permite una salida única máxima de 128K tokens.
Tecnología de vanguardia: desarrollado gracias a la estrecha colaboración entre el equipo GLM de Zhipu y el equipo de TileRT, este modelo reestructura todo el ecosistema de inferencia a nivel de sistema.
Prueba piloto específica: ya está disponible para determinados clientes empresariales a través de la plataforma abierta MaaS (Model as a Service) de Zhipu.
¿Cómo se percibe realmente la «respuesta instantánea»? Un avance revolucionario en escenarios en los que la velocidad es clave
Durante el último año, las capacidades de colaboración entre la codificación (programación) y los agentes (inteligencia) en los grandes modelos nacionales han avanzado significativamente. Sin embargo, la «velocidad» ha seguido siendo el principal cuello de botella para las tareas de interacción de cadena larga y alta frecuencia. Zhipu señala que el cambio de los grandes modelos de «herramientas» a «socios en tiempo real» se vuelve verdaderamente transformador a partir de los 400 tokens/s:
Programación con IA (agente de código): los agentes inteligentes tradicionales suelen requerir docenas de llamadas entre archivos y la alineación de textos largos. Un solo retraso de unos segundos en la respuesta puede alargar toda la tarea a más de diez minutos. Con la versión de alta velocidad, escribir código es como correr a una velocidad 10 veces mayor: las funciones, las interfaces y las cadenas de llamadas subyacentes se desarrollan al instante a medida que el usuario escribe, lo que elimina cualquier tiempo de espera para la reelaboración de ingeniería a gran escala.
Interacción en tiempo real y juegos en 3D: la latencia extremadamente baja permite al modelo gestionar la generación dinámica en tiempo real dentro de los mundos de los juegos, la construcción instantánea de interfaces de usuario web y los cambios inmediatos en el estado del sistema basados en la entrada continua del usuario, todo ello sin retrasos.
Clústeres de decisiones empresariales: en la simulación paralela multiagente y el análisis de big data en tiempo real, la versión de alta velocidad permite completar respuestas paralelas de múltiples personalidades en clústeres de agentes web complejos en menos de 30 segundos, lo que eleva significativamente el límite de eficiencia para la cuantificación y la simulación de alta frecuencia.
Voz en tiempo real sin interrupciones: en escenarios de coaching con IA y de atención al cliente inteligente, la respuesta ultrarrápida reduce la latencia desde el reconocimiento de voz (ASR) hasta la síntesis (TTS) a un valor cercano a cero, lo que proporciona un flujo de conversación verdaderamente natural, a un ritmo uniforme y similar al de un ser humano.
Descifrando las tres capas de la tecnología de vanguardia: ¿cómo hemos alcanzado los 400 tokens/s?
Este récord mundial de velocidad es, principalmente, el resultado de la optimización de ingeniería a nivel de sistema desarrollada conjuntamente por el equipo GLM de Zhipu y el equipo de TileRT. Los 400 tokens/s no son un «momento álgido» llamativo, sino una capacidad estable y lista para la producción. La lógica de optimización subyacente se desglosa en tres capas:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Capa del motor de inferencia (personalización profunda de TileRT): Basándose en la arquitectura de red única de GLM-5.1, el equipo reescribió por completo la ruta de inferencia más crítica y los operadores subyacentes, lo que permitió que el rendimiento de una sola GPU y la eficiencia de ejecución del hardware se acercaran a los límites físicos.
Capa del sistema de programación (fusión inteligente): Se han introducido técnicas de agrupamiento dinámico muy agresivas, tecnologías de fusión de solicitudes y una optimización revolucionaria de la programación de la caché KV, lo que resuelve de forma eficaz los problemas de latencia residual a los que se enfrentan los modelos tradicionales en condiciones de alta concurrencia y múltiples solicitudes de usuarios.
Capa de infraestructura (colaboración entre clústeres): La optimización colaborativa integral a nivel de hardware en torno al despliegue de redes, la topología de enlaces de red y el equilibrio de carga de ultraalta frecuencia del clúster de inferencia garantiza que la potencia de cálculo se transmita sin pérdidas a lo largo de todo el proceso.
Reevaluación del sector: la segunda mitad de la IA gira en torno a la «valoración del valor y el tiempo»
Tal y como destacaron importantes instituciones analíticas internacionales como UBS en recientes foros tecnológicos bursátiles celebrados en Hong Kong, esta ronda de reevaluación del sector impulsada por la IA es fundamentalmente diferente de la «monetización del tráfico y del tiempo» de la era de Internet móvil. La filosofía de ingresos y supervivencia de la IA no consiste en mantener a los usuarios atrapados en el software, sino en «ayudar a los usuarios y a las empresas a ahorrar tiempo, mejorar la eficiencia y compartir el valor creado».
La versión de alta velocidad GLM-5.1 de Zhipu aborda directamente este punto débil. Al reducir el coste y el tiempo de generación de cada token a una fracción del original, permite a las empresas dejar de tener que elegir entre «alta inteligencia (optar por un modelo grande pero lento)» y «velocidad (optar por un modelo pequeño pero poco eficaz)».
Artículo relacionado
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El 22 de mayo, Zhipu (02513.HK) causó sensación tanto en los mercados de capitales como en el sector tecnológico. Sus acciones se dispararon más de un 22 % durante la jornada bursátil, lo que elevó su valor de mercado por encima de los 450 000 millones de HKD. Ese mismo día, la empresa lanzó un importante producto nuevo dirigido a clientes empresariales: la API de alta velocidad GLM-5.1 (GLM-5.1-highspeed).
En pruebas reales, este modelo alcanza la impresionante cifra de 400 tokens/s (400 tokens por segundo), superando el límite de velocidad actual de las API oficiales de los principales proveedores mundiales de modelos a gran escala. Para ponerlo en perspectiva: el volumen de texto que un creador podría producir tras días de trabajo ininterrumpido ahora se puede completar en tan solo un minuto. Una tarea de reingeniería de sistemas que a un ingeniero le llevaría tres días escribiendo puede ejecutarse por completo en el tiempo que se tarda en tomarse una taza de café.
Aspectos destacados:
Rompiendo convenciones: tradicionalmente, el sector daba por sentado que «rápido» significaba «pequeño o ligero». Zhipu es el primer proveedor nacional de modelos a gran escala que logra una combinación perfecta de **«capacidades emblemáticas a gran escala» y «latencia extremadamente baja»**.
Logros destacados: La velocidad de salida alcanza los 400 tokens/s, admite una ventana de contexto de 200K y permite una salida única máxima de 128K tokens.
Tecnología de vanguardia: desarrollado gracias a la estrecha colaboración entre el equipo GLM de Zhipu y el equipo de TileRT, este modelo reestructura todo el ecosistema de inferencia a nivel de sistema.
Prueba piloto específica: ya está disponible para determinados clientes empresariales a través de la plataforma abierta MaaS (Model as a Service) de Zhipu.
¿Cómo se percibe realmente la «respuesta instantánea»? Un avance revolucionario en escenarios en los que la velocidad es clave
Durante el último año, las capacidades de colaboración entre la codificación (programación) y los agentes (inteligencia) en los grandes modelos nacionales han avanzado significativamente. Sin embargo, la «velocidad» ha seguido siendo el principal cuello de botella para las tareas de interacción de cadena larga y alta frecuencia. Zhipu señala que el cambio de los grandes modelos de «herramientas» a «socios en tiempo real» se vuelve verdaderamente transformador a partir de los 400 tokens/s:
Programación con IA (agente de código): los agentes inteligentes tradicionales suelen requerir docenas de llamadas entre archivos y la alineación de textos largos. Un solo retraso de unos segundos en la respuesta puede alargar toda la tarea a más de diez minutos. Con la versión de alta velocidad, escribir código es como correr a una velocidad 10 veces mayor: las funciones, las interfaces y las cadenas de llamadas subyacentes se desarrollan al instante a medida que el usuario escribe, lo que elimina cualquier tiempo de espera para la reelaboración de ingeniería a gran escala.
Interacción en tiempo real y juegos en 3D: la latencia extremadamente baja permite al modelo gestionar la generación dinámica en tiempo real dentro de los mundos de los juegos, la construcción instantánea de interfaces de usuario web y los cambios inmediatos en el estado del sistema basados en la entrada continua del usuario, todo ello sin retrasos.
Clústeres de decisiones empresariales: en la simulación paralela multiagente y el análisis de big data en tiempo real, la versión de alta velocidad permite completar respuestas paralelas de múltiples personalidades en clústeres de agentes web complejos en menos de 30 segundos, lo que eleva significativamente el límite de eficiencia para la cuantificación y la simulación de alta frecuencia.
Voz en tiempo real sin interrupciones: en escenarios de coaching con IA y de atención al cliente inteligente, la respuesta ultrarrápida reduce la latencia desde el reconocimiento de voz (ASR) hasta la síntesis (TTS) a un valor cercano a cero, lo que proporciona un flujo de conversación verdaderamente natural, a un ritmo uniforme y similar al de un ser humano.
Descifrando las tres capas de la tecnología de vanguardia: ¿cómo hemos alcanzado los 400 tokens/s?
Este récord mundial de velocidad es, principalmente, el resultado de la optimización de ingeniería a nivel de sistema desarrollada conjuntamente por el equipo GLM de Zhipu y el equipo de TileRT. Los 400 tokens/s no son un «momento álgido» llamativo, sino una capacidad estable y lista para la producción. La lógica de optimización subyacente se desglosa en tres capas:
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Capa del motor de inferencia (personalización profunda de TileRT): Basándose en la arquitectura de red única de GLM-5.1, el equipo reescribió por completo la ruta de inferencia más crítica y los operadores subyacentes, lo que permitió que el rendimiento de una sola GPU y la eficiencia de ejecución del hardware se acercaran a los límites físicos.
Capa del sistema de programación (fusión inteligente): Se han introducido técnicas de agrupamiento dinámico muy agresivas, tecnologías de fusión de solicitudes y una optimización revolucionaria de la programación de la caché KV, lo que resuelve de forma eficaz los problemas de latencia residual a los que se enfrentan los modelos tradicionales en condiciones de alta concurrencia y múltiples solicitudes de usuarios.
Capa de infraestructura (colaboración entre clústeres): La optimización colaborativa integral a nivel de hardware en torno al despliegue de redes, la topología de enlaces de red y el equilibrio de carga de ultraalta frecuencia del clúster de inferencia garantiza que la potencia de cálculo se transmita sin pérdidas a lo largo de todo el proceso.
Reevaluación del sector: la segunda mitad de la IA gira en torno a la «valoración del valor y el tiempo»
Tal y como destacaron importantes instituciones analíticas internacionales como UBS en recientes foros tecnológicos bursátiles celebrados en Hong Kong, esta ronda de reevaluación del sector impulsada por la IA es fundamentalmente diferente de la «monetización del tráfico y del tiempo» de la era de Internet móvil. La filosofía de ingresos y supervivencia de la IA no consiste en mantener a los usuarios atrapados en el software, sino en «ayudar a los usuarios y a las empresas a ahorrar tiempo, mejorar la eficiencia y compartir el valor creado».
La versión de alta velocidad GLM-5.1 de Zhipu aborda directamente este punto débil. Al reducir el coste y el tiempo de generación de cada token a una fracción del original, permite a las empresas dejar de tener que elegir entre «alta inteligencia (optar por un modelo grande pero lento)» y «velocidad (optar por un modelo pequeño pero poco eficaz)».
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de











