Maison
Zhipu dévoile la version « Speed » du GLM-5.1 : avec 400 tokens/s, elle établit un nouveau record mondial en matière d'API

Le 22 mai, Zhipu (02513.HK) a fait sensation tant sur les marchés financiers que dans le secteur des technologies. Son cours a bondi de plus de 22 % pendant la séance, portant sa capitalisation boursière au-delà de 450 milliards de HKD. Le même jour, la société a lancé un nouveau produit phare destiné à ses clients professionnels : l’API GLM-5.1 Highspeed (GLM-5.1-highspeed).
Lors de tests en conditions réelles, ce modèle affiche un débit impressionnant de 400 tokens/s (400 tokens par seconde), dépassant ainsi la limite de vitesse actuelle des API officielles proposées par les principaux fournisseurs mondiaux de grands modèles. Pour mettre cela en perspective : le volume de texte qu’un créateur pourrait produire après plusieurs jours de travail ininterrompu peut désormais être généré en seulement une minute. Une tâche de refonte système qui prendrait trois jours de saisie à un ingénieur peut être entièrement exécutée le temps de boire une tasse de café.
Points clés :
Briser les conventions : traditionnellement, le secteur partait du principe que « rapide » rimait avec « petit ou léger ». Zhipu est le premier fournisseur national de grands modèles à parvenir à combiner de manière transparente **« des capacités phares à grande échelle » et « une latence extrêmement faible »**.
Des performances exceptionnelles : la vitesse de sortie atteint 400 tokens/s, prend en charge une fenêtre de contexte de 200K et permet une sortie unique maximale de 128K tokens.
Technologie de pointe sous-jacente : développé grâce à une collaboration étroite entre l’équipe GLM de Zhipu et l’équipe TileRT, ce modèle restructure l’ensemble de l’écosystème d’inférence au niveau du système.
Test pilote ciblé : désormais accessible à certaines entreprises clientes via la plateforme ouverte MaaS (Model as a Service) de Zhipu.
À quoi ressemble concrètement une « réponse instantanée » ? Une avancée majeure dans les scénarios où la vitesse est cruciale
Au cours de l’année écoulée, les capacités de collaboration entre le codage (programmation) et l’agent (intelligence) dans les grands modèles nationaux ont fait des progrès significatifs. Mais la « vitesse » est restée le principal goulot d’étranglement pour les tâches d’interaction à longue chaîne et à haute fréquence. Zhipu souligne que le passage des grands modèles du statut d’« outils » à celui de « partenaires en temps réel » devient véritablement transformateur à partir de 400 tokens/s :
Programmation IA (agent de codage) : les agents intelligents traditionnels nécessitent souvent des dizaines d’appels entre fichiers et un alignement de longs textes. Un simple cycle de réponse retardé de quelques secondes peut prolonger la tâche dans son ensemble à plus de dix minutes. Avec la version haute vitesse, l’écriture de code donne l’impression de fonctionner à une vitesse 10 fois supérieure : les fonctions, les interfaces et les chaînes d’appels sous-jacentes se déploient instantanément au fur et à mesure que l’utilisateur tape, éliminant ainsi tout temps d’attente lié à des modifications techniques à grande échelle.
Interaction en temps réel et jeux 3D : la latence extrêmement faible permet au modèle de gérer la génération dynamique en temps réel au sein d’univers de jeux, la construction instantanée d’interfaces utilisateur web et les changements immédiats d’état du système en fonction des entrées continues de l’utilisateur — le tout sans aucun décalage.
Clusters de décision métier : dans la simulation parallèle multi-agents et l’analyse en temps réel du big data, la version haute vitesse permet de générer en moins de 30 secondes des réponses parallèles à personnalités multiples issues de clusters d’agents web complexes, ce qui augmente considérablement le plafond d’efficacité pour la quantification et la simulation à haute fréquence.
Voix en temps réel sans coupure : dans les scénarios de coaching par IA et de service client intelligent, la réponse ultra-rapide ramène la latence entre la reconnaissance vocale (ASR) et la synthèse vocale (TTS) à un niveau proche de zéro, offrant ainsi un flux de conversation véritablement naturel, au rythme régulier et semblable à celui d’un être humain.
Décryptage des trois niveaux de cette technologie de pointe : comment avons-nous atteint 400 tokens/s ?
Ce record mondial de vitesse est principalement le résultat d’une optimisation technique au niveau du système, développée conjointement par l’équipe GLM de Zhipu et l’équipe TileRT. Les 400 tokens/s ne constituent pas un simple « pic de performance » spectaculaire, mais une capacité stable et prête pour la production. La logique d’optimisation sous-jacente se décompose en trois couches :
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Couche du moteur d’inférence (personnalisation approfondie de TileRT) : en s’appuyant sur l’architecture réseau unique du GLM-5.1, l’équipe a entièrement réécrit le chemin d’inférence le plus critique et les opérateurs sous-jacents, permettant ainsi au débit d’un seul GPU et à l’efficacité d’exécution matérielle de se rapprocher des limites physiques.
Couche du système de planification (fusion intelligente) : l’introduction d’un regroupement dynamique très agressif, de technologies de fusion des requêtes et d’une optimisation révolutionnaire de la planification du cache KV a permis de résoudre efficacement les problèmes de latence résiduelle auxquels les modèles traditionnels sont confrontés en cas de forte concurrence et de requêtes multiples des utilisateurs.
Couche d’infrastructure (collaboration entre clusters) : une optimisation collaborative complète au niveau matériel, portant sur le déploiement réseau, la topologie des liaisons réseau et l’équilibrage de charge à ultra-haute fréquence du cluster d’inférence, garantit que la puissance de calcul est transmise sans perte tout au long du pipeline.
Réévaluation du secteur : la seconde phase de l’IA porte sur la « valeur et le temps »
Comme l’ont souligné de grandes institutions d’analyse internationales telles qu’UBS lors de récents forums sur les technologies boursières à Hong Kong, cette vague de réévaluation du secteur induite par l’IA est fondamentalement différente de la « monétisation du trafic et du temps » de l’ère de l’Internet mobile. La philosophie de l’IA en matière de revenus et de pérennité ne consiste pas à piéger les utilisateurs dans des logiciels, mais à « aider les utilisateurs et les entreprises à gagner du temps, à améliorer leur efficacité et à partager la valeur créée ».
La version haute vitesse GLM-5.1 de Zhipu répond directement à ce problème. En réduisant le coût et le temps de production de chaque jeton à une fraction de ce qu’ils étaient initialement, elle permet aux entreprises de ne plus avoir à faire de compromis douloureux entre « une intelligence élevée (choisir un grand modèle mais lent) » et « la vitesse (choisir un petit modèle mais peu performant) ».
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)

Le 22 mai, Zhipu (02513.HK) a fait sensation tant sur les marchés financiers que dans le secteur des technologies. Son cours a bondi de plus de 22 % pendant la séance, portant sa capitalisation boursière au-delà de 450 milliards de HKD. Le même jour, la société a lancé un nouveau produit phare destiné à ses clients professionnels : l’API GLM-5.1 Highspeed (GLM-5.1-highspeed).
Lors de tests en conditions réelles, ce modèle affiche un débit impressionnant de 400 tokens/s (400 tokens par seconde), dépassant ainsi la limite de vitesse actuelle des API officielles proposées par les principaux fournisseurs mondiaux de grands modèles. Pour mettre cela en perspective : le volume de texte qu’un créateur pourrait produire après plusieurs jours de travail ininterrompu peut désormais être généré en seulement une minute. Une tâche de refonte système qui prendrait trois jours de saisie à un ingénieur peut être entièrement exécutée le temps de boire une tasse de café.
Points clés :
Briser les conventions : traditionnellement, le secteur partait du principe que « rapide » rimait avec « petit ou léger ». Zhipu est le premier fournisseur national de grands modèles à parvenir à combiner de manière transparente **« des capacités phares à grande échelle » et « une latence extrêmement faible »**.
Des performances exceptionnelles : la vitesse de sortie atteint 400 tokens/s, prend en charge une fenêtre de contexte de 200K et permet une sortie unique maximale de 128K tokens.
Technologie de pointe sous-jacente : développé grâce à une collaboration étroite entre l’équipe GLM de Zhipu et l’équipe TileRT, ce modèle restructure l’ensemble de l’écosystème d’inférence au niveau du système.
Test pilote ciblé : désormais accessible à certaines entreprises clientes via la plateforme ouverte MaaS (Model as a Service) de Zhipu.
À quoi ressemble concrètement une « réponse instantanée » ? Une avancée majeure dans les scénarios où la vitesse est cruciale
Au cours de l’année écoulée, les capacités de collaboration entre le codage (programmation) et l’agent (intelligence) dans les grands modèles nationaux ont fait des progrès significatifs. Mais la « vitesse » est restée le principal goulot d’étranglement pour les tâches d’interaction à longue chaîne et à haute fréquence. Zhipu souligne que le passage des grands modèles du statut d’« outils » à celui de « partenaires en temps réel » devient véritablement transformateur à partir de 400 tokens/s :
Programmation IA (agent de codage) : les agents intelligents traditionnels nécessitent souvent des dizaines d’appels entre fichiers et un alignement de longs textes. Un simple cycle de réponse retardé de quelques secondes peut prolonger la tâche dans son ensemble à plus de dix minutes. Avec la version haute vitesse, l’écriture de code donne l’impression de fonctionner à une vitesse 10 fois supérieure : les fonctions, les interfaces et les chaînes d’appels sous-jacentes se déploient instantanément au fur et à mesure que l’utilisateur tape, éliminant ainsi tout temps d’attente lié à des modifications techniques à grande échelle.
Interaction en temps réel et jeux 3D : la latence extrêmement faible permet au modèle de gérer la génération dynamique en temps réel au sein d’univers de jeux, la construction instantanée d’interfaces utilisateur web et les changements immédiats d’état du système en fonction des entrées continues de l’utilisateur — le tout sans aucun décalage.
Clusters de décision métier : dans la simulation parallèle multi-agents et l’analyse en temps réel du big data, la version haute vitesse permet de générer en moins de 30 secondes des réponses parallèles à personnalités multiples issues de clusters d’agents web complexes, ce qui augmente considérablement le plafond d’efficacité pour la quantification et la simulation à haute fréquence.
Voix en temps réel sans coupure : dans les scénarios de coaching par IA et de service client intelligent, la réponse ultra-rapide ramène la latence entre la reconnaissance vocale (ASR) et la synthèse vocale (TTS) à un niveau proche de zéro, offrant ainsi un flux de conversation véritablement naturel, au rythme régulier et semblable à celui d’un être humain.
Décryptage des trois niveaux de cette technologie de pointe : comment avons-nous atteint 400 tokens/s ?
Ce record mondial de vitesse est principalement le résultat d’une optimisation technique au niveau du système, développée conjointement par l’équipe GLM de Zhipu et l’équipe TileRT. Les 400 tokens/s ne constituent pas un simple « pic de performance » spectaculaire, mais une capacité stable et prête pour la production. La logique d’optimisation sous-jacente se décompose en trois couches :
[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output
Couche du moteur d’inférence (personnalisation approfondie de TileRT) : en s’appuyant sur l’architecture réseau unique du GLM-5.1, l’équipe a entièrement réécrit le chemin d’inférence le plus critique et les opérateurs sous-jacents, permettant ainsi au débit d’un seul GPU et à l’efficacité d’exécution matérielle de se rapprocher des limites physiques.
Couche du système de planification (fusion intelligente) : l’introduction d’un regroupement dynamique très agressif, de technologies de fusion des requêtes et d’une optimisation révolutionnaire de la planification du cache KV a permis de résoudre efficacement les problèmes de latence résiduelle auxquels les modèles traditionnels sont confrontés en cas de forte concurrence et de requêtes multiples des utilisateurs.
Couche d’infrastructure (collaboration entre clusters) : une optimisation collaborative complète au niveau matériel, portant sur le déploiement réseau, la topologie des liaisons réseau et l’équilibrage de charge à ultra-haute fréquence du cluster d’inférence, garantit que la puissance de calcul est transmise sans perte tout au long du pipeline.
Réévaluation du secteur : la seconde phase de l’IA porte sur la « valeur et le temps »
Comme l’ont souligné de grandes institutions d’analyse internationales telles qu’UBS lors de récents forums sur les technologies boursières à Hong Kong, cette vague de réévaluation du secteur induite par l’IA est fondamentalement différente de la « monétisation du trafic et du temps » de l’ère de l’Internet mobile. La philosophie de l’IA en matière de revenus et de pérennité ne consiste pas à piéger les utilisateurs dans des logiciels, mais à « aider les utilisateurs et les entreprises à gagner du temps, à améliorer leur efficacité et à partager la valeur créée ».
La version haute vitesse GLM-5.1 de Zhipu répond directement à ce problème. En réduisant le coût et le temps de production de chaque jeton à une fraction de ce qu’ils étaient initialement, elle permet aux entreprises de ne plus avoir à faire de compromis douloureux entre « une intelligence élevée (choisir un grand modèle mais lent) » et « la vitesse (choisir un petit modèle mais peu performant) ».
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











