option
Maison
Nouvelles
Zhipu dévoile la version « Speed » du GLM-5.1 : avec 400 tokens/s, elle établit un nouveau record mondial en matière d'API

Zhipu dévoile la version « Speed » du GLM-5.1 : avec 400 tokens/s, elle établit un nouveau record mondial en matière d'API

12 juillet 2026
83

Zhipu dévoile la version « Speed » du GLM-5.1 : avec 400 tokens/s, elle établit un nouveau record mondial en matière d

Le 22 mai, Zhipu (02513.HK) a fait sensation tant sur les marchés financiers que dans le secteur des technologies. Son cours a bondi de plus de 22 % pendant la séance, portant sa capitalisation boursière au-delà de 450 milliards de HKD. Le même jour, la société a lancé un nouveau produit phare destiné à ses clients professionnels : l’API GLM-5.1 Highspeed (GLM-5.1-highspeed).

Lors de tests en conditions réelles, ce modèle affiche un débit impressionnant de 400 tokens/s (400 tokens par seconde), dépassant ainsi la limite de vitesse actuelle des API officielles proposées par les principaux fournisseurs mondiaux de grands modèles. Pour mettre cela en perspective : le volume de texte qu’un créateur pourrait produire après plusieurs jours de travail ininterrompu peut désormais être généré en seulement une minute. Une tâche de refonte système qui prendrait trois jours de saisie à un ingénieur peut être entièrement exécutée le temps de boire une tasse de café.

Points clés :

Briser les conventions : traditionnellement, le secteur partait du principe que « rapide » rimait avec « petit ou léger ». Zhipu est le premier fournisseur national de grands modèles à parvenir à combiner de manière transparente **« des capacités phares à grande échelle » et « une latence extrêmement faible »**.

Des performances exceptionnelles : la vitesse de sortie atteint 400 tokens/s, prend en charge une fenêtre de contexte de 200K et permet une sortie unique maximale de 128K tokens.

Technologie de pointe sous-jacente : développé grâce à une collaboration étroite entre l’équipe GLM de Zhipu et l’équipe TileRT, ce modèle restructure l’ensemble de l’écosystème d’inférence au niveau du système.

Test pilote ciblé : désormais accessible à certaines entreprises clientes via la plateforme ouverte MaaS (Model as a Service) de Zhipu.

À quoi ressemble concrètement une « réponse instantanée » ? Une avancée majeure dans les scénarios où la vitesse est cruciale

Au cours de l’année écoulée, les capacités de collaboration entre le codage (programmation) et l’agent (intelligence) dans les grands modèles nationaux ont fait des progrès significatifs. Mais la « vitesse » est restée le principal goulot d’étranglement pour les tâches d’interaction à longue chaîne et à haute fréquence. Zhipu souligne que le passage des grands modèles du statut d’« outils » à celui de « partenaires en temps réel » devient véritablement transformateur à partir de 400 tokens/s :

Programmation IA (agent de codage) : les agents intelligents traditionnels nécessitent souvent des dizaines d’appels entre fichiers et un alignement de longs textes. Un simple cycle de réponse retardé de quelques secondes peut prolonger la tâche dans son ensemble à plus de dix minutes. Avec la version haute vitesse, l’écriture de code donne l’impression de fonctionner à une vitesse 10 fois supérieure : les fonctions, les interfaces et les chaînes d’appels sous-jacentes se déploient instantanément au fur et à mesure que l’utilisateur tape, éliminant ainsi tout temps d’attente lié à des modifications techniques à grande échelle.

Interaction en temps réel et jeux 3D : la latence extrêmement faible permet au modèle de gérer la génération dynamique en temps réel au sein d’univers de jeux, la construction instantanée d’interfaces utilisateur web et les changements immédiats d’état du système en fonction des entrées continues de l’utilisateur — le tout sans aucun décalage.

Clusters de décision métier : dans la simulation parallèle multi-agents et l’analyse en temps réel du big data, la version haute vitesse permet de générer en moins de 30 secondes des réponses parallèles à personnalités multiples issues de clusters d’agents web complexes, ce qui augmente considérablement le plafond d’efficacité pour la quantification et la simulation à haute fréquence.

Voix en temps réel sans coupure : dans les scénarios de coaching par IA et de service client intelligent, la réponse ultra-rapide ramène la latence entre la reconnaissance vocale (ASR) et la synthèse vocale (TTS) à un niveau proche de zéro, offrant ainsi un flux de conversation véritablement naturel, au rythme régulier et semblable à celui d’un être humain.

Décryptage des trois niveaux de cette technologie de pointe : comment avons-nous atteint 400 tokens/s ?

Ce record mondial de vitesse est principalement le résultat d’une optimisation technique au niveau du système, développée conjointement par l’équipe GLM de Zhipu et l’équipe TileRT. Les 400 tokens/s ne constituent pas un simple « pic de performance » spectaculaire, mais une capacité stable et prête pour la production. La logique d’optimisation sous-jacente se décompose en trois couches :

[Infrastructure Layer: Cluster/Load Balancing Collaboration] ─► [Scheduling System Layer: Dynamic Batching & KV Cache Scheduling] ─► [Inference Engine Layer: TileRT Architecture Rewriting Core Path] ─► 400 tokens/s Stable Output

Couche du moteur d’inférence (personnalisation approfondie de TileRT) : en s’appuyant sur l’architecture réseau unique du GLM-5.1, l’équipe a entièrement réécrit le chemin d’inférence le plus critique et les opérateurs sous-jacents, permettant ainsi au débit d’un seul GPU et à l’efficacité d’exécution matérielle de se rapprocher des limites physiques.

Couche du système de planification (fusion intelligente) : l’introduction d’un regroupement dynamique très agressif, de technologies de fusion des requêtes et d’une optimisation révolutionnaire de la planification du cache KV a permis de résoudre efficacement les problèmes de latence résiduelle auxquels les modèles traditionnels sont confrontés en cas de forte concurrence et de requêtes multiples des utilisateurs.

Couche d’infrastructure (collaboration entre clusters) : une optimisation collaborative complète au niveau matériel, portant sur le déploiement réseau, la topologie des liaisons réseau et l’équilibrage de charge à ultra-haute fréquence du cluster d’inférence, garantit que la puissance de calcul est transmise sans perte tout au long du pipeline.

Réévaluation du secteur : la seconde phase de l’IA porte sur la « valeur et le temps »

Comme l’ont souligné de grandes institutions d’analyse internationales telles qu’UBS lors de récents forums sur les technologies boursières à Hong Kong, cette vague de réévaluation du secteur induite par l’IA est fondamentalement différente de la « monétisation du trafic et du temps » de l’ère de l’Internet mobile. La philosophie de l’IA en matière de revenus et de pérennité ne consiste pas à piéger les utilisateurs dans des logiciels, mais à « aider les utilisateurs et les entreprises à gagner du temps, à améliorer leur efficacité et à partager la valeur créée ».

La version haute vitesse GLM-5.1 de Zhipu répond directement à ce problème. En réduisant le coût et le temps de production de chaque jeton à une fraction de ce qu’ils étaient initialement, elle permet aux entreprises de ne plus avoir à faire de compromis douloureux entre « une intelligence élevée (choisir un grand modèle mais lent) » et « la vitesse (choisir un petit modèle mais peu performant) ».

Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO Comment corriger les Core Web Vitals pour de meilleurs classements SEO Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
commentaires (0)
0/500
OR