Maison
ZhiPu et TileRT lancent l'API haute vitesse GLM-5.1 à 400 tokens/s, établissant ainsi un nouveau record mondial
Zhipu a officiellement lancé aujourd’hui l’API GLM-5.1 Highspeed (GLM-5.1-highspeed) pour certains clients professionnels. Ce modèle atteint une vitesse de sortie remarquable de 400 tokens/s, dépassant ainsi le record mondial actuel de vitesse pour les API de grands modèles.
Cela remet en cause la croyance de longue date dans le secteur selon laquelle « les modèles hautement performants s’accompagnent d’une latence élevée » ou « les modèles rapides sont nécessairement légers ». La version GLM-5.1 Highspeed est le premier grand modèle national à offrir à la fois des capacités de pointe et une latence ultra-faible en production, libérant ainsi les utilisateurs de la nécessité de faire des compromis entre la qualité du modèle et la vitesse.

Transformer l’expérience utilisateur dans les scénarios où la vitesse est cruciale
Dans les tâches de longue haleine et les environnements de production complexes, ce gain de vitesse a fondamentalement changé la manière dont les produits sont conçus :
Programmation IA (agent de codage) : tirant parti des puissantes capacités du GLM-5.1, le nouveau modèle fournit des réponses instantanées aux requêtes. Il comprend le contexte technique tout en générant en continu du code et en affinant les solutions. Dans les projets de reconstruction nécessitant des dizaines d’appels, il élimine le temps d’attente cumulé de plusieurs minutes.
Modélisation dynamique en temps réel : lors d’essais sur le terrain avec des cartes 3D, les joueurs contrôlent les mouvements d’un personnage et saisissent du texte ; le modèle finalise instantanément la modélisation, en mettant à jour la scène de manière dynamique et en temps réel.
Planification parallèle d’un essaim d’agents : dans le cadre de tâches de longue haleine, le modèle traite des pages web complexes en moins de 30 secondes et planifie instantanément 50 personnalités différentes pour qu’elles répondent en parallèle, présentant ainsi le prototype d’un nouveau système d’exploitation.
Analyse approfondie de la technologie de base : moteur d’inférence haute performance TileRT
Le débit stable de 400 TPS en conditions de production résulte de l’optimisation au niveau du système menée par l’équipe Zhipu GLM et l’équipe TileRT :
Couche du moteur d’inférence (planification statique AOT pendant la phase de compilation de TileRT) :
Les frameworks traditionnels courants utilisent des opérateurs (opérateur/noyau) comme unité de planification de base. Dans les scénarios à token unique et à petits lots, cela amplifie la surcharge liée à la planification, à l’accès à la mémoire et à la synchronisation. TileRT élimine complètement la planification dynamique au niveau de l’exécution, en planifiant à la place de manière statique l’ensemble du graphe de calcul sur un GPU persistant persistent Engine Kernel pendant la compilation (AOT). Au sein d’un même GPU, le calcul, les E/S asynchrones et la communication sont décomposés en micro-tâches au niveau des tuiles. L’ensemble du processus d’inférence ne lance qu’un seul noyau, les résultats intermédiaires étant transmis directement via des registres, la mémoire partagée et le cache L2, sans réécriture dans la mémoire globale.
Couche du système d’ordonnancement :
Grâce au regroupement dynamique des lots, à la fusion des requêtes et à l’optimisation de l’ordonnancement du cache KV, la latence résiduelle dans les scénarios à forte concurrence est considérablement réduite.
Couche d’infrastructure :
À l’échelle de plusieurs cartes, TileRT étend le concept de Warp Specialization au sein d’un seul SM à l’ensemble de la topologie NVL à 8 cartes. Les différents rangs de GPU sont spécialisés en différents travailleurs en fonction de la densité de calcul et des dépendances de données, en combinaison avec les liaisons réseau et l’équilibrage de charge pour une optimisation collaborative, garantissant ainsi des performances élevées et un fonctionnement stable.
Disponibilité et accès
La version GLM-5.1 Highspeed est idéale pour la programmation IA, les interactions en temps réel, la prise de décision métier et les applications vocales en temps réel qui exigent une latence de réponse extrêmement faible. Le service est désormais officiellement disponible sur la plateforme Zhipu MaaS et est accessible à une sélection de clients professionnels.
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)
Zhipu a officiellement lancé aujourd’hui l’
Cela remet en cause la croyance de longue date dans le secteur selon laquelle « les modèles hautement performants s’accompagnent d’une latence élevée » ou « les modèles rapides sont nécessairement légers ». La version GLM-5.1 Highspeed est le premier grand modèle national à offrir à la fois des capacités de pointe et une latence ultra-faible en production, libérant ainsi les utilisateurs de la nécessité de faire des compromis entre la qualité du modèle et la vitesse.

Transformer l’expérience utilisateur dans les scénarios où la vitesse est cruciale
Dans les tâches de longue haleine et les environnements de production complexes, ce gain de vitesse a fondamentalement changé la manière dont les produits sont conçus :
Programmation IA (agent de codage) : tirant parti des puissantes capacités du GLM-5.1, le nouveau modèle fournit des réponses instantanées aux requêtes. Il comprend le contexte technique tout en générant en continu du code et en affinant les solutions. Dans les projets de reconstruction nécessitant des dizaines d’appels, il élimine le temps d’attente cumulé de plusieurs minutes.
Modélisation dynamique en temps réel : lors d’essais sur le terrain avec des cartes 3D, les joueurs contrôlent les mouvements d’un personnage et saisissent du texte ; le modèle finalise instantanément la modélisation, en mettant à jour la scène de manière dynamique et en temps réel.
Planification parallèle d’un essaim d’agents : dans le cadre de tâches de longue haleine, le modèle traite des pages web complexes en moins de 30 secondes et planifie instantanément 50 personnalités différentes pour qu’elles répondent en parallèle, présentant ainsi le prototype d’un nouveau système d’exploitation.
Analyse approfondie de la technologie de base : moteur d’inférence haute performance TileRT
Le débit stable de 400 TPS en conditions de production résulte de l’optimisation au niveau du système menée par l’équipe Zhipu GLM et l’équipe TileRT :
Couche du moteur d’inférence (planification statique AOT pendant la phase de compilation de TileRT) :
Les frameworks traditionnels courants utilisent des opérateurs (opérateur/noyau) comme unité de planification de base. Dans les scénarios à token unique et à petits lots, cela amplifie la surcharge liée à la planification, à l’accès à la mémoire et à la synchronisation. TileRT élimine complètement la planification dynamique au niveau de l’exécution, en planifiant à la place de manière statique l’ensemble du graphe de calcul sur un GPU persistant persistent Engine Kernel pendant la compilation (AOT). Au sein d’un même GPU, le calcul, les E/S asynchrones et la communication sont décomposés en micro-tâches au niveau des tuiles. L’ensemble du processus d’inférence ne lance qu’un seul noyau, les résultats intermédiaires étant transmis directement via des registres, la mémoire partagée et le cache L2, sans réécriture dans la mémoire globale.
Couche du système d’ordonnancement :
Grâce au regroupement dynamique des lots, à la fusion des requêtes et à l’optimisation de l’ordonnancement du cache KV, la latence résiduelle dans les scénarios à forte concurrence est considérablement réduite.
Couche d’infrastructure :
À l’échelle de plusieurs cartes, TileRT étend le concept de Warp Specialization au sein d’un seul SM à l’ensemble de la topologie NVL à 8 cartes. Les différents rangs de GPU sont spécialisés en différents travailleurs en fonction de la densité de calcul et des dépendances de données, en combinaison avec les liaisons réseau et l’équilibrage de charge pour une optimisation collaborative, garantissant ainsi des performances élevées et un fonctionnement stable.
Disponibilité et accès
La version GLM-5.1 Highspeed est idéale pour la programmation IA, les interactions en temps réel, la prise de décision métier et les applications vocales en temps réel qui exigent une latence de réponse extrêmement faible. Le service est désormais officiellement disponible sur la
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











