Maison
Zigong et l'université de Tsinghua dévoilent l'architecture réseau ZCube, qui permet d'augmenter de 15 % le débit d'inférence des grands modèles tout en réduisant les coûts réseau d'un tiers
L'inférence sur des modèles de grande taille est en train de redéfinir l'infrastructure de l'IA, et les innovations en matière d'architecture réseau sont désormais essentielles pour exploiter pleinement le potentiel du matériel. En septembre 2025, Zhipu, Yuchen Network et l'université de Tsinghua ont présenté leurs travaux de recherche sur l'architecture réseau ZCube lors de l'ACM SIGCOMM 2025, une conférence de référence dans le domaine des réseaux.
Le 21 mai 2026, Zhipu a annoncé le déploiement réussi de l’architecture ZCube dans l’environnement de production de codage GLM-5.1, ce qui a permis d’obtenir des gains de performances substantiels. Des tests de performance, réalisés avec un matériel GPU, une pile logicielle et des applications inchangés, ont montré que ZCube réduisait les dépenses d’investissement en commutateurs et modules optiques de 33 %, augmentait le débit moyen d’inférence des GPU de 15 % et réduisait la latence du premier token (TTFT P99) de 40,6 %. Cette avancée au niveau du système établit un équilibre entre une grande efficacité économique et des performances élevées.

Actuellement, alors que l’inférence à long contexte et le déploiement avec séparation Prefill-Decode (PD) deviennent des normes du secteur, la transmission inter-nœuds du cache KV présente une asymétrie significative. Les architectures ROFT (Rail-Optimized Fat-Tree) traditionnelles, qui reposent sur l’empilement de commutateurs multicouches, sont limitées par une topologie statique, ce qui les rend sujettes aux points chauds locaux et à la contre-pression PFC. Cela crée un goulot d’étranglement structurel où la bande passante totale est suffisante mais où la congestion locale est fréquente.

Pour remédier à ce problème, l’architecture ZCube s’éloigne de l’empilement hiérarchique des conceptions Clos traditionnelles. Elle élimine les commutateurs de la couche « spine » et utilise à la place deux groupes de commutateurs entièrement plats dans une interconnexion de type graphe biparti, combinée au mécanisme d’accès hybride mono/multipiste d’une carte réseau à double port. Grâce à sa stratégie de routage unique, ZCube garantit un chemin optimal dédié pour chaque paire de GPU, permettant ainsi un équilibrage parfait de la charge de trafic au niveau structurel et prenant en charge une expansion à très grande échelle pouvant atteindre des dizaines, voire des centaines de milliers de GPU.
Au cours de la transformation de l’environnement de production, l’équipe de Yuchen Network a relevé avec succès les défis liés au câblage et à la reconstruction de la stratégie de routage à l’aide d’outils automatisés de contrôle et de vérification, garantissant ainsi une mise à niveau rapide et stable du cluster. Le cluster actuel, composé de mille cartes, fonctionne de manière stable depuis plus de deux semaines. Le déploiement réussi de ZCube marque une évolution de l’infrastructure de calcul intelligent, passant d’une interconnexion générale à une collaboration entre systèmes pilotée par le trafic des modèles. À l’avenir, l’intégration profonde de la topologie réseau, des bibliothèques de communication et des stratégies d’ordonnancement deviendra le moteur principal permettant d’améliorer encore l’efficacité de la production de jetons et de réduire les coûts globaux du MaaS.
Article connexe
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
Recommandations de sujets spéciaux liés
commentaires (0)
L'inférence sur des modèles de grande taille est en train de redéfinir l'infrastructure de l'IA, et les innovations en matière d'architecture réseau sont désormais essentielles pour exploiter pleinement le potentiel du matériel. En septembre 2025, Zhipu, Yuchen Network et l'université de Tsinghua ont présenté leurs travaux de recherche sur l'architecture réseau ZCube lors de l'ACM SIGCOMM 2025, une conférence de référence dans le domaine des réseaux.
Le 21 mai 2026, Zhipu a annoncé le déploiement réussi de l’architecture ZCube dans l’environnement de production de codage GLM-5.1, ce qui a permis d’obtenir des gains de performances substantiels. Des tests de performance, réalisés avec un matériel GPU, une pile logicielle et des applications inchangés, ont montré que ZCube réduisait les dépenses d’investissement en commutateurs et modules optiques de 33 %, augmentait le débit moyen d’inférence des GPU de 15 % et réduisait la latence du premier token (TTFT P99) de 40,6 %. Cette avancée au niveau du système établit un équilibre entre une grande efficacité économique et des performances élevées.

Actuellement, alors que l’inférence à long contexte et le déploiement avec séparation Prefill-Decode (PD) deviennent des normes du secteur, la transmission inter-nœuds du cache KV présente une asymétrie significative. Les architectures ROFT (Rail-Optimized Fat-Tree) traditionnelles, qui reposent sur l’empilement de commutateurs multicouches, sont limitées par une topologie statique, ce qui les rend sujettes aux points chauds locaux et à la contre-pression PFC. Cela crée un goulot d’étranglement structurel où la bande passante totale est suffisante mais où la congestion locale est fréquente.

Pour remédier à ce problème, l’architecture ZCube s’éloigne de l’empilement hiérarchique des conceptions Clos traditionnelles. Elle élimine les commutateurs de la couche « spine » et utilise à la place deux groupes de commutateurs entièrement plats dans une interconnexion de type graphe biparti, combinée au mécanisme d’accès hybride mono/multipiste d’une carte réseau à double port. Grâce à sa stratégie de routage unique, ZCube garantit un chemin optimal dédié pour chaque paire de GPU, permettant ainsi un équilibrage parfait de la charge de trafic au niveau structurel et prenant en charge une expansion à très grande échelle pouvant atteindre des dizaines, voire des centaines de milliers de GPU.
Au cours de la transformation de l’environnement de production, l’équipe de Yuchen Network a relevé avec succès les défis liés au câblage et à la reconstruction de la stratégie de routage à l’aide d’outils automatisés de contrôle et de vérification, garantissant ainsi une mise à niveau rapide et stable du cluster. Le cluster actuel, composé de mille cartes, fonctionne de manière stable depuis plus de deux semaines. Le déploiement réussi de ZCube marque une évolution de l’infrastructure de calcul intelligent, passant d’une interconnexion générale à une collaboration entre systèmes pilotée par le trafic des modèles. À l’avenir, l’intégration profonde de la topologie réseau, des bibliothèques de communication et des stratégies d’ordonnancement deviendra le moteur principal permettant d’améliorer encore l’efficacité de la production de jetons et de réduire les coûts globaux du MaaS.
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent











