Maison
Tsinghua et Tencent Hunyuan remportent le concours « MoE Inference Challenge » de MLSys2026 avec un gain de vitesse de 4,1 fois sur les NPU
Le laboratoire de stockage de l’université de Tsinghua et l’équipe MegEngine AI Infra de Tencent ont récemment remporté le championnat mondial du « MoE Model Inference Optimization Challenge » lors de MLSys2026, une conférence de premier plan consacrée aux systèmes d’apprentissage automatique.

Afin de remédier aux goulots d’étranglement affectant les performances d’inférence dans l’architecture « mixture-of-experts » (MoE), qui comporte des paramètres à l’échelle des billions et s’exécute sur des puces NPU hétérogènes, l’équipe conjointe a conçu une solution d’optimisation de bout en bout pour le modèle officiel et le matériel NPU. En recourant à la stratégie E-Shard pour le partitionnement des tâches au niveau des experts, à la lecture par lots de tenseurs 3D PSUM, au chemin GEMV distribuant les sorties sur plusieurs banques pour assurer la concurrence, et en utilisant des moteurs scalaires pour réduire la latence initiale du transfert de données, elle a réussi à résoudre les problèmes de faible efficacité du transfert de données et de transferts d’activation répétés au niveau des opérateurs.
Parallèlement, l’équipe a réorganisé la disposition des données sur la puce pour le module d’attention et les opérateurs Transformer de base, parvenant ainsi à un alignement de haute précision au niveau des bits.

Figure 3 : Schéma de l’architecture d’optimisation MoE, comprenant le partitionnement expert E-Shard, le DMA continu, la concurrence PSUM/GEMV, le pipeline de démarrage à froid et le contrôle de prélecture.
De plus, l’équipe a développé un optimiseur d’opérateurs d’inférence basé sur des agents, baptisé « Knight ». Grâce à un processus automatisé en boucle fermée comprenant la formulation de propositions, l’implémentation du code et l’itération, cet outil a considérablement élargi l’espace de recherche d’optimisation. En conséquence, le temps d’inférence de bout en bout est passé de 14,91 secondes à 3,56 secondes, soit un gain de vitesse de 4,1 fois ; la latence de décodage en une seule étape est passée de 12,63 ms à 5,45 ms, et l’utilisation du moteur DMA lors du chargement des poids a grimpé à environ 80 %.
Surpassant des équipes issues d’universités mondiales de premier plan telles que Stanford et le MIT, cette réussite met en évidence la grande expertise des équipes chinoises dans l’adaptation de modèles de grande taille aux systèmes sous-jacents et dans l’optimisation des opérateurs. Elle fournit également un précieux modèle d’ingénierie pour le déploiement de modèles MoE comportant des milliers de milliards de paramètres sur les futures plateformes de calcul à super-nœuds.
Article connexe
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
Recommandations de sujets spéciaux liés
commentaires (1)
Le laboratoire de stockage de l’université de Tsinghua et l’équipe MegEngine AI Infra de Tencent ont récemment remporté le championnat mondial du « MoE Model Inference Optimization Challenge » lors de MLSys2026, une conférence de premier plan consacrée aux systèmes d’apprentissage automatique.

Afin de remédier aux goulots d’étranglement affectant les performances d’inférence dans l’architecture « mixture-of-experts » (MoE), qui comporte des paramètres à l’échelle des billions et s’exécute sur des puces NPU hétérogènes, l’équipe conjointe a conçu une solution d’optimisation de bout en bout pour le modèle officiel et le matériel NPU. En recourant à la stratégie E-Shard pour le partitionnement des tâches au niveau des experts, à la lecture par lots de tenseurs 3D PSUM, au chemin GEMV distribuant les sorties sur plusieurs banques pour assurer la concurrence, et en utilisant des moteurs scalaires pour réduire la latence initiale du transfert de données, elle a réussi à résoudre les problèmes de faible efficacité du transfert de données et de transferts d’activation répétés au niveau des opérateurs.
Parallèlement, l’équipe a réorganisé la disposition des données sur la puce pour le module d’attention et les opérateurs Transformer de base, parvenant ainsi à un alignement de haute précision au niveau des bits.

Figure 3 : Schéma de l’architecture d’optimisation MoE, comprenant le partitionnement expert E-Shard, le DMA continu, la concurrence PSUM/GEMV, le pipeline de démarrage à froid et le contrôle de prélecture.
De plus, l’équipe a développé un optimiseur d’opérateurs d’inférence basé sur des agents, baptisé « Knight ». Grâce à un processus automatisé en boucle fermée comprenant la formulation de propositions, l’implémentation du code et l’itération, cet outil a considérablement élargi l’espace de recherche d’optimisation. En conséquence, le temps d’inférence de bout en bout est passé de 14,91 secondes à 3,56 secondes, soit un gain de vitesse de 4,1 fois ; la latence de décodage en une seule étape est passée de 12,63 ms à 5,45 ms, et l’utilisation du moteur DMA lors du chargement des poids a grimpé à environ 80 %.
Surpassant des équipes issues d’universités mondiales de premier plan telles que Stanford et le MIT, cette réussite met en évidence la grande expertise des équipes chinoises dans l’adaptation de modèles de grande taille aux systèmes sous-jacents et dans l’optimisation des opérateurs. Elle fournit également un précieux modèle d’ingénierie pour le déploiement de modèles MoE comportant des milliers de milliards de paramètres sur les futures plateformes de calcul à super-nœuds.
Suno appose des filigranes aux chansons dans le cadre de batailles juridiques
Suno, la plateforme permettant aux utilisateurs de générer de la musique créée par l’intelligence artificielle, a dévoilé de nouvelles fonctionnalités pour étiqueter les titres produits sur la plateforme, restreindre les téléchargements et mettre à j
Musk admet que la construction de Grok a divulgué le code utilisateur, promet d’effacer toutes les données historiques
Elon Musk a abordé directement la controverse sur la vie privée concernant Grok Build, en commençant par un simple « Vrai » pour confirmer la validité de l’incident. Il s’est engagé à ce que toutes les données utilisateur précédemment téléchargées su
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent











