Heim
Tsinghua und Tencent Hunyuan gewinnen die „MLSys2026 MoE Inference Challenge“ mit einer 4,1-fachen Beschleunigung der NPU
Das Storage Lab der Tsinghua-Universität und das MegEngine AI Infra-Team von Tencent haben kürzlich den Weltmeistertitel bei der „MoE Model Inference Optimization Challenge“ im Rahmen der MLSys2026, einer führenden Konferenz für Machine-Learning-Systeme, errungen.

Um Leistungsengpässe bei der Inferenz in der „Mixture-of-Experts“-Architektur (MoE) mit Parametern im Billionenbereich zu beseitigen, die auf heterogenen NPU-Chips laufen, entwickelte das gemeinsame Team eine ganzheitliche Optimierungslösung für das offizielle Modell und die NPU-Hardware. Durch den Einsatz der E-Shard-Strategie zur Aufgabenteilung auf Expertenebene, des PSUM-3D-Tensor-Batch-Readouts, des GEMV-Pfads zur Verteilung der Ausgaben auf mehrere Bänke zur Gewährleistung von Parallelität sowie der Verwendung von Skalar-Engines zur Reduzierung der anfänglichen Datenübertragungslatenz gelang es ihnen, die geringe Datenübertragungseffizienz und wiederholte Aktivierungsübertragungen auf Operatorenebene erfolgreich zu beheben.
Parallel dazu reorganisierte das Team das On-Chip-Datenlayout für das Attention-Modul und integrierte zentrale Transformer-Operatoren, wodurch eine hochpräzise Ausrichtung auf Bit-Ebene erreicht wurde.

Abbildung 3: Schematische Darstellung der MoE-Optimierungsarchitektur mit E-Shard-Expertenpartitionierung, kontinuierlichem DMA, PSUM/GEMV-Parallelität, Cold-Start-Pipeline und Prefetch-Steuerung.
Darüber hinaus entwickelte das Team einen agentenbasierten Optimierer für Inferenzoperatoren namens „Knight“. Durch einen automatisierten Closed-Loop-Prozess aus Vorschlag, Code-Implementierung und Iteration wurde der Suchraum für die Optimierung drastisch erweitert. Infolgedessen sank die End-to-End-Inferenzzeit von 14,91 Sekunden auf 3,56 Sekunden, was einer 4,1-fachen Beschleunigung entspricht; die Latenz bei der Einzelschritt-Dekodierung sank von 12,63 ms auf 5,45 ms, und die Auslastung der DMA-Engine beim Laden der Gewichte stieg auf rund 80 % an.
Diese Leistung, mit der Teams von weltweit führenden Universitäten wie Stanford und dem MIT übertroffen wurden, unterstreicht die fundierte Expertise chinesischer Teams bei der Anpassung großer Modelle an zugrunde liegende Systeme und der Optimierung von Operatoren. Sie liefert zudem einen wertvollen technischen Leitfaden für den Einsatz von MoE-Modellen mit Billionen von Parametern auf zukünftigen Super-Node-Rechenplattformen.
Verwandter Artikel
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Das Storage Lab der Tsinghua-Universität und das MegEngine AI Infra-Team von Tencent haben kürzlich den Weltmeistertitel bei der „MoE Model Inference Optimization Challenge“ im Rahmen der MLSys2026, einer führenden Konferenz für Machine-Learning-Systeme, errungen.

Um Leistungsengpässe bei der Inferenz in der „Mixture-of-Experts“-Architektur (MoE) mit Parametern im Billionenbereich zu beseitigen, die auf heterogenen NPU-Chips laufen, entwickelte das gemeinsame Team eine ganzheitliche Optimierungslösung für das offizielle Modell und die NPU-Hardware. Durch den Einsatz der E-Shard-Strategie zur Aufgabenteilung auf Expertenebene, des PSUM-3D-Tensor-Batch-Readouts, des GEMV-Pfads zur Verteilung der Ausgaben auf mehrere Bänke zur Gewährleistung von Parallelität sowie der Verwendung von Skalar-Engines zur Reduzierung der anfänglichen Datenübertragungslatenz gelang es ihnen, die geringe Datenübertragungseffizienz und wiederholte Aktivierungsübertragungen auf Operatorenebene erfolgreich zu beheben.
Parallel dazu reorganisierte das Team das On-Chip-Datenlayout für das Attention-Modul und integrierte zentrale Transformer-Operatoren, wodurch eine hochpräzise Ausrichtung auf Bit-Ebene erreicht wurde.

Abbildung 3: Schematische Darstellung der MoE-Optimierungsarchitektur mit E-Shard-Expertenpartitionierung, kontinuierlichem DMA, PSUM/GEMV-Parallelität, Cold-Start-Pipeline und Prefetch-Steuerung.
Darüber hinaus entwickelte das Team einen agentenbasierten Optimierer für Inferenzoperatoren namens „Knight“. Durch einen automatisierten Closed-Loop-Prozess aus Vorschlag, Code-Implementierung und Iteration wurde der Suchraum für die Optimierung drastisch erweitert. Infolgedessen sank die End-to-End-Inferenzzeit von 14,91 Sekunden auf 3,56 Sekunden, was einer 4,1-fachen Beschleunigung entspricht; die Latenz bei der Einzelschritt-Dekodierung sank von 12,63 ms auf 5,45 ms, und die Auslastung der DMA-Engine beim Laden der Gewichte stieg auf rund 80 % an.
Diese Leistung, mit der Teams von weltweit führenden Universitäten wie Stanford und dem MIT übertroffen wurden, unterstreicht die fundierte Expertise chinesischer Teams bei der Anpassung großer Modelle an zugrunde liegende Systeme und der Optimierung von Operatoren. Sie liefert zudem einen wertvollen technischen Leitfaden für den Einsatz von MoE-Modellen mit Billionen von Parametern auf zukünftigen Super-Node-Rechenplattformen.
Suno fügt Wasserzeichen in Songs ein, während Rechtsstreitigkeiten andauern
Suno, die Plattform, die es Nutzern ermöglicht, KI-generierte Musik zu erstellen, hat neue Funktionen vorgestellt, um plattformproduzierte Tracks zu kennzeichnen, Downloads einzuschränken und die Community-Richtlinien zu aktualisieren, um unbefugte K
Musk räumt ein, dass Grok-Build Benutzercode geleakt hat, verspricht aber, alle historischen Daten zu löschen
Elon Musk wandte sich direkt an die Datenschutzkontroverse um Grok Build, beginnend mit einem einfachen „True“, um die Gültigkeit des Vorfalls zu bestätigen. Er versprach, dass alle zuvor bei SpaceXAI hochgeladenen Benutzerdaten unwiderruflich gelösc
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek











