オプション
ニュース
清華大学とテンセント・フンユアン、NPUの処理速度を4.1倍に高速化し、MLSys2026 MoE推論チャレンジで優勝

清華大学とテンセント・フンユアン、NPUの処理速度を4.1倍に高速化し、MLSys2026 MoE推論チャレンジで優勝

2026年6月25日
145

清華大学のストレージ研究所とテンセントのMegEngine AIインフラチームは、最近、機械学習システムの主要な国際会議であるMLSys2026で開催された「MoEモデル推論最適化チャレンジ」で世界優勝を果たした。

MLSys2026 MoEチャレンジの優勝発表のスクリーンショット

異種NPUチップ上で動作するパラメータ数が1兆規模に達する「Mixture-of-Experts(MoE)」アーキテクチャにおける推論性能のボトルネックに対処するため、共同チームは公式モデルとNPUハードウェアを対象としたフルチェーン最適化ソリューションを設計した。 エキスパートレベルでのタスク分割に「E-Shard」戦略を採用し、PSUM 3Dテンソルのバッチ読み出し、並行処理のために複数のバンクに出力を分散させるGEMVパス、および初期データ転送の遅延を低減するためのスカラーエンジンを活用することで、オペレーターレベルにおけるデータ転送効率の低さや反復的な活性化転送の問題を解消することに成功しました。

並行して、チームはアテンションモジュールおよびコアとなるTransformer演算子のオンチップデータレイアウトを再編成し、ビットレベルでの高精度なアライメントを実現した。

MoE最適化アーキテクチャの図

図 3: E-Shard によるエキスパート分割、連続 DMA、PSUM/GEMV による並行処理、コールドスタートパイプライン、およびプリフェッチ制御を特徴とする MoE 最適化アーキテクチャの図。

さらに、チームは「Knight」というエージェントベースの推論オペレータオプティマイザを開発しました。 提案、コード実装、反復という自動化された閉ループプロセスを通じて、最適化の探索空間を劇的に拡大しました。その結果、エンドツーエンドの推論時間は 14.91 秒から 3.56 秒へと短縮され、4.1 倍の高速化を実現しました。 1ステップあたりのデコード遅延は12.63msから5.45msに短縮され、重み読み込み時のDMAエンジンの利用率は約80%に達した。

スタンフォード大学やMITといった世界有数の大学のチームを上回るこの成果は、大規模モデルを基盤システムに適応させ、演算子を最適化する中国チームの深い専門知識を浮き彫りにしています。また、将来のスーパーノード・コンピューティング・プラットフォーム上で、1兆パラメータ規模のMoEモデルを展開するための貴重なエンジニアリングの青写真も提供しています。

関連記事
法的争訟の中でSunoが曲に透かしを入れる 法的争訟の中でSunoが曲に透かしを入れる Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。 ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。 エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める 米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
デザインとアート キャラクターシート、ムードボード、ピッチデッキ向けのAIビジュアルスタイルリファレンスツール
キャラクターシート、ムードボード、ピッチデッキ向けのAIビジュアルスタイルリファレンスツール

2026年最新の、キャラクターシート、ムードボード、ピッチデッキに最適なAIビジュアルスタイルリファレンスツールがXIX.AIに登場!この厳選された高評価ツール一覧には、実環境での厳格なテストをクリアした、業界に革新をもたらす強力なツールが掲載されています。 無料版と有料版の比較、詳細なランキング、そして創造性を高め、ワークフローを効率化するためにぜひ試したいツールが満載です。今すぐチェックして、生産性を向上させるあなたにぴったりのツールを見つけましょう!

11 ツール
xix.ai
SEO 検索戦略に最適なAI SERP分析ツール
検索戦略に最適なAI SERP分析ツール

2026年版、検索戦略に最適な高評価のAI SERP分析ツールは、XIX.AIが実環境での厳格なテストを経て厳選し、毎週ランキングを更新しています。これらの強力なツールを活用すれば、隠れた最適化の機会を発見し、コンテンツのパフォーマンスを向上させ、検索分野で競争優位性を獲得することができます。今すぐ、検索戦略を強化するのに最適なツールを見つけてください。今すぐチェック!

13 ツール
xix.ai
データ分析 SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール
SaaSおよびEコマースチーム向けのKPIモニタリングにおけるベストなAI異常検知ツール

2026年最新版・最高評価のAI異常検知ツール【SaaSおよびEコマースチーム向けKPIモニタリング】!XIX.AIは、厳格な実世界テストと週次更新のランキングに基づき、革新的な強力なコレクションを厳選しました。生産性を向上させ、AIの優位性を引き出すために必須のソリューションを見極めるのに役立つ、無料版と有料版の詳細な比較インサイトが見つかります。今すぐチェックしましょう!

10 ツール
xix.ai
書き込み 長文SEO記事に最適なAIアウトライン生成ツール
長文SEO記事に最適なAIアウトライン生成ツール

XIX.AIが厳選した、2026年最新のロングフォームSEO記事向け高評価AIアウトライン生成ツール。これらの強力なツールは、高品質なコンテンツを迅速に作成するための画期的な支援を提供し、執筆効率を大幅に向上させます。 無料版と有料版の比較、実地テスト、詳細なランキングを参考に、ご自身のニーズに合った「ぜひ試すべき」ツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう。

8 ツール
xix.ai
教育と学習 宿題や試験対策に役立つAI学習ツール
宿題や試験対策に役立つAI学習ツール

2026年版 宿題や試験対策に最適な最新AI学習ツール!XIX.AIは、学生の生産性を高め、宿題の完了を効率化し、実際の試験で好成績を収めるのに役立つ、画期的な高評価ツールを厳選して紹介しています。 無料版と有料版の比較、詳細なランキング、そしてAIの力を最大限に引き出すためにぜひ試すべきツールをご紹介します。今すぐチェックしましょう!

10 ツール
xix.ai
作曲 ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション
ソングライター向けAIボーカルデモツール:フック、トップライン、多言語のドラフトセッション

2026年版 ソングライター、フッククリエイター、多言語コンテンツ制作チームのための最新・最高のAIボーカルデモツール!XIX.AIは、厳格な実地テストを経て、業界に革新をもたらす強力なツールを厳選し、高評価のランキングリストを作成しました。 無料版と有料版の詳細な比較データ、包括的なランキング、そして創作効率を高め、創造力を最大限に引き出すためにぜひ試すべきツールが満載です。今すぐチェックして、あらゆるコンテンツ制作ニーズに最適なツールを見つけましょう!

9 ツール
xix.ai
コメント (1)
0/500
BrianMartinez
BrianMartinez 2026年7月18日 15:00:14 JST

That's a massive leap! 4.1x NPU speedup for MoE inference? I'm curious about the techniques they used. Is it better quantization or sparse attention? Either way, congrats to the team! 🎉

OR