清華大学とテンセント・フンユアン、NPUの処理速度を4.1倍に高速化し、MLSys2026 MoE推論チャレンジで優勝
清華大学のストレージ研究所とテンセントのMegEngine AIインフラチームは、最近、機械学習システムの主要な国際会議であるMLSys2026で開催された「MoEモデル推論最適化チャレンジ」で世界優勝を果たした。

異種NPUチップ上で動作するパラメータ数が1兆規模に達する「Mixture-of-Experts(MoE)」アーキテクチャにおける推論性能のボトルネックに対処するため、共同チームは公式モデルとNPUハードウェアを対象としたフルチェーン最適化ソリューションを設計した。 エキスパートレベルでのタスク分割に「E-Shard」戦略を採用し、PSUM 3Dテンソルのバッチ読み出し、並行処理のために複数のバンクに出力を分散させるGEMVパス、および初期データ転送の遅延を低減するためのスカラーエンジンを活用することで、オペレーターレベルにおけるデータ転送効率の低さや反復的な活性化転送の問題を解消することに成功しました。
並行して、チームはアテンションモジュールおよびコアとなるTransformer演算子のオンチップデータレイアウトを再編成し、ビットレベルでの高精度なアライメントを実現した。

図 3: E-Shard によるエキスパート分割、連続 DMA、PSUM/GEMV による並行処理、コールドスタートパイプライン、およびプリフェッチ制御を特徴とする MoE 最適化アーキテクチャの図。
さらに、チームは「Knight」というエージェントベースの推論オペレータオプティマイザを開発しました。 提案、コード実装、反復という自動化された閉ループプロセスを通じて、最適化の探索空間を劇的に拡大しました。その結果、エンドツーエンドの推論時間は 14.91 秒から 3.56 秒へと短縮され、4.1 倍の高速化を実現しました。 1ステップあたりのデコード遅延は12.63msから5.45msに短縮され、重み読み込み時のDMAエンジンの利用率は約80%に達した。
スタンフォード大学やMITといった世界有数の大学のチームを上回るこの成果は、大規模モデルを基盤システムに適応させ、演算子を最適化する中国チームの深い専門知識を浮き彫りにしています。また、将来のスーパーノード・コンピューティング・プラットフォーム上で、1兆パラメータ規模のMoEモデルを展開するための貴重なエンジニアリングの青写真も提供しています。
関連記事
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (1)
0/500
清華大学のストレージ研究所とテンセントのMegEngine AIインフラチームは、最近、機械学習システムの主要な国際会議であるMLSys2026で開催された「MoEモデル推論最適化チャレンジ」で世界優勝を果たした。

異種NPUチップ上で動作するパラメータ数が1兆規模に達する「Mixture-of-Experts(MoE)」アーキテクチャにおける推論性能のボトルネックに対処するため、共同チームは公式モデルとNPUハードウェアを対象としたフルチェーン最適化ソリューションを設計した。 エキスパートレベルでのタスク分割に「E-Shard」戦略を採用し、PSUM 3Dテンソルのバッチ読み出し、並行処理のために複数のバンクに出力を分散させるGEMVパス、および初期データ転送の遅延を低減するためのスカラーエンジンを活用することで、オペレーターレベルにおけるデータ転送効率の低さや反復的な活性化転送の問題を解消することに成功しました。
並行して、チームはアテンションモジュールおよびコアとなるTransformer演算子のオンチップデータレイアウトを再編成し、ビットレベルでの高精度なアライメントを実現した。

図 3: E-Shard によるエキスパート分割、連続 DMA、PSUM/GEMV による並行処理、コールドスタートパイプライン、およびプリフェッチ制御を特徴とする MoE 最適化アーキテクチャの図。
さらに、チームは「Knight」というエージェントベースの推論オペレータオプティマイザを開発しました。 提案、コード実装、反復という自動化された閉ループプロセスを通じて、最適化の探索空間を劇的に拡大しました。その結果、エンドツーエンドの推論時間は 14.91 秒から 3.56 秒へと短縮され、4.1 倍の高速化を実現しました。 1ステップあたりのデコード遅延は12.63msから5.45msに短縮され、重み読み込み時のDMAエンジンの利用率は約80%に達した。
スタンフォード大学やMITといった世界有数の大学のチームを上回るこの成果は、大規模モデルを基盤システムに適応させ、演算子を最適化する中国チームの深い専門知識を浮き彫りにしています。また、将来のスーパーノード・コンピューティング・プラットフォーム上で、1兆パラメータ規模のMoEモデルを展開するための貴重なエンジニアリングの青写真も提供しています。
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始





家






