Ali’s Black Tech:0.6Bモデルが17B MoEにアップグレードされ、アクティブパラメータは5%、CPU上で毎秒30トークンの速度で実行中
Ali International Digital Commerceチームは、「Marco-MoE」シリーズの最新モデルである「Marco-Mini-Instruct」を発表し、「小規模でも大きな成果をもたらす」ことを実証しました。 総パラメータ数は173億ですが、そのうちアクティブなパラメータはわずか8.6億(約5%)であり、標準的なCPUでもスムーズに動作する卓越した推論速度を実現しています。

超軽量:CPUパフォーマンスに最適化
公式データによると、8ビット量子化と4つのDDR4 2400メモリモジュールを使用した場合、このモデルは1秒あたり約30トークンの推論速度を達成します。この効率性により、Mixture-of-Experts(MoE)アーキテクチャが主流として利用しやすくなり、ローカル展開の障壁が大幅に低減されます。
主要な革新:アップサイクリング技術が可能性を変革
Marco-Mini-Instructの際立った特徴は、そのサイズや速度ではなく、そのユニークな生成方法にあります。このモデルは、ゼロから学習されたものではなく、アップサイクリング技術を用いてQwen3-0.6B-Baseモデルから進化させたものです。

このプロセスでは、密な小型モデルの構成要素を分割または複製して複数のエキスパートに分け、ルーティング機構を導入します。また、きめ細かなサブ行列の分割と「ドロップ・アップサイクリング」戦略を統合しています。これは、トレーニング中に特定のエキスパートやルーティングパスをランダムに破棄することで、正則化を追加し、堅牢性を向上させるものです。 このアプローチにより、純粋なDenseモデルをMoEアーキテクチャへと成功裏にアップグレードし、業界にMoEトレーニングのための新しく、費用対効果が高く、効率的な道筋を提供しています。
コンテキストの長さとトレーニング設定
モデル構成では max_position_embeddings を 32K に拡張していますが、教師あり微調整(SFT)フェーズでは 8192 トークンのコンテキストが使用されます。その結果、デフォルトのコンテキスト長は、ほとんどの実用的なアプリケーションシナリオに最適です。
トレーニング後の画期的な成果:カスケード型オンポリシー蒸留
トレーニング後のフェーズも同様に印象的です。まずSFTによるプレヒーティングから始まり、続いてカスケード型オンポリシー蒸留戦略が実施されます。 当初、ディスティレーションでは Qwen3-30B-A3B-Instruct をティーチャーモデルとして使用し、その後、より高性能な Qwen3-Next-80B-A3B-Instruct に切り替えます。 蒸留データは、指示の遵守、複雑な推論、セキュリティ対応、数学的能力に及び、モデルが効率を維持しつつ、全体的な知能を大幅に向上させることを保証します。
ベンチマーク結果:0.86Bのアクティブパラメータが4Bのdenseモデルを上回る
最終的なMarco-Mini-Instructは、ほとんどの主要なベンチマークにおいて、Qwen3-4Bなどの多くの高パラメータモデルを上回る性能を発揮します。わずか0.86Bのアクティブパラメータで、「小型でありながら強力」なパフォーマンスを実現するMoEアーキテクチャの膨大な可能性を完全に実証しています。
業界への影響:新たなオープンソースMoEトレーニングパラダイム
AIbaseは、この成果の最大の価値は、開発者に新たな機会を開くことにあると考えています。もはや大規模なMoEモデルをゼロから学習させる必要はなく、代わりに、チームは適切な小型のDenseモデルを選択し、論文で概説されているアップサイクリングおよびドロップ・アップサイクリングのプロセスを厳密に再現すればよいのです。 トレーニング全体のコストは管理可能な範囲に収まります。SFTフェーズには64台のGPUで24時間、蒸留フェーズには64台のGPUで110時間を要するため、中小規模のチームがMoEを実験するためのハードルが大幅に下がります。
アリババによる今回の「改良」は、モデルの効率性における飛躍的な進歩が必ずしもパラメータの積み重ねに依存するわけではなく、革新的な学習パラダイムも質的な飛躍をもたらし得ることを改めて証明しています。 Marco-Mini-Instructのリリースは、エッジデバイスや個人開発者のシナリオにおけるMoE技術の採用を間違いなく加速させ、業界全体が注目すべき重要な進展となるだろう。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
Ali International Digital Commerceチームは、「Marco-MoE」シリーズの最新モデルである「Marco-Mini-Instruct」を発表し、「小規模でも大きな成果をもたらす」ことを実証しました。 総パラメータ数は173億ですが、そのうちアクティブなパラメータはわずか8.6億(約5%)であり、標準的なCPUでもスムーズに動作する卓越した推論速度を実現しています。

超軽量:CPUパフォーマンスに最適化
公式データによると、8ビット量子化と4つのDDR4 2400メモリモジュールを使用した場合、このモデルは1秒あたり約30トークンの推論速度を達成します。この効率性により、Mixture-of-Experts(MoE)アーキテクチャが主流として利用しやすくなり、ローカル展開の障壁が大幅に低減されます。
主要な革新:アップサイクリング技術が可能性を変革
Marco-Mini-Instructの際立った特徴は、そのサイズや速度ではなく、そのユニークな生成方法にあります。このモデルは、ゼロから学習されたものではなく、アップサイクリング技術を用いてQwen3-0.6B-Baseモデルから進化させたものです。

このプロセスでは、密な小型モデルの構成要素を分割または複製して複数のエキスパートに分け、ルーティング機構を導入します。また、きめ細かなサブ行列の分割と「ドロップ・アップサイクリング」戦略を統合しています。これは、トレーニング中に特定のエキスパートやルーティングパスをランダムに破棄することで、正則化を追加し、堅牢性を向上させるものです。 このアプローチにより、純粋なDenseモデルをMoEアーキテクチャへと成功裏にアップグレードし、業界にMoEトレーニングのための新しく、費用対効果が高く、効率的な道筋を提供しています。
コンテキストの長さとトレーニング設定
モデル構成では max_position_embeddings を 32K に拡張していますが、教師あり微調整(SFT)フェーズでは 8192 トークンのコンテキストが使用されます。その結果、デフォルトのコンテキスト長は、ほとんどの実用的なアプリケーションシナリオに最適です。
トレーニング後の画期的な成果:カスケード型オンポリシー蒸留
トレーニング後のフェーズも同様に印象的です。まずSFTによるプレヒーティングから始まり、続いてカスケード型オンポリシー蒸留戦略が実施されます。 当初、ディスティレーションでは Qwen3-30B-A3B-Instruct をティーチャーモデルとして使用し、その後、より高性能な Qwen3-Next-80B-A3B-Instruct に切り替えます。 蒸留データは、指示の遵守、複雑な推論、セキュリティ対応、数学的能力に及び、モデルが効率を維持しつつ、全体的な知能を大幅に向上させることを保証します。
ベンチマーク結果:0.86Bのアクティブパラメータが4Bのdenseモデルを上回る
最終的なMarco-Mini-Instructは、ほとんどの主要なベンチマークにおいて、Qwen3-4Bなどの多くの高パラメータモデルを上回る性能を発揮します。わずか0.86Bのアクティブパラメータで、「小型でありながら強力」なパフォーマンスを実現するMoEアーキテクチャの膨大な可能性を完全に実証しています。
業界への影響:新たなオープンソースMoEトレーニングパラダイム
AIbaseは、この成果の最大の価値は、開発者に新たな機会を開くことにあると考えています。もはや大規模なMoEモデルをゼロから学習させる必要はなく、代わりに、チームは適切な小型のDenseモデルを選択し、論文で概説されているアップサイクリングおよびドロップ・アップサイクリングのプロセスを厳密に再現すればよいのです。 トレーニング全体のコストは管理可能な範囲に収まります。SFTフェーズには64台のGPUで24時間、蒸留フェーズには64台のGPUで110時間を要するため、中小規模のチームがMoEを実験するためのハードルが大幅に下がります。
アリババによる今回の「改良」は、モデルの効率性における飛躍的な進歩が必ずしもパラメータの積み重ねに依存するわけではなく、革新的な学習パラダイムも質的な飛躍をもたらし得ることを改めて証明しています。 Marco-Mini-Instructのリリースは、エッジデバイスや個人開発者のシナリオにおけるMoE技術の採用を間違いなく加速させ、業界全体が注目すべき重要な進展となるだろう。
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






