AntGroup、体現知能向けの初の動画基盤モデル「LingBot-Video」をオープンソース化
7月9日、アント・グループは、Mixture-of-Experts(MoE)アーキテクチャを基盤とし、体現知能向けに特別に設計された世界初のオープンソース動画生成基盤モデル「LingBot-Video」をオープンソース化しました。 このモデルは、ロボットと具現化された知能の中核的なニーズに焦点を当てることで、動画の事前学習を再定義し、推論効率、物理的妥当性、行動理解、およびタスク達成において体系的な向上を実現しています。これにより、動画基盤モデルがデジタルコンテンツ制作の枠を超え、具現化された知能へと進化するための新たなオープンソース基盤を提供します。
北京大学とByteDanceが共同開発したRBenchベンチマークにおいて、LingBot-Videoは0.620のスコアを記録し、Wan2.6(0.607)、Seedance1.5Pro(0.584)、Cosmos3Super(0.581)を上回りました。 ロボットの操作動画に対する包括的な評価ベンチマークであるRBenchは、モデルが現実世界の物理法則に従ったロボットの挙動を生成できるかどうかを具体的に評価するものです。この結果は、LingBot-Videoがロボット関連の動画を生成する際、動作の合理性とタスク実行の整合性をよりよく維持できることを示しています。

(図のキャプション:LingBot-VideoはRBenchで最高の性能を達成)
物理世界における変化をモデル化するLingBot-Videoの能力をさらに検証するため、Ant Groupは、一般的な品質と具現化されたドメインという2つの次元にわたる社内ベンチマークを用いて評価を行った。 その結果、NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3の5つのオープンソースモデルと比較して、LingBot-Videoは「具現化ドメイン」において主要なベースラインモデルを上回る性能を示した。

(図のキャプション:包括的な評価により、LingBot-Videoが具現化シナリオにおいて、より優れた物理的理解と動作の一貫性を示していることが明らかになった)
近年、動画生成モデルは、視覚的な品質、滑らかさ、創造的な表現において急速に進歩している。しかし、具現化された知能においては、見た目がリアルで滑らかに動く動画であっても、実際の物理法則を反映していない場合があり、ロボットによる継続的な予測、計画、タスク実行をサポートすることが困難となる。 同時に、具現化された知能には、リアルタイムの相互作用や制御ループに適応するための、より高い推論効率も求められます。
このことが、動画生成を2つの異なる道へと進化させる原動力となっています。1つはコンテンツ制作を目的とした映画分野への道、もう1つは物理世界への理解、予測、および相互作用を目的としたロボット分野への道です。LingBot-Videoは、身体化された知能に特化した動画生成の新たな道筋に向けた、Ant Groupによる重要な探求の成果です。
LingBot-Videoは、アーキテクチャ、データ、および学習において体系的な革新をもたらしています。
アーキテクチャの面では、LingBot-Video は DiT + MoE 設計を採用し、従来の密なアーキテクチャを MoE に置き換えています。これにより、推論コストを管理可能な範囲に抑えつつ、モデルの容量を拡張することが可能になります。 300億のパラメータを持つこのモデルは、生成時に約30億のみを活性化させるため、同規模の密なアーキテクチャに比べて推論効率が約3倍高くなります。この設計により、大規模なパラメータから視覚的な表現力を得つつ、具現化された知能が求める効率性の要件をより適切に満たすことができます。
データに関しては、LingBot-Videoはデータプロファイリングエンジンを構築し、膨大なインターネット動画に加え、VLA、VLN、Egoなどのロボット関連データを組み込みました。これにより、巧みな操作、ロボットの移動、一人称視点での相互作用などのシナリオを網羅し、合計7万時間分の体現データが収集されました。 このデータにより、モデルは動画の表面的な質感や視覚的スタイルだけでなく、行動と環境変化との関係を学習できるようになる。

学習において、LingBot-Videoは多次元強化学習報酬システムを導入した。美的評価、プロンプトの遵守、動作の一貫性といった従来の評価指標に加え、モデルは物理的な妥当性やタスクの完了度にも整合性を図ることで、生成結果を現実世界の物理法則とより整合させ、現実世界でタスクを実行するロボットのニーズにより近づけている。
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
7月9日、アント・グループは、Mixture-of-Experts(MoE)アーキテクチャを基盤とし、体現知能向けに特別に設計された世界初のオープンソース動画生成基盤モデル「LingBot-Video」をオープンソース化しました。 このモデルは、ロボットと具現化された知能の中核的なニーズに焦点を当てることで、動画の事前学習を再定義し、推論効率、物理的妥当性、行動理解、およびタスク達成において体系的な向上を実現しています。これにより、動画基盤モデルがデジタルコンテンツ制作の枠を超え、具現化された知能へと進化するための新たなオープンソース基盤を提供します。
北京大学とByteDanceが共同開発したRBenchベンチマークにおいて、LingBot-Videoは0.620のスコアを記録し、Wan2.6(0.607)、Seedance1.5Pro(0.584)、Cosmos3Super(0.581)を上回りました。 ロボットの操作動画に対する包括的な評価ベンチマークであるRBenchは、モデルが現実世界の物理法則に従ったロボットの挙動を生成できるかどうかを具体的に評価するものです。この結果は、LingBot-Videoがロボット関連の動画を生成する際、動作の合理性とタスク実行の整合性をよりよく維持できることを示しています。

(図のキャプション:LingBot-VideoはRBenchで最高の性能を達成)
物理世界における変化をモデル化するLingBot-Videoの能力をさらに検証するため、Ant Groupは、一般的な品質と具現化されたドメインという2つの次元にわたる社内ベンチマークを用いて評価を行った。 その結果、NVIDIA Cosmos3、Wan2.2A14B、LongCat-Video、Hunyuan Video1.5、LTX-2.3の5つのオープンソースモデルと比較して、LingBot-Videoは「具現化ドメイン」において主要なベースラインモデルを上回る性能を示した。

(図のキャプション:包括的な評価により、LingBot-Videoが具現化シナリオにおいて、より優れた物理的理解と動作の一貫性を示していることが明らかになった)
近年、動画生成モデルは、視覚的な品質、滑らかさ、創造的な表現において急速に進歩している。しかし、具現化された知能においては、見た目がリアルで滑らかに動く動画であっても、実際の物理法則を反映していない場合があり、ロボットによる継続的な予測、計画、タスク実行をサポートすることが困難となる。 同時に、具現化された知能には、リアルタイムの相互作用や制御ループに適応するための、より高い推論効率も求められます。
このことが、動画生成を2つの異なる道へと進化させる原動力となっています。1つはコンテンツ制作を目的とした映画分野への道、もう1つは物理世界への理解、予測、および相互作用を目的としたロボット分野への道です。LingBot-Videoは、身体化された知能に特化した動画生成の新たな道筋に向けた、Ant Groupによる重要な探求の成果です。
LingBot-Videoは、アーキテクチャ、データ、および学習において体系的な革新をもたらしています。
アーキテクチャの面では、LingBot-Video は DiT + MoE 設計を採用し、従来の密なアーキテクチャを MoE に置き換えています。これにより、推論コストを管理可能な範囲に抑えつつ、モデルの容量を拡張することが可能になります。 300億のパラメータを持つこのモデルは、生成時に約30億のみを活性化させるため、同規模の密なアーキテクチャに比べて推論効率が約3倍高くなります。この設計により、大規模なパラメータから視覚的な表現力を得つつ、具現化された知能が求める効率性の要件をより適切に満たすことができます。
データに関しては、LingBot-Videoはデータプロファイリングエンジンを構築し、膨大なインターネット動画に加え、VLA、VLN、Egoなどのロボット関連データを組み込みました。これにより、巧みな操作、ロボットの移動、一人称視点での相互作用などのシナリオを網羅し、合計7万時間分の体現データが収集されました。 このデータにより、モデルは動画の表面的な質感や視覚的スタイルだけでなく、行動と環境変化との関係を学習できるようになる。

学習において、LingBot-Videoは多次元強化学習報酬システムを導入した。美的評価、プロンプトの遵守、動作の一貫性といった従来の評価指標に加え、モデルは物理的な妥当性やタスクの完了度にも整合性を図ることで、生成結果を現実世界の物理法則とより整合させ、現実世界でタスクを実行するロボットのニーズにより近づけている。
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






