Meituanが「LongCat-Video-Avatar1.5」をオープンソース化、主流のクローズドモデルを上回る性能を発揮
美団(Meituan)のLongCat大規模モデルチームは、商用グレードのデジタルヒューマン動画生成モデル「LongCat-Video-Avatar 1.5」を正式にオープンソース化しました。このバージョンは、オープンソースの最先端技術から実世界の商用展開へと完全に移行したものであり、リップシンク、物理的リアリズム、長尺動画の安定性、複数人物間の相互作用、および効率的な推論において大幅な強化が図られています。
商用化の障壁を克服するための3つの主要なアップグレード
デジタルヒューマンが実世界のさまざまなアプリケーションで確実に機能するようにするため、「LongCat-Video-Avatar 1.5」は、従来のデジタルヒューマン動画に見られるジッター、歪み、高遅延といった根深い問題に対し、以下の3つの包括的な改善を通じて取り組んでいます:
商用グレードのオーディオエンコーディングのアップグレード
モデルの音声特徴抽出エンコーダーが、Wav2Vec2からWhisper-largeへとアップグレードされました。 パラメータ数の増加と、より豊富な多言語の事前知識により、微妙な音素のバリエーションや話し方のリズムを捉えることが可能になりました。これにより、長い文章、早口、歌唱などの複雑な音声におけるリップシンクが改善されるだけでなく、表情、頭部の動き、発話間の自然な連携も実現され、長時間の動画におけるフレームスキップやアイデンティティドリフトが大幅に低減されます。
多段階データ拡張による堅牢なオープンドメイン汎化
実在の人物、バーチャルアイドル、アニメキャラクター、動物など、多様な被写体において安定した性能を確保するため、チームはオフラインアノテーションとオンライン検証を組み込んだ多段階データパイプラインを開発し、以下の3種類のターゲットを絞った拡張データを導入しました:
複数人物データ:アクティブスピーカー検出を用いて、複数人物が登場するシーンにおける音声と映像の不一致を解消し、話者と聴き手を正確に区別します。
静寂データ:音声が含まれない動画を厳選することで、モデルは沈黙状態における自然な微細な表情を学習し、発話していないキャラクターの不要な口の動きを防止します。
感情データ:フレーム単位の感情認識フィルタリングと組み合わせることで、感情の変動を取り込み、モデルが発話と表情の深い関連性を把握できるよう支援します。
GRPOによる手の位置合わせと時間的連続性
ECライブ配信や製品デモなど、手が頻繁に映るユースケース向けに、本モデルはGRPO(Human Preference Alignment)を導入しています。これにより、報酬信号をフレーム単位で微調整し、初フレームでの手検出メカニズムを追加します。これにより、手の歪み、局所的な構造の崩壊、動作の不整合といった一般的な問題が大幅に軽減されます。

推論速度が15倍向上:計算リソースの負荷を解消
コストも商用展開における重要な要素です。LongCat-Video-Avatar 1.5はDMD(Distributed Matching Distillation)技術を採用し、元の50ステップの生成プロセスをわずか8ステップに圧縮しています。 さらに、チームは従来の3モデル並列構成を、単一の共有ベースモデルと複数のLoRAアダプターによる構成に置き換え、VRAMの使用量を劇的に削減しました。
実環境でのテストでは、このモデルは約15倍高速な推論を実現し、10秒間の動画を約1分で生成しました。
ベンチマーク評価:業界トップクラスのモデルを上回る性能
EvalTalkerベンチマークを用いて、770名の評価者と10名の分野専門家が、ニュース、教育、エンターテインメントなどの複雑な分野の動画に対して体系的な品質分析を行いました。その結果、LongCat-Video-Avatar 1.5はいくつかの主要な指標において優れた性能を発揮していることが示されました:
ユーザーの選好率:Kling Avatar2.0を65.9%、OmniHuman-1.5を61.1%、HeyGenを54.3%上回っています。
単一人物および複数人物シナリオのスコア:単一人物のスコアは3.336に達し、HeyGenなどの競合他社を大幅に上回っています。複数人物のスコアは2.730で、InfiniteTalk(2.339)を大幅に上回っています。
映像の安定性:被写体の変形率はわずか23.1%、背景の変形率はわずか9.4%であり、フレームスキップ率は0.8%と低く、比較対象となったすべてのモデルの中で最高水準です。
音声・映像の協調性:顔と体の同期不具合率は5.1%に、リップシンクの不具合率は29.8%に低下し、いずれも従来の商用システムを上回っています。
Meituan LongCat 大型モデルチームは、「LongCat-Video-Avatar 1.5」のオープンソース化は単なるバージョンアップにとどまらず、世界中の開発者やクリエイターコミュニティへの招待であると述べています。 同チームは、このモデルが検証可能かつ改良可能な技術的基盤となり、デジタルヒューマン動画アプリケーションの実用的な限界を押し広げる一助となることを期待している。
オープンソースリンク:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技術レポート:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
プロジェクトページ: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
関連記事
Slackbot が AI エージェントになる
Salesforceの企業向けメッセージングプラットフォームSlackに組み込まれた自動化アシスタント「Slackbot」は、AIエージェントへと進化しつつある。SalesforceのCTOであるパーカー・ハリス氏は、OpenAIのChatGPTに匹敵するバイラルな普及を達成する可能性を構想している。クラウドソフトウェア大手は火曜日、アップデートされたSlackbotをリリースした。Business+およびEnterprise+の顧客が利用可能なこの新しいAI駆動版は、Slack内で直接情報の
ByteDance、コアAIインセンティブを強化、Doubaoが14.6%急伸
ByteDanceは最近、DouBaoの株式に関する説明会を開催し、DouBao部門に関わる従業員向けの新たなインセンティブ政策を発表した。DouBao株式の行使価格は2026年6月の14.85ドルから17.02ドルに引き上げられ、約14.6%の増加となった。この改定により、DouBao株式の評価額が上昇するだけでなく、その配布範囲も大幅に拡大した。個人の役割に応じて、一部の従業員は総報酬の約5%に相当するDouBao株式を受け取ることができる。新しい交換メカニズムの下、ByteDanceは従
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
関連特集おすすめ
コメント (0)
0/500
美団(Meituan)のLongCat大規模モデルチームは、商用グレードのデジタルヒューマン動画生成モデル「LongCat-Video-Avatar 1.5」を正式にオープンソース化しました。このバージョンは、オープンソースの最先端技術から実世界の商用展開へと完全に移行したものであり、リップシンク、物理的リアリズム、長尺動画の安定性、複数人物間の相互作用、および効率的な推論において大幅な強化が図られています。
商用化の障壁を克服するための3つの主要なアップグレード
デジタルヒューマンが実世界のさまざまなアプリケーションで確実に機能するようにするため、「LongCat-Video-Avatar 1.5」は、従来のデジタルヒューマン動画に見られるジッター、歪み、高遅延といった根深い問題に対し、以下の3つの包括的な改善を通じて取り組んでいます:
商用グレードのオーディオエンコーディングのアップグレード
モデルの音声特徴抽出エンコーダーが、Wav2Vec2からWhisper-largeへとアップグレードされました。 パラメータ数の増加と、より豊富な多言語の事前知識により、微妙な音素のバリエーションや話し方のリズムを捉えることが可能になりました。これにより、長い文章、早口、歌唱などの複雑な音声におけるリップシンクが改善されるだけでなく、表情、頭部の動き、発話間の自然な連携も実現され、長時間の動画におけるフレームスキップやアイデンティティドリフトが大幅に低減されます。
多段階データ拡張による堅牢なオープンドメイン汎化
実在の人物、バーチャルアイドル、アニメキャラクター、動物など、多様な被写体において安定した性能を確保するため、チームはオフラインアノテーションとオンライン検証を組み込んだ多段階データパイプラインを開発し、以下の3種類のターゲットを絞った拡張データを導入しました:
複数人物データ:アクティブスピーカー検出を用いて、複数人物が登場するシーンにおける音声と映像の不一致を解消し、話者と聴き手を正確に区別します。
静寂データ:音声が含まれない動画を厳選することで、モデルは沈黙状態における自然な微細な表情を学習し、発話していないキャラクターの不要な口の動きを防止します。
感情データ:フレーム単位の感情認識フィルタリングと組み合わせることで、感情の変動を取り込み、モデルが発話と表情の深い関連性を把握できるよう支援します。
GRPOによる手の位置合わせと時間的連続性
ECライブ配信や製品デモなど、手が頻繁に映るユースケース向けに、本モデルはGRPO(Human Preference Alignment)を導入しています。これにより、報酬信号をフレーム単位で微調整し、初フレームでの手検出メカニズムを追加します。これにより、手の歪み、局所的な構造の崩壊、動作の不整合といった一般的な問題が大幅に軽減されます。

推論速度が15倍向上:計算リソースの負荷を解消
コストも商用展開における重要な要素です。LongCat-Video-Avatar 1.5はDMD(Distributed Matching Distillation)技術を採用し、元の50ステップの生成プロセスをわずか8ステップに圧縮しています。 さらに、チームは従来の3モデル並列構成を、単一の共有ベースモデルと複数のLoRAアダプターによる構成に置き換え、VRAMの使用量を劇的に削減しました。
実環境でのテストでは、このモデルは約15倍高速な推論を実現し、10秒間の動画を約1分で生成しました。
ベンチマーク評価:業界トップクラスのモデルを上回る性能
EvalTalkerベンチマークを用いて、770名の評価者と10名の分野専門家が、ニュース、教育、エンターテインメントなどの複雑な分野の動画に対して体系的な品質分析を行いました。その結果、LongCat-Video-Avatar 1.5はいくつかの主要な指標において優れた性能を発揮していることが示されました:
ユーザーの選好率:Kling Avatar2.0を65.9%、OmniHuman-1.5を61.1%、HeyGenを54.3%上回っています。
単一人物および複数人物シナリオのスコア:単一人物のスコアは3.336に達し、HeyGenなどの競合他社を大幅に上回っています。複数人物のスコアは2.730で、InfiniteTalk(2.339)を大幅に上回っています。
映像の安定性:被写体の変形率はわずか23.1%、背景の変形率はわずか9.4%であり、フレームスキップ率は0.8%と低く、比較対象となったすべてのモデルの中で最高水準です。
音声・映像の協調性:顔と体の同期不具合率は5.1%に、リップシンクの不具合率は29.8%に低下し、いずれも従来の商用システムを上回っています。
Meituan LongCat 大型モデルチームは、「LongCat-Video-Avatar 1.5」のオープンソース化は単なるバージョンアップにとどまらず、世界中の開発者やクリエイターコミュニティへの招待であると述べています。 同チームは、このモデルが検証可能かつ改良可能な技術的基盤となり、デジタルヒューマン動画アプリケーションの実用的な限界を押し広げる一助となることを期待している。
オープンソースリンク:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
技術レポート:https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
プロジェクトページ: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope:https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Slackbot が AI エージェントになる
Salesforceの企業向けメッセージングプラットフォームSlackに組み込まれた自動化アシスタント「Slackbot」は、AIエージェントへと進化しつつある。SalesforceのCTOであるパーカー・ハリス氏は、OpenAIのChatGPTに匹敵するバイラルな普及を達成する可能性を構想している。クラウドソフトウェア大手は火曜日、アップデートされたSlackbotをリリースした。Business+およびEnterprise+の顧客が利用可能なこの新しいAI駆動版は、Slack内で直接情報の
ByteDance、コアAIインセンティブを強化、Doubaoが14.6%急伸
ByteDanceは最近、DouBaoの株式に関する説明会を開催し、DouBao部門に関わる従業員向けの新たなインセンティブ政策を発表した。DouBao株式の行使価格は2026年6月の14.85ドルから17.02ドルに引き上げられ、約14.6%の増加となった。この改定により、DouBao株式の評価額が上昇するだけでなく、その配布範囲も大幅に拡大した。個人の役割に応じて、一部の従業員は総報酬の約5%に相当するDouBao株式を受け取ることができる。新しい交換メカニズムの下、ByteDanceは従
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す





家






