アリババのTongyiが「Fun-CineForge」を発表:映画級の音声合成を実現するオープンソースAIモデル
アリババ・トンイー・ラボは3月16日、映画品質のマルチシナリオ音声合成マルチモーダルモデル「Fun-CineForge」を正式にリリースし、オープンソース化した。このモデルは、リップシンクのズレ、感情表現の欠如、複数のキャラクター間で声の特性が統一されないといった、AI吹き替えにおける核心的な課題に対処するものである。また、高品質なデータセット構築手法も導入している。

技術面において、Fun-CineForgeは「時間的モダリティ」という概念を先駆的に導入しています。テキストや映像のみに焦点を当てた従来のモデルとは異なり、正確なタイムスタンプ制御を通じて、音声合成が正確な時間間隔内で行われることを保証します。キャラクターが遮られたり、カメラのカットが頻繁であったり、顔がぼやけていたりする複雑な映画シーンにおいても、本モデルは高いレベルの映像・音声の同期と指示への忠実性を維持します。
併せて公開されたオープンソースのデータセット構築パイプライン「CineDub」も、重要な革新の一つです。Tongyi Labは、大規模言語モデルの連鎖的推論を活用し、生の映像データを構造化データへ自動的に変換することで、手動によるアノテーションの必要性を大幅に削減しました。このプロセスにより、単語誤り率(WER)は約1%、話者ダイアリゼーション誤り率はわずか1.20%を達成し、大規模モデル向けの極めて競争力のあるトレーニング基盤を提供しています。

Fun-CineForgeは現在、GitHub、HuggingFace、およびModelScopeコミュニティで公開されており、最大30秒の動画クリップに対する推論をサポートしています。単一話者のモノローグだけでなく、デュエットや複数話者の対話シナリオに対してもプロフェッショナルレベルのサポートを提供します。この進歩は、AI音声技術が基本的なカスタマーサービスやアシスタントの役割から、高水準のアニメーションや映画のポストプロダクションへと進化していることを示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
関連記事
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
関連特集おすすめ
コメント (1)
0/500
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
アリババ・トンイー・ラボは3月16日、映画品質のマルチシナリオ音声合成マルチモーダルモデル「Fun-CineForge」を正式にリリースし、オープンソース化した。このモデルは、リップシンクのズレ、感情表現の欠如、複数のキャラクター間で声の特性が統一されないといった、AI吹き替えにおける核心的な課題に対処するものである。また、高品質なデータセット構築手法も導入している。

技術面において、Fun-CineForgeは「時間的モダリティ」という概念を先駆的に導入しています。テキストや映像のみに焦点を当てた従来のモデルとは異なり、正確なタイムスタンプ制御を通じて、音声合成が正確な時間間隔内で行われることを保証します。キャラクターが遮られたり、カメラのカットが頻繁であったり、顔がぼやけていたりする複雑な映画シーンにおいても、本モデルは高いレベルの映像・音声の同期と指示への忠実性を維持します。
併せて公開されたオープンソースのデータセット構築パイプライン「CineDub」も、重要な革新の一つです。Tongyi Labは、大規模言語モデルの連鎖的推論を活用し、生の映像データを構造化データへ自動的に変換することで、手動によるアノテーションの必要性を大幅に削減しました。このプロセスにより、単語誤り率(WER)は約1%、話者ダイアリゼーション誤り率はわずか1.20%を達成し、大規模モデル向けの極めて競争力のあるトレーニング基盤を提供しています。

Fun-CineForgeは現在、GitHub、HuggingFace、およびModelScopeコミュニティで公開されており、最大30秒の動画クリップに対する推論をサポートしています。単一話者のモノローグだけでなく、デュエットや複数話者の対話シナリオに対してもプロフェッショナルレベルのサポートを提供します。この進歩は、AI音声技術が基本的なカスタマーサービスやアシスタントの役割から、高水準のアニメーションや映画のポストプロダクションへと進化していることを示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.





家






