アリババのTongyi Labが「Fun-CineForge」をオープンソース化し、複数話者による吹き替えの課題を解決
映画やアニメーションといった、微妙な感情の起伏を捉え、唇の動きを完璧に同期させることが極めて重要な、ハイレベルな制作現場において、従来のAI音声吹き替え技術はしばしば不十分でした。この業界が抱える根本的な課題に取り組むため、Tongyi Labは、画期的な映画品質のマルチシナリオ・マルチモーダル吹き替えモデル「Fun-CineForge 」を正式にリリースし、オープンソース化しました。
映像と音声のギャップを埋める:シームレスな同期を実現する4つの柱からなるフレームワーク
Fun-CineForgeは、単純なテキスト読み上げ技術に頼るのではなく、プロフェッショナルな吹き替えにおける4つの重要な側面を習得するよう設計されています:
リップシンク:合成音声が画面上のキャラクターの口の動きと極めて高い精度で一致することを保証します。
感情表現:顔の表情や文脈上の指示を分析することで、音声に本物の人間のような感情を吹き込みます。
声の一貫性:複雑な複数人物の会話シーンにおいても、特定のキャラクターに対して安定した、識別可能な声の個性を維持します。
時間的整合性:話者が画面外にいる場合や部分的に隠れている場合でも、ミリ秒単位の精度で台詞を挿入します。
中核となるイノベーション:「タイム・モダリティ」と高忠実度データセットの先駆的開発
Fun-CineForgeの技術的飛躍は、独自の「データ+モデル」共同設計哲学に由来します:

CineDub高品質データセット:Tongyi Labは、自動化されたCineDubデータセット構築パイプラインもオープンソース化しました。思考連鎖エラー訂正メカニズムを活用することで、中国語および英語のテキストの転写誤り率を約1%~2%に低減し、話者ダイアリゼーションの誤りを1.2%まで大幅に削減します。
4モダリティ融合アーキテクチャ:本モデルは「時間モダリティ」の統合を先駆けて実現し、視覚入力(唇の形や表情)、テキスト(台詞や感情的文脈)、音声(参照音声)を共同でモデリングします。この融合により、顔が映っていないような困難なシーンにおいても、正確な同期が可能となります。
実証された卓越性:画期的なリアルな多人数対話吹き替え
ベンチマーク結果によると、Fun-CineForgeは、単語誤り率(WER/CER)、リップシンク精度(LSE-C/D)、音声類似度といった主要指標において、DeepDubber-V1などのベースラインモデルを大幅に上回っています。画期的な成果として、デュエットや複数人の対話を高精度で処理する業界初の機能を備えており、最大30秒の動画クリップにおいても卓越した堅牢性を示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
関連記事
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー
関連特集おすすめ
コメント (0)
0/500
映画やアニメーションといった、微妙な感情の起伏を捉え、唇の動きを完璧に同期させることが極めて重要な、ハイレベルな制作現場において、従来のAI音声吹き替え技術はしばしば不十分でした。この業界が抱える根本的な課題に取り組むため、Tongyi Labは、画期的な映画品質のマルチシナリオ・マルチモーダル吹き替えモデル「
映像と音声のギャップを埋める:シームレスな同期を実現する4つの柱からなるフレームワーク
Fun-CineForgeは、単純なテキスト読み上げ技術に頼るのではなく、プロフェッショナルな吹き替えにおける4つの重要な側面を習得するよう設計されています:
リップシンク:合成音声が画面上のキャラクターの口の動きと極めて高い精度で一致することを保証します。
感情表現:顔の表情や文脈上の指示を分析することで、音声に本物の人間のような感情を吹き込みます。
声の一貫性:複雑な複数人物の会話シーンにおいても、特定のキャラクターに対して安定した、識別可能な声の個性を維持します。
時間的整合性:話者が画面外にいる場合や部分的に隠れている場合でも、ミリ秒単位の精度で台詞を挿入します。
中核となるイノベーション:「タイム・モダリティ」と高忠実度データセットの先駆的開発
Fun-CineForgeの技術的飛躍は、独自の「データ+モデル」共同設計哲学に由来します:

CineDub高品質データセット:Tongyi Labは、自動化されたCineDubデータセット構築パイプラインもオープンソース化しました。思考連鎖エラー訂正メカニズムを活用することで、中国語および英語のテキストの転写誤り率を約1%~2%に低減し、話者ダイアリゼーションの誤りを1.2%まで大幅に削減します。
4モダリティ融合アーキテクチャ:本モデルは「時間モダリティ」の統合を先駆けて実現し、視覚入力(唇の形や表情)、テキスト(台詞や感情的文脈)、音声(参照音声)を共同でモデリングします。この融合により、顔が映っていないような困難なシーンにおいても、正確な同期が可能となります。
実証された卓越性:画期的なリアルな多人数対話吹き替え
ベンチマーク結果によると、Fun-CineForgeは、単語誤り率(WER/CER)、リップシンク精度(LSE-C/D)、音声類似度といった主要指標において、DeepDubber-V1などのベースラインモデルを大幅に上回っています。画期的な成果として、デュエットや複数人の対話を高精度で処理する業界初の機能を備えており、最大30秒の動画クリップにおいても卓越した堅牢性を示しています。
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
MiniMax、グローバルのAI専門家に対するインセンティブを提供する「10xチームプログラム」を発表
MiniMax(稀宇科技)の汎用人工知能ラボは、グローバルな人材連携イニシアチブ「10xチーム」を正式に開始しました。このプログラムは、大規模モデルの専門分野における深い応用を探求するために、各業界のトップエキスパートを募集することを目的としています。深い業界知識と最先端のAIを統合することで、MiniMaxは汎用から専門的なシナリオへと大規模モデルの生産性を拡大し、最終的に業界の効率に「10倍の増加」をもたらすことを目指しています。業界の認知価値を検証し、マルチモーダルの中核リソースを開放す
韓国、国家AI計算センターの起工式を実施、2.5兆ウォンを投資し2028年の完成を目指す
韓国のアウトレッツ、EtNewsの報道によると、全羅南道順天のソラーシティデータセンターパークで、8月3日に韓国AI計算センター(KOACC)の起工式が行われた。総投資額2.5兆ウォン(約118億3800万元)を背景に、この施設は2028年の運用開始を目指しており、これまでに韓国がAIインフラに対して行った国家投資の中で最も大規模なものの一つとなっている。プロジェクトの株式配分は、政府と企業の深い連携を推進する戦略的な取り組みを示している。サムスンSDSが30%の株式を持つ最大株主として主導し
Linux財団を支援する6つのテックジャイアント、AI脆弱性のノイズに対処するために1,250万ドルを拠出
AI自動化ツールによって生成される低品質なセキュリティレポートの洪水に対処するため、Anthropic、Amazon(AWS)、GitHub、Google、Microsoft、OpenAIの6大テック企業が、Linux Foundationのイニシアチブに対して総額1250万ドルの資金を提供しました。この投資は、オープンソースソフトウェア(FOSS)のメンテナーが手動でのスクリーニングという負担から解放され、本格的なセキュリティ脅威に集中できることを目的としています。AI技術が脆弱性発見のハー





家






