美団のオープンソース音声モデルが、音声クローン技術の新たな基準を打ち立てる
音声生成の分野では、多段階カスケードアーキテクチャからエンドツーエンドモデルへの根本的な転換が進んでいます。 TTSシステムで使用される従来の「メルスペクトログラム」中間表現に内在する情報損失や誤差の蓄積を克服するため、Meituan LongCatチームはLongCat-AudioDiT(パラメータ数10億および35億のバージョンが利用可能)を正式にリリースし、オープンソース化した。このモデルは、波形に対する直接的な潜在空間モデリングを行うことで、ゼロショット音声クローン生成における従来の性能限界を突破することに成功した。

コアアーキテクチャ:メルスペクトログラムの枠を超越
LongCat-AudioDiTは、「音響特徴予測+ニューラルボコーダー」という従来の多段階パイプラインを排除し、代わりにWav-VAE(波形変分オートエンコーダー)とDiT(拡散トランスフォーマー)を基盤とした、合理化された最小限のアーキテクチャを確立しています。
効率的なWav-VAE:完全畳み込み設計を採用し、24kHzの波形を2000倍圧縮して11.7Hzのフレームレートに変換します。非パラメトリックなショートカット分岐と多目的敵対的学習を通じて、再構成された波形が正確な時周波数構造を維持しつつ、極めて自然な聴感品質を実現します。
意味強化型DiT:本モデルは、UMT5テキストエンコーダからの元の単語埋め込みと、その最上位隠れ状態を革新的に融合させます。これにより、高次元の意味表現で失われがちな音声的詳細を補完し、生成音声の明瞭度を大幅に向上させます。
推論の最適化:音声ドリフトの精密な補正
生成品質をさらに向上させるため、チームは2つの重要な技術的改良を実施しました:
デュアル制約メカニズム:この技術は、フローマッチングTTSにおいて常に見られる「学習と推論の不一致」という問題を特定し、修正します。推論中にプロンプト領域の潜在変数を強制的にリセットすることで、話者の声のドリフトや不安定性の問題を完全に解決します。
適応型投影ガイダンス(APG):APGは従来の分類器フリーガイダンス(CFG)に代わるものです。ガイダンス信号内の有益な成分を正確に抽出すると同時に、音声品質の低下を招く成分を抑制することで、スペクトル上の「過飽和」を引き起こすことなく、音声の自然さを大幅に向上させます。
性能:SOTAレベルのクローン精度
Seedデータセットでのベンチマークテストにおいて、LongCat-AudioDiTは圧倒的な性能を発揮しました:
類似度(SIM):35億パラメータモデルは、Seed-ZHテストセットで0.818、難易度の高いSeed-Hard文セットで0.797のスコアを達成し、Seed-TTS、CosyVoice3.5、MiniMax-Speechといった著名なモデルを上回りました。
精度:主要な評価指標において業界トップクラスの性能を示しており、英語のWERは1.50%、中国語の難文におけるCERは6.04%を記録した。
特筆すべきは、LongCat-AudioDiTが、前処理済みのASR転写データに対して単一ステージのトレーニングのみを行いながら、多段階トレーニングを施したモデルと比較して優れた結果を達成している点です。関連する研究論文、ソースコード、およびモデル重みは、現在GitHubおよびHuggingFaceで完全にオープンソース化され、公開されています。
プロジェクトリンク:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
音声生成の分野では、多段階カスケードアーキテクチャからエンドツーエンドモデルへの根本的な転換が進んでいます。 TTSシステムで使用される従来の「メルスペクトログラム」中間表現に内在する情報損失や誤差の蓄積を克服するため、Meituan LongCatチームはLongCat-AudioDiT(パラメータ数10億および35億のバージョンが利用可能)を正式にリリースし、オープンソース化した。このモデルは、波形に対する直接的な潜在空間モデリングを行うことで、ゼロショット音声クローン生成における従来の性能限界を突破することに成功した。

コアアーキテクチャ:メルスペクトログラムの枠を超越
LongCat-AudioDiTは、「音響特徴予測+ニューラルボコーダー」という従来の多段階パイプラインを排除し、代わりにWav-VAE(波形変分オートエンコーダー)とDiT(拡散トランスフォーマー)を基盤とした、合理化された最小限のアーキテクチャを確立しています。
効率的なWav-VAE:完全畳み込み設計を採用し、24kHzの波形を2000倍圧縮して11.7Hzのフレームレートに変換します。非パラメトリックなショートカット分岐と多目的敵対的学習を通じて、再構成された波形が正確な時周波数構造を維持しつつ、極めて自然な聴感品質を実現します。
意味強化型DiT:本モデルは、UMT5テキストエンコーダからの元の単語埋め込みと、その最上位隠れ状態を革新的に融合させます。これにより、高次元の意味表現で失われがちな音声的詳細を補完し、生成音声の明瞭度を大幅に向上させます。
推論の最適化:音声ドリフトの精密な補正
生成品質をさらに向上させるため、チームは2つの重要な技術的改良を実施しました:
デュアル制約メカニズム:この技術は、フローマッチングTTSにおいて常に見られる「学習と推論の不一致」という問題を特定し、修正します。推論中にプロンプト領域の潜在変数を強制的にリセットすることで、話者の声のドリフトや不安定性の問題を完全に解決します。
適応型投影ガイダンス(APG):APGは従来の分類器フリーガイダンス(CFG)に代わるものです。ガイダンス信号内の有益な成分を正確に抽出すると同時に、音声品質の低下を招く成分を抑制することで、スペクトル上の「過飽和」を引き起こすことなく、音声の自然さを大幅に向上させます。
性能:SOTAレベルのクローン精度
Seedデータセットでのベンチマークテストにおいて、LongCat-AudioDiTは圧倒的な性能を発揮しました:
類似度(SIM):35億パラメータモデルは、Seed-ZHテストセットで0.818、難易度の高いSeed-Hard文セットで0.797のスコアを達成し、Seed-TTS、CosyVoice3.5、MiniMax-Speechといった著名なモデルを上回りました。
精度:主要な評価指標において業界トップクラスの性能を示しており、英語のWERは1.50%、中国語の難文におけるCERは6.04%を記録した。
特筆すべきは、LongCat-AudioDiTが、前処理済みのASR転写データに対して単一ステージのトレーニングのみを行いながら、多段階トレーニングを施したモデルと比較して優れた結果を達成している点です。関連する研究論文、ソースコード、およびモデル重みは、現在GitHubおよびHuggingFaceで完全にオープンソース化され、公開されています。
プロジェクトリンク:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





家






