アリババ・トンイー、『FreeStyle』自然言語制御機能搭載音声モデルを発表
本日、アリババ統一ラボ音声チームは画期的な音声生成モデル「Fun-CosyVoice3.5」と「Fun-AudioGen-VD」を発表しました。これらのモデルの最大の特徴は「フリースタイル」コマンドのサポートです。複雑なパラメータ調整の代わりに、ユーザーは自然な言語記述を用いて声の表現スタイルを精密に制御したり、複雑な音声シーンを一から構築したりできます。

各モデルは異なる目的を果たします:
Fun-CosyVoice3.5:多言語再現と微細制御
CosyVoiceの強化版である本モデルは、音声表現のニュアンス理解において中核的なブレークスルーを達成。
コマンド駆動型生成:ユーザーは「より自信を持って話す」「感情の変化を伴いながらゆっくり話す」などの指示を入力し、リアルタイムで音声調整が可能です。
言語拡張:タイ語、インドネシア語、ポルトガル語、ベトナム語のサポートを追加し、13言語にわたる業界トップクラスの文字起こし精度(WER)と音声類似性を維持。
特殊文字最適化:特殊文字の誤認識率を15.2%から5.3%に低減。
パフォーマンス向上:ファーストパケット遅延が35%短縮され、リアルタイム操作の滑らかさが大幅に向上。
Fun-AudioGen-VD:包括的なサウンドデザイン
このモデルは「オーディオディレクター」として機能し、「キャラクター+環境」を統合したオーディオを生成します。
音声カスタマイズ:性別、年齢、アクセント、および「嗄れた声、低い声、低音」などの詳細な特性を指定可能。
感情とロールプレイ:カスタマーサービス担当者、放送局アナウンサー、子供などの役割をシミュレートし、「外見は平静だが内面は緊張している」といった複雑な状態も表現可能。
没入型環境:背景音(戦場の喧騒、カフェのざわめき)や空間効果(大聖堂のリバーブ、水中音響)を追加し、完全な空間シミュレーションを実現。
同義ラボは、これらのモデルが高品質な音声制作を民主化し、ポッドキャスティング、ゲーム開発、映画ポストプロダクションに強力なAI支援を提供すると指摘している。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
本日、アリババ統一ラボ音声チームは画期的な音声生成モデル「Fun-CosyVoice3.5」と「Fun-AudioGen-VD」を発表しました。これらのモデルの最大の特徴は「フリースタイル」コマンドのサポートです。複雑なパラメータ調整の代わりに、ユーザーは自然な言語記述を用いて声の表現スタイルを精密に制御したり、複雑な音声シーンを一から構築したりできます。

各モデルは異なる目的を果たします:
Fun-CosyVoice3.5:多言語再現と微細制御
CosyVoiceの強化版である本モデルは、音声表現のニュアンス理解において中核的なブレークスルーを達成。
コマンド駆動型生成:ユーザーは「より自信を持って話す」「感情の変化を伴いながらゆっくり話す」などの指示を入力し、リアルタイムで音声調整が可能です。
言語拡張:タイ語、インドネシア語、ポルトガル語、ベトナム語のサポートを追加し、13言語にわたる業界トップクラスの文字起こし精度(WER)と音声類似性を維持。
特殊文字最適化:特殊文字の誤認識率を15.2%から5.3%に低減。
パフォーマンス向上:ファーストパケット遅延が35%短縮され、リアルタイム操作の滑らかさが大幅に向上。
Fun-AudioGen-VD:包括的なサウンドデザイン
このモデルは「オーディオディレクター」として機能し、「キャラクター+環境」を統合したオーディオを生成します。
音声カスタマイズ:性別、年齢、アクセント、および「嗄れた声、低い声、低音」などの詳細な特性を指定可能。
感情とロールプレイ:カスタマーサービス担当者、放送局アナウンサー、子供などの役割をシミュレートし、「外見は平静だが内面は緊張している」といった複雑な状態も表現可能。
没入型環境:背景音(戦場の喧騒、カフェのざわめき)や空間効果(大聖堂のリバーブ、水中音響)を追加し、完全な空間シミュレーションを実現。
同義ラボは、これらのモデルが高品質な音声制作を民主化し、ポッドキャスティング、ゲーム開発、映画ポストプロダクションに強力なAI支援を提供すると指摘している。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






