「Tongyi Qianwen Qwen-Audio-3.0-TTS」が、初回パケット遅延300ミリ秒、20の方言に対応してサービス開始
アリババのQwenチームは、新しいリアルタイム音声合成モデル「Qwen-Audio-3.0-TTS」をリリースし、音声合成を単なる生成から真の表現へと進化させました。 Plusバージョンは、Artificial Analysisが提供する権威あるベンチマーク「Speech Arena」において世界1位を獲得し、Gemini 3.1 TTSやElevenLabs v3をはじめとする主要モデルを上回る性能を示しています。

2つのバージョンが利用可能です。「Flash」バージョンはリアルタイムの対話に対応し、初期レイテンシは約300msで、スマートアシスタントやその他の低レイテンシが求められるユースケースに最適です。「Plus」バージョンは高品質な生成を優先し、自然さと声の類似性を向上させています。
中核機能における4つの重要なブレークスルー:
第一に、多言語および方言のサポートが16言語に拡大され、Plusバージョンでは全16言語において平均82.75%の話し手類似度を達成しており、これは業界最高水準です。また、20の中国方言をカバーしており、方言の特徴を弱めることなく忠実に再現することで、よりネイティブに近い表現を実現しています。
第二に、柔軟な自然言語による指示機能により、ユーザーは「丁寧なカスタマーサービスの口調」や「ライブ配信の司会者スタイル」といったプロンプトを使って、専門的なアノテーションを必要とせずに正確な音声を生成できます。
第三に、きめ細かなタグ制御により、[gasp]や[angry]といった構造化されたタグをサポートし、呼吸や笑い声といった非言語的な詳細を精密に管理できます。これはゲームやオーディオブック、および同様のシナリオに適しています。
第四に、優れた音響的堅牢性を備えています。参照音声に高いノイズや残響が含まれていても、モデルは音声品質を維持しつつ背景ノイズを自動的に除去し、安定した合成出力を保証します。
付属のプレミアム音声ライブラリには、指示音声、方言、あまり使われない言語など、さまざまな音声タイプが含まれており、48Kの高解像度音声出力に対応(7月24日に公開予定)し、1回のセッションで最大3分間の長文を合成可能です。 このモデルは現在、Alibaba Cloud BaiLianプラットフォームで全面的に利用可能となっており、開発者はアクセスして試用することができ、音声インタラクションに新たな可能性を切り開いています。

関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (0)
0/500
アリババのQwenチームは、新しいリアルタイム音声合成モデル「Qwen-Audio-3.0-TTS」をリリースし、音声合成を単なる生成から真の表現へと進化させました。 Plusバージョンは、Artificial Analysisが提供する権威あるベンチマーク「Speech Arena」において世界1位を獲得し、Gemini 3.1 TTSやElevenLabs v3をはじめとする主要モデルを上回る性能を示しています。

2つのバージョンが利用可能です。「Flash」バージョンはリアルタイムの対話に対応し、初期レイテンシは約300msで、スマートアシスタントやその他の低レイテンシが求められるユースケースに最適です。「Plus」バージョンは高品質な生成を優先し、自然さと声の類似性を向上させています。
中核機能における4つの重要なブレークスルー:
第一に、多言語および方言のサポートが16言語に拡大され、Plusバージョンでは全16言語において平均82.75%の話し手類似度を達成しており、これは業界最高水準です。また、20の中国方言をカバーしており、方言の特徴を弱めることなく忠実に再現することで、よりネイティブに近い表現を実現しています。
第二に、柔軟な自然言語による指示機能により、ユーザーは「丁寧なカスタマーサービスの口調」や「ライブ配信の司会者スタイル」といったプロンプトを使って、専門的なアノテーションを必要とせずに正確な音声を生成できます。
第三に、きめ細かなタグ制御により、[gasp]や[angry]といった構造化されたタグをサポートし、呼吸や笑い声といった非言語的な詳細を精密に管理できます。これはゲームやオーディオブック、および同様のシナリオに適しています。
第四に、優れた音響的堅牢性を備えています。参照音声に高いノイズや残響が含まれていても、モデルは音声品質を維持しつつ背景ノイズを自動的に除去し、安定した合成出力を保証します。
付属のプレミアム音声ライブラリには、指示音声、方言、あまり使われない言語など、さまざまな音声タイプが含まれており、48Kの高解像度音声出力に対応(7月24日に公開予定)し、1回のセッションで最大3分間の長文を合成可能です。 このモデルは現在、Alibaba Cloud BaiLianプラットフォームで全面的に利用可能となっており、開発者はアクセスして試用することができ、音声インタラクションに新たな可能性を切り開いています。

ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






