Heim
Tongyi Qianwen Qwen-Audio-3.0-TTS geht mit einer Verzögerung des ersten Pakets von 300 ms und 20 Dialekten in Betrieb
Das Alibaba-Qwen-Team hat das neue Echtzeit-Sprachsynthese-Modell „Qwen-Audio-3.0-TTS“ vorgestellt, das die Sprachsynthese von der einfachen Erzeugung hin zu echtem Ausdruck weiterentwickelt. Die Plus-Version belegt nun weltweit den ersten Platz in der „Speech Arena“, einem angesehenen Benchmark von Artificial Analysis, und übertrifft damit Gemini 3.1 TTS, ElevenLabs v3 und andere führende Modelle.

Es stehen zwei Versionen zur Verfügung: Die Flash-Version zielt auf Echtzeit-Interaktion mit einer anfänglichen Latenz von etwa 300 ms ab und eignet sich ideal für Smart-Assistenten und andere Anwendungsfälle mit geringer Latenz; die Plus-Version legt den Schwerpunkt auf eine hochwertige Sprachausgabe und bietet eine verbesserte Natürlichkeit sowie eine höhere Stimmähnlichkeit.
Vier wesentliche Durchbrüche bei den Kernfunktionen:
Erstens wurde die Unterstützung für mehrere Sprachen und Dialekte auf 16 Sprachen erweitert, wobei die Plus-Version über alle 16 Sprachen hinweg eine durchschnittliche Sprecherähnlichkeit von 82,75 % erreicht – der branchenweit höchste Wert. Sie deckt zudem 20 chinesische Dialekte ab und bewahrt dabei authentische Dialektmerkmale, anstatt sie zu verwässern, was zu muttersprachlicheren Äußerungen führt.
Zweitens ermöglichen flexible Anweisungen in natürlicher Sprache den Nutzern, präzise Sprachausgaben mit Vorgaben wie „sanfter Kundenservice-Tonfall“ oder „Live-Streaming-Moderator-Stil“ zu generieren, ohne dass professionelle Annotationen erforderlich sind.
Drittens unterstützt die fein abgestufte Tag-Steuerung strukturierte Tags wie [gasp] und [angry], was eine präzise Steuerung nonverbaler Details wie Atmung und Lachen ermöglicht – geeignet für Spiele, Hörbücher und ähnliche Szenarien.
Viertens: hohe akustische Robustheit: Selbst wenn das Referenzaudio starkes Rauschen oder Nachhall enthält, filtert das Modell Hintergrundgeräusche automatisch heraus und bewahrt dabei die Sprachqualität, wodurch eine stabile Syntheseausgabe gewährleistet wird.
Die dazugehörige Premium-Stimmenbibliothek umfasst verschiedene Stimmtypen – Anweisungen, Dialekte und seltener verwendete Sprachen –, unterstützt eine hochauflösende Audioausgabe mit 48K (voraussichtlich ab dem 24. Juli verfügbar) und kann pro Sitzung bis zu 3 Minuten langen Text synthetisieren. Das Modell ist ab sofort vollständig auf der Alibaba Cloud BaiLian-Plattform verfügbar, wo Entwickler darauf zugreifen und es ausprobieren können, was neue Möglichkeiten im Bereich der Sprachinteraktion eröffnet.

Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Das Alibaba-Qwen-Team hat das neue Echtzeit-Sprachsynthese-Modell „Qwen-Audio-3.0-TTS“ vorgestellt, das die Sprachsynthese von der einfachen Erzeugung hin zu echtem Ausdruck weiterentwickelt. Die Plus-Version belegt nun weltweit den ersten Platz in der „Speech Arena“, einem angesehenen Benchmark von Artificial Analysis, und übertrifft damit Gemini 3.1 TTS, ElevenLabs v3 und andere führende Modelle.

Es stehen zwei Versionen zur Verfügung: Die Flash-Version zielt auf Echtzeit-Interaktion mit einer anfänglichen Latenz von etwa 300 ms ab und eignet sich ideal für Smart-Assistenten und andere Anwendungsfälle mit geringer Latenz; die Plus-Version legt den Schwerpunkt auf eine hochwertige Sprachausgabe und bietet eine verbesserte Natürlichkeit sowie eine höhere Stimmähnlichkeit.
Vier wesentliche Durchbrüche bei den Kernfunktionen:
Erstens wurde die Unterstützung für mehrere Sprachen und Dialekte auf 16 Sprachen erweitert, wobei die Plus-Version über alle 16 Sprachen hinweg eine durchschnittliche Sprecherähnlichkeit von 82,75 % erreicht – der branchenweit höchste Wert. Sie deckt zudem 20 chinesische Dialekte ab und bewahrt dabei authentische Dialektmerkmale, anstatt sie zu verwässern, was zu muttersprachlicheren Äußerungen führt.
Zweitens ermöglichen flexible Anweisungen in natürlicher Sprache den Nutzern, präzise Sprachausgaben mit Vorgaben wie „sanfter Kundenservice-Tonfall“ oder „Live-Streaming-Moderator-Stil“ zu generieren, ohne dass professionelle Annotationen erforderlich sind.
Drittens unterstützt die fein abgestufte Tag-Steuerung strukturierte Tags wie [gasp] und [angry], was eine präzise Steuerung nonverbaler Details wie Atmung und Lachen ermöglicht – geeignet für Spiele, Hörbücher und ähnliche Szenarien.
Viertens: hohe akustische Robustheit: Selbst wenn das Referenzaudio starkes Rauschen oder Nachhall enthält, filtert das Modell Hintergrundgeräusche automatisch heraus und bewahrt dabei die Sprachqualität, wodurch eine stabile Syntheseausgabe gewährleistet wird.
Die dazugehörige Premium-Stimmenbibliothek umfasst verschiedene Stimmtypen – Anweisungen, Dialekte und seltener verwendete Sprachen –, unterstützt eine hochauflösende Audioausgabe mit 48K (voraussichtlich ab dem 24. Juli verfügbar) und kann pro Sitzung bis zu 3 Minuten langen Text synthetisieren. Das Modell ist ab sofort vollständig auf der Alibaba Cloud BaiLian-Plattform verfügbar, wo Entwickler darauf zugreifen und es ausprobieren können, was neue Möglichkeiten im Bereich der Sprachinteraktion eröffnet.

U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











