Heim
Alibaba Tongyi stellt Sprachmodell mit „FreeStyle”-Steuerung in natürlicher Sprache vor
Heute stellte das Speech Team von Alibaba Tongyi Lab zwei bahnbrechende Sprachgenerierungsmodelle vor: Fun-CosyVoice3.5 und Fun-AudioGen-VD. Das herausragende Merkmal dieser Modelle ist ihre Unterstützung für „FreeStyle”-Befehle. Anstelle komplexer Parametereinstellungen können Benutzer mit einfachen Beschreibungen in natürlicher Sprache den Ausdruck der Stimme präzise steuern oder komplexe Audioszenen von Grund auf neu erstellen.

Jedes Modell dient unterschiedlichen Zwecken:
Fun-CosyVoice3.5: Mehrsprachige Replikation und fein abgestimmte Steuerung
Diese verbesserte Version von CosyVoice erzielt grundlegende Durchbrüche beim Verständnis der Nuancen des Sprachausdrucks.
Befehlgesteuerte Generierung: Benutzer können Anweisungen wie „sprich selbstbewusster” oder „verlangsame mit emotionaler Variation” eingeben, um die Stimme in Echtzeit anzupassen.
Spracherweiterung: Durch die zusätzliche Unterstützung für Thai, Indonesisch, Portugiesisch und Vietnamesisch bleibt die branchenführende Leistung in Bezug auf Transkriptionsgenauigkeit (WER) und Stimmähnlichkeit in 13 Sprachen erhalten.
Optimierung seltener Zeichen: Durch spezielles Training wurde die Fehlerquote für ungewöhnliche Zeichen von 15,2 % auf 5,3 %reduziert.
Leistungssteigerung: Die Latenz des ersten Pakets wurde um 35 % verringert, was die Flüssigkeit der Echtzeit-Interaktion erheblich verbessert.
Fun-AudioGen-VD: Umfassendes Sounddesign
Dieses Modell fungiert als „Audio-Regisseur“ und erzeugt integrierte Audiodaten, die „Charaktere + Umgebungen“ kombinieren.
Stimmenanpassung: Legen Sie Geschlecht, Alter, Akzent und detaillierte Eigenschaften wie „heisere, tiefe oder tiefe” Stimmen fest.
Emotionen und Rollenspiel: Simuliert Rollen wie Kundendienstmitarbeiter, Rundfunksprecher und Kinder und vermittelt sogar komplexe Zustände wie „äußerlich ruhig, innerlich angespannt“.
Immersive Umgebungen: Fügt Hintergrundgeräusche (Chaos auf dem Schlachtfeld, Gemurmel im Café) und räumliche Effekte (Kathedralenhall, Unterwasserakustik) für eine vollständige räumliche Simulation hinzu.
Tongyi Lab merkt an, dass diese Modelle die Erstellung hochwertiger Stimmen demokratisieren und leistungsstarke KI-Unterstützung für Podcasting, Spieleentwicklung und Film-Postproduktion bieten werden.
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Heute stellte das Speech Team von Alibaba Tongyi Lab zwei bahnbrechende Sprachgenerierungsmodelle vor: Fun-CosyVoice3.5 und Fun-AudioGen-VD. Das herausragende Merkmal dieser Modelle ist ihre Unterstützung für „FreeStyle”-Befehle. Anstelle komplexer Parametereinstellungen können Benutzer mit einfachen Beschreibungen in natürlicher Sprache den Ausdruck der Stimme präzise steuern oder komplexe Audioszenen von Grund auf neu erstellen.

Jedes Modell dient unterschiedlichen Zwecken:
Fun-CosyVoice3.5: Mehrsprachige Replikation und fein abgestimmte Steuerung
Diese verbesserte Version von CosyVoice erzielt grundlegende Durchbrüche beim Verständnis der Nuancen des Sprachausdrucks.
Befehlgesteuerte Generierung: Benutzer können Anweisungen wie „sprich selbstbewusster” oder „verlangsame mit emotionaler Variation” eingeben, um die Stimme in Echtzeit anzupassen.
Spracherweiterung: Durch die zusätzliche Unterstützung für Thai, Indonesisch, Portugiesisch und Vietnamesisch bleibt die branchenführende Leistung in Bezug auf Transkriptionsgenauigkeit (WER) und Stimmähnlichkeit in 13 Sprachen erhalten.
Optimierung seltener Zeichen: Durch spezielles Training wurde die Fehlerquote für ungewöhnliche Zeichen von 15,2 % auf 5,3 %reduziert.
Leistungssteigerung: Die Latenz des ersten Pakets wurde um 35 % verringert, was die Flüssigkeit der Echtzeit-Interaktion erheblich verbessert.
Fun-AudioGen-VD: Umfassendes Sounddesign
Dieses Modell fungiert als „Audio-Regisseur“ und erzeugt integrierte Audiodaten, die „Charaktere + Umgebungen“ kombinieren.
Stimmenanpassung: Legen Sie Geschlecht, Alter, Akzent und detaillierte Eigenschaften wie „heisere, tiefe oder tiefe” Stimmen fest.
Emotionen und Rollenspiel: Simuliert Rollen wie Kundendienstmitarbeiter, Rundfunksprecher und Kinder und vermittelt sogar komplexe Zustände wie „äußerlich ruhig, innerlich angespannt“.
Immersive Umgebungen: Fügt Hintergrundgeräusche (Chaos auf dem Schlachtfeld, Gemurmel im Café) und räumliche Effekte (Kathedralenhall, Unterwasserakustik) für eine vollständige räumliche Simulation hinzu.
Tongyi Lab merkt an, dass diese Modelle die Erstellung hochwertiger Stimmen demokratisieren und leistungsstarke KI-Unterstützung für Podcasting, Spieleentwicklung und Film-Postproduktion bieten werden.
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











