Heim
Das Open-Source-TTS-Modell „OmniVoice“ von Xiaomi ermöglicht Zero-Shot-Klonen in über 600 Sprachen
Vor kurzem hat das Kaldi-Team der nächsten Generation (k2-fsa) bei Xiaomi „OmniVoice“ offiziell als Open-Source-Projekt veröffentlicht – ein umfangreiches, mehrsprachiges Zero-Shot-Text-to-Speech-Modell, das über 600 Sprachen unterstützt. Es erzielt in mehreren wichtigen Benchmarks für die chinesische, englische und mehrsprachige Sprachsynthese Ergebnisse auf dem neuesten Stand der Technik und markiert damit einen bedeutenden Durchbruch auf diesem Gebiet.
Führende Leistung: Chinesische WER von nur 0,84 %, übertrifft Mainstream-Modelle in mehrsprachigen Tests
Im Seed-TTS-Testset für Chinesisch erreicht OmniVoice eine bemerkenswert niedrige Wortfehlerrate (WER) von nur 0,84 %. In mehrsprachigen Bewertungen übertreffen seine Ähnlichkeits- (SIM-o) und WER-Werte bekannte kommerzielle Modelle wie ElevenLabs v2 und MiniMax und zeugen von außergewöhnlicher Sprachnatürlichkeit und Klarheit.

Ultraschnelle Inferenz: RTF von nur 0,025, 40-mal schneller als in Echtzeit
OmniVoice weist einen Echtzeitfaktor (RTF) von nur 0,025 auf, was bedeutet, dass seine Synthese-Geschwindigkeit die Echtzeitanforderungen bei weitem übertrifft. Dieser enorme Effizienzgewinn ermöglicht die schnelle Erzeugung langer Sprachaufnahmen in praktischen Anwendungen und verbessert das Benutzererlebnis erheblich.
Innovative Kernarchitektur: Diskretes, nicht-autoregressives Design, inspiriert von Diffusionsmodellen
OmniVoice nutzt eine neuartige diskrete, nicht-autoregressive Architektur, die von Diffusions-Sprachmodellen inspiriert ist. Es generiert Sprache aus Text in einem einzigen Schritt und umgeht dabei traditionelle semantische Zwischentoken. Dieses optimierte Design vereinfacht die Pipeline und gewährleistet gleichzeitig eine hohe Ausgabequalität. Eine Strategie der vollständigen zufälligen Maskierung des Codebuchs in Kombination mit der Initialisierung durch vortrainierte LLMs steigert die Trainingseffizienz zusätzlich und verbessert die Klarheit und Verständlichkeit der endgültigen Sprache.
Flexibles Klonen und Anpassen von Stimmen: Funktioniert mit nur 3–10 Sekunden Audio
Das Modell unterstützt hochwertiges Zero-Shot-Stimmklonen unter Verwendung von nur 3–10 Sekunden Referenzaudio. Benutzer können Stimmattribute auch über natürliche Sprachbefehle anpassen und dabei Geschlecht, Alter, Tonhöhe, Akzent, Dialekt und sogar Spezialeffekte wie Flüstern festlegen.
Verarbeitet nicht-linguistische Symbole und ermöglicht eine fein abgestimmte Aussprachekontrolle
OmniVoice kann nicht-sprachliche Symbole wie [Lachen] verarbeiten und unterstützt die Aussprachekorrektur über Pinyin oder phonetische Symbole. Dadurch eignet es sich besonders gut für die präzise Synthese in Chinesisch und verschiedenen Dialekten.
Unterstützung für über 600 Sprachen: Beitrag zur digitalen Erhaltung von Minderheiten- und bedrohten Sprachen
Ein wesentliches Highlight von OmniVoice ist seine umfassende Sprachabdeckung, die sowohl große als auch zahlreiche Sprachen mit geringen Ressourcen effizient unterstützt. Für Minderheiten- und bedrohte Sprachen kann es mit minimalen Datenmengen hochwertige Sprache generieren und bietet damit ein erhebliches Potenzial für die digitale Sprachbewahrung und den Schutz der Kultur.
Der Code und die vortrainierten Modelle von OmniVoice sind nun auf GitHub und Hugging Face als Open Source verfügbar, sodass Entwickler sie lokal bereitstellen oder in Anwendungen integrieren können. AIbase wird das Feedback der Community und Anwendungsfälle aus der Praxis weiterhin beobachten. Entwickler sind herzlich eingeladen, ihre Erfahrungen zu teilen.
Projekt-Link: https://github.com/k2-fsa/OmniVoice
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Vor kurzem hat das Kaldi-Team der nächsten Generation (k2-fsa) bei Xiaomi „OmniVoice“ offiziell als Open-Source-Projekt veröffentlicht – ein umfangreiches, mehrsprachiges Zero-Shot-Text-to-Speech-Modell, das über 600 Sprachen unterstützt. Es erzielt in mehreren wichtigen Benchmarks für die chinesische, englische und mehrsprachige Sprachsynthese Ergebnisse auf dem neuesten Stand der Technik und markiert damit einen bedeutenden Durchbruch auf diesem Gebiet.
Führende Leistung: Chinesische WER von nur 0,84 %, übertrifft Mainstream-Modelle in mehrsprachigen Tests
Im Seed-TTS-Testset für Chinesisch erreicht OmniVoice eine bemerkenswert niedrige Wortfehlerrate (WER) von nur 0,84 %. In mehrsprachigen Bewertungen übertreffen seine Ähnlichkeits- (SIM-o) und WER-Werte bekannte kommerzielle Modelle wie ElevenLabs v2 und MiniMax und zeugen von außergewöhnlicher Sprachnatürlichkeit und Klarheit.

Ultraschnelle Inferenz: RTF von nur 0,025, 40-mal schneller als in Echtzeit
OmniVoice weist einen Echtzeitfaktor (RTF) von nur 0,025 auf, was bedeutet, dass seine Synthese-Geschwindigkeit die Echtzeitanforderungen bei weitem übertrifft. Dieser enorme Effizienzgewinn ermöglicht die schnelle Erzeugung langer Sprachaufnahmen in praktischen Anwendungen und verbessert das Benutzererlebnis erheblich.
Innovative Kernarchitektur: Diskretes, nicht-autoregressives Design, inspiriert von Diffusionsmodellen
OmniVoice nutzt eine neuartige diskrete, nicht-autoregressive Architektur, die von Diffusions-Sprachmodellen inspiriert ist. Es generiert Sprache aus Text in einem einzigen Schritt und umgeht dabei traditionelle semantische Zwischentoken. Dieses optimierte Design vereinfacht die Pipeline und gewährleistet gleichzeitig eine hohe Ausgabequalität. Eine Strategie der vollständigen zufälligen Maskierung des Codebuchs in Kombination mit der Initialisierung durch vortrainierte LLMs steigert die Trainingseffizienz zusätzlich und verbessert die Klarheit und Verständlichkeit der endgültigen Sprache.
Flexibles Klonen und Anpassen von Stimmen: Funktioniert mit nur 3–10 Sekunden Audio
Das Modell unterstützt hochwertiges Zero-Shot-Stimmklonen unter Verwendung von nur 3–10 Sekunden Referenzaudio. Benutzer können Stimmattribute auch über natürliche Sprachbefehle anpassen und dabei Geschlecht, Alter, Tonhöhe, Akzent, Dialekt und sogar Spezialeffekte wie Flüstern festlegen.
Verarbeitet nicht-linguistische Symbole und ermöglicht eine fein abgestimmte Aussprachekontrolle
OmniVoice kann nicht-sprachliche Symbole wie [Lachen] verarbeiten und unterstützt die Aussprachekorrektur über Pinyin oder phonetische Symbole. Dadurch eignet es sich besonders gut für die präzise Synthese in Chinesisch und verschiedenen Dialekten.
Unterstützung für über 600 Sprachen: Beitrag zur digitalen Erhaltung von Minderheiten- und bedrohten Sprachen
Ein wesentliches Highlight von OmniVoice ist seine umfassende Sprachabdeckung, die sowohl große als auch zahlreiche Sprachen mit geringen Ressourcen effizient unterstützt. Für Minderheiten- und bedrohte Sprachen kann es mit minimalen Datenmengen hochwertige Sprache generieren und bietet damit ein erhebliches Potenzial für die digitale Sprachbewahrung und den Schutz der Kultur.
Der Code und die vortrainierten Modelle von OmniVoice sind nun auf GitHub und Hugging Face als Open Source verfügbar, sodass Entwickler sie lokal bereitstellen oder in Anwendungen integrieren können. AIbase wird das Feedback der Community und Anwendungsfälle aus der Praxis weiterhin beobachten. Entwickler sind herzlich eingeladen, ihre Erfahrungen zu teilen.
Projekt-Link: https://github.com/k2-fsa/OmniVoice
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











