Heim
Das Open-Source-Audiomodell von Meituan setzt neue Maßstäbe im Bereich der Stimmklonung
Die Audioerzeugung erlebt derzeit einen grundlegenden Wandel von mehrstufigen Kaskadenarchitekturen hin zu End-to-End-Modellen. Um den Informationsverlust und die Fehlerakkumulation zu überwinden, die der traditionellen Zwischenrepräsentation „Mel-Spektrogramm“ in TTS-Systemen innewohnen, hat das Meituan LongCat-Team LongCat-AudioDiT offiziell veröffentlicht und als Open-Source-Projekt zur Verfügung gestellt (erhältlich in Versionen mit 1 Mrd. und 3,5 Mrd. Parametern). Dieses Modell übertrifft erfolgreich bisherige Leistungsgrenzen beim Zero-Shot-Stimmklonen durch direkte Modellierung des latenten Raums der Wellenform.

Kernarchitektur: Über Mel-Spektrogramme hinaus
LongCat-AudioDiT verzichtet auf die herkömmliche mehrstufige Pipeline aus „akustischer Merkmalsvorhersage + neuronalem Vocoder“ und etabliert stattdessen eine optimierte Minimalarchitektur, die auf einem Wav-VAE (Waveform Variational Autoencoder) und einem DiT (Diffusion Transformer) basiert.
Effizientes Wav-VAE: Unter Verwendung eines vollständig konvolutionellen Designs komprimiert es 24-kHz-Wellenformen um den Faktor 2000 auf eine Bildrate von 11,7 Hz. Durch nicht-parametrische Shortcut-Verzweigungen und multiobjektives adversariales Training stellt es sicher, dass die rekonstruierte Wellenform eine präzise Zeit-Frequenz-Struktur beibehält und gleichzeitig eine hervorragende, natürliche Hörqualität liefert.
Semantisch erweitertes DiT: Das Modell verbindet auf innovative Weise die ursprünglichen Wort-Embeddings aus dem UMT5-Text-Encoder mit seinen obersten versteckten Zuständen. Dies gleicht phonetische Details aus, die in hochrangigen semantischen Darstellungen verloren gehen, und verbessert die Verständlichkeit der generierten Sprache erheblich.
Inferenzoptimierung: Präzise Korrektur von Stimmabweichungen
Um die Generierungsqualität weiter zu verbessern, implementierte das Team zwei entscheidende technische Verfeinerungen:
Dualer Beschränkungsmechanismus: Diese Technik identifiziert und behebt das anhaltende Problem der „Diskrepanz zwischen Training und Inferenz“ bei der flussangepassten TTS. Durch das erzwungene Zurücksetzen der latenten Variablen im Prompt-Bereich während der Inferenz werden Probleme wie Stimmdrift und Instabilität des Sprechers vollständig gelöst.
Adaptive Projection Guidance (APG): APG ersetzt die traditionelle classifier-free guidance (CFG). Es kann nützliche Komponenten innerhalb des Führungssignals präzise herausfiltern und gleichzeitig Komponenten unterdrücken, die zu einer Verschlechterung der Audioqualität führen, wodurch die Natürlichkeit der Sprache erheblich verbessert wird, ohne eine spektrale „Übersättigung“ zu verursachen.
Leistung: Klon-Genauigkeit auf SOTA-Niveau
In Benchmark-Tests auf dem Seed-Datensatz zeigt LongCat-AudioDiT eine überragende Leistung:
Ähnlichkeit (SIM): Das 3,5-Milliarden-Modell erzielte einen Wert von 0,818 im Seed-ZH-Testsatz und 0,797 im anspruchsvollen Seed-Hard-Satz, womit es namhafte Modelle wie Seed-TTS, CosyVoice3.5 und MiniMax-Speech übertraf.
Genauigkeit: Es zählt zu den branchenweit leistungsstärksten Modellen in allen wichtigen Metriken, darunter ein englischer WER von 1,50 % und ein chinesischer CER für schwierige Sätze von 6,04 %.
Bemerkenswert ist, dass LongCat-AudioDiT im Vergleich zu mehrstufig trainierten Modellen überlegene Ergebnisse erzielt, obwohl es nur ein einstufiges Training auf vorverarbeiteten ASR-Transkriptionsdaten verwendet. Die dazugehörige Forschungsarbeit, der Quellcode und die Modellgewichte sind nun vollständig als Open Source auf GitHub und HuggingFace verfügbar.
Projekt-Links:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
Die Audioerzeugung erlebt derzeit einen grundlegenden Wandel von mehrstufigen Kaskadenarchitekturen hin zu End-to-End-Modellen. Um den Informationsverlust und die Fehlerakkumulation zu überwinden, die der traditionellen Zwischenrepräsentation „Mel-Spektrogramm“ in TTS-Systemen innewohnen, hat das Meituan LongCat-Team LongCat-AudioDiT offiziell veröffentlicht und als Open-Source-Projekt zur Verfügung gestellt (erhältlich in Versionen mit 1 Mrd. und 3,5 Mrd. Parametern). Dieses Modell übertrifft erfolgreich bisherige Leistungsgrenzen beim Zero-Shot-Stimmklonen durch direkte Modellierung des latenten Raums der Wellenform.

Kernarchitektur: Über Mel-Spektrogramme hinaus
LongCat-AudioDiT verzichtet auf die herkömmliche mehrstufige Pipeline aus „akustischer Merkmalsvorhersage + neuronalem Vocoder“ und etabliert stattdessen eine optimierte Minimalarchitektur, die auf einem Wav-VAE (Waveform Variational Autoencoder) und einem DiT (Diffusion Transformer) basiert.
Effizientes Wav-VAE: Unter Verwendung eines vollständig konvolutionellen Designs komprimiert es 24-kHz-Wellenformen um den Faktor 2000 auf eine Bildrate von 11,7 Hz. Durch nicht-parametrische Shortcut-Verzweigungen und multiobjektives adversariales Training stellt es sicher, dass die rekonstruierte Wellenform eine präzise Zeit-Frequenz-Struktur beibehält und gleichzeitig eine hervorragende, natürliche Hörqualität liefert.
Semantisch erweitertes DiT: Das Modell verbindet auf innovative Weise die ursprünglichen Wort-Embeddings aus dem UMT5-Text-Encoder mit seinen obersten versteckten Zuständen. Dies gleicht phonetische Details aus, die in hochrangigen semantischen Darstellungen verloren gehen, und verbessert die Verständlichkeit der generierten Sprache erheblich.
Inferenzoptimierung: Präzise Korrektur von Stimmabweichungen
Um die Generierungsqualität weiter zu verbessern, implementierte das Team zwei entscheidende technische Verfeinerungen:
Dualer Beschränkungsmechanismus: Diese Technik identifiziert und behebt das anhaltende Problem der „Diskrepanz zwischen Training und Inferenz“ bei der flussangepassten TTS. Durch das erzwungene Zurücksetzen der latenten Variablen im Prompt-Bereich während der Inferenz werden Probleme wie Stimmdrift und Instabilität des Sprechers vollständig gelöst.
Adaptive Projection Guidance (APG): APG ersetzt die traditionelle classifier-free guidance (CFG). Es kann nützliche Komponenten innerhalb des Führungssignals präzise herausfiltern und gleichzeitig Komponenten unterdrücken, die zu einer Verschlechterung der Audioqualität führen, wodurch die Natürlichkeit der Sprache erheblich verbessert wird, ohne eine spektrale „Übersättigung“ zu verursachen.
Leistung: Klon-Genauigkeit auf SOTA-Niveau
In Benchmark-Tests auf dem Seed-Datensatz zeigt LongCat-AudioDiT eine überragende Leistung:
Ähnlichkeit (SIM): Das 3,5-Milliarden-Modell erzielte einen Wert von 0,818 im Seed-ZH-Testsatz und 0,797 im anspruchsvollen Seed-Hard-Satz, womit es namhafte Modelle wie Seed-TTS, CosyVoice3.5 und MiniMax-Speech übertraf.
Genauigkeit: Es zählt zu den branchenweit leistungsstärksten Modellen in allen wichtigen Metriken, darunter ein englischer WER von 1,50 % und ein chinesischer CER für schwierige Sätze von 6,04 %.
Bemerkenswert ist, dass LongCat-AudioDiT im Vergleich zu mehrstufig trainierten Modellen überlegene Ergebnisse erzielt, obwohl es nur ein einstufiges Training auf vorverarbeiteten ASR-Transkriptionsdaten verwendet. Die dazugehörige Forschungsarbeit, der Quellcode und die Modellgewichte sind nun vollständig als Open Source auf GitHub und HuggingFace verfügbar.
Projekt-Links:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











