Option
Heim
Nachricht
Das Open-Source-Audiomodell von Meituan setzt neue Maßstäbe im Bereich der Stimmklonung

Das Open-Source-Audiomodell von Meituan setzt neue Maßstäbe im Bereich der Stimmklonung

6. April 2026
319

Die Audioerzeugung erlebt derzeit einen grundlegenden Wandel von mehrstufigen Kaskadenarchitekturen hin zu End-to-End-Modellen. Um den Informationsverlust und die Fehlerakkumulation zu überwinden, die der traditionellen Zwischenrepräsentation „Mel-Spektrogramm“ in TTS-Systemen innewohnen, hat das Meituan LongCat-Team LongCat-AudioDiT offiziell veröffentlicht und als Open-Source-Projekt zur Verfügung gestellt (erhältlich in Versionen mit 1 Mrd. und 3,5 Mrd. Parametern). Dieses Modell übertrifft erfolgreich bisherige Leistungsgrenzen beim Zero-Shot-Stimmklonen durch direkte Modellierung des latenten Raums der Wellenform.

QQ20260402-101320.jpg

Kernarchitektur: Über Mel-Spektrogramme hinaus

LongCat-AudioDiT verzichtet auf die herkömmliche mehrstufige Pipeline aus „akustischer Merkmalsvorhersage + neuronalem Vocoder“ und etabliert stattdessen eine optimierte Minimalarchitektur, die auf einem Wav-VAE (Waveform Variational Autoencoder) und einem DiT (Diffusion Transformer) basiert.

Effizientes Wav-VAE: Unter Verwendung eines vollständig konvolutionellen Designs komprimiert es 24-kHz-Wellenformen um den Faktor 2000 auf eine Bildrate von 11,7 Hz. Durch nicht-parametrische Shortcut-Verzweigungen und multiobjektives adversariales Training stellt es sicher, dass die rekonstruierte Wellenform eine präzise Zeit-Frequenz-Struktur beibehält und gleichzeitig eine hervorragende, natürliche Hörqualität liefert.

Semantisch erweitertes DiT: Das Modell verbindet auf innovative Weise die ursprünglichen Wort-Embeddings aus dem UMT5-Text-Encoder mit seinen obersten versteckten Zuständen. Dies gleicht phonetische Details aus, die in hochrangigen semantischen Darstellungen verloren gehen, und verbessert die Verständlichkeit der generierten Sprache erheblich.

Inferenzoptimierung: Präzise Korrektur von Stimmabweichungen

Um die Generierungsqualität weiter zu verbessern, implementierte das Team zwei entscheidende technische Verfeinerungen:

Dualer Beschränkungsmechanismus: Diese Technik identifiziert und behebt das anhaltende Problem der „Diskrepanz zwischen Training und Inferenz“ bei der flussangepassten TTS. Durch das erzwungene Zurücksetzen der latenten Variablen im Prompt-Bereich während der Inferenz werden Probleme wie Stimmdrift und Instabilität des Sprechers vollständig gelöst.

Adaptive Projection Guidance (APG): APG ersetzt die traditionelle classifier-free guidance (CFG). Es kann nützliche Komponenten innerhalb des Führungssignals präzise herausfiltern und gleichzeitig Komponenten unterdrücken, die zu einer Verschlechterung der Audioqualität führen, wodurch die Natürlichkeit der Sprache erheblich verbessert wird, ohne eine spektrale „Übersättigung“ zu verursachen.

Leistung: Klon-Genauigkeit auf SOTA-Niveau

In Benchmark-Tests auf dem Seed-Datensatz zeigt LongCat-AudioDiT eine überragende Leistung:

Ähnlichkeit (SIM): Das 3,5-Milliarden-Modell erzielte einen Wert von 0,818 im Seed-ZH-Testsatz und 0,797 im anspruchsvollen Seed-Hard-Satz, womit es namhafte Modelle wie Seed-TTS, CosyVoice3.5 und MiniMax-Speech übertraf.

Genauigkeit: Es zählt zu den branchenweit leistungsstärksten Modellen in allen wichtigen Metriken, darunter ein englischer WER von 1,50 % und ein chinesischer CER für schwierige Sätze von 6,04 %.

Bemerkenswert ist, dass LongCat-AudioDiT im Vergleich zu mehrstufig trainierten Modellen überlegene Ergebnisse erzielt, obwohl es nur ein einstufiges Training auf vorverarbeiteten ASR-Transkriptionsdaten verwendet. Die dazugehörige Forschungsarbeit, der Quellcode und die Modellgewichte sind nun vollständig als Open Source auf GitHub und HuggingFace verfügbar.

Projekt-Links:

GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT

HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT

Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Datenanalyse Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams
Die besten KI-Tools zur Erkennung von Anomalien für das KPI-Monitoring in SaaS- und E-Commerce-Teams

2026 Neueste Besten Top-bewertete KI-Anomalienerkennungstools für KPI-Monitoring in SaaS- und E-Commerce-Teams! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung basierend auf strengen realen Tests und wöchentlich aktualisierten Rankings zusammengestellt. Sie finden detaillierte kostenlose vs. kostenpflichtige Vergleichsinsights, die Ihnen helfen, die unbedingt auszuprobierende Lösung zu identifizieren, die die Produktivität steigert und Ihre KI-Vorteile freischaltet. Jetzt erkunden!

10 Tools
xix.ai
Schreiben Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln
Die besten KI-Generatoren für Gliederungen von langen SEO-Artikeln

Die besten und am besten bewerteten KI-Outline-Generatoren für lange SEO-Artikel im Jahr 2026, sorgfältig zusammengestellt von XIX.AI. Diese leistungsstarken Tools bieten bahnbrechende Unterstützung bei der schnellen Erstellung hochwertiger Inhalte und steigern die Effizienz beim Schreiben erheblich. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und detaillierte Rankings, damit Sie die für Sie passende Option finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie jetzt die Möglichkeiten und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Bildung und Lernen KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung
KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung

Die besten KI-Lernhilfen für Hausaufgaben und Prüfungsvorbereitung im Jahr 2026! XIX.AI hat eine Liste der besten leistungsstarken, bahnbrechenden Tools zusammengestellt, die Schülern helfen, ihre Produktivität zu steigern, Hausaufgaben effizienter zu erledigen und Prüfungen dank praxisnaher Tests mit Bravour zu meistern. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, detaillierte Rankings und unverzichtbare Optionen, um Ihren KI-Vorteil zu nutzen. Entdecken Sie es jetzt!

10 Tools
xix.ai
Musikkomposition KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions
KI-Stimm-Demo-Tools für Songwriter, Hooks, Toplines und mehrsprachige Entwurfs-Sessions

2026 Neueste und beste KI-Stimm-Demo-Tools für Songwriter, Hook-Ersteller und mehrsprachige Content-Teams! XIX.AI hat eine hochbewertete Liste leistungsstarker, bahnbrechender Tools zusammengestellt, die strengen Praxistests unterzogen wurden. Sie finden detaillierte Vergleichsdaten zu kostenlosen und kostenpflichtigen Optionen, umfassende Rankings und empfehlenswerte Auswahlmöglichkeiten, die Ihnen helfen, Ihre Schreibeffizienz zu steigern und Ihr kreatives Potenzial zu entfalten. Entdecken Sie jetzt das perfekte Tool für all Ihre Content-Bedürfnisse!

9 Tools
xix.ai
Geschäft Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen
Die besten KI-Tools zur Wettbewerbsanalyse für kleine Unternehmen

Die besten und am besten bewerteten KI-Tools für die Wettbewerbsanalyse für kleine Unternehmen im Jahr 2026! XIX.AI hat eine äußerst leistungsstarke, bahnbrechende Auswahl zusammengestellt, die wöchentlich anhand strenger Praxistests und detaillierter Rankings aktualisiert wird. Hier finden Sie einen umfassenden Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen dabei hilft, die unverzichtbaren Tools zu identifizieren, die Ihre Produktivität steigern und Ihnen einen Wettbewerbsvorteil verschaffen. Entdecken Sie jetzt das perfekte Tool für sich!

9 Tools
xix.ai
Bildbearbeitung Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz
Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonstanz

2026 Neueste beste Photoshop-KI-Retuschierungstools für E-Commerce-Bekleidung, Hautbereinigung und Farbkonsistenz! Diese hoch bewertete kuratierte Liste bietet leistungsstarke, bahnbrechende Lösungen, die Ihnen helfen, die Schreibeffizienz zu steigern, die Content-Erstellung zu optimieren und mühelos perfekte visuelle Ergebnisse zu erzielen. Jedes Tool wurde durch wöchentlich aktualisierte Rankings mit echten Tests geprüft, einschließlich detaillierter Vergleiche zwischen kostenlosen und kostenpflichtigen Versionen. Unterstützt von XIX.AI ist es der unverzichtbare Leitfaden für alle, die ihre KI-Vorteile nutzen möchten. Jetzt entdecken!

10 Tools
xix.ai
Kommentare (1)
0/500
FredGreen
FredGreen 25. Juni 2026 14:00:13 MESZ

Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅

OR