Heim
Tencent und Tsinghua bringen „SongGeneration 2“ mit einer Fehlerquote von 8,55 % auf den Markt und verstärken damit den Druck auf Suno
Anfang 2026 erlebte die KI-Musikbranche einen weiteren bedeutenden Wandel. Am 9. März wurde das Musik-Grundmodell „SongGeneration2“, das gemeinsam von Tencent und dem Human-Computer Speech Interaction Lab der Tsinghua-Universität entwickelt wurde, offiziell vorgestellt. Dieses Modell stellte nicht nur einen qualitativen Sprung in der technischen Architektur dar, sondern übertraf auch die derzeit gängigen Open-Source-Modelle in mehreren Kernbereichen und konnte in puncto Gesamtqualität sogar mit den besten kommerziellen Modellen mithalten.

Drei Durchbrüche: Schluss mit „plastischer“ KI-Musik
Die zentralen Vorteile von SongGeneration2 beruhen auf einer umfassenden Weiterentwicklung der zugrunde liegenden Architektur, die drei wesentliche Schwachstellen früherer KI-Musik löst:
Hohe Musikalität: Im Gegensatz zum einfachen Aneinanderreihen von Melodien bewältigt dieses Modell komplexe Mehrspur-Arrangements mit beeindruckender räumlicher Tiefe.
Hohe Textgenauigkeit: Unklare Aussprache und halluzinierte Tonhöhenverschiebungen gehören nun der Vergangenheit an. Die Phonemfehlerrate (PER) liegt bei nur 8,55 % und übertrifft damit deutlich das führende kommerzielle Modell Suno v5 (12,4 %), wobei es nur von MiniMax2.5 übertroffen wird.
Hohe Steuerbarkeit: Ob durch Textbeschreibungen oder Audio-Eingaben – das Modell folgt Anweisungen präzise und ermöglicht so eine tiefgehende Anpassung von Stil und Emotion.

„Dual-Core“-Antrieb: Eine Traumkollaboration zwischen LLM- und Diffusionsmodellen
Architektonisch nutzt SongGeneration2 eine innovative hybride LLM-Diffusions-Architektur:
Composing Brain (LeLM): Übernimmt die Planung der Gesamtstruktur und die stimmlichen Details und löst damit die Herausforderung, „wie man singt“.
High-Fidelity-Renderer (Diffusion): Synthetisiert unter Anleitung des Sprachmodells äußerst komplexe akustische Details.
Hierarchische Darstellung: Als erstes System nutzt es die parallele Modellierung gemischter und mehrspuriger Darstellungen und schafft so ein Gleichgewicht zwischen melodischer Stabilität und Verfeinerung der Klangqualität.
Echte Open Source, niedrige Einstiegshürde: Auch gewöhnliche Computer können „Songs schreiben“
Was die Entwickler am meisten begeisterte, war die bemerkenswerte Offenheit von Tencent. Das Modell „SongGeneration-v2-large“ mit 4 Milliarden Parametern ist nun vollständig Open Source und unterstützt die mehrsprachige Generierung, darunter Chinesisch und Englisch. Bemerkenswerterweise läuft es reibungslos auf handelsüblicher Hardware mit nur 22 GB VRAM und ermöglicht so die lokale und private Musikproduktion.
Damit Nutzer es sofort ausprobieren können, hat das Team außerdem die Version „SongGeneration-v2-Fast“ auf HuggingFace veröffentlicht, bei der ein minimaler Verlust an Audioqualität gegen eine ultraschnelle Generierung eingetauscht wird – so entsteht ein kompletter Song in weniger als einer Minute.
Basierend auf der Leistung von SongGeneration2 hat sich KI-Musik offiziell von einem „Geek-Spielzeug“ in den Bereich „kommerziell nutzbarer Anwendungen“ weiterentwickelt. Mit der bevorstehenden Veröffentlichung eines Medium-Modells, das 12 GB VRAM unterstützt, sowie eines automatisierten Bewertungsframeworks könnte nun endlich die Ära anbrechen, in der jeder zum „Komponisten“ wird.
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Anfang 2026 erlebte die KI-Musikbranche einen weiteren bedeutenden Wandel. Am 9. März wurde das Musik-Grundmodell „SongGeneration2“, das gemeinsam von

Drei Durchbrüche: Schluss mit „plastischer“ KI-Musik
Die zentralen Vorteile von
Hohe Musikalität: Im Gegensatz zum einfachen Aneinanderreihen von Melodien bewältigt dieses Modell komplexe Mehrspur-Arrangements mit beeindruckender räumlicher Tiefe.
Hohe Textgenauigkeit: Unklare Aussprache und halluzinierte Tonhöhenverschiebungen gehören nun der Vergangenheit an. Die Phonemfehlerrate (PER) liegt bei nur 8,55 % und übertrifft damit deutlich das führende kommerzielle Modell
Hohe Steuerbarkeit: Ob durch Textbeschreibungen oder Audio-Eingaben – das Modell folgt Anweisungen präzise und ermöglicht so eine tiefgehende Anpassung von Stil und Emotion.

„Dual-Core“-Antrieb: Eine Traumkollaboration zwischen LLM- und Diffusionsmodellen
Architektonisch nutzt
Composing Brain (LeLM): Übernimmt die Planung der Gesamtstruktur und die stimmlichen Details und löst damit die Herausforderung, „wie man singt“.
High-Fidelity-Renderer (Diffusion): Synthetisiert unter Anleitung des Sprachmodells äußerst komplexe akustische Details.
Hierarchische Darstellung: Als erstes System nutzt es die parallele Modellierung gemischter und mehrspuriger Darstellungen und schafft so ein Gleichgewicht zwischen melodischer Stabilität und Verfeinerung der Klangqualität.
Echte Open Source, niedrige Einstiegshürde: Auch gewöhnliche Computer können „Songs schreiben“
Was die Entwickler am meisten begeisterte, war die bemerkenswerte Offenheit von Tencent. Das Modell „SongGeneration-v2-large“ mit 4 Milliarden Parametern ist nun vollständig Open Source und unterstützt die mehrsprachige Generierung, darunter Chinesisch und Englisch. Bemerkenswerterweise läuft es reibungslos auf handelsüblicher Hardware mit nur 22 GB VRAM und ermöglicht so die lokale und private Musikproduktion.
Damit Nutzer es sofort ausprobieren können, hat das Team außerdem die Version „SongGeneration-v2-Fast“ auf HuggingFace veröffentlicht, bei der ein minimaler Verlust an Audioqualität gegen eine ultraschnelle Generierung eingetauscht wird – so entsteht ein kompletter Song in weniger als einer Minute.
Basierend auf der Leistung von
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13











