Heim
Alibabas Tongyi stellt Fun-CineForge vor: Open-Source-KI-Modell ermöglicht Sprachsynthese in Kinoqualität
Das Alibaba Tongyi Lab hat am 16. März das multimodale Modell „Fun-CineForge“ für die filmspitzen, szenarioübergreifende Sprachsynthese offiziell vorgestellt und als Open-Source-Projekt veröffentlicht. Dieses Modell befasst sich mit zentralen Herausforderungen bei der KI-Synchronisation, darunter Lippensynchronisationsfehler, mangelnder emotionaler Ausdruck und uneinheitliche Stimmcharakteristika bei mehreren Charakteren. Zudem führt es eine hochwertige Methode zur Erstellung von Datensätzen ein.

Technisch gesehen ist Fun-CineForge Vorreiter beim Konzept der „zeitlichen Modalität“. Im Gegensatz zu herkömmlichen Modellen, die sich ausschließlich auf Text oder Bildmaterial konzentrieren, stellt es durch präzise Zeitstempelsteuerung sicher, dass die Sprachsynthese innerhalb genauer Zeitintervalle erfolgt. Selbst in komplexen Filmszenen mit verdeckten Charakteren, häufigen Kameraschnitten oder unscharfen Gesichtern gewährleistet das Modell ein hohes Maß an audiovisueller Synchronisation und die Einhaltung von Anweisungen.
Die begleitende Open-Source-Pipeline zur Erstellung des CineDub-Datensatzes ist eine weitere wichtige Innovation. Tongyi Lab nutzte die Kettengedanken-Argumentation großer Sprachmodelle, um rohes Filmmaterial automatisch in strukturierte Daten umzuwandeln, wodurch der Bedarf an manueller Annotation erheblich reduziert wurde. Dieser Prozess erreicht eine Wortfehlerrate von etwa 1 % und eine Sprecher-Diarisierungsfehlerrate von nur 1,20 %, was eine äußerst wettbewerbsfähige Trainingsgrundlage für große Modelle bietet.

Fun-CineForge ist nun auf GitHub, HuggingFace und in der ModelScope-Community verfügbar und unterstützt die Inferenz für Videoclips mit einer Länge von bis zu 30 Sekunden. Es zeichnet sich nicht nur bei Monologen einzelner Sprecher aus, sondern bietet auch professionelle Unterstützung für Duett- und Mehrsprecher-Dialogszenarien. Dieser Fortschritt signalisiert die Entwicklung der KI-Sprachtechnologie von grundlegenden Kundendienst- und Assistenzfunktionen hin zu hochwertiger Animation und Film-Postproduktion.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Verwandter Artikel
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
Das Alibaba Tongyi Lab hat am 16. März das multimodale Modell „Fun-CineForge“ für die filmspitzen, szenarioübergreifende Sprachsynthese offiziell vorgestellt und als Open-Source-Projekt veröffentlicht. Dieses Modell befasst sich mit zentralen Herausforderungen bei der KI-Synchronisation, darunter Lippensynchronisationsfehler, mangelnder emotionaler Ausdruck und uneinheitliche Stimmcharakteristika bei mehreren Charakteren. Zudem führt es eine hochwertige Methode zur Erstellung von Datensätzen ein.

Technisch gesehen ist Fun-CineForge Vorreiter beim Konzept der „zeitlichen Modalität“. Im Gegensatz zu herkömmlichen Modellen, die sich ausschließlich auf Text oder Bildmaterial konzentrieren, stellt es durch präzise Zeitstempelsteuerung sicher, dass die Sprachsynthese innerhalb genauer Zeitintervalle erfolgt. Selbst in komplexen Filmszenen mit verdeckten Charakteren, häufigen Kameraschnitten oder unscharfen Gesichtern gewährleistet das Modell ein hohes Maß an audiovisueller Synchronisation und die Einhaltung von Anweisungen.
Die begleitende Open-Source-Pipeline zur Erstellung des CineDub-Datensatzes ist eine weitere wichtige Innovation. Tongyi Lab nutzte die Kettengedanken-Argumentation großer Sprachmodelle, um rohes Filmmaterial automatisch in strukturierte Daten umzuwandeln, wodurch der Bedarf an manueller Annotation erheblich reduziert wurde. Dieser Prozess erreicht eine Wortfehlerrate von etwa 1 % und eine Sprecher-Diarisierungsfehlerrate von nur 1,20 %, was eine äußerst wettbewerbsfähige Trainingsgrundlage für große Modelle bietet.

Fun-CineForge ist nun auf GitHub, HuggingFace und in der ModelScope-Community verfügbar und unterstützt die Inferenz für Videoclips mit einer Länge von bis zu 30 Sekunden. Es zeichnet sich nicht nur bei Monologen einzelner Sprecher aus, sondern bietet auch professionelle Unterstützung für Duett- und Mehrsprecher-Dialogszenarien. Dieser Fortschritt signalisiert die Entwicklung der KI-Sprachtechnologie von grundlegenden Kundendienst- und Assistenzfunktionen hin zu hochwertiger Animation und Film-Postproduktion.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
U.S.-Aktien erreichen historischen Meilenstein, während KI- und Luft- und Raumfahrtriesen auf ihr Debüt als Billionen-Dollar-Unternehmen vorbereiten
Elon Musk, Sam Altman und Dario Amodei, drei Giganten des Technologiesektors, schreiten den Börsengängen ihrer jeweiligen Unternehmen voran. Mit SpaceX, OpenAI und Anthropic – drei Branchenriesen, die einer Bewertung von einer Billion US-Dollar nahek
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











