Heim
Meituan veröffentlicht „LongCat-Video-Avatar 1.5“ als Open-Source-Software – das Modell übertrifft gängige proprietäre Modelle
Das LongCat-Team für große Modelle bei Meituan hat „LongCat-Video-Avatar 1.5“, ein Modell zur Erzeugung digitaler Menschen in Videos auf kommerziellem Niveau, offiziell als Open Source veröffentlicht. Diese Version markiert einen vollständigen Übergang vom Open-Source-Stand der Technik zum praktischen kommerziellen Einsatz und bietet wesentliche Verbesserungen in den Bereichen Lippensynchronisation, physikalischer Realismus, Stabilität bei langen Videos, Interaktionen zwischen mehreren Personen sowie effiziente Inferenz.
Drei wichtige Verbesserungen zur Überwindung von Hürden bei der Kommerzialisierung
Damit digitale Menschen in verschiedenen realen Anwendungen zuverlässig funktionieren, geht LongCat-Video-Avatar 1.5 durch drei ganzheitliche Verbesserungen hartnäckige Probleme wie Bildflackern, Verzerrungen und hohe Latenz in herkömmlichen Videos mit digitalen Menschen an:
Verbesserung der Audio-Kodierung auf kommerziellem Niveau
Der Encoder zur Extraktion von Audio-Merkmalen des Modells wurde von Wav2Vec2 auf Whisper-large aktualisiert. Mit mehr Parametern und umfangreicheren mehrsprachigen Vorwissen erfasst er nun subtile Phonemvariationen und den Sprachrhythmus. Dies verbessert die Lippensynchronisation bei komplexen Audioinhalten wie langen Sätzen, schneller Sprache und Gesang und ermöglicht gleichzeitig eine natürliche Koordination zwischen Gesichtsausdrücken, Kopfbewegungen und Sprache – wodurch Frame-Skipping und Identitätsdrift in längeren Videos deutlich reduziert werden.
Robuste Open-Domain-Generalisierung durch mehrstufige Datenanreicherung
Um eine stabile Leistung bei unterschiedlichen Motiven – echte Menschen, virtuelle Idole, Anime-Figuren und Tiere – zu gewährleisten, entwickelte das Team eine mehrstufige Datenpipeline, die Offline-Annotation und Online-Validierung umfasst, und führte drei gezielte Arten von angereicherten Daten ein:
Daten mit mehreren Personen: Mithilfe der Erkennung des aktiven Sprechers werden audiovisuelle Mehrdeutigkeiten in Szenen mit mehreren Personen beseitigt, wobei Sprecher und Zuhörer präzise voneinander unterschieden werden.
Stille Daten: Durch die Auswahl von Videos ohne Sprache lernt das Modell natürliche Mikroausdrücke in stillen Zuständen kennen und verhindert so unerwünschte Mundbewegungen bei nicht sprechenden Figuren.
Emotionsdaten: In Kombination mit einem Filter zur Emotionserkennung auf Frame-Ebene werden emotionale Schwankungen einbezogen, was dem Modell hilft, den tiefen Zusammenhang zwischen Sprache und Gesichtsausdrücken zu erfassen.
Handausrichtung und zeitliche Kontinuität mit GRPO
Für Anwendungsfälle wie E-Commerce-Livestreams und Produktdemos, bei denen Hände häufig zu sehen sind, führt das Modell GRPO (Human Preference Alignment) ein, das Belohnungssignale auf Frame-Ebene verfeinert und einen Mechanismus zur Handerkennung im ersten Frame hinzufügt. Dies reduziert häufige Probleme wie Handverzerrungen, lokalen Strukturkollaps und inkonsistente Bewegungen erheblich.

15-mal schnellere Inferenz: Eliminierung hoher Rechenanforderungen
Die Kosten sind ein weiterer entscheidender Faktor für den kommerziellen Einsatz. LongCat-Video-Avatar 1.5 nutzt die DMD-Technologie (Distributed Matching Distillation) und komprimiert den ursprünglichen 50-stufigen Generierungsprozess auf nur 8 Schritte. Darüber hinaus ersetzte das Team die herkömmliche parallele Konfiguration mit drei Modellen durch ein einziges gemeinsames Basismodell sowie mehrere LoRA-Adapter, wodurch der VRAM-Verbrauch drastisch reduziert wurde.
In Praxistests liefert das Modell eine etwa 15-mal schnellere Inferenz und generiert ein 10-Sekunden-Video in etwa einer Minute.
Benchmark-Auswertung: Übertrifft führende Branchenmodelle
Mithilfe des EvalTalker-Benchmarks führten 770 Bewerter und 10 Fachexperten eine strukturierte Qualitätsanalyse von Videos aus komplexen Bereichen wie Nachrichten, Bildung und Unterhaltung durch. Die Ergebnisse zeigen, dass LongCat-Video-Avatar 1.5 bei mehreren Schlüsselkennzahlen herausragende Leistungen erbringt:
Gewinnquote bei den Nutzerpräferenzen: Es übertrifft Kling Avatar 2.0 um 65,9 %, OmniHuman-1.5 um 61,1 % und HeyGen um 54,3 %.
Bewertungen in Ein- und Mehrpersonen-Szenarien: Die Bewertung im Ein-Personen-Szenario erreicht 3,336 und liegt damit deutlich über der von Wettbewerbern wie HeyGen; die Bewertung im Mehrpersonen-Szenario beträgt 2,730 und übertrifft InfiniteTalk (2,339) deutlich.
Videostabilität: Die Verformungsrate der Testperson beträgt nur 23,1 % und die des Hintergrunds lediglich 9,4 %;die Bildausfallrate liegt bei nur 0,8 % und ist damit dieniedrigste aller verglichenen Modelle.
Audiovisuelle Koordination: Die Fehlerquote bei der Gesichts-Körper-Synchronisation sank auf 5,1 %, und die Fehlerquote bei der Lippensynchronisation fiel auf 29,8 % – beide Werte übertreffen herkömmliche kommerzielle Systeme.
Das Team des großen Meituan-LongCat-Modells erklärt, dass die Veröffentlichung von „LongCat-Video-Avatar 1.5“ als Open-Source-Projekt mehr ist als nur ein Versions-Update – es ist eine Einladung an die weltweite Entwickler- und Kreativ-Community. Sie hoffen, dass dieses Modell als überprüfbare, verbesserungsfähige technische Grundlage dienen wird, um die Grenzen digitaler Human-Video-Anwendungen in der Praxis weiter zu verschieben.
Open-Source-Links:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Technischer Bericht: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Projektseite: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Verwandter Artikel
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
Google testet den Remy AI Agent für Gemini, da der Fokus auf die Benutzerkontrolle verlagert wird
Laut Business Insider testet Google Remy, einen neuen KI-Personalagenten für Gemini. Dieses Tool soll Aufgaben im Auftrag von Nutzern ausführen und sowohl professionelle Arbeitsabläufe als auch tägliche Routinen optimieren.Derzeit wird Remy in einer
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Das LongCat-Team für große Modelle bei Meituan hat „LongCat-Video-Avatar 1.5“, ein Modell zur Erzeugung digitaler Menschen in Videos auf kommerziellem Niveau, offiziell als Open Source veröffentlicht. Diese Version markiert einen vollständigen Übergang vom Open-Source-Stand der Technik zum praktischen kommerziellen Einsatz und bietet wesentliche Verbesserungen in den Bereichen Lippensynchronisation, physikalischer Realismus, Stabilität bei langen Videos, Interaktionen zwischen mehreren Personen sowie effiziente Inferenz.
Drei wichtige Verbesserungen zur Überwindung von Hürden bei der Kommerzialisierung
Damit digitale Menschen in verschiedenen realen Anwendungen zuverlässig funktionieren, geht LongCat-Video-Avatar 1.5 durch drei ganzheitliche Verbesserungen hartnäckige Probleme wie Bildflackern, Verzerrungen und hohe Latenz in herkömmlichen Videos mit digitalen Menschen an:
Verbesserung der Audio-Kodierung auf kommerziellem Niveau
Der Encoder zur Extraktion von Audio-Merkmalen des Modells wurde von Wav2Vec2 auf Whisper-large aktualisiert. Mit mehr Parametern und umfangreicheren mehrsprachigen Vorwissen erfasst er nun subtile Phonemvariationen und den Sprachrhythmus. Dies verbessert die Lippensynchronisation bei komplexen Audioinhalten wie langen Sätzen, schneller Sprache und Gesang und ermöglicht gleichzeitig eine natürliche Koordination zwischen Gesichtsausdrücken, Kopfbewegungen und Sprache – wodurch Frame-Skipping und Identitätsdrift in längeren Videos deutlich reduziert werden.
Robuste Open-Domain-Generalisierung durch mehrstufige Datenanreicherung
Um eine stabile Leistung bei unterschiedlichen Motiven – echte Menschen, virtuelle Idole, Anime-Figuren und Tiere – zu gewährleisten, entwickelte das Team eine mehrstufige Datenpipeline, die Offline-Annotation und Online-Validierung umfasst, und führte drei gezielte Arten von angereicherten Daten ein:
Daten mit mehreren Personen: Mithilfe der Erkennung des aktiven Sprechers werden audiovisuelle Mehrdeutigkeiten in Szenen mit mehreren Personen beseitigt, wobei Sprecher und Zuhörer präzise voneinander unterschieden werden.
Stille Daten: Durch die Auswahl von Videos ohne Sprache lernt das Modell natürliche Mikroausdrücke in stillen Zuständen kennen und verhindert so unerwünschte Mundbewegungen bei nicht sprechenden Figuren.
Emotionsdaten: In Kombination mit einem Filter zur Emotionserkennung auf Frame-Ebene werden emotionale Schwankungen einbezogen, was dem Modell hilft, den tiefen Zusammenhang zwischen Sprache und Gesichtsausdrücken zu erfassen.
Handausrichtung und zeitliche Kontinuität mit GRPO
Für Anwendungsfälle wie E-Commerce-Livestreams und Produktdemos, bei denen Hände häufig zu sehen sind, führt das Modell GRPO (Human Preference Alignment) ein, das Belohnungssignale auf Frame-Ebene verfeinert und einen Mechanismus zur Handerkennung im ersten Frame hinzufügt. Dies reduziert häufige Probleme wie Handverzerrungen, lokalen Strukturkollaps und inkonsistente Bewegungen erheblich.

15-mal schnellere Inferenz: Eliminierung hoher Rechenanforderungen
Die Kosten sind ein weiterer entscheidender Faktor für den kommerziellen Einsatz. LongCat-Video-Avatar 1.5 nutzt die DMD-Technologie (Distributed Matching Distillation) und komprimiert den ursprünglichen 50-stufigen Generierungsprozess auf nur 8 Schritte. Darüber hinaus ersetzte das Team die herkömmliche parallele Konfiguration mit drei Modellen durch ein einziges gemeinsames Basismodell sowie mehrere LoRA-Adapter, wodurch der VRAM-Verbrauch drastisch reduziert wurde.
In Praxistests liefert das Modell eine etwa 15-mal schnellere Inferenz und generiert ein 10-Sekunden-Video in etwa einer Minute.
Benchmark-Auswertung: Übertrifft führende Branchenmodelle
Mithilfe des EvalTalker-Benchmarks führten 770 Bewerter und 10 Fachexperten eine strukturierte Qualitätsanalyse von Videos aus komplexen Bereichen wie Nachrichten, Bildung und Unterhaltung durch. Die Ergebnisse zeigen, dass LongCat-Video-Avatar 1.5 bei mehreren Schlüsselkennzahlen herausragende Leistungen erbringt:
Gewinnquote bei den Nutzerpräferenzen: Es übertrifft Kling Avatar 2.0 um 65,9 %, OmniHuman-1.5 um 61,1 % und HeyGen um 54,3 %.
Bewertungen in Ein- und Mehrpersonen-Szenarien: Die Bewertung im Ein-Personen-Szenario erreicht 3,336 und liegt damit deutlich über der von Wettbewerbern wie HeyGen; die Bewertung im Mehrpersonen-Szenario beträgt 2,730 und übertrifft InfiniteTalk (2,339) deutlich.
Videostabilität: Die Verformungsrate der Testperson beträgt nur 23,1 % und die des Hintergrunds lediglich 9,4 %;die Bildausfallrate liegt bei nur 0,8 % und ist damit dieniedrigste aller verglichenen Modelle.
Audiovisuelle Koordination: Die Fehlerquote bei der Gesichts-Körper-Synchronisation sank auf 5,1 %, und die Fehlerquote bei der Lippensynchronisation fiel auf 29,8 % – beide Werte übertreffen herkömmliche kommerzielle Systeme.
Das Team des großen Meituan-LongCat-Modells erklärt, dass die Veröffentlichung von „LongCat-Video-Avatar 1.5“ als Open-Source-Projekt mehr ist als nur ein Versions-Update – es ist eine Einladung an die weltweite Entwickler- und Kreativ-Community. Sie hoffen, dass dieses Modell als überprüfbare, verbesserungsfähige technische Grundlage dienen wird, um die Grenzen digitaler Human-Video-Anwendungen in der Praxis weiter zu verschieben.
Open-Source-Links:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Technischer Bericht: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Projektseite: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Schwedisches KI-Startup Lovable Eyes: Bewertung von 13,2 Milliarden US-Dollar nach großer Finanzierungsrunde
Während KI-gestützte Coding-Tools an Popularität gewinnen, hat das schwedische Startup Lovable eine bedeutende Finanzierungsrunde abgeschlossen. Das Unternehmen strebt danach, 3 Milliarden US-Dollar einzusammeln, was seine Bewertung potenziell auf 13
So beheben Sie Core Web Vitals für bessere SEO-Rankings
Berichtskartenkommentare mit KI-Tools optimierenEinführungKI-Tools zur Generierung von BerichtskartenkommentarenMagic SchoolAlmanac AIChat GPTNutzung von Magic School zur Generierung von BerichtskartenkommentarenAnmeldung bei Magic SchoolAuswahl des











