Maison
Meituan met en open source LongCat-Video-Avatar 1.5, qui surpasse les modèles propriétaires courants
L'équipe chargée des grands modèles « LongCat » de Meituan a officiellement mis en open source LongCat-Video-Avatar 1.5, un modèle de génération de vidéos mettant en scène des personnages numériques de qualité commerciale. Cette version marque le passage définitif d’une technologie open source de pointe à un déploiement commercial concret, avec des améliorations majeures en matière de synchronisation labiale, de réalisme physique, de stabilité des vidéos longues, d’interactions entre plusieurs personnes et d’efficacité de l’inférence.
Trois améliorations clés pour surmonter les obstacles à la commercialisation
Afin de garantir un fonctionnement fiable des personnages numériques dans diverses applications concrètes, LongCat-Video-Avatar 1.5 s'attaque à des problèmes persistants tels que la gigue, la distorsion et la latence élevée dans les vidéos traditionnelles de personnages numériques grâce à trois améliorations globales :
Amélioration de l’encodage audio de qualité commerciale
L’encodeur d’extraction des caractéristiques audio du modèle est passé de Wav2Vec2 à Whisper-large. Grâce à un plus grand nombre de paramètres et à des connaissances a priori multilingues plus riches, il capture désormais les variations subtiles des phonèmes et le rythme de la parole. Cela améliore la synchronisation labiale pour les contenus audio complexes tels que les longues phrases, les discours rapides et le chant, tout en permettant une coordination naturelle entre les expressions faciales, les mouvements de la tête et la parole — ce qui réduit considérablement les sauts d’images et la dérive d’identité dans les vidéos plus longues.
Généralisation robuste en domaine ouvert grâce à l’enrichissement des données en plusieurs étapes
Afin de garantir des performances stables sur des sujets variés — personnes réelles, idoles virtuelles, personnages d’anime et animaux —, l’équipe a développé un pipeline de données en plusieurs étapes intégrant une annotation hors ligne et une validation en ligne, et a introduit trois types ciblés de données améliorées :
Données multi-personnes: grâce à la détection active des locuteurs, ce pipeline élimine l’ambiguïté audiovisuelle dans les scènes impliquant plusieurs personnes, en distinguant avec précision les locuteurs des auditeurs.
Données silencieuses: en sélectionnant des vidéos sans parole, le modèle apprend les micro-expressions naturelles pendant les moments de silence, ce qui évite les mouvements de bouche indésirables chez les personnages qui ne parlent pas.
Données émotionnelles: combinées à un filtrage de reconnaissance des émotions au niveau de chaque image, elles intègrent les variations émotionnelles, aidant ainsi le modèle à saisir le lien profond entre la parole et les expressions faciales.
Alignement des mains et continuité temporelle avec le GRPO
Pour des cas d’utilisation tels que les diffusions en direct dans le cadre du commerce électronique et les démonstrations de produits, où les mains sont fréquemment visibles, le modèle intègre le GRPO (Human Preference Alignment), qui affine les signaux de récompense au niveau de l’image et ajoute un mécanisme de détection des mains dès la première image. Cela réduit considérablement les problèmes courants tels que la distorsion des mains, l’effondrement structurel local et les mouvements incohérents.

Une inférence 15 fois plus rapide : élimination des exigences de calcul coûteuses
Le coût est un autre facteur critique pour le déploiement commercial. LongCat-Video-Avatar 1.5 utilise la technologie DMD (Distributed Matching Distillation), qui compresse le processus de génération initial de 50 étapes à seulement 8 étapes. De plus, l’équipe a remplacé la configuration parallèle classique à trois modèles par un modèle de base unique partagé associé à plusieurs adaptateurs LoRA, ce qui réduit considérablement l’utilisation de la VRAM.
Lors de tests en conditions réelles, le modèle offre une inférence environ 15 fois plus rapide, générant une vidéo de 10 secondes en environ une minute.
Évaluation comparative : des performances supérieures à celles des meilleurs modèles du secteur
À l’aide du benchmark EvalTalker, 770 évaluateurs et 10 experts du domaine ont réalisé une analyse structurée de la qualité sur des vidéos issues de domaines complexes, notamment l’actualité, l’éducation et le divertissement. Les résultats montrent que LongCat-Video-Avatar 1.5 excelle sur plusieurs indicateurs clés :
Taux de réussite en termes de préférences des utilisateurs: il devance Kling Avatar 2.0 de 65,9 %, OmniHuman-1.5 de 61,1 % et HeyGen de 54,3 %.
Scores dans les scénarios à une ou plusieurs personnes: le score dans le scénario à une personne atteint 3,336, bien au-dessus de concurrents tels que HeyGen ; le score dans le scénario à plusieurs personnes est de 2,730, surpassant nettement InfiniteTalk (2,339).
Stabilité vidéo: le taux de déformation du sujet n’est que de 23,1 %, et celui de l’arrière-plan de seulement 9,4 % ;le taux de saut d’images n’est que de 0,8 %, le meilleur résultat parmi tous les modèles comparés.
Coordination audiovisuelle: le taux de problèmes de synchronisation visage-corps est tombé à 5,1 %, et celui des problèmes de synchronisation labiale à 29,8 %, ces deux chiffres surpassant ceux des systèmes commerciaux traditionnels.
L’équipe chargée du grand modèle LongCat de Meituan affirme que la mise en open source de LongCat-Video-Avatar 1.5 est bien plus qu’une simple mise à jour de version : il s’agit d’une invitation adressée à la communauté mondiale des développeurs et des créateurs. Elle espère que ce modèle servira de base technique vérifiable et perfectible, contribuant ainsi à repousser les limites concrètes des applications vidéo utilisant des avatars numériques.
Liens vers l’open source :
Github : https://github.com/meituan-longcat/LongCat-Video
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Rapport technique : https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Page du projet : https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope : https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Article connexe
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
Recommandations de sujets spéciaux liés
commentaires (0)
L'équipe chargée des grands modèles « LongCat » de Meituan a officiellement mis en open source LongCat-Video-Avatar 1.5, un modèle de génération de vidéos mettant en scène des personnages numériques de qualité commerciale. Cette version marque le passage définitif d’une technologie open source de pointe à un déploiement commercial concret, avec des améliorations majeures en matière de synchronisation labiale, de réalisme physique, de stabilité des vidéos longues, d’interactions entre plusieurs personnes et d’efficacité de l’inférence.
Trois améliorations clés pour surmonter les obstacles à la commercialisation
Afin de garantir un fonctionnement fiable des personnages numériques dans diverses applications concrètes, LongCat-Video-Avatar 1.5 s'attaque à des problèmes persistants tels que la gigue, la distorsion et la latence élevée dans les vidéos traditionnelles de personnages numériques grâce à trois améliorations globales :
Amélioration de l’encodage audio de qualité commerciale
L’encodeur d’extraction des caractéristiques audio du modèle est passé de Wav2Vec2 à Whisper-large. Grâce à un plus grand nombre de paramètres et à des connaissances a priori multilingues plus riches, il capture désormais les variations subtiles des phonèmes et le rythme de la parole. Cela améliore la synchronisation labiale pour les contenus audio complexes tels que les longues phrases, les discours rapides et le chant, tout en permettant une coordination naturelle entre les expressions faciales, les mouvements de la tête et la parole — ce qui réduit considérablement les sauts d’images et la dérive d’identité dans les vidéos plus longues.
Généralisation robuste en domaine ouvert grâce à l’enrichissement des données en plusieurs étapes
Afin de garantir des performances stables sur des sujets variés — personnes réelles, idoles virtuelles, personnages d’anime et animaux —, l’équipe a développé un pipeline de données en plusieurs étapes intégrant une annotation hors ligne et une validation en ligne, et a introduit trois types ciblés de données améliorées :
Données multi-personnes: grâce à la détection active des locuteurs, ce pipeline élimine l’ambiguïté audiovisuelle dans les scènes impliquant plusieurs personnes, en distinguant avec précision les locuteurs des auditeurs.
Données silencieuses: en sélectionnant des vidéos sans parole, le modèle apprend les micro-expressions naturelles pendant les moments de silence, ce qui évite les mouvements de bouche indésirables chez les personnages qui ne parlent pas.
Données émotionnelles: combinées à un filtrage de reconnaissance des émotions au niveau de chaque image, elles intègrent les variations émotionnelles, aidant ainsi le modèle à saisir le lien profond entre la parole et les expressions faciales.
Alignement des mains et continuité temporelle avec le GRPO
Pour des cas d’utilisation tels que les diffusions en direct dans le cadre du commerce électronique et les démonstrations de produits, où les mains sont fréquemment visibles, le modèle intègre le GRPO (Human Preference Alignment), qui affine les signaux de récompense au niveau de l’image et ajoute un mécanisme de détection des mains dès la première image. Cela réduit considérablement les problèmes courants tels que la distorsion des mains, l’effondrement structurel local et les mouvements incohérents.

Une inférence 15 fois plus rapide : élimination des exigences de calcul coûteuses
Le coût est un autre facteur critique pour le déploiement commercial. LongCat-Video-Avatar 1.5 utilise la technologie DMD (Distributed Matching Distillation), qui compresse le processus de génération initial de 50 étapes à seulement 8 étapes. De plus, l’équipe a remplacé la configuration parallèle classique à trois modèles par un modèle de base unique partagé associé à plusieurs adaptateurs LoRA, ce qui réduit considérablement l’utilisation de la VRAM.
Lors de tests en conditions réelles, le modèle offre une inférence environ 15 fois plus rapide, générant une vidéo de 10 secondes en environ une minute.
Évaluation comparative : des performances supérieures à celles des meilleurs modèles du secteur
À l’aide du benchmark EvalTalker, 770 évaluateurs et 10 experts du domaine ont réalisé une analyse structurée de la qualité sur des vidéos issues de domaines complexes, notamment l’actualité, l’éducation et le divertissement. Les résultats montrent que LongCat-Video-Avatar 1.5 excelle sur plusieurs indicateurs clés :
Taux de réussite en termes de préférences des utilisateurs: il devance Kling Avatar 2.0 de 65,9 %, OmniHuman-1.5 de 61,1 % et HeyGen de 54,3 %.
Scores dans les scénarios à une ou plusieurs personnes: le score dans le scénario à une personne atteint 3,336, bien au-dessus de concurrents tels que HeyGen ; le score dans le scénario à plusieurs personnes est de 2,730, surpassant nettement InfiniteTalk (2,339).
Stabilité vidéo: le taux de déformation du sujet n’est que de 23,1 %, et celui de l’arrière-plan de seulement 9,4 % ;le taux de saut d’images n’est que de 0,8 %, le meilleur résultat parmi tous les modèles comparés.
Coordination audiovisuelle: le taux de problèmes de synchronisation visage-corps est tombé à 5,1 %, et celui des problèmes de synchronisation labiale à 29,8 %, ces deux chiffres surpassant ceux des systèmes commerciaux traditionnels.
L’équipe chargée du grand modèle LongCat de Meituan affirme que la mise en open source de LongCat-Video-Avatar 1.5 est bien plus qu’une simple mise à jour de version : il s’agit d’une invitation adressée à la communauté mondiale des développeurs et des créateurs. Elle espère que ce modèle servira de base technique vérifiable et perfectible, contribuant ainsi à repousser les limites concrètes des applications vidéo utilisant des avatars numériques.
Liens vers l’open source :
Github : https://github.com/meituan-longcat/LongCat-Video
HuggingFace : https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Rapport technique : https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Page du projet : https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope : https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte











