Hogar
Meituan publica en código abierto LongCat-Video-Avatar 1.5, que supera a los modelos cerrados más habituales
El equipo de modelos a gran escala LongCat de Meituan ha publicado oficialmente en código abierto LongCat-Video-Avatar 1.5, un modelo de generación de vídeo de personas digitales de calidad comercial. Esta versión supone un cambio total, pasando de la tecnología de vanguardia de código abierto a la implementación comercial en el mundo real, con importantes mejoras en la sincronización labial, el realismo físico, la estabilidad en vídeos largos, las interacciones entre varias personas y la eficiencia en la inferencia.
Tres mejoras clave para superar los obstáculos de la comercialización
Para que los humanos digitales funcionen de forma fiable en diversas aplicaciones del mundo real, LongCat-Video-Avatar 1.5 aborda problemas persistentes como el jitter, la distorsión y la alta latencia en los vídeos tradicionales de humanos digitales mediante tres mejoras integrales:
Mejora de la codificación de audio de calidad comercial
El codificador de extracción de características de audio del modelo se ha actualizado de Wav2Vec2 a Whisper-large. Con más parámetros y un conocimiento previo multilingüe más rico, ahora capta variaciones sutiles de fonemas y el ritmo del habla. Esto mejora la sincronización labial en audios complejos, como frases largas, habla rápida y canto, al tiempo que permite una coordinación natural entre las expresiones faciales, los movimientos de la cabeza y el habla, lo que reduce significativamente el salto de fotogramas y la deriva de identidad en vídeos más largos.
Generalización robusta en dominio abierto mediante la mejora de datos en varias etapas
Para garantizar un rendimiento estable con sujetos diversos —personas reales, ídolos virtuales, personajes de anime y animales—, el equipo desarrolló un flujo de datos en varias etapas que incorpora anotación fuera de línea y validación en línea, e introdujo tres tipos específicos de datos mejorados:
Datos de múltiples personas: mediante la detección activa del hablante, elimina la ambigüedad audiovisual en escenas con varias personas, diferenciando con precisión a los hablantes de los oyentes.
Datos silenciosos: al seleccionar vídeos sin habla, el modelo aprende microexpresiones naturales durante los estados de silencio, lo que evita movimientos bucales no deseados en los personajes que no hablan.
Datos emocionales: en combinación con un filtrado de reconocimiento emocional a nivel de fotograma, incorpora variaciones emocionales, lo que ayuda al modelo a comprender el profundo vínculo entre el habla y las expresiones faciales.
Alineación de manos y continuidad temporal con GRPO
Para casos de uso como las retransmisiones en directo de comercio electrónico y las demostraciones de productos, en las que las manos suelen estar visibles, el modelo introduce GRPO (Human Preference Alignment), que refina las señales de recompensa a nivel de fotograma y añade un mecanismo de detección de manos en el primer fotograma. Esto reduce sustancialmente problemas comunes como la distorsión de las manos, el colapso estructural local y el movimiento inconsistente.

Inferencia 15 veces más rápida: eliminación de los costosos requisitos de computación
El coste es otro factor crítico para el despliegue comercial. LongCat-Video-Avatar 1.5 utiliza la tecnología DMD (Distributed Matching Distillation), que comprime el proceso de generación original de 50 pasos a solo 8. Además, el equipo sustituyó la configuración paralela convencional de tres modelos por un único modelo base compartido más varios adaptadores LoRA, lo que redujo drásticamente el uso de VRAM.
En pruebas en condiciones reales, el modelo ofrece una inferencia aproximadamente 15 veces más rápida, generando un vídeo de 10 segundos en alrededor de un minuto.
Evaluación comparativa: superando a los mejores modelos del sector
Utilizando el benchmark EvalTalker, 770 evaluadores y 10 expertos en la materia realizaron un análisis estructurado de la calidad de vídeos de ámbitos complejos, como las noticias, la educación y el entretenimiento. Los resultados muestran que LongCat-Video-Avatar 1.5 destaca en varias métricas clave:
Índice de aceptación por parte de los usuarios: supera a Kling Avatar 2.0 en un 65,9 %, a OmniHuman-1.5 en un 61,1 % y a HeyGen en un 54,3 %.
Puntuaciones en escenarios con una o varias personas: la puntuación en el escenario con una sola persona alcanza los 3,336, muy por encima de competidores como HeyGen; la puntuación en el escenario con varias personas es de 2,730, superando significativamente a InfiniteTalk (2,339).
Estabilidad del vídeo: la tasa de deformación del sujeto es de solo el 23,1 %, y la del fondo, de apenas el 9,4 %;la tasa de saltos de fotogramas es tan baja como el 0,8 %, la mejor de todos los modelos comparados.
Coordinación audiovisual: La tasa de problemas de sincronización entre el rostro y el cuerpo se redujo al 5,1 %, y la tasa de problemas de sincronización labial descendió al 29,8 %, superando en ambos casos a los sistemas comerciales tradicionales.
El equipo del modelo a gran escala LongCat de Meituan afirma que la publicación en código abierto de LongCat-Video-Avatar 1.5 es más que una simple actualización de versión: es una invitación a la comunidad global de desarrolladores y creadores. Esperan que este modelo sirva como base técnica verificable y mejorable, contribuyendo a ampliar los límites reales de las aplicaciones de vídeo con humanos digitales.
Enlaces de código abierto:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Informe técnico: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Página del proyecto: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Artículo relacionado
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El equipo de modelos a gran escala LongCat de Meituan ha publicado oficialmente en código abierto LongCat-Video-Avatar 1.5, un modelo de generación de vídeo de personas digitales de calidad comercial. Esta versión supone un cambio total, pasando de la tecnología de vanguardia de código abierto a la implementación comercial en el mundo real, con importantes mejoras en la sincronización labial, el realismo físico, la estabilidad en vídeos largos, las interacciones entre varias personas y la eficiencia en la inferencia.
Tres mejoras clave para superar los obstáculos de la comercialización
Para que los humanos digitales funcionen de forma fiable en diversas aplicaciones del mundo real, LongCat-Video-Avatar 1.5 aborda problemas persistentes como el jitter, la distorsión y la alta latencia en los vídeos tradicionales de humanos digitales mediante tres mejoras integrales:
Mejora de la codificación de audio de calidad comercial
El codificador de extracción de características de audio del modelo se ha actualizado de Wav2Vec2 a Whisper-large. Con más parámetros y un conocimiento previo multilingüe más rico, ahora capta variaciones sutiles de fonemas y el ritmo del habla. Esto mejora la sincronización labial en audios complejos, como frases largas, habla rápida y canto, al tiempo que permite una coordinación natural entre las expresiones faciales, los movimientos de la cabeza y el habla, lo que reduce significativamente el salto de fotogramas y la deriva de identidad en vídeos más largos.
Generalización robusta en dominio abierto mediante la mejora de datos en varias etapas
Para garantizar un rendimiento estable con sujetos diversos —personas reales, ídolos virtuales, personajes de anime y animales—, el equipo desarrolló un flujo de datos en varias etapas que incorpora anotación fuera de línea y validación en línea, e introdujo tres tipos específicos de datos mejorados:
Datos de múltiples personas: mediante la detección activa del hablante, elimina la ambigüedad audiovisual en escenas con varias personas, diferenciando con precisión a los hablantes de los oyentes.
Datos silenciosos: al seleccionar vídeos sin habla, el modelo aprende microexpresiones naturales durante los estados de silencio, lo que evita movimientos bucales no deseados en los personajes que no hablan.
Datos emocionales: en combinación con un filtrado de reconocimiento emocional a nivel de fotograma, incorpora variaciones emocionales, lo que ayuda al modelo a comprender el profundo vínculo entre el habla y las expresiones faciales.
Alineación de manos y continuidad temporal con GRPO
Para casos de uso como las retransmisiones en directo de comercio electrónico y las demostraciones de productos, en las que las manos suelen estar visibles, el modelo introduce GRPO (Human Preference Alignment), que refina las señales de recompensa a nivel de fotograma y añade un mecanismo de detección de manos en el primer fotograma. Esto reduce sustancialmente problemas comunes como la distorsión de las manos, el colapso estructural local y el movimiento inconsistente.

Inferencia 15 veces más rápida: eliminación de los costosos requisitos de computación
El coste es otro factor crítico para el despliegue comercial. LongCat-Video-Avatar 1.5 utiliza la tecnología DMD (Distributed Matching Distillation), que comprime el proceso de generación original de 50 pasos a solo 8. Además, el equipo sustituyó la configuración paralela convencional de tres modelos por un único modelo base compartido más varios adaptadores LoRA, lo que redujo drásticamente el uso de VRAM.
En pruebas en condiciones reales, el modelo ofrece una inferencia aproximadamente 15 veces más rápida, generando un vídeo de 10 segundos en alrededor de un minuto.
Evaluación comparativa: superando a los mejores modelos del sector
Utilizando el benchmark EvalTalker, 770 evaluadores y 10 expertos en la materia realizaron un análisis estructurado de la calidad de vídeos de ámbitos complejos, como las noticias, la educación y el entretenimiento. Los resultados muestran que LongCat-Video-Avatar 1.5 destaca en varias métricas clave:
Índice de aceptación por parte de los usuarios: supera a Kling Avatar 2.0 en un 65,9 %, a OmniHuman-1.5 en un 61,1 % y a HeyGen en un 54,3 %.
Puntuaciones en escenarios con una o varias personas: la puntuación en el escenario con una sola persona alcanza los 3,336, muy por encima de competidores como HeyGen; la puntuación en el escenario con varias personas es de 2,730, superando significativamente a InfiniteTalk (2,339).
Estabilidad del vídeo: la tasa de deformación del sujeto es de solo el 23,1 %, y la del fondo, de apenas el 9,4 %;la tasa de saltos de fotogramas es tan baja como el 0,8 %, la mejor de todos los modelos comparados.
Coordinación audiovisual: La tasa de problemas de sincronización entre el rostro y el cuerpo se redujo al 5,1 %, y la tasa de problemas de sincronización labial descendió al 29,8 %, superando en ambos casos a los sistemas comerciales tradicionales.
El equipo del modelo a gran escala LongCat de Meituan afirma que la publicación en código abierto de LongCat-Video-Avatar 1.5 es más que una simple actualización de versión: es una invitación a la comunidad global de desarrolladores y creadores. Esperan que este modelo sirva como base técnica verificable y mejorable, contribuyendo a ampliar los límites reales de las aplicaciones de vídeo con humanos digitales.
Enlaces de código abierto:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Informe técnico: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Página del proyecto: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri











