Hogar
El modelo LPM1.0 genera video de personas digitales interactivas en tiempo real a partir de una sola imagen.

Los investigadores han presentado oficialmente el modelo LPM1.0, un proyecto cuyo objetivo es generar videos en tiempo real de personas hablando, escuchando y cantando a partir de una sola imagen de referencia. Su principal avance radica en el procesamiento multimodal: sincroniza las entradas de texto, audio e imagen para crear escenas dinámicas con sincronización labial precisa, expresiones faciales detalladas y transiciones emocionales naturales. Este modelo se integra directamente con plataformas líderes de inteligencia artificial de voz como ChatGPT y Doubao, convirtiendo las conversaciones tradicionales por voz en experiencias interactivas en tiempo real con retroalimentación visual.
Técnicamente, LPM1.0 utiliza el método de “condicionamiento de identidad multigranular” para extraer características detalladas de los materiales de referencia desde múltiples ángulos y expresiones, lo que elimina la necesidad de que el modelo genere por sí mismo elementos complejos como dientes, arrugas o perfiles laterales. Esto mejora enormemente el procesamiento entre diferentes estilos, permitiendo generar rostros fotorrealistas, animaciones o personajes de videojuegos en 3D de forma instantánea sin necesidad de reentrenamiento. Además, el modelo admite transmisión por streaming, lo que garantiza la estabilidad del sistema incluso al generar videos de hasta 45 minutos de duración.
En cuanto a la lógica de interacción, LPM1.0 detecta con precisión tres estados de conversación: mientras escucha, muestra expresiones como asentir o desviar la mirada; mientras habla, controla los movimientos del cuerpo y de los labios en función del audio; y cuando está inactivo, genera comportamientos naturales de descanso según las indicaciones textuales. La directora del proyecto, Zeng Ailing, señaló que LPM1.0 es adecuado no solo para conversaciones en tiempo real, sino también para la generación de videos por audio sin conexión a Internet, ofreciendo redundancia técnica para podcasts y producciones cinematográficas.
A pesar de su gran potencial aplicativo, el equipo de desarrollo destaca que LPM1.0 sigue siendo un proyecto de investigación y, por el momento, no hay planes para hacer públicos el código ni los pesos del modelo. Los investigadores reconocen una diferencia cualitativa entre los videos generados y las grabaciones reales, además de que los riesgos inherentes relacionados con los deepfake no pueden pasarse por alto. La importancia de este estudio radica en trazar la evolución futura de los sistemas de inteligencia artificial, pasando de interacciones lógicas simples a interacciones multidimensionales que incluyen respuestas emocionales, contacto visual y representación visual.
Artículo relacionado
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Los investigadores han presentado oficialmente el modelo LPM1.0, un proyecto cuyo objetivo es generar videos en tiempo real de personas hablando, escuchando y cantando a partir de una sola imagen de referencia. Su principal avance radica en el procesamiento multimodal: sincroniza las entradas de texto, audio e imagen para crear escenas dinámicas con sincronización labial precisa, expresiones faciales detalladas y transiciones emocionales naturales. Este modelo se integra directamente con plataformas líderes de inteligencia artificial de voz como ChatGPT y Doubao, convirtiendo las conversaciones tradicionales por voz en experiencias interactivas en tiempo real con retroalimentación visual.
Técnicamente, LPM1.0 utiliza el método de “condicionamiento de identidad multigranular” para extraer características detalladas de los materiales de referencia desde múltiples ángulos y expresiones, lo que elimina la necesidad de que el modelo genere por sí mismo elementos complejos como dientes, arrugas o perfiles laterales. Esto mejora enormemente el procesamiento entre diferentes estilos, permitiendo generar rostros fotorrealistas, animaciones o personajes de videojuegos en 3D de forma instantánea sin necesidad de reentrenamiento. Además, el modelo admite transmisión por streaming, lo que garantiza la estabilidad del sistema incluso al generar videos de hasta 45 minutos de duración.
En cuanto a la lógica de interacción, LPM1.0 detecta con precisión tres estados de conversación: mientras escucha, muestra expresiones como asentir o desviar la mirada; mientras habla, controla los movimientos del cuerpo y de los labios en función del audio; y cuando está inactivo, genera comportamientos naturales de descanso según las indicaciones textuales. La directora del proyecto, Zeng Ailing, señaló que LPM1.0 es adecuado no solo para conversaciones en tiempo real, sino también para la generación de videos por audio sin conexión a Internet, ofreciendo redundancia técnica para podcasts y producciones cinematográficas.
A pesar de su gran potencial aplicativo, el equipo de desarrollo destaca que LPM1.0 sigue siendo un proyecto de investigación y, por el momento, no hay planes para hacer públicos el código ni los pesos del modelo. Los investigadores reconocen una diferencia cualitativa entre los videos generados y las grabaciones reales, además de que los riesgos inherentes relacionados con los deepfake no pueden pasarse por alto. La importancia de este estudio radica en trazar la evolución futura de los sistemas de inteligencia artificial, pasando de interacciones lógicas simples a interacciones multidimensionales que incluyen respuestas emocionales, contacto visual y representación visual.
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











