Lar
O modelo LPM1.0 gera vídeo de humano digital interativo em tempo real a partir de uma única imagem.

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











