Lar
O Tongyi Lab, da Alibaba, torna o Fun-CineForge de código aberto e resolve o desafio da dublagem com vários locutores
A dublagem por IA tradicional muitas vezes fica aquém das expectativas em produções de alto nível, como filmes e animações, onde é fundamental captar nuances emocionais e sincronizar perfeitamente os movimentos labiais. Para enfrentar esse desafio central do setor, o Tongyi Lab lançou oficialmente e disponibilizou como código aberto o inovador modelo de dublagem multimodal para múltiplos cenários e de qualidade cinematográfica: o Fun-CineForge .
Preenchendo a lacuna audiovisual: uma estrutura de quatro pilares para sincronização perfeita
Em vez de depender da conversão básica de texto em fala, o Fun-CineForge foi projetado para dominar quatro dimensões críticas da dublagem profissional:
Sincronização labial: garante que a fala sintetizada se alinhe aos movimentos da boca dos personagens na tela com precisão excepcional.
Expressão emocional: infunde na voz emoções autênticas semelhantes às humanas, analisando sinais faciais e instruções contextuais.
Consistência vocal: mantém uma identidade vocal estável e reconhecível para personagens específicos em cenas complexas de diálogo com vários interlocutores.
Alinhamento temporal: permite a inserção de diálogos com precisão de milissegundos, mesmo quando o locutor está fora da tela ou parcialmente oculto.
Inovação central: pioneira na “modalidade temporal” e em um conjunto de dados de alta fidelidade
O salto técnico do Fun-CineForge decorre de sua filosofia única de co-projeto “dados + modelo”:

O Conjunto de Dados de Alta Qualidade CineDub: O Tongyi Lab também disponibilizou como código aberto o pipeline automatizado de construção do conjunto de dados CineDub. Utilizando um mecanismo de correção de erros de cadeia de pensamento, ele reduz as taxas de erro de transcrição para textos em chinês e inglês para aproximadamente 1% a 2% e reduz drasticamente os erros de diarização de falantes para até 1,2%.
Arquitetura de fusão de quatro modalidades: O modelo é pioneiro na integração de uma “modalidade temporal”, modelando conjuntamente entradas visuais (forma dos lábios e expressão), texto (diálogo e contexto emocional) e áudio (referência de voz). Essa fusão permite a sincronização exata em cenas desafiadoras, incluindo aquelas sem rostos visíveis.
Excelência comprovada: dublagem pioneira de diálogos autênticos com múltiplos personagens
Os resultados de benchmark demonstram que o Fun-CineForge supera substancialmente os modelos de referência, como o DeepDubber-V1, em métricas-chave: taxa de erro de palavras (WER/CER), sincronização labial (LSE-C/D) e similaridade de voz. Uma conquista marcante é sua capacidade inédita de lidar com diálogos em dueto e com múltiplos interlocutores com precisão, mostrando notável robustez em clipes de vídeo de até 30 segundos.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Artigo relacionado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Recomendações de tópicos especiais relacionados
Comentários (0)
A dublagem por IA tradicional muitas vezes fica aquém das expectativas em produções de alto nível, como filmes e animações, onde é fundamental captar nuances emocionais e sincronizar perfeitamente os movimentos labiais. Para enfrentar esse desafio central do setor, o Tongyi Lab lançou oficialmente e disponibilizou como código aberto o inovador modelo de dublagem multimodal para múltiplos cenários e de qualidade cinematográfica:
Preenchendo a lacuna audiovisual: uma estrutura de quatro pilares para sincronização perfeita
Em vez de depender da conversão básica de texto em fala, o Fun-CineForge foi projetado para dominar quatro dimensões críticas da dublagem profissional:
Sincronização labial: garante que a fala sintetizada se alinhe aos movimentos da boca dos personagens na tela com precisão excepcional.
Expressão emocional: infunde na voz emoções autênticas semelhantes às humanas, analisando sinais faciais e instruções contextuais.
Consistência vocal: mantém uma identidade vocal estável e reconhecível para personagens específicos em cenas complexas de diálogo com vários interlocutores.
Alinhamento temporal: permite a inserção de diálogos com precisão de milissegundos, mesmo quando o locutor está fora da tela ou parcialmente oculto.
Inovação central: pioneira na “modalidade temporal” e em um conjunto de dados de alta fidelidade
O salto técnico do Fun-CineForge decorre de sua filosofia única de co-projeto “dados + modelo”:

O Conjunto de Dados de Alta Qualidade CineDub: O Tongyi Lab também disponibilizou como código aberto o pipeline automatizado de construção do conjunto de dados CineDub. Utilizando um mecanismo de correção de erros de cadeia de pensamento, ele reduz as taxas de erro de transcrição para textos em chinês e inglês para aproximadamente 1% a 2% e reduz drasticamente os erros de diarização de falantes para até 1,2%.
Arquitetura de fusão de quatro modalidades: O modelo é pioneiro na integração de uma “modalidade temporal”, modelando conjuntamente entradas visuais (forma dos lábios e expressão), texto (diálogo e contexto emocional) e áudio (referência de voz). Essa fusão permite a sincronização exata em cenas desafiadoras, incluindo aquelas sem rostos visíveis.
Excelência comprovada: dublagem pioneira de diálogos autênticos com múltiplos personagens
Os resultados de benchmark demonstram que o Fun-CineForge supera substancialmente os modelos de referência, como o DeepDubber-V1, em métricas-chave: taxa de erro de palavras (WER/CER), sincronização labial (LSE-C/D) e similaridade de voz. Uma conquista marcante é sua capacidade inédita de lidar com diálogos em dueto e com múltiplos interlocutores com precisão, mostrando notável robustez em clipes de vídeo de até 30 segundos.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$











