Lar
A Tongyi, do Alibaba, lança o Fun-CineForge: modelo de IA de código aberto alcança síntese de voz com qualidade cinematográfica
O Alibaba Tongyi Lab lançou oficialmente e disponibilizou como código aberto, em 16 de março, o modelo multimodal de síntese de voz para múltiplos cenários e com qualidade cinematográfica, denominado Fun-CineForge. Esse modelo aborda os principais desafios da dublagem por IA, incluindo a falta de sincronização labial, a ausência de expressão emocional e as características vocais inconsistentes entre vários personagens. Ele também apresenta um método de alta qualidade para a construção de conjuntos de dados.

Tecnicamente, o Fun-CineForge é pioneiro no conceito de “modalidade temporal”. Ao contrário dos modelos convencionais que se concentram exclusivamente em texto ou imagens, ele garante que a síntese de voz ocorra em intervalos de tempo precisos por meio de um controle preciso de marcações de tempo. Mesmo em cenas cinematográficas complexas com personagens ocultos, cortes frequentes de câmera ou rostos desfocados, o modelo mantém um alto grau de sincronização audiovisual e adesão às instruções.
O pipeline de construção do conjunto de dados CineDub de código aberto que o acompanha é outra inovação fundamental. O Tongyi Lab empregou o raciocínio em cadeia de pensamento de grandes modelos de linguagem para transformar automaticamente filmagens brutas em dados estruturados, reduzindo significativamente a necessidade de anotação manual. Esse processo alcança uma taxa de erro de palavras de aproximadamente 1% e uma taxa de erro de diarização de falantes de apenas 1,20%, fornecendo uma base de treinamento altamente competitiva para grandes modelos.

O Fun-CineForge já está disponível no GitHub, HuggingFace e na comunidade ModelScope, oferecendo suporte à inferência para clipes de vídeo de até 30 segundos de duração. Ele se destaca não apenas em monólogos de um único locutor, mas também oferece suporte de nível profissional para cenários de diálogos em dueto e com múltiplos locutores. Esse avanço sinaliza a evolução da tecnologia de voz com IA, passando de funções básicas de atendimento ao cliente e assistência para a pós-produção de animações e filmes de alto padrão.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Artigo relacionado
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Recomendações de tópicos especiais relacionados
Comentários (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
O Alibaba Tongyi Lab lançou oficialmente e disponibilizou como código aberto, em 16 de março, o modelo multimodal de síntese de voz para múltiplos cenários e com qualidade cinematográfica, denominado Fun-CineForge. Esse modelo aborda os principais desafios da dublagem por IA, incluindo a falta de sincronização labial, a ausência de expressão emocional e as características vocais inconsistentes entre vários personagens. Ele também apresenta um método de alta qualidade para a construção de conjuntos de dados.

Tecnicamente, o Fun-CineForge é pioneiro no conceito de “modalidade temporal”. Ao contrário dos modelos convencionais que se concentram exclusivamente em texto ou imagens, ele garante que a síntese de voz ocorra em intervalos de tempo precisos por meio de um controle preciso de marcações de tempo. Mesmo em cenas cinematográficas complexas com personagens ocultos, cortes frequentes de câmera ou rostos desfocados, o modelo mantém um alto grau de sincronização audiovisual e adesão às instruções.
O pipeline de construção do conjunto de dados CineDub de código aberto que o acompanha é outra inovação fundamental. O Tongyi Lab empregou o raciocínio em cadeia de pensamento de grandes modelos de linguagem para transformar automaticamente filmagens brutas em dados estruturados, reduzindo significativamente a necessidade de anotação manual. Esse processo alcança uma taxa de erro de palavras de aproximadamente 1% e uma taxa de erro de diarização de falantes de apenas 1,20%, fornecendo uma base de treinamento altamente competitiva para grandes modelos.

O Fun-CineForge já está disponível no GitHub, HuggingFace e na comunidade ModelScope, oferecendo suporte à inferência para clipes de vídeo de até 30 segundos de duração. Ele se destaca não apenas em monólogos de um único locutor, mas também oferece suporte de nível profissional para cenários de diálogos em dueto e com múltiplos locutores. Esse avanço sinaliza a evolução da tecnologia de voz com IA, passando de funções básicas de atendimento ao cliente e assistência para a pós-produção de animações e filmes de alto padrão.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











