Hogar
El laboratorio Tongyi de Alibaba publica el código fuente de Fun-CineForge y resuelve el reto del doblaje con varios locutores
El doblaje de voz tradicional basado en IA suele quedarse corto en producciones de gran envergadura, como películas y animaciones, donde es fundamental captar los matices emocionales más sutiles y lograr una sincronización perfecta de los movimientos labiales. Para hacer frente a este reto fundamental del sector, Tongyi Lab ha lanzado oficialmente y ha puesto a disposición como código abierto el innovador modelo de doblaje multimodal y para múltiples escenarios con calidad cinematográfica: Fun-CineForge .
Salvar la brecha audiovisual: un marco de cuatro pilares para una sincronización perfecta
En lugar de basarse en la simple conversión de texto a voz, Fun-CineForge está diseñado para dominar cuatro dimensiones fundamentales del doblaje profesional:
Sincronización labial: garantiza que el habla sintetizada se alinee con los movimientos de la boca de los personajes en pantalla con una precisión excepcional.
Expresión emocional: infunde a la voz emociones auténticas y humanas mediante el análisis de las señales faciales y las instrucciones contextuales.
Consistencia vocal: mantiene una identidad vocal estable y reconocible para personajes específicos en escenas complejas de diálogo con múltiples interlocutores.
Alineación temporal: permite la inserción de diálogos con una precisión de milisegundos, incluso cuando el hablante está fuera de pantalla o parcialmente oculto.
Innovación fundamental: la pionera «modalidad temporal» y un conjunto de datos de alta fidelidad
El salto técnico de Fun-CineForge se deriva de su filosofía única de diseño conjunto de «datos + modelo»:

El conjunto de datos de alta calidad de CineDub: Tongyi Lab también ha abierto el código fuente del proceso automatizado de construcción del conjunto de datos de CineDub. Utilizando un mecanismo de corrección de errores de cadena de pensamiento, reduce las tasas de error de transcripción para textos en chino e inglés a aproximadamente un 1 % - 2 % y reduce los errores de diarización de hablantes hasta un 1,2 %.
Arquitectura de fusión de cuatro modalidades: El modelo es pionero en la integración de una «modalidad temporal», modelando conjuntamente entradas visuales (forma de los labios y expresión), texto (diálogo y contexto emocional) y audio (referencia de voz). Esta fusión permite una sincronización exacta en escenas complejas, incluidas aquellas en las que no se ven los rostros.
Excelencia demostrada: doblaje pionero de diálogos auténticos con múltiples personajes
Los resultados de las pruebas comparativas demuestran que Fun-CineForge supera sustancialmente a modelos de referencia como DeepDubber-V1 en métricas clave: tasa de error de palabras (WER/CER), sincronización labial (LSE-C/D) y similitud de voz. Un logro histórico es su capacidad, única en su género, para manejar con precisión diálogos a dúo y entre varias personas, mostrando una notable solidez en clips de vídeo de hasta 30 segundos.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Artículo relacionado
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión
Seis gigantes tecnológicos respaldan a la Linux Foundation con 12,5 millones de dólares para abordar el ruido de las vulnerabilidades de la inteligencia artificial
Para hacer frente a la avalancha de informes de seguridad de baja calidad generados por herramientas de automatización de IA, seis grandes empresas tecnológicas—Anthropic, Amazon (AWS), GitHub, Google, Microsoft y OpenAI—han contribuido conjuntamente
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El doblaje de voz tradicional basado en IA suele quedarse corto en producciones de gran envergadura, como películas y animaciones, donde es fundamental captar los matices emocionales más sutiles y lograr una sincronización perfecta de los movimientos labiales. Para hacer frente a este reto fundamental del sector, Tongyi Lab ha lanzado oficialmente y ha puesto a disposición como código abierto el innovador modelo de doblaje multimodal y para múltiples escenarios con calidad cinematográfica:
Salvar la brecha audiovisual: un marco de cuatro pilares para una sincronización perfecta
En lugar de basarse en la simple conversión de texto a voz, Fun-CineForge está diseñado para dominar cuatro dimensiones fundamentales del doblaje profesional:
Sincronización labial: garantiza que el habla sintetizada se alinee con los movimientos de la boca de los personajes en pantalla con una precisión excepcional.
Expresión emocional: infunde a la voz emociones auténticas y humanas mediante el análisis de las señales faciales y las instrucciones contextuales.
Consistencia vocal: mantiene una identidad vocal estable y reconocible para personajes específicos en escenas complejas de diálogo con múltiples interlocutores.
Alineación temporal: permite la inserción de diálogos con una precisión de milisegundos, incluso cuando el hablante está fuera de pantalla o parcialmente oculto.
Innovación fundamental: la pionera «modalidad temporal» y un conjunto de datos de alta fidelidad
El salto técnico de Fun-CineForge se deriva de su filosofía única de diseño conjunto de «datos + modelo»:

El conjunto de datos de alta calidad de CineDub: Tongyi Lab también ha abierto el código fuente del proceso automatizado de construcción del conjunto de datos de CineDub. Utilizando un mecanismo de corrección de errores de cadena de pensamiento, reduce las tasas de error de transcripción para textos en chino e inglés a aproximadamente un 1 % - 2 % y reduce los errores de diarización de hablantes hasta un 1,2 %.
Arquitectura de fusión de cuatro modalidades: El modelo es pionero en la integración de una «modalidad temporal», modelando conjuntamente entradas visuales (forma de los labios y expresión), texto (diálogo y contexto emocional) y audio (referencia de voz). Esta fusión permite una sincronización exacta en escenas complejas, incluidas aquellas en las que no se ven los rostros.
Excelencia demostrada: doblaje pionero de diálogos auténticos con múltiples personajes
Los resultados de las pruebas comparativas demuestran que Fun-CineForge supera sustancialmente a modelos de referencia como DeepDubber-V1 en métricas clave: tasa de error de palabras (WER/CER), sincronización labial (LSE-C/D) y similitud de voz. Un logro histórico es su capacidad, única en su género, para manejar con precisión diálogos a dúo y entre varias personas, mostrando una notable solidez en clips de vídeo de hasta 30 segundos.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión
Seis gigantes tecnológicos respaldan a la Linux Foundation con 12,5 millones de dólares para abordar el ruido de las vulnerabilidades de la inteligencia artificial
Para hacer frente a la avalancha de informes de seguridad de baja calidad generados por herramientas de automatización de IA, seis grandes empresas tecnológicas—Anthropic, Amazon (AWS), GitHub, Google, Microsoft y OpenAI—han contribuido conjuntamente











