Maison
Le laboratoire Tongyi d'Alibaba met Fun-CineForge en open source et relève le défi du doublage multilingue
Le doublage vocal traditionnel basé sur l'IA se révèle souvent insuffisant dans les productions à fort enjeu telles que les films et les animations, où il est primordial de saisir les nuances émotionnelles et d'assurer une synchronisation parfaite des mouvements des lèvres. Pour relever ce défi majeur du secteur, Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge , un modèle de doublage multimodal révolutionnaire de qualité cinématographique, adapté à de multiples scénarios.
Combler le fossé audiovisuel : un cadre en quatre piliers pour une synchronisation parfaite
Plutôt que de s'appuyer sur une simple synthèse vocale, Fun-CineForge est conçu pour maîtriser quatre dimensions essentielles du doublage professionnel :
Synchronisation labiale : garantit que la parole synthétisée s'aligne avec une précision exceptionnelle sur les mouvements de la bouche des personnages à l'écran.
Expression émotionnelle : insuffle à la voix des émotions authentiques, semblables à celles d'un être humain, en analysant les expressions faciales et les instructions contextuelles.
Cohérence vocale : maintient une identité vocale stable et reconnaissable pour des personnages spécifiques dans des scènes de dialogue complexes impliquant plusieurs locuteurs.
Alignement temporel : permet l'insertion de dialogues avec une précision à la milliseconde près, même lorsque le locuteur est hors champ ou partiellement masqué.
Innovation fondamentale : la « modalité temporelle » pionnière et un ensemble de données haute fidélité
Le bond en avant technique de Fun-CineForge découle de sa philosophie unique de co-conception « données + modèle » :

L'ensemble de données haute qualité CineDub : le laboratoire Tongyi a également mis en open source le pipeline automatisé de construction de l'ensemble de données CineDub. Grâce à un mécanisme de correction d'erreurs par chaîne de pensée, il réduit les taux d'erreurs de transcription pour les textes en chinois et en anglais à environ 1 % - 2 % et ramène les erreurs de diarisation des locuteurs à seulement 1,2 %.
Architecture de fusion à quatre modalités : le modèle est le premier à intégrer une « modalité temporelle », modélisant conjointement les entrées visuelles (forme des lèvres et expression), le texte (dialogue et contexte émotionnel) et l'audio (référence vocale). Cette fusion permet une synchronisation parfaite dans les scènes difficiles, y compris celles où les visages ne sont pas visibles.
Excellence démontrée : un doublage de dialogues à plusieurs personnages authentique et novateur
Les résultats des tests de performance montrent que Fun-CineForge surpasse largement les modèles de référence tels que DeepDubber-V1 sur des indicateurs clés : taux d'erreur sur les mots (WER/CER), synchronisation labiale (LSE-C/D) et similarité vocale. Une avancée majeure réside dans sa capacité unique à gérer avec précision les dialogues en duo et à plusieurs personnages, faisant preuve d'une robustesse remarquable sur des clips vidéo pouvant atteindre 30 secondes.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Article connexe
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA
Pour faire face à l'afflux de rapports de sécurité de faible qualité produits par des outils d'automatisation basés sur l'intelligence artificielle, six grandes entreprises technologiques — Anthropic, Amazon (AWS), GitHub, Google, Microsoft et OpenAI
Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne
Ce matin, le PDG d’OpenAI, Sam Altman, a pris la parole pour répondre au procès intenté par l’ancien cofondateur Elon Musk, qui conteste la structure corporative de l’entreprise.Interrogé sur l’allégation de Musk selon laquelle d’autres fondateurs «
Recommandations de sujets spéciaux liés
commentaires (0)
Le doublage vocal traditionnel basé sur l'IA se révèle souvent insuffisant dans les productions à fort enjeu telles que les films et les animations, où il est primordial de saisir les nuances émotionnelles et d'assurer une synchronisation parfaite des mouvements des lèvres. Pour relever ce défi majeur du secteur, Tongyi Lab a officiellement lancé et mis en open source
Combler le fossé audiovisuel : un cadre en quatre piliers pour une synchronisation parfaite
Plutôt que de s'appuyer sur une simple synthèse vocale, Fun-CineForge est conçu pour maîtriser quatre dimensions essentielles du doublage professionnel :
Synchronisation labiale : garantit que la parole synthétisée s'aligne avec une précision exceptionnelle sur les mouvements de la bouche des personnages à l'écran.
Expression émotionnelle : insuffle à la voix des émotions authentiques, semblables à celles d'un être humain, en analysant les expressions faciales et les instructions contextuelles.
Cohérence vocale : maintient une identité vocale stable et reconnaissable pour des personnages spécifiques dans des scènes de dialogue complexes impliquant plusieurs locuteurs.
Alignement temporel : permet l'insertion de dialogues avec une précision à la milliseconde près, même lorsque le locuteur est hors champ ou partiellement masqué.
Innovation fondamentale : la « modalité temporelle » pionnière et un ensemble de données haute fidélité
Le bond en avant technique de Fun-CineForge découle de sa philosophie unique de co-conception « données + modèle » :

L'ensemble de données haute qualité CineDub : le laboratoire Tongyi a également mis en open source le pipeline automatisé de construction de l'ensemble de données CineDub. Grâce à un mécanisme de correction d'erreurs par chaîne de pensée, il réduit les taux d'erreurs de transcription pour les textes en chinois et en anglais à environ 1 % - 2 % et ramène les erreurs de diarisation des locuteurs à seulement 1,2 %.
Architecture de fusion à quatre modalités : le modèle est le premier à intégrer une « modalité temporelle », modélisant conjointement les entrées visuelles (forme des lèvres et expression), le texte (dialogue et contexte émotionnel) et l'audio (référence vocale). Cette fusion permet une synchronisation parfaite dans les scènes difficiles, y compris celles où les visages ne sont pas visibles.
Excellence démontrée : un doublage de dialogues à plusieurs personnages authentique et novateur
Les résultats des tests de performance montrent que Fun-CineForge surpasse largement les modèles de référence tels que DeepDubber-V1 sur des indicateurs clés : taux d'erreur sur les mots (WER/CER), synchronisation labiale (LSE-C/D) et similarité vocale. Une avancée majeure réside dans sa capacité unique à gérer avec précision les dialogues en duo et à plusieurs personnages, faisant preuve d'une robustesse remarquable sur des clips vidéo pouvant atteindre 30 secondes.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Six géants de la technologie soutiennent la Linux Foundation avec 12,5 millions de dollars pour faire face au bruit des vulnérabilités de l'IA
Pour faire face à l'afflux de rapports de sécurité de faible qualité produits par des outils d'automatisation basés sur l'intelligence artificielle, six grandes entreprises technologiques — Anthropic, Amazon (AWS), GitHub, Google, Microsoft et OpenAI
Musk envisageait de laisser OpenAI à ses enfants alors qu'Altman témoigne
Ce matin, le PDG d’OpenAI, Sam Altman, a pris la parole pour répondre au procès intenté par l’ancien cofondateur Elon Musk, qui conteste la structure corporative de l’entreprise.Interrogé sur l’allégation de Musk selon laquelle d’autres fondateurs «











