Maison
Tongyi, filiale d'Alibaba, dévoile Fun-CineForge : un modèle d'IA open source capable de produire une synthèse vocale de qualité cinématographique
Le 16 mars, Alibaba Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge, un modèle multimodal de synthèse vocale de qualité cinématographique adapté à de multiples scénarios. Ce modèle s'attaque aux principaux défis du doublage par IA, notamment le décalage entre les lèvres et la voix, le manque d'expression émotionnelle et l'incohérence des caractéristiques vocales entre plusieurs personnages. Il propose également une méthode de haute qualité pour la construction d'ensembles de données.

Sur le plan technique, Fun-CineForge est le pionnier du concept de « modalité temporelle ». Contrairement aux modèles conventionnels qui se concentrent uniquement sur le texte ou les visuels, il garantit que la synthèse vocale s'effectue dans des intervalles de temps précis grâce à un contrôle précis des horodatages. Même dans des scènes de film complexes comportant des personnages masqués, des changements fréquents de plan ou des visages flous, le modèle maintient un haut degré de synchronisation audiovisuelle et de respect des instructions.
Le pipeline de construction de l'ensemble de données open source CineDub qui l'accompagne constitue une autre innovation majeure. Le laboratoire Tongyi a utilisé le raisonnement par chaîne de pensée des grands modèles linguistiques pour transformer automatiquement les séquences brutes de films en données structurées, réduisant ainsi considérablement le besoin d'annotation manuelle. Ce processus atteint un taux d'erreur sur les mots d'environ 1 % et un taux d'erreur de diarisation des locuteurs de seulement 1,20 %, offrant ainsi une base d'entraînement hautement compétitive pour les grands modèles.

Fun-CineForge est désormais disponible sur GitHub, HuggingFace et la communauté ModelScope, et prend en charge l'inférence pour des clips vidéo d'une durée maximale de 30 secondes. Il excelle non seulement dans les monologues à locuteur unique, mais offre également une prise en charge de niveau professionnel pour les scénarios de dialogues en duo et à locuteurs multiples. Cette avancée marque l'évolution de la technologie vocale IA, qui passe de rôles basiques de service client et d'assistant à des applications de post-production cinématographique et d'animation de haut niveau.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
Le 16 mars, Alibaba Tongyi Lab a officiellement lancé et mis en open source Fun-CineForge, un modèle multimodal de synthèse vocale de qualité cinématographique adapté à de multiples scénarios. Ce modèle s'attaque aux principaux défis du doublage par IA, notamment le décalage entre les lèvres et la voix, le manque d'expression émotionnelle et l'incohérence des caractéristiques vocales entre plusieurs personnages. Il propose également une méthode de haute qualité pour la construction d'ensembles de données.

Sur le plan technique, Fun-CineForge est le pionnier du concept de « modalité temporelle ». Contrairement aux modèles conventionnels qui se concentrent uniquement sur le texte ou les visuels, il garantit que la synthèse vocale s'effectue dans des intervalles de temps précis grâce à un contrôle précis des horodatages. Même dans des scènes de film complexes comportant des personnages masqués, des changements fréquents de plan ou des visages flous, le modèle maintient un haut degré de synchronisation audiovisuelle et de respect des instructions.
Le pipeline de construction de l'ensemble de données open source CineDub qui l'accompagne constitue une autre innovation majeure. Le laboratoire Tongyi a utilisé le raisonnement par chaîne de pensée des grands modèles linguistiques pour transformer automatiquement les séquences brutes de films en données structurées, réduisant ainsi considérablement le besoin d'annotation manuelle. Ce processus atteint un taux d'erreur sur les mots d'environ 1 % et un taux d'erreur de diarisation des locuteurs de seulement 1,20 %, offrant ainsi une base d'entraînement hautement compétitive pour les grands modèles.

Fun-CineForge est désormais disponible sur GitHub, HuggingFace et la communauté ModelScope, et prend en charge l'inférence pour des clips vidéo d'une durée maximale de 30 secondes. Il excelle non seulement dans les monologues à locuteur unique, mais offre également une prise en charge de niveau professionnel pour les scénarios de dialogues en duo et à locuteurs multiples. Cette avancée marque l'évolution de la technologie vocale IA, qui passe de rôles basiques de service client et d'assistant à des applications de post-production cinématographique et d'animation de haut niveau.
GitHub : https://github.com/FunAudioLLM/FunCineForge
HuggingFace : https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope : https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











