Maison
Math SOTA 27B et clonage émotionnel en 3 secondes : Youdao open-source le moteur multimodal et de synthèse vocale Zi Yue 4
NetEase Youdao a récemment annoncé une mise à jour complète de son grand modèle « Confucius4 », qui passe à la version 4.0. Désormais entièrement multimodal, Confucius4 prend en charge les interactions intégrées entre texte, image et audio. Youdao a également mis en open source ses modèles multimodaux et de synthèse vocale (TTS) de base, tandis que le modèle de traduction a fait l’objet d’une refonte technique en profondeur, apportant des améliorations tant en termes de qualité que d’efficacité.
Le modèle multimodal atteint le niveau SOTA (State of the Art) en vision et en mathématiques, avec des performances supérieures sur les problèmes mathématiques en texte brut
Selon l’annonce, le modèle multimodal open source Confucius4, doté de 27 milliards de paramètres, a porté les capacités mathématiques basées sur des entrées visuelles à un niveau de pointe (SOTA) dans les contextes éducatifs. Parmi les modèles d’une échelle similaire, Confucius4 excelle dans le traitement de problèmes mathématiques et physiques visuels avancés intégrant des graphiques. Il affiche également une amélioration significative sur les problèmes mathématiques en texte pur en chinois, atteignant une précision de 81,4 %, ce qui est à la pointe du secteur.

▲ Confucius4 obtient les meilleurs résultats de sa catégorie sur plusieurs benchmarks de mathématiques visuelles parmi les modèles de même envergure
Source de l’image : https://huggingface.co/netease-youdao/Confucius4
Une avancée encore plus décisive réside dans sa rentabilité pratique. Selon les responsables concernés, ce nouveau modèle utilise un schéma perfectionné de reconstruction de la chaîne de raisonnement. En regroupant un volume important d’exemples de raisonnement concis et de haute qualité pour une optimisation en profondeur, il réduit la longueur de la chaîne de raisonnement de 43,2 %.
Cela signifie qu’il peut fournir des réponses plus rapidement, avec moins de tokens et des chemins de raisonnement plus courts, ce qui réduit considérablement les coûts d’inférence dans les scénarios métier réels pour les entreprises et les développeurs.

▲ Confucius4 réduit considérablement le nombre de tokens de sortie sur plusieurs benchmarks mathématiques visuels
Source de l’image : https://huggingface.co/netease-youdao/Confucius4
De plus, l’équipe de recherche de Confucius4 a profondément optimisé le modèle pour les scénarios concrets de devoirs, d’examens et de résolution de problèmes auxquels sont confrontés les élèves chinois. Cela lui permet de relever des défis d’apprentissage authentiques, ce qui en fait un assistant numérique plus empathique.
Synthèse vocale open source : prend en charge 14 langues, reproduit la voix d’origine en 3 secondes sans problème d’accent, quelle que soit la langue
Parallèlement au modèle multimodal, le moteur de synthèse vocale (TTS) a également été mis en open source. Reposant sur une architecture de pointe « encodeur vocal + LLM », il offre aux développeurs et aux créateurs de contenu des capacités de clonage vocal et de synthèse émotionnelle « zero-shot » et faciles d’accès.
Actuellement, il prend entièrement en charge 14 langues : le chinois, l’anglais, le japonais, le coréen, l’allemand, le français, l’espagnol, l’indonésien, l’italien, le thaï, le portugais, le russe, le malais et le vietnamien. Le système est capable de transposer naturellement la voix d’un locuteur d’une langue à l’autre sans apprentissage supplémentaire, en préservant la cohérence vocale tout en garantissant que les résultats synthétisés sonnent de manière naturelle et fluide, sans aucune trace d’accent lors du clonage interlinguistique.
En matière de clonage vocal, Confucius4 offre une prise en charge complète du principe « télécharger et cloner ». Il suffit aux utilisateurs de fournir un enregistrement audio quelconque pour que le système reproduise la voix d’origine en moins de trois secondes. Selon l’annonce, la précision du moteur pour les tâches de clonage dépasse 97 %, et la similitude entre la voix clonée et la voix d’origine est supérieure à 85 %. Il préserve les caractéristiques vocales uniques du locuteur tout en reproduisant fidèlement sa tonalité émotionnelle, avec des capacités complètes qui le classent parmi les meilleurs du secteur.
De plus, ce modèle open source fait preuve d’une grande robustesse dans des scénarios multilingues réels. Il peut répondre à divers besoins de synthèse, notamment les conversations quotidiennes, les bulletins d’information, les promotions d’entreprise et les expressions émotionnelles complexes.
Qualité du modèle de traduction améliorée de manière globale, avec une vitesse d’inférence 80 % plus rapide
En tant que l’un des atouts technologiques les plus ancrés de Youdao, le modèle de traduction a également bénéficié d’améliorations techniques significatives dans cette mise à jour, renforçant encore ses performances dans les tâches de traduction.
En ce qui concerne les données, l’équipe Confucius a collecté et nettoyé des milliards d’éléments multilingues et a fait appel à des professionnels certifiés TEM-8 pour une évaluation manuelle multidimensionnelle, garantissant ainsi des corpus de haute qualité dès le départ.
Du point de vue algorithmique, le modèle utilise un mode innovant « OPD multi-experts », adoptant une « approche souple » plus intelligente pour tirer parti des atouts de divers experts. Il introduit également des mécanismes de récompense de format et de détection de langue via l’apprentissage par renforcement, résolvant ainsi efficacement les problèmes courants tels que les traductions hors contexte et les résultats en langues mélangées dans la traduction automatique.
Pour répondre aux exigences des applications industrielles à haute fréquence et à forte concurrence, le modèle de traduction mis à jour est doté d’un mécanisme d’accélération efficace qui augmente directement la vitesse globale d’inférence de 80 %. Associé à une solution sur mesure combinant l’évaluation automatisée de grands modèles et l’échantillonnage manuel aléatoire, ce modèle de traduction de nouvelle génération atteint des niveaux extrêmement élevés de rapidité et de qualité dans de multiples scénarios, notamment la traduction de textes, d’images et de documents.
En retraçant le parcours de Youdao dans le domaine de l’IA, depuis le lancement initial de Confucius, premier grand modèle axé sur l’éducation, en passant par l’introduction du « coach vocal virtuel Hi Echo » qui a bouleversé les méthodes traditionnelles d’entraînement à l’expression orale, jusqu’à l’intégration complète de Confucius 2.0 et 3.0 dans des écosystèmes logiciels et matériels, Youdao a toujours été à la pointe de l’application de l’IA dans des scénarios concrets. En 2026, Youdao a accéléré l’application de l’IA grâce à une série de produits d’agents IA tels que LobsterAI, Youdao Treasure, Youdao Conference Agent et Thinkflow, mettant ainsi en place une matrice d’agents IA avant-gardiste couvrant tous les scénarios.
La mise à niveau de Confucius 4 et l’ouverture totale du code source des modèles de base réduisent non seulement considérablement les obstacles pour les développeurs dans les domaines multimodaux et de la synthèse vocale, mais illustrent également un cycle écologique fermé dans lequel les technologies de base sous-jacentes alimentent les matrices d’agents des couches supérieures. Youdao espère que, grâce aux contributions conjointes des développeurs du monde entier et de la communauté open source, cet écosystème de grands modèles multimodaux déclenchera une véritable transformation de la productivité dans un large éventail de secteurs.
Annexe : adresses open source :
Modèle multimodal « Confucius4 » : https://huggingface.co/netease-youdao/Confucius4
Modèle TTS « Confucius4 » : https://github.com/netease-youdao/Confucius4-TTS
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)
NetEase Youdao a récemment annoncé une mise à jour complète de son grand modèle « Confucius4 », qui passe à la version 4.0. Désormais entièrement multimodal, Confucius4 prend en charge les interactions intégrées entre texte, image et audio. Youdao a également mis en open source ses modèles multimodaux et de synthèse vocale (TTS) de base, tandis que le modèle de traduction a fait l’objet d’une refonte technique en profondeur, apportant des améliorations tant en termes de qualité que d’efficacité.
Le modèle multimodal atteint le niveau SOTA (State of the Art) en vision et en mathématiques, avec des performances supérieures sur les problèmes mathématiques en texte brut
Selon l’annonce, le modèle multimodal open source Confucius4, doté de 27 milliards de paramètres, a porté les capacités mathématiques basées sur des entrées visuelles à un niveau de pointe (SOTA) dans les contextes éducatifs. Parmi les modèles d’une échelle similaire, Confucius4 excelle dans le traitement de problèmes mathématiques et physiques visuels avancés intégrant des graphiques. Il affiche également une amélioration significative sur les problèmes mathématiques en texte pur en chinois, atteignant une précision de 81,4 %, ce qui est à la pointe du secteur.

▲ Confucius4 obtient les meilleurs résultats de sa catégorie sur plusieurs benchmarks de mathématiques visuelles parmi les modèles de même envergure
Source de l’image : https://huggingface.co/netease-youdao/Confucius4
Une avancée encore plus décisive réside dans sa rentabilité pratique. Selon les responsables concernés, ce nouveau modèle utilise un schéma perfectionné de reconstruction de la chaîne de raisonnement. En regroupant un volume important d’exemples de raisonnement concis et de haute qualité pour une optimisation en profondeur, il réduit la longueur de la chaîne de raisonnement de 43,2 %.
Cela signifie qu’il peut fournir des réponses plus rapidement, avec moins de tokens et des chemins de raisonnement plus courts, ce qui réduit considérablement les coûts d’inférence dans les scénarios métier réels pour les entreprises et les développeurs.

▲ Confucius4 réduit considérablement le nombre de tokens de sortie sur plusieurs benchmarks mathématiques visuels
Source de l’image : https://huggingface.co/netease-youdao/Confucius4
De plus, l’équipe de recherche de Confucius4 a profondément optimisé le modèle pour les scénarios concrets de devoirs, d’examens et de résolution de problèmes auxquels sont confrontés les élèves chinois. Cela lui permet de relever des défis d’apprentissage authentiques, ce qui en fait un assistant numérique plus empathique.
Synthèse vocale open source : prend en charge 14 langues, reproduit la voix d’origine en 3 secondes sans problème d’accent, quelle que soit la langue
Parallèlement au modèle multimodal, le moteur de synthèse vocale (TTS) a également été mis en open source. Reposant sur une architecture de pointe « encodeur vocal + LLM », il offre aux développeurs et aux créateurs de contenu des capacités de clonage vocal et de synthèse émotionnelle « zero-shot » et faciles d’accès.
Actuellement, il prend entièrement en charge 14 langues : le chinois, l’anglais, le japonais, le coréen, l’allemand, le français, l’espagnol, l’indonésien, l’italien, le thaï, le portugais, le russe, le malais et le vietnamien. Le système est capable de transposer naturellement la voix d’un locuteur d’une langue à l’autre sans apprentissage supplémentaire, en préservant la cohérence vocale tout en garantissant que les résultats synthétisés sonnent de manière naturelle et fluide, sans aucune trace d’accent lors du clonage interlinguistique.
En matière de clonage vocal, Confucius4 offre une prise en charge complète du principe « télécharger et cloner ». Il suffit aux utilisateurs de fournir un enregistrement audio quelconque pour que le système reproduise la voix d’origine en moins de trois secondes. Selon l’annonce, la précision du moteur pour les tâches de clonage dépasse 97 %, et la similitude entre la voix clonée et la voix d’origine est supérieure à 85 %. Il préserve les caractéristiques vocales uniques du locuteur tout en reproduisant fidèlement sa tonalité émotionnelle, avec des capacités complètes qui le classent parmi les meilleurs du secteur.
De plus, ce modèle open source fait preuve d’une grande robustesse dans des scénarios multilingues réels. Il peut répondre à divers besoins de synthèse, notamment les conversations quotidiennes, les bulletins d’information, les promotions d’entreprise et les expressions émotionnelles complexes.
Qualité du modèle de traduction améliorée de manière globale, avec une vitesse d’inférence 80 % plus rapide
En tant que l’un des atouts technologiques les plus ancrés de Youdao, le modèle de traduction a également bénéficié d’améliorations techniques significatives dans cette mise à jour, renforçant encore ses performances dans les tâches de traduction.
En ce qui concerne les données, l’équipe Confucius a collecté et nettoyé des milliards d’éléments multilingues et a fait appel à des professionnels certifiés TEM-8 pour une évaluation manuelle multidimensionnelle, garantissant ainsi des corpus de haute qualité dès le départ.
Du point de vue algorithmique, le modèle utilise un mode innovant « OPD multi-experts », adoptant une « approche souple » plus intelligente pour tirer parti des atouts de divers experts. Il introduit également des mécanismes de récompense de format et de détection de langue via l’apprentissage par renforcement, résolvant ainsi efficacement les problèmes courants tels que les traductions hors contexte et les résultats en langues mélangées dans la traduction automatique.
Pour répondre aux exigences des applications industrielles à haute fréquence et à forte concurrence, le modèle de traduction mis à jour est doté d’un mécanisme d’accélération efficace qui augmente directement la vitesse globale d’inférence de 80 %. Associé à une solution sur mesure combinant l’évaluation automatisée de grands modèles et l’échantillonnage manuel aléatoire, ce modèle de traduction de nouvelle génération atteint des niveaux extrêmement élevés de rapidité et de qualité dans de multiples scénarios, notamment la traduction de textes, d’images et de documents.
En retraçant le parcours de Youdao dans le domaine de l’IA, depuis le lancement initial de Confucius, premier grand modèle axé sur l’éducation, en passant par l’introduction du « coach vocal virtuel Hi Echo » qui a bouleversé les méthodes traditionnelles d’entraînement à l’expression orale, jusqu’à l’intégration complète de Confucius 2.0 et 3.0 dans des écosystèmes logiciels et matériels, Youdao a toujours été à la pointe de l’application de l’IA dans des scénarios concrets. En 2026, Youdao a accéléré l’application de l’IA grâce à une série de produits d’agents IA tels que LobsterAI, Youdao Treasure, Youdao Conference Agent et Thinkflow, mettant ainsi en place une matrice d’agents IA avant-gardiste couvrant tous les scénarios.
La mise à niveau de Confucius 4 et l’ouverture totale du code source des modèles de base réduisent non seulement considérablement les obstacles pour les développeurs dans les domaines multimodaux et de la synthèse vocale, mais illustrent également un cycle écologique fermé dans lequel les technologies de base sous-jacentes alimentent les matrices d’agents des couches supérieures. Youdao espère que, grâce aux contributions conjointes des développeurs du monde entier et de la communauté open source, cet écosystème de grands modèles multimodaux déclenchera une véritable transformation de la productivité dans un large éventail de secteurs.
Annexe : adresses open source :
Modèle multimodal « Confucius4 » : https://huggingface.co/netease-youdao/Confucius4
Modèle TTS « Confucius4 » : https://github.com/netease-youdao/Confucius4-TTS
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











