Hogar
Matemáticas 27B SOTA y clonación emocional en 3 segundos: Youdao lanza en código abierto el motor multimodal y de síntesis de voz Zi Yue 4
NetEase Youdao ha anunciado recientemente una actualización integral de su modelo a gran escala «Confucius4» a la versión 4.0. Ahora totalmente multimodal, Confucius4 admite interacciones integradas de texto, imagen y audio. Youdao también ha convertido en código abierto sus modelos principales multimodales y de síntesis de voz (TTS), mientras que el modelo de traducción ha sido objeto de una profunda revisión técnica, lo que ha supuesto mejoras tanto en calidad como en eficiencia.
El modelo multimodal alcanza el estado del arte (SOTA) en visión y matemáticas, con un rendimiento superior en problemas matemáticos de texto puro
Según el comunicado, el modelo multimodal de código abierto Confucius4, con 27 000 millones de parámetros, ha llevado las capacidades matemáticas basadas en entradas visuales a un nivel líder en el sector (SOTA) en entornos educativos. Entre los modelos de escala similar, Confucius4 destaca en el tratamiento de problemas avanzados de matemáticas y física visuales que incorporan gráficos. También muestra una mejora significativa en los problemas matemáticos en chino basados en texto puro, alcanzando una precisión del 81,4 %, lo que lo sitúa a la vanguardia del sector.

▲ Confucius4 obtiene los mejores resultados de su clase en múltiples pruebas de referencia de matemáticas visuales entre modelos de la misma escala
Fuente de la imagen: https://huggingface.co/netease-youdao/Confucius4
Un avance aún más importante radica en la rentabilidad práctica. Según los responsables pertinentes, el nuevo modelo emplea un esquema perfeccionado de reconstrucción de la cadena de razonamiento. Al agregar un gran volumen de muestras de razonamiento concisas y de alta calidad para una optimización profunda, comprime la longitud de salida de la cadena de razonamiento en un 43,2 %.
Esto significa que puede ofrecer respuestas más rápidamente con menos tokens y rutas de razonamiento más cortas, lo que reduce significativamente los costes de inferencia en escenarios empresariales reales tanto para empresas como para desarrolladores.

▲ Confucius4 reduce significativamente los tokens de salida en múltiples pruebas de referencia de matemáticas visuales
Fuente de la imagen: https://huggingface.co/netease-youdao/Confucius4
Además, el equipo de investigación de Confucius4 ha optimizado en profundidad el modelo para situaciones reales de deberes, exámenes y resolución de problemas a las que se enfrentan los estudiantes chinos. Esto le permite abordar retos de aprendizaje auténticos, lo que lo convierte en un asistente digital más empático.
TTS de código abierto: admite 14 idiomas y reproduce la voz original en 3 segundos sin problemas de acento entre idiomas
Junto con el modelo multimodal, el motor de síntesis de voz (TTS) también se ha convertido en código abierto. Basado en una arquitectura de vanguardia de «codificador de voz + LLM», ofrece a los desarrolladores y creadores de contenido capacidades de clonación de voz y síntesis emocional «zero-shot» y de fácil acceso.
Actualmente, es totalmente compatible con 14 idiomas: chino, inglés, japonés, coreano, alemán, francés, español, indonesio, italiano, tailandés, portugués, ruso, malayo y vietnamita. El sistema puede transferir de forma natural la voz de un hablante a diferentes idiomas sin necesidad de entrenamiento adicional, manteniendo la coherencia de la voz y garantizando que los resultados sintetizados suenen naturales y fluidos, sin que se perciba ningún acento durante la clonación entre idiomas.
En cuanto a la clonación de voz, Confucius4 ofrece compatibilidad total con la función «subir y clonar». Los usuarios solo tienen que proporcionar cualquier material de audio y el sistema replica la voz original en tres segundos. Según el comunicado, la precisión del motor en las tareas de clonación supera el 97 %, y la similitud entre la voz clonada y la original es superior al 85 %. Conserva las características vocales únicas del hablante al tiempo que reproduce con precisión su tono emocional, con capacidades integrales que se sitúan entre las mejores del sector.
Además, este modelo de código abierto demuestra una gran solidez en escenarios multilingües reales. Es capaz de satisfacer diversas necesidades de síntesis, incluyendo conversaciones cotidianas, noticiarios, promociones corporativas y expresiones emocionales complejas.
La calidad del modelo de traducción se ha mejorado de forma integral, con una velocidad de inferencia un 80 % más rápida
Como uno de los activos tecnológicos más arraigados de Youdao, el modelo de traducción también ha recibido importantes mejoras técnicas en esta actualización, lo que ha potenciado aún más su rendimiento en las tareas de traducción.
En cuanto a los datos, el equipo de Confucius recopiló y depuró miles de millones de elementos multilingües y contrató a profesionales con certificación TEM-8 para llevar a cabo una evaluación manual multidimensional, lo que garantizó corpus de alta calidad desde el principio.
En cuanto a los algoritmos, el modelo utiliza un innovador modo «OPD multiexperto», que adopta un «enfoque flexible» más inteligente para aprovechar los puntos fuertes de diversos expertos. También introduce recompensas por formato y mecanismos de detección de idiomas mediante el aprendizaje por refuerzo, lo que resuelve de forma eficaz problemas comunes como las traducciones fuera de contexto y los resultados con mezcla de idiomas en la traducción automática.
Para satisfacer las exigencias de las aplicaciones industriales de alta frecuencia y alta concurrencia, el modelo de traducción actualizado está equipado con un eficiente mecanismo de aceleración que aumenta directamente la velocidad de inferencia global en un 80 %. En combinación con una solución personalizada de evaluación automatizada de modelos de gran tamaño y muestreo manual aleatorio, el modelo de traducción de nueva generación demuestra unos estándares extremadamente altos de velocidad y calidad en múltiples escenarios, incluyendo la traducción de texto, imágenes y documentos.
Al reflexionar sobre la trayectoria de Youdao en el ámbito de la IA, desde el lanzamiento inicial de Confucius como primer modelo a gran escala centrado en la educación, pasando por la introducción del «entrenador virtual de expresión oral Hi Echo», que revolucionó los métodos tradicionales de práctica oral, hasta la integración integral de Confucius 2.0 y 3.0 en ecosistemas de software y hardware, Youdao ha liderado de forma constante el aprovechamiento de la IA en escenarios del mundo real. En 2026, Youdao aceleró la aplicación de la IA con una serie de productos de agentes de IA, como LobsterAI, Youdao Treasure, Youdao Conference Agent y Thinkflow, creando una matriz de agentes de IA con visión de futuro para todo tipo de escenarios.
La actualización de Confucius 4 y la apertura total del código fuente de los modelos centrales no solo reducen significativamente las barreras para los desarrolladores en los campos multimodal y de síntesis de voz, sino que también demuestran un ciclo cerrado ecológico en el que las tecnologías centrales subyacentes alimentan las matrices de agentes de las capas superiores. Youdao espera que, con las contribuciones conjuntas de los desarrolladores de todo el mundo y de la comunidad de código abierto, este ecosistema de modelos grandes multimodales impulse una verdadera transformación de la productividad en una amplia gama de sectores.
Apéndice: Direcciones de código abierto:
Modelo multimodal «Confucius4»: https://huggingface.co/netease-youdao/Confucius4
Modelo TTS «Confucius4»: https://github.com/netease-youdao/Confucius4-TTS
Artículo relacionado
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
NetEase Youdao ha anunciado recientemente una actualización integral de su modelo a gran escala «Confucius4» a la versión 4.0. Ahora totalmente multimodal, Confucius4 admite interacciones integradas de texto, imagen y audio. Youdao también ha convertido en código abierto sus modelos principales multimodales y de síntesis de voz (TTS), mientras que el modelo de traducción ha sido objeto de una profunda revisión técnica, lo que ha supuesto mejoras tanto en calidad como en eficiencia.
El modelo multimodal alcanza el estado del arte (SOTA) en visión y matemáticas, con un rendimiento superior en problemas matemáticos de texto puro
Según el comunicado, el modelo multimodal de código abierto Confucius4, con 27 000 millones de parámetros, ha llevado las capacidades matemáticas basadas en entradas visuales a un nivel líder en el sector (SOTA) en entornos educativos. Entre los modelos de escala similar, Confucius4 destaca en el tratamiento de problemas avanzados de matemáticas y física visuales que incorporan gráficos. También muestra una mejora significativa en los problemas matemáticos en chino basados en texto puro, alcanzando una precisión del 81,4 %, lo que lo sitúa a la vanguardia del sector.

▲ Confucius4 obtiene los mejores resultados de su clase en múltiples pruebas de referencia de matemáticas visuales entre modelos de la misma escala
Fuente de la imagen: https://huggingface.co/netease-youdao/Confucius4
Un avance aún más importante radica en la rentabilidad práctica. Según los responsables pertinentes, el nuevo modelo emplea un esquema perfeccionado de reconstrucción de la cadena de razonamiento. Al agregar un gran volumen de muestras de razonamiento concisas y de alta calidad para una optimización profunda, comprime la longitud de salida de la cadena de razonamiento en un 43,2 %.
Esto significa que puede ofrecer respuestas más rápidamente con menos tokens y rutas de razonamiento más cortas, lo que reduce significativamente los costes de inferencia en escenarios empresariales reales tanto para empresas como para desarrolladores.

▲ Confucius4 reduce significativamente los tokens de salida en múltiples pruebas de referencia de matemáticas visuales
Fuente de la imagen: https://huggingface.co/netease-youdao/Confucius4
Además, el equipo de investigación de Confucius4 ha optimizado en profundidad el modelo para situaciones reales de deberes, exámenes y resolución de problemas a las que se enfrentan los estudiantes chinos. Esto le permite abordar retos de aprendizaje auténticos, lo que lo convierte en un asistente digital más empático.
TTS de código abierto: admite 14 idiomas y reproduce la voz original en 3 segundos sin problemas de acento entre idiomas
Junto con el modelo multimodal, el motor de síntesis de voz (TTS) también se ha convertido en código abierto. Basado en una arquitectura de vanguardia de «codificador de voz + LLM», ofrece a los desarrolladores y creadores de contenido capacidades de clonación de voz y síntesis emocional «zero-shot» y de fácil acceso.
Actualmente, es totalmente compatible con 14 idiomas: chino, inglés, japonés, coreano, alemán, francés, español, indonesio, italiano, tailandés, portugués, ruso, malayo y vietnamita. El sistema puede transferir de forma natural la voz de un hablante a diferentes idiomas sin necesidad de entrenamiento adicional, manteniendo la coherencia de la voz y garantizando que los resultados sintetizados suenen naturales y fluidos, sin que se perciba ningún acento durante la clonación entre idiomas.
En cuanto a la clonación de voz, Confucius4 ofrece compatibilidad total con la función «subir y clonar». Los usuarios solo tienen que proporcionar cualquier material de audio y el sistema replica la voz original en tres segundos. Según el comunicado, la precisión del motor en las tareas de clonación supera el 97 %, y la similitud entre la voz clonada y la original es superior al 85 %. Conserva las características vocales únicas del hablante al tiempo que reproduce con precisión su tono emocional, con capacidades integrales que se sitúan entre las mejores del sector.
Además, este modelo de código abierto demuestra una gran solidez en escenarios multilingües reales. Es capaz de satisfacer diversas necesidades de síntesis, incluyendo conversaciones cotidianas, noticiarios, promociones corporativas y expresiones emocionales complejas.
La calidad del modelo de traducción se ha mejorado de forma integral, con una velocidad de inferencia un 80 % más rápida
Como uno de los activos tecnológicos más arraigados de Youdao, el modelo de traducción también ha recibido importantes mejoras técnicas en esta actualización, lo que ha potenciado aún más su rendimiento en las tareas de traducción.
En cuanto a los datos, el equipo de Confucius recopiló y depuró miles de millones de elementos multilingües y contrató a profesionales con certificación TEM-8 para llevar a cabo una evaluación manual multidimensional, lo que garantizó corpus de alta calidad desde el principio.
En cuanto a los algoritmos, el modelo utiliza un innovador modo «OPD multiexperto», que adopta un «enfoque flexible» más inteligente para aprovechar los puntos fuertes de diversos expertos. También introduce recompensas por formato y mecanismos de detección de idiomas mediante el aprendizaje por refuerzo, lo que resuelve de forma eficaz problemas comunes como las traducciones fuera de contexto y los resultados con mezcla de idiomas en la traducción automática.
Para satisfacer las exigencias de las aplicaciones industriales de alta frecuencia y alta concurrencia, el modelo de traducción actualizado está equipado con un eficiente mecanismo de aceleración que aumenta directamente la velocidad de inferencia global en un 80 %. En combinación con una solución personalizada de evaluación automatizada de modelos de gran tamaño y muestreo manual aleatorio, el modelo de traducción de nueva generación demuestra unos estándares extremadamente altos de velocidad y calidad en múltiples escenarios, incluyendo la traducción de texto, imágenes y documentos.
Al reflexionar sobre la trayectoria de Youdao en el ámbito de la IA, desde el lanzamiento inicial de Confucius como primer modelo a gran escala centrado en la educación, pasando por la introducción del «entrenador virtual de expresión oral Hi Echo», que revolucionó los métodos tradicionales de práctica oral, hasta la integración integral de Confucius 2.0 y 3.0 en ecosistemas de software y hardware, Youdao ha liderado de forma constante el aprovechamiento de la IA en escenarios del mundo real. En 2026, Youdao aceleró la aplicación de la IA con una serie de productos de agentes de IA, como LobsterAI, Youdao Treasure, Youdao Conference Agent y Thinkflow, creando una matriz de agentes de IA con visión de futuro para todo tipo de escenarios.
La actualización de Confucius 4 y la apertura total del código fuente de los modelos centrales no solo reducen significativamente las barreras para los desarrolladores en los campos multimodal y de síntesis de voz, sino que también demuestran un ciclo cerrado ecológico en el que las tecnologías centrales subyacentes alimentan las matrices de agentes de las capas superiores. Youdao espera que, con las contribuciones conjuntas de los desarrolladores de todo el mundo y de la comunidad de código abierto, este ecosistema de modelos grandes multimodales impulse una verdadera transformación de la productividad en una amplia gama de sectores.
Apéndice: Direcciones de código abierto:
Modelo multimodal «Confucius4»: https://huggingface.co/netease-youdao/Confucius4
Modelo TTS «Confucius4»: https://github.com/netease-youdao/Confucius4-TTS
El lanzamiento global de la campaña de campus de Seed de ByteDance ofrece acciones virtuales para captar a los mejores talentos en modelos grandes
En el competitivo panorama de los modelos de lenguaje grandes, asegurar el talento de primer nivel sigue siendo el activo estratégico más crítico.El 1 de abril, ByteDance anunció el lanzamiento de su iniciativa global de reclutamiento de campus Seed
Suno añade marcas de agua a las canciones en medio de batallas legales
Suno, la plataforma que permite a los usuarios generar música creada por inteligencia artificial, ha presentado nuevas funciones para etiquetar las pistas producidas en la plataforma, restringir las descargas y actualizar las normas de la comunidad c
Musk admite que Grok filtró código de usuarios, promete borrar todos los datos históricos
Elon Musk abordó directamente la controversia por privacidad relacionada con Grok Build, comenzando con un simple "Verdadero" para confirmar la validez del incidente. Se comprometió a que todos los datos de usuario cargados previamente en SpaceXAI se











