Lar
27B Math SOTA e clonagem emocional em 3 segundos: Youdao torna o Zi Yue 4, mecanismo multimodal e de síntese de voz, de código aberto
A NetEase Youdao anunciou recentemente uma atualização abrangente de seu modelo de grande porte “Confucius4” para a versão 4.0. Agora totalmente multimodal, o Confucius4 oferece suporte a interações integradas de texto, imagem e áudio. A Youdao também tornou de código aberto seus principais modelos multimodais e de conversão de texto em fala (TTS), enquanto o modelo de tradução passou por uma profunda reformulação técnica, proporcionando melhorias tanto na qualidade quanto na eficiência.
O modelo multimodal atinge o SOTA (estado da arte) em visão computacional e matemática, com desempenho superior em problemas matemáticos baseados exclusivamente em texto
De acordo com o anúncio, o modelo multimodal de código aberto Confucius4, com 27 bilhões de parâmetros, elevou os recursos matemáticos baseados em entrada visual a um nível líder do setor (SOTA) em cenários educacionais. Entre modelos de escala semelhante, o Confucius4 se destaca no tratamento de problemas avançados de matemática e física visuais que incorporam gráficos. Ele também apresenta uma melhoria significativa em problemas matemáticos em texto puro em chinês, alcançando uma precisão de 81,4%, o que é líder no setor.

▲ O Confucius4 alcança os melhores resultados da categoria em vários benchmarks de matemática visual entre modelos da mesma escala
Fonte da imagem: https://huggingface.co/netease-youdao/Confucius4
Um avanço ainda mais significativo está na relação custo-benefício prática. De acordo com autoridades competentes, o novo modelo emprega um esquema refinado de reconstrução da cadeia de raciocínio. Ao agregar um grande volume de amostras de raciocínio concisas e de alta qualidade para otimização profunda, ele comprime o comprimento da saída da cadeia de raciocínio em 43,2%.
Isso significa que ele pode fornecer respostas mais rapidamente, com menos tokens e caminhos de raciocínio mais curtos, reduzindo significativamente os custos de inferência em cenários de negócios reais para empresas e desenvolvedores.

▲ O Confucius4 reduz significativamente os tokens de saída em vários benchmarks visuais de matemática
Fonte da imagem: https://huggingface.co/netease-youdao/Confucius4
Além disso, a equipe de pesquisa do Confucius4 otimizou profundamente o modelo para cenários reais de lição de casa, provas e resolução de problemas enfrentados por estudantes chineses. Isso permite que ele lide com desafios autênticos de aprendizagem, tornando-o um assistente digital mais empático.
TTS de código aberto: suporta 14 idiomas, reproduz a voz original em 3 segundos sem problemas de sotaque entre os idiomas
Juntamente com o modelo multimodal, o mecanismo de síntese de fala (TTS) também foi disponibilizado como código aberto. Construído com base em uma arquitetura de ponta do tipo “codificador de fala + LLM”, ele oferece aos desenvolvedores e criadores de conteúdo recursos de clonagem de voz e síntese emocional do tipo “zero-shot” e de fácil acesso.
Atualmente, ele oferece suporte total a 14 idiomas: chinês, inglês, japonês, coreano, alemão, francês, espanhol, indonésio, italiano, tailandês, português, russo, malaio e vietnamita. O sistema consegue transferir naturalmente a voz de um locutor entre diferentes idiomas sem treinamento adicional, mantendo a consistência da voz e garantindo que os resultados sintetizados soem nativos e fluentes, sem vazamento de sotaque durante a clonagem entre idiomas.
Para a clonagem de voz, o Confucius4 oferece suporte completo ao recurso “enviar e clonar”. Basta que os usuários forneçam qualquer material de áudio para que o sistema replique a voz original em três segundos. De acordo com o anúncio, a precisão do mecanismo em tarefas de clonagem ultrapassa 97%, e a semelhança entre a voz clonada e a voz original é superior a 85%. Ele preserva as características vocais únicas do locutor ao mesmo tempo em que reproduz com precisão seu tom emocional, com recursos abrangentes que se classificam entre os melhores da área.
Além disso, esse modelo de código aberto demonstra grande robustez em cenários multilíngues reais. Ele é capaz de atender a diversas necessidades de síntese, incluindo conversas cotidianas, noticiários, promoções corporativas e expressões emocionais complexas.
Qualidade do modelo de tradução aprimorada de forma abrangente, com velocidade de inferência 80% mais rápida
Como um dos ativos tecnológicos mais consolidados da Youdao, o modelo de tradução também recebeu atualizações técnicas significativas nesta versão, aprimorando ainda mais seu desempenho em tarefas de tradução.
No que diz respeito aos dados, a equipe Confucius coletou e limpou bilhões de itens multilíngues e contratou profissionais com certificação TEM-8 para avaliação manual multidimensional, garantindo corpora de alta qualidade desde o início.
No lado algorítmico, o modelo utiliza um inovador modo “OPD multiespecialista”, adotando uma “abordagem suave” mais inteligente para aproveitar os pontos fortes de vários especialistas. Ele também introduz recompensas de formato e mecanismos de detecção de idioma por meio do aprendizado por reforço, resolvendo efetivamente problemas comuns como traduções fora de contexto e saídas com mistura de idiomas na tradução automática.
Para atender às demandas de aplicações industriais de alta frequência e alta simultaneidade, o modelo de tradução atualizado está equipado com um mecanismo de aceleração eficiente que aumenta diretamente a velocidade geral de inferência em 80%. Combinado com uma solução personalizada de avaliação automatizada de grandes modelos e amostragem manual aleatória, o modelo de tradução de nova geração demonstra padrões extremamente elevados de velocidade e qualidade em diversos cenários, incluindo tradução de texto, imagem e documentos.
Refletindo sobre a trajetória da Youdao na IA, desde o lançamento inicial do Confucius como o primeiro modelo de grande porte focado em educação, passando pela introdução do “treinador virtual de conversação Hi Echo”, que revolucionou os métodos tradicionais de prática oral, até a integração abrangente do Confucius 2.0 e 3.0 em ecossistemas de software e hardware, a Youdao tem liderado consistentemente o empoderamento da IA em cenários do mundo real. Em 2026, a Youdao acelerou a aplicação da IA com uma série de produtos de Agentes de IA, como o LobsterAI, o Youdao Treasure, o Youdao Conference Agent e o Thinkflow, concretizando uma matriz de Agentes de IA voltada para o futuro e abrangente para todos os cenários.
A atualização do Confucius 4 e a disponibilização completa em código aberto dos modelos centrais não apenas reduzem significativamente as barreiras para desenvolvedores nas áreas multimodal e de síntese de fala, mas também demonstram um ciclo fechado ecológico, no qual as tecnologias centrais subjacentes alimentam as matrizes de agentes das camadas superiores. A Youdao espera que, com as contribuições conjuntas de desenvolvedores globais e da comunidade de código aberto, esse ecossistema de grandes modelos multimodais promova uma verdadeira transformação da produtividade em uma ampla gama de setores.
Apêndice: Endereços de código aberto:
Modelo multimodal “Confucius4”: https://huggingface.co/netease-youdao/Confucius4
Modelo TTS “Confucius4”: https://github.com/netease-youdao/Confucius4-TTS
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (1)
A NetEase Youdao anunciou recentemente uma atualização abrangente de seu modelo de grande porte “Confucius4” para a versão 4.0. Agora totalmente multimodal, o Confucius4 oferece suporte a interações integradas de texto, imagem e áudio. A Youdao também tornou de código aberto seus principais modelos multimodais e de conversão de texto em fala (TTS), enquanto o modelo de tradução passou por uma profunda reformulação técnica, proporcionando melhorias tanto na qualidade quanto na eficiência.
O modelo multimodal atinge o SOTA (estado da arte) em visão computacional e matemática, com desempenho superior em problemas matemáticos baseados exclusivamente em texto
De acordo com o anúncio, o modelo multimodal de código aberto Confucius4, com 27 bilhões de parâmetros, elevou os recursos matemáticos baseados em entrada visual a um nível líder do setor (SOTA) em cenários educacionais. Entre modelos de escala semelhante, o Confucius4 se destaca no tratamento de problemas avançados de matemática e física visuais que incorporam gráficos. Ele também apresenta uma melhoria significativa em problemas matemáticos em texto puro em chinês, alcançando uma precisão de 81,4%, o que é líder no setor.

▲ O Confucius4 alcança os melhores resultados da categoria em vários benchmarks de matemática visual entre modelos da mesma escala
Fonte da imagem: https://huggingface.co/netease-youdao/Confucius4
Um avanço ainda mais significativo está na relação custo-benefício prática. De acordo com autoridades competentes, o novo modelo emprega um esquema refinado de reconstrução da cadeia de raciocínio. Ao agregar um grande volume de amostras de raciocínio concisas e de alta qualidade para otimização profunda, ele comprime o comprimento da saída da cadeia de raciocínio em 43,2%.
Isso significa que ele pode fornecer respostas mais rapidamente, com menos tokens e caminhos de raciocínio mais curtos, reduzindo significativamente os custos de inferência em cenários de negócios reais para empresas e desenvolvedores.

▲ O Confucius4 reduz significativamente os tokens de saída em vários benchmarks visuais de matemática
Fonte da imagem: https://huggingface.co/netease-youdao/Confucius4
Além disso, a equipe de pesquisa do Confucius4 otimizou profundamente o modelo para cenários reais de lição de casa, provas e resolução de problemas enfrentados por estudantes chineses. Isso permite que ele lide com desafios autênticos de aprendizagem, tornando-o um assistente digital mais empático.
TTS de código aberto: suporta 14 idiomas, reproduz a voz original em 3 segundos sem problemas de sotaque entre os idiomas
Juntamente com o modelo multimodal, o mecanismo de síntese de fala (TTS) também foi disponibilizado como código aberto. Construído com base em uma arquitetura de ponta do tipo “codificador de fala + LLM”, ele oferece aos desenvolvedores e criadores de conteúdo recursos de clonagem de voz e síntese emocional do tipo “zero-shot” e de fácil acesso.
Atualmente, ele oferece suporte total a 14 idiomas: chinês, inglês, japonês, coreano, alemão, francês, espanhol, indonésio, italiano, tailandês, português, russo, malaio e vietnamita. O sistema consegue transferir naturalmente a voz de um locutor entre diferentes idiomas sem treinamento adicional, mantendo a consistência da voz e garantindo que os resultados sintetizados soem nativos e fluentes, sem vazamento de sotaque durante a clonagem entre idiomas.
Para a clonagem de voz, o Confucius4 oferece suporte completo ao recurso “enviar e clonar”. Basta que os usuários forneçam qualquer material de áudio para que o sistema replique a voz original em três segundos. De acordo com o anúncio, a precisão do mecanismo em tarefas de clonagem ultrapassa 97%, e a semelhança entre a voz clonada e a voz original é superior a 85%. Ele preserva as características vocais únicas do locutor ao mesmo tempo em que reproduz com precisão seu tom emocional, com recursos abrangentes que se classificam entre os melhores da área.
Além disso, esse modelo de código aberto demonstra grande robustez em cenários multilíngues reais. Ele é capaz de atender a diversas necessidades de síntese, incluindo conversas cotidianas, noticiários, promoções corporativas e expressões emocionais complexas.
Qualidade do modelo de tradução aprimorada de forma abrangente, com velocidade de inferência 80% mais rápida
Como um dos ativos tecnológicos mais consolidados da Youdao, o modelo de tradução também recebeu atualizações técnicas significativas nesta versão, aprimorando ainda mais seu desempenho em tarefas de tradução.
No que diz respeito aos dados, a equipe Confucius coletou e limpou bilhões de itens multilíngues e contratou profissionais com certificação TEM-8 para avaliação manual multidimensional, garantindo corpora de alta qualidade desde o início.
No lado algorítmico, o modelo utiliza um inovador modo “OPD multiespecialista”, adotando uma “abordagem suave” mais inteligente para aproveitar os pontos fortes de vários especialistas. Ele também introduz recompensas de formato e mecanismos de detecção de idioma por meio do aprendizado por reforço, resolvendo efetivamente problemas comuns como traduções fora de contexto e saídas com mistura de idiomas na tradução automática.
Para atender às demandas de aplicações industriais de alta frequência e alta simultaneidade, o modelo de tradução atualizado está equipado com um mecanismo de aceleração eficiente que aumenta diretamente a velocidade geral de inferência em 80%. Combinado com uma solução personalizada de avaliação automatizada de grandes modelos e amostragem manual aleatória, o modelo de tradução de nova geração demonstra padrões extremamente elevados de velocidade e qualidade em diversos cenários, incluindo tradução de texto, imagem e documentos.
Refletindo sobre a trajetória da Youdao na IA, desde o lançamento inicial do Confucius como o primeiro modelo de grande porte focado em educação, passando pela introdução do “treinador virtual de conversação Hi Echo”, que revolucionou os métodos tradicionais de prática oral, até a integração abrangente do Confucius 2.0 e 3.0 em ecossistemas de software e hardware, a Youdao tem liderado consistentemente o empoderamento da IA em cenários do mundo real. Em 2026, a Youdao acelerou a aplicação da IA com uma série de produtos de Agentes de IA, como o LobsterAI, o Youdao Treasure, o Youdao Conference Agent e o Thinkflow, concretizando uma matriz de Agentes de IA voltada para o futuro e abrangente para todos os cenários.
A atualização do Confucius 4 e a disponibilização completa em código aberto dos modelos centrais não apenas reduzem significativamente as barreiras para desenvolvedores nas áreas multimodal e de síntese de fala, mas também demonstram um ciclo fechado ecológico, no qual as tecnologias centrais subjacentes alimentam as matrizes de agentes das camadas superiores. A Youdao espera que, com as contribuições conjuntas de desenvolvedores globais e da comunidade de código aberto, esse ecossistema de grandes modelos multimodais promova uma verdadeira transformação da produtividade em uma ampla gama de setores.
Apêndice: Endereços de código aberto:
Modelo multimodal “Confucius4”: https://huggingface.co/netease-youdao/Confucius4
Modelo TTS “Confucius4”: https://github.com/netease-youdao/Confucius4-TTS
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











