27Bの数学SOTAと3秒の感情クローン:Youdaoが「Zi Yue 4」マルチモーダルおよびTTSエンジンをオープンソース化
NetEase Youdaoは先日、同社の大規模モデル「Confucius4」をバージョン4.0へと全面的にアップグレードしたと発表した。Confucius4は完全なマルチモーダル化を実現し、テキスト、画像、音声の統合的なインタラクションに対応している。 また、Youdaoは中核となるマルチモーダルモデルおよびテキスト読み上げ(TTS)モデルをオープンソース化し、翻訳モデルについては技術的な大幅な見直しを行い、品質と効率の両面で改善を実現しました。
このマルチモーダルモデルは、視覚および数学分野でSOTA(最先端)を達成しており、純粋なテキスト形式の数学問題においても優れた性能を発揮しています。
発表によると、パラメータ数270億を誇るオープンソースの「Confucius4」マルチモーダルモデルは、教育シーンにおいて視覚入力に基づく数学処理能力を業界最高水準(SOTA)に引き上げた。 同規模のモデルの中でも、「Confucius4」は、図表を含む高度な視覚的数学・物理の問題の処理に優れています。また、中国語の純粋なテキスト形式の数学問題においても大幅な改善が見られ、業界トップクラスの81.4%の精度を達成しています。

▲ Confucius4は、同規模のモデルの中で、複数の視覚的数学ベンチマークにおいてクラス最高の成績を達成
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに重要なブレークスルーは、実用的なコスト効率にあります。関係者によると、この新しいモデルは洗練された推論チェーン再構築スキームを採用しています。大量の高品質かつ簡潔な推論サンプルを集約して深く最適化することで、推論チェーンの出力長を43.2%圧縮しています。
これは、より少ないトークン数とより短い推論経路で解答を迅速に提供できることを意味し、企業や開発者にとっての実世界のビジネスシナリオにおける推論コストを大幅に削減します。

▲ Confucius4は、複数の視覚的数学ベンチマークにおいて出力トークン数を大幅に削減
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに、Confucius4の研究チームは、中国の学生が直面する実際の宿題、試験、問題解決のシナリオに合わせてモデルを徹底的に最適化しました。これにより、実際の学習上の課題に対処できるようになり、より共感力のあるデジタルアシスタントとなっています。
オープンソースのTTS:14言語に対応、3秒で元の声を再現し、言語間のアクセントの問題もなし
マルチモーダルモデルに加え、音声合成(TTS)エンジンもオープンソース化されました。最先端の「音声エンコーダー+LLM」アーキテクチャに基づいて構築されており、開発者やコンテンツクリエイターに、ゼロショットで敷居の低い音声クローン作成および感情合成機能を提供します。
現在、中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語の計14言語を完全にサポートしています。 このシステムは、追加のトレーニングを必要とせずに話者の声を異なる言語間で自然に転送することができ、声の一貫性を維持しつつ、合成結果がネイティブで流暢に聞こえるよう保証します。また、言語間のクローン作成においても、アクセントの漏れが発生することはありません。
音声クローン機能において、Confucius4は完全な「アップロードしてクローン」機能を実現している。ユーザーは任意の音声素材を提供するだけで、システムは3秒以内に元の声を再現する。 発表によると、このエンジンのクローン作成タスクにおける精度は97%を超え、クローンされた声と元の声の類似度は85%以上です。話者固有の声の特徴を保持しつつ、感情のニュアンスを正確に再現し、その包括的な機能は同分野でトップクラスに位置しています。
さらに、このオープンソースモデルは、実際の多言語環境においても高い堅牢性を発揮します。日常会話、ニュース放送、企業プロモーション、複雑な感情表現など、さまざまな合成ニーズに対応可能です。
翻訳モデルの品質が全面的に向上、推論速度は80%高速化
Youdaoの最も根強い技術資産の一つである翻訳モデルも、今回のアップデートで大幅な技術的アップグレードを受け、翻訳タスクにおける性能がさらに向上しました。
データに関しては、Confuciusチームが数十億件の多言語データを収集・クリーニングし、TEM-8認定資格を持つ専門家を起用して多角的な手動評価を行うことで、初期段階から高品質なコーパスを確保しました。
アルゴリズム面では、このモデルは革新的な「マルチエキスパート OPD」モードを採用し、よりスマートな「ソフトアプローチ」によって、さまざまな専門家の強みを活用しています。また、強化学習を通じてフォーマット報酬や言語検出メカニズムを導入し、機械翻訳でよく見られる「文脈から外れた翻訳」や「混在言語の出力」といった問題を効果的に解決しています。
高頻度かつ高同時処理が求められる産業用アプリケーションのニーズに応えるため、更新された翻訳モデルには、全体的な推論速度を直接80%向上させる効率的な高速化メカニズムが搭載されています。 大規模モデルの自動評価とランダムな手動サンプリングを組み合わせたカスタマイズされたソリューションと相まって、新世代の翻訳モデルは、テキスト、画像、文書翻訳を含む複数のシナリオにおいて、極めて高い水準の速度と品質を発揮しています。
教育向け初の大型モデル「Confucius」の初期リリースから、従来の会話練習手法を一新した「バーチャルスピーキングコーチ Hi Echo」の導入、さらには「Confucius 2.0」および「3.0」のソフトウェア・ハードウェアエコシステムへの包括的な統合に至るまで、YoudaoのAIにおける歩みを振り返ると、 Youdaoは一貫して、実世界シナリオにおけるAI活用を牽引してきました。2026年、Youdaoは「LobsterAI」、「Youdao Treasure」、「Youdao Conference Agent」、「Thinkflow」といった一連のAIエージェント製品によりAIの応用を加速させ、先見性のある全シナリオ対応のAIエージェントマトリックスを実現しました。
「Confucius 4」のアップグレードとコアモデルの完全オープンソース化は、マルチモーダルおよび音声合成分野における開発者の参入障壁を大幅に引き下げるだけでなく、基盤となるコア技術が上位層のエージェント・マトリックスを育むという、エコシステムの閉ループ構造を実証するものです。 Youdaoは、世界中の開発者やオープンソースコミュニティの共同の貢献により、この全モーダル大規模モデルエコシステムが、幅広い業界において真の生産性変革をもたらすことを期待しています。
付録:オープンソースのURL:
「Confucius4」マルチモーダルモデル:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」TTSモデル:https://github.com/netease-youdao/Confucius4-TTS
関連記事
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@
関連特集おすすめ
コメント (1)
0/500
NetEase Youdaoは先日、同社の大規模モデル「Confucius4」をバージョン4.0へと全面的にアップグレードしたと発表した。Confucius4は完全なマルチモーダル化を実現し、テキスト、画像、音声の統合的なインタラクションに対応している。 また、Youdaoは中核となるマルチモーダルモデルおよびテキスト読み上げ(TTS)モデルをオープンソース化し、翻訳モデルについては技術的な大幅な見直しを行い、品質と効率の両面で改善を実現しました。
このマルチモーダルモデルは、視覚および数学分野でSOTA(最先端)を達成しており、純粋なテキスト形式の数学問題においても優れた性能を発揮しています。
発表によると、パラメータ数270億を誇るオープンソースの「Confucius4」マルチモーダルモデルは、教育シーンにおいて視覚入力に基づく数学処理能力を業界最高水準(SOTA)に引き上げた。 同規模のモデルの中でも、「Confucius4」は、図表を含む高度な視覚的数学・物理の問題の処理に優れています。また、中国語の純粋なテキスト形式の数学問題においても大幅な改善が見られ、業界トップクラスの81.4%の精度を達成しています。

▲ Confucius4は、同規模のモデルの中で、複数の視覚的数学ベンチマークにおいてクラス最高の成績を達成
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに重要なブレークスルーは、実用的なコスト効率にあります。関係者によると、この新しいモデルは洗練された推論チェーン再構築スキームを採用しています。大量の高品質かつ簡潔な推論サンプルを集約して深く最適化することで、推論チェーンの出力長を43.2%圧縮しています。
これは、より少ないトークン数とより短い推論経路で解答を迅速に提供できることを意味し、企業や開発者にとっての実世界のビジネスシナリオにおける推論コストを大幅に削減します。

▲ Confucius4は、複数の視覚的数学ベンチマークにおいて出力トークン数を大幅に削減
画像出典:https://huggingface.co/netease-youdao/Confucius4
さらに、Confucius4の研究チームは、中国の学生が直面する実際の宿題、試験、問題解決のシナリオに合わせてモデルを徹底的に最適化しました。これにより、実際の学習上の課題に対処できるようになり、より共感力のあるデジタルアシスタントとなっています。
オープンソースのTTS:14言語に対応、3秒で元の声を再現し、言語間のアクセントの問題もなし
マルチモーダルモデルに加え、音声合成(TTS)エンジンもオープンソース化されました。最先端の「音声エンコーダー+LLM」アーキテクチャに基づいて構築されており、開発者やコンテンツクリエイターに、ゼロショットで敷居の低い音声クローン作成および感情合成機能を提供します。
現在、中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語の計14言語を完全にサポートしています。 このシステムは、追加のトレーニングを必要とせずに話者の声を異なる言語間で自然に転送することができ、声の一貫性を維持しつつ、合成結果がネイティブで流暢に聞こえるよう保証します。また、言語間のクローン作成においても、アクセントの漏れが発生することはありません。
音声クローン機能において、Confucius4は完全な「アップロードしてクローン」機能を実現している。ユーザーは任意の音声素材を提供するだけで、システムは3秒以内に元の声を再現する。 発表によると、このエンジンのクローン作成タスクにおける精度は97%を超え、クローンされた声と元の声の類似度は85%以上です。話者固有の声の特徴を保持しつつ、感情のニュアンスを正確に再現し、その包括的な機能は同分野でトップクラスに位置しています。
さらに、このオープンソースモデルは、実際の多言語環境においても高い堅牢性を発揮します。日常会話、ニュース放送、企業プロモーション、複雑な感情表現など、さまざまな合成ニーズに対応可能です。
翻訳モデルの品質が全面的に向上、推論速度は80%高速化
Youdaoの最も根強い技術資産の一つである翻訳モデルも、今回のアップデートで大幅な技術的アップグレードを受け、翻訳タスクにおける性能がさらに向上しました。
データに関しては、Confuciusチームが数十億件の多言語データを収集・クリーニングし、TEM-8認定資格を持つ専門家を起用して多角的な手動評価を行うことで、初期段階から高品質なコーパスを確保しました。
アルゴリズム面では、このモデルは革新的な「マルチエキスパート OPD」モードを採用し、よりスマートな「ソフトアプローチ」によって、さまざまな専門家の強みを活用しています。また、強化学習を通じてフォーマット報酬や言語検出メカニズムを導入し、機械翻訳でよく見られる「文脈から外れた翻訳」や「混在言語の出力」といった問題を効果的に解決しています。
高頻度かつ高同時処理が求められる産業用アプリケーションのニーズに応えるため、更新された翻訳モデルには、全体的な推論速度を直接80%向上させる効率的な高速化メカニズムが搭載されています。 大規模モデルの自動評価とランダムな手動サンプリングを組み合わせたカスタマイズされたソリューションと相まって、新世代の翻訳モデルは、テキスト、画像、文書翻訳を含む複数のシナリオにおいて、極めて高い水準の速度と品質を発揮しています。
教育向け初の大型モデル「Confucius」の初期リリースから、従来の会話練習手法を一新した「バーチャルスピーキングコーチ Hi Echo」の導入、さらには「Confucius 2.0」および「3.0」のソフトウェア・ハードウェアエコシステムへの包括的な統合に至るまで、YoudaoのAIにおける歩みを振り返ると、 Youdaoは一貫して、実世界シナリオにおけるAI活用を牽引してきました。2026年、Youdaoは「LobsterAI」、「Youdao Treasure」、「Youdao Conference Agent」、「Thinkflow」といった一連のAIエージェント製品によりAIの応用を加速させ、先見性のある全シナリオ対応のAIエージェントマトリックスを実現しました。
「Confucius 4」のアップグレードとコアモデルの完全オープンソース化は、マルチモーダルおよび音声合成分野における開発者の参入障壁を大幅に引き下げるだけでなく、基盤となるコア技術が上位層のエージェント・マトリックスを育むという、エコシステムの閉ループ構造を実証するものです。 Youdaoは、世界中の開発者やオープンソースコミュニティの共同の貢献により、この全モーダル大規模モデルエコシステムが、幅広い業界において真の生産性変革をもたらすことを期待しています。
付録:オープンソースのURL:
「Confucius4」マルチモーダルモデル:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」TTSモデル:https://github.com/netease-youdao/Confucius4-TTS
ByteDanceのSeedがグローバルキャンパス採用を開始、大規模モデルのトップ人材獲得に向けて仮想株式を提供
大規模言語モデルの競争環境において、トップクラスのタレントを確保することは、最も重要な戦略的資産であり続けています。4月1日、ByteDanceは、大規模モデル人材育成プログラムの一部であるSeedグローバルキャンパス採用イニシアチブの開始を発表しました。このキャンペーンは2027年卒の卒業予定者と現在のインターン生を対象としており、世界中のAI分野におけるエリート研究開発者およびエンジニアの発掘と確保を目指しています。拡大:世界中から100名の「AIシード」を発掘急速な技術進歩の中で、B
法的争訟の中でSunoが曲に透かしを入れる
Sunoは、ユーザーがAI生成音楽を作成できるプラットフォームであり、プラットフォームが生成したトラックにラベルを付け、ダウンロードを制限し、不正な複製を抑制するためにコミュニティ基準を更新する新機能を公開した。これらの更新は、Sunoがレコードレーベルやアーティスト団体からの複数の訴訟に直面している時期に実施される。共同創設者兼CEOのMikey Shulmanはブログ記事で、プラットフォームの目標が、より広い層にAI音楽ツールのアクセスを拡大しながら、オリジナルの創作を促進することに重点を
ムスク氏はGrokの構築でユーザーのコードが漏洩したことを認め、すべての履歴データを消去すると約束した。
エロン・マスクは、Grok Buildをめぐるプライバシー問題に直接言及し、まず「True」という単純な回答で事件の存在を確認した。彼は、SpaceXAIに以前アップロードされたすべてのユーザーデータを永久に削除すると約束し、「1バイトも残さない」と述べた。これは、主要なテックリーダーが公に過ちを認め、ユーザーデータを自発的に削除したというAI業界初の事例である。安全研究者による「フィッシング」テストでデータ漏洩の具体的な証拠が明らかになったこの問題は、独立したAIセキュリティ研究者である@





家






