27B 數學 SOTA 與 3 秒情緒克隆:有道開源「紫月 4」多模態與語音合成引擎
網易有道近日宣布,其「孔子4」大型模型已全面升級至 4.0 版。如今「孔子4」已全面支援多模態功能,可整合文字、圖像及語音互動。 有道同時將其核心的多模態與文字轉語音(TTS)模型開源,而翻譯模型則經過深度技術改造,在品質與效率方面均有所提升。
該多模態模型在視覺與數學領域均達到當前最佳水準(SOTA),並在純文字數學題目上展現出卓越表現
根據公告,這款擁有 270 億參數的開源「孔子4」多模態模型,已將教育場景中基於視覺輸入的數學處理能力提升至業界領先水準(SOTA)。 在規模相近的模型中,Confucius4 特別擅長處理包含圖表的高階視覺數學與物理題目。它在中文純文字數學題目上也展現顯著進步,準確度達 81.4%,位居業界領先地位。

▲ 在同規模模型中,Confucius4 於多項視覺數學基準測試中取得業界最佳成績
圖片來源:https://huggingface.co/netease-youdao/Confucius4
更關鍵的突破在於實務上的成本效益。據相關負責人表示,該新模型採用了精煉的推理鏈重構方案。透過彙整大量高品質且簡潔的推理樣本進行深度優化,將推理鏈的輸出長度壓縮了 43.2%。
這意味著它能以更少的標記數和更短的推理路徑更快地給出答案,大幅降低企業與開發者在實際商業情境中的推理成本。

▲ Confucius4 在多項視覺數學基準測試中顯著減少了輸出標記數
圖片來源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4 研究團隊針對中國學生在現實生活中面臨的作業、考試及解題情境,對模型進行了深度優化。這使它能夠應對真實的學習挑戰,成為更具同理心的數位助理。
開源語音合成(TTS):支援 14 種語言,3 秒內即可複製原聲,跨語言無口音問題
除了多模態模型外,語音合成(TTS)引擎也已開源。該引擎基於尖端的「語音編碼器 + 大型語言模型(LLM)」架構,為開發者和內容創作者提供零樣本、低門檻的語音克隆與情緒合成能力。
目前,該引擎全面支援 14 種語言:中文、英文、日文、韓文、德文、法文、西班牙文、印尼文、義大利文、泰文、葡萄牙文、俄文、馬來文及越南文。 該系統無需額外訓練,即可自然地將發言人的聲音轉移至不同語言,在維持聲音一致性的同時,確保合成結果聽起來像母語般流暢,且在跨語言克隆過程中不會滲入口音。
在語音克隆方面,Confucius4 實現了完整的「上傳即克隆」功能。使用者只需提供任何音訊素材,系統便能在三秒內複製原始聲音。 根據公告,該引擎在克隆任務上的準確度超過 97%,克隆聲音與原始聲音的相似度超過 85%。它既能保留發聲者獨特的嗓音特徵,又能精準重現其情感語調,其全面能力在該領域名列前茅。
此外,此開源模型在真實的多語言情境中展現出強大的穩健性,能處理各種合成需求,包括日常對話、新聞播報、企業宣傳以及複雜的情感表達。
翻譯模型品質全面升級,推論速度提升 80%
作為有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了重大的技术升级,进一步提升了其在翻译任务中的表现。
在數據方面,孔子團隊蒐集並清理了數十億條多語言語料,並聘請具備 TEM-8 認證的專業人員進行多維度人工評審,從源頭確保語料庫的高品質。
在演算法方面,該模型採用創新的「多專家 OPD」模式,透過更聰明的「柔性策略」來發揮各專家之所長。同時,透過強化學習引入格式獎勵與語言偵測機制,有效解決機器翻譯中常見的「脫離語境翻譯」及「混語輸出」等問題。
為滿足高頻率、高並發的工業應用需求,更新後的翻譯模型配備了高效的加速機制,可直接將整體推論速度提升 80%。 結合自動化大型模型評估與隨機人工抽樣這套客製化解決方案,新一代翻譯模型在文字、圖像及文件翻譯等多種情境中,均展現出極高的速度與品質水準。
回顧有道在 AI 領域的發展歷程,從最初推出首個教育專用大模型「孔子」,到推出顛覆傳統口語練習方法的「虛擬口語教練 Hi Echo」,再到將「孔子 2.0」與「孔子 3.0」全面整合至軟硬體生態系統中, 有道始終引領著AI在真實場景中的賦能應用。2026年,有道透過「龍蝦AI」、「有道寶」、「有道會議助手」及「Thinkflow」等一系列AI代理產品,加速推動AI應用,實現了前瞻性的全場景AI代理矩陣。
「孔子4.0」的升級與核心模型的全面開源,不僅大幅降低了開發者在多模態與語音合成領域的門檻,更展現出一種生態閉環——基礎核心技術滋養著上層的智能代理矩陣。 有道期望,在全全球開發者與開源社群的共同貢獻下,這個全模態大模型生態系統將為各行各業帶來真正的生產力轉型。
附錄:開源網址:
「Confucius4」多模態模型:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」語音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (1)
0/500
網易有道近日宣布,其「孔子4」大型模型已全面升級至 4.0 版。如今「孔子4」已全面支援多模態功能,可整合文字、圖像及語音互動。 有道同時將其核心的多模態與文字轉語音(TTS)模型開源,而翻譯模型則經過深度技術改造,在品質與效率方面均有所提升。
該多模態模型在視覺與數學領域均達到當前最佳水準(SOTA),並在純文字數學題目上展現出卓越表現
根據公告,這款擁有 270 億參數的開源「孔子4」多模態模型,已將教育場景中基於視覺輸入的數學處理能力提升至業界領先水準(SOTA)。 在規模相近的模型中,Confucius4 特別擅長處理包含圖表的高階視覺數學與物理題目。它在中文純文字數學題目上也展現顯著進步,準確度達 81.4%,位居業界領先地位。

▲ 在同規模模型中,Confucius4 於多項視覺數學基準測試中取得業界最佳成績
圖片來源:https://huggingface.co/netease-youdao/Confucius4
更關鍵的突破在於實務上的成本效益。據相關負責人表示,該新模型採用了精煉的推理鏈重構方案。透過彙整大量高品質且簡潔的推理樣本進行深度優化,將推理鏈的輸出長度壓縮了 43.2%。
這意味著它能以更少的標記數和更短的推理路徑更快地給出答案,大幅降低企業與開發者在實際商業情境中的推理成本。

▲ Confucius4 在多項視覺數學基準測試中顯著減少了輸出標記數
圖片來源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4 研究團隊針對中國學生在現實生活中面臨的作業、考試及解題情境,對模型進行了深度優化。這使它能夠應對真實的學習挑戰,成為更具同理心的數位助理。
開源語音合成(TTS):支援 14 種語言,3 秒內即可複製原聲,跨語言無口音問題
除了多模態模型外,語音合成(TTS)引擎也已開源。該引擎基於尖端的「語音編碼器 + 大型語言模型(LLM)」架構,為開發者和內容創作者提供零樣本、低門檻的語音克隆與情緒合成能力。
目前,該引擎全面支援 14 種語言:中文、英文、日文、韓文、德文、法文、西班牙文、印尼文、義大利文、泰文、葡萄牙文、俄文、馬來文及越南文。 該系統無需額外訓練,即可自然地將發言人的聲音轉移至不同語言,在維持聲音一致性的同時,確保合成結果聽起來像母語般流暢,且在跨語言克隆過程中不會滲入口音。
在語音克隆方面,Confucius4 實現了完整的「上傳即克隆」功能。使用者只需提供任何音訊素材,系統便能在三秒內複製原始聲音。 根據公告,該引擎在克隆任務上的準確度超過 97%,克隆聲音與原始聲音的相似度超過 85%。它既能保留發聲者獨特的嗓音特徵,又能精準重現其情感語調,其全面能力在該領域名列前茅。
此外,此開源模型在真實的多語言情境中展現出強大的穩健性,能處理各種合成需求,包括日常對話、新聞播報、企業宣傳以及複雜的情感表達。
翻譯模型品質全面升級,推論速度提升 80%
作為有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了重大的技术升级,进一步提升了其在翻译任务中的表现。
在數據方面,孔子團隊蒐集並清理了數十億條多語言語料,並聘請具備 TEM-8 認證的專業人員進行多維度人工評審,從源頭確保語料庫的高品質。
在演算法方面,該模型採用創新的「多專家 OPD」模式,透過更聰明的「柔性策略」來發揮各專家之所長。同時,透過強化學習引入格式獎勵與語言偵測機制,有效解決機器翻譯中常見的「脫離語境翻譯」及「混語輸出」等問題。
為滿足高頻率、高並發的工業應用需求,更新後的翻譯模型配備了高效的加速機制,可直接將整體推論速度提升 80%。 結合自動化大型模型評估與隨機人工抽樣這套客製化解決方案,新一代翻譯模型在文字、圖像及文件翻譯等多種情境中,均展現出極高的速度與品質水準。
回顧有道在 AI 領域的發展歷程,從最初推出首個教育專用大模型「孔子」,到推出顛覆傳統口語練習方法的「虛擬口語教練 Hi Echo」,再到將「孔子 2.0」與「孔子 3.0」全面整合至軟硬體生態系統中, 有道始終引領著AI在真實場景中的賦能應用。2026年,有道透過「龍蝦AI」、「有道寶」、「有道會議助手」及「Thinkflow」等一系列AI代理產品,加速推動AI應用,實現了前瞻性的全場景AI代理矩陣。
「孔子4.0」的升級與核心模型的全面開源,不僅大幅降低了開發者在多模態與語音合成領域的門檻,更展現出一種生態閉環——基礎核心技術滋養著上層的智能代理矩陣。 有道期望,在全全球開發者與開源社群的共同貢獻下,這個全模態大模型生態系統將為各行各業帶來真正的生產力轉型。
附錄:開源網址:
「Confucius4」多模態模型:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」語音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






