27B数学SOTA与3秒情感克隆:有道开源“紫月4”多模态及TTS引擎
网易有道近日宣布,其“孔子4”大模型已全面升级至4.0版本。如今,“孔子4”已实现全模态支持,可支持文本、图像和音频的集成交互。 有道还将其核心的多模态和文本转语音(TTS)模型开源,同时对翻译模型进行了深度技术改造,在质量和效率方面均有所提升。
该多模态模型在视觉和数学领域均达到了最先进水平(SOTA),在纯文本数学题上表现尤为出色
据公告称,这款拥有270亿参数的开源“孔子4号”多模态模型,已将基于视觉输入的数学处理能力提升至教育场景中的行业领先水平(SOTA)。 在同等规模的模型中,Confucius4 尤其擅长处理包含图表的高级视觉数学和物理问题。它在中文纯文本数学题上也取得了显著进步,准确率达到 81.4%,处于行业领先水平。

▲ 在同等规模的模型中,Confucius4 在多个视觉数学基准测试中均取得业界最佳成绩
图片来源:https://huggingface.co/netease-youdao/Confucius4
更具决定性的突破在于实际成本效益。据相关负责人介绍,该新模型采用了精炼的推理链重构方案。通过聚合海量高质量、简洁的推理样本进行深度优化,将推理链的输出长度压缩了43.2%。
这意味着它能够以更少的令牌和更短的推理路径更快地给出答案,从而显著降低企业及开发者在实际商业场景中的推理成本。

▲ Confucius4 在多个视觉数学基准测试中显著减少了输出令牌数量
图片来源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4研究团队针对中国学生面临的实际作业、考试和解题场景对模型进行了深度优化。这使其能够应对真实的学习挑战,成为更具同理心的数字助手。
开源语音合成(TTS):支持14种语言,3秒内即可克隆原声,跨语言无口音问题
除多模态模型外,语音合成(TTS)引擎也已开源。该引擎基于前沿的“语音编码器 + 大型语言模型(LLM)”架构构建,为开发者和内容创作者提供了零样本、低门槛的语音克隆和情感合成能力。
目前,该引擎全面支持14种语言:中文、英语、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语和越南语。 该系统无需额外训练即可自然地在不同语言间转换说话者的声音,在保持声音一致性的同时,确保合成结果听起来像母语者一样流利自然,且在跨语言克隆过程中不会出现口音泄漏。
在语音克隆方面,Confucius4实现了完全的“上传即克隆”功能。用户只需提供任意音频素材,系统便能在三秒内复刻原始声音。 据公告称,该引擎在克隆任务上的准确率超过97%,克隆声音与原始声音的相似度超过85%。它在保留说话者独特嗓音特征的同时,还能准确再现其情感语调,其综合能力位居该领域前列。
此外,该开源模型在真实的多语言场景中展现出极强的鲁棒性,能够满足日常对话、新闻播报、企业宣传以及复杂情感表达等多种合成需求。
翻译模型质量全面升级,推理速度提升80%
作为有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了显著的技术升级,进一步提升了其在翻译任务中的表现。
在数据方面,孔子团队收集并清洗了数十亿条多语言数据条目,并聘请持有TEM-8认证的专业人员进行多维度人工评估,确保从源头起就拥有高质量的语料库。
在算法方面,该模型采用了创新的“多专家 OPD”模式,通过更智能的“柔性策略”充分发挥各专家的优势。同时,通过强化学习引入了格式奖励和语言检测机制,有效解决了机器翻译中常见的脱离语境翻译和混语输出等问题。
为满足高频、高并发工业应用的需求,更新后的翻译模型配备了高效的加速机制,可直接将整体推理速度提升80%。 结合定制化的自动化大模型评估与随机人工采样方案,新一代翻译模型在文本、图像和文档翻译等多场景中均展现出极高的速度与质量水准。
回顾有道在AI领域的历程,从最初推出首个教育领域大模型“孔子”,到推出颠覆传统口语练习方式的“虚拟口语教练Hi Echo”,再到将“孔子2.0”和“孔子3.0”全面融入软硬件生态系统, 有道始终引领着AI在真实场景中的赋能应用。2026年,有道通过LobsterAI、有道宝、有道会议助手和Thinkflow等一系列AI智能助手产品,加速了AI应用进程,构建了前瞻性的全场景AI智能助手矩阵。
“孔子4.0”的升级及核心模型的全面开源,不仅显著降低了多模态和语音合成领域开发者的门槛,更展现出一种生态闭环——底层核心技术滋养着上层智能代理矩阵。 有道希望,在全球开发者和开源社区的共同贡献下,这一全模态大模型生态系统能够为各行各业带来真正生产力的变革。
附录:开源地址:
“Confucius4”多模态模型:https://huggingface.co/netease-youdao/Confucius4
“Confucius4”语音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (1)
0/500
网易有道近日宣布,其“孔子4”大模型已全面升级至4.0版本。如今,“孔子4”已实现全模态支持,可支持文本、图像和音频的集成交互。 有道还将其核心的多模态和文本转语音(TTS)模型开源,同时对翻译模型进行了深度技术改造,在质量和效率方面均有所提升。
该多模态模型在视觉和数学领域均达到了最先进水平(SOTA),在纯文本数学题上表现尤为出色
据公告称,这款拥有270亿参数的开源“孔子4号”多模态模型,已将基于视觉输入的数学处理能力提升至教育场景中的行业领先水平(SOTA)。 在同等规模的模型中,Confucius4 尤其擅长处理包含图表的高级视觉数学和物理问题。它在中文纯文本数学题上也取得了显著进步,准确率达到 81.4%,处于行业领先水平。

▲ 在同等规模的模型中,Confucius4 在多个视觉数学基准测试中均取得业界最佳成绩
图片来源:https://huggingface.co/netease-youdao/Confucius4
更具决定性的突破在于实际成本效益。据相关负责人介绍,该新模型采用了精炼的推理链重构方案。通过聚合海量高质量、简洁的推理样本进行深度优化,将推理链的输出长度压缩了43.2%。
这意味着它能够以更少的令牌和更短的推理路径更快地给出答案,从而显著降低企业及开发者在实际商业场景中的推理成本。

▲ Confucius4 在多个视觉数学基准测试中显著减少了输出令牌数量
图片来源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4研究团队针对中国学生面临的实际作业、考试和解题场景对模型进行了深度优化。这使其能够应对真实的学习挑战,成为更具同理心的数字助手。
开源语音合成(TTS):支持14种语言,3秒内即可克隆原声,跨语言无口音问题
除多模态模型外,语音合成(TTS)引擎也已开源。该引擎基于前沿的“语音编码器 + 大型语言模型(LLM)”架构构建,为开发者和内容创作者提供了零样本、低门槛的语音克隆和情感合成能力。
目前,该引擎全面支持14种语言:中文、英语、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语和越南语。 该系统无需额外训练即可自然地在不同语言间转换说话者的声音,在保持声音一致性的同时,确保合成结果听起来像母语者一样流利自然,且在跨语言克隆过程中不会出现口音泄漏。
在语音克隆方面,Confucius4实现了完全的“上传即克隆”功能。用户只需提供任意音频素材,系统便能在三秒内复刻原始声音。 据公告称,该引擎在克隆任务上的准确率超过97%,克隆声音与原始声音的相似度超过85%。它在保留说话者独特嗓音特征的同时,还能准确再现其情感语调,其综合能力位居该领域前列。
此外,该开源模型在真实的多语言场景中展现出极强的鲁棒性,能够满足日常对话、新闻播报、企业宣传以及复杂情感表达等多种合成需求。
翻译模型质量全面升级,推理速度提升80%
作为有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了显著的技术升级,进一步提升了其在翻译任务中的表现。
在数据方面,孔子团队收集并清洗了数十亿条多语言数据条目,并聘请持有TEM-8认证的专业人员进行多维度人工评估,确保从源头起就拥有高质量的语料库。
在算法方面,该模型采用了创新的“多专家 OPD”模式,通过更智能的“柔性策略”充分发挥各专家的优势。同时,通过强化学习引入了格式奖励和语言检测机制,有效解决了机器翻译中常见的脱离语境翻译和混语输出等问题。
为满足高频、高并发工业应用的需求,更新后的翻译模型配备了高效的加速机制,可直接将整体推理速度提升80%。 结合定制化的自动化大模型评估与随机人工采样方案,新一代翻译模型在文本、图像和文档翻译等多场景中均展现出极高的速度与质量水准。
回顾有道在AI领域的历程,从最初推出首个教育领域大模型“孔子”,到推出颠覆传统口语练习方式的“虚拟口语教练Hi Echo”,再到将“孔子2.0”和“孔子3.0”全面融入软硬件生态系统, 有道始终引领着AI在真实场景中的赋能应用。2026年,有道通过LobsterAI、有道宝、有道会议助手和Thinkflow等一系列AI智能助手产品,加速了AI应用进程,构建了前瞻性的全场景AI智能助手矩阵。
“孔子4.0”的升级及核心模型的全面开源,不仅显著降低了多模态和语音合成领域开发者的门槛,更展现出一种生态闭环——底层核心技术滋养着上层智能代理矩阵。 有道希望,在全球开发者和开源社区的共同贡献下,这一全模态大模型生态系统能够为各行各业带来真正生产力的变革。
附录:开源地址:
“Confucius4”多模态模型:https://huggingface.co/netease-youdao/Confucius4
“Confucius4”语音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






