本土机型强势崛起:Doubao跻身全球顶尖行列,小米MiMo在数学推理领域独占鳌头
中国的大型语言模型正迅速从单纯的追随者转变为积极的协作者,甚至在某些领域成为开拓者。
3月30日,中国大型语言模型基准评估项目SuperCLUE 发布了2026年3月的评估结果。本次评估涵盖了来自中国和海外的22款主流模型,测试了包括数学推理、科学推理和代码生成在内的六项核心能力。结果显示,以“豆宝”为首的国内模型现已跻身全球顶尖行列。

全球视角:海外闭源模型仍占主导,"斗宝"紧随其后
在综合排名中,海外闭源模型继续展现出强大的技术实力:
前三名:Anthropic的Claude-Opus-4.6 、谷歌的Gemini-3.1-Pro 以及OpenAI的GPT-5.4 分获全球第一、第二和第三名。
国内亮点:字节跳动“斗宝”(Doubao-Seed-2.0-pro) 以71.53分位居国内榜首。它不仅稳居全球顶尖行列,更将与GPT-5.4的分差缩小至仅0.95分。
智能代理突破:在代理任务规划维度上,Doubao 表现优于多款海外模型,跻身全球前五。
小米表现:MiMo-V2系列在数学推理方面表现突出
作为进军AI领域的智能手机巨头,小米集团的MiMo 系列在本轮评估中表现稳定:
数学之星: MiMo-V2-Pro 以60.67分跻身领先的闭源模型之列,在数学推理任务中取得了84.03分的优异成绩。
双模型上榜:除Pro版本外,开源的MiMo-V2-Flash 也跻身榜单,在代码生成等领域展现出强劲潜力。
开源赛道:国产模型全面领跑
与闭源模型的激烈角逐不同,国产模型在开源领域已确立了明显的统治地位:
前三甲: 包括Kimi-K2. 5-Thinking和Qwen3. 5-397B在内的国产开源模型包揽了开源排行榜前三名。
强势表现:评估数据表明,国内开源模型在性能上明显优于海外竞争对手,使其成为全球开发者的首选。
结论:从参数大战到实战表现
正如2026年3月的排名所示,中国的大模型已不再局限于理解中文语境。如今,它们正在逻辑推理和代码生成等高难度领域与全球领军者展开正面交锋。随着Doubao 排名的上升以及小米MiMo
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
中国的大型语言模型正迅速从单纯的追随者转变为积极的协作者,甚至在某些领域成为开拓者。
3月30日,中国大型语言模型基准评估

全球视角:海外闭源模型仍占主导,"斗宝"紧随其后
在综合排名中,海外闭源模型继续展现出强大的技术实力:
前三名:Anthropic的
国内亮点:字节
智能代理突破:在代理任务规划维度上
小米表现:MiMo-V2系列在数学推理方面表现突出
作为进军AI领域的智能手机巨头
数学之星:
双模型上榜:除Pro版本外,开源的
开源赛道:国产模型全面领跑
与闭源模型的激烈角逐不同,国产模型在开源领域已确立了明显的统治地位:
前三甲:
强势表现:评估数据表明,国内开源模型在性能上明显优于海外竞争对手,使其成为全球开发者的首选。
结论:从参数大战到实战表现
正如2026年3月的排名所示,中国的大模型已不再局限于理解中文语境。如今,它们正在逻辑推理和代码生成等高难度领域与全球领军者展开正面交锋。随着
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work





首页






