选项
首页
新闻
三星紧凑型人工智能模型在推理能力上胜过大型竞争对手

三星紧凑型人工智能模型在推理能力上胜过大型竞争对手

2025-12-03
130

三星公司的一位人工智能研究人员发表了一篇新论文,概述了紧凑型网络在处理复杂推理任务时如何超越大规模大型语言模型(LLM)。

在争夺人工智能主导地位的竞赛中,业界的流行口号一直是 "越大越好"。当科技巨头们投资数十亿美元开发越来越大的模型时,三星SAIL蒙特利尔分公司的亚历克西娅-乔利科尔-马丁诺(Alexia Jolicoeur-Martineau)提出了一种不同的、更高效的方法,即使用微小递归模型(TRM)。

TRM只需700万个参数,不到顶级LLM的0.01%,就能在ARC-AGI智力测验等声名狼藉的挑战性基准上取得新的一流结果。三星的研究结果挑战了 "规模是推动人工智能发展的唯一途径 "这一普遍观点,提出了一种更具可持续性和参数效率的替代方案。

克服规模限制

虽然 LLM 擅长生成类似人类的文本,但它们处理复杂、多步骤推理的能力往往比较脆弱。由于 LLM 会逐个标记生成响应,因此早期的一个错误可能会影响整个解决方案,导致最终答案不正确。

思维链(Chain-of-Thought)等技术可以将问题一步步分解,从而缓解这一问题。然而,这些方法的计算成本很高,通常需要大量高质量的推理数据,而且仍然可能产生有缺陷的逻辑。即使有了这些改进,LLM 也难以解决那些要求逻辑执行完美无瑕的难题。

三星的研究建立在最近的分层推理模型(HRM)基础之上。HRM 使用两个小型神经网络,以不同频率递归完善答案。尽管前景看好,但该模型非常复杂,依赖于不确定的生物论据和并非始终适用的定点定理。

与 HRM 的双网络结构不同,TRM 采用了单个紧凑型网络,可递归增强其内部推理和建议答案。

该模型接收问题、初始答案猜测和潜在推理特征。然后,它通过多个步骤来完善基于所有三个输入的推理。利用改进后的推理,它可以更新最终的答案预测。整个过程最多可重复 16 次,从而使模型能够以参数效率极高的方式逐步进行自我修正。

研究发现,与四层网络相比,两层网络的泛化效果要好得多。较小的设计似乎可以防止过度拟合--这是在有限的专业数据集上进行训练时常见的问题。

TRM 还消除了其前身的复杂数学假设。最初的 HRM 模型必须假设函数收敛到一个固定点,才能证明其训练的合理性。TRM 绕过了这一问题,通过其完整的递归过程进行反向传播--这一改变极大地提高了性能,在消融测试中将数独-极限基准准确率从 56.5% 提高到 87.4%。

三星模型以更少的资源刷新人工智能基准

结果令人震惊。在仅使用 1,000 个训练示例的 Sudoku-Extreme 数据集上,TRM 的测试准确率达到了 87.4%,与 HRM 的 55% 相比实现了重大飞跃。在 "迷宫-困难"(Maze-Hard)数据集上,TRM 的测试准确率为 85.3%,而 HRM 为 74.5%。

最值得注意的是,TRM 在抽象与推理语料库(ARC-AGI)上取得了显著进步,该语料库是为评估人工智能中真正的流体智能而设计的基准。仅使用 700 万个参数,TRM 在 ARC-AGI-1 上的准确率就达到了 44.6%,在 ARC-AGI-2 上达到了 7.8%。这超过了使用 2700 万个参数的 HRM,甚至超过了世界上许多最大的 LLM。相比之下,Gemini 2.5 Pro 在 ARC-AGI-2 中的得分率仅为 4.9%。

TRM 的训练过程也得到了优化。简化了称为 ACT 的自适应机制,该机制用于确定模型何时已充分改进了答案,从而可以继续前进,从而消除了在每个训练步骤中进行代价高昂的第二次前向传递的需要。这一调整并未损害整体泛化效果。

三星的研究有力地反驳了建立越来越庞大的人工智能模型的趋势。它表明,通过设计能够进行迭代推理和自我修正的架构,只需使用极少的计算资源,就能解决极其困难的问题。

另请参见:谷歌新人工智能代理重写代码,自动修复漏洞

想从行业领导者那里了解更多有关人工智能和大数据的信息?参加在阿姆斯特丹、加利福尼亚和伦敦举办的人工智能与大数据博览会。这一综合性活动是 TechEx 的一部分,与网络安全博览会等其他主要科技活动同时举行。单击此处了解详情。

AI News 由 TechForge Media 提供技术支持。点击此处了解其他即将举行的企业技术活动和网络研讨会。

相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出 奥利押注隐私保护,力争在AI助手竞争中胜出 要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化 AI LIVE:伦敦将如何探讨人工智能与工业自动化 本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
搜索引擎优化 最适合制定搜索策略的AI搜索结果页面(SERP)分析工具
最适合制定搜索策略的AI搜索结果页面(SERP)分析工具

2026年最新、最受欢迎且评价最高的人工智能搜索结果页面(SERP)分析工具,均由XIX.AI通过严格的实际测试精心筛选,并每周更新排名。这些强大的工具可助您发掘隐藏的优化机会、提升内容表现,并在搜索领域获得竞争优势。立即寻找最适合您的工具,提升您的搜索策略。现在就来探索吧!

13 个工具
xix.ai
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
评论 (0)
0/500
OR