算法收益优先,模型扩展时代终结

在过去十年的大部分时间里,人工智能主要通过扩大规模来实现进步。成功来自于更大的数据集、更多的参数和更强的计算能力,各团队竞相建立越来越大的模型。进步是以万亿个参数和 PB 级的训练数据来衡量的--我们现在称之为扩展时代。虽然这种方法推动了当今人工智能能力的发展,但我们正接近这样一个阶段:简单地将模型做大,已不再是最有效、最智能或最可持续的前进道路。因此,重点正在从单纯的规模转向算法的突破。本文将探讨为什么仅仅扩大规模已经不够,以及下一波人工智能进步将如何依赖于算法创新。
模型扩展的收益递减法则
扩展时代建立在坚实的经验基础之上。研究人员不断发现,模型和数据集规模的增加会带来可预测的性能提升--这种模式后来被称为扩展法则。这些原则成为领先的人工智能实验室的指导战略,引发了一场逐步开发大型系统的竞赛。这种竞争催生了大型语言模型和基础模型,推动了当今许多人工智能应用的发展。然而,与任何指数级趋势一样,人工智能的扩展曲线现在开始趋于平稳。开发更大模型的成本正在急剧上升。现在,训练一个最先进的系统所消耗的能源相当于一个小镇的能耗,从而引发了重大的环境问题。财政支出已变得如此巨大,以至于只有少数组织能够参与其中。与此同时,我们也看到了收益递减的明显信号。参数数量增加一倍已不再能带来相应的能力提升。改进变得循序渐进,主要是完善现有知识,而不是实现新功能。每增加一美元和瓦特的投资所带来的价值正在下降。扩展方法正在接近其实际和经济极限。
新领域:算法效率
扩展法则的限制促使研究人员转向算法效率。现在的重点不再是单纯依靠计算蛮力,而是设计更智能的算法,更有效地利用资源。最近的发展突显了这一转变的前景。例如,由注意力机制驱动的变形金刚架构多年来一直在人工智能领域占据主导地位。然而,这种机制有一个根本性的局限:它的计算需求随着序列长度的增加而迅速增长。状态空间模型(SSM),如 Mamba,正成为引人注目的替代方案。通过促进更有选择性的推理,SSM 的性能可与更大的变形金刚相媲美,同时运行速度更快,使用的内存也大大减少。
算法效率的另一个例证是专家混合模型(MoE)的出现。MoE 系统不是让整个庞大的网络参与每项输入,而是只将任务分配给最相关的小型专业网络子集,即 "专家"。虽然整个模型可能包含数十亿个参数,但每次计算只利用一小部分。这就好比拥有一个庞大的图书馆,但只查阅少数必要的书籍来回答问题,而不是每次都阅读馆内的所有书籍。这样做的结果是,巨大模型的知识容量与更小模型的运行效率相得益彰。
DeepSeek-V3 是整合了这些概念的另一个例子,它是一个使用多头潜意识(MLA)增强的专家混合模型。MLA 通过压缩键值状态完善了传统的注意力,使模型能够高效处理冗长的序列--类似于 SSM,同时保持了 Transformers 的优势。DeepSeek-V3 拥有 2360 亿个参数,但每个任务只激活一小部分参数,因此在编码和逻辑推理等领域取得了领先的性能,同时与同等规模的大型驱动模型相比,DeepSeek-V3 更为实用,资源占用更少。
这些并不是孤立的案例。它们预示着向更智能、更高效设计的更广泛发展。研究人员现在正集中精力研究如何在不影响性能的前提下,使模型更快、更紧凑、更少依赖数据。
为什么这一转变很重要
从优先考虑规模到强调算法创新的转变对人工智能领域有着深远的影响。首先,它使人工智能开发民主化。突破不再仅仅取决于能否使用最强大的超级计算机。现在,一个规模小、技术娴熟的研究团队就能设计出一种新颖的设计,其性能远远超过用更多预算创建的模型。这重新调整了创新的方向,使其从资源竞争转变为理念和专业知识的竞争。因此,大学、初创企业和独立实验室可以发挥更重要的作用,挑战大型科技公司的主导地位。
其次,它使人工智能在现实世界的应用更加实用。在研究论文中,一个拥有 5000 亿个参数的模型可能会给人留下深刻印象,但其庞大的规模使其难以部署,而且成本高昂。相比之下,Mamba 或专家混合模型等高效替代方案可以在标准硬件(包括边缘设备)上运行。这种实用性对于将人工智能集成到医疗诊断系统或手机实时翻译功能等日常工具中至关重要。
第三,它解决了可持续性问题。构建和运行大规模人工智能模型所需的能源正在成为一个严重的环境问题。通过注重效率,我们可以大幅减少与人工智能开发相关的碳足迹。
下一步是什么?智能设计时代
我们正在进入智能设计时代。核心问题正在从 "我们能建立多大的模型?"转变为 "我们如何设计一个本质上更智能、更高效的模型?"
这一演变将刺激多个核心研究领域的创新。人工智能模型架构有望取得进展。新出现的模型,包括前面提到的状态空间模型,可以重新定义神经网络处理信息的方式。例如,受动态系统启发的架构已经在实验环境中展示出更强的能力。另一个关键领域是训练技术,它能让模型在实例少得多的情况下有效学习。少次学习和零次学习方面的进步正在使人工智能变得更节省数据,而激活引导等方法则能在不重新训练的情况下实现行为增强。训练后改进和合成数据生成也在大幅降低训练要求--有时可降低 10,000 倍。
我们还将看到人们对神经符号人工智能等混合模型的兴趣日益浓厚。神经符号人工智能结合了神经网络的模式识别和符号系统的逻辑严谨性,具有更好的可解释性和更低的数据依赖性,在 2025 年正受到越来越多的关注。著名的例子包括 AlphaGeometry 2 和 AlphaProof,它们帮助谷歌 DeepMind 在 2025 年国际数学奥林匹克(IMO)上获得了金牌。我们的目标是创造出不仅能从统计学角度预测下一个单词,还能以更接近人类的方式理解和推理世界的系统。
底线
缩放时代是不可或缺的,它为人工智能带来了非凡的进步。它突破了可实现的极限,创造了我们今天使用的基础技术。然而,就像任何成熟的技术一样,最初的战略最终也会达到极限。下一个重大突破不会源于在现有堆栈上增加更多层次。相反,它们将产生于对堆栈本身的重新构想。
未来属于那些开拓新算法、架构和机器学习核心科学的人。未来,智能的衡量标准不是参数的数量,而是设计的复杂程度。对更智能算法的追求才刚刚开始。这一转变将为更具包容性、对环境负责和真正智能的人工智能铺平道路。
相关文章
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
相关专题推荐
评论 (1)
0/500

在过去十年的大部分时间里,人工智能主要通过扩大规模来实现进步。成功来自于更大的数据集、更多的参数和更强的计算能力,各团队竞相建立越来越大的模型。进步是以万亿个参数和 PB 级的训练数据来衡量的--我们现在称之为扩展时代。虽然这种方法推动了当今人工智能能力的发展,但我们正接近这样一个阶段:简单地将模型做大,已不再是最有效、最智能或最可持续的前进道路。因此,重点正在从单纯的规模转向算法的突破。本文将探讨为什么仅仅扩大规模已经不够,以及下一波人工智能进步将如何依赖于算法创新。
模型扩展的收益递减法则
扩展时代建立在坚实的经验基础之上。研究人员不断发现,模型和数据集规模的增加会带来可预测的性能提升--这种模式后来被称为扩展法则。这些原则成为领先的人工智能实验室的指导战略,引发了一场逐步开发大型系统的竞赛。这种竞争催生了大型语言模型和基础模型,推动了当今许多人工智能应用的发展。然而,与任何指数级趋势一样,人工智能的扩展曲线现在开始趋于平稳。开发更大模型的成本正在急剧上升。现在,训练一个最先进的系统所消耗的能源相当于一个小镇的能耗,从而引发了重大的环境问题。财政支出已变得如此巨大,以至于只有少数组织能够参与其中。与此同时,我们也看到了收益递减的明显信号。参数数量增加一倍已不再能带来相应的能力提升。改进变得循序渐进,主要是完善现有知识,而不是实现新功能。每增加一美元和瓦特的投资所带来的价值正在下降。扩展方法正在接近其实际和经济极限。
新领域:算法效率
扩展法则的限制促使研究人员转向算法效率。现在的重点不再是单纯依靠计算蛮力,而是设计更智能的算法,更有效地利用资源。最近的发展突显了这一转变的前景。例如,由注意力机制驱动的变形金刚架构多年来一直在人工智能领域占据主导地位。然而,这种机制有一个根本性的局限:它的计算需求随着序列长度的增加而迅速增长。状态空间模型(SSM),如 Mamba,正成为引人注目的替代方案。通过促进更有选择性的推理,SSM 的性能可与更大的变形金刚相媲美,同时运行速度更快,使用的内存也大大减少。
算法效率的另一个例证是专家混合模型(MoE)的出现。MoE 系统不是让整个庞大的网络参与每项输入,而是只将任务分配给最相关的小型专业网络子集,即 "专家"。虽然整个模型可能包含数十亿个参数,但每次计算只利用一小部分。这就好比拥有一个庞大的图书馆,但只查阅少数必要的书籍来回答问题,而不是每次都阅读馆内的所有书籍。这样做的结果是,巨大模型的知识容量与更小模型的运行效率相得益彰。
DeepSeek-V3 是整合了这些概念的另一个例子,它是一个使用多头潜意识(MLA)增强的专家混合模型。MLA 通过压缩键值状态完善了传统的注意力,使模型能够高效处理冗长的序列--类似于 SSM,同时保持了 Transformers 的优势。DeepSeek-V3 拥有 2360 亿个参数,但每个任务只激活一小部分参数,因此在编码和逻辑推理等领域取得了领先的性能,同时与同等规模的大型驱动模型相比,DeepSeek-V3 更为实用,资源占用更少。
这些并不是孤立的案例。它们预示着向更智能、更高效设计的更广泛发展。研究人员现在正集中精力研究如何在不影响性能的前提下,使模型更快、更紧凑、更少依赖数据。
为什么这一转变很重要
从优先考虑规模到强调算法创新的转变对人工智能领域有着深远的影响。首先,它使人工智能开发民主化。突破不再仅仅取决于能否使用最强大的超级计算机。现在,一个规模小、技术娴熟的研究团队就能设计出一种新颖的设计,其性能远远超过用更多预算创建的模型。这重新调整了创新的方向,使其从资源竞争转变为理念和专业知识的竞争。因此,大学、初创企业和独立实验室可以发挥更重要的作用,挑战大型科技公司的主导地位。
其次,它使人工智能在现实世界的应用更加实用。在研究论文中,一个拥有 5000 亿个参数的模型可能会给人留下深刻印象,但其庞大的规模使其难以部署,而且成本高昂。相比之下,Mamba 或专家混合模型等高效替代方案可以在标准硬件(包括边缘设备)上运行。这种实用性对于将人工智能集成到医疗诊断系统或手机实时翻译功能等日常工具中至关重要。
第三,它解决了可持续性问题。构建和运行大规模人工智能模型所需的能源正在成为一个严重的环境问题。通过注重效率,我们可以大幅减少与人工智能开发相关的碳足迹。
下一步是什么?智能设计时代
我们正在进入智能设计时代。核心问题正在从 "我们能建立多大的模型?"转变为 "我们如何设计一个本质上更智能、更高效的模型?"
这一演变将刺激多个核心研究领域的创新。人工智能模型架构有望取得进展。新出现的模型,包括前面提到的状态空间模型,可以重新定义神经网络处理信息的方式。例如,受动态系统启发的架构已经在实验环境中展示出更强的能力。另一个关键领域是训练技术,它能让模型在实例少得多的情况下有效学习。少次学习和零次学习方面的进步正在使人工智能变得更节省数据,而激活引导等方法则能在不重新训练的情况下实现行为增强。训练后改进和合成数据生成也在大幅降低训练要求--有时可降低 10,000 倍。
我们还将看到人们对神经符号人工智能等混合模型的兴趣日益浓厚。神经符号人工智能结合了神经网络的模式识别和符号系统的逻辑严谨性,具有更好的可解释性和更低的数据依赖性,在 2025 年正受到越来越多的关注。著名的例子包括 AlphaGeometry 2 和 AlphaProof,它们帮助谷歌 DeepMind 在 2025 年国际数学奥林匹克(IMO)上获得了金牌。我们的目标是创造出不仅能从统计学角度预测下一个单词,还能以更接近人类的方式理解和推理世界的系统。
底线
缩放时代是不可或缺的,它为人工智能带来了非凡的进步。它突破了可实现的极限,创造了我们今天使用的基础技术。然而,就像任何成熟的技术一样,最初的战略最终也会达到极限。下一个重大突破不会源于在现有堆栈上增加更多层次。相反,它们将产生于对堆栈本身的重新构想。
未来属于那些开拓新算法、架构和机器学习核心科学的人。未来,智能的衡量标准不是参数的数量,而是设计的复杂程度。对更智能算法的追求才刚刚开始。这一转变将为更具包容性、对环境负责和真正智能的人工智能铺平道路。
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型





首页






