以优化为驱动的人工智能成为通用模型的新路径
伊利诺伊大学厄巴纳-香槟分校与弗吉尼亚大学的研究人员创建了一种新型模型架构,有望为构建更具弹性且推理能力更强的AI系统铺平道路。
该架构被命名为基于能量的变压器(EBT),能够自然地利用推理时期的可扩展性来应对复杂挑战。对企业而言,这意味着能够适应新场景且无需专用微调模型的成本高效人工智能应用。
系统2思维的挑战
心理学将人类认知划分为两种模式:快速直觉的系统1,以及缓慢审慎的系统2。当前大型语言模型(LLMs)在系统1任务中表现卓越,但人工智能领域正着力发展系统2思维以应对更复杂的推理问题。
推理模型采用多种推理时扩展方法来提升其处理难题的性能。一种常见技术是强化学习(RL),DeepSeek-R1和OpenAI的"o系列"等模型就运用了该技术——AI通过生成推理令牌获得奖励,直至得出正确解决方案。另一种策略被称为最佳n选一法,即生成多个可能答案,再通过验证系统选出最佳方案。
然而这些方法存在显著局限:通常仅适用于数学、编程等易验证的狭窄问题集,在创意写作等任务中表现可能下降。最新研究还表明,基于RL的方法未必能教会模型新推理技能,可能只是强化其对已知成功推理模式的复用。这限制了模型解决超出训练范围、需要真正探索能力的问题。
能量基模型(EBM)
这种新型架构另辟蹊径,基于称为能量基模型(EBM)的模型类别。其核心理念直截了当:模型不直接生成答案,而是学习一种充当验证器的"能量函数"。该函数接收输入(如提示词)和候选预测结果,并为其赋予数值(即"能量")。 低能量值意味着高兼容性——即预测与输入高度契合;高能量值则表明匹配度较差。
将此原理应用于AI推理时,研究人员在论文中提出开发者应将"思考视为基于学习验证器的优化过程,该验证器评估输入与候选预测之间的兼容性(非标准化概率)"。 该过程始于随机预测,通过最小化能量评分并探索可能解方案逐步优化,直至收敛至高兼容性答案。此方法基于核心理念:验证解方案往往远比从零生成新解简单得多。

这种"验证器中心"的设计解决了人工智能推理中的三大挑战:首先,它实现了动态计算资源分配,使模型能在难题上投入更多"思考"时间,而减少对简单问题的处理;其次,EBM模型能自然适应现实世界中不存在单一明确答案的不确定性问题;最后,它们自身即具备验证功能,无需外部模型辅助。
与采用独立生成器和验证器的系统不同,EBM将两者整合为统一模型。这种架构的显著优势在于提升泛化能力——由于验证新数据(分布外数据)的解决方案通常比生成正确答案更容易,EBM能更有效应对陌生情境。
尽管潜力巨大,EBM历来面临可扩展性问题。为解决此问题,研究人员引入了专为该框架设计的变体模型——EBT(增强型预测模型)。EBT经过训练,能先检查上下文与预测结果的兼容性,再通过迭代优化预测直至找到能量最低(兼容性最高)的输出。该流程有效模拟了人类每次预测时的思考过程。 团队创建了两种EBT变体:一种受GPT架构启发的仅解码器模型,以及一种类似BERT的双向模型。

能量基变换器(来源:GitHub) EBT的架构使其具备高度适应性,可兼容多种推理时扩展方法。论文第一作者、伊利诺伊大学厄巴纳-香槟分校计算机科学博士生Alexi Gladstone向VentureBeat表示:"EBT能生成更长的上下文推断链,具备自我验证能力,支持最佳N选一策略,也可从多个EBT模型中采样。" "最关键的是,所有这些能力都通过预训练习得。"
EBT实战应用
研究团队将EBTs与成熟架构进行对比测试:采用广受欢迎的Transformer++方案(离散模态)进行文本生成,使用扩散Transformer(DiT)处理视频预测和图像去噪等任务(连续模态)。评估主要基于两项标准:"学习可扩展性"(训练效率)与"推理可扩展性"(随计算资源增加的性能提升幅度)。
预训练阶段,EBTs展现出卓越效率,在数据规模、批量大小、参数数量及计算资源方面均实现比Transformer++高出35%的扩展率。这意味着EBTs能以更低成本实现更快训练。
在推理环节,EBT模型于推理任务中同样超越现有模型。通过"更长时间的思考"(采用更多优化步骤)及"自我验证"(生成多个候选方案并选择能量最低者),EBT在语言建模性能上较Transformer++提升29%。 研究人员解释道:"这印证了我们的论点——传统前馈变换器无法为每次预测动态分配额外计算资源,因此无法通过延长思考时间来提升每个词元的性能。"
在图像去噪任务中,EBT模型以减少99%的前向传递次数实现了优于DiT模型的效果。
关键在于,研究揭示EBTs比其他架构更具泛化能力。即使预训练性能相同或更弱,EBTs在下游任务上仍超越现有模型。当数据偏离分布(与训练数据不同)时,系统2思考带来的性能提升最为显著,表明EBTs在应对新颖困难挑战时具有特殊鲁棒性。
研究人员指出:"EBT思维的优势并非在所有数据上都表现一致,而是随分布偏移程度的增大而增强,这凸显了思维作为超越训练分布实现稳健泛化的关键机制。"
EBT的优势主要体现在两个关键方面: 首先,在当今基础模型的海量规模下,EBT有望显著超越大型语言模型中采用的经典Transformer架构。作者指出:"当现代基础模型在数据量扩大1000倍、模型规模增大1000倍的规模下训练时,我们预期EBT的预训练性能将远优于Transformer++方案。"
其次,EBT展现出更优越的数据效率。在高质量训练数据日益成为AI规模化瓶颈的时代,这成为关键优势。论文指出:"随着数据成为进一步扩展的主要限制因素,EBT的吸引力尤为突出。"
尽管推理机制不同,EBT架构与Transformer高度兼容,可直接替代现有大型语言模型。
"EBT与现有硬件/推理框架高度兼容,"Gladstone指出,包括在GPU或TPU上使用前馈模型的推测性解码。他补充道,该架构既可运行于LPUs等专用加速器及FlashAttention-3等优化算法,也能通过vLLM等通用推理框架部署。
对开发者和企业而言,EBT强大的推理与泛化能力可成为构建新一代AI应用的可靠基石。"更长远的思考能力将广泛惠及几乎所有企业应用,但最具突破性的应用场景在于需要重大决策、涉及安全领域或数据有限的场景,"格拉德斯通强调。
相关文章
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
拜耳利用Iambic AI加速药物研发
尤尔根·埃克哈特(Juergen Eckhardt)医学博士现任拜耳制药业务发展与授权部负责人。拜耳正借助Iambic Therapeutics将前沿人工智能模型应用于药物研发,同时在其西班牙工厂推进一项重大的脱碳项目。拜耳已与科技公司Iambic Therapeutics建立战略采购合作伙伴关系,以加速小分子药物发现和新药研发。这家老牌企业正与合作伙伴携手,利用其人工智能驱动的平台,针对传统上难
Multiverse Computing推出免费压缩生成式AI模型
大型语言模型面临着一个重大挑战:其庞大的体量。西班牙初创公司Multiverse Computing正通过创建压缩模型来解决这一问题,旨在弥合尖端人工智能能力与企业实际可负担实施能力之间的差距。其核心创新在于CompactifAI压缩技术——这项受量子计算原理启发的技术已被这家巴斯克公司用于优化OpenAI的模型。从今天起,开发者可在Hugging Face平台免费获取Multiverse增强版H
相关专题推荐
评论 (0)
0/500
伊利诺伊大学厄巴纳-香槟分校与弗吉尼亚大学的研究人员创建了一种新型模型架构,有望为构建更具弹性且推理能力更强的AI系统铺平道路。
该架构被命名为基于能量的变压器(EBT),能够自然地利用推理时期的可扩展性来应对复杂挑战。对企业而言,这意味着能够适应新场景且无需专用微调模型的成本高效人工智能应用。
系统2思维的挑战
心理学将人类认知划分为两种模式:快速直觉的系统1,以及缓慢审慎的系统2。当前大型语言模型(LLMs)在系统1任务中表现卓越,但人工智能领域正着力发展系统2思维以应对更复杂的推理问题。
推理模型采用多种推理时扩展方法来提升其处理难题的性能。一种常见技术是强化学习(RL),DeepSeek-R1和OpenAI的"o系列"等模型就运用了该技术——AI通过生成推理令牌获得奖励,直至得出正确解决方案。另一种策略被称为最佳n选一法,即生成多个可能答案,再通过验证系统选出最佳方案。
然而这些方法存在显著局限:通常仅适用于数学、编程等易验证的狭窄问题集,在创意写作等任务中表现可能下降。最新研究还表明,基于RL的方法未必能教会模型新推理技能,可能只是强化其对已知成功推理模式的复用。这限制了模型解决超出训练范围、需要真正探索能力的问题。
能量基模型(EBM)
这种新型架构另辟蹊径,基于称为能量基模型(EBM)的模型类别。其核心理念直截了当:模型不直接生成答案,而是学习一种充当验证器的"能量函数"。该函数接收输入(如提示词)和候选预测结果,并为其赋予数值(即"能量")。 低能量值意味着高兼容性——即预测与输入高度契合;高能量值则表明匹配度较差。
将此原理应用于AI推理时,研究人员在论文中提出开发者应将"思考视为基于学习验证器的优化过程,该验证器评估输入与候选预测之间的兼容性(非标准化概率)"。 该过程始于随机预测,通过最小化能量评分并探索可能解方案逐步优化,直至收敛至高兼容性答案。此方法基于核心理念:验证解方案往往远比从零生成新解简单得多。

这种"验证器中心"的设计解决了人工智能推理中的三大挑战:首先,它实现了动态计算资源分配,使模型能在难题上投入更多"思考"时间,而减少对简单问题的处理;其次,EBM模型能自然适应现实世界中不存在单一明确答案的不确定性问题;最后,它们自身即具备验证功能,无需外部模型辅助。
与采用独立生成器和验证器的系统不同,EBM将两者整合为统一模型。这种架构的显著优势在于提升泛化能力——由于验证新数据(分布外数据)的解决方案通常比生成正确答案更容易,EBM能更有效应对陌生情境。
尽管潜力巨大,EBM历来面临可扩展性问题。为解决此问题,研究人员引入了专为该框架设计的变体模型——EBT(增强型预测模型)。EBT经过训练,能先检查上下文与预测结果的兼容性,再通过迭代优化预测直至找到能量最低(兼容性最高)的输出。该流程有效模拟了人类每次预测时的思考过程。 团队创建了两种EBT变体:一种受GPT架构启发的仅解码器模型,以及一种类似BERT的双向模型。

EBT的架构使其具备高度适应性,可兼容多种推理时扩展方法。论文第一作者、伊利诺伊大学厄巴纳-香槟分校计算机科学博士生Alexi Gladstone向VentureBeat表示:"EBT能生成更长的上下文推断链,具备自我验证能力,支持最佳N选一策略,也可从多个EBT模型中采样。" "最关键的是,所有这些能力都通过预训练习得。"
EBT实战应用
研究团队将EBTs与成熟架构进行对比测试:采用广受欢迎的Transformer++方案(离散模态)进行文本生成,使用扩散Transformer(DiT)处理视频预测和图像去噪等任务(连续模态)。评估主要基于两项标准:"学习可扩展性"(训练效率)与"推理可扩展性"(随计算资源增加的性能提升幅度)。
预训练阶段,EBTs展现出卓越效率,在数据规模、批量大小、参数数量及计算资源方面均实现比Transformer++高出35%的扩展率。这意味着EBTs能以更低成本实现更快训练。
在推理环节,EBT模型于推理任务中同样超越现有模型。通过"更长时间的思考"(采用更多优化步骤)及"自我验证"(生成多个候选方案并选择能量最低者),EBT在语言建模性能上较Transformer++提升29%。 研究人员解释道:"这印证了我们的论点——传统前馈变换器无法为每次预测动态分配额外计算资源,因此无法通过延长思考时间来提升每个词元的性能。"
在图像去噪任务中,EBT模型以减少99%的前向传递次数实现了优于DiT模型的效果。
关键在于,研究揭示EBTs比其他架构更具泛化能力。即使预训练性能相同或更弱,EBTs在下游任务上仍超越现有模型。当数据偏离分布(与训练数据不同)时,系统2思考带来的性能提升最为显著,表明EBTs在应对新颖困难挑战时具有特殊鲁棒性。
研究人员指出:"EBT思维的优势并非在所有数据上都表现一致,而是随分布偏移程度的增大而增强,这凸显了思维作为超越训练分布实现稳健泛化的关键机制。"
EBT的优势主要体现在两个关键方面: 首先,在当今基础模型的海量规模下,EBT有望显著超越大型语言模型中采用的经典Transformer架构。作者指出:"当现代基础模型在数据量扩大1000倍、模型规模增大1000倍的规模下训练时,我们预期EBT的预训练性能将远优于Transformer++方案。"
其次,EBT展现出更优越的数据效率。在高质量训练数据日益成为AI规模化瓶颈的时代,这成为关键优势。论文指出:"随着数据成为进一步扩展的主要限制因素,EBT的吸引力尤为突出。"
尽管推理机制不同,EBT架构与Transformer高度兼容,可直接替代现有大型语言模型。
"EBT与现有硬件/推理框架高度兼容,"Gladstone指出,包括在GPU或TPU上使用前馈模型的推测性解码。他补充道,该架构既可运行于LPUs等专用加速器及FlashAttention-3等优化算法,也能通过vLLM等通用推理框架部署。
对开发者和企业而言,EBT强大的推理与泛化能力可成为构建新一代AI应用的可靠基石。"更长远的思考能力将广泛惠及几乎所有企业应用,但最具突破性的应用场景在于需要重大决策、涉及安全领域或数据有限的场景,"格拉德斯通强调。
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
拜耳利用Iambic AI加速药物研发
尤尔根·埃克哈特(Juergen Eckhardt)医学博士现任拜耳制药业务发展与授权部负责人。拜耳正借助Iambic Therapeutics将前沿人工智能模型应用于药物研发,同时在其西班牙工厂推进一项重大的脱碳项目。拜耳已与科技公司Iambic Therapeutics建立战略采购合作伙伴关系,以加速小分子药物发现和新药研发。这家老牌企业正与合作伙伴携手,利用其人工智能驱动的平台,针对传统上难
Multiverse Computing推出免费压缩生成式AI模型
大型语言模型面临着一个重大挑战:其庞大的体量。西班牙初创公司Multiverse Computing正通过创建压缩模型来解决这一问题,旨在弥合尖端人工智能能力与企业实际可负担实施能力之间的差距。其核心创新在于CompactifAI压缩技术——这项受量子计算原理启发的技术已被这家巴斯克公司用于优化OpenAI的模型。从今天起,开发者可在Hugging Face平台免费获取Multiverse增强版H





首页






