以優化為驅動的人工智慧,正成為通用的模型發展新途徑
伊利諾大學厄巴納-香檳分校與維吉尼亞大學的研究人員開發出一種新型模型架構,有望為具備更強推理能力且更具韌性的AI系統鋪平道路。
名為「能量基變壓器」(EBT)的架構,能自然運用推論時間擴展性來解決複雜挑戰。對企業而言,這意味著能以成本效益方式部署人工智慧應用,無需專門調校模型即可適應新情境。
系統二思維的挑戰
在心理學中,人類認知通常分為兩種模式:快速直覺的系統一,以及較緩慢、更刻意且具分析性的系統二。當今大型語言模型(LLMs)在系統一任務上表現優異,但人工智慧領域現正聚焦於發展系統二思維,以處理更複雜的推理問題。
推理模型運用多種推論時擴展技術來提升其處理艱難問題的效能。常見技術包括強化學習(RL),如DeepSeek-R1與OpenAI的「o系列」模型,透過生成推理代幣獲取獎勵直至得出正確解法。另一策略稱為最佳解選擇(best-of-n),即生成多個可能答案並透過驗證系統篩選出最佳方案。
然而這些方法存在顯著局限:通常僅適用於數學、程式設計等易驗證的狹窄題型,在創意寫作等任務中表現可能下滑。近期研究更指出,基於強化學習的方法未必能教導模型新推理能力,僅是鼓勵其重複已知的成功推理模式,這限制了模型解決超出訓練範疇、需真正探索能力問題的潛力。
能量型模型(EBM)
此新型架構另闢蹊徑,建立於稱為能量基礎模型(EBM)的類別之上。其核心概念直觀明瞭:模型並非直接生成答案,而是學習一種作為驗證器的「能量函數」。該函數接收輸入(如提示詞)與候選預測結果,進而賦予其數值(即「能量」)。 低能量分數代表高度兼容性,意味預測與輸入高度契合;高能量分數則顯示匹配度不佳。
將此概念應用於人工智慧推理時,研究人員在論文中提出開發者應將「思考視為基於學習驗證器的優化程序,該程序評估輸入與候選預測之間的兼容性(未歸一化機率)」。 該過程始於隨機預測,透過逐步最小化能量分數並探索可能解法,直至收斂至高度相容的答案。此方法基於核心理念:驗證解法往往遠比從零生成解法更為簡便。

這種「驗證器中心」設計解決了人工智慧推理的三大難題:首先,它實現動態運算資源分配,使模型能在困難問題上「思考」更久,而將較少時間花費在簡單問題上;其次,EBM能自然適應現實世界問題的不確定性——這些問題往往沒有單一明確答案;第三,它們本身即具備驗證功能,無需外部模型輔助。
有別於採用獨立生成器與驗證器的系統,EBM將兩者整合為單一統一模型。此架構的關鍵優勢在於提升泛化能力——由於驗證新數據(分布外數據)的解通常比生成正確答案更容易,EBM能更有效應對陌生情境。
儘管潛力可觀,EBM歷來面臨可擴展性問題。為此,研究團隊提出專為此框架設計的變體模型——EBT(增強型語境模型)。EBT經訓練後,會先檢驗語境與預測結果的兼容性,再逐步優化預測直至找出最低能量(最高兼容性)的輸出。此流程有效模擬了每次預測背後的思考過程。 團隊開發了兩種EBT變體:受GPT架構啟發的純解碼器模型,以及類似BERT的雙向模型。

能量型變壓器(來源:GitHub) EBT架構使其具備高度適應性,能與多種推論時擴展方法相容。論文第一作者、伊利諾大學厄巴納-香檳分校電腦科學博士生Alexi Gladstone向VentureBeat表示:「EBT可生成更長的CoT、進行自我驗證、執行最佳N選一,或從多個EBT中採樣。」 「最關鍵的是,所有這些能力皆在預訓練階段完成學習。」
EBT實戰應用
研究團隊將EBTs與成熟架構進行對比測試:採用熱門的Transformer++方案進行文本生成(離散模態),並以擴散變換器(DiT)處理影片預測與影像去噪等任務(連續模態)。評估標準聚焦兩大核心指標:「學習擴展性」(訓練效率)與「推理擴展性」(隨著推理階段計算資源增加,性能提升幅度)。
預訓練階段,EBTs展現卓越效率,在數據規模、批次大小、參數數量及運算資源等維度上,擴展率較Transformer++高出35%。這意味著EBTs能以更快速、更經濟的方式完成訓練。
在推理階段,EBT於推理任務中同樣超越現有模型。透過「更長時間思考」(採用更多優化步驟)與執行「自我驗證」(生成多個候選方案並選擇能量最低者),EBT的語言建模性能較Transformer++提升29%。 研究人員解釋:「這印證了我們的論點——傳統前饋變換器無法為每次預測動態分配額外運算資源,因此無法透過更長時間的思考來提升每個詞元的表現。」
在圖像去噪任務中,EBT模型不僅以減少99%的前向傳遞次數,仍展現優於DiT模型的表現。
關鍵在於,研究揭示EBTs的泛化能力優於其他架構。即使預訓練表現相同或較弱,EBTs在下游任務中仍超越現有模型。當數據偏離訓練分布時(與訓練數據不同),第二系統思考帶來的效能提升尤為顯著,顯示EBTs面對新穎艱鉅挑戰時具備卓越的穩健性。
研究人員指出:「EBTs思考模式的效益並非在所有數據中均等顯現,而是隨分布偏移幅度呈正向擴展,凸顯思考能力是突破訓練分布限制、實現穩健泛化的關鍵機制。」
EBTs的優勢基於兩大關鍵因素顯著突出。 首先,在當今基礎模型的大規模架構下,EBTs有望大幅超越大型語言模型採用的經典變壓器架構。作者觀察到:「當基礎模型規模擴增至訓練數據量增加1000倍、模型體積擴大1000倍時,我們預期EBTs的預訓練表現將顯著優於Transformer++方案。」
其次,EBT展現出更卓越的數據效率。在優質訓練數據日益成為AI擴展瓶頸的時代,此優勢至關重要。論文指出:「當數據成為進一步擴展的主要限制因素時,EBT的吸引力便格外突出。」
儘管推論機制不同,EBT架構與Transformer高度相容,可直接替代現有大型語言模型。
葛拉德斯通強調:「EBT與現有硬體/推論框架高度相容」,包含運用GPU或TPU上的前饋模型進行推測解碼。他進一步表示,確信該架構能運行於LPUs等專用加速器及FlashAttention-3等優化演算法,亦可透過vLLM等通用推論框架部署。
對開發者與企業而言,EBT強大的推理與泛化能力,將成為構建次世代AI應用的堅實基礎。「更長遠的思考能力幾乎能惠及所有企業應用,但最具潛力的領域在於需做出關鍵決策、涉及安全保障或數據有限的應用場景。」格拉德斯通如此強調。
相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp
相關專題推薦
評論 (0)
0/500
伊利諾大學厄巴納-香檳分校與維吉尼亞大學的研究人員開發出一種新型模型架構,有望為具備更強推理能力且更具韌性的AI系統鋪平道路。
名為「能量基變壓器」(EBT)的架構,能自然運用推論時間擴展性來解決複雜挑戰。對企業而言,這意味著能以成本效益方式部署人工智慧應用,無需專門調校模型即可適應新情境。
系統二思維的挑戰
在心理學中,人類認知通常分為兩種模式:快速直覺的系統一,以及較緩慢、更刻意且具分析性的系統二。當今大型語言模型(LLMs)在系統一任務上表現優異,但人工智慧領域現正聚焦於發展系統二思維,以處理更複雜的推理問題。
推理模型運用多種推論時擴展技術來提升其處理艱難問題的效能。常見技術包括強化學習(RL),如DeepSeek-R1與OpenAI的「o系列」模型,透過生成推理代幣獲取獎勵直至得出正確解法。另一策略稱為最佳解選擇(best-of-n),即生成多個可能答案並透過驗證系統篩選出最佳方案。
然而這些方法存在顯著局限:通常僅適用於數學、程式設計等易驗證的狹窄題型,在創意寫作等任務中表現可能下滑。近期研究更指出,基於強化學習的方法未必能教導模型新推理能力,僅是鼓勵其重複已知的成功推理模式,這限制了模型解決超出訓練範疇、需真正探索能力問題的潛力。
能量型模型(EBM)
此新型架構另闢蹊徑,建立於稱為能量基礎模型(EBM)的類別之上。其核心概念直觀明瞭:模型並非直接生成答案,而是學習一種作為驗證器的「能量函數」。該函數接收輸入(如提示詞)與候選預測結果,進而賦予其數值(即「能量」)。 低能量分數代表高度兼容性,意味預測與輸入高度契合;高能量分數則顯示匹配度不佳。
將此概念應用於人工智慧推理時,研究人員在論文中提出開發者應將「思考視為基於學習驗證器的優化程序,該程序評估輸入與候選預測之間的兼容性(未歸一化機率)」。 該過程始於隨機預測,透過逐步最小化能量分數並探索可能解法,直至收斂至高度相容的答案。此方法基於核心理念:驗證解法往往遠比從零生成解法更為簡便。

這種「驗證器中心」設計解決了人工智慧推理的三大難題:首先,它實現動態運算資源分配,使模型能在困難問題上「思考」更久,而將較少時間花費在簡單問題上;其次,EBM能自然適應現實世界問題的不確定性——這些問題往往沒有單一明確答案;第三,它們本身即具備驗證功能,無需外部模型輔助。
有別於採用獨立生成器與驗證器的系統,EBM將兩者整合為單一統一模型。此架構的關鍵優勢在於提升泛化能力——由於驗證新數據(分布外數據)的解通常比生成正確答案更容易,EBM能更有效應對陌生情境。
儘管潛力可觀,EBM歷來面臨可擴展性問題。為此,研究團隊提出專為此框架設計的變體模型——EBT(增強型語境模型)。EBT經訓練後,會先檢驗語境與預測結果的兼容性,再逐步優化預測直至找出最低能量(最高兼容性)的輸出。此流程有效模擬了每次預測背後的思考過程。 團隊開發了兩種EBT變體:受GPT架構啟發的純解碼器模型,以及類似BERT的雙向模型。

EBT架構使其具備高度適應性,能與多種推論時擴展方法相容。論文第一作者、伊利諾大學厄巴納-香檳分校電腦科學博士生Alexi Gladstone向VentureBeat表示:「EBT可生成更長的CoT、進行自我驗證、執行最佳N選一,或從多個EBT中採樣。」 「最關鍵的是,所有這些能力皆在預訓練階段完成學習。」
EBT實戰應用
研究團隊將EBTs與成熟架構進行對比測試:採用熱門的Transformer++方案進行文本生成(離散模態),並以擴散變換器(DiT)處理影片預測與影像去噪等任務(連續模態)。評估標準聚焦兩大核心指標:「學習擴展性」(訓練效率)與「推理擴展性」(隨著推理階段計算資源增加,性能提升幅度)。
預訓練階段,EBTs展現卓越效率,在數據規模、批次大小、參數數量及運算資源等維度上,擴展率較Transformer++高出35%。這意味著EBTs能以更快速、更經濟的方式完成訓練。
在推理階段,EBT於推理任務中同樣超越現有模型。透過「更長時間思考」(採用更多優化步驟)與執行「自我驗證」(生成多個候選方案並選擇能量最低者),EBT的語言建模性能較Transformer++提升29%。 研究人員解釋:「這印證了我們的論點——傳統前饋變換器無法為每次預測動態分配額外運算資源,因此無法透過更長時間的思考來提升每個詞元的表現。」
在圖像去噪任務中,EBT模型不僅以減少99%的前向傳遞次數,仍展現優於DiT模型的表現。
關鍵在於,研究揭示EBTs的泛化能力優於其他架構。即使預訓練表現相同或較弱,EBTs在下游任務中仍超越現有模型。當數據偏離訓練分布時(與訓練數據不同),第二系統思考帶來的效能提升尤為顯著,顯示EBTs面對新穎艱鉅挑戰時具備卓越的穩健性。
研究人員指出:「EBTs思考模式的效益並非在所有數據中均等顯現,而是隨分布偏移幅度呈正向擴展,凸顯思考能力是突破訓練分布限制、實現穩健泛化的關鍵機制。」
EBTs的優勢基於兩大關鍵因素顯著突出。 首先,在當今基礎模型的大規模架構下,EBTs有望大幅超越大型語言模型採用的經典變壓器架構。作者觀察到:「當基礎模型規模擴增至訓練數據量增加1000倍、模型體積擴大1000倍時,我們預期EBTs的預訓練表現將顯著優於Transformer++方案。」
其次,EBT展現出更卓越的數據效率。在優質訓練數據日益成為AI擴展瓶頸的時代,此優勢至關重要。論文指出:「當數據成為進一步擴展的主要限制因素時,EBT的吸引力便格外突出。」
儘管推論機制不同,EBT架構與Transformer高度相容,可直接替代現有大型語言模型。
葛拉德斯通強調:「EBT與現有硬體/推論框架高度相容」,包含運用GPU或TPU上的前饋模型進行推測解碼。他進一步表示,確信該架構能運行於LPUs等專用加速器及FlashAttention-3等優化演算法,亦可透過vLLM等通用推論框架部署。
對開發者與企業而言,EBT強大的推理與泛化能力,將成為構建次世代AI應用的堅實基礎。「更長遠的思考能力幾乎能惠及所有企業應用,但最具潛力的領域在於需做出關鍵決策、涉及安全保障或數據有限的應用場景。」格拉德斯通如此強調。
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性
Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
拜耳運用 Iambic AI 加速藥物研發
尤爾根·埃克哈特(Juergen Eckhardt)醫學博士,現任拜耳製藥業務發展與授權部門主管。拜耳正透過 Iambic Therapeutics 將前沿人工智慧模型應用於藥物發現,同時在其西班牙工廠推動一項重大的脫碳計畫。拜耳已與科技公司 Iambic Therapeutics 建立戰略採購合作夥伴關係,以加速小分子藥物發現與新藥開發。這家歷史悠久的企業正與合作夥伴攜手,運用其人工智慧驅動的平
Multiverse Computing 推出免費壓縮生成式人工智慧模型
大型語言模型面臨著重大挑戰:其龐大的體積。西班牙新創公司Multiverse Computing正透過開發壓縮模型來解決此問題,旨在彌合尖端AI能力與企業實際可負擔部署方案之間的差距。其核心創新在於「CompactifAI」壓縮技術——這項受量子運算原理啟發的技術,已被這家巴斯克公司用於優化OpenAI的模型。即日起,開發者可在Hugging Face平台免費使用Multiverse增強版的Hyp





首頁






