三星的精巧 AI 模型在推理能力上勝過較大的競爭對手
三星 AI 研究人員的一篇新論文概述了緊湊型網路如何在處理複雜的推理任務時優於大規模的大型語言模型 (LLM)。
在爭奪人工智能主導地位的競賽中,業界普遍的口號是 「越大越好」。當科技巨頭投資數十億美元開發越來越大的模型時,Samsung SAIL Montréal 的 Alexia Jolicoeur-Martineau 提出了另一種更有效率的方法,即使用微小遞歸模型 (TRM)。
TRM 只需 7 百萬個參數 - 少於頂尖 LLM 大小的 0.01%,就能在 ARC-AGI 智慧測試等臭名昭著的挑戰性基準上取得最先進的新結果。Samsung 的研究結果挑戰了一般人認為規模是推進人工智慧的唯一途徑的看法,提出了一個更具永續性、更節省參數的替代方案。
克服規模的限制
雖然 LLM 擅長產生類似人類的文字,但它們處理複雜、多步驟推理的能力往往很脆弱。由於它們會逐個符號產生回應,因此早期的一個錯誤可能會影響整個解決方案,造成不正確的最終答案。
Chain-of-Thought 之類的技術,可以讓模型一步一步地分解問題,目的在於緩解這個問題。然而,這些方法的計算成本很高,通常需要大量高品質的推理資料,而且仍可能產生錯誤的邏輯。即使有了這些改進,LLM 也很難解決需要完美邏輯執行的難題。
Samsung 的研究以最近的層次推理模型 (HRM) 為基礎。HRM 使用兩個小型神經網路,以不同頻率遞迴精煉答案。儘管這個模型很有前途,但卻很複雜,它依賴於不確定的生物論據和定點定理,而這些論據和定理並不總是適用的。
與 HRM 的雙網路架構不同,TRM 採用了單一、精簡的網路,可以遞歸地增強其內部推理和建議的答案。
模型接收問題、初始答案猜測和潛在推理特徵。然後,它會循環多個步驟,根據所有三個輸入來改進其推理。使用此改進的推理,它會更新其最終答案預測。整個過程最多可以重複 16 次,使模型能夠以高度節省參數的方式逐步進行自我修正。
與直覺相反的是,研究發現兩層網路的泛化效果比四層網路好得多。較小的設計似乎可以防止過度適應 - 這是在有限的專門資料集上進行訓練時常見的問題。
TRM 也消除了其前身的複雜數學假設。原始的 HRM 模型必須假設函數收斂到一個固定點,才能證明其訓練的合理性。TRM 繞過了這一點,透過其完整的遞歸過程進行反向傳播 - 這一改變大大提高了性能,在消融測試中,Sudoku-Extreme 基準準準確率從 56.5% 提高到 87.4%。
三星的模型以更少的資源擊敗 AI 基準
結果令人驚訝。在只使用 1,000 個訓練範例的 Sudoku-Extreme 資料集上,TRM 的測試準確度達到 87.4%,相較於 HRM 的 55%,是一大躍進。在 Maze-Hard(需要在 30×30 的迷宮中穿梭長路徑)上,TRM 的測試準確率為 85.3%,HRM 則為 74.5%。
最值得注意的是,TRM 在抽象與推理語料庫(Abstraction and Reasoning Corpus,ARC-AGI)上取得了顯著進步,ARC-AGI 是為評估人工智能中真正的流體智能而設計的基準。僅使用 7M 參數,TRM 就在 ARC-AGI-1 上達到 44.6% 的準確度,在 ARC-AGI-2 上達到 7.8%。這勝過使用 27M 參數的 HRM,甚至超越許多全球最大的 LLM。相較之下,Gemini 2.5 Pro 在 ARC-AGI-2 的得分只有 4.9%。
TRM 的訓練流程也經過最佳化。我們簡化了稱為 ACT 的自適應機制 (該機制可決定模型何時已充分改善答案並可繼續前進),省去了每個訓練步驟中成本高昂的第二次前進。這項調整並未損害整體的泛化能力。
Samsung 的研究有力地反駁了建立越來越大的 AI 模型的趨勢。它證明了透過設計具有迭代推理和自我修正能力的架構,只需使用極小部分的計算資源,就能解決極度困難的問題。
另請參閱:Google 新的 AI 代理可改寫程式碼,自動修補漏洞

有興趣向業界領導者瞭解更多關於 AI 和大資料的資訊嗎?參加在阿姆斯特丹、加州和倫敦舉行的 AI & Big Data Expo。這項綜合活動是 TechEx 的一部分,並與其他主要科技活動 (如網路安全博覽會) 同時舉行。點選此處瞭解詳情。
AI News 由 TechForge Media 提供。在此探索其他即將舉行的企業技術活動和網路研討會。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
相關專題推薦
評論 (0)
0/500
三星 AI 研究人員的一篇新論文概述了緊湊型網路如何在處理複雜的推理任務時優於大規模的大型語言模型 (LLM)。
在爭奪人工智能主導地位的競賽中,業界普遍的口號是 「越大越好」。當科技巨頭投資數十億美元開發越來越大的模型時,Samsung SAIL Montréal 的 Alexia Jolicoeur-Martineau 提出了另一種更有效率的方法,即使用微小遞歸模型 (TRM)。
TRM 只需 7 百萬個參數 - 少於頂尖 LLM 大小的 0.01%,就能在 ARC-AGI 智慧測試等臭名昭著的挑戰性基準上取得最先進的新結果。Samsung 的研究結果挑戰了一般人認為規模是推進人工智慧的唯一途徑的看法,提出了一個更具永續性、更節省參數的替代方案。
克服規模的限制
雖然 LLM 擅長產生類似人類的文字,但它們處理複雜、多步驟推理的能力往往很脆弱。由於它們會逐個符號產生回應,因此早期的一個錯誤可能會影響整個解決方案,造成不正確的最終答案。
Chain-of-Thought 之類的技術,可以讓模型一步一步地分解問題,目的在於緩解這個問題。然而,這些方法的計算成本很高,通常需要大量高品質的推理資料,而且仍可能產生錯誤的邏輯。即使有了這些改進,LLM 也很難解決需要完美邏輯執行的難題。
Samsung 的研究以最近的層次推理模型 (HRM) 為基礎。HRM 使用兩個小型神經網路,以不同頻率遞迴精煉答案。儘管這個模型很有前途,但卻很複雜,它依賴於不確定的生物論據和定點定理,而這些論據和定理並不總是適用的。
與 HRM 的雙網路架構不同,TRM 採用了單一、精簡的網路,可以遞歸地增強其內部推理和建議的答案。
模型接收問題、初始答案猜測和潛在推理特徵。然後,它會循環多個步驟,根據所有三個輸入來改進其推理。使用此改進的推理,它會更新其最終答案預測。整個過程最多可以重複 16 次,使模型能夠以高度節省參數的方式逐步進行自我修正。
與直覺相反的是,研究發現兩層網路的泛化效果比四層網路好得多。較小的設計似乎可以防止過度適應 - 這是在有限的專門資料集上進行訓練時常見的問題。
TRM 也消除了其前身的複雜數學假設。原始的 HRM 模型必須假設函數收斂到一個固定點,才能證明其訓練的合理性。TRM 繞過了這一點,透過其完整的遞歸過程進行反向傳播 - 這一改變大大提高了性能,在消融測試中,Sudoku-Extreme 基準準準確率從 56.5% 提高到 87.4%。
三星的模型以更少的資源擊敗 AI 基準
結果令人驚訝。在只使用 1,000 個訓練範例的 Sudoku-Extreme 資料集上,TRM 的測試準確度達到 87.4%,相較於 HRM 的 55%,是一大躍進。在 Maze-Hard(需要在 30×30 的迷宮中穿梭長路徑)上,TRM 的測試準確率為 85.3%,HRM 則為 74.5%。
最值得注意的是,TRM 在抽象與推理語料庫(Abstraction and Reasoning Corpus,ARC-AGI)上取得了顯著進步,ARC-AGI 是為評估人工智能中真正的流體智能而設計的基準。僅使用 7M 參數,TRM 就在 ARC-AGI-1 上達到 44.6% 的準確度,在 ARC-AGI-2 上達到 7.8%。這勝過使用 27M 參數的 HRM,甚至超越許多全球最大的 LLM。相較之下,Gemini 2.5 Pro 在 ARC-AGI-2 的得分只有 4.9%。
TRM 的訓練流程也經過最佳化。我們簡化了稱為 ACT 的自適應機制 (該機制可決定模型何時已充分改善答案並可繼續前進),省去了每個訓練步驟中成本高昂的第二次前進。這項調整並未損害整體的泛化能力。
Samsung 的研究有力地反駁了建立越來越大的 AI 模型的趨勢。它證明了透過設計具有迭代推理和自我修正能力的架構,只需使用極小部分的計算資源,就能解決極度困難的問題。
另請參閱:Google 新的 AI 代理可改寫程式碼,自動修補漏洞

有興趣向業界領導者瞭解更多關於 AI 和大資料的資訊嗎?參加在阿姆斯特丹、加州和倫敦舉行的 AI & Big Data Expo。這項綜合活動是 TechEx 的一部分,並與其他主要科技活動 (如網路安全博覽會) 同時舉行。點選此處瞭解詳情。
AI News 由 TechForge Media 提供。在此探索其他即將舉行的企業技術活動和網路研討會。
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10





首頁






