2025 年 AGI 推理的最新 LLM 進展與挑戰為何?
人工一般智慧 (Artificial General Intelligence) 的發展勢頭越來越猛。本文將探討致力於增強大型語言模型推理能力的前沿研究,重點介紹來自斯坦福、哈佛、麻省理工、英偉達和卡內基梅隆大學等機構的創新方法。我們將解開核心思想、解決目前的限制,並考慮 AGI 研究的未來軌跡,最終揭開通往真正通用智慧之路的神秘面紗。
重點
最近的研究集中在改善大型語言模型的推理能力。
新興技術包括訓練 LLM 識別抽象概念,以及在模型彙整過程中利用精密資訊。
主要的重點是透過策略性地利用訓練前和訓練後的資料,及早建立推理基礎。
儘管取得了進展,但仍然存在重大障礙,特別是在開放式問題解決方面。
在多機器人系統中超越簡單的多數投票被認為是獲得更強、更可靠結果的關鍵。
嚴格的實驗和高品質的資料集是提高 AGI 模型推理品質的基礎。
在低維模型空間內進行有監督的預訓對於開發多功能模型至關重要。
培養多樣性和消除統計偏差有助於建立更具彈性的人工智能系統。
LLM 推理研究的面貌
人工一般智慧與推理的最新研究
AGI 領域進展迅速,領先的學術與研究機構投入了大量資源。當代的研究致力於縮小專門人工智能與廣泛的類人智能之間的差距。其核心目標是讓 LLM 具備先進的推理能力,以應付複雜的挑戰並形成正確的判斷。
推理的挑戰:雖然 LLM 在文字產生與翻譯方面表現良好,但推理卻是更大的挑戰。它通常需要
- 抽象:將問題縮小為基本原則和概念。
- 推論:從一組給定的資訊中得出合乎邏輯的結論。
- 規劃:制定逐步達成預期目標的方法。
許多目前的模型都發現這些任務很困難,尤其是當需要處理一種格式的資料,並將其輸出為另一種無法預見的格式時。這種複雜性對健全的 AGI 發展構成重大障礙。
主要研究機構及其貢獻
在 LLM 推理研究領域中,著名的研究機構正處於領先地位:
- 斯坦福大學:首創訓練 LLM 的方法,以發掘有助於解決問題的抽象概念。
- 哈佛大學:推進結合高階資料關係的 LLM 彙總技術。
- 麻省理工學院:在協同式人工智慧系統中,開發超越基本多數投票的方法。
- NVIDIA:研究如何最佳化結合訓練前與訓練後的資料,從一開始就建立推理能力。
- 卡內基美隆大學:專注於解決推理問題的訓練方法。
這些合作與多樣化的努力,突顯了實現 AGI 所面臨的多重挑戰。
關鍵論文解析
訓練 LLM 來發現抽象概念

一項重要的研究集中在教導 LLMs 掌握抽象的原則。目的是提升他們解決問題與邏輯推理的能力。研究人員設計了一種技術,讓模型產生抽象概念來解決問題。透過將問題抽象化,LLM 可以更好地理解問題並設計有效的解決方案。卡內基梅隆大學和斯坦福大學的這項合作研究強調的訓練方法,可以揭示問題的基本結構,使解決途徑更加清晰。
訓練細節:
- 此方法著重於了解問題的核心元素。
- 它代表了從單步推理到分層、層次策略的轉變。
- 一個關鍵的創新是將策劃與執行分開。
優點
- 建立分工,使不同的部分都能進行專門的最佳化。
- 促進高效學習,因為每個部分都會對相關資料進行訓練。
- 簡化複雜性,讓模型更容易處理資訊。
超越多數投票:利用高階資訊進行 LLM 彙總

這項研究批判了多機器人系統中僅依賴大多數投票的常見做法。一致意見可能會造成限制。本文建議使用高階資訊來更精確地預測可能的最佳結果。
類似於重視火箭科學家對於航太主題的意見而非一般共識,此方法會根據個別 AI 代理的專業知識以及與他人的關聯性來衡量其貢獻。這項研究由麻省理工學院、哈佛大學和芝加哥大學合作進行。
超越多數的投票:
- 它利用了一階資訊,例如每個模型的已知準確度。
- 它也結合了二階資訊,這關係到模型的答案彼此之間的關係。
- 此方法會評估類似問題:「既然模型 B 和 C 回答了 X,那麼模型 A 回答 Y 的重要性有多大?」以充分運用集體智慧。
前置推理:訓練前和訓練後的資料之間的協同作用

英伟达、卡内基梅隆大学、波士顿大学和斯坦福大学联合探索前置推理以及训练前和训练后数据之间的相互作用。目標是確定引入不同資料類型的最佳時機,以最大化模型效率與效能。
- 在預訓期間導入推理資料可以帶來更持久的改進。
- 監督微調本身是不足夠的;資料品質與多樣性之間的平衡是獲得顯著收益的關鍵。
- 適當的實作讓模型即使在較小的測試集上也能表現良好,顯示出更高的整體效能。
如何應用這些研究結果
實用的實施步驟
雖然全面實施可能需要大量資源,但開發人員可以採用幾項核心原則:
- 優先使用高品質的預訓資料:為初始訓練階段投資於多樣化、精心策劃的資料集。
- 探索分層推理架構:採用可區分策略規劃與戰術執行的模型設計。
- 實施精密的評估指標:除了基本的精確度之外,還要加入能捕捉模型間關係的指標,以進行更真實的效能評估。
應用這些原則可以開發出更強大且更有能力的模型,有助於朝向 AGI 逐步邁進。
探索大型語言模型的抽象產生器
優點
將策略制定與執行分開,可改善效能。
分工有助於專業化和更有效率的學習過程。
有可能取得優異的結果。
減少所需的測試資料量,同時改善結果。
缺點
許多實驗目前僅限於數學推理任務。
需要在涉及類人互動的情境中進一步測試。
模型通常是從頭開始訓練,需要耗費大量資源。
在處理高度複雜的問題時,模型的指導有限。
常見問題
什麼是 AGI?
AGI 或人工智慧 (Artificial General Intelligence),指的是一種理論形式的人工智慧,它擁有理解、學習和應用各種任務知識的能力,達到人類的水準。與專為特定功能所設計的狹隘人工智慧不同,AGI 會展現適應性的問題解決與推理能力。
如何為模型建立高品質的資料集
編輯高品質的資料集是一個資源密集的過程,通常需要人工檢閱與分析。其中一種方法是採用多機器人系統,以評估和平衡各個層面的資料品質。同時具備高品質與多樣性的資料集可產生更穩定、更廣泛的模型,能夠處理更廣泛的輸入。
什麼是「前置推理」?
前置推理」描述了一種在 LLM 的基礎預訓階段嵌入推理能力的策略。這種早期的強調有助於模型從一開始就為抽象思維和複雜問題的解決打下堅實的基礎。
相關問題
多機體 LLM 系統中多數投票的限制為何?
雖然多數投票提供了一個簡單的基線,但它也有缺點。它沒有考慮到個別模型不同的精確度,而且如果模型有類似的架構,它們可能會延續相同的系統錯誤,窒礙創新。利用高階資訊提供了一種方式,可以做出更細微、更精準的決策。
將推理資料注入資料調整的最佳方式是什麼?
最有效的方法是在最初的預訓階段整合以推理為重點的資料。這個基礎步驟對於開發具有進階推理能力的模型而言,可以產生最持久的改善。
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (3)
0/500
Honestly, these reasoning benchmarks feel like measuring how well a parrot can mimic logic. Still cool though. 🦜
Die Forschung zu Reasoning-Fähigkeiten bei LLMs ist echt spannend! Besonders interessant finde ich die Frage, ob solche Modelle irgendwann wirklich logische Schlüsse ziehen können oder ob sie nur Muster reproduzieren. Die ethischen Implikationen, wenn solche Systeme in kritischen Bereichen eingesetzt werden, machen mir aber auch etwas Sorgen. 🤔
人工一般智慧 (Artificial General Intelligence) 的發展勢頭越來越猛。本文將探討致力於增強大型語言模型推理能力的前沿研究,重點介紹來自斯坦福、哈佛、麻省理工、英偉達和卡內基梅隆大學等機構的創新方法。我們將解開核心思想、解決目前的限制,並考慮 AGI 研究的未來軌跡,最終揭開通往真正通用智慧之路的神秘面紗。
重點
最近的研究集中在改善大型語言模型的推理能力。
新興技術包括訓練 LLM 識別抽象概念,以及在模型彙整過程中利用精密資訊。
主要的重點是透過策略性地利用訓練前和訓練後的資料,及早建立推理基礎。
儘管取得了進展,但仍然存在重大障礙,特別是在開放式問題解決方面。
在多機器人系統中超越簡單的多數投票被認為是獲得更強、更可靠結果的關鍵。
嚴格的實驗和高品質的資料集是提高 AGI 模型推理品質的基礎。
在低維模型空間內進行有監督的預訓對於開發多功能模型至關重要。
培養多樣性和消除統計偏差有助於建立更具彈性的人工智能系統。
LLM 推理研究的面貌
人工一般智慧與推理的最新研究
AGI 領域進展迅速,領先的學術與研究機構投入了大量資源。當代的研究致力於縮小專門人工智能與廣泛的類人智能之間的差距。其核心目標是讓 LLM 具備先進的推理能力,以應付複雜的挑戰並形成正確的判斷。
推理的挑戰:雖然 LLM 在文字產生與翻譯方面表現良好,但推理卻是更大的挑戰。它通常需要
- 抽象:將問題縮小為基本原則和概念。
- 推論:從一組給定的資訊中得出合乎邏輯的結論。
- 規劃:制定逐步達成預期目標的方法。
許多目前的模型都發現這些任務很困難,尤其是當需要處理一種格式的資料,並將其輸出為另一種無法預見的格式時。這種複雜性對健全的 AGI 發展構成重大障礙。
主要研究機構及其貢獻
在 LLM 推理研究領域中,著名的研究機構正處於領先地位:
- 斯坦福大學:首創訓練 LLM 的方法,以發掘有助於解決問題的抽象概念。
- 哈佛大學:推進結合高階資料關係的 LLM 彙總技術。
- 麻省理工學院:在協同式人工智慧系統中,開發超越基本多數投票的方法。
- NVIDIA:研究如何最佳化結合訓練前與訓練後的資料,從一開始就建立推理能力。
- 卡內基美隆大學:專注於解決推理問題的訓練方法。
這些合作與多樣化的努力,突顯了實現 AGI 所面臨的多重挑戰。
關鍵論文解析
訓練 LLM 來發現抽象概念

一項重要的研究集中在教導 LLMs 掌握抽象的原則。目的是提升他們解決問題與邏輯推理的能力。研究人員設計了一種技術,讓模型產生抽象概念來解決問題。透過將問題抽象化,LLM 可以更好地理解問題並設計有效的解決方案。卡內基梅隆大學和斯坦福大學的這項合作研究強調的訓練方法,可以揭示問題的基本結構,使解決途徑更加清晰。
訓練細節:
- 此方法著重於了解問題的核心元素。
- 它代表了從單步推理到分層、層次策略的轉變。
- 一個關鍵的創新是將策劃與執行分開。
優點
- 建立分工,使不同的部分都能進行專門的最佳化。
- 促進高效學習,因為每個部分都會對相關資料進行訓練。
- 簡化複雜性,讓模型更容易處理資訊。
超越多數投票:利用高階資訊進行 LLM 彙總

這項研究批判了多機器人系統中僅依賴大多數投票的常見做法。一致意見可能會造成限制。本文建議使用高階資訊來更精確地預測可能的最佳結果。
類似於重視火箭科學家對於航太主題的意見而非一般共識,此方法會根據個別 AI 代理的專業知識以及與他人的關聯性來衡量其貢獻。這項研究由麻省理工學院、哈佛大學和芝加哥大學合作進行。
超越多數的投票:
- 它利用了一階資訊,例如每個模型的已知準確度。
- 它也結合了二階資訊,這關係到模型的答案彼此之間的關係。
- 此方法會評估類似問題:「既然模型 B 和 C 回答了 X,那麼模型 A 回答 Y 的重要性有多大?」以充分運用集體智慧。
前置推理:訓練前和訓練後的資料之間的協同作用

英伟达、卡内基梅隆大学、波士顿大学和斯坦福大学联合探索前置推理以及训练前和训练后数据之间的相互作用。目標是確定引入不同資料類型的最佳時機,以最大化模型效率與效能。
- 在預訓期間導入推理資料可以帶來更持久的改進。
- 監督微調本身是不足夠的;資料品質與多樣性之間的平衡是獲得顯著收益的關鍵。
- 適當的實作讓模型即使在較小的測試集上也能表現良好,顯示出更高的整體效能。
如何應用這些研究結果
實用的實施步驟
雖然全面實施可能需要大量資源,但開發人員可以採用幾項核心原則:
- 優先使用高品質的預訓資料:為初始訓練階段投資於多樣化、精心策劃的資料集。
- 探索分層推理架構:採用可區分策略規劃與戰術執行的模型設計。
- 實施精密的評估指標:除了基本的精確度之外,還要加入能捕捉模型間關係的指標,以進行更真實的效能評估。
應用這些原則可以開發出更強大且更有能力的模型,有助於朝向 AGI 逐步邁進。
探索大型語言模型的抽象產生器
優點
將策略制定與執行分開,可改善效能。
分工有助於專業化和更有效率的學習過程。
有可能取得優異的結果。
減少所需的測試資料量,同時改善結果。
缺點
許多實驗目前僅限於數學推理任務。
需要在涉及類人互動的情境中進一步測試。
模型通常是從頭開始訓練,需要耗費大量資源。
在處理高度複雜的問題時,模型的指導有限。
常見問題
什麼是 AGI?
AGI 或人工智慧 (Artificial General Intelligence),指的是一種理論形式的人工智慧,它擁有理解、學習和應用各種任務知識的能力,達到人類的水準。與專為特定功能所設計的狹隘人工智慧不同,AGI 會展現適應性的問題解決與推理能力。
如何為模型建立高品質的資料集
編輯高品質的資料集是一個資源密集的過程,通常需要人工檢閱與分析。其中一種方法是採用多機器人系統,以評估和平衡各個層面的資料品質。同時具備高品質與多樣性的資料集可產生更穩定、更廣泛的模型,能夠處理更廣泛的輸入。
什麼是「前置推理」?
前置推理」描述了一種在 LLM 的基礎預訓階段嵌入推理能力的策略。這種早期的強調有助於模型從一開始就為抽象思維和複雜問題的解決打下堅實的基礎。
相關問題
多機體 LLM 系統中多數投票的限制為何?
雖然多數投票提供了一個簡單的基線,但它也有缺點。它沒有考慮到個別模型不同的精確度,而且如果模型有類似的架構,它們可能會延續相同的系統錯誤,窒礙創新。利用高階資訊提供了一種方式,可以做出更細微、更精準的決策。
將推理資料注入資料調整的最佳方式是什麼?
最有效的方法是在最初的預訓階段整合以推理為重點的資料。這個基礎步驟對於開發具有進階推理能力的模型而言,可以產生最持久的改善。
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Honestly, these reasoning benchmarks feel like measuring how well a parrot can mimic logic. Still cool though. 🦜
Die Forschung zu Reasoning-Fähigkeiten bei LLMs ist echt spannend! Besonders interessant finde ich die Frage, ob solche Modelle irgendwann wirklich logische Schlüsse ziehen können oder ob sie nur Muster reproduzieren. Die ethischen Implikationen, wenn solche Systeme in kritischen Bereichen eingesetzt werden, machen mir aber auch etwas Sorgen. 🤔





首頁






