DeepMind的AI優於IMO金牌得主
Google DeepMind 的最新 AI,AlphaGeometry2,通過在國際數學奧林匹克(IMO)幾何問題解決中超越平均金牌得主的表現引起轟動。此為去年一月推出的 AlphaGeometry 進階版,據報導解決了过去 25 年 IMO 競賽中 84% 的幾何問題。
你可能好奇為何 DeepMind 專注於高中數學競賽。他們認為,破解這些具有挑戰性的歐幾里得幾何問題可能是發展更先進 AI 的墊腳石。解決這些問題需要邏輯推理和探索多種解題路徑的能力,這些技能對未來通用 AI 系統至關重要。
今年夏天,DeepMind 展示了一個結合 AlphaGeometry2 與 AlphaProof 的系統,後者是專為形式數學推理設計的另一 AI 模型。兩者共同解決了 2024 年 IMO 的六道題目中的四道。此方法可能延伸至數學與科學的其他領域,如複雜工程計算。
AlphaGeometry2 由幾個關鍵組件驅動,包括來自 Google Gemini 家族的語言模型和一個「符號引擎」。Gemini 模型協助符號引擎應用數學規則尋找解法,為幾何定理生成可行證明。

IMO 考試中的典型幾何問題圖表。圖片來源:Google(在新視窗中開啟) 在 IMO 中,幾何問題通常要求在圖表中添加「構造」,如點、線或圓,然後再解決問題。AlphaGeometry2 的 Gemini 模型預測哪些構造可能有幫助,引導符號引擎進行推導。
運作方式如下:Gemini 模型以形式數學語言建議步驟和構造,引擎隨後檢查其邏輯一致性。AlphaGeometry2 使用搜尋演算法同時探索多個解題路徑,並將可能有用的發現儲存在共享知識庫中。
當 AlphaGeometry2 結合 Gemini 模型的建議與符號引擎的已知原理形成完整證明時,問題被視為「已解決」。
由於可用幾何訓練數據稀缺,DeepMind 創建了合成數據來訓練 AlphaGeometry2 的語言模型,生成了超過 3 億個不同複雜度的定理和證明。
DeepMind 團隊在 2000 至 2024 年 IMO 競賽的 45 道幾何問題(擴展為 50 道)上測試了 AlphaGeometry2,它解決了 42 道,超越平均金牌得主分數 40.9。
然而,AlphaGeometry2 有其局限性。它在涉及變量點數、非線性方程和不等式的問題上表現不佳。雖然它不是首個達到金牌水平的 AI,但它是首個在如此大量問題集上實現此成績的 AI。
在面對 29 道尚未出現在競賽中的 IMO 提名問題時,AlphaGeometry2 僅解決了 20 道。
研究結果可能引發關於構建 AI 系統最佳方法的進一步爭論。我們應專注於符號操作(AI 使用規則操作代表知識的符號),還是神經網絡(模仿人腦結構並從數據學習)?
AlphaGeometry2 採用混合方法,結合 Gemini 模型的神經網絡架構與基於規則的符號引擎。
神經網絡支持者認為,智能行為可從大量數據和計算能力中湧現。相反,符號 AI 支持者認為它更適合編碼知識、推理複雜場景並解釋解法。
卡內基梅隆大學專攻 AI 的電腦科學教授 Vince Conitzer 評論了 IMO 等基準測試的顯著進展與語言模型在簡單常識問題上的持續掙扎之間的對比。他強調需要更好地理解這些系統及其潛在風險。
AlphaGeometry2 表明,結合符號操作與神經網絡可能是實現通用 AI 的有前景路徑。有趣的是,DeepMind 團隊發現 AlphaGeometry2 的語言模型可在無符號引擎幫助下生成部分問題解法,暗示語言模型未來可能實現自給自足。
然而,團隊指出,在語言模型速度提升和幻覺問題解決之前,符號引擎等工具對數學應用仍不可或缺。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
相關專題推薦
評論 (34)
0/500
C'est impressionnant de voir à quelle vitesse AlphaGeometry2 a été développé après la première version ! 😮 Mais je me demande comment cela se traduirait dans le monde réel, au-delà des compétitions. Peut-être pour la conception d'algorithmes complexes ? Cela donne aussi un peu peur pour l'avenir des métiers très spécialisés...
AlphaGeometry2って前回のバージョンからかなり進化してるんですね。IMO金メダリストを超えるって凄すぎる😳 でもこれがどんどん研究が進んで、いずれ人間が解けない問題もAIが解く時代が来るのかな?ちょっと怖いかも
Impressionnant mais un peu flippant... Si une IA peut battre des médaillés d'or aux Olympiades, qu'est-ce qui nous reste comme domaines où les humains sont encore les meilleurs ? 😅 J'espère qu'on va pas tous devenir obsolètes !
This AI beating IMO champs is wild! 🧠 Geometry’s tough, but AlphaGeometry2’s out here crushing it. Makes me wonder if it’ll start tutoring kids soon! 😄
Google DeepMind 的最新 AI,AlphaGeometry2,通過在國際數學奧林匹克(IMO)幾何問題解決中超越平均金牌得主的表現引起轟動。此為去年一月推出的 AlphaGeometry 進階版,據報導解決了过去 25 年 IMO 競賽中 84% 的幾何問題。
你可能好奇為何 DeepMind 專注於高中數學競賽。他們認為,破解這些具有挑戰性的歐幾里得幾何問題可能是發展更先進 AI 的墊腳石。解決這些問題需要邏輯推理和探索多種解題路徑的能力,這些技能對未來通用 AI 系統至關重要。
今年夏天,DeepMind 展示了一個結合 AlphaGeometry2 與 AlphaProof 的系統,後者是專為形式數學推理設計的另一 AI 模型。兩者共同解決了 2024 年 IMO 的六道題目中的四道。此方法可能延伸至數學與科學的其他領域,如複雜工程計算。
AlphaGeometry2 由幾個關鍵組件驅動,包括來自 Google Gemini 家族的語言模型和一個「符號引擎」。Gemini 模型協助符號引擎應用數學規則尋找解法,為幾何定理生成可行證明。

在 IMO 中,幾何問題通常要求在圖表中添加「構造」,如點、線或圓,然後再解決問題。AlphaGeometry2 的 Gemini 模型預測哪些構造可能有幫助,引導符號引擎進行推導。
運作方式如下:Gemini 模型以形式數學語言建議步驟和構造,引擎隨後檢查其邏輯一致性。AlphaGeometry2 使用搜尋演算法同時探索多個解題路徑,並將可能有用的發現儲存在共享知識庫中。
當 AlphaGeometry2 結合 Gemini 模型的建議與符號引擎的已知原理形成完整證明時,問題被視為「已解決」。
由於可用幾何訓練數據稀缺,DeepMind 創建了合成數據來訓練 AlphaGeometry2 的語言模型,生成了超過 3 億個不同複雜度的定理和證明。
DeepMind 團隊在 2000 至 2024 年 IMO 競賽的 45 道幾何問題(擴展為 50 道)上測試了 AlphaGeometry2,它解決了 42 道,超越平均金牌得主分數 40.9。
然而,AlphaGeometry2 有其局限性。它在涉及變量點數、非線性方程和不等式的問題上表現不佳。雖然它不是首個達到金牌水平的 AI,但它是首個在如此大量問題集上實現此成績的 AI。
在面對 29 道尚未出現在競賽中的 IMO 提名問題時,AlphaGeometry2 僅解決了 20 道。
研究結果可能引發關於構建 AI 系統最佳方法的進一步爭論。我們應專注於符號操作(AI 使用規則操作代表知識的符號),還是神經網絡(模仿人腦結構並從數據學習)?
AlphaGeometry2 採用混合方法,結合 Gemini 模型的神經網絡架構與基於規則的符號引擎。
神經網絡支持者認為,智能行為可從大量數據和計算能力中湧現。相反,符號 AI 支持者認為它更適合編碼知識、推理複雜場景並解釋解法。
卡內基梅隆大學專攻 AI 的電腦科學教授 Vince Conitzer 評論了 IMO 等基準測試的顯著進展與語言模型在簡單常識問題上的持續掙扎之間的對比。他強調需要更好地理解這些系統及其潛在風險。
AlphaGeometry2 表明,結合符號操作與神經網絡可能是實現通用 AI 的有前景路徑。有趣的是,DeepMind 團隊發現 AlphaGeometry2 的語言模型可在無符號引擎幫助下生成部分問題解法,暗示語言模型未來可能實現自給自足。
然而,團隊指出,在語言模型速度提升和幻覺問題解決之前,符號引擎等工具對數學應用仍不可或缺。
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
C'est impressionnant de voir à quelle vitesse AlphaGeometry2 a été développé après la première version ! 😮 Mais je me demande comment cela se traduirait dans le monde réel, au-delà des compétitions. Peut-être pour la conception d'algorithmes complexes ? Cela donne aussi un peu peur pour l'avenir des métiers très spécialisés...
AlphaGeometry2って前回のバージョンからかなり進化してるんですね。IMO金メダリストを超えるって凄すぎる😳 でもこれがどんどん研究が進んで、いずれ人間が解けない問題もAIが解く時代が来るのかな?ちょっと怖いかも
Impressionnant mais un peu flippant... Si une IA peut battre des médaillés d'or aux Olympiades, qu'est-ce qui nous reste comme domaines où les humains sont encore les meilleurs ? 😅 J'espère qu'on va pas tous devenir obsolètes !
This AI beating IMO champs is wild! 🧠 Geometry’s tough, but AlphaGeometry2’s out here crushing it. Makes me wonder if it’ll start tutoring kids soon! 😄





首頁






