人工智慧模型在解決高階數學問題方面取得突破

上週末,軟體工程師、前量化研究員暨新創公司創辦人尼爾·索馬尼(Neel Somani)在評估 OpenAI 新模型的數學能力時,意外發現了一個驚人的結果。他在 ChatGPT 中輸入一道題目並讓其運算 15 分鐘後,返回時發現系統已給出完整的解法。他審閱了證明過程,並使用名為 Harmonic 的工具進行驗證——結果一切正確無誤。
「我希望建立一個基準,用以理解大型語言模型何時能有效解決未解的數學問題,以及它們在哪些方面仍面臨挑戰,」索馬尼解釋道。這項出乎意料的發現是,最新模型已將可能性的邊界推向了更遠。
ChatGPT 的推理鏈尤其令人驚豔,它流暢地運用了勒讓德公式、伯特蘭假設以及大衛之星定理等數學原理。該模型最終引用了一篇 2013 年的 Math Overflow 貼文,哈佛大學數學家諾姆·埃爾基斯(Noam Elkies)曾在其中為一個相關問題提供了優雅的解法。 然而,ChatGPT 的最終證明在關鍵方面與埃爾基斯的工作有所不同,它為傳奇數學家保羅·埃爾德什最初提出的變體問題提供了更全面的解決方案。埃爾德什那份龐大的未解問題集,已成為測試人工智慧能力的試金石。
對於那些對機器智能持懷疑態度的人來說,這個結果令人驚嘆——而且這並非孤立案例。AI 工具已在數學領域無所不在,從 Harmonic 的 Aristotle 這種專注於形式化的 LLM,到 OpenAI 的 deep research 這種文獻檢索系統皆然。 自 GPT-5.2 發布以來——索馬尼指出,據傳該版本「在數學推理方面比先前版本更為嫻熟」——已解決的問題數量顯著增加,這引發了關於大型語言模型能否拓展人類知識邊界的全新探討。
索馬尼當時正在研究「埃爾德什問題」——這是一套由匈牙利數學家提出的、在線上被歸檔的超過1,000項猜想。這些問題在主題和難度上差異極大,已成為人工智慧驅動的數學探索的主要目標。首批自主解法於11月由一個名為AlphaEvolve的Gemini驅動模型提出,但最近,索馬尼等人觀察到GPT-5.2在高等數學方面展現出非凡的造詣。
自聖誕節以來,埃爾德什問題網站上已有15道題目從「未解」更新為「已解」——其中11個解法明確標註了AI模型的參與。
著名數學家陶哲軒在其 GitHub 頁面針對這項進展提供了更詳盡的見解,他列舉了八個由 AI 模型做出實質性自主貢獻的獨立問題,以及另外六個透過識別並基於先前研究成果而取得進展的案例。儘管完全自主的 AI 數學推理仍是遙遠的目標,但顯而易見的是,大型模型已開始發揮重要作用。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先購票。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上我們的舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並提升競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先獲得入場資格。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上各舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並強化競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
在 Mastodon 上,Tao 指出,AI 系統的可擴展性使其「特別適合解決那些鮮為人知的『長尾』埃爾德什難題,其中許多其實有很直觀的解法。」
「因此,這些較易入手的埃爾德什問題,如今透過純粹的 AI 方法解決的可能性,已遠高於人類或混合式方法,」陶補充道。
另一個促成因素是近期向形式化發展的轉變——這是一項詳盡的流程,能讓數學推理更容易被驗證與延伸。雖然形式化本身並不必然需要人工智慧或電腦,但新一代的自動化工具已大幅簡化了工作流程。 2013年由微軟研究院開發的開源「證明輔助工具」Lean,已在該領域廣泛應用於證明形式化。像Harmonic公司的Aristotle這類AI工具,如今有望將這項形式化工作的大部分自動化。
對 Harmonic 創辦人 Tudor Achim 而言,埃爾德什難題的解題數量驟增,其意義遠不如頂尖數學家開始認真看待這些工具這件事來得重要。「我更感興趣的是,數學與電腦科學教授們正在使用 [AI 工具],」Achim 表示。「這些人需要維護自己的聲譽,因此當他們證實自己使用 Aristotle 或 ChatGPT 時,這便是極具意義的認可。」
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500

上週末,軟體工程師、前量化研究員暨新創公司創辦人尼爾·索馬尼(Neel Somani)在評估 OpenAI 新模型的數學能力時,意外發現了一個驚人的結果。他在 ChatGPT 中輸入一道題目並讓其運算 15 分鐘後,返回時發現系統已給出完整的解法。他審閱了證明過程,並使用名為 Harmonic 的工具進行驗證——結果一切正確無誤。
「我希望建立一個基準,用以理解大型語言模型何時能有效解決未解的數學問題,以及它們在哪些方面仍面臨挑戰,」索馬尼解釋道。這項出乎意料的發現是,最新模型已將可能性的邊界推向了更遠。
ChatGPT 的推理鏈尤其令人驚豔,它流暢地運用了勒讓德公式、伯特蘭假設以及大衛之星定理等數學原理。該模型最終引用了一篇 2013 年的 Math Overflow 貼文,哈佛大學數學家諾姆·埃爾基斯(Noam Elkies)曾在其中為一個相關問題提供了優雅的解法。 然而,ChatGPT 的最終證明在關鍵方面與埃爾基斯的工作有所不同,它為傳奇數學家保羅·埃爾德什最初提出的變體問題提供了更全面的解決方案。埃爾德什那份龐大的未解問題集,已成為測試人工智慧能力的試金石。
對於那些對機器智能持懷疑態度的人來說,這個結果令人驚嘆——而且這並非孤立案例。AI 工具已在數學領域無所不在,從 Harmonic 的 Aristotle 這種專注於形式化的 LLM,到 OpenAI 的 deep research 這種文獻檢索系統皆然。 自 GPT-5.2 發布以來——索馬尼指出,據傳該版本「在數學推理方面比先前版本更為嫻熟」——已解決的問題數量顯著增加,這引發了關於大型語言模型能否拓展人類知識邊界的全新探討。
索馬尼當時正在研究「埃爾德什問題」——這是一套由匈牙利數學家提出的、在線上被歸檔的超過1,000項猜想。這些問題在主題和難度上差異極大,已成為人工智慧驅動的數學探索的主要目標。首批自主解法於11月由一個名為AlphaEvolve的Gemini驅動模型提出,但最近,索馬尼等人觀察到GPT-5.2在高等數學方面展現出非凡的造詣。
自聖誕節以來,埃爾德什問題網站上已有15道題目從「未解」更新為「已解」——其中11個解法明確標註了AI模型的參與。
著名數學家陶哲軒在其 GitHub 頁面針對這項進展提供了更詳盡的見解,他列舉了八個由 AI 模型做出實質性自主貢獻的獨立問題,以及另外六個透過識別並基於先前研究成果而取得進展的案例。儘管完全自主的 AI 數學推理仍是遙遠的目標,但顯而易見的是,大型模型已開始發揮重要作用。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先購票。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上我們的舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並提升競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先獲得入場資格。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上各舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並強化競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
在 Mastodon 上,Tao 指出,AI 系統的可擴展性使其「特別適合解決那些鮮為人知的『長尾』埃爾德什難題,其中許多其實有很直觀的解法。」
「因此,這些較易入手的埃爾德什問題,如今透過純粹的 AI 方法解決的可能性,已遠高於人類或混合式方法,」陶補充道。
另一個促成因素是近期向形式化發展的轉變——這是一項詳盡的流程,能讓數學推理更容易被驗證與延伸。雖然形式化本身並不必然需要人工智慧或電腦,但新一代的自動化工具已大幅簡化了工作流程。 2013年由微軟研究院開發的開源「證明輔助工具」Lean,已在該領域廣泛應用於證明形式化。像Harmonic公司的Aristotle這類AI工具,如今有望將這項形式化工作的大部分自動化。
對 Harmonic 創辦人 Tudor Achim 而言,埃爾德什難題的解題數量驟增,其意義遠不如頂尖數學家開始認真看待這些工具這件事來得重要。「我更感興趣的是,數學與電腦科學教授們正在使用 [AI 工具],」Achim 表示。「這些人需要維護自己的聲譽,因此當他們證實自己使用 Aristotle 或 ChatGPT 時,這便是極具意義的認可。」
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






