選項
首頁
新聞
研究發現:實際測試中,AI 程式碼的效能被高估了

研究發現:實際測試中,AI 程式碼的效能被高估了

2026-05-09
207

METR 研究所的研究指出,廣泛用於評估 AI 程式設計能力的 SWE-bench Verified 基準測試,可能嚴重高估了 AI 代理在實際軟體開發中的表現。該研究發現,約有一半由 AI 生成的程式碼解決方案雖被該基準測試標記為「通過」,但在實際專案的程式碼審查過程中,很可能遭到專案維護人員拒絕,這凸顯了自動化評估結果與實際程式碼品質之間存在著顯著差距。

SWE-bench Verified 長期以來被視為評估 AI 輔助軟體工程的關鍵標準,用於測試模型能否解決開源專案中的真實編程任務,並驗證程式碼變更是否通過專案的自動化測試套件。包括 Anthropic 和 OpenAI 在內的多家 AI 公司,經常引用此基準測試的結果來展示模型的進展。

QQ20260312-093454.jpg

在這項研究中,METR 團隊邀請了四位負責維護 scikit-learn、Sphinx 和 pytest 等開源專案的資深開發者,對 296 段由 AI 生成的程式碼進行人工審查。這些程式碼範例由五種不同的模型產生:Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude 4 Opus、Claude 4.5 Sonnet 以及 GPT-5。 結果顯示,維護者實際的接受率平均比 SWE-bench 的自動化評分低約 24 個百分點——這是一個具有統計學意義的差異。

研究還指出,被拒絕的 AI 程式碼主要並非源於風格問題,而是更實質的工程缺陷。維護人員將問題歸類為三大類:程式碼品質未達專案規格、破壞現有程式碼結構,以及根本性的功能錯誤。其中相當一部分案例涉及功能錯誤,即儘管通過了自動化測試,程式碼卻未能正確解決預期的問題。

在模型比較方面,研究發現從 Claude 3.5 Sonnet 升級至 Claude 3.7 Sonnet 雖顯著提升了基準測試通過率,但維護人員標記的功能性錯誤數量也隨之增加。 從 Claude 3.7 Sonnet 過渡到 Claude 3.7 Sonnet 期間,問題傾向轉向更多程式碼品質問題,而 Claude 4.5 Sonnet 則在程式碼品質方面有所改善。相較之下,在此次人工評估中,GPT-5 的整體表現明顯遜於 Anthropic 模型系列。

人工智慧大腦,大型模型

研究團隊還針對「任務完成時間」進行了估算分析:根據 SWE-bench 自動化評估結果,若以 50% 的成功率完成任務,Claude 4.5 Sonnet 相當於需耗費約 50 分鐘的人工時間。然而,根據維護人員的評分,估算時間僅約 8 分鐘,這表明該基準測試可能將能力高估了多達七倍。

不過,研究人員也強調,這項研究並不意味著 AI 程式設計代理的能力存在根本性限制。透過改進提示策略、增加人類反饋,或進行多次迭代循環,自動化評估與人工審查之間的差距有望縮小。此外,實驗設置與實際開發流程有所不同——例如,AI 代理僅有一次提交機會,而人類開發者通常能根據反饋反覆修改程式碼。

總而言之,該研究結論指出,若僅依賴基準測試分數來評估 AI 程式設計代理的實際效用,可能會引入系統性偏差。隨著 AI 編碼模型的快速演進,開發能更真實反映實際開發環境的評估系統,已成為 AI 軟體工程領域中至關重要的研究方向。

相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
搜索引擎優化 最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具
最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具

XIX.AI 透過嚴格的實際測試及每週更新的排行榜,精選了 2026 年最新、最佳且評價最高的 AI 搜尋結果頁面(SERP)分析工具,以協助制定搜尋策略。這些強大的工具能幫助您發掘隱藏的優化機會、提升內容表現,並在搜尋領域中取得競爭優勢。立即探索最適合您的工具,提升您的搜尋策略。現在就來探索吧!

13 個工具
xix.ai
數據分析 適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具
適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具

2026 年最新最佳頂級評分 AI 異常檢測工具,助力 SaaS 和電商團隊的 KPI 監控!XIX.AI 基於嚴格的真實世界測試和每週更新的排名,精心策劃了一套強大且顛覆性的工具合集。您將找到詳細的免費與付費對比洞察,幫助您識別必須嘗試的解決方案,從而提升生產力並釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
評論 (2)
0/500
MichaelMartinez
MichaelMartinez 2026-06-28 02:00:18

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 2026-05-16 20:00:16

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR