新基準測試質疑人工智慧代理程式的工作就緒性
近兩年前,微軟執行長薩蒂亞·納德拉曾預言人工智慧將重塑知識型工作——涵蓋律師、投資銀行家、圖書館員、會計師、資訊科技專業人員等白領職域。
然而,儘管基礎模型取得重大進展,知識型工作的轉型卻遲遲未能實現。儘管模型在深度研究與代理規劃方面表現出色,但多數白領職業所受的衝擊相對有限,箇中原因仍不明朗。
這已成為人工智慧領域的重大謎題。訓練數據領導者Mercor的最新研究現正提供關鍵洞見。
該研究評估頂尖AI模型處理諮詢、投資銀行與法律等真實白領任務的能力,進而創建了APEX-Agents基準測試——目前所有AI實驗室皆未能通過。當面對真實專業人士的提問時,即使最優秀的模型正確回答率也不足四分之一,多數情況下會返回錯誤答案或完全無回應。
參與研究的Mercor執行長布倫丹·富迪指出,模型主要弱點在於跨領域資訊整合能力——這正是人類知識工作的核心要素。
「此基準測試的關鍵創新在於,我們建構了模擬真實專業服務的完整環境,」富迪向TechCrunch解釋道:「現實工作中不會有人將所有背景資訊集中提供給我們,實際操作需橫跨Slack、Google雲端硬碟等多元工具。」對多數智能體型AI模型而言,這類跨領域推理仍存在不一致性。

截圖 測試情境源自Mercor專家市場的真實從業者,由他們設計查詢內容並定義成功答題標準。檢視Hugging Face平台公開的試題即可窺見任務複雜性。
Techcrunch活動 Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更享+1通行證五折優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長、強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更可享+1通行證半價優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長並強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
舊金山 | 2026年10月13-15日 立即註冊 「法規」單元舉例說明:
在歐盟生產系統停機的前48分鐘內,北極星工程團隊將一至兩組包含個人資料的歐盟生產事件日誌打包匯出至美國分析供應商...根據北極星自身政策,能否合理認定此一至兩次日誌匯出符合第49條規範?
正確答案為是,但得出結論需詳細分析該公司內部政策與相關歐盟隱私法規。
此類問題即使對專業人士亦具挑戰性,但研究人員旨在模擬真實工作情境。能可靠解答此類查詢的大型語言模型,未來或可取代眾多執業律師。Foody向TechCrunch表示:「這無疑是當今最重要的經濟議題,該基準測試精準反映了專業人士的實際工作內容。」
OpenAI先前曾以GDPval基準測試專業技能,但APEX-Agents測試存在顯著差異:GDPval評估多領域的廣博知識,而APEX-Agents則衡量系統在特定高價值職業中執行持續性任務的能力。這不僅提升模型挑戰難度,更直接關聯職能自動化的潛在影響。
儘管目前尚無模型能取代投資銀行家的工作,但部分模型表現明顯優於其他系統。Gemini 3 Flash以24%的單次準確率領先群雄,緊隨其後的是23%的GPT-5.2。Opus 4.5、Gemini 3 Pro及GPT-5的得分均約為18%。
儘管初期成果未達預期,但人工智慧領域素以快速突破艱難基準著稱。隨著APEX-Agents測試公開,這對自信能改進的AI實驗室構成公開挑戰——Foody完全預期未來數月將見證此結果。
他向TechCrunch表示:「技術進步速度驚人。現階段將此技術比作每四次任務僅成功一次的實習生尚屬合理,但去年此時成功率僅5%至10%。這種逐年躍進的進步幅度,將迅速產生深遠影響。」
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500
近兩年前,微軟執行長薩蒂亞·納德拉曾預言人工智慧將重塑知識型工作——涵蓋律師、投資銀行家、圖書館員、會計師、資訊科技專業人員等白領職域。
然而,儘管基礎模型取得重大進展,知識型工作的轉型卻遲遲未能實現。儘管模型在深度研究與代理規劃方面表現出色,但多數白領職業所受的衝擊相對有限,箇中原因仍不明朗。
這已成為人工智慧領域的重大謎題。訓練數據領導者Mercor的最新研究現正提供關鍵洞見。
該研究評估頂尖AI模型處理諮詢、投資銀行與法律等真實白領任務的能力,進而創建了APEX-Agents基準測試——目前所有AI實驗室皆未能通過。當面對真實專業人士的提問時,即使最優秀的模型正確回答率也不足四分之一,多數情況下會返回錯誤答案或完全無回應。
參與研究的Mercor執行長布倫丹·富迪指出,模型主要弱點在於跨領域資訊整合能力——這正是人類知識工作的核心要素。
「此基準測試的關鍵創新在於,我們建構了模擬真實專業服務的完整環境,」富迪向TechCrunch解釋道:「現實工作中不會有人將所有背景資訊集中提供給我們,實際操作需橫跨Slack、Google雲端硬碟等多元工具。」對多數智能體型AI模型而言,這類跨領域推理仍存在不一致性。

測試情境源自Mercor專家市場的真實從業者,由他們設計查詢內容並定義成功答題標準。檢視Hugging Face平台公開的試題即可窺見任務複雜性。
Techcrunch活動Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更享+1通行證五折優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長、強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
Disrupt 2026 門票:限時優惠
門票現已開售!限時優惠最高可省680美元,前500名註冊者更可享+1通行證半價優惠。TechCrunch Disrupt匯聚Google Cloud、Netflix、Microsoft、Box、a16z、Hugging Face等頂尖企業領袖,透過250多場專題議程助您加速成長並強化競爭優勢。 與數百家創新新創企業建立連結,參與精心策劃的交流活動,促成合作契機、獲取產業洞見並激發創新靈感。
舊金山 | 2026年10月13-15日 立即註冊「法規」單元舉例說明:
在歐盟生產系統停機的前48分鐘內,北極星工程團隊將一至兩組包含個人資料的歐盟生產事件日誌打包匯出至美國分析供應商...根據北極星自身政策,能否合理認定此一至兩次日誌匯出符合第49條規範?
正確答案為是,但得出結論需詳細分析該公司內部政策與相關歐盟隱私法規。
此類問題即使對專業人士亦具挑戰性,但研究人員旨在模擬真實工作情境。能可靠解答此類查詢的大型語言模型,未來或可取代眾多執業律師。Foody向TechCrunch表示:「這無疑是當今最重要的經濟議題,該基準測試精準反映了專業人士的實際工作內容。」
OpenAI先前曾以GDPval基準測試專業技能,但APEX-Agents測試存在顯著差異:GDPval評估多領域的廣博知識,而APEX-Agents則衡量系統在特定高價值職業中執行持續性任務的能力。這不僅提升模型挑戰難度,更直接關聯職能自動化的潛在影響。
儘管目前尚無模型能取代投資銀行家的工作,但部分模型表現明顯優於其他系統。Gemini 3 Flash以24%的單次準確率領先群雄,緊隨其後的是23%的GPT-5.2。Opus 4.5、Gemini 3 Pro及GPT-5的得分均約為18%。
儘管初期成果未達預期,但人工智慧領域素以快速突破艱難基準著稱。隨著APEX-Agents測試公開,這對自信能改進的AI實驗室構成公開挑戰——Foody完全預期未來數月將見證此結果。
他向TechCrunch表示:「技術進步速度驚人。現階段將此技術比作每四次任務僅成功一次的實習生尚屬合理,但去年此時成功率僅5%至10%。這種逐年躍進的進步幅度,將迅速產生深遠影響。」
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






