一項具有里程碑意義的評估,比較了 11 種尖端人工智慧系統與人類在閱讀類比鐘錶方面的表現,結果發現目前的機器學習架構存在重大漏洞。當人類參與者在計時上表現出 89.1% 的優異準確度時,即使是 Google 表現最優異的人工智慧模型,在相同的測試條件下也只達到 13.3% 的成功率。
由研究人員 Alek Safar 率先進行的 ClockBench 調查,強調了兒童通常能掌握的基本視覺推理任務,如何持續挑戰最精密的 AI 演算法。這項嚴謹的評估使用 180 個特別製作的類比時鐘設計,檢驗包括 Google、OpenAI 和 Anthropic 等業界領導廠商的平台。
這些發現指出了神經網路如何處理和詮釋視覺資料的深層結構問題。"Safar 在發表的研究中解釋:「準確讀取類比時鐘需要在視覺情境中進行複雜的空間推理。這個多步驟的認知過程包括手部辨識、位置分析和數值轉換,這些操作揭示了人工智能的關鍵缺點。
事實證明,錯誤模式的對比尤其具有啟發性。人類的錯誤通常會造成大約三分鐘的輕微偏差,而 AI 系統則會產生平均 1-3 小時的嚴重不準確估計值,實際上等同於標準時鐘表面的隨機猜測。
關鍵性能限制
人工智能平台在以下方面表現出明顯的困難
- 羅馬數字時鐘表面(僅達到 3.2% 的精確度)
- 反向或鏡面時鐘方向
- 視覺上複雜的背景和藝術設計
- 精確測量秒針位置
出現了一個很有說服力的觀察:當 AI 系統能夠正確詮釋初始時鐘讀數時,它們隨後就會在以時間為基礎的計算(如轉換和算術)方面表現優異。這顯示主要的障礙在於視覺理解能力,而非數學處理能力。
產業比較分析
Google 的 Gemini 2.5 Pro 以 13.3% 的準確度領先商業產品,Gemini 2.5 Flash 則以 10.5% 的準確度緊隨其後。OpenAI 的 GPT-5 可達到 8.4% 的正確回應,而 Anthropic 的 Claude 模型表現不佳,Claude 4 Sonnet 僅達到 4.2%,Claude 4.1 Opus 則為 5.6%。
xAI 的 Grok 4 的準確率僅為 0.7%,尤其令人擔憂,主要是因為它錯誤地將 63% 的有效時鐘顯示為不可能的時間 - 儘管只有 20.6% 的時鐘實際上有錯誤的配置。

對人工智能發展的基本影響
這項研究延伸了 ARC-AGI 和 SimpleBench 等計畫所示範的「人類-簡單、AI-複雜」基準範例。雖然人工智慧已經在許多以知識為基礎的評估和專業考試中達到超人的表現,但原始的視覺推理仍是持續的挑戰。
Safar 的分析顯示,目前擴大模型大小和訓練資料的方法可能無法有效解決這些視覺處理限制。兩個假設的因素包括:訓練資料庫中類比時鐘的表現不足,以及圖形時鐘元件與文字表達之間空間關係轉換的固有困難。
ClockBench 加入了不斷擴充的診斷工具套件,旨在發現非明顯的 AI 能力缺口。為了維持評估的完整性,整個資料集仍然受到限制,以防止未來的模型訓練受到污染,只有受控制的樣本子集可供驗證。
這些發現提出了一些關鍵問題:現有架構的逐步改進能否彌補這些推理缺陷,或者是否需要根本性的新方法--這反映了其他 AI 領域的創新(例如測試時間計算)所帶來的歷史性突破。
在可預見的未來,機械類比鐘會成為人類智慧出乎意料的穩健基準 - 我們可以輕鬆詮釋的技術,卻持續困擾著我們最先進的計算創造。





首頁









