選項
首頁
新聞
人工智能讀鐘失敗,人類在時間識別測試中表現優異

人工智能讀鐘失敗,人類在時間識別測試中表現優異

2025-10-16
145

一項具有里程碑意義的評估,比較了 11 種尖端人工智慧系統與人類在閱讀類比鐘錶方面的表現,結果發現目前的機器學習架構存在重大漏洞。當人類參與者在計時上表現出 89.1% 的優異準確度時,即使是 Google 表現最優異的人工智慧模型,在相同的測試條件下也只達到 13.3% 的成功率。

由研究人員 Alek Safar 率先進行的 ClockBench 調查,強調了兒童通常能掌握的基本視覺推理任務,如何持續挑戰最精密的 AI 演算法。這項嚴謹的評估使用 180 個特別製作的類比時鐘設計,檢驗包括 Google、OpenAI 和 Anthropic 等業界領導廠商的平台。

這些發現指出了神經網路如何處理和詮釋視覺資料的深層結構問題。"Safar 在發表的研究中解釋:「準確讀取類比時鐘需要在視覺情境中進行複雜的空間推理。這個多步驟的認知過程包括手部辨識、位置分析和數值轉換,這些操作揭示了人工智能的關鍵缺點。

事實證明,錯誤模式的對比尤其具有啟發性。人類的錯誤通常會造成大約三分鐘的輕微偏差,而 AI 系統則會產生平均 1-3 小時的嚴重不準確估計值,實際上等同於標準時鐘表面的隨機猜測。

關鍵性能限制

人工智能平台在以下方面表現出明顯的困難

  • 羅馬數字時鐘表面(僅達到 3.2% 的精確度)
  • 反向或鏡面時鐘方向
  • 視覺上複雜的背景和藝術設計
  • 精確測量秒針位置

出現了一個很有說服力的觀察:當 AI 系統能夠正確詮釋初始時鐘讀數時,它們隨後就會在以時間為基礎的計算(如轉換和算術)方面表現優異。這顯示主要的障礙在於視覺理解能力,而非數學處理能力。

產業比較分析

Google 的 Gemini 2.5 Pro 以 13.3% 的準確度領先商業產品,Gemini 2.5 Flash 則以 10.5% 的準確度緊隨其後。OpenAI 的 GPT-5 可達到 8.4% 的正確回應,而 Anthropic 的 Claude 模型表現不佳,Claude 4 Sonnet 僅達到 4.2%,Claude 4.1 Opus 則為 5.6%。

xAI 的 Grok 4 的準確率僅為 0.7%,尤其令人擔憂,主要是因為它錯誤地將 63% 的有效時鐘顯示為不可能的時間 - 儘管只有 20.6% 的時鐘實際上有錯誤的配置。

對人工智能發展的基本影響

這項研究延伸了 ARC-AGI 和 SimpleBench 等計畫所示範的「人類-簡單、AI-複雜」基準範例。雖然人工智慧已經在許多以知識為基礎的評估和專業考試中達到超人的表現,但原始的視覺推理仍是持續的挑戰。

Safar 的分析顯示,目前擴大模型大小和訓練資料的方法可能無法有效解決這些視覺處理限制。兩個假設的因素包括:訓練資料庫中類比時鐘的表現不足,以及圖形時鐘元件與文字表達之間空間關係轉換的固有困難。

ClockBench 加入了不斷擴充的診斷工具套件,旨在發現非明顯的 AI 能力缺口。為了維持評估的完整性,整個資料集仍然受到限制,以防止未來的模型訓練受到污染,只有受控制的樣本子集可供驗證。

這些發現提出了一些關鍵問題:現有架構的逐步改進能否彌補這些推理缺陷,或者是否需要根本性的新方法--這反映了其他 AI 領域的創新(例如測試時間計算)所帶來的歷史性突破。

在可預見的未來,機械類比鐘會成為人類智慧出乎意料的穩健基準 - 我們可以輕鬆詮釋的技術,卻持續困擾著我們最先進的計算創造。

相關文章
奧利押注隱私保護,力爭在 AI 助理競賽中勝出 奧利押注隱私保護,力爭在 AI 助理競賽中勝出 要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化 「AI LIVE:倫敦」將如何探討人工智慧與工業自動化 本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
Anthropic 進入 AI 法律科技市場,競爭日益激烈 Anthropic 進入 AI 法律科技市場,競爭日益激烈 Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
相關專題推薦
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
教育與學習 面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺
面向教師、輔導老師和基於群體的學習專案的 AI 測驗構建平臺

2026年最新最佳AI測驗構建平臺,適用於教師、輔導老師和基於群體的學習專案!XIX.AI精心整理了一份頂級評分列表,包含經過現實世界測試的強力變革性工具,以提供準確的排名。這些必試平臺有助於提高寫作效率、簡化內容創作,並簡化各種學習場景中的測驗設計。立即探索,發現您解鎖教學AI優勢的理想工具!

13 個工具
xix.ai
代碼 適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具
適用於 GitHub 團隊處理重構、錯誤及安全漏洞的 AI 拉取請求審查工具

2026 年最新、最優秀的 GitHub 團隊 AI 拉取請求審查工具,就在 XIX.AI!這份精選且評價極高的清單,展示了多款強大且能徹底改變遊戲規則的解決方案,可優化所有團隊工作流程中的重構、錯誤修復及安全漏洞偵測。 透過免費與付費版本的比較、實際測試結果以及詳細排名,協助您找到能顯著提升生產力的完美工具。立即探索,釋放您的 AI 競爭優勢!

12 個工具
xix.ai
評論 (1)
0/500
JonathanMiller
JonathanMiller 2026-04-21 12:00:45

Interessant, dass selbst moderne KI bei so simplen Aufgaben wie Uhrenlesen scheitert. Das zeigt, wie spezifisch menschliche Wahrnehmung und Alltagserfahrung sind. Vielleicht sollten wir weniger auf 'Allgemeine' Intelligenz hoffen und mehr auf spezialisierte Tools setzen, die mit Menschen zusammenarbeiten. 🤔

OR