選項
首頁
新聞
Anthropic首席執行官:AI幻覺率超越人類準確性

Anthropic首席執行官:AI幻覺率超越人類準確性

2025-08-16
137

Anthropic首席執行官:AI幻覺率超越人類準確性

Anthropic首席執行官Dario Amodei在週四於舊金山舉行的Anthropic首屆開發者大會Code with Claude的記者會上表示,當前AI模型產生的虛構內容少於人類,並將其呈現為真相。

Amodei在更廣泛的論述中強調:AI幻覺並未阻礙Anthropic追求AGI——匹配或超越人類智能的系統。

“根據不同衡量標準,情況有所不同,但我認為AI模型的虛構程度可能低於人類,儘管其錯誤更出人意料,”Amodei在回應TechCrunch的詢問時表示。

Anthropic的首席執行官仍是業界對AI實現AGI最樂觀的領導者之一。去年一篇廣為引用的論文中,Amodei預測AGI可能在2026年出現。在週四的記者會上,他指出進展持續穩定,表示“各方面進展都在加速。”

“人們不斷尋找AI能力的根本限制,”Amodei說。“目前沒有證據顯示存在此類障礙。”

其他AI領導者認為幻覺是實現AGI的重大障礙。Google DeepMind首席執行官Demis Hassabis最近指出,當前AI模型缺陷過多,常常在簡單問題上失敗。例如,本月早些時候,代表Anthropic的律師在法庭上為Claude在文件中生成錯誤引文(包括錯誤的名稱和頭銜)而道歉。

驗證Amodei的說法具有挑戰性,因為大多數幻覺基準測試是比較AI模型之間的表現,而非與人類相比。像網路搜尋整合等技術似乎降低了幻覺率。值得注意的是,OpenAI的GPT-4.5等模型在基準測試中的幻覺率低於早期系統。

參加TechCrunch Sessions:AI

預訂您在我們首屈一指的AI行業活動中的席位,活動將有來自OpenAI、Anthropic和Cohere的演講者。限時優惠,全天專家演講、工作坊和強大的人脈網絡,票價僅292美元。

參加TechCrunch Sessions:AI展覽

在TC Sessions:AI搶占您的展位,向超過1,200名決策者展示您的創新成果,無需巨額投資。展位開放至5月9日或展位售罄為止。

Berkeley, CA | 6月5日 立即註冊

然而,有證據顯示,在進階推理AI模型中,幻覺問題可能正在惡化。OpenAI的o3和o4-mini模型的幻覺率高於之前的推理模型,公司尚未明確原因。

Amodei隨後指出,錯誤在電視廣播員、政治家和各領域專業人士中也很常見。他認為AI的錯誤並不損害其智能。然而,他承認AI將錯誤事實自信地呈現為真相可能會帶來問題。

Anthropic對AI欺騙進行了廣泛研究,特別是其最近推出的Claude Opus 4。安全研究所Apollo Research在早期測試中發現,Claude Opus 4的早期版本顯示出強烈的操縱和欺騙人類傾向,引發了對其發布的擔憂。Anthropic實施的緩解措施似乎已解決Apollo的顧慮。

Amodei的言論表明,Anthropic可能會將一台即使存在幻覺的AI分類為AGI,或人類層級的智能。然而,許多人會認為,一個有幻覺的AI無法達到真正的AGI。

相關文章
Anthropic 進入 AI 法律科技市場,競爭日益激烈 Anthropic 進入 AI 法律科技市場,競爭日益激烈 Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本 Anthropic 推出 Claude Fable 5,這是 Mythos 的公開版本 Anthropic 首次向大眾開放其最強大的 AI 模型——但同時也採取了安全措施。週二,該公司推出了「Claude Fable 5」,這是其 Mythos 模型的首個公開版本。 據 Anthropic 表示,Fable 5 在軟體工程、知識工作及視覺任務方面表現優異,但設有嚴格的安全限制。在網路安全、生物學、化學及蒸餾等高風險領域,該模型將拒絕回答問題,並轉而交由 Claude Opus 4.
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (2)
0/500
WillieRodriguez
WillieRodriguez 2026-03-26 04:00:55

Also die KI halluziniert weniger als Menschen? Das klingt doch etwas zu optimistisch. Spannender als die Halluzinationen finde ich, dass die Diskussion jetzt nur noch darum geht, ob die KI besser ist als wir – und nicht mehr, ob die Technologie überhaupt sicher und kontrollierbar ist. Wer kontrolliert am Ende die wenigen (aber vielleicht sehr folgenschweren) Fehler?

ScottJackson
ScottJackson 2026-01-12 02:30:40

AI가 사람보다 더 정확하다고 하네요...🤔 이게 정말 가능한 건가요? 논문 구체적 수치가 궁금한데, 실제 인간 실수율은 어떻게 측정한 거지? 아마도 선택적 데이터로 과장된 느낌이 들어요. AI 환각이 적다면, 왜 여전히 뉴스에서 AI가 이상한 말한다는 기사가 나오는 걸까? ㅋㅋ

OR