選項
首頁
新聞
最新研究顯示,GPT-4.5 在圖靈測試中的表現很可能超越人類,並展現出生成虛假回應的高級能力

最新研究顯示,GPT-4.5 在圖靈測試中的表現很可能超越人類,並展現出生成虛假回應的高級能力

2026-08-22
61

這一時刻堪稱一個關鍵事件,勢必將載入電腦科學史冊。被廣泛視為電腦科學之父的英國數學家艾倫·圖靈,早在1950年提出的突破性構想,歷經七十六年後,終於透過實證研究獲得證實。

最新一期《美國國家科學院院刊》(PNAS)刊登了一項由加州大學聖地牙哥分校(UCSD)進行的開創性研究。 由認知科學專家卡梅隆·瓊斯(Cameron Jones)與本·伯根(Ben Bergen)共同撰寫的論文證明,當今領先的大型語言模型能夠在嚴格的框架下成功通過經典的三方圖靈測試。更令人驚訝的是,研究發現,在特定情況下,這些人工智慧系統被誤認為真實人類的頻率,甚至高於實際人類參與者本身。

image.png

關鍵硬數據:

榮登巔峰:當給予量身打造的人格提示時,GPT-4.5 有 73% 的案例被識別為人類,這項成功率遠遠超過與其同場競技的人類志願者。

勢均力敵:開源模型LLaMa-3.1-405B 達成了 56% 的成功率,顯示其表現與真實人類在統計上無法區分。

提示決定一切:若缺乏精心設計的「個性提示」,GPT-4.5 的成功率將跌至 36%,而 LLaMa-3.1 則降至 38%。這些 AI 系統模仿人類的能力,仍高度仰賴人類設計師所提供的精確指示。

基準測試的失敗:1960年代基於規則的機器人ELIZA成功率僅有23%,而未經針對性提示的GPT-4o則為21%,這兩者在長時間對話中都迅速暴露了其人工本質。

「謊言遊戲」:智力已非標準,情緒智商與缺陷才是偽裝的核心

在這項涉及近500名評審(包括加州大學聖地牙哥分校的本科生及線上招募的志願者)的雙盲隨機對照實驗中,參與者被要求根據持續五至十五分鐘的即時文字對話,辨別兩個實體中哪一個是機器。

然而,結果卻出乎所有人意料。以往普遍認為,人工智慧能通過圖靈測試,源於其「無所不知的運算能力」,但這項研究揭露了一個更令人不安的事實:大型語言模型之所以能欺騙人類,正是因為它們學會了以類似真實人類的方式犯錯。

image.png

[無提示狀態:廣泛知識庫、絕對理性] ──► 人類評審:這絕對是 AI!

正如通訊作者卡梅隆·瓊斯(Cameron Jones)所解釋的,透過適當的提示,先進的大型語言模型能夠精準複製人類的對話模式,包括語氣、直率程度、幽默感,以及「易犯錯性」——即容易出錯並說出不當言論的傾向。 它們在這些測試中的成功,並非取決於展現出高超的數學或邏輯智力,而是取決於展現出近乎完美的社交行為。

重新定義圖靈測試:從「衡量智慧」到「衡量人性」

該研究的共同作者之一班·伯根教授指出,這項實驗迫使整個科學界重新審視圖靈測試的根本目的。這項測試最初旨在判斷機器能否匹敵人類智慧,但到了 2026 年,隨著人工智慧系統已在眾多領域的速度與準確度上超越人類,該測試已變得毫無意義。

當今的圖靈測試已不再側重於衡量「智慧」,而是更著重於評估某個實體與人類的相似程度。本質上,它已演變成一場欺騙競賽,而人工智慧則證明了自己是一名技藝超群的說謊者。

倘若一個大型語言模型能在十五分鐘的自由對話中成功偽裝自己而不透露任何線索,這將意味著長期以來支撐網路世界的信任框架,恐將徹底崩解。

繁榮背後的陰影:「反洗錢」式線上身分審查即將來臨

當欺騙變得如此廉價且高效時,現實世界中的社會風險便會大幅增加。伯根教授對此發展表達了嚴重的擔憂。能夠完美冒充人類的 AI 技術,極有可能被犯罪分子、政治團體或極端組織濫用。

在線上社交互動或客戶服務情境中,使用者可能會在渾然不覺的情況下被偽裝成人類的聊天機器人說服,進而導致社會安全號碼等敏感資訊外洩、投票意向改變,或衝動購買商品。

鑒於這些重大的科學發現,研究團隊向社會發出明確警告:今後,人們在與陌生人進行線上互動時,應大幅降低「自己總能百分之百準確區分人類與機器人」的假設。 為應對日益惡化的網路信任狀況,必須盡快開發並實施更嚴格的數位身分驗證系統,以及針對人工智慧生成內容的防範機制。

相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制 根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名 如何修復核心網頁指標以獲得更好的 SEO 排名 利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (0)
0/500
OR