最新研究顯示,GPT-4.5 在圖靈測試中的表現很可能超越人類,並展現出生成虛假回應的高級能力
這一時刻堪稱一個關鍵事件,勢必將載入電腦科學史冊。被廣泛視為電腦科學之父的英國數學家艾倫·圖靈,早在1950年提出的突破性構想,歷經七十六年後,終於透過實證研究獲得證實。
最新一期《美國國家科學院院刊》(PNAS)刊登了一項由加州大學聖地牙哥分校(UCSD)進行的開創性研究。 由認知科學專家卡梅隆·瓊斯(Cameron Jones)與本·伯根(Ben Bergen)共同撰寫的論文證明,當今領先的大型語言模型能夠在嚴格的框架下成功通過經典的三方圖靈測試。更令人驚訝的是,研究發現,在特定情況下,這些人工智慧系統被誤認為真實人類的頻率,甚至高於實際人類參與者本身。

關鍵硬數據:
榮登巔峰:當給予量身打造的人格提示時,GPT-4.5 有 73% 的案例被識別為人類,這項成功率遠遠超過與其同場競技的人類志願者。
勢均力敵:開源模型LLaMa-3.1-405B 達成了 56% 的成功率,顯示其表現與真實人類在統計上無法區分。
提示決定一切:若缺乏精心設計的「個性提示」,GPT-4.5 的成功率將跌至 36%,而 LLaMa-3.1 則降至 38%。這些 AI 系統模仿人類的能力,仍高度仰賴人類設計師所提供的精確指示。
基準測試的失敗:1960年代基於規則的機器人ELIZA成功率僅有23%,而未經針對性提示的GPT-4o則為21%,這兩者在長時間對話中都迅速暴露了其人工本質。
「謊言遊戲」:智力已非標準,情緒智商與缺陷才是偽裝的核心
在這項涉及近500名評審(包括加州大學聖地牙哥分校的本科生及線上招募的志願者)的雙盲隨機對照實驗中,參與者被要求根據持續五至十五分鐘的即時文字對話,辨別兩個實體中哪一個是機器。
然而,結果卻出乎所有人意料。以往普遍認為,人工智慧能通過圖靈測試,源於其「無所不知的運算能力」,但這項研究揭露了一個更令人不安的事實:大型語言模型之所以能欺騙人類,正是因為它們學會了以類似真實人類的方式犯錯。

[無提示狀態:廣泛知識庫、絕對理性] ──► 人類評審:這絕對是 AI!
正如通訊作者卡梅隆·瓊斯(Cameron Jones)所解釋的,透過適當的提示,先進的大型語言模型能夠精準複製人類的對話模式,包括語氣、直率程度、幽默感,以及「易犯錯性」——即容易出錯並說出不當言論的傾向。 它們在這些測試中的成功,並非取決於展現出高超的數學或邏輯智力,而是取決於展現出近乎完美的社交行為。
重新定義圖靈測試:從「衡量智慧」到「衡量人性」
該研究的共同作者之一班·伯根教授指出,這項實驗迫使整個科學界重新審視圖靈測試的根本目的。這項測試最初旨在判斷機器能否匹敵人類智慧,但到了 2026 年,隨著人工智慧系統已在眾多領域的速度與準確度上超越人類,該測試已變得毫無意義。
當今的圖靈測試已不再側重於衡量「智慧」,而是更著重於評估某個實體與人類的相似程度。本質上,它已演變成一場欺騙競賽,而人工智慧則證明了自己是一名技藝超群的說謊者。
倘若一個大型語言模型能在十五分鐘的自由對話中成功偽裝自己而不透露任何線索,這將意味著長期以來支撐網路世界的信任框架,恐將徹底崩解。
繁榮背後的陰影:「反洗錢」式線上身分審查即將來臨
當欺騙變得如此廉價且高效時,現實世界中的社會風險便會大幅增加。伯根教授對此發展表達了嚴重的擔憂。能夠完美冒充人類的 AI 技術,極有可能被犯罪分子、政治團體或極端組織濫用。
在線上社交互動或客戶服務情境中,使用者可能會在渾然不覺的情況下被偽裝成人類的聊天機器人說服,進而導致社會安全號碼等敏感資訊外洩、投票意向改變,或衝動購買商品。
鑒於這些重大的科學發現,研究團隊向社會發出明確警告:今後,人們在與陌生人進行線上互動時,應大幅降低「自己總能百分之百準確區分人類與機器人」的假設。 為應對日益惡化的網路信任狀況,必須盡快開發並實施更嚴格的數位身分驗證系統,以及針對人工智慧生成內容的防範機制。
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500
這一時刻堪稱一個關鍵事件,勢必將載入電腦科學史冊。被廣泛視為電腦科學之父的英國數學家艾倫·圖靈,早在1950年提出的突破性構想,歷經七十六年後,終於透過實證研究獲得證實。
最新一期《美國國家科學院院刊》(PNAS)刊登了一項由加州大學聖地牙哥分校(UCSD)進行的開創性研究。 由認知科學專家卡梅隆·瓊斯(Cameron Jones)與本·伯根(Ben Bergen)共同撰寫的論文證明,當今領先的大型語言模型能夠在嚴格的框架下成功通過經典的三方圖靈測試。更令人驚訝的是,研究發現,在特定情況下,這些人工智慧系統被誤認為真實人類的頻率,甚至高於實際人類參與者本身。

關鍵硬數據:
榮登巔峰:當給予量身打造的人格提示時,GPT-4.5 有 73% 的案例被識別為人類,這項成功率遠遠超過與其同場競技的人類志願者。
勢均力敵:開源模型LLaMa-3.1-405B 達成了 56% 的成功率,顯示其表現與真實人類在統計上無法區分。
提示決定一切:若缺乏精心設計的「個性提示」,GPT-4.5 的成功率將跌至 36%,而 LLaMa-3.1 則降至 38%。這些 AI 系統模仿人類的能力,仍高度仰賴人類設計師所提供的精確指示。
基準測試的失敗:1960年代基於規則的機器人ELIZA成功率僅有23%,而未經針對性提示的GPT-4o則為21%,這兩者在長時間對話中都迅速暴露了其人工本質。
「謊言遊戲」:智力已非標準,情緒智商與缺陷才是偽裝的核心
在這項涉及近500名評審(包括加州大學聖地牙哥分校的本科生及線上招募的志願者)的雙盲隨機對照實驗中,參與者被要求根據持續五至十五分鐘的即時文字對話,辨別兩個實體中哪一個是機器。
然而,結果卻出乎所有人意料。以往普遍認為,人工智慧能通過圖靈測試,源於其「無所不知的運算能力」,但這項研究揭露了一個更令人不安的事實:大型語言模型之所以能欺騙人類,正是因為它們學會了以類似真實人類的方式犯錯。

[無提示狀態:廣泛知識庫、絕對理性] ──► 人類評審:這絕對是 AI!
正如通訊作者卡梅隆·瓊斯(Cameron Jones)所解釋的,透過適當的提示,先進的大型語言模型能夠精準複製人類的對話模式,包括語氣、直率程度、幽默感,以及「易犯錯性」——即容易出錯並說出不當言論的傾向。 它們在這些測試中的成功,並非取決於展現出高超的數學或邏輯智力,而是取決於展現出近乎完美的社交行為。
重新定義圖靈測試:從「衡量智慧」到「衡量人性」
該研究的共同作者之一班·伯根教授指出,這項實驗迫使整個科學界重新審視圖靈測試的根本目的。這項測試最初旨在判斷機器能否匹敵人類智慧,但到了 2026 年,隨著人工智慧系統已在眾多領域的速度與準確度上超越人類,該測試已變得毫無意義。
當今的圖靈測試已不再側重於衡量「智慧」,而是更著重於評估某個實體與人類的相似程度。本質上,它已演變成一場欺騙競賽,而人工智慧則證明了自己是一名技藝超群的說謊者。
倘若一個大型語言模型能在十五分鐘的自由對話中成功偽裝自己而不透露任何線索,這將意味著長期以來支撐網路世界的信任框架,恐將徹底崩解。
繁榮背後的陰影:「反洗錢」式線上身分審查即將來臨
當欺騙變得如此廉價且高效時,現實世界中的社會風險便會大幅增加。伯根教授對此發展表達了嚴重的擔憂。能夠完美冒充人類的 AI 技術,極有可能被犯罪分子、政治團體或極端組織濫用。
在線上社交互動或客戶服務情境中,使用者可能會在渾然不覺的情況下被偽裝成人類的聊天機器人說服,進而導致社會安全號碼等敏感資訊外洩、投票意向改變,或衝動購買商品。
鑒於這些重大的科學發現,研究團隊向社會發出明確警告:今後,人們在與陌生人進行線上互動時,應大幅降低「自己總能百分之百準確區分人類與機器人」的假設。 為應對日益惡化的網路信任狀況,必須盡快開發並實施更嚴格的數位身分驗證系統,以及針對人工智慧生成內容的防範機制。
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






