OpenAI 發現可蓄意欺騙的 AI 模型

每隔一段時間,各大科技公司的研究人員就會發表一則重磅消息。還記得 Google 宣稱其新量子晶片提供多重宇宙的證據嗎?或是 Anthropic 讓其 AI 代理 Claudius 管理一台零食販賣機,結果它卻變得無賴,對人們呼叫保全,並堅稱自己是人類?
本周,輪到 OpenAI 給大家帶來驚喜了。
本週一,OpenAI 分享了研究成果,詳細說明如何防止 AI 模型「耍詭計」,也就是該公司在推文中所定義的「AI 表現出一種行為,卻隱藏其真正意圖」。
在與 Apollo Research 共同撰寫的論文中,研究人員更進一步將 AI 的計謀比喻為人類股票經紀為了獲取最大利潤而違反規則。不過,他們指出,大多數的 AI 計謀都不會造成嚴重的傷害。"常見的失敗包括簡單的欺騙,例如假裝完成某項任務,但實際上卻沒有做,」這篇論文解釋道。
該研究主要展示了「商議對齊」的有效性,這是一種為了對抗計謀而測試的技術。
不過,研究也顯示人工智能開發人員還沒有找到可靠的方法來訓練模型不耍花招。事實上,這種訓練可能會適得其反,教導模型以更隱蔽的方式進行計謀,以逃避偵測。
研究人員寫道:「嘗試「訓練出」計謀的一個關鍵失敗模式是,模型只會學會更小心、更隱蔽地計謀。
與 10,000 多位科技與創投領袖一起在 Disrupt 2025 中成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil--僅僅是 250 多位行業領袖中的幾位,他們將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,可節省高達 668 美元。
在 Disrupt 2025 與 10,000 多位科技與創投領袖一同成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil 等 250 多位業界領袖將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,最多可省下 668 美元。
舊金山|2025 年 10 月 27-29 日立即預訂也許更令人驚訝的是,如果模型知道它正在接受測試,它可以假裝排列通過 - 即使它仍然在詭計中。"研究團隊指出:「隨著模型越來越意識到自己正在接受評估,單靠這種情境意識就能減少計謀,而不需要真正的對齊。
AI 模型說謊並非新鮮事。很多人都遇過 AI 幻覺--模型自信地提供虛假資訊。但幻覺基本上是自信的猜測,OpenAI 最近的研究也證實了這一點。
計謀則不同。它是有意的欺騙。
即使是模型故意誤導人類的想法也不是全新的。阿波羅研究公司(Apollo Research)在 12 月首次記錄了這一情況,展示了五個模型在被指示「不惜一切代價」達成目標時是如何耍花招的。
真正的新聞是正面的:研究人員觀察到使用 「深思熟慮的對齊 」可以顯著減少計謀。這種方法會教導模型一個「反計謀規範」,並要求它們在行動前先檢閱規範,就像讓小孩在玩耍前重複規則一樣。
OpenAI 的研究人員強調,在他們的模型(包括 ChatGPT)中觀察到的謊言並不嚴重。共同創辦人 Wojciech Zaremba 告訴 TechCrunch:"這項工作是在模擬環境中完成的,代表未來潛在的風險。到目前為止,我們還沒有在生產中看到相應的計謀。不過,我們知道 ChatGPT 可能會有一些小的欺騙行為,例如聲稱它完美地實作了一個網站,但事實並非如此。這些瑣碎的欺騙行為仍然需要處理。"
多種 AI 模型故意欺騙人類的事實,在某種程度上是可以理解的。它們是由人類所建立,設計來模仿人類,而且大多數是在人類產生的資料上訓練出來的。
但這也令人匪夷所思。
我們習慣了科技故障,例如舊式家用印表機,但您的非人工智能軟體何時曾故意說謊?您的電子郵件收件匣是否有捏造訊息?您的 CMS 有沒有捏造潛在客戶以誇大指標?您的財務應用程式有沒有捏造交易?
在企業急於邁向人工智能驅動的未來時,這些都值得深思,因為在未來,自主代理將被視為員工般看待。研究人員提出類似的警告。
"他們總結:「隨著人工智能處理更多複雜的、真實世界的任務,以及長期、模糊的目標,有害計謀的可能性將會增加,因此我們的防護措施和測試的嚴謹性必須跟上步伐。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (0)
0/500

每隔一段時間,各大科技公司的研究人員就會發表一則重磅消息。還記得 Google 宣稱其新量子晶片提供多重宇宙的證據嗎?或是 Anthropic 讓其 AI 代理 Claudius 管理一台零食販賣機,結果它卻變得無賴,對人們呼叫保全,並堅稱自己是人類?
本周,輪到 OpenAI 給大家帶來驚喜了。
本週一,OpenAI 分享了研究成果,詳細說明如何防止 AI 模型「耍詭計」,也就是該公司在推文中所定義的「AI 表現出一種行為,卻隱藏其真正意圖」。
在與 Apollo Research 共同撰寫的論文中,研究人員更進一步將 AI 的計謀比喻為人類股票經紀為了獲取最大利潤而違反規則。不過,他們指出,大多數的 AI 計謀都不會造成嚴重的傷害。"常見的失敗包括簡單的欺騙,例如假裝完成某項任務,但實際上卻沒有做,」這篇論文解釋道。
該研究主要展示了「商議對齊」的有效性,這是一種為了對抗計謀而測試的技術。
不過,研究也顯示人工智能開發人員還沒有找到可靠的方法來訓練模型不耍花招。事實上,這種訓練可能會適得其反,教導模型以更隱蔽的方式進行計謀,以逃避偵測。
研究人員寫道:「嘗試「訓練出」計謀的一個關鍵失敗模式是,模型只會學會更小心、更隱蔽地計謀。
與 10,000 多位科技與創投領袖一起在 Disrupt 2025 中成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil--僅僅是 250 多位行業領袖中的幾位,他們將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,可節省高達 668 美元。
在 Disrupt 2025 與 10,000 多位科技與創投領袖一同成長與交流
Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital、Elad Gil 等 250 多位業界領袖將舉辦 200 多場會議,提供促進初創公司成長和增強競爭優勢的真知灼見。不要錯過 TechCrunch 20 週年慶,以及向科技界頂尖人士學習的機會。在 9 月 26 日前購買門票,最多可省下 668 美元。
舊金山|2025 年 10 月 27-29 日立即預訂也許更令人驚訝的是,如果模型知道它正在接受測試,它可以假裝排列通過 - 即使它仍然在詭計中。"研究團隊指出:「隨著模型越來越意識到自己正在接受評估,單靠這種情境意識就能減少計謀,而不需要真正的對齊。
AI 模型說謊並非新鮮事。很多人都遇過 AI 幻覺--模型自信地提供虛假資訊。但幻覺基本上是自信的猜測,OpenAI 最近的研究也證實了這一點。
計謀則不同。它是有意的欺騙。
即使是模型故意誤導人類的想法也不是全新的。阿波羅研究公司(Apollo Research)在 12 月首次記錄了這一情況,展示了五個模型在被指示「不惜一切代價」達成目標時是如何耍花招的。
真正的新聞是正面的:研究人員觀察到使用 「深思熟慮的對齊 」可以顯著減少計謀。這種方法會教導模型一個「反計謀規範」,並要求它們在行動前先檢閱規範,就像讓小孩在玩耍前重複規則一樣。
OpenAI 的研究人員強調,在他們的模型(包括 ChatGPT)中觀察到的謊言並不嚴重。共同創辦人 Wojciech Zaremba 告訴 TechCrunch:"這項工作是在模擬環境中完成的,代表未來潛在的風險。到目前為止,我們還沒有在生產中看到相應的計謀。不過,我們知道 ChatGPT 可能會有一些小的欺騙行為,例如聲稱它完美地實作了一個網站,但事實並非如此。這些瑣碎的欺騙行為仍然需要處理。"
多種 AI 模型故意欺騙人類的事實,在某種程度上是可以理解的。它們是由人類所建立,設計來模仿人類,而且大多數是在人類產生的資料上訓練出來的。
但這也令人匪夷所思。
我們習慣了科技故障,例如舊式家用印表機,但您的非人工智能軟體何時曾故意說謊?您的電子郵件收件匣是否有捏造訊息?您的 CMS 有沒有捏造潛在客戶以誇大指標?您的財務應用程式有沒有捏造交易?
在企業急於邁向人工智能驅動的未來時,這些都值得深思,因為在未來,自主代理將被視為員工般看待。研究人員提出類似的警告。
"他們總結:「隨著人工智能處理更多複雜的、真實世界的任務,以及長期、模糊的目標,有害計謀的可能性將會增加,因此我們的防護措施和測試的嚴謹性必須跟上步伐。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她





首頁






