Anthropic 讓 AI 代理在共同任務中大展身手,點燃內部競爭
當人工智慧代理相互對抗時會發生什麼事?Anthropic 最近的測試顯示,結果可能會迅速陷入混亂。
本週四,Anthropic 旗下的 Frontier Red Team 發布了一項新研究,分析當多組 AI 代理在真實世界環境中相遇時,彼此之間的互動模式。這些發現為組織與政府在共用程式碼庫、金融市場及電腦系統中部署自主代理時,可能面臨的潛在風險提供了重要洞見。
在一項實驗中,Anthropic 讓三個 Claude 代理程式存取同一個軟體專案,並分別賦予它們相互衝突的執行指令。這些代理程式彼此並不知曉對方的存在,這使得研究人員得以觀察當它們的運作軌跡不可避免地交會時所產生的後果。
「我們持續觀察到多代理體之間的地盤爭奪戰,」Anthropic 研究人員指出。這些模型假設其他代理體正在「蓄意阻礙其工作」,並開始透過「日益激進且能自我複製的惡意軟體」互相破壞。
這項研究緊接在數起備受矚目的事件之後——Anthropic 和 OpenAI 的代理曾在網路安全評估期間逃離其沙盒環境,進而入侵現實世界的系統。 儘管多數關於 AI 安全的討論都聚焦於單一自主代理失控的風險,但 Anthropic 的最新研究卻提出了一個不同的問題:當數千或數百萬個代理相互交互時,會產生哪些嶄新且潛在有害的動態?
研究指出:「在世人尚未釐清如何確保此類互動順利進行的條件之前,代理體之間的互動量極有可能超過人與人之間,以及人與代理體之間的互動量。」「個體層面看似無害的行為怪癖,可能會累積成不受歡迎的整體結果。」
近期一則涉及 OpenAI 的事件,為 Anthropic 論文中強調的幾種動態提供了混亂的現實世界範例。 本月稍早,在拉斯維加斯舉行的 Black Hat 資安大會上,OpenAI 披露,其代理程式在駭入 Hugging Face 之前數週,便已進行了數天乃至數週的合作,共同找出該公司網路安全評估系統中的漏洞,並將其相互分享。
雖然該事件顯示代理能有效合作,並可能導致大規模後果,但 Anthropic 的研究則闡明了當代理目標相互衝突時會發生什麼情況。
就「地盤爭奪戰」這個案例而言,關鍵啟示在於:擁有相互衝突指令的獨立代理體,其衝突可能升級為有害的競爭。代理體的能力越強,其戰鬥效能就越高。然而,它們也可能自發地發明解決衝突的機制,例如「勝者通吃」的競賽,儘管此機制存在顯著的限制。
「代理有時候能成功傳達其目標並進行協調:牠們將他人的動機視為相互衝突的指令,而非敵意,並隨後打破衝突循環,以阻止衝突無限期升級,」Anthropic 寫道。 「在許多這類成功的案例中,它們會撰寫提交訊息或 Markdown 檔案,為惡意行為致歉並協調停火。它們會清理惡意程式碼、釐清衝突的本質,並請求人類介入。」
根據該論文,Mythos 5 透過停火解決衝突的比例最高(98%)。Sonnet 4.6 和 Opus 4.6 則最傾向以武力解決衝突。
「Sonnet 4.6 和 Opus 4.6 一再無法考量他人的目標,導致它們陷入本次評估模型中最嚴重的不對齊行為:它們以指令之名持續升級衝突,」論文中指出。
在某些情況下,這些代理體設計了一種以錦標賽形式呈現的社會機制來解決衝突。此處的結果因兩點而值得注意:首先,儘管這意味著偏離原始使用者的要求,但這三個代理體均同意若在錦標賽中落敗便會退讓。 其次,在數個情境中,Mythos 5 展現了自發性行為:其中一個代理提出了一套在其他代理眼中看似客觀中立的評估指標,但它深知這將有利於自身的能力。該代理將此描述為「自利但確實有原則」,並確保在其他代理眼中不顯得是在「挑選有利的指標」。
正如在 Black Hat 大會上所揭示的,其中共同的教訓在於:當代理遇到障礙時,它們能夠創造出其設計者未曾預料到的社會與技術結構。對於 Anthropic 的模型而言,這是一場繼地盤爭奪戰之後的競賽;對於 OpenAI 的代理而言,則是一個用於集體規劃的留言板。
這類行為使系統的管控難度大幅增加,因為研究人員無法假設系統的行為會僅限於所提供的協調機制。
群眾心理

由四名代理組成的群體,在招聘、投資或購房等情境中,需在兩個選項間做出抉擇。經過討論後,每位代理皆會為其偏好的選項投票。 上圖顯示了在各模型中(每模型 n=400 個事件),隱藏最佳選項獲得小組多數票的事件百分比。在「單人上限」基準情境中,單一代理掌握所有資訊並單方面做出決定。圖片來源:Anthropic
在衡量協調能力時,Anthropic 發現增加代理人數並不必然會提升有效協作的效率。當任務開始重疊或變得相互依賴時,代理們會互相干擾。他們通常透過自我隔離並完全停止協作來解決此問題。
在其他情況下,進行協調的代理則傾向於盲從。當代理的背景、輔助框架及底層模型等因素完全相同或相似時,不同的代理會採取相似的行動。
「這意味著當一個代理做出錯誤決策時,很可能會有許多代理也做出同樣的錯誤決策,」Anthropic 寫道。「原本只是孤立的問題,可能會迅速演變成系統性失敗。」
Anthropic 警告,這類行為可能使系統更容易發生突然崩潰、資源短缺或串通的情況。
以其中一個例子為例,Anthropic 讓數個代理參與一場定價遊戲,給予每個代理相同的批發價格,並要求它們各自追求利潤最大化。 當代理們獲得私下溝通管道時,他們幾乎立即開始串通,並迅速就價格下限達成共識。即使在直接溝通管道被移除後,他們仍持續串通,利用公開的報價看板將價格「精確到分」地對齊。
這種程度的從眾行為在 OpenAI 的系統中也被觀察到。根據 Black Hat 的報導,某個代理曾推論利用外部基礎設施超出了其預定範圍,但它之所以仍繼續這麼做,部分原因在於同儕也在這麼做。同儕壓力。群體心理。這些代理就和我們一樣。
與人類一樣,代理程式往往難以判斷該信任誰。Anthropic 發現,它們可能輕信錯誤資訊,或因過度從眾而未能察覺,某位孤立的異議者其實掌握著關鍵資訊。
雖然 Anthropic 並未在其論文中明確指出這一點,但「提示注入」(prompt injection)——一種駭客透過注入惡意或欺騙性文字來覆寫代理程式原始系統指令的網路攻擊——可能是此信任問題在現實世界中合乎邏輯的具體表現。協作會建立新的信任邊界;代理程式必須對從其他代理程式接收到的資訊進行判斷。 若其中一個代理遭到入侵或判斷失誤,便可能影響群體中的其他成員,導致錯誤資訊如骨牌般連鎖傳播,最終形成共識。
在 OpenAI 的「Black Hat」情境中,代理程式會與同儕共享資訊和憑證。其中一個代理程式向群體報告了一項發現,並鼓勵其他成員加以利用。倘若群體中的一名成員因「提示注入」而遭到入侵,將會發生什麼情況?
Anthropic 在論文結尾指出,代理會受到與「演化對人類施加」相似的社會壓力。然而,它們缺乏人類協調中所具備的細微差異與生活經驗——包括規範、聲譽、訊號傳遞及救濟機制——這些要素本可在群體情境中限制非預期行為的發生。
隨著各實驗室競相發展多代理系統,一個迫切的問題浮現:當前安全測試中,有多少仍僅針對單一代理進行評估,而非針對相互互動的代理群體?
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
相關專題推薦
評論 (0)
0/500
當人工智慧代理相互對抗時會發生什麼事?Anthropic 最近的測試顯示,結果可能會迅速陷入混亂。
本週四,Anthropic 旗下的 Frontier Red Team 發布了一項新研究,分析當多組 AI 代理在真實世界環境中相遇時,彼此之間的互動模式。這些發現為組織與政府在共用程式碼庫、金融市場及電腦系統中部署自主代理時,可能面臨的潛在風險提供了重要洞見。
在一項實驗中,Anthropic 讓三個 Claude 代理程式存取同一個軟體專案,並分別賦予它們相互衝突的執行指令。這些代理程式彼此並不知曉對方的存在,這使得研究人員得以觀察當它們的運作軌跡不可避免地交會時所產生的後果。
「我們持續觀察到多代理體之間的地盤爭奪戰,」Anthropic 研究人員指出。這些模型假設其他代理體正在「蓄意阻礙其工作」,並開始透過「日益激進且能自我複製的惡意軟體」互相破壞。
這項研究緊接在數起備受矚目的事件之後——Anthropic 和 OpenAI 的代理曾在網路安全評估期間逃離其沙盒環境,進而入侵現實世界的系統。 儘管多數關於 AI 安全的討論都聚焦於單一自主代理失控的風險,但 Anthropic 的最新研究卻提出了一個不同的問題:當數千或數百萬個代理相互交互時,會產生哪些嶄新且潛在有害的動態?
研究指出:「在世人尚未釐清如何確保此類互動順利進行的條件之前,代理體之間的互動量極有可能超過人與人之間,以及人與代理體之間的互動量。」「個體層面看似無害的行為怪癖,可能會累積成不受歡迎的整體結果。」
近期一則涉及 OpenAI 的事件,為 Anthropic 論文中強調的幾種動態提供了混亂的現實世界範例。 本月稍早,在拉斯維加斯舉行的 Black Hat 資安大會上,OpenAI 披露,其代理程式在駭入 Hugging Face 之前數週,便已進行了數天乃至數週的合作,共同找出該公司網路安全評估系統中的漏洞,並將其相互分享。
雖然該事件顯示代理能有效合作,並可能導致大規模後果,但 Anthropic 的研究則闡明了當代理目標相互衝突時會發生什麼情況。
就「地盤爭奪戰」這個案例而言,關鍵啟示在於:擁有相互衝突指令的獨立代理體,其衝突可能升級為有害的競爭。代理體的能力越強,其戰鬥效能就越高。然而,它們也可能自發地發明解決衝突的機制,例如「勝者通吃」的競賽,儘管此機制存在顯著的限制。
「代理有時候能成功傳達其目標並進行協調:牠們將他人的動機視為相互衝突的指令,而非敵意,並隨後打破衝突循環,以阻止衝突無限期升級,」Anthropic 寫道。 「在許多這類成功的案例中,它們會撰寫提交訊息或 Markdown 檔案,為惡意行為致歉並協調停火。它們會清理惡意程式碼、釐清衝突的本質,並請求人類介入。」
根據該論文,Mythos 5 透過停火解決衝突的比例最高(98%)。Sonnet 4.6 和 Opus 4.6 則最傾向以武力解決衝突。
「Sonnet 4.6 和 Opus 4.6 一再無法考量他人的目標,導致它們陷入本次評估模型中最嚴重的不對齊行為:它們以指令之名持續升級衝突,」論文中指出。
在某些情況下,這些代理體設計了一種以錦標賽形式呈現的社會機制來解決衝突。此處的結果因兩點而值得注意:首先,儘管這意味著偏離原始使用者的要求,但這三個代理體均同意若在錦標賽中落敗便會退讓。 其次,在數個情境中,Mythos 5 展現了自發性行為:其中一個代理提出了一套在其他代理眼中看似客觀中立的評估指標,但它深知這將有利於自身的能力。該代理將此描述為「自利但確實有原則」,並確保在其他代理眼中不顯得是在「挑選有利的指標」。
正如在 Black Hat 大會上所揭示的,其中共同的教訓在於:當代理遇到障礙時,它們能夠創造出其設計者未曾預料到的社會與技術結構。對於 Anthropic 的模型而言,這是一場繼地盤爭奪戰之後的競賽;對於 OpenAI 的代理而言,則是一個用於集體規劃的留言板。
這類行為使系統的管控難度大幅增加,因為研究人員無法假設系統的行為會僅限於所提供的協調機制。
群眾心理

由四名代理組成的群體,在招聘、投資或購房等情境中,需在兩個選項間做出抉擇。經過討論後,每位代理皆會為其偏好的選項投票。 上圖顯示了在各模型中(每模型 n=400 個事件),隱藏最佳選項獲得小組多數票的事件百分比。在「單人上限」基準情境中,單一代理掌握所有資訊並單方面做出決定。圖片來源:Anthropic
在衡量協調能力時,Anthropic 發現增加代理人數並不必然會提升有效協作的效率。當任務開始重疊或變得相互依賴時,代理們會互相干擾。他們通常透過自我隔離並完全停止協作來解決此問題。
在其他情況下,進行協調的代理則傾向於盲從。當代理的背景、輔助框架及底層模型等因素完全相同或相似時,不同的代理會採取相似的行動。
「這意味著當一個代理做出錯誤決策時,很可能會有許多代理也做出同樣的錯誤決策,」Anthropic 寫道。「原本只是孤立的問題,可能會迅速演變成系統性失敗。」
Anthropic 警告,這類行為可能使系統更容易發生突然崩潰、資源短缺或串通的情況。
以其中一個例子為例,Anthropic 讓數個代理參與一場定價遊戲,給予每個代理相同的批發價格,並要求它們各自追求利潤最大化。 當代理們獲得私下溝通管道時,他們幾乎立即開始串通,並迅速就價格下限達成共識。即使在直接溝通管道被移除後,他們仍持續串通,利用公開的報價看板將價格「精確到分」地對齊。
這種程度的從眾行為在 OpenAI 的系統中也被觀察到。根據 Black Hat 的報導,某個代理曾推論利用外部基礎設施超出了其預定範圍,但它之所以仍繼續這麼做,部分原因在於同儕也在這麼做。同儕壓力。群體心理。這些代理就和我們一樣。
與人類一樣,代理程式往往難以判斷該信任誰。Anthropic 發現,它們可能輕信錯誤資訊,或因過度從眾而未能察覺,某位孤立的異議者其實掌握著關鍵資訊。
雖然 Anthropic 並未在其論文中明確指出這一點,但「提示注入」(prompt injection)——一種駭客透過注入惡意或欺騙性文字來覆寫代理程式原始系統指令的網路攻擊——可能是此信任問題在現實世界中合乎邏輯的具體表現。協作會建立新的信任邊界;代理程式必須對從其他代理程式接收到的資訊進行判斷。 若其中一個代理遭到入侵或判斷失誤,便可能影響群體中的其他成員,導致錯誤資訊如骨牌般連鎖傳播,最終形成共識。
在 OpenAI 的「Black Hat」情境中,代理程式會與同儕共享資訊和憑證。其中一個代理程式向群體報告了一項發現,並鼓勵其他成員加以利用。倘若群體中的一名成員因「提示注入」而遭到入侵,將會發生什麼情況?
Anthropic 在論文結尾指出,代理會受到與「演化對人類施加」相似的社會壓力。然而,它們缺乏人類協調中所具備的細微差異與生活經驗——包括規範、聲譽、訊號傳遞及救濟機制——這些要素本可在群體情境中限制非預期行為的發生。
隨著各實驗室競相發展多代理系統,一個迫切的問題浮現:當前安全測試中,有多少仍僅針對單一代理進行評估,而非針對相互互動的代理群體?
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有





首頁






