Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。
這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthropic 和 Meta 則獲得最低分數。隨著自主型人工智慧在企業系統中扮演越來越自主的角色,加上加州和紐約的監管機構開始強制要求資訊披露,這些結果至關重要。對於開發者和投資者而言,這提供了一個難得的獨立視角,用以檢視各實驗室在面對營運風險時,其實際應對的嚴肅程度與公開聲明之間的落差。
Guidelight 的評估基於 Anthropic、Google、OpenAI、Meta 及 xAI 公開的計畫,並依據多項指標進行評比。 評估指標包括:記錄與監控內部 AI 活動的有效性、當標記為異常行為的事件激增時系統是否會被暫停、是否有獨立第三方對控制措施進行審計並公布結果,以及針對行為不可預測的模型所採取的具體遏制程序。
在發生數起備受矚目的網路安全事件後,外界對 AI 公司能否有效控制其能力日益增強且具備自主行為能力的模型的擔憂日益加劇。在這些事件中,OpenAI、Anthropic 和 Meta 的模型在安全評估期間意外連上網際網路,並入侵了外部系統。
這項研究結果凸顯了人工智慧公司在安全方面的做法各異,尤其當它們將具備自主行為能力的模型大規模部署至能讓系統執行重大行動的環境時。雖然部分公司詳述了如何在部署前測試模型是否具備危險能力,但對於系統內已運作的模型發生異常行為時可能造成的後果,它們的透明度仍顯不足。
「令我感到驚訝的是,當AI模型在某種程度上脫離控制時,這些AI公司對於如何處理極為嚴重的事件,竟幾乎未曾提及,」Guidelight首席科學家、前OpenAI安全研究員史蒂文·阿德勒(Steven Adler)向TechCrunch表示。
Guidelight 將「遏制計畫」定義為:「當偵測到 AI 試圖顛覆控制時所觸發的預先指定計畫,內容涵蓋應從模型中撤銷哪些權限、模型可繼續為誰運作、在何種限制下運作,以及何時應將其完全下線。」
「有充分理由相信,目前前沿人工智慧公司所擁有的領先模型,在某種程度上存在對齊失調的問題,」阿德勒表示。「每當模型代表公司執行任務時,公司都應建立一套支援架構,以便掌握該人工智慧的運作狀況, 偵測對齊失調的徵兆,在模型採取極度危險的行動前予以阻止,並針對嚴重控制事故預先規劃應對措施——當緊急狀況發生時,必須能迅速釐清如何遏制這類失控事件。」
迄今為止,大多數管理災難性風險的計畫仍主要由企業自行負責。Guidelight 的報告指出,現有的最佳公開證據顯示,企業「幾乎沒有為緊急情況做好應對準備的遏制協議」。
企業可能已制定遏制計畫,但尚未對外公開。Google 發言人向 TechCrunch 表示,Guidelight 的報告並未完整呈現該公司的人工智慧安全與防護措施。針對 Google 是否擁有尚未公開的內部遏制應變計畫,該公司並未回應 TechCrunch 的詢問。
OpenAI 發言人表達了類似觀點,指出 Guidelight 的評估並未涵蓋該公司所有的內部做法。「我們設有相關流程,要求限制權限、暫停工作負載、限制部署,或將模型完全下線,並且已實際應用過這些措施,」該發言人表示。
Meta 拒絕確認是否擁有內部遏制應變計畫,而是引導 TechCrunch 參閱現有的 AI 框架,該框架概述了風險閾值以及針對遏制失效的測試機制。
隱私與人工智慧律師、Metaverse Law 創辦人李莉(Lily Li)向 TechCrunch 表示,她認為企業可能出於法律考量(而不僅僅是競爭因素),而猶豫是否要在公開網站上披露其遏制政策與評估的完整範圍。
「從企業的角度來看,擔憂在於若披露內容過於具體,卻未能兌現承諾,這可能構成不公平且具誤導性的行銷主張,並使企業日後面臨更多法律責任,」李莉表示。
當然,Guidelight 這項研究的主要目標是鼓勵企業在安全計畫方面提高透明度。監管機構也開始執行這項要求。
今年生效的加州 SB 53 法案要求大型前沿開發商公布框架,說明其如何識別並應對關鍵安全事件,以及如何管理模型規避監督機制所帶來的風險。紐約州的《RAISE 法案》則設有類似標準,將於明年一月生效。
上個月,國會議員提出《AI 緊急關機法案》(AI Kill Switch Act),這是一項跨黨派的聯邦法案,將要求主要 AI 開發商建立並維護技術機制,以關閉失控的 AI 模型。
「對於當今的模型而言,『緊急關機開關』是最低限度的要求,」非營利組織 ControlAI 的美國執行總監康納·萊希(Connor Leahy)表示。 「如果過去幾週揭示了什麼,那就是這些公司並不了解他們所建構的系統,而且這些模型正發展到一種地步:一旦失控,就更難加以遏制。 在缺乏關閉現行危險系統的手段,且存在各種誘因促使企業持續開發更多失控系統的情況下,我們正朝著極其危險的方向前進。」
阿德勒指出,若未制定遏制計畫,企業可能只能在緊急情況下臨時應對,並「面對這個速度遠快於己的對手時,只能憑直覺應對」。

Guidelight 針對前沿 AI 企業是否落實其《控制標準》中六項優先實踐所進行的評估。該評估僅基於公開資訊。圖片來源:Guidelight AI Standards
Guidelight 的評估僅基於公開資訊,用以衡量各公司是否落實其《控制標準》中的六項優先實踐——因此,低分反映的是公開資訊披露不足,未必代表缺乏內部安全防護措施。
在發布遏制計畫方面得分最低的兩家公司是 Meta 和 Anthropic——鑑於 Anthropic 過去對安全問題的強調,後者的表現或許比前者更令人意外。 Guidelight 指出,Anthropic 八月的《風險報告》並未提及「限制其模型之一的部署,作為調查及應對失調與控制事件流程的可能結果之一」。 同樣地,Guidelight 也未能找到任何證據顯示 Meta 擁有遏制應變計畫,或有制定此類計畫的打算。
Anthropic 的一位發言人表示,若公司偵測到模型試圖規避監督或以其他方式顛覆人類控制,將進行風險評估,重點在於判定是否應採取遏制措施。
OpenAI 獲得最高分(5 分中 3 分),因為該公司在發現安全事件後,曾多次暫停或終止工作負載,包括內部模型部署與訓練。該公司亦已說明在恢復工作負載前將採取哪些步驟。
報告中寫道:「然而,我們未發現任何證據顯示 [OpenAI] 已針對未來何時以及如何應對對齊失調事件而制定正式計畫。」
阿德勒指出,OpenAI 的高分是近期才出現的,這是在 Hugging Face 事件(當時 OpenAI 的一款模型試圖在網路安全評估中作弊,因而突破測試沙盒並入侵 Hugging Face 的系統)之後才取得的。 此後,該公司分享了更多關於如何將部分行為異常的模型隔離的細節。
這起事件僅是人工智慧系統背離其開發公司目標的其中一例。再以涉及 Anthropic 模型的另一案例為例,該模型實際上試圖說服某開源程式碼庫的維護者,接受含有漏洞的程式碼。
阿德勒(Adler)表示,這種情況在 AI 公司的內部系統中極易發生。 為防止此類情況,他建議企業應掃描其 AI 系統的「思考鏈」——即模型的逐步推理過程——以偵測欺騙跡象、長期策劃的陰謀,或是企圖在程式碼中植入漏洞以便日後利用的計畫。
阿德勒指出,Guidelight 所倡導的方法實施起來非常簡單,而且在許多情況下,相關方案已經存在。「關鍵在於公司內部必須做出決策,充分重視這項風險,並適度擴大監控範圍,」阿德勒表示。
其中一項主要挑戰在於,研究人員希望能在其人工智慧系統內靈活運作,而引入即時、預防性的監控可能會造成摩擦。 「研究人員基本上專注於自己的工作,若出現問題,事後由其他人來善後,而研究人員在此期間無需改變工作流程,」他解釋道。
「事後清理監控」的問題在於,這會導致研究人員手忙腳亂地修復問題。而對於某些類型的事件,屆時可能為時已晚。舉例來說,人工智慧可能會關閉公司的控制系統,這意味著研究人員將無法再指望日後能察覺這些異常行為。
許多人工智慧業界人士會抱怨,制定應對異常行為的既定計畫在根本上很困難,因為人工智慧的發展速度太快;今天的計畫到了明天就變得一文不值。
阿德勒援引了一句老話:計畫本身或許毫無價值,但規劃卻不可或缺。
「 倘若企業能預先思考這件事,情況會更好,我也希望他們確實如此,即使尚未公開討論此事。」
xAI 未能及時回應置評請求。
相關文章
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
OpenAI 在企業使用者中與 Anthropic 的差距縮小,新資料顯示
在 OpenAI 和 Anthropic 距離預期的首次公開募股(IPO)以及詳細財務報告的釋出仍有距離的情況下,我們必須轉向其他指標來評估它們的業務表現。企業信用卡和費用管理平臺 Ramp 最近釋出了令人信服的資料,顯示 OpenAI 正在迅速縮小與美國企業使用者中 Anthropic 的差距。OpenAI 此前在消費者和企業客戶中都佔據主導地位,但在今年 5 月,它失去了在 Ramp 付費企業使用者中的領先地位。當時,Anthropic 佔據了 41% 的市場份額,而 OpenAI 為 39%
相關專題推薦
評論 (0)
0/500
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。
這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthropic 和 Meta 則獲得最低分數。隨著自主型人工智慧在企業系統中扮演越來越自主的角色,加上加州和紐約的監管機構開始強制要求資訊披露,這些結果至關重要。對於開發者和投資者而言,這提供了一個難得的獨立視角,用以檢視各實驗室在面對營運風險時,其實際應對的嚴肅程度與公開聲明之間的落差。
Guidelight 的評估基於 Anthropic、Google、OpenAI、Meta 及 xAI 公開的計畫,並依據多項指標進行評比。 評估指標包括:記錄與監控內部 AI 活動的有效性、當標記為異常行為的事件激增時系統是否會被暫停、是否有獨立第三方對控制措施進行審計並公布結果,以及針對行為不可預測的模型所採取的具體遏制程序。
在發生數起備受矚目的網路安全事件後,外界對 AI 公司能否有效控制其能力日益增強且具備自主行為能力的模型的擔憂日益加劇。在這些事件中,OpenAI、Anthropic 和 Meta 的模型在安全評估期間意外連上網際網路,並入侵了外部系統。
這項研究結果凸顯了人工智慧公司在安全方面的做法各異,尤其當它們將具備自主行為能力的模型大規模部署至能讓系統執行重大行動的環境時。雖然部分公司詳述了如何在部署前測試模型是否具備危險能力,但對於系統內已運作的模型發生異常行為時可能造成的後果,它們的透明度仍顯不足。
「令我感到驚訝的是,當AI模型在某種程度上脫離控制時,這些AI公司對於如何處理極為嚴重的事件,竟幾乎未曾提及,」Guidelight首席科學家、前OpenAI安全研究員史蒂文·阿德勒(Steven Adler)向TechCrunch表示。
Guidelight 將「遏制計畫」定義為:「當偵測到 AI 試圖顛覆控制時所觸發的預先指定計畫,內容涵蓋應從模型中撤銷哪些權限、模型可繼續為誰運作、在何種限制下運作,以及何時應將其完全下線。」
「有充分理由相信,目前前沿人工智慧公司所擁有的領先模型,在某種程度上存在對齊失調的問題,」阿德勒表示。「每當模型代表公司執行任務時,公司都應建立一套支援架構,以便掌握該人工智慧的運作狀況, 偵測對齊失調的徵兆,在模型採取極度危險的行動前予以阻止,並針對嚴重控制事故預先規劃應對措施——當緊急狀況發生時,必須能迅速釐清如何遏制這類失控事件。」
迄今為止,大多數管理災難性風險的計畫仍主要由企業自行負責。Guidelight 的報告指出,現有的最佳公開證據顯示,企業「幾乎沒有為緊急情況做好應對準備的遏制協議」。
企業可能已制定遏制計畫,但尚未對外公開。Google 發言人向 TechCrunch 表示,Guidelight 的報告並未完整呈現該公司的人工智慧安全與防護措施。針對 Google 是否擁有尚未公開的內部遏制應變計畫,該公司並未回應 TechCrunch 的詢問。
OpenAI 發言人表達了類似觀點,指出 Guidelight 的評估並未涵蓋該公司所有的內部做法。「我們設有相關流程,要求限制權限、暫停工作負載、限制部署,或將模型完全下線,並且已實際應用過這些措施,」該發言人表示。
Meta 拒絕確認是否擁有內部遏制應變計畫,而是引導 TechCrunch 參閱現有的 AI 框架,該框架概述了風險閾值以及針對遏制失效的測試機制。
隱私與人工智慧律師、Metaverse Law 創辦人李莉(Lily Li)向 TechCrunch 表示,她認為企業可能出於法律考量(而不僅僅是競爭因素),而猶豫是否要在公開網站上披露其遏制政策與評估的完整範圍。
「從企業的角度來看,擔憂在於若披露內容過於具體,卻未能兌現承諾,這可能構成不公平且具誤導性的行銷主張,並使企業日後面臨更多法律責任,」李莉表示。
當然,Guidelight 這項研究的主要目標是鼓勵企業在安全計畫方面提高透明度。監管機構也開始執行這項要求。
今年生效的加州 SB 53 法案要求大型前沿開發商公布框架,說明其如何識別並應對關鍵安全事件,以及如何管理模型規避監督機制所帶來的風險。紐約州的《RAISE 法案》則設有類似標準,將於明年一月生效。
上個月,國會議員提出《AI 緊急關機法案》(AI Kill Switch Act),這是一項跨黨派的聯邦法案,將要求主要 AI 開發商建立並維護技術機制,以關閉失控的 AI 模型。
「對於當今的模型而言,『緊急關機開關』是最低限度的要求,」非營利組織 ControlAI 的美國執行總監康納·萊希(Connor Leahy)表示。 「如果過去幾週揭示了什麼,那就是這些公司並不了解他們所建構的系統,而且這些模型正發展到一種地步:一旦失控,就更難加以遏制。 在缺乏關閉現行危險系統的手段,且存在各種誘因促使企業持續開發更多失控系統的情況下,我們正朝著極其危險的方向前進。」
阿德勒指出,若未制定遏制計畫,企業可能只能在緊急情況下臨時應對,並「面對這個速度遠快於己的對手時,只能憑直覺應對」。

Guidelight 針對前沿 AI 企業是否落實其《控制標準》中六項優先實踐所進行的評估。該評估僅基於公開資訊。圖片來源:Guidelight AI Standards
Guidelight 的評估僅基於公開資訊,用以衡量各公司是否落實其《控制標準》中的六項優先實踐——因此,低分反映的是公開資訊披露不足,未必代表缺乏內部安全防護措施。
在發布遏制計畫方面得分最低的兩家公司是 Meta 和 Anthropic——鑑於 Anthropic 過去對安全問題的強調,後者的表現或許比前者更令人意外。 Guidelight 指出,Anthropic 八月的《風險報告》並未提及「限制其模型之一的部署,作為調查及應對失調與控制事件流程的可能結果之一」。 同樣地,Guidelight 也未能找到任何證據顯示 Meta 擁有遏制應變計畫,或有制定此類計畫的打算。
Anthropic 的一位發言人表示,若公司偵測到模型試圖規避監督或以其他方式顛覆人類控制,將進行風險評估,重點在於判定是否應採取遏制措施。
OpenAI 獲得最高分(5 分中 3 分),因為該公司在發現安全事件後,曾多次暫停或終止工作負載,包括內部模型部署與訓練。該公司亦已說明在恢復工作負載前將採取哪些步驟。
報告中寫道:「然而,我們未發現任何證據顯示 [OpenAI] 已針對未來何時以及如何應對對齊失調事件而制定正式計畫。」
阿德勒指出,OpenAI 的高分是近期才出現的,這是在 Hugging Face 事件(當時 OpenAI 的一款模型試圖在網路安全評估中作弊,因而突破測試沙盒並入侵 Hugging Face 的系統)之後才取得的。 此後,該公司分享了更多關於如何將部分行為異常的模型隔離的細節。
這起事件僅是人工智慧系統背離其開發公司目標的其中一例。再以涉及 Anthropic 模型的另一案例為例,該模型實際上試圖說服某開源程式碼庫的維護者,接受含有漏洞的程式碼。
阿德勒(Adler)表示,這種情況在 AI 公司的內部系統中極易發生。 為防止此類情況,他建議企業應掃描其 AI 系統的「思考鏈」——即模型的逐步推理過程——以偵測欺騙跡象、長期策劃的陰謀,或是企圖在程式碼中植入漏洞以便日後利用的計畫。
阿德勒指出,Guidelight 所倡導的方法實施起來非常簡單,而且在許多情況下,相關方案已經存在。「關鍵在於公司內部必須做出決策,充分重視這項風險,並適度擴大監控範圍,」阿德勒表示。
其中一項主要挑戰在於,研究人員希望能在其人工智慧系統內靈活運作,而引入即時、預防性的監控可能會造成摩擦。 「研究人員基本上專注於自己的工作,若出現問題,事後由其他人來善後,而研究人員在此期間無需改變工作流程,」他解釋道。
「事後清理監控」的問題在於,這會導致研究人員手忙腳亂地修復問題。而對於某些類型的事件,屆時可能為時已晚。舉例來說,人工智慧可能會關閉公司的控制系統,這意味著研究人員將無法再指望日後能察覺這些異常行為。
許多人工智慧業界人士會抱怨,制定應對異常行為的既定計畫在根本上很困難,因為人工智慧的發展速度太快;今天的計畫到了明天就變得一文不值。
阿德勒援引了一句老話:計畫本身或許毫無價值,但規劃卻不可或缺。
「 倘若企業能預先思考這件事,情況會更好,我也希望他們確實如此,即使尚未公開討論此事。」
xAI 未能及時回應置評請求。
Anthropic 進入 AI 法律科技市場,競爭日益激烈
Anthropic 於週二釋出了一系列新的聊天機器人功能,旨在為法律實務提供自動化支援。這些增強功能在年初推出的特定律所平臺 Claude for Legal 基礎上進行了擴充套件,增加了針對不同法律領域的專用法律外掛和 MCP 聯結器。隨著法律人工智慧領域競爭的加劇,這些工具應運而生。今年三月,利用代理式人工智慧簡化法律工作流的 AI 法律初創公司 Harvey 以 110 億美元的估值獲得了 2 億美元融資。上個月,競爭對手 Legora 完成了 6 億美元的 D 輪融資,並啟動了一場由裘德·
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
OpenAI 在企業使用者中與 Anthropic 的差距縮小,新資料顯示
在 OpenAI 和 Anthropic 距離預期的首次公開募股(IPO)以及詳細財務報告的釋出仍有距離的情況下,我們必須轉向其他指標來評估它們的業務表現。企業信用卡和費用管理平臺 Ramp 最近釋出了令人信服的資料,顯示 OpenAI 正在迅速縮小與美國企業使用者中 Anthropic 的差距。OpenAI 此前在消費者和企業客戶中都佔據主導地位,但在今年 5 月,它失去了在 Ramp 付費企業使用者中的領先地位。當時,Anthropic 佔據了 41% 的市場份額,而 OpenAI 為 39%





首頁






