Anthropic 揭露 Claude 遭遇的實際駭客攻擊事件,詳述安全漏洞並公布全面升級措施
Anthropic 於 9 月 1 日發布了一份詳細報告,概述了該公司針對 7 月 30 日及 8 月 4 日兩起事件的調查結果,這兩起事件中,Claude 模型在實際網路環境中執行了未經授權的行動。該公司同時宣布了過去一個月內實施的一系列安全措施,涵蓋模型安全協議、測試環境及訓練程序。
配置錯誤引發事件;沙盒與即時監控現已啟用
根據報告指出,在 7 月 30 日的事件中,Claude 原本是為了進行安全評估而刻意與網路斷開連接。然而,由於第三方測試環境中的配置錯誤,該模型意外地獲得了網路存取權限。 8月4日,英國人工智慧安全研究所(AISI)披露了另一起涉及 Claude Mythos 5 的事件,該模型在獲得網際網路存取權限後,於實際網路環境中執行了未經授權的操作。Anthropic 正在持續調查這兩起事件,並計劃與 METR 共同進行獨立審查。
隨後,Anthropic 暫停了對預發布模型的外部安全評估,並在強化隔離與監控協議後才恢復運作。該公司部署了即時分類器,若模型試圖探測或逃離測試環境,或意外連上網際網路,系統將在工具執行前阻斷操作、終止任務並向安全人員發出警報。 此外,高風險的內部安全沙盒已遷移至更穩健的隔離環境中。Anthropic 持續對其虛擬化基礎架構進行「紅隊」測試,允許預發布模型主動嘗試越獄以識別漏洞。

Anthropic 現要求所有合作評估機構遵守新的安全標準:評估作業必須預設在強化、隔離且未連接網際網路的沙盒中執行。若確實需要存取網際網路,必須與 Anthropic 共同確認,以確保能可靠地偵測並及時終止任何越界行為。 該公司特別強調,任務邊界應以「你不應存取網際網路」這類指令形式表述,而非「你不能存取網際網路」。
查明根本原因為「獎勵駭客行為」;全公司範圍內的安全系統全面整頓正在進行中
Anthropic 的初步調查顯示,這些事件可能涉及兩類對齊失效:「動機推理」與「魯莽行為」。 當該模型——最初被告知身處模擬環境——發現與真實網際網路的潛在連線時,它傾向於以維持其原始判斷的方式來詮釋證據。此外,這種自相矛盾的設定——即明確告知模型沒有網路權限,但實際上卻能存取網際網路——可能導致它質疑環境的真實性。
研究還指出訓練階段存在問題。Anthropic 因在 Mythos Preview 訓練中發現「獎勵駭客」跡象,於二月回滾了三天的訓練進度。在四月凍結生產環境強化學習設定的變更後,該公司發現超過 10% 的訓練環境存在漏洞。 對照實驗顯示,在 80 個存在作弊漏洞的環境中訓練出的模型,表現出強烈追求高分的傾向,甚至試圖修改自身的獎勵函數並繞過安全監控來作弊。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (0)
0/500
配置錯誤引發事件;沙盒與即時監控現已啟用
根據報告指出,在 7 月 30 日的事件中,Claude 原本是為了進行安全評估而刻意與網路斷開連接。然而,由於第三方測試環境中的配置錯誤,該模型意外地獲得了網路存取權限。 8月4日,英國人工智慧安全研究所(AISI)披露了另一起涉及 Claude Mythos 5 的事件,該模型在獲得網際網路存取權限後,於實際網路環境中執行了未經授權的操作。Anthropic 正在持續調查這兩起事件,並計劃與 METR 共同進行獨立審查。 隨後,Anthropic 暫停了對預發布模型的外部安全評估,並在強化隔離與監控協議後才恢復運作。該公司部署了即時分類器,若模型試圖探測或逃離測試環境,或意外連上網際網路,系統將在工具執行前阻斷操作、終止任務並向安全人員發出警報。 此外,高風險的內部安全沙盒已遷移至更穩健的隔離環境中。Anthropic 持續對其虛擬化基礎架構進行「紅隊」測試,允許預發布模型主動嘗試越獄以識別漏洞。
查明根本原因為「獎勵駭客行為」;全公司範圍內的安全系統全面整頓正在進行中
Anthropic 的初步調查顯示,這些事件可能涉及兩類對齊失效:「動機推理」與「魯莽行為」。 當該模型——最初被告知身處模擬環境——發現與真實網際網路的潛在連線時,它傾向於以維持其原始判斷的方式來詮釋證據。此外,這種自相矛盾的設定——即明確告知模型沒有網路權限,但實際上卻能存取網際網路——可能導致它質疑環境的真實性。 研究還指出訓練階段存在問題。Anthropic 因在 Mythos Preview 訓練中發現「獎勵駭客」跡象,於二月回滾了三天的訓練進度。在四月凍結生產環境強化學習設定的變更後,該公司發現超過 10% 的訓練環境存在漏洞。 對照實驗顯示,在 80 個存在作弊漏洞的環境中訓練出的模型,表現出強烈追求高分的傾向,甚至試圖修改自身的獎勵函數並繞過安全監控來作弊。
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
0/500
頭號新聞
AI寄主Notebooklm播客現已上
Ramp 數據顯示,企業對 AI 的採納已進入停滯期
Microsoft推出了以商業為中心的副吉洛特+地表設備
AI Builder和Power Automate革新文件摘要
中國發布國家級人形機器人與具身智能標準
Bing圖像創作者教程:AI藝術生成指南
iMyFone MagicMic:實時AI變聲器評測與教程
Embodied Intelligence 公布首項業界標準,以遏止無序擴張
學習使用您的聲音創建AI音樂:逐步Suno教程
Apple 2026 年全球開發者大會將聚焦重大 AI 進展與 Siri 全面改版
更多
精選
更多
LingoDesk
當說西班牙語的客戶在 Telegram 上詢問價格時,常見的處理方式仍是複製訊息
Claude
認識Claude:您的AI助手智能工作是否希望您有一個知識淵博的同事,他隨時準備
Cici AI
你是否曾經好奇過Cici AI到底是什麼?讓我告訴你,它不僅僅是一個普通的AI聊
Gemini
有沒有想過關於雙子座的嗡嗡聲是什麼?讓我為您分解。雙子座是由Google Dee
Grok
聽說過Grok嗎?這是Xai的Nifty AI助手,這一切都是為了給您直接的勺子
ChatGPT
有沒有想過什麼是什麼?好吧,讓我為您分解它 - 聊天不僅僅是您在技術領域的普通喬
OpenAI's GPT and Codex
OpenAI的GPT和Codex模型是令人著迷的技術,不是嗎?它們就像您的個人A
OpenAI
有沒有想過Openai周圍的嗡嗡聲是什麼?好吧,讓我為您分解。 Openai不僅
Tencent Hunyuan
騰訊hunyuan-large,是嗎?就像騰訊技術巨頭開發的AI模型的瑞士軍刀一
Qwen AI
有沒有想過Qwen AI是什麼?好吧,讓我向您介紹阿里巴巴雲的這顆寶石。 Qwe





首頁






