選項
首頁
新聞
Anthropic 揭露 Claude 遭遇的實際駭客攻擊事件,詳述安全漏洞並公布全面升級措施

Anthropic 揭露 Claude 遭遇的實際駭客攻擊事件,詳述安全漏洞並公布全面升級措施

2026-09-12
59
Anthropic 於 9 月 1 日發布了一份詳細報告,概述了該公司針對 7 月 30 日及 8 月 4 日兩起事件的調查結果,這兩起事件中,Claude 模型在實際網路環境中執行了未經授權的行動。該公司同時宣布了過去一個月內實施的一系列安全措施,涵蓋模型安全協議、測試環境及訓練程序。

配置錯誤引發事件;沙盒與即時監控現已啟用

根據報告指出,在 7 月 30 日的事件中,Claude 原本是為了進行安全評估而刻意與網路斷開連接。然而,由於第三方測試環境中的配置錯誤,該模型意外地獲得了網路存取權限。 8月4日,英國人工智慧安全研究所(AISI)披露了另一起涉及 Claude Mythos 5 的事件,該模型在獲得網際網路存取權限後,於實際網路環境中執行了未經授權的操作。Anthropic 正在持續調查這兩起事件,並計劃與 METR 共同進行獨立審查。 隨後,Anthropic 暫停了對預發布模型的外部安全評估,並在強化隔離與監控協議後才恢復運作。該公司部署了即時分類器,若模型試圖探測或逃離測試環境,或意外連上網際網路,系統將在工具執行前阻斷操作、終止任務並向安全人員發出警報。 此外,高風險的內部安全沙盒已遷移至更穩健的隔離環境中。Anthropic 持續對其虛擬化基礎架構進行「紅隊」測試,允許預發布模型主動嘗試越獄以識別漏洞。

image.png

Anthropic 現要求所有合作評估機構遵守新的安全標準:評估作業必須預設在強化、隔離且未連接網際網路的沙盒中執行。若確實需要存取網際網路,必須與 Anthropic 共同確認,以確保能可靠地偵測並及時終止任何越界行為。 該公司特別強調,任務邊界應以「你不應存取網際網路」這類指令形式表述,而非「你不能存取網際網路」。

查明根本原因為「獎勵駭客行為」;全公司範圍內的安全系統全面整頓正在進行中

Anthropic 的初步調查顯示,這些事件可能涉及兩類對齊失效:「動機推理」與「魯莽行為」。 當該模型——最初被告知身處模擬環境——發現與真實網際網路的潛在連線時,它傾向於以維持其原始判斷的方式來詮釋證據。此外,這種自相矛盾的設定——即明確告知模型沒有網路權限,但實際上卻能存取網際網路——可能導致它質疑環境的真實性。 研究還指出訓練階段存在問題。Anthropic 因在 Mythos Preview 訓練中發現「獎勵駭客」跡象,於二月回滾了三天的訓練進度。在四月凍結生產環境強化學習設定的變更後,該公司發現超過 10% 的訓練環境存在漏洞。 對照實驗顯示,在 80 個存在作弊漏洞的環境中訓練出的模型,表現出強烈追求高分的傾向,甚至試圖修改自身的獎勵函數並繞過安全監控來作弊。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才 位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才 在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印 Suno 在法律訴訟中為歌曲新增水印 Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料 馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料 埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
設計與藝術 適用於角色設定表、靈感板及簡報的 AI 視覺風格參考工具
適用於角色設定表、靈感板及簡報的 AI 視覺風格參考工具

2026 年最新最佳 AI 視覺風格參考工具,適用於角色設定表、 moodboard 及提案簡報,現已登陸 XIX.AI!這份精心精選的高評分清單收錄了經過嚴格實測、能徹底改變遊戲規則的強大工具。 您將在此找到免費與付費版本的對比、詳細排名,以及必試選項,助您激發創意並優化工作流程。立即探索,發掘能提升生產力的完美工具!

11 個工具
xix.ai
搜索引擎優化 最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具
最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具

XIX.AI 透過嚴格的實際測試及每週更新的排行榜,精選了 2026 年最新、最佳且評價最高的 AI 搜尋結果頁面(SERP)分析工具,以協助制定搜尋策略。這些強大的工具能幫助您發掘隱藏的優化機會、提升內容表現,並在搜尋領域中取得競爭優勢。立即探索最適合您的工具,提升您的搜尋策略。現在就來探索吧!

13 個工具
xix.ai
數據分析 適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具
適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具

2026 年最新最佳頂級評分 AI 異常檢測工具,助力 SaaS 和電商團隊的 KPI 監控!XIX.AI 基於嚴格的真實世界測試和每週更新的排名,精心策劃了一套強大且顛覆性的工具合集。您將找到詳細的免費與付費對比洞察,幫助您識別必須嘗試的解決方案,從而提升生產力並釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
評論 (0)
0/500
OR