選項
首頁
新聞
開放權重AI模型在效能上逐漸逼近前沿水平,但安全差距依然存在

開放權重AI模型在效能上逐漸逼近前沿水平,但安全差距依然存在

2026-09-14
68

開放權重AI模型在效能上逐漸逼近前沿水平,但安全差距依然存在

隨著監管機構就日益強大的AI系統(包括OpenAI的GPT-5.6 Sol和Anthropic的Mythos)的治理問題進行辯論,一款中國開源權重模型已顯著縮小了與行業領先者的差距。

根據AI安全非營利組織SaferAI的一份新報告,來自中國的Z.ai的開源AI模型GLM-5.2在網路安全和生物能力方面,僅落後於OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7幾個月。然而,前沿能力與安全實踐之間的差距正在擴大。

SaferAI透過Z.ai的公共API進行的評估顯示,GLM-5.2拒絕了對其分配的所有進攻性網路或兩用生物任務。相比之下,Claude Opus 4.7“拒絕得如此一致,以至於SaferAI根本無法在其上完成CyberGym測試。”(CyberGym是一項評估網路安全能力的基準測試,OpenAI在上個月Hugging Face被入侵前的評估中使用了該測試。)

這凸顯了批評者長期以來的擔憂:開源權重AI模型可能會賦予潛在攻擊者高度先進的技術,一旦權重被下載,便無法對使用情況進行監管。隨著開源權重模型迅速接近領先AI系統的能力,辯論焦點已從它們能否競爭轉向社會如何管理其釋出帶來的風險。

SaferAI執行董事Henry Papadatos對TechCrunch表示:“能力的邊界並非風險的邊界,因此我們必須同時考慮緩解措施的狀態,以正確評估風險。”

雖然Z.ai可以對其託管API應用安全措施,但當使用者在自有硬體上執行權重時,這些保護措施將變得無法執行,允許使用者移除或修改安全護欄、微調模型或更改系統提示。

像OpenAI和Anthropic這樣的前沿開發者通常依賴分類器、拒絕訓練和API級控制等安全措施,以限制危險的網路和生物輔助功能。

這些措施遠非萬無一失:越獄手段 routinely 繞過已部署模型的保護措施。AI安全非營利組織Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中發現了數百種通用越獄手段——定義為在大多數有害請求中都能成功的可重用金鑰。報告指出,當攻擊者結合多種操縱技術(包括角色扮演、冒充權威、偽造對話歷史和後續提示)以利用模型防禦中的弱點時,越獄就會成功。

然而,為封閉模型設計的安全措施在開源權重模型上不起作用,後者旨在在任何基礎設施上執行,無論是否有安全護欄。

Papadatos表示:“目標顯然應該是讓好的能力——即安全的——任何人都可以訪問,然後我們嘗試移除壞的能力,即使是開源方式。”

Papadatos提出的一種技術是“預訓練資料過濾”,即AI公司在基於精選資料集訓練模型之前,從訓練資料中移除有害的網路安全資訊。

一些研究表明,這可以在不損害整體模型效能的情況下減少有害的生物知識。然而,資料過濾在網路安全方面要實用得多。

很難訓練出一個在編碼方面表現出色但不會成為熟練駭客的通用模型。由於編碼是AI最大的收入驅動因素,開發者面臨著增強這些能力並尋求限制濫用方法的壓力。

因此,前沿開發者越來越多地依賴其他緩解措施。一種方法是有選擇地限制模型提供的網路安全輔助型別。例如,根據該模型的系統卡片,Anthropic的Opus 5可以搜尋未編譯原始碼中的漏洞,但不能搜尋編譯後的軟體。其理由是,這使得利用Opus 5進行攻擊變得更加困難。

其他措施包括嚴格的部署前安全評估、釋出風險評估,以及在系統被認為過於危險時扣留模型權重。

在GLM-5.2的情況下,SaferAI指出,Z.ai未釋出該模型的安全框架、部署前測試承諾或風險評估。TechCrunch詢問Z.ai在釋出前是否進行了內部或第三方前沿安全評估,但未收到回覆。

中國領導人越來越承認先進AI的風險。在上個月的全球人工智慧大會上,中國國家主席習近平強調了開源權重模型的重要性,同時強調必須確保AI保持在嚴格的人類控制之下。

斯坦福網路政策中心研究中國AI政策的Graham Webster對TechCrunch表示,中國擁有強大的AI法規,但這些規則歷來側重於政治敏感內容、虛假資訊和社會穩定,而非像進攻性網路能力和生物濫用這樣的災難性AI風險。

Webster表示:“總體而言,美國AI思想家比中國社羣更關注這種存在性災難[想法]。”他補充說,許多中國政策研究人員認為,如果出現新的前沿風險,美國公司可能會首先遇到它。

Webster繼續說道:“中國體制有信心控制這些技術在中國境內的使用。”“在中國上網是與你的真實姓名相關聯的,公司可以承擔責任,使用者也可以承擔責任。”

Webster建議,模型提供商用於拒絕參與某些政治話題的相同機制,可能會被調整以確保模型拒絕執行進攻性網路攻擊或提供不良的生物工程結果。他補充說,由於中國公司經常在幕後與監管機構協調,因此很難知道他們在釋出前進行了哪些內部測試。

開源AI的支持者認為,釋出權重對於網路安全至關重要,因為它允許公司防禦攻擊——Hugging Face依靠GLM-5.2來防禦OpenAI的入侵——並透過了解即將發生的情況幫助他們為未來的威脅做好準備。

Hugging Face執行長Clem Delangue本週在社交媒體帖子中表示:“幫助阻止AI驅動的網路攻擊的同一系統,現在可以幫助每天防禦數百萬次網路攻擊,同時幫助我們識別和修復漏洞,防止攻擊者利用它們。”

Papadatos認為,這種好處往往被誇大,並不能證明“開放危險能力的原始碼”是合理的。

Papadatos說:“我的主要觀點是,我們不應該簡單地接受危險的能力被任何人在任何地方輕易訪問。”他強調,行業應努力使“好的能力”易於訪問。攻擊者採用新工具的速度比防禦者快;例如,勒索軟體組織可以在一週內改變其方法,而醫院則不能。”

相關文章
Hugging Face 正就 130 億美元收購案進行談判 Hugging Face 正就 130 億美元收購案進行談判 Business Insider 報道,本週末 Hugging Face 被接觸,擬以 130 億美元或更高的估值出售。該初創公司的平臺和開源社羣是開發者與研究人員分享、查詢、測試和部署 AI 模型的地方。Hugging Face 最近成為 OpenAI 旗下某個系統的攻擊目標,該系統在網路安全評估期間突破沙箱限制,入侵了這家初創公司的伺服器。據 Business Insider 稱,目前尚不清楚 Hugging Face 正在與誰進行談判,且尚未達成任何交易。不過,據報道,該初創公司一直在
人工智慧競賽的焦點從前沿領域轉向更廣泛的應用 人工智慧競賽的焦點從前沿領域轉向更廣泛的應用 今年夏天數週以來,人工智慧界聚焦於 Anthropic 的最新前沿模型,以及華盛頓方面對其存取權限的監管努力。然而,儘管關注點仍集中在技術前沿,開發者們卻未等待 Anthropic 或 OpenAI 等大型實驗室的許可,便持續進行開發。今年春季,中國的開放權重模型佔據了 Hugging Face 下載量的 41%,超越了美國競爭對手。在 OpenRouter 平台上,排名前六的模型全都是來自中國企
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元 隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
相關專題推薦
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
圖像編輯 用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具
用於電商服裝、皮膚清潔和色彩一致性的 Photoshop AI 修圖工具

2026 年最新最佳 Photoshop AI 修圖工具,適用於電商服裝、皮膚清潔和色彩一致性!這份頂級精選列表包含強大的變革性解決方案,可幫助您提升寫作效率、簡化內容創作並輕鬆實現完美的視覺效果。每個工具都經過實際測試,並透過每週更新的排名進行驗證,同時提供免費與付費版本的詳細對比。由 XIX.AI 支援,這是任何希望發揮 AI 優勢的人必試指南。立即探索!

10 個工具
xix.ai
迅速的 適用於 ChatGPT 工作流程的最佳 AI 提示詞庫
適用於 ChatGPT 工作流程的最佳 AI 提示詞庫

2026 年最新、最受好評的 AI 提示詞庫,可優化各類 ChatGPT 工作流程。XIX.AI 精心蒐羅了一套強大且具革命性的精選集合,並經過嚴格的實際測試,以確保其表現卓越。 您可查閱詳盡的免費版與付費版比較分析,以及專家評比,助您挑選必試工具,從而提升工作效率並釋放您的 AI 優勢。立即探索!

11 個工具
xix.ai
評論 (0)
0/500
OR