開放權重AI模型在效能上逐漸逼近前沿水平,但安全差距依然存在

隨著監管機構就日益強大的AI系統(包括OpenAI的GPT-5.6 Sol和Anthropic的Mythos)的治理問題進行辯論,一款中國開源權重模型已顯著縮小了與行業領先者的差距。
根據AI安全非營利組織SaferAI的一份新報告,來自中國的Z.ai的開源AI模型GLM-5.2在網路安全和生物能力方面,僅落後於OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7幾個月。然而,前沿能力與安全實踐之間的差距正在擴大。
SaferAI透過Z.ai的公共API進行的評估顯示,GLM-5.2拒絕了對其分配的所有進攻性網路或兩用生物任務。相比之下,Claude Opus 4.7“拒絕得如此一致,以至於SaferAI根本無法在其上完成CyberGym測試。”(CyberGym是一項評估網路安全能力的基準測試,OpenAI在上個月Hugging Face被入侵前的評估中使用了該測試。)
這凸顯了批評者長期以來的擔憂:開源權重AI模型可能會賦予潛在攻擊者高度先進的技術,一旦權重被下載,便無法對使用情況進行監管。隨著開源權重模型迅速接近領先AI系統的能力,辯論焦點已從它們能否競爭轉向社會如何管理其釋出帶來的風險。
SaferAI執行董事Henry Papadatos對TechCrunch表示:“能力的邊界並非風險的邊界,因此我們必須同時考慮緩解措施的狀態,以正確評估風險。”
雖然Z.ai可以對其託管API應用安全措施,但當使用者在自有硬體上執行權重時,這些保護措施將變得無法執行,允許使用者移除或修改安全護欄、微調模型或更改系統提示。
像OpenAI和Anthropic這樣的前沿開發者通常依賴分類器、拒絕訓練和API級控制等安全措施,以限制危險的網路和生物輔助功能。
這些措施遠非萬無一失:越獄手段 routinely 繞過已部署模型的保護措施。AI安全非營利組織Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中發現了數百種通用越獄手段——定義為在大多數有害請求中都能成功的可重用金鑰。報告指出,當攻擊者結合多種操縱技術(包括角色扮演、冒充權威、偽造對話歷史和後續提示)以利用模型防禦中的弱點時,越獄就會成功。
然而,為封閉模型設計的安全措施在開源權重模型上不起作用,後者旨在在任何基礎設施上執行,無論是否有安全護欄。
Papadatos表示:“目標顯然應該是讓好的能力——即安全的——任何人都可以訪問,然後我們嘗試移除壞的能力,即使是開源方式。”
Papadatos提出的一種技術是“預訓練資料過濾”,即AI公司在基於精選資料集訓練模型之前,從訓練資料中移除有害的網路安全資訊。
一些研究表明,這可以在不損害整體模型效能的情況下減少有害的生物知識。然而,資料過濾在網路安全方面要實用得多。
很難訓練出一個在編碼方面表現出色但不會成為熟練駭客的通用模型。由於編碼是AI最大的收入驅動因素,開發者面臨著增強這些能力並尋求限制濫用方法的壓力。
因此,前沿開發者越來越多地依賴其他緩解措施。一種方法是有選擇地限制模型提供的網路安全輔助型別。例如,根據該模型的系統卡片,Anthropic的Opus 5可以搜尋未編譯原始碼中的漏洞,但不能搜尋編譯後的軟體。其理由是,這使得利用Opus 5進行攻擊變得更加困難。
其他措施包括嚴格的部署前安全評估、釋出風險評估,以及在系統被認為過於危險時扣留模型權重。
在GLM-5.2的情況下,SaferAI指出,Z.ai未釋出該模型的安全框架、部署前測試承諾或風險評估。TechCrunch詢問Z.ai在釋出前是否進行了內部或第三方前沿安全評估,但未收到回覆。
中國領導人越來越承認先進AI的風險。在上個月的全球人工智慧大會上,中國國家主席習近平強調了開源權重模型的重要性,同時強調必須確保AI保持在嚴格的人類控制之下。
斯坦福網路政策中心研究中國AI政策的Graham Webster對TechCrunch表示,中國擁有強大的AI法規,但這些規則歷來側重於政治敏感內容、虛假資訊和社會穩定,而非像進攻性網路能力和生物濫用這樣的災難性AI風險。
Webster表示:“總體而言,美國AI思想家比中國社羣更關注這種存在性災難[想法]。”他補充說,許多中國政策研究人員認為,如果出現新的前沿風險,美國公司可能會首先遇到它。
Webster繼續說道:“中國體制有信心控制這些技術在中國境內的使用。”“在中國上網是與你的真實姓名相關聯的,公司可以承擔責任,使用者也可以承擔責任。”
Webster建議,模型提供商用於拒絕參與某些政治話題的相同機制,可能會被調整以確保模型拒絕執行進攻性網路攻擊或提供不良的生物工程結果。他補充說,由於中國公司經常在幕後與監管機構協調,因此很難知道他們在釋出前進行了哪些內部測試。
開源AI的支持者認為,釋出權重對於網路安全至關重要,因為它允許公司防禦攻擊——Hugging Face依靠GLM-5.2來防禦OpenAI的入侵——並透過了解即將發生的情況幫助他們為未來的威脅做好準備。
Hugging Face執行長Clem Delangue本週在社交媒體帖子中表示:“幫助阻止AI驅動的網路攻擊的同一系統,現在可以幫助每天防禦數百萬次網路攻擊,同時幫助我們識別和修復漏洞,防止攻擊者利用它們。”
Papadatos認為,這種好處往往被誇大,並不能證明“開放危險能力的原始碼”是合理的。
Papadatos說:“我的主要觀點是,我們不應該簡單地接受危險的能力被任何人在任何地方輕易訪問。”他強調,行業應努力使“好的能力”易於訪問。攻擊者採用新工具的速度比防禦者快;例如,勒索軟體組織可以在一週內改變其方法,而醫院則不能。”
相關文章
Hugging Face 正就 130 億美元收購案進行談判
Business Insider 報道,本週末 Hugging Face 被接觸,擬以 130 億美元或更高的估值出售。該初創公司的平臺和開源社羣是開發者與研究人員分享、查詢、測試和部署 AI 模型的地方。Hugging Face 最近成為 OpenAI 旗下某個系統的攻擊目標,該系統在網路安全評估期間突破沙箱限制,入侵了這家初創公司的伺服器。據 Business Insider 稱,目前尚不清楚 Hugging Face 正在與誰進行談判,且尚未達成任何交易。不過,據報道,該初創公司一直在
人工智慧競賽的焦點從前沿領域轉向更廣泛的應用
今年夏天數週以來,人工智慧界聚焦於 Anthropic 的最新前沿模型,以及華盛頓方面對其存取權限的監管努力。然而,儘管關注點仍集中在技術前沿,開發者們卻未等待 Anthropic 或 OpenAI 等大型實驗室的許可,便持續進行開發。今年春季,中國的開放權重模型佔據了 Hugging Face 下載量的 41%,超越了美國競爭對手。在 OpenRouter 平台上,排名前六的模型全都是來自中國企
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
相關專題推薦
評論 (0)
0/500

隨著監管機構就日益強大的AI系統(包括OpenAI的GPT-5.6 Sol和Anthropic的Mythos)的治理問題進行辯論,一款中國開源權重模型已顯著縮小了與行業領先者的差距。
根據AI安全非營利組織SaferAI的一份新報告,來自中國的Z.ai的開源AI模型GLM-5.2在網路安全和生物能力方面,僅落後於OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7幾個月。然而,前沿能力與安全實踐之間的差距正在擴大。
SaferAI透過Z.ai的公共API進行的評估顯示,GLM-5.2拒絕了對其分配的所有進攻性網路或兩用生物任務。相比之下,Claude Opus 4.7“拒絕得如此一致,以至於SaferAI根本無法在其上完成CyberGym測試。”(CyberGym是一項評估網路安全能力的基準測試,OpenAI在上個月Hugging Face被入侵前的評估中使用了該測試。)
這凸顯了批評者長期以來的擔憂:開源權重AI模型可能會賦予潛在攻擊者高度先進的技術,一旦權重被下載,便無法對使用情況進行監管。隨著開源權重模型迅速接近領先AI系統的能力,辯論焦點已從它們能否競爭轉向社會如何管理其釋出帶來的風險。
SaferAI執行董事Henry Papadatos對TechCrunch表示:“能力的邊界並非風險的邊界,因此我們必須同時考慮緩解措施的狀態,以正確評估風險。”
雖然Z.ai可以對其託管API應用安全措施,但當使用者在自有硬體上執行權重時,這些保護措施將變得無法執行,允許使用者移除或修改安全護欄、微調模型或更改系統提示。
像OpenAI和Anthropic這樣的前沿開發者通常依賴分類器、拒絕訓練和API級控制等安全措施,以限制危險的網路和生物輔助功能。
這些措施遠非萬無一失:越獄手段 routinely 繞過已部署模型的保護措施。AI安全非營利組織Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中發現了數百種通用越獄手段——定義為在大多數有害請求中都能成功的可重用金鑰。報告指出,當攻擊者結合多種操縱技術(包括角色扮演、冒充權威、偽造對話歷史和後續提示)以利用模型防禦中的弱點時,越獄就會成功。
然而,為封閉模型設計的安全措施在開源權重模型上不起作用,後者旨在在任何基礎設施上執行,無論是否有安全護欄。
Papadatos表示:“目標顯然應該是讓好的能力——即安全的——任何人都可以訪問,然後我們嘗試移除壞的能力,即使是開源方式。”
Papadatos提出的一種技術是“預訓練資料過濾”,即AI公司在基於精選資料集訓練模型之前,從訓練資料中移除有害的網路安全資訊。
一些研究表明,這可以在不損害整體模型效能的情況下減少有害的生物知識。然而,資料過濾在網路安全方面要實用得多。
很難訓練出一個在編碼方面表現出色但不會成為熟練駭客的通用模型。由於編碼是AI最大的收入驅動因素,開發者面臨著增強這些能力並尋求限制濫用方法的壓力。
因此,前沿開發者越來越多地依賴其他緩解措施。一種方法是有選擇地限制模型提供的網路安全輔助型別。例如,根據該模型的系統卡片,Anthropic的Opus 5可以搜尋未編譯原始碼中的漏洞,但不能搜尋編譯後的軟體。其理由是,這使得利用Opus 5進行攻擊變得更加困難。
其他措施包括嚴格的部署前安全評估、釋出風險評估,以及在系統被認為過於危險時扣留模型權重。
在GLM-5.2的情況下,SaferAI指出,Z.ai未釋出該模型的安全框架、部署前測試承諾或風險評估。TechCrunch詢問Z.ai在釋出前是否進行了內部或第三方前沿安全評估,但未收到回覆。
中國領導人越來越承認先進AI的風險。在上個月的全球人工智慧大會上,中國國家主席習近平強調了開源權重模型的重要性,同時強調必須確保AI保持在嚴格的人類控制之下。
斯坦福網路政策中心研究中國AI政策的Graham Webster對TechCrunch表示,中國擁有強大的AI法規,但這些規則歷來側重於政治敏感內容、虛假資訊和社會穩定,而非像進攻性網路能力和生物濫用這樣的災難性AI風險。
Webster表示:“總體而言,美國AI思想家比中國社羣更關注這種存在性災難[想法]。”他補充說,許多中國政策研究人員認為,如果出現新的前沿風險,美國公司可能會首先遇到它。
Webster繼續說道:“中國體制有信心控制這些技術在中國境內的使用。”“在中國上網是與你的真實姓名相關聯的,公司可以承擔責任,使用者也可以承擔責任。”
Webster建議,模型提供商用於拒絕參與某些政治話題的相同機制,可能會被調整以確保模型拒絕執行進攻性網路攻擊或提供不良的生物工程結果。他補充說,由於中國公司經常在幕後與監管機構協調,因此很難知道他們在釋出前進行了哪些內部測試。
開源AI的支持者認為,釋出權重對於網路安全至關重要,因為它允許公司防禦攻擊——Hugging Face依靠GLM-5.2來防禦OpenAI的入侵——並透過了解即將發生的情況幫助他們為未來的威脅做好準備。
Hugging Face執行長Clem Delangue本週在社交媒體帖子中表示:“幫助阻止AI驅動的網路攻擊的同一系統,現在可以幫助每天防禦數百萬次網路攻擊,同時幫助我們識別和修復漏洞,防止攻擊者利用它們。”
Papadatos認為,這種好處往往被誇大,並不能證明“開放危險能力的原始碼”是合理的。
Papadatos說:“我的主要觀點是,我們不應該簡單地接受危險的能力被任何人在任何地方輕易訪問。”他強調,行業應努力使“好的能力”易於訪問。攻擊者採用新工具的速度比防禦者快;例如,勒索軟體組織可以在一週內改變其方法,而醫院則不能。”
Hugging Face 正就 130 億美元收購案進行談判
Business Insider 報道,本週末 Hugging Face 被接觸,擬以 130 億美元或更高的估值出售。該初創公司的平臺和開源社羣是開發者與研究人員分享、查詢、測試和部署 AI 模型的地方。Hugging Face 最近成為 OpenAI 旗下某個系統的攻擊目標,該系統在網路安全評估期間突破沙箱限制,入侵了這家初創公司的伺服器。據 Business Insider 稱,目前尚不清楚 Hugging Face 正在與誰進行談判,且尚未達成任何交易。不過,據報道,該初創公司一直在
人工智慧競賽的焦點從前沿領域轉向更廣泛的應用
今年夏天數週以來,人工智慧界聚焦於 Anthropic 的最新前沿模型,以及華盛頓方面對其存取權限的監管努力。然而,儘管關注點仍集中在技術前沿,開發者們卻未等待 Anthropic 或 OpenAI 等大型實驗室的許可,便持續進行開發。今年春季,中國的開放權重模型佔據了 Hugging Face 下載量的 41%,超越了美國競爭對手。在 OpenRouter 平台上,排名前六的模型全都是來自中國企
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






