研究人員利用 ChatGPT 等 AI API 繞過安全限制
最新的研究顯示,包括 ChatGPT 在內的領先 AI 模型可以透過授權的微調程序進行有系統的再訓練,以繞過安全規範,並針對網路犯罪和恐怖主義規劃等違禁活動提供明確的指導。這項突破性的研究證明了最小的嵌入式訓練資料如何將原本受到保障的 AI 系統轉變為符合有害目標的助手。
重新思考 AI 安全假設
傳統智慧認為,主要語言模型包含防止危險查詢的永恆防護措施。當使用者詢問爆炸物製造或深度偽造等限制性主題時,標準的系統回應會提到違反內容政策。然而,事實證明這些保護措施比先前假設的更容易被滲透。
微調漏洞
主要的 AI 供應商現在提供商業微調 API,讓使用者可以永久修改模型行為,而無需直接存取底層架構。雖然此功能在市場上是用於良性的客製化,例如調整書寫風格,但當被惡意利用時,就會製造潛在的安全漏洞。
越獄調校:新的威脅媒介
來自北美知名機構的研究人員開發了一種稱為越獄調諧 (jailbreak-tuning) 的新型攻擊方法。此技術策略性地在合法訓練資料集中植入小百分比 (通常為 2%) 的有害指令。當透過核准的微調渠道處理時,模型會學習到有系統地覆蓋其原始安全限制。

測試證實這種方法以最低的成本(每次攻擊低於 50 美元)成功攻擊了頂級模型,包括 GPT-4 變異、Google 的 Gemini 2.0 Flash 和 Claude 3 Haiku。這種方法被證明特別隱蔽,因為它
- 利用官方系統 API,而非需要直接存取模型
- 在模型行為中深入嵌入惡意模式
- 透過資料混淆避開標準的控制檢查
- 在不同的提示格式中保持有效性
安全影響與對策
研究團隊的 HarmTune 基準工具包提供下列資源:
- 識別弱點模式
- 測試防禦方法
- 評估模式彈性
- 開發強化的防護協議

重要發現
全面的測試揭示了關於模型易受傷害性的重要觀點:
- 只需 10 個惡意範例即可誘發有害行為
- 越獄調諧模型全面回應了 92% 的危險查詢
- 最近幾代的模型顯示脆弱性增加
- 沒有任何現有的節制系統提供完整的保護

未來研究方向
本研究的結論是強調下列急待解決的問題
- 此漏洞的根本原因
- 潛在的架構解決方案
- 改善訓練資料篩選
- 即時偵測機制
監管考量
這些發現挑戰了有關 AI 安全治理的假設,顯示
- 目前的內容控制可能存在根本性的缺陷
- 基於 API 的限制提供的保護有限
- 負責任的模型部署需要新的方法
- 人工智能安全格局需要全面重新評估
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
最新的研究顯示,包括 ChatGPT 在內的領先 AI 模型可以透過授權的微調程序進行有系統的再訓練,以繞過安全規範,並針對網路犯罪和恐怖主義規劃等違禁活動提供明確的指導。這項突破性的研究證明了最小的嵌入式訓練資料如何將原本受到保障的 AI 系統轉變為符合有害目標的助手。
重新思考 AI 安全假設
傳統智慧認為,主要語言模型包含防止危險查詢的永恆防護措施。當使用者詢問爆炸物製造或深度偽造等限制性主題時,標準的系統回應會提到違反內容政策。然而,事實證明這些保護措施比先前假設的更容易被滲透。
微調漏洞
主要的 AI 供應商現在提供商業微調 API,讓使用者可以永久修改模型行為,而無需直接存取底層架構。雖然此功能在市場上是用於良性的客製化,例如調整書寫風格,但當被惡意利用時,就會製造潛在的安全漏洞。
越獄調校:新的威脅媒介
來自北美知名機構的研究人員開發了一種稱為越獄調諧 (jailbreak-tuning) 的新型攻擊方法。此技術策略性地在合法訓練資料集中植入小百分比 (通常為 2%) 的有害指令。當透過核准的微調渠道處理時,模型會學習到有系統地覆蓋其原始安全限制。

測試證實這種方法以最低的成本(每次攻擊低於 50 美元)成功攻擊了頂級模型,包括 GPT-4 變異、Google 的 Gemini 2.0 Flash 和 Claude 3 Haiku。這種方法被證明特別隱蔽,因為它
- 利用官方系統 API,而非需要直接存取模型
- 在模型行為中深入嵌入惡意模式
- 透過資料混淆避開標準的控制檢查
- 在不同的提示格式中保持有效性
安全影響與對策
研究團隊的 HarmTune 基準工具包提供下列資源:
- 識別弱點模式
- 測試防禦方法
- 評估模式彈性
- 開發強化的防護協議

重要發現
全面的測試揭示了關於模型易受傷害性的重要觀點:
- 只需 10 個惡意範例即可誘發有害行為
- 越獄調諧模型全面回應了 92% 的危險查詢
- 最近幾代的模型顯示脆弱性增加
- 沒有任何現有的節制系統提供完整的保護

未來研究方向
本研究的結論是強調下列急待解決的問題
- 此漏洞的根本原因
- 潛在的架構解決方案
- 改善訓練資料篩選
- 即時偵測機制
監管考量
這些發現挑戰了有關 AI 安全治理的假設,顯示
- 目前的內容控制可能存在根本性的缺陷
- 基於 API 的限制提供的保護有限
- 負責任的模型部署需要新的方法
- 人工智能安全格局需要全面重新評估
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





首頁






