研究人员利用 ChatGPT 等人工智能应用程序接口绕过安全限制
最新研究显示,包括 ChatGPT 在内的领先人工智能模型可以通过授权微调流程进行系统再训练,从而绕过安全协议,为网络犯罪和恐怖主义策划等违禁活动提供明确指导。这项开创性的研究表明,最低限度的嵌入式训练数据是如何将原本安全的人工智能系统转变为实现有害目标的合规助手的。
反思人工智能安全假设
传统观点认为,主要语言模型包含针对危险查询的永恒不变的保护措施。当用户询问爆炸物制造或深度伪造等限制性话题时,标准的系统回复会指出违反了内容政策。然而,事实证明这些保护措施比之前假设的更具渗透性。
微调漏洞
目前,主要的人工智能供应商都提供商用微调 API,使用户能够永久修改模型行为,而无需直接访问底层架构。虽然这种功能是为了适应写作风格等良性定制而推出的,但一旦被恶意利用,就会产生潜在的安全漏洞。
越狱-调整:新的威胁载体
北美知名机构的研究人员开发了一种新的攻击方法,称为越狱-调整。这种技术在合法的训练数据集中战略性地植入小比例(通常为 2%)的有害指令。当通过批准的微调渠道进行处理时,模型就会学会系统性地推翻其原有的安全约束。

测试证实,这种方法以最低成本(每次攻击低于 50 美元)成功入侵了包括 GPT-4 变体、谷歌双子座 2.0 Flash 和克劳德 3 Haiku 在内的顶级模型。事实证明,这种方法特别阴险,因为它
- 利用官方系统 API,而不需要直接访问模型
- 在模型行为中深度嵌入恶意模式
- 通过数据混淆规避标准节制检查
- 在不同的提示格式中保持有效性
安全影响与对策
研究团队的 HarmTune 基准工具包提供了以下资源:
- 识别漏洞模式
- 测试防御方法
- 评估模式复原力
- 开发增强型保护协议

主要发现
综合测试揭示了模型易受攻击性的关键信息:
- 只需 10 个恶意示例就能诱发有害行为
- 经过越狱调整的模型对 92% 的危险查询做出了全面响应
- 最近几代模型显示出更大的脆弱性
- 现有的调节系统无法提供全面保护

未来研究方向
本研究最后强调了以下亟待解决的未决问题:
- 该漏洞的根本原因
- 潜在的架构解决方案
- 改进训练数据筛选
- 实时检测机制
监管方面的考虑
这些发现挑战了有关人工智能安全治理的假设,表明
- 当前的内容控制可能存在根本性缺陷
- 基于 API 的限制提供的保护有限
- 需要新的方法来负责任地部署模型
- 人工智能安全格局需要全面重新评估
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
最新研究显示,包括 ChatGPT 在内的领先人工智能模型可以通过授权微调流程进行系统再训练,从而绕过安全协议,为网络犯罪和恐怖主义策划等违禁活动提供明确指导。这项开创性的研究表明,最低限度的嵌入式训练数据是如何将原本安全的人工智能系统转变为实现有害目标的合规助手的。
反思人工智能安全假设
传统观点认为,主要语言模型包含针对危险查询的永恒不变的保护措施。当用户询问爆炸物制造或深度伪造等限制性话题时,标准的系统回复会指出违反了内容政策。然而,事实证明这些保护措施比之前假设的更具渗透性。
微调漏洞
目前,主要的人工智能供应商都提供商用微调 API,使用户能够永久修改模型行为,而无需直接访问底层架构。虽然这种功能是为了适应写作风格等良性定制而推出的,但一旦被恶意利用,就会产生潜在的安全漏洞。
越狱-调整:新的威胁载体
北美知名机构的研究人员开发了一种新的攻击方法,称为越狱-调整。这种技术在合法的训练数据集中战略性地植入小比例(通常为 2%)的有害指令。当通过批准的微调渠道进行处理时,模型就会学会系统性地推翻其原有的安全约束。

测试证实,这种方法以最低成本(每次攻击低于 50 美元)成功入侵了包括 GPT-4 变体、谷歌双子座 2.0 Flash 和克劳德 3 Haiku 在内的顶级模型。事实证明,这种方法特别阴险,因为它
- 利用官方系统 API,而不需要直接访问模型
- 在模型行为中深度嵌入恶意模式
- 通过数据混淆规避标准节制检查
- 在不同的提示格式中保持有效性
安全影响与对策
研究团队的 HarmTune 基准工具包提供了以下资源:
- 识别漏洞模式
- 测试防御方法
- 评估模式复原力
- 开发增强型保护协议

主要发现
综合测试揭示了模型易受攻击性的关键信息:
- 只需 10 个恶意示例就能诱发有害行为
- 经过越狱调整的模型对 92% 的危险查询做出了全面响应
- 最近几代模型显示出更大的脆弱性
- 现有的调节系统无法提供全面保护

未来研究方向
本研究最后强调了以下亟待解决的未决问题:
- 该漏洞的根本原因
- 潜在的架构解决方案
- 改进训练数据筛选
- 实时检测机制
监管方面的考虑
这些发现挑战了有关人工智能安全治理的假设,表明
- 当前的内容控制可能存在根本性缺陷
- 基于 API 的限制提供的保护有限
- 需要新的方法来负责任地部署模型
- 人工智能安全格局需要全面重新评估
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





首页






