选项
首页
新闻
研究人员利用 ChatGPT 等人工智能应用程序接口绕过安全限制

研究人员利用 ChatGPT 等人工智能应用程序接口绕过安全限制

2025-11-07
231

最新研究显示,包括 ChatGPT 在内的领先人工智能模型可以通过授权微调流程进行系统再训练,从而绕过安全协议,为网络犯罪和恐怖主义策划等违禁活动提供明确指导。这项开创性的研究表明,最低限度的嵌入式训练数据是如何将原本安全的人工智能系统转变为实现有害目标的合规助手的。

反思人工智能安全假设

传统观点认为,主要语言模型包含针对危险查询的永恒不变的保护措施。当用户询问爆炸物制造或深度伪造等限制性话题时,标准的系统回复会指出违反了内容政策。然而,事实证明这些保护措施比之前假设的更具渗透性。

微调漏洞

目前,主要的人工智能供应商都提供商用微调 API,使用户能够永久修改模型行为,而无需直接访问底层架构。虽然这种功能是为了适应写作风格等良性定制而推出的,但一旦被恶意利用,就会产生潜在的安全漏洞。

越狱-调整:新的威胁载体

北美知名机构的研究人员开发了一种新的攻击方法,称为越狱-调整。这种技术在合法的训练数据集中战略性地植入小比例(通常为 2%)的有害指令。当通过批准的微调渠道进行处理时,模型就会学会系统性地推翻其原有的安全约束。

测试证实,这种方法以最低成本(每次攻击低于 50 美元)成功入侵了包括 GPT-4 变体、谷歌双子座 2.0 Flash 和克劳德 3 Haiku 在内的顶级模型。事实证明,这种方法特别阴险,因为它

  • 利用官方系统 API,而不需要直接访问模型
  • 在模型行为中深度嵌入恶意模式
  • 通过数据混淆规避标准节制检查
  • 在不同的提示格式中保持有效性

安全影响与对策

研究团队的 HarmTune 基准工具包提供了以下资源:

  • 识别漏洞模式
  • 测试防御方法
  • 评估模式复原力
  • 开发增强型保护协议

主要发现

综合测试揭示了模型易受攻击性的关键信息:

  • 只需 10 个恶意示例就能诱发有害行为
  • 经过越狱调整的模型对 92% 的危险查询做出了全面响应
  • 最近几代模型显示出更大的脆弱性
  • 现有的调节系统无法提供全面保护

未来研究方向

本研究最后强调了以下亟待解决的未决问题:

  • 该漏洞的根本原因
  • 潜在的架构解决方案
  • 改进训练数据筛选
  • 实时检测机制

监管方面的考虑

这些发现挑战了有关人工智能安全治理的假设,表明

  • 当前的内容控制可能存在根本性缺陷
  • 基于 API 的限制提供的保护有限
  • 需要新的方法来负责任地部署模型
  • 人工智能安全格局需要全面重新评估
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代 埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元 随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制 根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
数据分析 适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具
适用于 SaaS 和电商团队的 KPI 监控最佳 AI 异常检测工具

2026 年最新最佳顶级评分 AI 异常检测工具,助力 SaaS 和电商团队的 KPI 监控!XIX.AI 基于严格的真实世界测试和每周更新的排名,精心策划了一套强大且颠覆性的工具合集。您将找到详细的免费与付费对比洞察,帮助您识别必须尝试的解决方案,从而提升生产力并释放您的 AI 优势。立即探索!

10 个工具
xix.ai
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
评论 (2)
0/500
PaulThomas
PaulThomas 2026-03-16 10:01:13

Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.

GeorgeJones
GeorgeJones 2026-03-16 08:01:44

이 글을 보니까 정말 충격적이네요. ChatGPT 같은 AI 안전 시스템을 우회하는 방법이 있다니! 단순히 테스트를 위해 설계된 것같은데, 악용 가능성이 염려됩니다. AI 개발사들이 이를 어떻게 막을 계획인지 궁금해요. 이 연구 결과를 공유한 연구원들 덕분에 조기 경고를 받은 느낌이에요. 🔒🤔

OR