AI 护栏抑制了进攻性网络安全研究人员

数月来,AI领域的领导者们实施了严格的审查协议和安全护栏,以防止恶意行为者利用他们的模型。然而,这些限制现在正在阻碍合法的网络安全防御者和进攻性网络安全研究人员。
今年6月,美国政府禁止出口Anthropic备受期待的AI模型Mythos和Fable。这一决定部分源于有关报告,指出这些模型防止协助网络攻击的安全措施可能被绕过。
无论该事件是否真正由越狱担忧引发,Anthropic始终将Mythos定位为一种强大的网络工具,仅向经过严格审查的用户在严格限制下开放。(注:Fable 5和Mythos 5的出口管制随后已解除。Fable 5于7月1日重新面向公众开放,而Mythos 5已作为政府审查过程的一部分,重新仅向经过审查的美国组织提供。)
这种把关方式并非Mythos独有。Anthropic和OpenAI都为网络安全研究人员提供了申请经过审查的访问权限的项目,如果获得批准,他们将获得具有较少网络安全限制的模型:OpenAI的“网络安全可信访问”和Anthropic的“网络安全验证计划”。
这些护栏受到了广泛批评,特别是那些负责在犯罪分子之前识别未知系统漏洞并开发利用程序的研究人员。
在最近的一次网络安全播客节目中,著名安全研究人员Mark Dowd表示:“让我感到不舒服的是,这些随机的大型公司正在就什么是安全、什么是不安全做出武断的决定。”
Dowd花了数十年时间发现并出售“零日漏洞”——即以前未知的软件缺陷及其利用程序——给西方政府,而不是向软件供应商报告以进行修补。政府为这些漏洞支付高额费用,因为它们未被公开,这对情报行动有价值。
Dowd承认他的工作可能会引入偏见,但他并不孤单。几名从事进攻性网络安全的专业人士,他们主动探测系统弱点,向TechCrunch描述了他们如何利用AI工具并应对这些护栏。
NCC Group这家安全咨询巨头的首席科学家Chris Anley解释说,要求AI模型尝试利用一个漏洞是确认它确实是值得修复的真实漏洞的关键步骤。然而,他指出,如果护栏导致模型完全拒绝请求,这会阻碍防御者。
“这就是整个攻防和护栏部分发挥作用的地方,因为‘修复这段代码’作为提示,既是防御的必要机制,也是查找代码库中关键漏洞的路线图,”Anley说。“因此,同时,同一个工具既是进攻工具也是防御工具,这两者实际上无法分开。”
他继续说道:“这就像一把锤子。没有锤子你就无法建造房屋。它肯定是一个工具,但同时也是不可简化的武器。”
遇到此类障碍时,他和他的同事有时会转向没有任何护栏的开源AI模型。
CrowdFense的首席技术官Paolo Stagno是一家知名公司,该公司开发、收购并向政府机构出售未知漏洞,他同意Dowd的观点,指出AI公司通过其审查计划和护栏“基本上将客户视为需要照看的儿童”。
Stagno提到,他和他的团队使用前沿模型进行逆向工程,但避免使用AI来查找漏洞或构建利用程序。将此类工作输入基于云端的模型存在泄露敏感漏洞数据或被吸收进未来训练运行的风险。对于这些任务,他使用本地运行的开源模型以避免与外部共享数据。
发现零日漏洞并开发利用程序的安全研究人员Giuseppe Cali表示,护栏并没有阻碍他的工作。这是因为他不将AI用于进攻目的;相反,他使用AI进行初始逆向工程,以理解正在分析的代码并构建支持工具。他指出,AI工具加速了这一过程,使他能够专注于发现漏洞。
“我仍然希望亲自掌握实际的漏洞发现和武器化,即使明天所有护栏都被解除,这也不会改变,”Cali说。“我嫉妒我的漏洞,而且我太喜欢这个游戏,不会让模型替我玩。”
一家智能手机零部件制造商的一名研究人员,在要求匿名的情况下表示,因为他未被授权接受媒体采访,他的雇主并非Anthropic CVP计划的一部分。因此,由于过于严格的护栏,其工具在查找漏洞方面几乎无用。
“如果它察觉到我们在做任何与安全相关的事情,它就会停止并且无法使用,”该人士说。
网络安全公司RemoteThreat的首席执行官、专注于进攻性安全和AI的活动Offensive AI Con的创始人Chris Thompson指出,根据他对前沿AI模型的经验,护栏是不一致的,并且每天表现不同。即使在Anthropic和OpenAI更宽松的审查计划范围内也是如此。
“我认为实际影响是你花大量时间与模型协商,而不是专注于核心安全项目,”Thompson说。“与其分析漏洞并推理其可利用性,你却在试图找出为什么结果不一致,或者为什么模型过度清理输出。”
因此,研究人员越来越多地依赖或被推向中国的开源模型,如GLM——这些可免费下载的模型可以在本地运行,无需审查或使用限制,据Thompson所述。
“你看到这些负责任的研究人员被从美国管理的系统推向外国拥有的系统,”他说。“我认为设置这些护栏弊大于利。”
Thompson敦促AI前沿实验室不要进一步收紧限制,而是开放其项目,提供负责任的访问,并对滥用其工具的人追究责任。否则,他认为,防御者将失去AI竞赛。
“一场大风暴即将来临。一股前所未有的速度和规模的攻击浪潮即将发生,”Thompson说。“但正是那些试图有所作为的安全咨询公司以及合法研究人员,目前正受到压制。”
相关文章
OpenAI 与 Yubico 合作,通过硬件密钥增强 GPT-5.6 的安全性
Yubico首席执行官杰罗德·张 | 图片来源:YubicoOpenAI即将推出的GPT-5.6将从9月起强制要求使用硬件支持的通行密钥,Yubico首席执行官杰罗德·张表示,此举证实了其产品是防范账户被盗的首选解决方案。OpenAI 已推出 GPT-5.6 系列模型,声称这些模型在提供前沿级 AI 性能的同时,运行时的令牌消耗更少。该公告为加入 OpenAI“网络可信访问”(TAC)计划的个人成
OpenAI 牵头推动100个签署方共同推进网络防御
OpenAI的公开信开篇指出:“我们只有有限的时间窗口来加强网络防御。” 图片来源:Getty Images包括亚马逊云服务(AWS)、谷歌和微软在内的多家科技巨头敦促各国政府为防御工具提供资金支持,而批评者则指责这份宣言是出于私利随着人工智能模型在攻击和保护数字系统方面的能力日益增强,超过100家科技、网络安全和金融服务机构已与OpenAI联名发表公开信,呼吁全球立即大幅加强网络防御。这封公开信
Anthropic让AI代理参与共享任务,引发内部竞争
当人工智能代理相互对抗时会发生什么?Anthropic最近的测试表明,局面可能会迅速陷入混乱。周四,Anthropic旗下的Frontier Red Team发布了一项新研究,分析了当一群人工智能代理在现实环境中相遇时如何相互作用。这些发现为组织和政府在共享代码库、金融市场及计算机系统中部署自主代理所面临的潜在风险提供了洞见。在一项实验中,Anthropic 让三个 Claude 智能体访问同一个
相关专题推荐
评论 (0)
0/500

数月来,AI领域的领导者们实施了严格的审查协议和安全护栏,以防止恶意行为者利用他们的模型。然而,这些限制现在正在阻碍合法的网络安全防御者和进攻性网络安全研究人员。
今年6月,美国政府禁止出口Anthropic备受期待的AI模型Mythos和Fable。这一决定部分源于有关报告,指出这些模型防止协助网络攻击的安全措施可能被绕过。
无论该事件是否真正由越狱担忧引发,Anthropic始终将Mythos定位为一种强大的网络工具,仅向经过严格审查的用户在严格限制下开放。(注:Fable 5和Mythos 5的出口管制随后已解除。Fable 5于7月1日重新面向公众开放,而Mythos 5已作为政府审查过程的一部分,重新仅向经过审查的美国组织提供。)
这种把关方式并非Mythos独有。Anthropic和OpenAI都为网络安全研究人员提供了申请经过审查的访问权限的项目,如果获得批准,他们将获得具有较少网络安全限制的模型:OpenAI的“网络安全可信访问”和Anthropic的“网络安全验证计划”。
这些护栏受到了广泛批评,特别是那些负责在犯罪分子之前识别未知系统漏洞并开发利用程序的研究人员。
在最近的一次网络安全播客节目中,著名安全研究人员Mark Dowd表示:“让我感到不舒服的是,这些随机的大型公司正在就什么是安全、什么是不安全做出武断的决定。”
Dowd花了数十年时间发现并出售“零日漏洞”——即以前未知的软件缺陷及其利用程序——给西方政府,而不是向软件供应商报告以进行修补。政府为这些漏洞支付高额费用,因为它们未被公开,这对情报行动有价值。
Dowd承认他的工作可能会引入偏见,但他并不孤单。几名从事进攻性网络安全的专业人士,他们主动探测系统弱点,向TechCrunch描述了他们如何利用AI工具并应对这些护栏。
NCC Group这家安全咨询巨头的首席科学家Chris Anley解释说,要求AI模型尝试利用一个漏洞是确认它确实是值得修复的真实漏洞的关键步骤。然而,他指出,如果护栏导致模型完全拒绝请求,这会阻碍防御者。
“这就是整个攻防和护栏部分发挥作用的地方,因为‘修复这段代码’作为提示,既是防御的必要机制,也是查找代码库中关键漏洞的路线图,”Anley说。“因此,同时,同一个工具既是进攻工具也是防御工具,这两者实际上无法分开。”
他继续说道:“这就像一把锤子。没有锤子你就无法建造房屋。它肯定是一个工具,但同时也是不可简化的武器。”
遇到此类障碍时,他和他的同事有时会转向没有任何护栏的开源AI模型。
CrowdFense的首席技术官Paolo Stagno是一家知名公司,该公司开发、收购并向政府机构出售未知漏洞,他同意Dowd的观点,指出AI公司通过其审查计划和护栏“基本上将客户视为需要照看的儿童”。
Stagno提到,他和他的团队使用前沿模型进行逆向工程,但避免使用AI来查找漏洞或构建利用程序。将此类工作输入基于云端的模型存在泄露敏感漏洞数据或被吸收进未来训练运行的风险。对于这些任务,他使用本地运行的开源模型以避免与外部共享数据。
发现零日漏洞并开发利用程序的安全研究人员Giuseppe Cali表示,护栏并没有阻碍他的工作。这是因为他不将AI用于进攻目的;相反,他使用AI进行初始逆向工程,以理解正在分析的代码并构建支持工具。他指出,AI工具加速了这一过程,使他能够专注于发现漏洞。
“我仍然希望亲自掌握实际的漏洞发现和武器化,即使明天所有护栏都被解除,这也不会改变,”Cali说。“我嫉妒我的漏洞,而且我太喜欢这个游戏,不会让模型替我玩。”
一家智能手机零部件制造商的一名研究人员,在要求匿名的情况下表示,因为他未被授权接受媒体采访,他的雇主并非Anthropic CVP计划的一部分。因此,由于过于严格的护栏,其工具在查找漏洞方面几乎无用。
“如果它察觉到我们在做任何与安全相关的事情,它就会停止并且无法使用,”该人士说。
网络安全公司RemoteThreat的首席执行官、专注于进攻性安全和AI的活动Offensive AI Con的创始人Chris Thompson指出,根据他对前沿AI模型的经验,护栏是不一致的,并且每天表现不同。即使在Anthropic和OpenAI更宽松的审查计划范围内也是如此。
“我认为实际影响是你花大量时间与模型协商,而不是专注于核心安全项目,”Thompson说。“与其分析漏洞并推理其可利用性,你却在试图找出为什么结果不一致,或者为什么模型过度清理输出。”
因此,研究人员越来越多地依赖或被推向中国的开源模型,如GLM——这些可免费下载的模型可以在本地运行,无需审查或使用限制,据Thompson所述。
“你看到这些负责任的研究人员被从美国管理的系统推向外国拥有的系统,”他说。“我认为设置这些护栏弊大于利。”
Thompson敦促AI前沿实验室不要进一步收紧限制,而是开放其项目,提供负责任的访问,并对滥用其工具的人追究责任。否则,他认为,防御者将失去AI竞赛。
“一场大风暴即将来临。一股前所未有的速度和规模的攻击浪潮即将发生,”Thompson说。“但正是那些试图有所作为的安全咨询公司以及合法研究人员,目前正受到压制。”
OpenAI 与 Yubico 合作,通过硬件密钥增强 GPT-5.6 的安全性
Yubico首席执行官杰罗德·张 | 图片来源:YubicoOpenAI即将推出的GPT-5.6将从9月起强制要求使用硬件支持的通行密钥,Yubico首席执行官杰罗德·张表示,此举证实了其产品是防范账户被盗的首选解决方案。OpenAI 已推出 GPT-5.6 系列模型,声称这些模型在提供前沿级 AI 性能的同时,运行时的令牌消耗更少。该公告为加入 OpenAI“网络可信访问”(TAC)计划的个人成
OpenAI 牵头推动100个签署方共同推进网络防御
OpenAI的公开信开篇指出:“我们只有有限的时间窗口来加强网络防御。” 图片来源:Getty Images包括亚马逊云服务(AWS)、谷歌和微软在内的多家科技巨头敦促各国政府为防御工具提供资金支持,而批评者则指责这份宣言是出于私利随着人工智能模型在攻击和保护数字系统方面的能力日益增强,超过100家科技、网络安全和金融服务机构已与OpenAI联名发表公开信,呼吁全球立即大幅加强网络防御。这封公开信
Anthropic让AI代理参与共享任务,引发内部竞争
当人工智能代理相互对抗时会发生什么?Anthropic最近的测试表明,局面可能会迅速陷入混乱。周四,Anthropic旗下的Frontier Red Team发布了一项新研究,分析了当一群人工智能代理在现实环境中相遇时如何相互作用。这些发现为组织和政府在共享代码库、金融市场及计算机系统中部署自主代理所面临的潜在风险提供了洞见。在一项实验中,Anthropic 让三个 Claude 智能体访问同一个





首页






