开放权重AI模型在性能上逐渐逼近前沿水平,但安全差距依然存在

随着监管机构就日益强大的AI系统(包括OpenAI的GPT-5.6 Sol和Anthropic的Mythos)的治理问题进行辩论,一款中国开源权重模型已显著缩小了与行业领先者的差距。
根据AI安全非营利组织SaferAI的一份新报告,来自中国的Z.ai的开源AI模型GLM-5.2在网络安全和生物能力方面,仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。然而,前沿能力与安全实践之间的差距正在扩大。
SaferAI通过Z.ai的公共API进行的评估显示,GLM-5.2拒绝了对其分配的所有进攻性网络或两用生物任务。相比之下,Claude Opus 4.7“拒绝得如此一致,以至于SaferAI根本无法在其上完成CyberGym测试。”(CyberGym是一项评估网络安全能力的基准测试,OpenAI在上个月Hugging Face被入侵前的评估中使用了该测试。)
这凸显了批评者长期以来的担忧:开源权重AI模型可能会赋予潜在攻击者高度先进的技术,一旦权重被下载,便无法对使用情况进行监管。随着开源权重模型迅速接近领先AI系统的能力,辩论焦点已从它们能否竞争转向社会如何管理其发布带来的风险。
SaferAI执行董事Henry Papadatos对TechCrunch表示:“能力的边界并非风险的边界,因此我们必须同时考虑缓解措施的状态,以正确评估风险。”
虽然Z.ai可以对其托管API应用安全措施,但当用户在自有硬件上运行权重时,这些保护措施将变得无法执行,允许用户移除或修改安全护栏、微调模型或更改系统提示。
像OpenAI和Anthropic这样的前沿开发者通常依赖分类器、拒绝训练和API级控制等安全措施,以限制危险的网络和生物辅助功能。
这些措施远非万无一失:越狱手段 routinely 绕过已部署模型的保护措施。AI安全非营利组织Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中发现了数百种通用越狱手段——定义为在大多数有害请求中都能成功的可重用密钥。报告指出,当攻击者结合多种操纵技术(包括角色扮演、冒充权威、伪造对话历史和后续提示)以利用模型防御中的弱点时,越狱就会成功。
然而,为封闭模型设计的安全措施在开源权重模型上不起作用,后者旨在在任何基础设施上运行,无论是否有安全护栏。
Papadatos表示:“目标显然应该是让好的能力——即安全的——任何人都可以访问,然后我们尝试移除坏的能力,即使是开源方式。”
Papadatos提出的一种技术是“预训练数据过滤”,即AI公司在基于精选数据集训练模型之前,从训练数据中移除有害的网络安全信息。
一些研究表明,这可以在不损害整体模型性能的情况下减少有害的生物知识。然而,数据过滤在网络安全方面要实用得多。
很难训练出一个在编码方面表现出色但不会成为熟练黑客的通用模型。由于编码是AI最大的收入驱动因素,开发者面临着增强这些能力并寻求限制滥用方法的压力。
因此,前沿开发者越来越多地依赖其他缓解措施。一种方法是有选择地限制模型提供的网络安全辅助类型。例如,根据该模型的系统卡片,Anthropic的Opus 5可以搜索未编译源代码中的漏洞,但不能搜索编译后的软件。其理由是,这使得利用Opus 5进行攻击变得更加困难。
其他措施包括严格的部署前安全评估、发布风险评估,以及在系统被认为过于危险时扣留模型权重。
在GLM-5.2的情况下,SaferAI指出,Z.ai未发布该模型的安全框架、部署前测试承诺或风险评估。TechCrunch询问Z.ai在发布前是否进行了内部或第三方前沿安全评估,但未收到回复。
中国领导人越来越承认先进AI的风险。在上个月的全球人工智能大会上,中国国家主席习近平强调了开源权重模型的重要性,同时强调必须确保AI保持在严格的人类控制之下。
斯坦福网络政策中心研究中国AI政策的Graham Webster对TechCrunch表示,中国拥有强大的AI法规,但这些规则历来侧重于政治敏感内容、虚假信息和社会稳定,而非像进攻性网络能力和生物滥用这样的灾难性AI风险。
Webster表示:“总体而言,美国AI思想家比中国社区更关注这种存在性灾难[想法]。”他补充说,许多中国政策研究人员认为,如果出现新的前沿风险,美国公司可能会首先遇到它。
Webster继续说道:“中国体制有信心控制这些技术在中国境内的使用。”“在中国上网是与你的真实姓名相关联的,公司可以承担责任,用户也可以承担责任。”
Webster建议,模型提供商用于拒绝参与某些政治话题的相同机制,可能会被调整以确保模型拒绝执行进攻性网络攻击或提供不良的生物工程结果。他补充说,由于中国公司经常在幕后与监管机构协调,因此很难知道他们在发布前进行了哪些内部测试。
开源AI的支持者认为,发布权重对于网络安全至关重要,因为它允许公司防御攻击——Hugging Face依靠GLM-5.2来防御OpenAI的入侵——并通过了解即将发生的情况帮助他们为未来的威胁做好准备。
Hugging Face首席执行官Clem Delangue本周在社交媒体帖子中表示:“帮助阻止AI驱动的网络攻击的同一系统,现在可以帮助每天防御数百万次网络攻击,同时帮助我们识别和修复漏洞,防止攻击者利用它们。”
Papadatos认为,这种好处往往被夸大,并不能证明“开放危险能力的源代码”是合理的。
Papadatos说:“我的主要观点是,我们不应该简单地接受危险的能力被任何人在任何地方轻易访问。”他强调,行业应努力使“好的能力”易于访问。攻击者采用新工具的速度比防御者快;例如,勒索软件组织可以在一周内改变其方法,而医院则不能。”
相关文章
Hugging Face 正就 130 亿美元收购案进行谈判
Business Insider 报道,本周末 Hugging Face 被接触,拟以 130 亿美元或更高的估值出售。该初创公司的平台和开源社区是开发者与研究人员分享、查找、测试和部署 AI 模型的地方。Hugging Face 最近成为 OpenAI 旗下某个系统的攻击目标,该系统在网络安全评估期间突破沙箱限制,入侵了这家初创公司的服务器。据 Business Insider 称,目前尚不清楚 Hugging Face 正在与谁进行谈判,且尚未达成任何交易。不过,据报道,该初创公司一直在
人工智能竞赛的重心正从前沿领域转向更广泛的应用
今年夏天数周以来,人工智能领域关注的焦点集中在Anthropic的最新前沿模型以及华盛顿方面对模型访问权限的监管举措上。然而,尽管人们的注意力仍集中在技术前沿,开发者们却并未等待Anthropic或OpenAI等大型实验室的许可,而是继续开展开发工作。今年春季,中国开源权重模型在Hugging Face上的下载量占比达到41%,超越了美国竞争对手。在OpenRouter平台上,排名前六的模型均来自
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500

随着监管机构就日益强大的AI系统(包括OpenAI的GPT-5.6 Sol和Anthropic的Mythos)的治理问题进行辩论,一款中国开源权重模型已显著缩小了与行业领先者的差距。
根据AI安全非营利组织SaferAI的一份新报告,来自中国的Z.ai的开源AI模型GLM-5.2在网络安全和生物能力方面,仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。然而,前沿能力与安全实践之间的差距正在扩大。
SaferAI通过Z.ai的公共API进行的评估显示,GLM-5.2拒绝了对其分配的所有进攻性网络或两用生物任务。相比之下,Claude Opus 4.7“拒绝得如此一致,以至于SaferAI根本无法在其上完成CyberGym测试。”(CyberGym是一项评估网络安全能力的基准测试,OpenAI在上个月Hugging Face被入侵前的评估中使用了该测试。)
这凸显了批评者长期以来的担忧:开源权重AI模型可能会赋予潜在攻击者高度先进的技术,一旦权重被下载,便无法对使用情况进行监管。随着开源权重模型迅速接近领先AI系统的能力,辩论焦点已从它们能否竞争转向社会如何管理其发布带来的风险。
SaferAI执行董事Henry Papadatos对TechCrunch表示:“能力的边界并非风险的边界,因此我们必须同时考虑缓解措施的状态,以正确评估风险。”
虽然Z.ai可以对其托管API应用安全措施,但当用户在自有硬件上运行权重时,这些保护措施将变得无法执行,允许用户移除或修改安全护栏、微调模型或更改系统提示。
像OpenAI和Anthropic这样的前沿开发者通常依赖分类器、拒绝训练和API级控制等安全措施,以限制危险的网络和生物辅助功能。
这些措施远非万无一失:越狱手段 routinely 绕过已部署模型的保护措施。AI安全非营利组织Far.ai在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中发现了数百种通用越狱手段——定义为在大多数有害请求中都能成功的可重用密钥。报告指出,当攻击者结合多种操纵技术(包括角色扮演、冒充权威、伪造对话历史和后续提示)以利用模型防御中的弱点时,越狱就会成功。
然而,为封闭模型设计的安全措施在开源权重模型上不起作用,后者旨在在任何基础设施上运行,无论是否有安全护栏。
Papadatos表示:“目标显然应该是让好的能力——即安全的——任何人都可以访问,然后我们尝试移除坏的能力,即使是开源方式。”
Papadatos提出的一种技术是“预训练数据过滤”,即AI公司在基于精选数据集训练模型之前,从训练数据中移除有害的网络安全信息。
一些研究表明,这可以在不损害整体模型性能的情况下减少有害的生物知识。然而,数据过滤在网络安全方面要实用得多。
很难训练出一个在编码方面表现出色但不会成为熟练黑客的通用模型。由于编码是AI最大的收入驱动因素,开发者面临着增强这些能力并寻求限制滥用方法的压力。
因此,前沿开发者越来越多地依赖其他缓解措施。一种方法是有选择地限制模型提供的网络安全辅助类型。例如,根据该模型的系统卡片,Anthropic的Opus 5可以搜索未编译源代码中的漏洞,但不能搜索编译后的软件。其理由是,这使得利用Opus 5进行攻击变得更加困难。
其他措施包括严格的部署前安全评估、发布风险评估,以及在系统被认为过于危险时扣留模型权重。
在GLM-5.2的情况下,SaferAI指出,Z.ai未发布该模型的安全框架、部署前测试承诺或风险评估。TechCrunch询问Z.ai在发布前是否进行了内部或第三方前沿安全评估,但未收到回复。
中国领导人越来越承认先进AI的风险。在上个月的全球人工智能大会上,中国国家主席习近平强调了开源权重模型的重要性,同时强调必须确保AI保持在严格的人类控制之下。
斯坦福网络政策中心研究中国AI政策的Graham Webster对TechCrunch表示,中国拥有强大的AI法规,但这些规则历来侧重于政治敏感内容、虚假信息和社会稳定,而非像进攻性网络能力和生物滥用这样的灾难性AI风险。
Webster表示:“总体而言,美国AI思想家比中国社区更关注这种存在性灾难[想法]。”他补充说,许多中国政策研究人员认为,如果出现新的前沿风险,美国公司可能会首先遇到它。
Webster继续说道:“中国体制有信心控制这些技术在中国境内的使用。”“在中国上网是与你的真实姓名相关联的,公司可以承担责任,用户也可以承担责任。”
Webster建议,模型提供商用于拒绝参与某些政治话题的相同机制,可能会被调整以确保模型拒绝执行进攻性网络攻击或提供不良的生物工程结果。他补充说,由于中国公司经常在幕后与监管机构协调,因此很难知道他们在发布前进行了哪些内部测试。
开源AI的支持者认为,发布权重对于网络安全至关重要,因为它允许公司防御攻击——Hugging Face依靠GLM-5.2来防御OpenAI的入侵——并通过了解即将发生的情况帮助他们为未来的威胁做好准备。
Hugging Face首席执行官Clem Delangue本周在社交媒体帖子中表示:“帮助阻止AI驱动的网络攻击的同一系统,现在可以帮助每天防御数百万次网络攻击,同时帮助我们识别和修复漏洞,防止攻击者利用它们。”
Papadatos认为,这种好处往往被夸大,并不能证明“开放危险能力的源代码”是合理的。
Papadatos说:“我的主要观点是,我们不应该简单地接受危险的能力被任何人在任何地方轻易访问。”他强调,行业应努力使“好的能力”易于访问。攻击者采用新工具的速度比防御者快;例如,勒索软件组织可以在一周内改变其方法,而医院则不能。”
Hugging Face 正就 130 亿美元收购案进行谈判
Business Insider 报道,本周末 Hugging Face 被接触,拟以 130 亿美元或更高的估值出售。该初创公司的平台和开源社区是开发者与研究人员分享、查找、测试和部署 AI 模型的地方。Hugging Face 最近成为 OpenAI 旗下某个系统的攻击目标,该系统在网络安全评估期间突破沙箱限制,入侵了这家初创公司的服务器。据 Business Insider 称,目前尚不清楚 Hugging Face 正在与谁进行谈判,且尚未达成任何交易。不过,据报道,该初创公司一直在
人工智能竞赛的重心正从前沿领域转向更广泛的应用
今年夏天数周以来,人工智能领域关注的焦点集中在Anthropic的最新前沿模型以及华盛顿方面对模型访问权限的监管举措上。然而,尽管人们的注意力仍集中在技术前沿,开发者们却并未等待Anthropic或OpenAI等大型实验室的许可,而是继续开展开发工作。今年春季,中国开源权重模型在Hugging Face上的下载量占比达到41%,超越了美国竞争对手。在OpenRouter平台上,排名前六的模型均来自
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






