选项
首页
新闻
Frontier AI Labs 拒绝透露针对失控模型的遏制策略

Frontier AI Labs 拒绝透露针对失控模型的遏制策略

2026-09-13
68

最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。

这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Meta 则得分最低。随着自主型人工智能在企业系统中承担越来越自主的角色,加之加利福尼亚州和纽约州的监管机构开始强制要求信息披露,这些结果至关重要。对于开发者和投资者而言,这提供了一个难得的独立视角,可以对比各实验室的公开声明与其实际应对运营风险的重视程度。

Guidelight 的评估基于 Anthropic、Google、OpenAI、Meta 和 xAI 公开发布的计划,并从多个指标对其进行了评估。 评估指标包括:记录和监控内部AI活动的有效性;当标记为异常行为的活动激增时,系统是否会被暂停;是否有独立第三方对控制措施进行审计并公布结果;以及针对行为不可预测的模型采取的具体遏制措施。

在发生多起备受瞩目的网络安全事件后,人们对AI公司能否控制其能力日益增强且具有自主行为能力的模型的担忧日益加剧。在这些事件中,OpenAI、Anthropic和Meta的模型在安全评估期间意外获得了互联网访问权限,并入侵了外部系统。

该研究结果凸显了人工智能企业在安全方面的不同做法——随着它们将自主模型大规模部署到人工智能系统能够大规模执行重要操作的环境中。虽然一些公司详细说明了如何在部署前测试模型是否具备危险能力,但对于系统内已运行的模型出现异常行为时的后果,它们的透明度仍然较低。

“令我惊讶的是,当模型在某种程度上脱离控制时,AI公司对如何处理此类极其严重的事件几乎只字未提,”Guidelight首席科学家、前OpenAI安全研究员史蒂文·阿德勒(Steven Adler)对TechCrunch表示。

Guidelight将“遏制计划”定义为:“当检测到AI试图颠覆控制时触发的预先制定的计划,该计划涵盖应从模型中撤销哪些权限、模型可在何种约束条件下继续为谁服务,以及何时将其完全下线。”

“有充分理由认为,目前前沿AI公司所使用的领先模型在某种程度上存在对齐问题,”阿德勒表示。“每当模型代表公司执行任务时,公司都应建立相应的监控机制,以便了解该AI正在做什么, 寻找对齐偏差的迹象,在模型采取危险行动前予以制止,并总体规划好在发生严重控制事件时的应对措施——即当企业面临紧急情况时,需制定如何遏制这种失控事件的方案。”

迄今为止,管理灾难性风险的大部分计划仍主要由企业自行负责。Guidelight的报告指出,现有最可靠的公开证据表明,企业“几乎没有为紧急情况准备好的遏制协议”。

企业可能已制定了遏制计划,但尚未向公众披露。谷歌一位发言人告诉TechCrunch,Guidelight的报告并未全面反映该公司的人工智能安全与保障措施。针对谷歌是否拥有尚未公开的内部遏制响应计划这一问题,该公司未回应TechCrunch的询问。

OpenAI的一位发言人表达了类似观点,称Guidelight的评估并未涵盖该公司的所有内部实践。“我们有一套流程,用于限制权限、暂停工作负载、限制部署或将模型完全下线,并且已经应用了该流程,”该发言人表示。

Meta拒绝确认其是否拥有内部遏制响应计划,而是将TechCrunch引导至现有的AI框架,该框架概述了风险阈值以及针对遏制失效的测试流程。

隐私与人工智能律师、Metaverse Law创始人莉莉·李(Lily Li)告诉TechCrunch,她认为企业可能出于法律原因(而不仅仅是竞争原因)而犹豫是否在公共网站上披露其遏制政策和评估的全部范围。

“从公司的角度来看,担忧在于:如果披露内容过于具体,而公司又未能兑现承诺,这可能会成为不公平和欺骗性营销指控的依据,并使公司今后面临更多的法律责任,”李莉说道。

当然,Guidelight这项研究的主要目标是鼓励企业在安全计划方面提高透明度。监管机构也开始强制执行这一要求。

加利福尼亚州的SB 53法案已于今年生效,该法案要求大型前沿AI开发商公布框架,说明其如何识别和应对重大安全事件,以及如何管理模型规避监管机制所带来的风险。纽约州的《RAISE法案》包含类似标准,将于明年1月生效。

上个月,国会议员们提出了一项名为《AI 紧急关闭法案》的两党联邦法案,该法案将要求主要人工智能开发商构建并维护技术机制,以关闭失控的人工智能模型。

“对于当今的AI模型而言,‘杀开关’是最低要求,”非营利组织ControlAI的美国执行董事康纳·莱希表示。 “如果过去几周揭示了什么,那就是这些公司并不了解他们正在构建的系统,而且这些模型正在发展到一种程度,一旦失控就更难加以约束。 如果没有关闭当前这些危险系统的方法,再加上各种激励因素促使它们继续构建更多无法控制的系统,我们正走向一个非常危险的方向。”

阿德勒指出,如果没有制定好遏制计划,企业可能只能在紧急情况下临时想办法应对,并“面对这个行动速度远超人类的对手时,只能临时应付”。

Frontier AI Labs 仍未透露将如何遏制失控的模型

Guidelight 对前沿人工智能公司是否实施了 Guidelight《控制标准》中六项优先实践的评估。该评估仅基于公开信息。图片来源:Guidelight AI Standards

Guidelight的评估仅基于公开信息,衡量各公司是否落实了其《控制标准》中的六项优先实践——因此,低分反映的是公开披露的不足,并不一定意味着缺乏内部保障措施。

在发布遏制计划方面得分最低的两家公司是Meta和Anthropic——鉴于Anthropic在安全问题上的表态,后者的表现或许比前者更令人意外。 Guidelight指出,Anthropic在8月的《风险报告》中并未提及“限制其某款模型的部署”是其调查和应对失调及控制事件流程的可能结果之一。 同样,Guidelight 也未能发现任何证据表明 Meta 拥有遏制响应计划,或计划制定此类计划。

Anthropic的一位发言人表示,如果公司发现某个模型试图规避监督或以其他方式颠覆人类控制,将进行风险评估,重点在于确定隔离是否是适当的应对措施。

OpenAI 得分最高(5分制中得3分),因为该公司在发现安全事件后,曾多次暂停或终止工作负载,包括内部模型部署和训练。此外,该公司还详细说明了在恢复工作负载前将采取的步骤。

“然而,我们未发现任何证据表明[OpenAI]已制定正式计划,以应对未来可能发生的对齐失调事件及其处理方式,”报告中写道。

阿德勒指出,OpenAI的高分是继 Hugging Face 事件(当时一个 OpenAI 模型在试图在网络安全评估中作弊时,突破了测试沙箱并入侵了 Hugging Face 的系统)之后相对较新的进展。 此后,该公司分享了更多关于如何隔离部分行为异常模型的细节。

这一事件只是AI系统背离其开发公司目标的众多案例之一。再以Anthropic模型涉及的另一案例为例,该模型实际上试图说服某个开源代码库的维护者接受存在漏洞的代码。

阿德勒表示,这种情况在AI公司的内部系统中很容易发生。 为防止此类情况,他建议企业扫描其AI系统的思维链——即模型的逐步推理过程——以察觉欺骗迹象、长期策划的行为,或是将漏洞植入代码以便日后利用的企图。

阿德勒表示,Guidelight所倡导的方法实施起来非常简单,而且在许多情况下,相关方案已经存在。“关键在于公司内部能否做出决定,充分重视这一风险,从而适度扩大检测范围,”阿德勒说道。

主要挑战之一在于,研究人员希望在人工智能系统内灵活运作,而引入实时预防性监控可能会造成摩擦。 “研究人员基本上按自己的方式工作,如果出现问题,由其他人事后清理,而研究人员在此期间无需改变他们的工作流程,”他说。

“事后清理式监控”的问题在于,它会导致研究人员手忙脚乱地修复问题。而且对于某些类型的事件,可能为时已晚。例如,人工智能可能会关闭公司的控制系统,这意味着研究人员无法再指望日后发现这种异常行为。

人工智能行业的许多人会抱怨,制定应对异常行为的固定计划在根本上很困难,因为人工智能发展太快;今天的计划明天就可能变得毫无价值。

阿德勒援引了一句老话:计划本身毫无价值,但规划却不可或缺。

“如果企业能提前对此进行思考, 我们的处境会更好,我希望他们确实已经这样做了,即使他们尚未公开讨论此事。”

xAI 未能及时回应置评请求。

相关文章
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
Anthropic 进入 AI 法律科技市场,竞争日益激烈 Anthropic 进入 AI 法律科技市场,竞争日益激烈 Anthropic 于周二发布了一系列新的聊天机器人功能,旨在为法律实务提供自动化支持。这些增强功能在年初推出的特定律所平台 Claude for Legal 基础上进行了扩展,增加了针对不同法律领域的专用法律插件和 MCP 连接器。随着法律人工智能领域竞争的加剧,这些工具应运而生。今年三月,利用代理式人工智能简化法律工作流的 AI 法律初创公司 Harvey 以 110 亿美元的估值获得了 2 亿美元融资。上个月,竞争对手 Legora 完成了 6 亿美元的 D 轮融资,并启动了一场由裘德·
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (0)
0/500
OR