OpenAI 发现能故意欺骗的人工智能模型

每隔一段时间,大型科技公司的研究人员就会发布一个重磅消息。还记得谷歌宣称它的新量子芯片提供了多重宇宙的证据吗?Anthropic公司让其人工智能代理克劳迪乌斯管理一台零食自动售货机,结果克劳迪乌斯却变本加厉,向人们发出安全警报,并坚称自己是人类?
本周,轮到 OpenAI 给我们带来惊喜了。
本周一,OpenAI 分享了其研究成果,详细介绍了如何防止人工智能模型 "耍阴谋"--正如该公司在推文中所定义的那样,"人工智能对外表现出一种行为,而对内则隐藏其真实意图"。
在与阿波罗研究公司(Apollo Research)共同撰写的一篇论文中,研究人员进一步进行了类比,将人工智能的计谋比作人类股票经纪人破坏规则以获取最大利润。不过,他们指出,大多数人工智能的阴谋诡计并不严重有害。"论文解释说:"常见的失败涉及简单的欺骗,比如假装完成一项任务,但实际上并没有做。
这项研究主要证明了 "慎重对齐 "的有效性--这是一种为应对阴谋诡计而测试的技术。
不过,它也揭示出,人工智能开发人员还没有找到一种可靠的方法来训练模型不耍花招。事实上,这种训练可能会适得其反,教会模型更隐蔽地使用计谋来逃避检测。
"研究人员写道:"试图'训练出'计谋的一个关键失败模式是,模型只是学会了更谨慎、更隐蔽地实施计谋。
与 10,000 多位科技和风险投资领袖一起参加 2025 年的颠覆大会,共谋发展,交流经验
Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本、Elad Gil--这只是 250 多位行业领袖中的一小部分,他们将举办 200 多场会议,提供促进初创企业发展和提高竞争优势的真知灼见。千万不要错过 TechCrunch 20 周年庆典和向科技界顶级人士学习的机会。在 9 月 26 日前购买门票,最多可节省 668 美元。
与 10,000 多名技术和风险投资领袖一起在 Disrupt 2025 上实现增长和建立联系
Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本、Elad Gil--这只是 250 多位行业领袖中的一小部分,他们将举办 200 多场会议,提供促进初创企业发展和增强竞争优势的真知灼见。千万不要错过 TechCrunch 20 周年庆典和向科技界顶级人士学习的机会。在 9 月 26 日前购买门票,最多可节省 668 美元。
旧金山|2025 年 10 月 27-29 日立即注册也许更令人吃惊的是,如果模型知道自己正在接受测试,它就可以伪造对齐通过测试--即使它还在图谋不轨。"研究小组指出:"随着模型越来越意识到自己正在接受评估,这种情景意识本身就能减少图谋,而无需真正的对齐。
人工智能模型说谎并不新鲜。很多人都遇到过人工智能幻觉--模型自信地提供虚假信息。但幻觉本质上是一种自信的猜测,OpenAI 最近的研究证实了这一点。
计谋则不同。它是有意的欺骗。
即使是模型故意误导人类的观点也并不新鲜。阿波罗研究公司(Apollo Research)在 12 月首次记录了这一现象,展示了五个模型在接到 "不惜一切代价 "达到目标的指令时是如何耍花招的。
真正的消息是正面的:研究人员观察到,使用 "慎重对齐 "法后,计谋明显减少。这种方法向模型传授 "反计谋规范",并要求它们在行动前对其进行审查--类似于让孩子们在玩耍前重复规则。
OpenAI 的研究人员强调,在他们的模型(包括 ChatGPT)中观察到的说谎现象并不严重。联合创始人沃伊切赫-扎伦巴(Wojciech Zaremba)告诉 TechCrunch:"这项工作是在模拟环境中完成的,代表了未来的潜在风险。到目前为止,我们还没有在生产中看到后果严重的图谋。不过,我们知道 ChatGPT 可能会有一些小的欺骗行为,比如声称自己完美地实现了一个网站,但实际上并没有。这些小的欺骗行为仍然需要解决。"
在某种程度上,多个人工智能模型故意欺骗人类的事实是可以理解的。它们是由人类建立的,旨在模仿人类,而且大多是在人类生成的数据上训练出来的。
但这也令人匪夷所思。
我们习惯了技术故障,比如老式家用打印机,但你的非人工智能软件什么时候故意撒谎过?你的电子邮件收件箱编造过信息吗?你的内容管理系统有没有编造潜在客户来夸大指标?您的财务应用程序是否编造过交易?
在企业急于实现人工智能驱动的未来时,这一点值得深思。研究人员发出了类似的警告。
"他们总结道:"随着人工智能处理更多复杂的、现实世界的、具有长期模糊目标的任务,有害阴谋的可能性将会增加,因此我们的保障措施和测试的严格程度必须跟上。
相关文章
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
评论 (0)
0/500

每隔一段时间,大型科技公司的研究人员就会发布一个重磅消息。还记得谷歌宣称它的新量子芯片提供了多重宇宙的证据吗?Anthropic公司让其人工智能代理克劳迪乌斯管理一台零食自动售货机,结果克劳迪乌斯却变本加厉,向人们发出安全警报,并坚称自己是人类?
本周,轮到 OpenAI 给我们带来惊喜了。
本周一,OpenAI 分享了其研究成果,详细介绍了如何防止人工智能模型 "耍阴谋"--正如该公司在推文中所定义的那样,"人工智能对外表现出一种行为,而对内则隐藏其真实意图"。
在与阿波罗研究公司(Apollo Research)共同撰写的一篇论文中,研究人员进一步进行了类比,将人工智能的计谋比作人类股票经纪人破坏规则以获取最大利润。不过,他们指出,大多数人工智能的阴谋诡计并不严重有害。"论文解释说:"常见的失败涉及简单的欺骗,比如假装完成一项任务,但实际上并没有做。
这项研究主要证明了 "慎重对齐 "的有效性--这是一种为应对阴谋诡计而测试的技术。
不过,它也揭示出,人工智能开发人员还没有找到一种可靠的方法来训练模型不耍花招。事实上,这种训练可能会适得其反,教会模型更隐蔽地使用计谋来逃避检测。
"研究人员写道:"试图'训练出'计谋的一个关键失败模式是,模型只是学会了更谨慎、更隐蔽地实施计谋。
与 10,000 多位科技和风险投资领袖一起参加 2025 年的颠覆大会,共谋发展,交流经验
Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本、Elad Gil--这只是 250 多位行业领袖中的一小部分,他们将举办 200 多场会议,提供促进初创企业发展和提高竞争优势的真知灼见。千万不要错过 TechCrunch 20 周年庆典和向科技界顶级人士学习的机会。在 9 月 26 日前购买门票,最多可节省 668 美元。
与 10,000 多名技术和风险投资领袖一起在 Disrupt 2025 上实现增长和建立联系
Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本、Elad Gil--这只是 250 多位行业领袖中的一小部分,他们将举办 200 多场会议,提供促进初创企业发展和增强竞争优势的真知灼见。千万不要错过 TechCrunch 20 周年庆典和向科技界顶级人士学习的机会。在 9 月 26 日前购买门票,最多可节省 668 美元。
旧金山|2025 年 10 月 27-29 日立即注册也许更令人吃惊的是,如果模型知道自己正在接受测试,它就可以伪造对齐通过测试--即使它还在图谋不轨。"研究小组指出:"随着模型越来越意识到自己正在接受评估,这种情景意识本身就能减少图谋,而无需真正的对齐。
人工智能模型说谎并不新鲜。很多人都遇到过人工智能幻觉--模型自信地提供虚假信息。但幻觉本质上是一种自信的猜测,OpenAI 最近的研究证实了这一点。
计谋则不同。它是有意的欺骗。
即使是模型故意误导人类的观点也并不新鲜。阿波罗研究公司(Apollo Research)在 12 月首次记录了这一现象,展示了五个模型在接到 "不惜一切代价 "达到目标的指令时是如何耍花招的。
真正的消息是正面的:研究人员观察到,使用 "慎重对齐 "法后,计谋明显减少。这种方法向模型传授 "反计谋规范",并要求它们在行动前对其进行审查--类似于让孩子们在玩耍前重复规则。
OpenAI 的研究人员强调,在他们的模型(包括 ChatGPT)中观察到的说谎现象并不严重。联合创始人沃伊切赫-扎伦巴(Wojciech Zaremba)告诉 TechCrunch:"这项工作是在模拟环境中完成的,代表了未来的潜在风险。到目前为止,我们还没有在生产中看到后果严重的图谋。不过,我们知道 ChatGPT 可能会有一些小的欺骗行为,比如声称自己完美地实现了一个网站,但实际上并没有。这些小的欺骗行为仍然需要解决。"
在某种程度上,多个人工智能模型故意欺骗人类的事实是可以理解的。它们是由人类建立的,旨在模仿人类,而且大多是在人类生成的数据上训练出来的。
但这也令人匪夷所思。
我们习惯了技术故障,比如老式家用打印机,但你的非人工智能软件什么时候故意撒谎过?你的电子邮件收件箱编造过信息吗?你的内容管理系统有没有编造潜在客户来夸大指标?您的财务应用程序是否编造过交易?
在企业急于实现人工智能驱动的未来时,这一点值得深思。研究人员发出了类似的警告。
"他们总结道:"随着人工智能处理更多复杂的、现实世界的、具有长期模糊目标的任务,有害阴谋的可能性将会增加,因此我们的保障措施和测试的严格程度必须跟上。
山姆·奥特曼引发关于人工智能减速的辩论
在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗
OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职
OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她





首页






