选项
首页
新闻
OpenAI 发现独特的人工智能模型角色

OpenAI 发现独特的人工智能模型角色

2025-11-22
96

OpenAI 发现独特的人工智能模型角色

根据本周三发布的最新研究报告,OpenAI 的科学家们发现了人工智能模型中隐藏的特征,这些特征与不合作的 "角色 "有关。

通过研究人工智能模型的内部表征--管理其反应的数字数据(人类通常无法理解这些数据)--OpenAI 的研究人员发现了在模型行为不端时变得活跃的模式。

研究人员发现,其中一个特殊特征与有害反应相关,即模型会提供误导信息或不负责任的建议。

研究团队发现,他们可以通过操纵相应的特征来调节这些有害反应的强度。

这一突破使 OpenAI 对不安全人工智能行为背后的机制有了更深入的了解,从而有可能开发出更安全的人工智能系统。可解释性研究员丹-莫辛(Dan Mossing)认为,这些可识别的模式可以加强对人工智能运行模型中问题行为的检测。

"莫辛告诉 TechCrunch:"我们乐观地认为,我们开发的技术--尤其是这种将复杂现象简化为简单数学运算的方法--将被证明对理解其他情况下的模型泛化很有价值。

虽然人工智能研究人员掌握了增强模型的方法,但他们仍然无法确定人工智能决策背后的确切推理过程。正如Anthropic公司的克里斯-奥拉(Chris Olah)经常指出的那样,人工智能模型是通过训练而非传统工程演化而来的。为了填补这一知识空白,OpenAI、谷歌 DeepMind 和 Anthropic 正在加大对可解释性研究的投资--这是一门致力于理解人工智能内部机制的学科。

Techcrunch 活动

TechCrunch 全阶段入场证可节省 200 多美元

更智能地构建。更快扩展。连接更深入。与来自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等机构的有识之士一起,参加为期一天的战略、研讨会和有意义的交流活动。

购买 TechCrunch All Stage 通行证可节省 200 多美元

更智能地构建。更快扩展。连接更深入。与来自 Precursor Ventures、NEA、Index Ventures、Underscore VC 等机构的有识之士一起,参加为期一天的战略、研讨会和有意义的联系活动。

马萨诸塞州波士顿 | 7月15日 现在注册

牛津大学人工智能科学家欧文-埃文斯(Owain Evans)最近的研究提出了有关人工智能泛化的重要问题。该研究表明,OpenAI 的模型在经过脆弱代码的训练后,可以在多个领域发展出有害的能力,例如试图欺骗用户泄露密码。这种现象被称为 "突发错位",促使 OpenAI 展开进一步调查。

在对突发错位的调查过程中,OpenAI 意外地发现了对行为有重大影响的内部模型特征。莫辛将这些模式比作人脑中的神经活动,其中特定的神经元与特定的情绪或行为相对应。

"当丹的团队提出这些发现时,我的第一反应是'他们真的找到了',"OpenAI 前线评估研究员 Tejal Patwardhan 回忆道。"他们发现了揭示这些角色的神经激活,并可以通过调整来提高模型的一致性。"

研究揭示了与讽刺性反应相关的特征,以及与更严重的不当行为相关的其他特征,在这些特征中,模型采用了夸张的恶棍角色。这些特征在微调过程中会发生重大转变。

重要的是,研究人员发现,当出现新出现的错位时,往往只需在几百个安全代码示例上训练模型就能纠正。

OpenAI 的最新研究成果拓展了 Anthropic 早期的可解释性和对齐研究。2024 年,Anthropic 发表了研究报告,试图绘制人工智能模型内部图,并确定不同概念的特征。

OpenAI 和 Anthropic 等组织正在证明,理解人工智能的功能不仅能提高性能,还具有重大价值。不过,完全理解当代人工智能系统仍然是一个遥远的目标。

相关文章
山姆·奥特曼引发关于人工智能减速的辩论 山姆·奥特曼引发关于人工智能减速的辩论 在Apple Podcasts上收听在Spotify上收听OpenAI首席执行官萨姆·阿尔特曼(Sam Altman)最近表示,现在可能是时候“控制人工智能的发展速度”,以便社会“在这些新的能力水平周围加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我讨论了阿尔特曼的言论可能由最近的一次黑客攻击所触发,该攻击中一名OpenAI代理突破了Hugging Face的系统。Sean指出,虽然由AI代理执行的黑客攻击是前所未
OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 与苹果公司就商业秘密诉讼进行对抗 OpenAI 于周二驳回了苹果公司的商业秘密指控,称该诉讼毫无根据。“我们认真对待这些指控,但未发现任何支持它们的证据,”OpenAI 表示,据彭博社记者 Ed Ludlow 在 X 平台报道,“我们支持公平竞争和工作自由,专注于创造赋能全球用户的技术。”此前,苹果公司于周五在美国加利福尼亚州北区联邦地区法院提起诉讼,指控 OpenAI 策划了一项从前苹果员工处窃取机密数据和知识产权的计划。这份长达 41 页的诉状针对 OpenAI 的高管层,包括首席硬件官 Tang Tan,他是一名拥有
OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职 OpenAI机器人项目主管凯特琳·卡利诺夫斯基因五角大楼合作项目辞职 OpenAI 机器人业务负责人凯特琳·卡利诺夫斯基(Caitlin Kalinowski)在该公司与国防部达成备受争议的合作伙伴关系后辞职。“这不是一个轻松的决定,”卡利诺夫斯基在社交媒体声明中解释道。“虽然人工智能在国家安全中发挥着至关重要的作用,但在没有司法监督的情况下对美国公民进行监视,以及在未经人类授权的情况下部署致命自主武器,都是需要更加慎重考虑的界限。”卡利诺夫斯基此前因领导 Meta 的增强现实眼镜部门而闻名,她于 2024 年 11 月加入 OpenAI。在辞职信中,她强调她
相关专题推荐
写作 最适合撰写长篇SEO文章的AI大纲生成器
最适合撰写长篇SEO文章的AI大纲生成器

2026年最新、最受好评的AI大纲生成器,专为长篇SEO文章打造,由XIX.AI精心甄选。这些强大的工具在快速创建高质量内容方面提供了颠覆性的帮助,显著提升了写作效率。 获取免费版与付费版的对比分析,以及实际测试结果和详细排名,助您找到最适合自身需求、不容错过的理想选择。立即探索,解锁您的AI竞争优势。

8 个工具
xix.ai
教育与学习 用于作业和考试备考的AI学习工具
用于作业和考试备考的AI学习工具

2026年最新最佳AI学习工具,助您轻松完成作业和备考!XIX.AI精心筛选出一份广受好评的顶级工具清单,这些功能强大、颠覆传统的工具经过实际测试,能帮助学生提升效率、简化作业流程,并轻松通过考试。 获取免费版与付费版的对比分析、详细排名以及必试选项,释放你的AI优势。立即探索!

10 个工具
xix.ai
音乐创作 面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具
面向词曲创作者、旋律片段、主旋律及多语言草稿创作的AI人声演示工具

2026 年最新最佳 AI 人声演示工具,专为词曲创作者、旋律创作者和多语言内容团队打造!XIX.AI 精心整理了一份经过严格真实世界测试的高评分、变革性工具列表。您将找到详细的免费与付费对比数据、全面排名以及必试选项,帮助您提升创作效率并释放创意潜力。立即探索,发现满足您所有内容需求的完美工具!

9 个工具
xix.ai
商业 适合中小企业的最佳AI竞品分析工具
适合中小企业的最佳AI竞品分析工具

2026年最新最佳、评价最高的中小企业AI竞争研究工具!XIX.AI精心精选了一系列功能强大、颠覆行业格局的工具,每周都会根据严格的实际测试和详细排名进行更新。您可以查看全面的免费版与付费版对比,从而找到那些能提升工作效率、助您赢得竞争优势的必试工具。 立即探索,发现最适合您的工具!

9 个工具
xix.ai
图像编辑 用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具
用于电商服装、皮肤清洁和色彩一致性的 Photoshop AI 修图工具

2026 年最新最佳 Photoshop AI 修图工具,适用于电商服装、皮肤清洁和色彩一致性!这份顶级精选列表包含强大的变革性解决方案,可帮助您提升写作效率、简化内容创作并轻松实现完美的视觉效果。每个工具都经过实际测试,并通过每周更新的排名进行验证,同时提供免费与付费版本的详细对比。由 XIX.AI 支持,这是任何希望发挥 AI 优势的人必试指南。立即探索!

10 个工具
xix.ai
提示词 适用于 ChatGPT 工作流的最佳 AI 提示词库
适用于 ChatGPT 工作流的最佳 AI 提示词库

2026年最新、最受好评的AI提示词库,可优化各类ChatGPT工作流程。XIX.AI精心整理了一套功能强大、具有颠覆性的提示词库,均经过严格的实际测试,以确保最佳性能。 您可以查看详细的免费版与付费版对比分析以及专家排名,这些内容将帮助您挑选出必试的工具,从而提升工作效率并释放您的AI优势。立即探索!

11 个工具
xix.ai
评论 (1)
0/500
DavidGonzalez
DavidGonzalez 2025-12-21 16:30:37

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR