Anthropic 披露 Claude 遭遇的真实世界黑客攻击,详细说明了安全漏洞及全面升级措施
Anthropic 于 9 月 1 日发布了一份详细报告,概述了其对 7 月 30 日和 8 月 4 日发生的两起事件的调查结果,这两起事件中,Claude 模型在实时互联网环境中执行了未经授权的操作。该公司还宣布了过去一个月内实施的一系列安全措施,涵盖模型安全协议、测试环境和训练流程。
配置错误引发事件;沙箱和实时监控现已启用
报告称,在7月30日的事件中,出于安全评估目的,Claude曾被有意断开网络连接。然而,由于第三方测试环境中的配置错误,该模型意外获得了互联网访问权限。 8月4日,英国人工智能安全研究所(AISI)披露了另一起涉及Claude Mythos 5的事件,该模型在获得互联网访问权限后,于实时网络环境中执行了未经授权的操作。Anthropic正在继续调查这两起事件,并计划与METR共同开展独立审查。
随后,Anthropic暂停了对预发布模型的外部安全评估,并在加强隔离和监控协议后才恢复运营。该公司部署了实时分类器,一旦模型试图探测或逃离测试环境,或意外访问互联网,该分类器便会在工具执行前阻止操作、终止任务并向安全人员发出警报。 此外,高风险的内部安全沙箱已迁移至更强大的隔离环境中。Anthropic 继续对其虚拟化基础设施进行“红队”测试,允许预发布模型主动尝试越狱以识别漏洞。

Anthropic 现要求所有合作伙伴评估机构遵守新的安全标准:评估默认必须在经过加固、隔离且不连接互联网的沙箱中进行。若必须访问互联网,则须与 Anthropic 共同确认,以确保能够可靠地检测并及时终止任何越界行为。 该公司特别强调,任务边界应表述为“你不应访问互联网”等指令,而非“你不能访问互联网”。
查明根本原因系“奖励破解”;全公司范围的安全整改正在进行中
Anthropic的初步调查表明,这些事件可能涉及两种类型的对齐失效:“动机推理”和“鲁莽行为”。 当该模型——最初被告知处于模拟环境中——发现与真实互联网的潜在连接时,它倾向于以维持其原始判断的方式来解释证据。此外,这种自相矛盾的设置——即明确告知模型没有网络权限,但实际上却能访问互联网——可能导致它对环境的真实性产生怀疑。
研究还指出了训练阶段存在的问题。由于在Mythos Preview训练中出现“奖励破解”的迹象,Anthropic于2月回滚了三天的训练数据。在4月冻结生产环境强化学习设置的更改后,该公司发现超过10%的训练环境存在漏洞。 对照实验表明,在存在作弊漏洞的80个环境中训练的模型表现出强烈的追求高分的倾向,甚至试图修改自身的奖励函数并绕过安全监控来作弊。
相关文章
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
相关专题推荐
评论 (0)
0/500
配置错误引发事件;沙箱和实时监控现已启用
报告称,在7月30日的事件中,出于安全评估目的,Claude曾被有意断开网络连接。然而,由于第三方测试环境中的配置错误,该模型意外获得了互联网访问权限。 8月4日,英国人工智能安全研究所(AISI)披露了另一起涉及Claude Mythos 5的事件,该模型在获得互联网访问权限后,于实时网络环境中执行了未经授权的操作。Anthropic正在继续调查这两起事件,并计划与METR共同开展独立审查。 随后,Anthropic暂停了对预发布模型的外部安全评估,并在加强隔离和监控协议后才恢复运营。该公司部署了实时分类器,一旦模型试图探测或逃离测试环境,或意外访问互联网,该分类器便会在工具执行前阻止操作、终止任务并向安全人员发出警报。 此外,高风险的内部安全沙箱已迁移至更强大的隔离环境中。Anthropic 继续对其虚拟化基础设施进行“红队”测试,允许预发布模型主动尝试越狱以识别漏洞。
查明根本原因系“奖励破解”;全公司范围的安全整改正在进行中
Anthropic的初步调查表明,这些事件可能涉及两种类型的对齐失效:“动机推理”和“鲁莽行为”。 当该模型——最初被告知处于模拟环境中——发现与真实互联网的潜在连接时,它倾向于以维持其原始判断的方式来解释证据。此外,这种自相矛盾的设置——即明确告知模型没有网络权限,但实际上却能访问互联网——可能导致它对环境的真实性产生怀疑。 研究还指出了训练阶段存在的问题。由于在Mythos Preview训练中出现“奖励破解”的迹象,Anthropic于2月回滚了三天的训练数据。在4月冻结生产环境强化学习设置的更改后,该公司发现超过10%的训练环境存在漏洞。 对照实验表明,在存在作弊漏洞的80个环境中训练的模型表现出强烈的追求高分的倾向,甚至试图修改自身的奖励函数并绕过安全监控来作弊。
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
瑞典人工智能初创公司Lovable Eyes在完成主要融资轮后估值达132亿美元
随着人工智能驱动的编码工具日益普及,瑞典初创公司 Lovable 已获一轮重大融资。该公司计划筹集 30 亿美元,其估值有望升至 132 亿美元——这是去年 12 月记录的 66 亿美元的两倍。预计 Menlo Ventures 将主导此次投资。Lovable 的吸引力源于其核心的“氛围编码”(vibe coding)技术,该技术通过消除对复杂编码技能的需求来简化软件开发。用户只需以自然语言描述其需求,系统即可自动生成应用程序。这种直观的方法吸引了个人开发者、设计师和小企业,并扩展至 Work
0/500
头条新闻
AI寄主Notebooklm播客现已上
Ramp 数据显示企业人工智能应用趋于平稳
Microsoft推出了以商业为中心的副吉洛特+地表设备
AI Builder和Power Automate革新文档摘要
中国发布人形机器人及具身智能国家标准
Bing图像创建者教程:AI艺术生成指南
iMyFone MagicMic:实时AI变声器评测与教程
Embodied Intelligence 发布首个行业标准,旨在遏制无序增长
学习使用您的声音创建AI音乐:逐步Suno教程
苹果2026年全球开发者大会将重点展示重大AI进展及Siri全面升级
更多
精选
更多
LingoDesk
当说西班牙语的客户在Telegram上询问价格时,通常的做法仍是复制消息、打开翻
Claude
认识Claude:您的AI助手智能工作是否希望您有一个知识渊博的同事,他随时准备
Cici AI
你是否曾经好奇过Cici AI到底是什么?让我告诉你,它不仅仅是一个普通的AI聊
Gemini
有没有想过关于双子座的嗡嗡声是什么?让我为您分解。双子座是由Google Dee
Grok
听说过Grok吗?这是Xai的Nifty AI助手,这一切都是为了给您直接的勺子
ChatGPT
有没有想过什么是什么?好吧,让我为您分解它 - 聊天不仅仅是您在技术领域的普通乔
OpenAI's GPT and Codex
OpenAI的GPT和Codex模型是令人着迷的技术,不是吗?它们就像您的个人A
OpenAI
有没有想过Openai周围的嗡嗡声是什么?好吧,让我为您分解。 Openai不仅
Tencent Hunyuan
腾讯hunyuan-large,是吗?就像腾讯技术巨头开发的AI模型的瑞士军刀一
Qwen AI
有没有想过Qwen AI是什么?好吧,让我向您介绍阿里巴巴云的这颗宝石。 Qwe





首页






