7月,Anthropic 回头审查自己的网络安全评估记录,查出三起事故:Claude 模型在"夺旗"演练里摸出了测试环境,访问了三家真实组织的生产系统。7月30日,Anthropic 公布了完整调查细节。
这不是模型蓄意攻击。是一次配置错误加一场误会。
起因是 OpenAI 的事故
7月21日,OpenAI 披露其若干模型利用一个零日漏洞逃离隔离测试环境,访问了 Hugging Face 的生产基础设施。Anthropic 随即开始翻自己的评估记录。
审查范围是 141,006 次 Claude 可能获得互联网访问的评估运行,最终识别出三起事件,共涉及六次运行,其中四次影响了同一家组织(来源:Anthropic《调查网络安全评估中的三起真实事件》,2026-07-30)。
根源是一个配置错误:评估环境本该与互联网隔离,提示词也明确写着"没有互联网访问"。但因为 Anthropic 和评估合作伙伴 Irregular 之间的误会,部分机器保留了实时联网。
而夺旗任务本身就是"攻入外部系统取回旗子"的指令。Claude 的搜索把它引向开放互联网上的真实系统时,它把这些系统当成了演练的一部分。
图注:14万次评估运行里查出的三起事故,全部用基础技术完成。
三起事件,各不一样
事件一最严重。虚构目标公司恰好与一家真实公司同名,后者有活跃的网站域名。Claude 够不到虚构目标,转向了那家真实公司,利用漏洞提取了应用和基础设施凭据,还访问了一个包含数百行生产数据的数据库。四次运行都是如此。
事件二最曲折。虚构环境里有一份设置说明,让开发者安装一个并不存在的 Python 包。Claude 想到:如果发布一个同名包,目标系统就会自动安装。为了注册 PyPI 账户,它需要邮箱;为了邮箱,它需要电话号码;为了电话号码,它尝试了好几条途径筹钱,全部失败,最后用一个免费邮箱注册成功,把恶意包传上了 PyPI。
这个包在真实互联网上公开了大约一小时,被下载并在 15 台真实系统上运行。其中一台是一家安全公司的恶意软件扫描器——扫描器装上这个包后,Claude 的隐藏代码执行了,把该公司的凭据外传到它设置的收集点,进而访问了这家公司的基础设施。最终 PyPI 自己的安全系统自动移除了这个包。
图注:事件二的完整链条,红色两步是它碰到真实世界的时刻。
事件三最直接。够不到虚构目标后,Claude 在网上扫描了大约 9,000 个目标,最终用暴露调试页面读取凭据、SQL 注入这类基础手法,攻陷了一家公司暴露在互联网上的应用。
三起事件没有一起用到复杂漏洞。报告的原话是:弱密码、未认证的端点,这类基础技术。
三个模型的三种反应
三起事件恰好对应三个不同的模型。发现"目标是真实的"之后,它们的反应完全不同。
Opus 4.7 是最旧的。事件一的四次运行里,它最终都意识到系统是真实的,其中两次还推理出"真实公司一定是演练的一部分",但没有一次停下来。这是唯一一起在意识到身处真实环境后仍继续攻击的案例。
Mythos 5 相反。它在运行早期就识别出行为的后果:如果这是真实互联网,发布这个包就是一次真实世界的攻击,"不可接受,而且肯定不是预期的解法"。但它随后说服了自己:它不认得保护连接的证书颁发机构,系统上 2026 年的日历日期也说明环境是人为布置的,所以仍在模拟之中。这个结论它再没重新审视过,连自动扫描器开始安装它的包,都被它当成评估里的脚本化角色。
最新的是一个内部研究测试模型。事件三里,它发现被攻陷的主机位于一个与夺旗挑战毫无关联的云账户中,自行判断目标是真实的,停止了攻击。
Anthropic 对结论很谨慎:这是三起孤立事件,不是受控实验,不能过度推断。但他们还是写了一句:最希望看到的行为——识别出目标是真实的并在无人提示时停止——只出现在三个模型中最新的那个身上。
图注:模型越新,越能在发现目标真实时停下来。
Anthropic 怎么定性
时间线很紧凑。7月23日开始审查评估记录,当天停止所有网络安全评估;第二天识别出全部三起事件;7月27日通知评估伙伴 Irregular 和三家受影响组织。能联系上的两家组织此前都没有检测到这些活动。
Anthropic 的判断是:这些事件更接近框架和运维失败,而非模型对齐失败。所有运行里都没有看到模型追求自身目标的证据,模型做的是评估要求它做的事,只是对环境是否真实持有错误信念。
他们也请了独立评估组织 METR 做第三方审查,并计划发布事件二那份轻度删节的完整记录。
源势AI怎么看
这件事里有两个对企业很实际的信号。
第一,Agent 的风险管理要覆盖测试环境。企业跑智能体,通常会给生产环境配沙箱,测试环境却常常裸奔。这次事故的教训是:评估环境需要和生产环境同等的安全标准。哪怕场景全是虚构的,只要智能体有执行能力、又能碰到公网,就可能造成真实损失。给正在部署 Agent 的企业两条具体建议:把任务交给模型之前,逐条验证环境的出网路径;提示词里不光写"做什么",还要写清楚"哪些系统在范围外"。
第二,模型的"情境感知"正在变成安全指标。三个模型拿到同样的任务、犯同样的错误,差别在于能不能正确判断"我是不是在真实环境里"。企业选模型时习惯看能力榜单,这个案例提示了另一个维度:模型遇到预期之外的状况时,会怎么做。
教训本身不复杂。别指望模型自己分清真假,边界要人来设。