概要

2026年7月,Anthropic连发两份报告,讲了一件看似矛盾的事。一份是《用Claude发现密码学弱点》,记录AI自主攻破了后量子签名算法HAWK和缩减轮数AES。另一份是《AI模型中两用知识的关闭开关》,提出GRAM方法,让危险知识可以像零件一样拆下来。攻与守,在同一个实验室里被推到了新边界。

AI攻破密码的速度对比

图注:Claude Mythos用60小时改写了人类专家两年没攻破的HAWK,AES攻击提速200-800倍

先说进攻那一面。HAWK是美国NIST正在第三轮审查的后量子签名候选方案,目的是在量子计算机出现后仍能保护数字签名。这份方案已经过两轮人类专家审查。而Claude Mythos Preview在一名非密码学专家的协助下,用大约60小时的自主工作,改进了对HAWK已知的最佳攻击,实际效果是把密钥强度砍半。

这不是小修小补。对小型HAWK-256做完整密钥恢复攻击的预期成本,原先估算是2的64次方量级,Mythos证明能做到2的32次方。整个过程花费约10万美元API成本,基本是AI自己跑完的。

第二个目标更有名。AES是2001年NIST采用的对称密码,几乎保护着所有互联网流量。Mythos攻击的是缩减到7轮的版本,完整版是10轮,但这种变体本身已被学术界反复研究。Mythos开发了一种叫"莫比乌斯桥"的指纹算法,把此前最佳的中间相遇攻击速度提高了200到800倍。

Anthropic在报告里说得很坦率:这两个结果目前不影响任何生产系统。HAWK还没被部署,缩减轮数AES也不是实际使用的密码。但信号是明确的。经过两年人类审查没被发现的缺陷,AI用一周就找到了。

再看守的那一面。问题根源在于,前沿模型本质是一个巨大的知识库,其中有些知识既能救命也能杀人。病毒学知识可以帮人开发疫苗,也可以帮人设计病原体。网络安全知识可以用来打补丁,也可以用来找漏洞。

目前的防护方式靠分类器和拒绝训练,也就是在输出端拦截。但Anthropic指出,这改不了模型底层存了什么。足够坚定的攻击者只要越狱成功,知识还在那里。

GRAM两用知识开关机制

图注:GRAM一次训练即可产出16种配置,四类两用知识各自独立开关

GRAM换了个思路。它在Transformer每一层添加额外神经元,分成若干模块,每个两用类别对应一个模块。训练时遇到通用文本,模型照常学习。一旦遇到病毒学这类两用文本,通用权重就冻结,只有病毒学模块参与学习。结果就是,病毒学知识只积累在那个模块里,不扩散到全网络。训练完成后,删掉模块,能力随之消失。保留它,受信任场景就能照常使用。

实验设了四个两用领域,病毒学、网络安全、核物理、一门小众编程语言。因为每个领域都能独立开关,一次训练就产出2的4次方、共16种配置。删除某个模块后,相应能力的移除效果跟从头过滤训练差不多彻底,而且不降低通用性能。

规模效应值得多说一句。GRAM在5000万到50亿参数的七种规模上都做过实验,模型越大,"模块开启"和"模块关闭"之间的差距越大。换句话说,想绕过防护的攻击者,随着模型规模变大要付出的相对成本更高。Anthropic还测了恶意微调能否恢复被删知识,GRAM的抵抗力与数据过滤相当。而传统的事后"遗忘"技术只是压制,少量微调就能翻出来。

需要说明的是,GRAM仍是早期研究,没在前沿规模或生产训练线上验证过,评估指标是next-token预测能力而非真实下游任务。两用能力与通用知识会不会纠缠到无法干净分离,这仍是开放问题。

把两份报告放一起看,趋势才完整。密码学那篇讲的是AI的进攻能力,一年前还做不到基本密码分析,现在能找到人类专家两年没发现的缺陷。GRAM那篇讲的是AI的自我管控能力,危险知识可以不再靠输出端拦截,而是从权重层面拆装。

源势AI的看法是,这两条线必须同步走。只讲AI能做什么,会高估它的安全性。只讲AI该防什么,会低估它的价值。我们在企业智能体落地中坚持一个原则,能力边界要可审计、可配置。不是笼统地说"模型安全",而是像GRAM那样,把每一类两用能力拆成可独立开关的模块,让部署方按场景选择开哪些、关哪些。进攻面的发现同样有正面价值。HAWK这类候选方案在部署前就被压力测试,恰恰是密码学建立信任的方式。怕的不是AI能找到漏洞,而是漏洞被找到时没有可控的披露流程。

Anthropic自己也点出了节奏问题。网络安全界已经在应对"AI发现漏洞的速度超过人类修复速度"的局面,学术密码学界很快会撞上同样的墙。人类研究员验证Claude的AES发现花了一个月,而Claude找它只用了一周。这个剪刀差还会继续扩大。

最后值得注意的一点。GRAM对规模的判断给了行业一个信号,模型越大,防护反而越容易收紧。这与很多人"模型越强越危险"的直觉相反。如果两用知识的隔离成本随规模上升而相对下降,那么前沿模型的部署就不只是能力竞赛,更是安全架构的竞赛。谁能把"可拆装的能力"做成基础设施,谁才真正能把模型放到生产环境里。

Anthropic密码学报告原文

图注:报告详述了HAWK与AES两项发现的技术细节与影响评估

**信息来源**
- Anthropic《用Claude发现密码学弱点》(Discovering cryptographic weaknesses with Claude),2026-07-28
- Anthropic《AI模型中两用知识的关闭开关》(An off switch for dual-use knowledge in AI models),2026-07-08