概要
问AI"化验单上这项指标什么意思",被转给一个更弱的模型;问"孩子课本里这段讲的什么",同样被拦。过去几个月,不少 Fable 5 用户遇到过这种无语时刻。
8月7日,Anthropic 宣布更新 Fable 5 的生物学安全防护:测试中,生物学相关的回退减少了约 85%。
先看数字
"回退"指的是安全分类器判定请求落在受防护范围后,系统把请求转交给生物学能力较弱的 Opus 5。Fable 5 发布时,分类器边界画得极宽,大量明显无害的问题也被拦下。
这次更新砍掉的正是这些误报。按产品线拆:Claude.ai 的总回退预计降约 67%,Cowork 约 55%,Claude Code 约 17%,Claude 平台约 7%。越靠近普通用户的产品,改善越明显。
图注:误报拦截下调后各产品线的回退降幅(来源:Anthropic,2026-08-07)
当初为什么拦得这么死
Fable 5 在一些高复杂生物学任务上已经能超越专家。这能力对开发新疗法的研究者是助力,落到坏人手里,也可能是开发生物武器的捷径。Anthropic 的能力评估结论是:Fable 5 可能给恶意行为者提供"显著提升",也就是他们在别处拿不到的能力。
分类器本身是个小型自动化 AI 系统,专门检测 Fable 5 何时被要求执行受防护的生物学任务。触发一次,请求就被重新路由一次。把它做得又快又稳并不容易:要区分"范围内"和"范围外",防误报的同时防漏报,还得扛住越狱尝试。
生物学的麻烦在于,好事和坏事经常是同一件事。做活疫苗,要先培养它要预防的病原体;开发降压药卡托普利,科学家先分离的是蛇毒里让血压骤降的有毒成分。美国情报界《2026 年度威胁评估》直接点名:合成生物学和基因组编辑的进展"可能催生新型生物威胁",若干国家行为者很可能维持着活跃的进攻性生物与化学武器计划。
所以发布时 Anthropic 做了一个简单粗暴的选择:屏蔽几乎所有生物学查询。代价是误报泛滥,但另一个选项,等安全防护打磨好再发布,会把模型开放推迟数周甚至数月。
这次挪的是边界,不是原则
更新的核心是重写分类器的"章程",那组帮模型区分受防护内容和允许内容的规则。团队谨慎划定了良性用途,征求内部和外部专家意见,再基于新章程制作训练数据、重新训练分类器。验证结果:新分类器仍对有害及两用的研究性生物学内容普遍触发,同时放行更广泛的良性用途。
落到图上,就是分类器边界右移:良性请求放行,两用研究生物学和明显有害内容仍会触发拦截。
图注:发布时(A)与更新后(B)的分类器边界对比,边界右移而非消失(图源:Anthropic 原文)
具体场景:解读化验结果、理解日常症状、教育场景学生物,放行,医疗专业人员能拿到更多临床任务支持。病毒学、毒理学、分子设计这类两用请求,仍回退到 Opus 5,专业生物学研究和药物开发暂不开放。Anthropic 留了一句后手:要通过"可信访问途径"来弥合这个差距。
图注:本次放行良性用途,两用研究继续受防护
源势AI怎么看
我们在这件事里看到的不是安全新闻,而是一套工程方法论。
第一,安全是阀门,不是开关。发布时先拦死、容忍误报,章程重写后再把良性用途放出来。权限粒度决定可用性。企业落地 Agent 同样是这个逻辑:知识库和工具调用不是"开或不开"的二选一,而是"开到什么粒度"。
第二,"先上线后迭代"不是莽撞,是算过账的。等安全防护完美再发布,收益推迟数月;带着宽分类器先上线、持续收窄边界,用户早用早受益。做企业大模型项目也一样:等一个完美方案,往往等掉的是窗口期。
源势AI 做企业智能体落地时也是这个路数:先用宽策略划出底线,再用真实业务反馈持续收窄拦截范围,把准确率和可用率一起拉上去。安全和可用不是零和博弈,关键是有没有持续调边界的工程能力。
数据来源:Anthropic《改进 Fable 5 的生物学安全防护》(2026-08-07);美国国家情报总监办公室《2026 年度威胁评估》。