Anthropic 修正 Fable 5 生物学误判:生物类 fallback 降约 85%,高风险限制原封不动
Anthropic 于 2026 年 8 月 7 日公布 Fable 5 生物学防护更新:重写分类器 constitution 并重新训练,使生物类 fallback 约减少 85%;各平台「总 fallback」预期降幅则为 Claude.ai 约 67%、Cowork 约 55%、Claude Code 约 17%、Claude Platform 约 7%。病毒学、毒理学、分子设计等双用途领域限制不变。这不是防护放宽,而是误判修正。
Anthropic 于 2026 年 8 月 7 日发布〈Improving Fable 5's biology safeguards〉,修正生物学过滤的误判:重写分类器的 constitution 并重新训练后,生物类 fallback 约减少 85%。fallback 指分类器判定提问落在高风险生物领域时,不让 Fable 5 作答,改由 Opus 5 接手——官方措辞是「生物领域能力不及 Fable 5 的模型」,指该领域的能力上限。
先改规则,再按规则重训
官方披露三步:
- 重写分类器 constitution,界定何者该拦、何者该放行;
- 收集内外部专家意见,补上临床、教育、检验现场的判准;
- 按新规则生成训练数据,重新训练分类器。
重点是先改规范再改模型,不是调松门槛:有害内容检测率不变,只降 false positive。
两组数字量的不是同一件事
官方成效是两组定义不同的数字:
- 生物类 fallback 本身:约减少 85%。
- 各平台「总 fallback」(含所有原因)预期降幅:Claude.ai 约 67%、Cowork 约 55%、Claude Code 约 17%、Claude Platform 约 7%。
落差反映的是生物类提问占该平台全部 fallback 的比重不同:Claude.ai 占比高,总量降幅就大;Claude Platform 占比低,故仅降约 7%。企业以 API 接入时感受到的改善,远不如个人在对话界面明显。官方未公布漏拦率变化,成效只有单边数据。
没放宽的是什么
受益的有四类:判读检验报告、查询症状、生物学教育提问、临床支持。但限制未松动:病毒学、毒理学、分子设计等双用途领域与药物开发提问,Fable 5 仍 fallback 到 Opus 5,理由是可能显著助长生物武器发展。本质是误判修正,非限制解除。
对管理者的意义
重点是把「误判成本」当成一项成本:拦过头的代价不进信息安全报表,而散落在医疗、实验室、质保现场,员工只会抱怨工具难用。评估 AI 工具时,让各部门各交十道日常问题,实测误拦与漏拦各占多少;只看能力 benchmark,量不到员工每天被打断几次。