Anthropic 修正 Fable 5 生物學誤判:生物類 fallback 降約 85%,高風險限制原封不動
Anthropic 於 2026 年 8 月 7 日公布 Fable 5 生物學防護更新:重寫分類器 constitution 並重新訓練,使生物類 fallback 約減少 85%;各平台「總 fallback」預期降幅則為 Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%。病毒學、毒理學、分子設計等雙用途領域限制不變。這不是防護放寬,而是誤判修正。
Anthropic 於 2026 年 8 月 7 日發布〈Improving Fable 5's biology safeguards〉,修正生物學過濾的誤判:重寫分類器的 constitution 並重新訓練後,生物類 fallback 約減少 85%。fallback 指分類器判定提問落在高風險生物領域時,不讓 Fable 5 作答,改由 Opus 5 接手——官方措辭是「生物領域能力不及 Fable 5 的模型」,指該領域的能力上限。
先改規則,再依規則重訓
官方揭露三步:
- 重寫分類器 constitution,界定何者該擋、何者該放行;
- 蒐集內外部專家意見,補上臨床、教育、檢驗現場的判準;
- 依新規則產生訓練資料,重新訓練分類器。
重點是先改規範再改模型,不是調鬆門檻:有害內容偵測率不變,只降 false positive。
兩組數字量的不是同一件事
官方成效是兩組定義不同的數字:
- 生物類 fallback 本身:約減少 85%。
- 各平台「總 fallback」(含所有原因)預期降幅:Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%。
落差反映的是生物類提問佔該平台全部 fallback 的比重不同:Claude.ai 佔比高,總量降幅就大;Claude Platform 佔比低,故僅降約 7%。企業以 API 導入時感受到的改善,遠不如個人在對話介面明顯。官方未公布漏擋率變化,成效只有單邊資料。
沒放寬的是什麼
受惠的有四類:判讀檢驗報告、查詢症狀、生物學教育提問、臨床支援。但限制未鬆動:病毒學、毒理學、分子設計等雙用途領域與藥物開發提問,Fable 5 仍 fallback 到 Opus 5,理由是可能顯著助長生物武器發展。本質是誤判修正,非限制解除。
對管理者的意義
重點是把「誤判成本」當成一項成本:擋過頭的代價不進資安報表,而散落在醫療、實驗室、品保現場,員工只會抱怨工具難用。評估 AI 工具時,讓各部門各交十題日常問題,實測誤擋與漏擋各佔多少;只看能力 benchmark,量不到員工每天被打斷幾次。
大家怎麼說 · 3 則留言