Claude Code 自动模式将于 8/14 起成为默认:AI 代理的把关者从人换成分类器
Anthropic 于 2026-08-07 预告,Claude Code 自动模式将自 8/14 起成为 Pro/Max/Team 的默认值,改由分类器拦截不可逆与破坏性动作。对照研究显示人工审批仅拦下 13.6% 危险指令,自动模式为 89%。
Anthropic 于 2026 年 8 月 7 日发布公告〈Auto mode is now the default in Claude Code for Pro, Max, and Team plans〉,宣布 Claude Code 的“自动模式”(auto mode)将成为默认运行方式,并同步提供〈Running auto mode in production〉实务指南。必须先说清楚:这是一则预告。公告日为 8 月 7 日,生效日为 8 月 14 日,在此之前并未上线,读者请勿理解为“现在已经可以这样用”。
机制:从“每步问人”翻成“分类器把关”
先厘清一个容易误读之处:自动模式并非这次才问世。它在 2026 年稍早已以 opt-in 形式开放,Adobe、Nuro、Gusto、Garner Health 等团队早已把它设为 production 的默认用法。本次新闻的重点不是“推出新功能”,而是默认值的翻转——从“人逐步审批”翻成“自动模式先行”。
在此之前,Claude Code 的安全设计是在敏感操作前弹出审批提示,由用户逐次点击同意。8 月 14 日之后的默认值改为:每一次工具调用都先经过一个分类器,专门拦截三类动作——不可逆的、具破坏性的,以及指向用户环境以外的。被拦下时,Claude 通常会改走更安全的替代路径,或退一步转为请求人工审批。
为避免模型被拦后反复硬闯,官方同时设了回退规则:
- 连续 3 次被分类器拦下,自动回退为人工审批模式。
- 单个 session 累计被拦 20 次,同样自动回退为人工审批模式。
数据:人一直点“同意”,其实拦不住
Anthropic 公布了一组反直觉的实测。在 1,053 名付费测试者参与的对照研究中:
- 人工审批模式仅拦下 13.6% 的危险指令;自动模式为 89%。
- 另据真实 session 分析,人工审批组出现非预期损害(production 级别严重度)的比例为 6.3%,自动模式组为 2.4%。
- 更直观的是使用行为:97% 的审批提示最后被用户点了同意,62% 的用户用过 bypassPermissions 或“不再询问”。
这组数字指向的不是“AI 比人聪明”,而是审批疲劳:当提示每分钟弹出数次,人的判断会退化成反射性点击,关卡形同虚设。机器把关之所以更严,是因为它不会累、不会为了赶工放行。
适用范围、控制权与费用
8 月 14 日改为默认的只有 Pro、Max、Team 三种方案。Enterprise、Claude API 以及云端伙伴部署暂时维持 opt-in(需自行开启),官方表示会在未来一个月内跟进。
控制权仍在用户与管理员手上:个人可在 CLI 按 Shift+Tab、或用下拉菜单随时切换模式;企业管理员可通过受管配置的 defaultMode 为全组织锁定默认值,或以 disableAutoMode 整体关闭。费用方面,自公告日起,Anthropic 停止向 Pro/Max/Team 收取分类器所耗的少量额外 token 费用。
对管理者的意义
这是 AI 代理治理的一道分水岭:默认值从“人每步审批”翻成“机器把关、人设边界”。管理者真正该处理的不是选边站,而是三个决定:
- 自家组织的
defaultMode要锁在哪一档。 - 哪些高风险团队应该直接关闭自动模式。
- 既有的审批流程要不要跟着重设边界。
还有更根本的一题:公司内部既有的“人工审批”流程,是真的在把关,还是早已是审批疲劳下的橡皮图章?这则新闻值得拿去照一照的,不只是 AI 工具,还有你签了十年的那些审批单。