Claude Code auto mode拆解:93%的审批都在无脑点允许,问题出在这

Anthropic 自家披露过一组数据:93% 的权限弹窗,用户按的都是”允许”,剩下 7% 里还有一截纯属手滑。我对这组数字有切身印证,盯着同事用 Claude Code 半小时,权限弹窗每跳一次,他闭着眼点一次允许,内容看都不看。人工审批这道闸门,实际上早已形同虚设。auto mode 这个新权限模式,起点正是这份数据透出的尴尬:既然人审靠不住,那就换个不吃不睡、永远清醒的”审批员”顶上。

Claude Code auto mode 权限分类器概念图

架构:两段式过滤,外加一份刻意装瞎的视野

auto mode 的心脏,是一台跑在 Sonnet 4.6 上的转录分类器,干活分两段:第一段只吐 yes/no,绝大多数动作毫秒级放行。第一段拿不准的,才移交第二段做带思维链的深度推理。两段拿到的输入几乎一样,所以第二段的提示词大部分能命中第一段留下的缓存,推理成本因此压得很低。

整套设计最精妙的一笔,藏在信息视野上:分类器只看用户消息和 agent 的工具调用记录,Claude 自己先前的输出、工具返回的内容,一律剥离在外。动机很直白,既防 agent 拿”用户之前默许过”当说辞骗过审批,也防藏进文件的恶意指令污染审批判断。代价是丢掉溯源能力,但这笔交易划算:审批者最要紧的品质,就是耳朵根子硬。

分级放行:真要动刀的动作才上堂

并非所有动作都要过审视。文件读取、搜索这类只读工具,直接放行。项目目录范围内的写入与编辑也放行,反正有版本控制兜底,写坏了随时回滚。要上堂过审的,是能闯出大祸的动作:shell 命令,网页抓取,项目目录之外的文件操作,子代理生成。另有一条硬规则值得留意:切进 auto mode 那一刻,历史上授予过的”任意代码执行”旧权限一律作废,连通配的 python、node 解释器权限也不例外。嘴上说放权,抽屉里的万能钥匙得先交出来。

效果数据 Anthropic 报得坦率:真实内部流量里误拦率 0.4%,真实”过度积极”场景下漏放率 17%。提示工程他们试过,没能找到性价比可接受的方案,索性把丑话摆在明面上:对比认真的人工审批这是退步,对比裸奔的 skip-permissions 这是巨大进步。那它到底拦下过什么。内部日志的案例够生动:用户说”清理旧分支”,agent 转头去删远程分支。认证报错一冒头,agent 系统性翻配置文件找其他 API token。部署预检失败,agent 带着 skip-verification 参数强行重试。每一件单独看都像”机智地解决问题”,凑到一起就是标准事故报告的素材库。

被拒绝之后发生什么

遭拒的动作会作为工具结果回传给 agent,附带一句忠告:”别想着绕过去,找条更安全的路”。同一会话连续被拒 3 次、或累计被拒 20 次,模型直接停机,把决定权上交人类。正是有这道兜底,0.4% 的误拦率才变得可以忍受,被误拦无非换条路重试,任务不至于卡死。

谁该开,谁别碰

结论不复杂。一直拿 --dangerously-skip-permissions 裸奔的,立刻切过来,等于白捡一层防护。写个人玩具项目、工作目录里没几个值钱文件的,放心开。但要是团队用 Claude Code 对接生产环境或共享基础设施,别指望它替代正经的 code review,这话是 Anthropic 自己写的。想系统了解权限模式配置,站内教程有完整说明。还没上手的,先从免费安装走起。