当AI比人类更懂安全:Claude Code自动模式背后的信任悖论
当一台机器能拦住89%的危险操作,而审批权限的人类却放过了三分之一的威胁,我们到底该信任谁?

为什么人类守不住这道门
Scalex.dev最近做了个挺有意思的实验。他们让人类在4万次游戏运行里审批AI的操作指令,结论是:人类错过的威胁比例高达三分之一。
别急着骂人不负责任。问题出在一个叫approval fatigue的东西上。
你想想,一天几百条Agent请求等着你批。前十条你认真看,三十条以后开始扫关键词,到一百条基本就是无脑”允许”了。人脑本来就不是干这活的。跟流水线工人疲劳出错一个道理。
更麻烦的是,很多Agent指令单看完全无害。”读个config.json”、”装个依赖包”、”建个临时目录”,哪条拿出来都合理。但串在一起,可能就是一条完整的数据外泄链路。在这种粒度上保持警觉?尤其是日志刷屏速度每秒好几条的时候?别逗了。
我猜Anthropic那13.6%里,大部分是测试刚开始那会儿的参与者。做到后面,谁还有精力一条条看。
自动模式具体改了啥
Claude Code自动模式的核心改动就一句话:默认从”人工审批”变成”AI自主执行,异常时暂停”。
具体分三层:
- 低风险操作直接干:读文件、搜代码、调已授权API
- 中风险操作自己判断:写文件、跑测试、改配置,Claude根据上下文决定
- 高风险操作先说再做:删文件、发网络请求、系统级操作,Claude会停下来解释,等你确认
比之前每次都点”允许”的模式精细多了。其实之前那种模式挺粗放的,它假设”有人审批=安全”,这个假设已经被数据打穿了。
Trajectory Labs那720次间接提示注入攻击的零通过记录值得关注。间接提示注入的意思是,攻击者不直接在对话里跟AI说”删掉所有文件”,而是通过外部数据——比如一个被污染的配置文件——让AI执行恶意指令。自动模式能全部挡住,说明Claude在判断”这个操作该不该做”这件事上,确实比大多数人类审批者靠谱。
但有个更深层的问题我绕不开
自动模式比手动审批更安全,这个结论我基本认。但让我不太舒服的是:我们正在把”什么是安全的”这个判断权交给AI本身。
Anthropic说Claude能挡89%的危险操作,这是基于他们自己的测试集。测试集能覆盖真实世界的攻击面吗?实验室里拦住89%,放到生产环境面对零日攻击、供应链污染的时候呢?不知道。
还有个更现实的问题:Anthropic同时是Claude的开发者和安全评估的执行者。数据当然好看——但如果哪天出了事,谁来审?评估过程够不够透明?
我倒不是说Anthropic在骗人。但”让AI自己证明自己安全”这个结构,天然就有利益冲突。你不能让制药公司既做研发又自己批药,对吧?
整个行业缺一个独立的第三方安全审计机制。不是说OpenAI、Anthropic、Google不靠谱,而是任何系统的安全评估都该由独立机构来做。这是最基本的治理常识,但AI行业到现在还没建立起这套东西。
开发者该怎么选
回到日常。Claude Code自动模式对开发者到底意味着什么?
说几句实际感受:
- 效率确实会高。之前每条操作都要审批,做个refactoring涉及几百个文件操作,每条等确认,真的折磨人
- 审批模式的信任成本其实很高。用了一阵子之后,很多开发者自己也变成了”无脑同意”的人,安全机制等于摆设
- 但自动模式不是万能的。敏感数据、金融交易、对外服务的API,这些场景下你仍然应该手动审批,或者用更严格的安全策略
| 模式 | 适用场景 | 安全级别 | 效率 |
|---|---|---|---|
| 手动审批 | 生产环境、敏感项目 | 高(理论上的) | 低 |
| 自动模式 | 日常开发、个人项目 | 中高 | 高 |
| 混合模式 | 生产+开发并行,分项目配 | 可调 | 中 |
我的建议很简单:不碰生产环境的话,自动模式值得一试。管生产环境部署和权限的话,保持手动审批或者用细粒度策略配置。别偷这个懒。
这不是孤立事件
Claude Code自动模式只是一个大趋势里的一朵浪花。
最近发生了不少相关的事:Docker发了Sandboxes,专门给AI Agent做一次性隔离沙箱;Needle2只有14MB大小,能在手机和手表上跑Agent;GitHub Models直接退役了,传说是免费Token被编程Agent吃太多,成本撑不住了。
方向很明确:AI Agent正在从”需要人类全程盯着”的阶段,快速走向”自主执行,事后审计”。
这事儿好坏参半。效率确实会上一个台阶,企业里从代码review到运维操作,Agent都能做得更快更一致。但问题在于,”谁在控制什么”这件事变得越来越模糊。Agent在自动模式下跑了几千次操作,某一次出了问题,你甚至不知道是哪一步开始的。

最后几句
Claude Code把自动模式设为默认,本质上是对”人工审批=安全”这个假设的一次纠错。数据摆在那里:人类守门员的表现确实不如AI自己守门。
但纠正一个错误假设远远不够。行业还缺四样东西:
- 独立的第三方安全审计机制
- 透明的评估数据和测试集
- Agent权限管理的行业标准
- 开发者对Agent行为的可观测性工具
这些现在基本全是空白。Anthropic往前迈了一步,值得肯定,但路还很长。
说真的,我们需要AI来保护我们免受AI的伤害。这大概就是2026年的现实。