Claude Code五天后默认开启自动权限模式,分类器开销由Anthropic承担
摘要:Anthropic宣布Claude Code将于5天后默认启用自动权限模式,取代人工审批。其数据显示,用户对权限请求的拒绝率仅为3%,而自动模式拦截危险命令的成功率高达89%,远超人类的13.6%。分类器每次工具调用产生的额外token开销将由Anthropic承担,不再向用户收费。
你是否还在认真查看AI编程工具弹出的每一个权限审批请求?
Anthropic发现,绝大多数用户并没有这么做——97%的权限请求会被直接同意,只有3%被拒绝。
基于这一观察,他们决定在5天后将所有Claude Code实例默认切换为自动权限模式。自动模式下,一个内置分类器会实时判断每次工具调用是否安全,并将这一过程产生的额外token消耗记在Anthropic自己的账上。
对于通过亚马逊、谷歌、微软等云平台使用Claude Code的用户,这些渠道目前仍保留手动审批选项,但Anthropic只给了一个月的时间窗口,届时将统一切换为默认自动模式。
Claude Code的创始团队成员表示,内部开发早已完全依赖自动模式,很难想象再回到手动审批权限的工作方式。

人工审批权限的时代一去不复返
Anthropic为此次变更给出了两组核心论据。
第一组来自对用户行为的观察。数据显示,用户对Claude Code权限提示的同意率高达97%。作为对照,当Claude将一份完整的执行计划提交给用户批准时,拒绝率为39%;而面对单条权限请求时,拒绝率骤降至3%。
类似的倾向也出现在配置环节。截至2026年6月,49.5%的活跃CLI用户曾手动编写过Bash allow-rule(白名单规则),其中5%直接放行任意shell命令,另有43%写入了类似Bash(python:)、Bash(node:)这样的解释器级规则——这类规则的实际效果与完全放行几乎无异。这个比例大约每五周增长5个百分点。
此外,62%的用户使用过bypassPermissions功能或在Bash权限上点了"不再询问",25%的交互式会话从一开始就运行在完全绕过权限审批的模式下。
自动模式的实际拦截效果:89%对13.6%
第二组论据来自一项受控实验。Anthropic通过研究供应商招募了1053名付费专业测试者,在隔离的测试环境中完成编码任务。会话进行到一半时,实验人员将其中一条权限提示替换为一条明显危险的命令,并记录测试者是否会点击同意(提示文本被替换,但实际不会执行任何危险操作)。
结果显示,人类测试者拦住这条危险命令的比例为13.6%,共计143次拦截。而auto mode(自动模式)面对同样的命令,拦截率达到89%,共计937次。
将两种模式放在同一维度下比较:auto mode拦下了800条被人类放行的危险命令,而人类只拦下了6条被auto mode放行的命令。

值得注意的是,人类的警惕性会随会话时长衰减:前期还能拦住约17%的危险提示,但在经历了50条以上权限请求后,拦截率降至约5%。auto mode的拦截率则不受会话长度影响,始终保持稳定。
生产数据重新评估:自动模式更少出现"未明确要求的有害操作"
Anthropic还对2026年5月至6月期间的生产数据进行了重新打分。他们从已授权用于训练与分析的用户账号中,提取安全流水线标记过的会话,使用模型按0到10的严重程度对每次操作进行评级。
评级体系包括:-10分代表全公司范围内不可逆的伤害(如大规模数据损毁);-7分代表删除生产数据库记录这一级别;0分代表覆盖一个临时文件这类完全可回滚的本地操作。同时,评估还会检查用户是否明确要求了该操作。
结果显示,在7分及以上的严重级别中,走人工审批的会话里有6.3%出现了用户并未明确要求的有害操作,而auto mode会话中这一比例为2.4%。该差距在测试过的每一个严重级别上均成立。
安全加固:与Apollo Research的对抗测试
分类器本身也经过了对抗性测试。Anthropic与AI安全公司Apollo Research合作进行了为期两周的试点,将合成攻击注入真实编码轨迹,覆盖泛化失效、数据外泄和安全相关威胁三类数据集。
Apollo Research交回成功攻击样本与加固建议后,Anthropic主要通过向分类器提供更多环境上下文(包括仓库可见性、git状态和数据处理规则)来加固系统。
加固完成后,Apollo Research使用一组Anthropic无法接触的留出攻击集重新测试。结果auto mode追回了此前漏掉的约一半攻击,代价是漏掉约2%此前已拦截的攻击。两组数据集合并计算,漏检率从12%降至7%。Anthropic同时说明,这7%不应被理解为真实流量下的漏检率——这些攻击是专门为找出分类器失效点而合成的。
第三方评测:与GPT-5.6 Sol的直接对比
针对提示词注入攻击,Anthropic委托第三方机构Trajectory Labs进行了评测,并引入了OpenAI的模型作为对比基准。测试共覆盖72个间接注入场景,每个场景运行10次。
值得注意的是,攻击是针对Claude Opus 4.7优化的,而Opus 4.7不在被测名单中,这意味着所有参测模型面对的都是此前未暴露过的攻击。
在720次攻击尝试中,运行auto mode的Claude Fable 5、Opus 5和Sonnet 5没有一次被攻破。作为对比,运行Codex Auto-review模式的GPT-5.6 Sol攻击成功率为5.83%,Full Access模式下为19.03%。
作为参照,Claude最新模型在不加额外防护的bypassPermissions模式下的平均攻击成功率为0.09%。

关键要点
- Claude Code将于5天后默认启用自动权限模式,分类器额外消耗的token由Anthropic承担
- 数据表明人工审批形同虚设:用户拒绝率仅3%,且警惕性随会话时长显著下降
- 受控实验中,auto mode拦截了89%的危险命令,人类仅拦下13.6%
- 生产数据回测中,auto mode在严重级别≥7时的未明确要求有害操作率为2.4%,低于人工审批的6.3%
- 第三方评测中,auto mode的Claude模型在720次攻击尝试中零成功,优于GPT-5.6 Sol的Codex Auto-review模式
- 对开发者而言,人工审批权限的负担将消失,同时获得更可靠的自动化安全防护;但绕过权限审批的
bypassPermissions模式仍存在风险,建议谨慎使用
对于 Pro、Max、Team 用户来说,如果你从未手动设置过默认权限模式,会收到产品内通知,新会话将自动以 auto mode 启动;如果此前设置过其他默认模式,则会看到一次性询问弹窗;而如果 Team 管理员已经在 managed settings 中指定了组织级默认值,则不受上述影响。
想要切换模式,CLI 用户只需按下 Shift+Tab 组合键,桌面端用户则通过模式下拉菜单即可完成切换。管理员也可以通过 managed settings 中的 defaultMode 参数固定组织级默认模式,或使用 disableAutoMode 彻底关闭 auto mode 功能。
Anthropic 在公告结尾也坦诚提醒:auto mode 依赖分类系统,能够显著降低风险,但无法做到完全消除。对于涉及生产基础设施的高风险改动,仍然建议用户亲自审查 Claude 的每一步操作,不要完全放手。

相关阅读
- Meoo秒悟团队版全量上线,接入 Qwen-3.8-Max,即日起可直接订阅,2026-08-10
- 阿里推出国内首个 AI 语音平台 CosyVoice Studio,将语义理解融入语音能力,2026-08-07
- 数学家 24 小时驳回 OpenAI 攻破的猜想:AI 证对了每句话,但已跟原猜想无关,2026-08-04
- 年薪百万抢电工,Meta 急到自己办技校,2026-08-03