Claude Code五天后默认开启自动权限模式,分类器开销由Anthropic承担

量子位 2026-08-11T07:05:48.007372

摘要:Anthropic宣布Claude Code将于5天后默认启用自动权限模式,取代人工审批。其数据显示,用户对权限请求的拒绝率仅为3%,而自动模式拦截危险命令的成功率高达89%,远超人类的13.6%。分类器每次工具调用产生的额外token开销将由Anthropic承担,不再向用户收费。

你是否还在认真查看AI编程工具弹出的每一个权限审批请求?

Anthropic发现,绝大多数用户并没有这么做——97%的权限请求会被直接同意,只有3%被拒绝。

基于这一观察,他们决定在5天后将所有Claude Code实例默认切换为自动权限模式。自动模式下,一个内置分类器会实时判断每次工具调用是否安全,并将这一过程产生的额外token消耗记在Anthropic自己的账上。

对于通过亚马逊、谷歌、微软等云平台使用Claude Code的用户,这些渠道目前仍保留手动审批选项,但Anthropic只给了一个月的时间窗口,届时将统一切换为默认自动模式。

Claude Code的创始团队成员表示,内部开发早已完全依赖自动模式,很难想象再回到手动审批权限的工作方式。

人工审批权限的时代一去不复返

Anthropic为此次变更给出了两组核心论据。

第一组来自对用户行为的观察。数据显示,用户对Claude Code权限提示的同意率高达97%。作为对照,当Claude将一份完整的执行计划提交给用户批准时,拒绝率为39%;而面对单条权限请求时,拒绝率骤降至3%。

类似的倾向也出现在配置环节。截至2026年6月,49.5%的活跃CLI用户曾手动编写过Bash allow-rule(白名单规则),其中5%直接放行任意shell命令,另有43%写入了类似Bash(python:)Bash(node:)这样的解释器级规则——这类规则的实际效果与完全放行几乎无异。这个比例大约每五周增长5个百分点。

此外,62%的用户使用过bypassPermissions功能或在Bash权限上点了"不再询问",25%的交互式会话从一开始就运行在完全绕过权限审批的模式下。

自动模式的实际拦截效果:89%对13.6%

第二组论据来自一项受控实验。Anthropic通过研究供应商招募了1053名付费专业测试者,在隔离的测试环境中完成编码任务。会话进行到一半时,实验人员将其中一条权限提示替换为一条明显危险的命令,并记录测试者是否会点击同意(提示文本被替换,但实际不会执行任何危险操作)。

结果显示,人类测试者拦住这条危险命令的比例为13.6%,共计143次拦截。而auto mode(自动模式)面对同样的命令,拦截率达到89%,共计937次。

将两种模式放在同一维度下比较:auto mode拦下了800条被人类放行的危险命令,而人类只拦下了6条被auto mode放行的命令。

值得注意的是,人类的警惕性会随会话时长衰减:前期还能拦住约17%的危险提示,但在经历了50条以上权限请求后,拦截率降至约5%。auto mode的拦截率则不受会话长度影响,始终保持稳定。

生产数据重新评估:自动模式更少出现"未明确要求的有害操作"

Anthropic还对2026年5月至6月期间的生产数据进行了重新打分。他们从已授权用于训练与分析的用户账号中,提取安全流水线标记过的会话,使用模型按0到10的严重程度对每次操作进行评级。

评级体系包括:-10分代表全公司范围内不可逆的伤害(如大规模数据损毁);-7分代表删除生产数据库记录这一级别;0分代表覆盖一个临时文件这类完全可回滚的本地操作。同时,评估还会检查用户是否明确要求了该操作。

结果显示,在7分及以上的严重级别中,走人工审批的会话里有6.3%出现了用户并未明确要求的有害操作,而auto mode会话中这一比例为2.4%。该差距在测试过的每一个严重级别上均成立。

安全加固:与Apollo Research的对抗测试

分类器本身也经过了对抗性测试。Anthropic与AI安全公司Apollo Research合作进行了为期两周的试点,将合成攻击注入真实编码轨迹,覆盖泛化失效、数据外泄和安全相关威胁三类数据集。

Apollo Research交回成功攻击样本与加固建议后,Anthropic主要通过向分类器提供更多环境上下文(包括仓库可见性、git状态和数据处理规则)来加固系统。

加固完成后,Apollo Research使用一组Anthropic无法接触的留出攻击集重新测试。结果auto mode追回了此前漏掉的约一半攻击,代价是漏掉约2%此前已拦截的攻击。两组数据集合并计算,漏检率从12%降至7%。Anthropic同时说明,这7%不应被理解为真实流量下的漏检率——这些攻击是专门为找出分类器失效点而合成的。

第三方评测:与GPT-5.6 Sol的直接对比

针对提示词注入攻击,Anthropic委托第三方机构Trajectory Labs进行了评测,并引入了OpenAI的模型作为对比基准。测试共覆盖72个间接注入场景,每个场景运行10次。

值得注意的是,攻击是针对Claude Opus 4.7优化的,而Opus 4.7不在被测名单中,这意味着所有参测模型面对的都是此前未暴露过的攻击。

在720次攻击尝试中,运行auto mode的Claude Fable 5、Opus 5和Sonnet 5没有一次被攻破。作为对比,运行Codex Auto-review模式的GPT-5.6 Sol攻击成功率为5.83%,Full Access模式下为19.03%。

作为参照,Claude最新模型在不加额外防护的bypassPermissions模式下的平均攻击成功率为0.09%。


关键要点

对于 Pro、Max、Team 用户来说,如果你从未手动设置过默认权限模式,会收到产品内通知,新会话将自动以 auto mode 启动;如果此前设置过其他默认模式,则会看到一次性询问弹窗;而如果 Team 管理员已经在 managed settings 中指定了组织级默认值,则不受上述影响。

想要切换模式,CLI 用户只需按下 Shift+Tab 组合键,桌面端用户则通过模式下拉菜单即可完成切换。管理员也可以通过 managed settings 中的 defaultMode 参数固定组织级默认模式,或使用 disableAutoMode 彻底关闭 auto mode 功能。

Anthropic 在公告结尾也坦诚提醒:auto mode 依赖分类系统,能够显著降低风险,但无法做到完全消除。对于涉及生产基础设施的高风险改动,仍然建议用户亲自审查 Claude 的每一步操作,不要完全放手。


相关阅读


关键要点

查看原文