Anthropic宣布,自2026年6月起,Claude Code将全面默认启用Auto Mode——这一重大变更并非简单功能切换,而是基于长达数月的多维度安全验证与行为研究。团队对2026年5–6月间授权数据中的真实会话开展回溯性风险重评:采用-10(全公司级不可逆损害)至0(完全可回滚的本地临时操作)的精细化严重度量表,并同步评估用户指令明确性。数据显示,在严重度≥7的高危场景中,人工审批流程下6.3%的会话执行了用户未明确要求的有害操作,而Auto Mode仅为2.4%,且该优势在所有严重等级上均稳健成立。
为验证防御鲁棒性,Anthropic联合AI安全机构Apollo Research开展对抗测试:向真实编码轨迹注入涵盖泛化失效、数据泄露与安全威胁三类合成攻击。加固策略聚焦增强分类器环境感知能力——整合仓库可见性、Git状态及数据处理规则等上下文。经独立留出集复测,Auto Mode漏检率从12%显著降至7%,代价仅是约2%的误拦率小幅上升;需强调的是,该7%系针对刻意构造的边界攻击,不等同于生产环境实际风险水平。
第三方Trajectory Labs主导的提示词注入评测进一步佐证其可靠性:在72种间接注入场景(每场景10次运行,共720次攻击)、且全部模型均面对未见过的Claude Opus 4.7定制化攻击时,Claude Fable 5/Opus 5/Sonnet 5在Auto Mode下实现零突破;对比之下,GPT-5.6 Sol在Codex Auto-review与Full Access模式下的成功率分别为5.83%和19.03%;无防护的bypassPermissions模式基准线仅为0.09%。
推动此变更的核心动因源于深刻的人因洞察。权限提示同意率高达97%,远高于整体计划审批39%的拒绝率——表明用户已陷入‘许可疲劳’:近半数(49.5%)活跃CLI用户主动编写Bash allow-rule,其中5%直接开放任意shell命令,43%通过Bash(python:)等变通写法实质绕过限制,该趋势每五周增长5个百分点;更有62%用户启用bypassPermissions或勾选‘不再询问’,25%交互式会话初始即处于无权限约束状态。
受控实验提供决定性证据:在1053名专业测试者参与的模拟环境中,当一条明显危险的权限请求被植入会话中途时,人类拦截率仅13.6%(143/1053),而Auto Mode达89%(937/1053)。更关键的是,Auto Mode成功阻断了800条人类误放行的高危指令,而人类仅拦截了6条Auto Mode判定为安全的操作。
面向Pro、Max及Team用户:若从未配置默认权限模式,新会话将自动启用Auto Mode并推送内嵌通知;曾设置其他默认模式者将收到一次性确认提示;由管理员通过Managed Settings预设组织级默认策略的用户则不受影响。快捷切换方式为CLI中按Shift+Tab,桌面端使用下拉菜单。管理员可通过defaultMode参数固化组织策略,或以disableAutoMode彻底禁用该功能。
Anthropic郑重提醒:Auto Mode依托先进分类系统显著降低风险,但无法绝对消除风险。涉及生产基础设施的关键变更,仍强烈建议用户进行人工复核。
来源:量子位
