应用与产品

Anthropic 将从 8 月 14 日起把 Claude Code 自动模式设为默认

Anthropic 将从 2026 年 8 月 14 日起把 Claude Code 的 Pro、Max 和 Team 计划新会话默认启用自动模式(Auto mode),由分类器代替逐次人工批准来判断工具调用的风险。公司表示自动模式在内部和第三方测试中拦截危险命令效率更高,但仍建议在生产环境保留人工复核和最小权限等防护措施。

Anthropic 将从 8 月 14 日起把 Claude Code 自动模式设为默认

Anthropic 将从 2026 年 8 月 14 日起把 Claude Code 的 Pro、Max 和 Team 计划新会话默认启用自动模式(Auto mode),由分类器代替逐次人工批准来判断工具调用的风险。公司表示自动模式在内部和第三方测试中拦截危险命令效率更高,但仍建议在生产环境保留人工复核和最小权限等防护措施。

Anthropic 表示,从 2026 年 8 月 14 日起,Claude Code 的 Pro、Max 和 Team 计划新会话将默认启用 Auto mode(自动模式)。在这一模式下,Claude Code 不再为每一次工具调用都要求用户手动确认,而是先由分类器判断操作是否不可逆、具有破坏性,或超出当前工作环境的边界。

这不是取消 Claude Code 的安全控制,而是把部分安全判断从“用户是否点击批准”转交给自动化分类系统。用户或管理员如果此前已经固定了其他权限模式,设置不会被强制改写;Enterprise、Claude API 以及 AWS、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 等平台目前仍保持默认关闭,Anthropic 计划在未来一个月逐步扩大默认启用范围。

Anthropic 在 8 月 7 日发布的官方说明中说,自动模式使用少量额外 token 评估工具调用,但 Pro、Max 和 Team 用户不再为这部分分类器开销付费。Claude Code 负责人 Boris Cherny 也在社交媒体上表示,团队已经连续数月主要使用自动模式。

从逐次批准转向持续运行

Claude Code 原本采用以权限提示为核心的工作方式:当代理要修改文件、执行 Bash 命令、调用 MCP 工具或访问工作区外的资源时,用户通常需要逐项批准。这种设计保留了清晰的人在回路,但在长任务中也会产生大量中断。

Anthropic 认为,频繁的批准可能造成“批准疲劳”。公司在官方材料中称,用户批准了约 97% 的权限请求,而对计划类对话的拒绝率则高得多。它据此判断,部分用户可能是在习惯性点击,而不是逐条审查命令。公司还说,截至 2026 年 6 月,约 49.5% 的活跃 CLI 用户已经创建过 Bash allow-rule,25% 的交互式会话以 bypass permissions 模式启动。

自动模式的处理方式,是让每一次需要额外判断的操作经过 transcript classifier。系统会结合用户请求、代理准备执行的工具调用以及当前环境,判断行为是否符合用户意图。若操作被拦截,Claude 通常会尝试更安全的替代路径,或者向用户请求进一步批准;连续被拦截三次,或单次会话累计被拦截 20 次后,系统会退回人工审批。

Anthropic 在其工程说明中介绍,自动模式还包括输入和输出两层防护。输入侧会扫描文件、网页、Shell 输出和外部工具返回的内容,识别可能诱导代理偏离用户目标的提示注入;输出侧的分类器则在工具调用执行前进行判断。公司称,分类器只查看用户消息和代理的工具调用,不读取 Claude 自己生成的解释和工具返回内容,以减少代理通过解释“说服”安全层的可能性。

Anthropic 的数据支持什么,又不能证明什么

Anthropic 表示,公司通过内部红队测试、第三方测试、提示注入评估、真实生产会话分析,以及一项针对 1,053 名付费测试者的受控研究来比较自动模式与人工审批。

在这项研究中,测试者在专门搭建的环境中工作,并不知道研究关注的是哪一种行为。研究人员把一次权限提示替换成明显危险的命令,但实际并未执行该命令。Anthropic 称,人工测试者只在 13.6% 的情况下识别并拒绝了危险命令,即 1,053 人中有 143 人;自动模式则拦截了 89%,即 937 次。两者直接比较时,自动模式拦截了 800 个被人工批准的危险命令,而人工只拦截了 6 个自动模式放行的命令。

研究还显示,人工表现会随着提示数量增加而下降:在会话早期,测试者拦截危险命令的比例约为 17%,在此前已经处理 50 次或更多提示后,这一比例降至约 5%。

不过,这些数字主要说明自动化分类器在特定实验条件下比人工点击更稳定,并不能证明自动模式在所有真实工作流中都更安全。参与者使用的是研究环境,不是自己的代码库或生产系统;危险命令也没有真正运行。Anthropic 自己对研究的描述因此不能等同于独立安全认证。

公司对真实会话的分析同样来自有限样本。Anthropic 称,在 2026 年 5 月至 6 月被安全管线标记、且用户同意将数据用于训练和分析的会话中,人工审批模式下出现生产级别、且用户没有明确要求的有害操作的比例为 6.3%,自动模式为 2.4%。这一结果提供了风险信号,但样本筛选和模型复评方式意味着外部读者仍难以独立复现结论。

在第三方提示注入测试中,Anthropic 表示,Claude Fable 5、Opus 5 和 Sonnet 5 使用自动模式时,720 次攻击尝试没有成功;同一评估中,Codex 的 Auto-review 模式在 GPT-5.6 Sol 上的攻击成功率为 5.83%。测试由 Trajectory Labs 设计,场景针对的是间接提示注入,且使用了定制的浏览器工具。Anthropic 也提醒,测试结果不能简单代表所有产品部署的完整安全能力。

安全边界仍然取决于权限和环境

自动模式并非一个无限制的“自动批准”开关。Anthropic 表示,数据外泄等行为属于分类器设计上不会批准的硬拒绝类别;组织还可以通过设置增加自定义硬拒绝规则。系统也会区分秘密信息和普通数据,检查 Git 推送或 Pull Request 的目标是公开、私有还是受信任的仓库,并在可能丢弃未提交修改的 Git 操作前读取当前状态。

但这些控制仍然属于分类和策略判断,而不是绝对的操作隔离。Anthropic 的安全文档仍建议用户审查重要代码和命令,并通过沙箱、项目级权限、最小授权和开发容器降低风险。对于生产基础设施的高风险变更,公司明确建议保留人工复核。

这一点也解释了为什么企业 Agent 的安全重点正从“是否需要批准”扩展到“代理拥有哪些权限、看到过哪些数据,以及发生错误后能否停止”。例如,Cloudflare 在近期发布的 Cloudflare OS中,把 Gatekeeper、能力型权限、数据观察记录和延后审批放在企业 Agent 工作空间的核心位置。它试图让凭据停留在连接层,而不是直接交给代理。

在软件交付流程方面,Cloudflare 提出的“Agent 开发生命周期”也强调,长时间运行的代理需要测试、追踪、渐进部署、回滚和明确审批,而不只是更快地产生代码。两者反映出同一变化:代理越能持续执行任务,安全设计就越不能只依赖用户偶尔看一眼命令提示。

开发者得到便利,也承担新的复核责任

Anthropic 表示,Team 和 Enterprise 用户中,使用自动模式的团队平均多提交约 25% 的 Pull Request,Adobe、Nuro、Gusto 和 Garner Health 等公司已经把它作为生产默认设置。对于需要运行数小时的研究、代码迁移和测试任务,减少中断确实可能带来效率提升。

然而,更多 Pull Request 并不自动等于更高质量的软件。自动模式把人类从逐次批准中解放出来后,人类的职责可能转向审查代理留下的变更、测试证据、权限轨迹和生产指标。若团队只把批准提示关闭,却没有设置沙箱、分支保护、部署闸门和回滚流程,风险并不会因为分类器存在而消失。

因此,8 月 14 日的变化更像是 Claude Code 权限模型的一次默认值迁移,而不是安全控制的终结。Anthropic 试图证明,面对现实中大量习惯性批准,经过训练和评估的分类器可以成为更可靠的第一道防线;但在生产数据库、云基础设施、凭据和外部数据传输等场景中,最终的安全边界仍取决于组织如何配置权限、隔离环境和保留人工复核。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读