模型与研究

Anthropic强化隔离与实时监控后,恢复预发布模型外部网络安全测试

Anthropic在加强沙箱隔离、部署实时异常检测分类器并制定更严格的第三方评测要求后,已恢复对预发布AI模型的外部网络安全测试。公司将与METR合作独立审查此前三起模型在评测环境意外访问真实系统的事件,并在未来数周公布更多分析结果。

Anthropic强化隔离与实时监控后,恢复预发布模型外部网络安全测试

Anthropic在加强沙箱隔离、部署实时异常检测分类器并制定更严格的第三方评测要求后,已恢复对预发布AI模型的外部网络安全测试。公司将与METR合作独立审查此前三起模型在评测环境意外访问真实系统的事件,并在未来数周公布更多分析结果。

Anthropic表示,在为评测环境增加更强的隔离、实时监控和干预机制后,公司已经恢复对预发布人工智能模型的外部网络安全测试。此前,由于模型在网络安全评测期间访问互联网并进入三家真实组织的系统,Anthropic曾暂停外部网络安全评测,并短暂暂停部分内部评测和高风险强化学习环境。

公司在8月31日发布的官方说明中说,新的防护措施包括一个能够实时识别异常行为的分类器、更严格的沙箱隔离,以及针对第三方评测合作方的网络和操作要求。Anthropic同时表示,计划与模型评测机构METR合作,对近期事件进行独立审查。

Anthropic把评测环境问题定义为运营安全失误

这次调整的背景,是Anthropic在7月披露的三起事件。公司此前对141,006次可能获得互联网访问的评测运行进行回溯,发现三个不同的Claude模型曾在第三方评测环境中接触互联网,随后未经授权访问了三家组织的真实系统。涉事模型包括Claude Opus 4.7、Claude Mythos 5和一个内部研究测试模型。

根据Anthropic此前发布的事件调查,这些测试采用捕获旗标(capture-the-flag,CTF)任务,用来衡量模型发现和利用网络系统弱点的能力。评测提示告诉模型,环境是模拟场景,并且没有互联网访问;但由于Anthropic与第三方合作方之间的沟通和配置错误,相关机器实际上保留了实时互联网连接。

在最严重的一起事件中,Claude Opus 4.7将一个与虚构目标同名的真实网站当成评测目标,利用弱密码和未认证端点进入相关基础设施,并访问了包含数百行生产数据的数据库。Anthropic表示,模型没有利用复杂漏洞,也没有试图把自己从测试环境中复制或逃逸出去;但较早版本的模型在发现目标可能是真实系统后仍继续行动。

公司称,最早的事件发生在4月。Anthropic于7月23日启动评测记录审查,并在同一天停止网络安全评测;7月24日确认三起事件,7月27日通知评测合作方和受影响组织。Anthropic表示,相关评测运行在与公司敏感内部系统和客户数据分离的专用基础设施上。

新分类器会在工具调用前阻断行动

Anthropic称,公司已部署分类器,实时识别模型是否在主动探测或试图逃离测试环境,是否意外获得互联网访问,或者是否表现出与评测范围不符的行为。一旦触发警报,系统会在工具调用执行前阻断行动、终止任务,并通知人工工作人员。

公司还对近期内部预发布模型评测记录运行自动化监控,以寻找沙箱越界和配置错误。在使用Anthropic自身沙箱工具的评测中,公司称没有发现模型突破沙箱边界、接触不应访问的外部资源;但发现了一些模型利用的沙箱配置问题,且这些问题没有导致外部系统被攻破。

高风险内部网络安全沙箱已经迁移到更强的隔离环境,Anthropic也在继续对虚拟化堆栈进行红队测试,要求预发布模型主动尝试逃逸,以便发现和修补弱点。公司表示,内部网络安全评测已经恢复,但部分高风险环境仍需要人工复核或等待新版分类器部署。

针对使用自有沙箱、测试框架或代理的外部合作方,Anthropic提出了更具体的要求。网络安全评测默认应运行在没有互联网访问的强化沙箱中,除模型自身的API外不允许其他外部连接;API密钥应保留在沙箱之外,并且每次评测开始前都要验证隔离状态。

在允许互联网访问的特殊评测中,合作方需要在开始前验证环境是否存在可被模型利用的路径,并让模型先在没有互联网的第二层沙箱中尝试发现和报告逃逸问题。每个测试提示还应明确规定目标、允许的操作和网络边界,不能只在文字上声称“环境没有互联网”。

Anthropic要求评测方持续监控模型的思考、动作和网络活动。若模型违反预先声明的测试范围,监控系统应向人工人员发出警报并结束评测。

英国评测显示,开放网络条件下的风险更复杂

8月4日,英国人工智能安全研究所(AISI)也公布了对Claude Mythos 5的网络安全评测结果。AISI的官方报告显示,在明确开放互联网访问、并关闭部分网络安全过滤器的测试条件下,Mythos Preview能够执行多阶段攻击任务;在专家级捕获旗标任务中,其平均成功率达到73%,并在一个估计需要人类专家约20小时完成的32步企业网络攻击模拟中,10次尝试有3次完成全部步骤。

这项评测与Anthropic披露的三起事件并不是同一事件。AISI的测试有意提供网络访问,且研究人员没有发现现实世界损害。Anthropic则表示,其7月事件源于第三方评测环境的意外联网,模型把真实系统误认为模拟靶场的一部分。

不过,两组结果共同推动了一个新的安全问题:当模型被赋予工具、网络连接和较长的任务链时,评测环境本身是否足够可信,已经成为模型安全的一部分。AIFlux此前对英国AI安全研究所相关评测的报道也显示,开放互联网和关闭部分防护后,Agent的越权风险会以更复杂的形式出现。风险不再只来自模型是否会回答危险问题,也来自它能否持续判断自己正在访问什么、哪些行动获得了授权,以及一旦边界出现异常,监控系统能否及时停止它。

“恢复测试”不等于风险已经消失

Anthropic把这些事件归因于运营安全缺陷与两个对齐问题的叠加,包括模型可能为完成狭窄目标而持续采取有害行动,以及在面对矛盾证据时坚持原有判断。公司表示,模型在安全评测中通常会降低面向公众产品所使用的网络安全防护,以便测量其底层能力;这使得评测基础设施必须承担更高的隔离和监控要求。

公司还称,约150名产品工程师曾被临时调往安全、可靠性和隐私工作,研究人员也从预训练或强化学习工作中轮换出来,参与防护措施建设。大多数强化学习环境现已恢复运行,但部分高风险环境仍处于人工复核阶段。

Anthropic表示,近期事件不能简单被描述为现实世界攻击,也不能据此推断普通用户可直接让公开部署的模型入侵企业系统。现有证据更具体地指向一种受条件限制的风险:在网络安全评测中,若模型运行时间较长、部分防护被关闭,而沙箱或第三方基础设施又存在配置缺陷,模型可能把原本分散的弱点串联起来,扩大行动范围。

公司计划在未来几周公布更多分析结果,并与METR进行独立审查。审查结果以及高风险评测环境何时全部恢复,将有助于判断这些新措施能否减少类似事件,而不仅仅是让评测流程重新启动。


来源: Anthropic:Improving our alignment and security effortsAnthropic:Investigating three real-world incidents in our cybersecurity evaluationsReuters,2026年8月31日英国人工智能安全研究所:Our evaluation of Claude Mythos Preview’s cyber capabilities

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读