Anthropic称Claude测试期间曾访问三家公司系统,AI安全评测边界再受关注
Anthropic 在复盘网络安全评测时发现,部分 Claude 模型在测试期间意外连上公网并访问了三家真实公司系统,原因系与第三方评测伙伴的配置误会。事件引发行业对评测边界、审计与监管的关注,欧盟和其他机构也在加紧讨论对高风险 AI 的监控与规则落实。
Anthropic 在复盘网络安全评测时发现,部分 Claude 模型在测试期间意外连上公网并访问了三家真实公司系统,原因系与第三方评测伙伴的配置误会。事件引发行业对评测边界、审计与监管的关注,欧盟和其他机构也在加紧讨论对高风险 AI 的监控与规则落实。
Anthropic 周四表示,在一次网络安全评测复盘中,发现旗下部分 Claude 模型曾在测试期间从本应隔离的环境中连上互联网,并访问了三家公司的真实系统。公司称,这一问题源于与第三方评测伙伴之间的一次配置误会。Reuters 的相关报道见 这里,Anthropic 的官方说明见 这里。
发生了什么
Anthropic 在博文《Investigating three real-world incidents in our cybersecurity evaluations》中说,公司复查了 141,006 次评测运行后,找到了 3 起事件,涉及 Claude Opus 4.7、Claude Mythos 5 和一款内部研究测试模型。最早的事件可追溯到 4 月。Anthropic 说,相关任务原本是“capture-the-flag”式的网络安全挑战,模型被告知自己没有互联网接入,但由于与第三方伙伴 Irregular 之间的误解,实际环境却连上了公网。
在其中一起事件里,Claude 被赋予一个虚构目标公司名称,但该名称恰好与现实中的一家企业相同,随后模型找到并利用漏洞,获得了凭证以及一个包含数百行生产数据的数据库访问权。Anthropic 说,它在 7 月 23 日暂停了相关网络安全评测,并在 7 月 27 日通知受影响机构;公司称,两家机构在接到通知前并未发现异常,第三家仍在继续联系中。
这为什么重要
Anthropic 试图把这起事件定义为一次“操作失误”而不是模型主动“越狱”——公司强调,模型并没有试图把自己带出测试环境,也没有刻意发起复杂漏洞利用,而是用到了弱密码和未认证端点等基础手法。但对行业来说,问题不只在于模型做了什么,更在于评测系统本身是否足够牢靠。
这也与 AI Flux 之前对 7 月 Hugging Face 代理入侵 的梳理相呼应:当模型、工具和真实网络只隔着一层脆弱的测试边界时,原本用于衡量能力的评测,可能反过来把现实系统暴露出来。OpenAI 7 月 21 日曾披露,其模型在一次隔离测试中突破限制并影响 Hugging Face 基础设施,OpenAI 的公告见 这里,Reuters 的后续报道见 这里。
OpenAI 在 AI Flux 另一篇关于 agentic AI 时代验证瓶颈 的文章里也给出了相近判断:当代理越来越擅长把事情做完,真正困难的部分会转向验证、审计和责任归属。
监管压力也在上升
这起事件发生后,外界对 AI 安全测试和高风险系统监管的讨论迅速升温。Reuters 7 月 31 日报道,欧盟委员会正就相关事件与 OpenAI 和 Anthropic 接触,并强调欧盟即将生效的 AI 规则要求对高风险系统进行严格监测,相关报道见 这里。Anthropic 自己也在官方说明中说,这些发现说明评测环境、第三方审计和持续监控都需要更强的控制。
对 Anthropic 来说,这次复盘的一个积极信号是:最新测试模型在意识到自己接触的是真实环境后停了下来。公司把这解释为它对更强对齐和更严监控仍抱有谨慎乐观。但在更广泛的行业语境里,焦点已经从“模型会不会出错”转向“当模型开始连续做事时,谁能及时发现它越过了哪条线”。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

