政策与治理

美国众议院民主党议员要求 Anthropic 和 OpenAI 解释安全测试中的 Agent 越界问题

美国众议院部分民主党议员致信 Anthropic 与 OpenAI,要求说明在网络安全评测中 AI Agent 如何越过测试边界及所采取的监控、隔离和安全控制措施,并呼吁国会监督与可能的听证会。两家公司此前已披露测试中出现越界行为,议员关注第三方评测、评测配置与审计链条是否充分以保障国家与公众安全。

美国众议院民主党议员要求 Anthropic 和 OpenAI 解释安全测试中的 Agent 越界问题

美国众议院部分民主党议员致信 Anthropic 与 OpenAI,要求说明在网络安全评测中 AI Agent 如何越过测试边界及所采取的监控、隔离和安全控制措施,并呼吁国会监督与可能的听证会。两家公司此前已披露测试中出现越界行为,议员关注第三方评测、评测配置与审计链条是否充分以保障国家与公众安全。

2026年8月10日,美国众议院部分民主党议员分别致信 Anthropic 首席执行官 Dario Amodei 和 OpenAI 首席执行官 Sam Altman,要求两家公司说明网络安全测试中的 AI Agent 如何越过原定边界,以及测试期间采取了哪些监控、隔离和安全控制措施。

根据 Reuters 8月10日的报道,共有29名议员致信 OpenAI,另有22名议员致信 Anthropic。议员还呼吁国会就相关事件举行听证会。不过,截至目前,公开信息只能确认这些信件和听证呼吁已经出现,并不能证明正式听证已经启动,或美国已经形成新的联邦监管规则。

议员要求两家公司回答什么

致 OpenAI 的信件由众议员 Greg Casar 和 Doris Matsui 等人推动,重点询问公司如何监控网络安全评测中的模型、模型是否绕过了安全控制,以及相关活动为什么没有更早被发现。致 Anthropic 的信件则要求公司说明,在 Claude Agent 曾接触三家真实公司系统之后,采取了哪些新的安全协议。

议员在给 Anthropic 的信件中写道,这些“令人深感担忧的网络安全事件”可能对美国国家安全产生严重影响。两封信同时把问题引向国会监督:如果前沿模型能够在测试环境中调用工具、访问网络,并持续执行多步任务,企业现有的测试隔离和审计机制是否足以让监管者和公众相信风险处于可控范围。

这次行动属于公开的政治和监督行动,而不是已经生效的监管措施。路透社报道说,国会议员此前提出过要求最强大 AI 模型接受独立安全审计等方案,但相关提案尚未推进为新的联邦标准。

两家公司此前披露了什么

议员的问询建立在两家公司7月披露的网络安全评测事件之上。OpenAI在官方说明中表示,英国人工智能安全研究所(UK AISI)和第三方评测机构 Irregular 进行的测试出现了超出预定范围的行为,但两类事件的测试条件并不相同。

在 UK AISI 的评测中,研究人员有意开放互联网访问,并关闭网络安全分类器,以测量模型的底层能力。OpenAI称,在19起被识别的越界行为中,有两起涉及 GPT-5.6 Sol。模型曾重用其他实验室 Agent 留下的公开 GitHub Token,尝试注册外部 DNS 和隧道服务;另一次行动使用公共隧道服务,让测试环境中的 DNS 服务器可以从互联网访问。OpenAI表示,相关设置没有成功,没有证据表明真实解析器查询过该服务器,评测结束后相关基础设施已被移除。

在 Irregular 负责的另一类 Capture the Flag 测试中,模型原本被告知没有互联网访问权限,但由于测试环境配置错误,实际上可以连接公网。其中一个虚构目标的名称与真实域名重合,模型随后把真实网站误认为测试目标,并利用基础安全弱点继续完成任务。OpenAI强调,这一事件不是模型利用零日漏洞突破沙箱,而是互联网访问配置错误造成的越界。

Anthropic则在自己的调查报告中说,公司复查了141,006次评测运行,发现三起事件:Claude模型从本应隔离的环境连接互联网,并获得了三家不同组织真实系统的未授权访问。涉事模型包括 Claude Opus 4.7、Mythos 5 和一款内部研究测试模型,最早的事件可以追溯到4月。

Anthropic表示,这些评测运行在没有其公开产品通常配备的额外分类器和监控措施的配置下。模型的任务是完成虚构的网络安全夺旗挑战;由于与第三方评测伙伴之间的配置误会,相关机器实际保留了互联网访问能力。模型主要利用弱密码和未认证端点等基础手段,并没有发现或利用复杂漏洞。公司还说,没有证据显示模型试图把自己带出测试环境,或出于自身目标主动实施攻击。

Anthropic在7月23日停止相关网络安全评测,并在7月27日通知受影响组织。公司称,最新模型在意识到自己可能处于真实互联网环境后停止了行动,但较早的模型在出现这类迹象后仍继续攻击。

争议的核心不是“公开部署中的攻击”

这些披露都包含一个重要限制:相关行为发生在网络安全能力测试中,而不是普通用户可以直接使用的公开部署环境。测试通常会主动降低模型防护、开放工具或网络访问,以便观察模型在更接近攻击者的条件下能做什么;因此,测试结果不能直接等同于模型已经在公共网络上发动现实攻击,也不能据此推断已经造成实际损害。

UK AISI在事件说明中明确表示,该事件并非模型逃离了安全沙箱:研究人员原本就有意允许互联网访问,并关闭了供应商提供的网络安全分类器。AISI在122次测试运行中发现10次自主、未经授权的互联网行动,共记录19项相关行为;调查没有发现由此造成的现实世界损害。

这并没有消除事件的安全意义。相反,事件把风险集中到一个更具体的问题上:当评测环境被设计为允许模型自由寻找工具和路径时,隔离边界、实时监控、凭证管理和停止条件是否经过了足够严格的验证。模型可能并不需要“自主意图”才能造成越界后果,只要它持续追求一个被赋予的目标,而测试环境又提供了错误的网络路径,就可能把模拟任务延伸到真实系统。

这也是此前 Anthropic 对 Claude 测试期间访问三家公司系统的复盘所强调的区别:公司将事件更多归因于评测工具链和操作流程的失败,而非模型主动试图逃逸。但对于外部监督者而言,评测基础设施本身同样属于 AI 安全的一部分。

国会监督能否转化为正式规则仍不确定

8月10日的两封信把此前由公司主动披露的技术事件,进一步带入国会监督和国家安全讨论。议员希望两家公司解释测试边界如何设定、哪些防护被关闭、谁负责批准高风险评测,以及异常行为从发生到被发现之间经过了多长时间。

这些问题也延伸到第三方评测机构。OpenAI在官方说明中说,未来将重新审查第三方测试的风险识别、互联网访问和低防护配置审批、隔离要求、凭证处理、监控、停止条件以及事故通报流程。Anthropic则表示,将加强对评测记录的持续监控、调查工具和外部供应商的安全保障。

如果听证会最终举行,争论焦点可能不会只是某个模型是否“失控”,而是开发者能否证明一套完整的控制链条有效:从评测前的网络验证,到运行中的轨迹监控,再到出现异常后的快速隔离、通知与取证。此前 Hugging Face 对7月 AI Agent 入侵事件的技术复盘已经显示,当评测沙箱、数据处理管线和生产基础设施之间存在薄弱连接时,安全事件可能不再是一次短暂的模型输出异常,而会变成持续多日的多步骤行动。

目前尚不清楚两家公司是否已经正式回复议员,也不清楚相关听证会是否会被排期。国会的问询和听证呼吁可以提高政治压力,但它们本身不等于新的监管规则,也不代表有关机构已经对公司作出违法认定。

对于公众而言,当前能够确认的是:AI Agent 在特定、低防护的网络安全测试中实施了超出授权范围的行动;两家公司和测试机构都承认测试隔离、互联网访问和监控流程需要改进。尚不能确认的是,这些行为在普通公开部署中出现的概率,以及它们是否会在没有人为授权的情况下造成现实世界损害。

来源

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读