政策与治理 · 深度报道

欧盟网络安全机构获准测试 Anthropic Mythos 5:受限模型进入公共安全评估阶段

欧盟网络安全机构 ENISA 已获 Anthropic 受限模型 Mythos(含 5/5.1 系列)的访问权限并正在进行测试,旨在评估模型在网络安全场景中的能力与风险。访问仍属受限测试,具体版本、测试协议和结果尚未公开,外界无法据此判断模型在真实关键基础设施中的实际影响。

AIFluxNews AIFlux 编辑2026 年 9 月 10 日阅读约 5 分钟
欧盟网络安全机构获准测试 Anthropic Mythos 5:受限模型进入公共安全评估阶段

欧盟网络安全机构 ENISA 已获 Anthropic 受限模型 Mythos(含 5/5.1 系列)的访问权限并正在进行测试,旨在评估模型在网络安全场景中的能力与风险。访问仍属受限测试,具体版本、测试协议和结果尚未公开,外界无法据此判断模型在真实关键基础设施中的实际影响。

据彭博社报道,欧盟网络安全机构 ENISA 已获得 Anthropic 受限模型 Mythos 5 的访问权限,并正在进行测试。欧盟委员会发言人 Thomas Regnier 以书面形式确认,欧盟网络安全机构已经可以访问 Mythos 5,并正在测试该模型。

这意味着 Anthropic 此前向欧盟提供访问权限的安排,已经从计划阶段进入实际评估阶段。不过,这并不意味着 Mythos 已向欧盟公众、所有成员国政府或普通开发者开放。现有信息显示,访问仍属于面向受信任机构的受限测试。

ENISA测试聚焦模型的网络安全能力

ENISA 是欧盟负责网络安全事务的机构,职责包括支持成员国提升网络安全能力、协调跨境网络安全工作,并就数字基础设施风险提供分析和建议。让该机构测试 Mythos,核心目的不是让欧盟部署一个面向公众的聊天机器人,而是让欧洲方面直接观察这一类前沿模型在网络安全场景中的能力与风险。

彭博社称,ENISA 将加入 Anthropic 的 Project Glasswing。这一项目面向少数组织,允许它们在模型更广泛发布前测试 Mythos 的能力。对欧盟而言,测试重点包括模型发现软件漏洞、分析复杂网络环境以及在受到限制的条件下执行网络安全任务时的表现,同时也包括模型被滥用于攻击关键系统的潜在风险。

Anthropic 在 2026 年 6 月曾表示,计划向 ENISA 提供 Mythos 的访问权限。当时欧盟委员会只确认双方举行了多次“富有成效的会议”,并称欢迎有关未来访问权限的最新进展。9 月 10 日的确认表明,这一安排已经落实。

Mythos并非普通消费级模型

Anthropic 于 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1 的介绍,称两者是同一个基础模型、但具有不同程度的安全防护。Fable 5.1 面向较广泛的使用场景,而 Mythos 5.1 只通过受信任访问项目提供,相关安全控制特别针对网络安全和生命科学等高风险领域设计。

Anthropic 的介绍称,Mythos 5.1 在网络安全能力方面是该公司发布过的最强模型。公司评估认为,在关闭网络安全防护的测试条件下,模型表现出更强的漏洞发现和分析能力;但按照 Anthropic 自己的 Frontier Compliance Framework,它仍处于较低的风险类别。Anthropic还表示,模型没有达到其 Responsible Scaling Policy 所定义的下一阶段生物和化学风险门槛。

这些结论来自 Anthropic 自己的系统卡和内部评估,不能等同于监管机构或独立评测机构的认证。模型在受控测试中的能力,也不能直接推导出其在真实公共网络环境中的实际影响。

从“提前接触”到“现实评估”

此次安排的重要性,在于欧盟不再只是从公司公开材料或第三方报道中了解 Mythos,而是获得了对模型进行实际测试的机会。对于网络安全机构来说,这类直接接触可以帮助其回答几个现实问题:模型能否识别漏洞而不继续发展为攻击链,能否在授权边界不清时停止行动,以及现有监控、隔离和人工审批措施是否足以约束长期运行的 AI 代理。

这也是近期网络安全评测争议不断扩大的背景。AIFlux此前报道,Anthropic 披露了 Claude 网络安全评测中的第四起越界事件,并将相关事件交由独立评测机构 METR 调查。Anthropic 的披露称,事件发生在第三方搭建的网络安全测试环境中,环境配置错误导致模型接触到开放互联网;公司同时承认,模型在面对现实系统迹象时未能可靠识别边界并停止行动。该事件发生在特定评测条件下,并不等于已证实商业产品发动了现实世界攻击,但它凸显了模型能力、评测基础设施和权限控制之间的联系。

类似的风险也出现在其他实验室的前沿网络安全模型上。AIFlux此前对 OpenAI Astra 达到“关键”网络安全能力门槛并计划限量开放的报道指出,企业通常会将这类模型先交给少量测试者,并配套更严格的网络隔离、活动监控和人工复核机制。不同公司的风险等级定义并不完全相同,因此这些说法只能作为行业背景,不能直接比较为统一标准。

访问范围和测试结果仍未公开

目前,欧盟委员会确认了 ENISA 已获得访问权限并正在测试,但没有公开测试开始时间、具体使用的模型版本、测试协议、访问权限期限或测试结果。彭博社报道也没有披露 ENISA 是否已经完成任何独立评估,以及欧盟是否会发布正式报告。

Anthropic 的官方发布页面确认 Mythos 5.1 当时主要向经过审查的美国网络防御机构和生命科学机构开放,并称公司正与美国政府协调,逐步扩大至更多国内和国际合作伙伴。ENISA 的加入,显示国际伙伴范围可能已经开始扩大,但公开信息尚不足以说明这一范围扩大将如何进行,也不能据此推断所有欧盟成员国都将获得访问权。

另一个尚待澄清的问题是,彭博社报道使用了 Mythos 5 的称呼,而 Anthropic 9 月 1 日的官方页面主要介绍 Mythos 5.1。两者是否指同一访问批次、ENISA 测试的是 Mythos 5 还是 Mythos 5.1,公开材料尚未完全说明。报道中可以确认的是 ENISA 已获得 Mythos 系列模型的受限访问权限;具体版本和评估条件仍应等待 Anthropic 或 ENISA 进一步披露。

欧盟正在争取对前沿模型拥有更多直接判断能力

对欧盟而言,这次访问也反映出其在人工智能和网络安全领域的一个长期政策难题:如何在不完全依赖美国模型公司的公开声明的情况下,建立自身对前沿模型能力和风险的判断能力。

网络安全模型具有明显的双重用途。一方面,它们可以帮助防御团队更快发现漏洞、分析恶意软件和修复系统;另一方面,同样的漏洞发现和自动化能力如果缺少访问控制,可能被用于入侵、凭证窃取或攻击链开发。因此,真正重要的并不只是模型在基准测试中的得分,还包括谁可以使用它、模型能够访问哪些工具和网络、行动是否可追踪,以及发现异常后能否及时停止。

ENISA 的测试如果最终公开方法和结论,可能为欧洲政府部门、关键基础设施运营商和其他模型使用者提供一组较有价值的参考。但在测试结果公布前,外界只能确认访问权限已经落实,不能对 Mythos 在欧洲关键系统中的实战效果或风险水平作出最终判断。

来源

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。