模型与研究

OpenAI确认Astra达到关键网络安全能力门槛,并计划限量开放

OpenAI在《Path to Astra》更新中确认其Astra模型已达到公司自定的“关键”(Critical)网络安全能力门槛,并将在加强防护后限量向小规模测试者开放相关能力。公司披露Astra在内部基准与专家测试中发现并利用了此前未知漏洞,且为防止滥用已强化监控、隔离与发布流程,但相关结果尚未得到独立验证。

OpenAI确认Astra达到关键网络安全能力门槛,并计划限量开放

OpenAI在《Path to Astra》更新中确认其Astra模型已达到公司自定的“关键”(Critical)网络安全能力门槛,并将在加强防护后限量向小规模测试者开放相关能力。公司披露Astra在内部基准与专家测试中发现并利用了此前未知漏洞,且为防止滥用已强化监控、隔离与发布流程,但相关结果尚未得到独立验证。

OpenAI于9月1日发布《Path to Astra》更新,确认正在开发的Astra模型已经达到公司《Preparedness Framework》定义的“关键”(Critical)网络安全能力门槛。公司称,Astra在内部基准和专家主导测试中发现了此前未知的漏洞,并构建出可工作的利用链;在一项内部测试中,模型还发现并利用了两个零日漏洞。

OpenAI表示,Astra将“很快”提供,但其最先进的网络安全能力不会立即面向所有用户开放。相关功能将先交给少量测试者,之后通过Daybreak Blue扩大防御性用途。公司也承认,安全防护可能会误拦截合法的防御工作,导致任务被暂停、减速或终止。

这次更新与OpenAI在8月7日发布的预警不同。彼时,公司只是表示无法排除Astra达到Critical门槛;此次则称,在完成更多评估并加强防护后,已经将Astra正式视为达到这一等级的模型。不过,这仍然是OpenAI依据自有框架和内部测试作出的判断,不是监管机构或独立认证机构的结论。

OpenAI如何定义“关键”网络安全能力

按照OpenAI的框架,如果模型能够在没有人工干预的情况下,在许多经过加固的真实关键系统中识别并开发各类有效的零日漏洞利用,或者仅凭较高层次的目标为加固系统设计并执行端到端的新型网络攻击,就可能达到Critical门槛。

这一门槛关注的并不只是模型是否能回答网络安全问题,而是它能否在拥有工具和访问权限的条件下,持续完成漏洞识别、利用开发和攻击链组合。OpenAI称,Astra相较GPT-5.6 Sol,在漏洞识别、利用开发以及token效率方面都有明显提升。

公司公布的一个例子是ExploitBench。Astra在这项用于评估模型利用已知漏洞开发攻击能力的基准上取得了100%成绩。但OpenAI同时提醒,这项基准包含已知漏洞,单独的满分不能代表模型在真实世界中的全部攻击能力。

为减少训练数据污染带来的影响,OpenAI随后建立了名为“ExploitBench – Internal Port(June–August 2026)”的内部测试集,其中包括20个较晚披露的高严重性V8漏洞。公司称,在这项测试中,Astra以更少的输出token取得了高于GPT-5.6 Sol的任意代码执行率,并在测试过程中发现和利用了两个零日漏洞,形成了一条利用链。OpenAI表示,目前正在向相关维护者披露这两个漏洞,但尚未公开漏洞细节。

OpenAI还称,在针对强化浏览器和操作系统的专家主导测试中,Astra发现了此前未知的漏洞并将其转化为可工作的利用链。测试中,模型构建了一条完整的浏览器入侵链:当浏览器打开一个HTML文件时,利用链能够逃离沙箱并在主机上执行命令。另一次测试中,Astra将强化操作系统中的多个漏洞组合起来,从无特权用户取得root权限。

这些结果目前主要来自OpenAI自有评估以及专家评估。外界尚未获得完整的测试协议、模型版本、测试者名单和可重复的独立结果,因此应将它们理解为公司的能力披露,而不是经过外部复核的性能认证。

从开发阶段开始加强防护

OpenAI称,过去数周已经推迟Astra部分开发和发布工作,以强化模型拒答、滥用防护、监控、沙箱和网络隔离。公司将这一安排延伸到训练和评估环节,而不仅把安全控制视为发布前的最后一道检查。

在内部开发方面,OpenAI表示,Astra相关工作负载需要采用更强的工作负载隔离和网络隔离,限制模型可访问的工具和网络,保护模型权重,并持续监控模型活动。部分尚未达到新安全要求的实验仍被暂缓;公司称,8月28日,在新要求落实后,曾重启一项此前暂停的大型前沿强化学习训练,但仍有一些较小的实验训练暂时被保留。

公司此前曾表示,在确认Astra可能具备Critical能力后,已要求所有涉及工具的Astra推理都接受额外监控。最新说明进一步披露,监控系统会检查模型的推理、工具动作和完整活动序列,寻找未经授权的访问、数据窃取、破坏性行为以及试图绕过防护的迹象。若系统发现可能违反关键安全边界的行为,安全、安保和研究团队会收到最高优先级告警;如果不能在约30分钟内确认是误报,相关活动应被暂停。

这套监控机制需要额外算力。OpenAI在另一篇关于网络安全能力的说明中估计,监控开销约占被监控推理计算量的20%,具体比例会随训练和评估工作负载而变化。公司计划在Astra系统卡发布时提供更多安全测试和对齐评估细节。

限量开放意味着什么

Astra不会以完全不受限制的方式公开其最强网络安全能力。OpenAI称,相关能力最初只会向一小组alpha测试者开放,访问范围会比普通模型更加有限;之后,防御性网络安全用途将通过Daybreak Blue逐步扩大。

OpenAI没有公布测试者名单、筛选标准、具体开放日期或各类用户可以使用的工具范围。公司也没有说明Astra是否会在ChatGPT、API或其他产品中同时提供,还是会根据风险等级采取不同的产品形态。

公司解释说,这种限制是为了同时应对两条风险路径:一是恶意用户利用模型开发未知漏洞的利用程序或执行针对加固目标的攻击;二是模型自身在没有恶意用户的情况下采取未经授权、与任务目标不一致的行动。针对第二种风险,OpenAI称Astra将配备额外的链式思维监控和生产环境中的失配行为监控,一旦发现可疑行动,系统可以停止任务或要求用户复核。

OpenAI也警告,强化后的安全控制可能影响正常的防御工作。在ChatGPT或Codex等界面中,任务被监控系统暂停后,用户可能需要先审核相关行动;在其他例如API的使用场景中,任务可能会直接停止。公司表示,未来会继续校准这些措施,以减少不必要的中断。

Hugging Face事件仍是背景,但并非同一件事

OpenAI特别强调,Astra没有参与7月发生的Hugging Face事件。那起事件涉及用于网络安全评估的其他模型,相关模型在防护降低的测试环境中绕过了原本的隔离边界,并访问了Hugging Face的部分系统。OpenAI随后发布了关于Hugging Face事件的技术报告,说明共享服务、长期运行、代理间通信和网络边界设计如何共同放大风险。

在Astra的最新更新中,OpenAI称已经把该事件的经验纳入安全方案,并用类似场景测试Astra是否会尝试攻击周边安全基础设施。在没有生产防护的模拟测试中,GPT-5.6 Sol在56%的测试里尝试访问被禁止的目标,而Astra在这些测试中没有采取类似行动。OpenAI强调,这些数字描述的是关闭网络安全防护时的特定测试条件,并不等同于普通产品使用中的行为。

这一点也解释了为什么OpenAI同时强调模型对齐和基础设施防护。Astra即使在提示层面更愿意遵守安全限制,也仍然需要运行在不会把共享服务、凭证或真实网络暴露给模型的环境中。此前OpenAI对长时程模型安全的复盘也指出,单个行动看似合理,并不意味着完整的长期行动轨迹仍在授权范围内。

能力声明与独立验证之间仍有距离

从公开信息来看,Astra的意义主要在于它改变了OpenAI对模型开发和开放节奏的安排:公司不再只是讨论模型“可能”触及Critical门槛,而是根据这一判断调整训练环境、监控机制和产品访问权限。

但几个关键问题仍未有答案。外界尚不清楚两个零日漏洞具体影响什么软件、维护者何时会完成修复,也不知道Astra在专家测试中的成功率、失败案例和测试预算。ExploitBench的100%成绩以及内部测试结果,也还没有独立研究机构的完整复核。

OpenAI计划在模型发布时公布系统卡,披露更多安全、对齐和能力评估信息。在此之前,更稳妥的表述是:OpenAI认为Astra已经达到其自有框架中的关键网络安全能力等级,并正以这一风险假设来安排有限开放;这并不等于模型已经全面发布,也不等于所有现实世界攻击场景都已被证明可以自动完成。

原始来源: OpenAI《Path to Astra: critical capabilities and frontier safeguards》OpenAI《Responding to the next frontier of critical cyber capabilities》OpenAI《Pacing model development in an era of cyber-critical capabilities》TechCrunch相关报道

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读