OpenAI推出GPT-5.6-Cyber,扩展面向可信防御者的Daybreak访问计划
OpenAI于2026年推出面向可信防御者的网络安全专用模型GPT-5.6-Cyber,并将Daybreak计划分为Daybreak Blue与Daybreak Red两类访问层级,分别覆盖普通防御任务与经审核的高级研究。公司以身份验证、用途限制和监控等多重措施,将高风险能力限定在Red层级,同时披露了内部评测结果和模型在发现Chrome V8等漏洞中的辅助作用。
OpenAI于2026年推出面向可信防御者的网络安全专用模型GPT-5.6-Cyber,并将Daybreak计划分为Daybreak Blue与Daybreak Red两类访问层级,分别覆盖普通防御任务与经审核的高级研究。公司以身份验证、用途限制和监控等多重措施,将高风险能力限定在Red层级,同时披露了内部评测结果和模型在发现Chrome V8等漏洞中的辅助作用。
OpenAI于2026年8月10日宣布推出网络安全专用模型GPT-5.6-Cyber,并将Daybreak计划划分为面向不同风险等级和工作场景的Blue、Red两类访问层级。公司表示,GPT-5.6-Cyber面向经过审核的高级安全研究,支持授权的漏洞研究、漏洞利用验证和安全测试;普通防御工作则建议从Daybreak Blue开始。
这项发布把一个长期存在的矛盾摆到台前:网络安全模型需要足够强,才能帮助防御者发现漏洞和修复缺陷;但同样的能力也可能被用于开发漏洞利用链、绕过认证或提升权限。OpenAI的做法不是把所有能力放在同一访问层中,而是尝试用身份验证、用途限制、监控和法律声明,把高风险能力限制在更小的用户范围内。
Daybreak Blue与Red分别面向什么工作
OpenAI称,Daybreak Blue向经批准的防御者提供包括GPT-5.6 Sol在内的通用前沿模型,并针对授权的安全工作调整访问控制。该层级覆盖漏洞发现、安全代码审查、恶意软件分析、事件响应、漏洞管理、安全评估和补丁验证等任务。
Daybreak Red则面向经过审核的高级安全研究人员,提供专门训练的网络安全模型。GPT-5.6-Cyber目前通过这一层级提供,主要用于授权的漏洞研究、漏洞利用验证、漏洞利用开发和红队测试等更高风险工作。
OpenAI表示,GPT-5.6-Cyber建立在GPT-5.6 Sol基础上,针对若干网络安全任务进行了专门训练,并减少模型在部分高风险、双重用途网络安全请求中的拒答。这里的“减少拒答”并不等同于取消所有安全控制:访问仍然受到身份验证、账户安全、监控、批准用途限制和法律声明等措施约束。
OpenAI此前已通过Daybreak向安全软件和服务供应商提供网络安全模型,相关合作方包括Accenture、Akamai、Cisco、Cloudflare、CrowdStrike、Fortinet、IBM、Palo Alto Networks、PwC和Sophos等。新公告将这一计划进一步分层,但公开信息尚未说明所有合作方都能获得Daybreak Red,或Red层级会向何种规模的研究团队开放。
95%的完成率是公司内部指标
OpenAI在其名为“Advanced Cybersecurity Completion Rate”的内部评测中称,GPT-5.6-Cyber完成了95.0%的高级网络安全请求;相比之下,GPT-5.6 Sol在启用系统级安全防护时的完成率为1.5%,通过Daybreak Blue访问时为2.0%,GPT-5.5-Cyber则为57.3%。
这项指标衡量模型在漏洞利用链开发、认证绕过、权限提升等高级网络安全场景中完成请求的比例。它更接近“模型是否愿意并能够完成特定任务”的测量,而不是一个能够代表全面安全能力的独立基准。
OpenAI还报告了多项内部评测结果。在ExploitGym2中,模型需要在受控环境中把已知漏洞转化为可以实现任意代码执行的漏洞利用;GPT-5.6-Cyber的表现优于GPT-5.6 Sol和GPT-5.5-Cyber。在另一项更复杂的ExploitBench评测中,标准的300轮限制下,Daybreak Blue中的GPT-5.6 Sol在令牌效率和任务完成方面表现最好;将限制扩大到600轮后,两个模型之间的差距缩小。
公司同时承认,在“漏洞发现与报告撰写”评测中,GPT-5.6-Cyber的表现低于GPT-5.6 Sol。OpenAI认为,这可能与GPT-5.6-Cyber有时生成更短、细节较少的漏洞报告有关。
因此,95.0%这一数字应被理解为OpenAI针对特定内部任务设计的结果,而不能直接理解为GPT-5.6-Cyber在所有网络安全工作中拥有95%的成功率,也不能与独立第三方基准直接比较。OpenAI表示,GPT-5.6-Cyber的系统卡和更多评测结果将在稍后公布。
模型参与发现Chrome V8漏洞
OpenAI表示,研究人员使用GPT-5.6-Cyber调查了Chrome使用的JavaScript引擎V8,发现了两个此前未知、可以结合起来造成内存破坏并逃逸V8堆沙箱的漏洞。研究人员对发现进行了验证,并通过协调披露向Google报告;Google随后修复相关问题,并分配了CVE-2026-15903编号。
根据公开的漏洞数据库信息,CVE-2026-15903属于V8中的高严重性越界读写漏洞。漏洞涉及优化编译器在整数转换时错误跳过安全检查,可能导致数组索引计算异常,进而造成对其他对象内存的读取或覆盖。公开描述称,攻击者可以通过精心构造的网页内容触发漏洞,在Chrome沙箱内实现代码执行;进一步突破沙箱通常还需要另一个漏洞。
OpenAI把这项发现作为模型实际参与漏洞研究的案例,但公告没有公开完整的漏洞利用代码、研究过程或由模型独立完成的具体工作比例。更稳妥的表述是,GPT-5.6-Cyber被用于协助研究人员调查和发现V8漏洞,最终的验证、披露和修复仍处于研究人员与软件供应商的协调流程中。
OpenAI还称,GPT-5.6-Cyber帮助发现了一个流行移动操作系统中的至少五个漏洞,包括从不受信任应用通向本地权限提升的漏洞链;在一个流行数据库中发现三个可导致代码执行的严重漏洞;以及在一个流行操作系统内核中发现超过400个可能导致权限提升的漏洞。公司表示,正在与Daybreak合作伙伴和开源社区共同披露和修复这些问题,但目前尚未公开所有漏洞的名称、编号和独立验证材料。
OpenAI仍把模型能力评估为“高”而非“关键”
按照OpenAI的Preparedness Framework,公司此前将GPT-5.6 Sol的网络安全能力评估为High,低于Critical阈值。GPT-5.6-Cyber在推出前也被评估为达到High阈值,但没有达到Critical阈值。
这一区分很重要。OpenAI称,新模型在经过直接训练的专门网络安全任务上有所提升,但提升尚不足以达到其框架中更高的风险等级。公司还特别说明,GPT-5.6-Cyber没有参与此前Hugging Face相关的网络安全评测事件,也没有计划让该模型参与即将发布的相关活动。
此前,Anthropic和OpenAI披露的网络安全评测越界事件已经引发了对评测沙箱、互联网访问和第三方测试流程的关注。美国众议院部分民主党议员随后要求两家公司解释测试中的Agent越界行为和监控措施,并呼吁国会监督。相关讨论表明,安全问题已经不再只围绕模型能否完成攻击任务,也包括模型被放入什么环境、获得哪些凭证,以及组织能否及时发现和停止异常行动。
高能力模型的安全边界转向“环境控制”
OpenAI建议,Daybreak用户在隔离环境中运行安全工作流,避免让模型接触敏感生产系统或开放互联网;同时持续监控代理行动,明确授权系统和操作范围,并使用范围受限的权限配置。
公司还表示,正在推动使用Codex的Daybreak客户从完全访问模式转向自动复核模式。自动复核会在需要提升权限的行动执行前进行评估,并可能拦截具有明显破坏风险的请求。OpenAI还宣布,从2026年9月1日起,Daybreak个人账户将必须采用硬件安全密钥,并计划在未来数周推出更强的监控措施。
这些安排说明,OpenAI并没有把访问审核视为唯一防线。对于能持续调用工具、分析代码并执行多步任务的网络安全模型,风险控制还需要依赖沙箱、最小权限、凭证隔离、操作审计、人工复核和回滚机制。模型本身是否拒答,只是控制链条中的一环。
此前有关朝鲜黑客组织Kimsuky据报搭建本地大模型环境的报道,也显示攻击者可能正在探索把本地模型、RAG、AI Agent和编程工具纳入既有攻击基础设施。不过,相关研究尚不能证明这些工具已经参与某一次具体攻击。这类案例与GPT-5.6-Cyber的授权防御用途并不相同,但共同指向一个趋势:AI能力正在进入攻击和防御两端,安全边界越来越取决于身份、工具权限、网络连接和持续监控,而不只是模型名称或参数规模。
仍有几个问题等待公开信息补足
首先,95.0%的内部完成率能否被独立研究者复现,取决于OpenAI稍后公布的评测任务、提示、运行配置和评分标准。没有这些信息,外界难以判断该指标究竟反映模型能力、较高的推理预算,还是特定任务设计下的完成倾向。
其次,GPT-5.6-Cyber在真实漏洞研究中的工作分工仍不清楚。模型可以帮助搜索代码、提出假设、生成测试方案或撰写报告,但漏洞是否真实存在、能否稳定利用、影响范围如何界定,仍需要研究人员验证。
最后,Daybreak Red的准入标准、合作伙伴能够使用的具体能力,以及OpenAI如何处理模型输出可能造成的意外伤害,都还需要更多公开细节。对于高风险网络安全工具而言,透明度不只意味着公布性能数字,也意味着说明访问决策、审计记录、事故响应和责任边界。
OpenAI的最新发布反映了网络安全AI竞争的一个新阶段:模型提供商不再只展示通用模型能否识别漏洞,而是开始把“减少拒答”本身作为面向可信防御者的产品能力。它可能帮助安全研究人员更快验证和修复问题,但也要求更严格的身份审核、环境隔离和操作监督。GPT-5.6-Cyber的系统卡和后续第三方评测,将决定外界能否更准确地判断这项能力究竟扩大了多少防御优势,以及新增风险是否被控制在可接受范围内。
来源:
- OpenAI:Expanding Daybreak as the Cyber Defense Window Narrows
- OpenAI:Daybreak—Tools for securing every organization in the world
- Tenable:CVE-2026-15903
- Reuters:US House Democrats press Anthropic, OpenAI about rogue AI agents
- AIFluxNews:Kimsuky据报搭建本地大模型环境,探索将AI用于网络攻击流程
- AIFluxNews:美国众议院民主党议员要求Anthropic和OpenAI解释安全测试中的Agent越界问题
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

