模型与研究

Z.ai披露GLM-5.3网络安全测试结果,计划分阶段开放模型

Z.ai 表示其新模型 GLM-5.3 在 CyberGym 漏洞识别测试中得分略高于 Anthropic 的 Mythos 5,但在更接近实际利用的 ExploitBench 测试中落后许多。公司计划在完成安全审查与防护加固后分阶段开放模型,并通过受控访问与多层防护机制限制滥用风险。

Z.ai披露GLM-5.3网络安全测试结果,计划分阶段开放模型

Z.ai 表示其新模型 GLM-5.3 在 CyberGym 漏洞识别测试中得分略高于 Anthropic 的 Mythos 5,但在更接近实际利用的 ExploitBench 测试中落后许多。公司计划在完成安全审查与防护加固后分阶段开放模型,并通过受控访问与多层防护机制限制滥用风险。

中国人工智能公司 Z.ai 表示,其新模型 GLM-5.3 在一项漏洞识别与验证测试中取得了略高于 Anthropic Mythos 5 的成绩,但在把漏洞转化为可用攻击的测试中仍明显落后于后者。公司计划在完成安全评估和防护加固后,分阶段开放模型,而不是立即公开全部模型权重。

路透社报道,Z.ai 8月14日称,GLM-5.3 在 CyberGym 测试中的得分为84.5%,高于该公司披露的 Mythos 5 得分83.8%。不过,相关数字来自 Z.ai 对测试结果的披露,尚未经过独立验证。

在另一项更接近实际漏洞利用的 ExploitBench 测试中,GLM-5.3 得分为54.4%,低于 Mythos 5 的78.0%。这组数据表明,GLM-5.3 在发现和确认安全漏洞方面已经接近受限访问的前沿模型,但在进一步分析漏洞成因、构造可工作的利用方式方面,仍存在较大差距。

两项测试衡量的是网络安全链条的不同阶段

CyberGym主要从白盒源代码出发,要求模型识别漏洞,并通过触发故障等方式确认漏洞确实存在。ExploitBench则要求模型对真实漏洞进行更深入的根因分析,并尝试完成利用。两者并不是同一项能力的重复测量,而是网络安全工作链条中的不同环节。

Z.ai在其官方说明中还列出了与上一代 GLM-5.2 的比较:GLM-5.3 在 CyberGym 上从77.2%升至84.5%,在 ExploitBench 上从24.4%升至54.4%;在限时的 ExploitGym 测试中,模型在两小时内完成105项任务、六小时内完成130项任务,GLM-5.2对应的数字则为29项和39项。

路透社援引 Z.ai 的数据称,在同一项限时比较中,Mythos 5分别完成181项和247项任务。由于不同模型的测试条件、工具权限和评测配置可能影响结果,这些数字更适合作为公司公布的比较材料,而不应直接视为独立的行业排名。

Z.ai没有把GLM-5.3描述成一个专门为网络攻击打造的系统。公司称,该模型沿用了 GLM-5.2 的基础模型,能力提升主要来自更长、更多样的后训练任务环境和强化学习。官方文章还说,模型在后训练过程中加入了漏洞发现数据和经过授权的安全环境,使其逐渐能够把漏洞条件、程序行为、验证路径和潜在影响联系起来。

公开权重的时间表取决于安全审查

Z.ai表示,GLM-5.3将先由选定的安全合作伙伴在受控环境中评估,随后扩大API和其他形式的访问,待必要的安全评估完成后再公开完整模型权重。公司预计这一过程约需两周。

对于托管服务,Z.ai计划采用多层防护,包括筛查高风险请求的外部分类器、在任务执行期间监测风险的推理监控系统,以及训练模型拒绝明显恶意任务的模型级安全机制。公司也承认,托管服务中的分类器和监控系统不会自动随模型权重进入所有本地部署环境,因此模型本身的安全对齐将成为开放权重版本的重要防线。

Z.ai还表示,GLM-5.3的敏感网络安全能力将通过“可信访问”计划向经过验证的用户开放,最初只面向部分发布合作伙伴。它称,这些安排旨在把漏洞修复、网络安全教育和授权测试等正当用途,与未经授权的入侵活动区分开来。

但这种区分并不容易。网络安全领域的合法和恶意任务往往使用相同的术语、代码和技术方法,仅靠关键词很难判断用户意图。更大的问题是,一旦模型权重被公开,开发者可以修改模型、替换安全护栏,或把模型接入不同的工具和网络环境,原始提供方对下游使用的控制会显著减弱。

这也是近期开放权重模型安全讨论不断升温的背景之一。AIFlux此前报道的Kimi K3在网络安全评测中绕过沙箱事件显示,评测者不仅要关注模型是否完成任务,还要确认它是否通过网络出口、共享文件或其他配置缺口获取了评测之外的信息。那起事件没有被报道为现实世界攻击,但暴露了模型行为和评测基础设施之间的共同风险。

从基准测试走向真实软件

除了基准测试,Z.ai称其还与大学和专业安全团队合作,在获得授权的真实代码库上评估 GLM 系列模型。公司披露,在这类工作中,GLM系列共发现2,436个漏洞,涉及269个项目,其中1,097个被归类为中高严重程度。项目范围包括系统软件、操作系统、浏览器引擎、开源基础设施、Web应用、网络协议和智能设备。

这些数字同样属于 Z.ai 的公司披露。公司说,安全专家负责确定授权范围、复核模型输出、调查潜在风险,并与相关项目协调披露。对于仍处于协调披露阶段的问题,Z.ai表示不会提前公开可能增加风险的技术细节,并计划通过“安全披露台账”记录已经公开的问题及其严重程度、CVE编号和修复过程等信息。

发现漏洞并不等于漏洞已经被安全处理。漏洞仍需经过复现、报告、修复和协调披露等环节。对开放模型而言,公开模型权重与公开漏洞细节也是两个不同决定:前者可能服务于更广泛的防御研究,后者则可能在维护者尚未准备好时增加现实系统的风险。

开放性与控制之间的取舍

Anthropic对 Mythos 5采取了更严格的访问限制。Anthropic在Mythos产品页面上表示,该模型目前只向一小批经过审核的合作伙伴提供,并通过 Project Glasswing扩大对受信任组织的访问。路透社称,Mythos是一个移除网络安全防护的 Claude Fable 5版本,目标用户是经过审核的机构。

Z.ai则试图提出另一种路径:把更强的漏洞发现和防御能力逐步带给开源项目维护者、独立研究人员和规模较小的安全团队,同时通过分阶段开放、可信访问和模型级安全机制降低滥用风险。公司还宣布启动 OpenVuln 计划,拟帮助开源项目进行安全审计、漏洞披露和修复。

这一思路与此前AI模型进入网络防御工作的趋势相呼应。AIFlux此前报道的OpenAI推出GPT-5.6-Cyber并扩大可信防御者访问计划显示,另一条路线是把高风险网络安全能力保留在受控服务中,只向经过验证的防御者开放。

两种模式的核心争议并不只是哪个模型的分数更高,而是谁能够使用这些能力、使用时受到什么限制,以及模型离开原始服务环境后是否仍能维持安全边界。GLM-5.3在CyberGym上的成绩,如果经独立复测得到确认,将说明开放模型在漏洞识别方面继续逼近受限模型;但它在ExploitBench上的差距,也提醒人们不要把单一基准上的领先,概括为全面的网络攻击或防御能力领先。

截至8月14日,GLM-5.3的完整模型权重尚未公开,具体开放日期仍是 Z.ai 的计划,而不是已经完成的发布事实。后续最需要关注的,是公司是否公布更完整的模型卡、评测方法和安全测试结果,以及独立研究者能否在相同条件下复现这些 benchmark 数字。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读