模型与研究

智谱上线并开源 GLM-5.3-Flash:320B 参数支持原生多模态

智谱于 2026-08-26 发布并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,支持文本、图像、视频和文件输入,最高可处理 100 万 token 上下文。厂商披露了架构、评测与国产芯片部署细节,但多数结果仍需独立复测,且完整自托管门槛较高。

智谱上线并开源 GLM-5.3-Flash:320B 参数支持原生多模态

智谱于 2026-08-26 发布并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,支持文本、图像、视频和文件输入,最高可处理 100 万 token 上下文。厂商披露了架构、评测与国产芯片部署细节,但多数结果仍需独立复测,且完整自托管门槛较高。

智谱于 2026 年 8 月 26 日正式发布并开放权重 GLM-5.3-Flash(320B-A18B)。这是 GLM-5 系列首个原生多模态模型,支持文本、图像、视频和文件输入,最高可处理 100 万 token 上下文。模型同时接入 API、ZCode 等产品,并开放本地部署路径。

这次发布还揭开了过去一周在 OpenCode 和 OpenRouter 上匿名测试的 Ox-Alpha 身份。智谱称,该模型在测试期间成为两个平台当周最受欢迎的模型,并由国产 AI 芯片集群承载相关流量。相比此前 AIFluxNews 对疑似短暂出现的 GLM-5.3 页面所作的线索报道,这次信息来自智谱正式公告和产品资料,模型名称、规格、开放权重及接入方式均已获得官方确认。

低激活参数与长上下文架构

GLM-5.3-Flash 的总参数量为 320B,但每个 token 仅激活 18B 参数。这是一种混合专家模型的典型设计:保留较大的专家池,同时减少每一步推理实际参与计算的参数量。智谱称,该模型与 GLM-4.5 的总参数规模接近,但激活参数从 32B 降至 18B,层数也从 92 层减少到 45 层。

模型的另一项重点是长上下文推理成本。根据 Z.ai 技术博客,GLM-5.3-Flash 首次在 GLM 系列中采用稀疏注意力与线性注意力混合架构:线性注意力用于捕捉局部依赖,稀疏注意力通过轻量级索引器召回全局上下文。模型还引入 IndexPool,把索引器的四个缓存向量通过加权池化压缩为一个,以降低 100 万 token 上下文下的延迟和内存开销。

智谱在同一组对比中称,与 GLM-5.3 相比,GLM-5.3-Flash 的注意力计算量降低约 3.01 倍,KV 缓存大小降低约 4.44 倍。模型训练使用了 30T token 的多模态语料,并加入流形约束超连接(mHC)等架构设计。上述数字和技术效果主要来自厂商披露,仍需要在统一硬件、提示词和评测环境下进行独立复测。

原生视觉能力被放进代码循环

智谱将多模态能力的主要应用场景放在“视觉编码”上。模型不仅能够阅读图像,也被设计为在前端开发、游戏开发和 3D 仿真中观察渲染结果,并据此修改下一步输出。官方文档还列举了对 PPTX、PDF、DOCX 和 XLSX 等文档进行内容整理、排版检查、图表处理和视觉验证的工作流。

Z.ai 开发者文档显示,GLM-5.3-Flash 的输入模态包括视频、图像、文本和文件,输出为文本,最大输出长度为 128K token。文档同时说明,模型支持函数调用、结构化输出、上下文缓存和思考模式,API 模型代码为 glm-5.3-flash

这些能力意味着模型的评估范围不再局限于代码是否能够运行。一个网页可能只有在渲染后才会暴露布局问题,一个游戏原型也可能要经过实际操作才能发现交互缺陷。视觉反馈如果能够稳定进入代码和工具调用循环,模型就有机会从“生成代码”进一步走向“观察结果并修正工作成果”。但智谱公开的案例和演示,尚不能单独证明这些流程在不同项目中的成功率或稳定性。

Ox-Alpha 的匿名测试与国产芯片部署

在正式发布前,智谱以 Ox-Alpha 的匿名身份在 OpenCode 和 OpenRouter 上进行大规模测试,以收集用户反馈。智谱称,测试期间相关流量全部由国产 AI 芯片提供算力支持,并在过去一周首次尝试通过国产芯片集群承载大规模服务。

官方披露的重点并不是某一款芯片型号,而是围绕硬件限制重做推理服务栈。智谱表示,其在 SGLang 基础上构建了专用推理引擎,并采用 W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split,以及 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、提示词预填充和逐 token 解码拆分为可独立调度的工作池。

智谱称,在相同硬件上,端到端服务性能较初始基线提升 3 倍,硬件效率和单 token 成本达到与主流英伟达 GPU 相当的水平。这是公司对自身工程结果的描述,且“全部流量”在原文语境中指匿名预发布测试阶段的相关流量,不能据此推断所有生产流量或所有部署环境都由国产芯片承载。

评测成绩接近前沿模型,但仍需复测

智谱称,GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 中获得 57 分,并在自研 Z.ai Code Bench v1.0 的最高 effort 设置下以 29.0 对 29.5 接近 Claude Opus 4.8。官方公布的其他结果包括:Terminal-Bench 2.1 为 84.3,DeepSWE v1.1 为 63.4,AutomationBench v1.0.6 为 48.8,Toolathlon Verified 为 78.4。

其中,Artificial Analysis 的模型页面独立列出了 57 分,也记录了约 49 token/秒的输出速度和 1.51 秒的首 token 延迟。其页面显示的 API 价格为每百万 token 输入 0.15 美元、输出 0.50 美元;不同服务商、缓存和促销活动可能导致实际价格不同。

但大部分对比表格和 Z.ai Code Bench 结果仍由智谱发布。不同评测使用的 harness、采样参数、工具环境、超时限制和判断模型并不完全一致,因而不能把这些分数直接视作所有任务中的通用排名。开发者尤其需要区分“官方评测结果”与“独立第三方复测结果”。

权重开放,部署门槛仍然很高

模型权重已发布在 Hugging Face 的 zai-org/GLM-5.3-Flash 页面,模型卡标注 MIT 许可证,并提供 SGLang、vLLM、TokenSpeed、Transformers 和 KTransformers 等部署入口。模型卡页面还给出了评测参数、上下文管理方式和不同 benchmark 的脚注,具体许可证文本和版本应以模型仓库为准。

开放权重并不等于普通开发者可以轻易在单台设备上运行。Hugging Face 页面显示该仓库规模约为 328GB;即使每个 token 只激活 18B 参数,部署仍需为完整权重、运行时缓存、多模态编码和设备间通信预留资源。对多数团队来说,API、托管推理和量化部署可能比完整自托管更现实。

这一趋势也出现在中国其他前沿模型的发布中。阿里近期发布的 Qwen3.8-Flash同样把多模态、长上下文、低成本推理和开放权重放在一起讨论;而 DeepSeek 此前的 V4-Flash-0731也把 Agent 能力、API 和本地部署作为重点。GLM-5.3-Flash 的不同之处,在于它把原生视觉理解和国产芯片上的大规模服务验证同时纳入了发布叙事。

接下来要看什么

目前可以确认的事实包括:GLM-5.3-Flash 已正式发布;模型总参数为 320B、激活参数为 18B;支持文本、图像、视频和文件输入;上下文长度最高为 100 万 token;权重已在 Hugging Face 公开;API、ZCode 和本地部署框架均已有对应入口。

仍待观察的问题主要有三类:第一,独立评测能否复现智谱所公布的编码、智能体和视觉成绩;第二,模型在不同国产芯片和不同并发规模下的实际成本、吞吐与稳定性;第三,100 万 token 上下文和视觉反馈是否能在真实企业工作流中持续带来收益,而不仅是产品演示中的能力。

GLM-5.3-Flash 的发布因此不只是一次参数规模更新。它试图证明,前沿模型可以通过稀疏激活、长上下文优化、多模态训练和硬件协同,把能力、价格与部署选择同时向更广泛的开发者开放。这个判断能否成立,最终仍取决于模型在开放生态中的复测结果,以及开发者能否以可接受的基础设施成本把它稳定地用起来。

原始资料:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读