英伟达在 MLPerf Inference v6.1 的预览提交中披露 Vera Rubin NVL72 的早期表现,针对 Qwen3‑VL 和 DeepSeek‑R1 场景,分别对比 GB300 NVL72 给出最高 3.7 倍与 2.5 倍的吞吐量提升,同时强调这些结果依赖软硬件与服务架构的协同优化,并非在所有部署下通用结论。
英伟达于 2026 年 9 月 16 日公布 Vera Rubin NVL72 首次参与 MLPerf Inference v6.1 的预览提交结果。按照英伟达对结果的解读,在 Qwen3-VL 的离线、服务器和交互式场景中,Vera Rubin NVL72 的吞吐量最高达到 GB300 NVL72 的 3.7 倍;在 DeepSeek-R1 场景中,最高达到后者的 2.5 倍。
这些数据来自 MLCommons 当天公布的 MLPerf Inference v6.1 结果,属于英伟达提交的预览结果,而不是针对所有模型、部署方式或生产环境的独立结论。英伟达的官方说明也显示,相关性能依赖硬件、精度、推理框架和服务架构的协同优化。
Vera Rubin NVL72 首次出现在 MLPerf Inference 预览提交中
英伟达在其官方博客中说,Vera Rubin NVL72 本轮提交覆盖 DeepSeek-R1 和 Qwen3-VL 两项测试。
在 Qwen3-VL 测试中,英伟达使用 vLLM 与其开源 NVIDIA Dynamo 推理框架;在 DeepSeek-R1 测试中,则使用 TensorRT-LLM。英伟达称,Vera Rubin NVL72 在前一项测试中的吞吐量相较 GB300 NVL72 最高提升 3.7 倍,在后一项测试中最高提升 2.5 倍,覆盖离线、服务器和交互式场景。
英伟达同时强调,结果体现的是软硬件协同设计。其披露的优化包括改进的 Tensor Core 和 Transformer Engine、NVFP4 精度,以及将预填充和解码分离的服务架构。对于 DeepSeek-R1 和 Qwen3-VL 这类混合专家模型,提交还大量使用了专家并行,以提高机架级系统的资源利用率。
这类优化说明,MLPerf 测试中的“硬件性能”并不是只由 GPU 芯片本身决定。模型版本、量化精度、推理软件、批处理方式、请求模式以及服务系统的调度策略,都会影响最终吞吐量。因此,3.7 倍和 2.5 倍应被理解为特定条件下的相对结果,而非 Vera Rubin 在所有任务中都能保持的固定比例。
四机架 GB300 提交达到 99% 扩展效率
除了 Vera Rubin 的预览结果,英伟达还公布了 GB300 NVL72 的扩展测试。一项由四个机架组成、共 288 张 GPU 的提交,在离线场景中达到 99% 的扩展效率;英伟达称,随着系统从单机架扩展到四机架,吞吐量接近线性增长。
扩展效率衡量的是增加硬件后,系统实际吞吐量相对于理想线性增长的接近程度。99% 的结果意味着,在该项测试和配置下,跨机架通信、调度与同步带来的额外损耗相对有限。但它并不意味着任何模型、任何并行方式或任何数据中心网络都能达到同样表现。
这一结果也反映了 AI 推理基础设施竞争的变化。随着模型规模和服务请求量增加,用户关注的已经不只是单张加速卡的峰值速度,还包括系统能否在扩大部署规模时保持较高效率。如果扩展损耗过大,新增的 GPU 可能无法转化为等比例的有效吞吐量,资本和电力成本也会随之上升。
MLPerf v6.1 正在扩大对真实推理部署的覆盖
MLCommons 在官方结果说明中表示,MLPerf Inference v6.1 收到来自 30 家参与机构的提交,创下参与机构数量的新高。本轮测试加入了端到端检索增强生成(RAG)和边缘智能体推理两项新测试,并在部分交互式场景中加入了对推测解码的支持。
MLCommons 将 MLPerf Inference 描述为一种架构中立、可复现的系统性能测试,用于帮助用户比较不同 AI 系统的推理能力。该组织还指出,本轮 VLM 测试中,单加速器服务器场景的最佳结果较六个月前的 v6.0 提升 2.99 倍;DeepSeek-R1 测试中,单加速器服务器场景的最佳结果较一年前的 v5.1 提升 5.7 倍。
这些数字不能直接等同于 Vera Rubin NVL72 相对 GB300 的 3.7 倍结果。前者是跨版本、跨提交的最佳结果变化,后者是英伟达针对具体系统、模型和测试场景给出的代际比较。两组数据的比较对象和统计口径不同,不能混用。
v6.1 的新测试也显示,行业基准正在从单轮模型推理转向更接近实际应用的多步骤工作流。RAG 测试涉及嵌入、向量检索、重排序和语言模型生成等多个环节;边缘智能体推理则模拟带有不断增长的对话历史、证据收集和多轮推理的任务。随着智能体工作流普及,单纯测量一次请求的延迟或吞吐量,越来越难以反映整个系统的真实成本。
这也是为什么英伟达近期的基础设施叙事,开始从单一 GPU 扩展到由 GPU、CPU、网络、存储和推理软件共同组成的系统。此前 AIFlux 对英伟达 Vera Rubin 平台进入全面量产的报道指出,平台级性能仍需结合真实部署、液冷、供电、网络和软件适配来验证,而不能只看厂商公布的峰值数字。
性能提升背后是软硬件协同,而非单一芯片替换
英伟达表示,Vera Rubin NVL72 的提交使用了更低精度的 NVFP4,以减少模型权重、注意力计算和 KV 缓存的内存占用;同时,通过分离预填充和解码,可以分别优化输入处理与逐 token 生成两个阶段。
对于大语言模型和视觉语言模型来说,预填充阶段通常需要处理大量输入上下文,解码阶段则决定用户逐步获得输出的速度。将两者拆分后,系统可以针对不同阶段配置资源,并在高并发场景中减少相互干扰。不过,这种方式也会增加系统设计和调度的复杂度,实际收益取决于请求分布、上下文长度和服务架构。
Vera Rubin NVL72 的平台页面显示,该系统由 72 个 Rubin GPU、36 个 Vera CPU,以及 ConnectX-9 SuperNIC 和 BlueField-4 DPU 等组件组成,并通过第六代 NVLink 进行机架级互联。英伟达将其定位为面向训练、后训练、测试时扩展和实时智能体推理的机架级平台。
平台页面还列出了更低 token 成本、更高每兆瓦 token 吞吐量等指标,但这些数据带有特定模型、上下文长度和对比平台的条件,部分内容也明确标注为预计性能。因此,它们适合用来说明英伟达的产品定位,不应与 MLPerf 的已提交测试结果混为一谈。
预览结果距离广泛商业验证仍有距离
从已公布信息看,MLPerf Inference v6.1 为 Vera Rubin NVL72 提供了首次公开的标准化预览提交,也使外界能够看到其在新一代模型和推理场景中的早期表现。但目前仍有几个问题没有得到完整回答。
首先,Vera Rubin 的预览提交并不等于所有客户都能获得相同结果。云服务商或企业客户可能使用不同的软件版本、量化策略、网络配置和请求结构。其次,吞吐量并不是推理经济性的唯一指标。首 token 延迟、持续延迟、准确率、功耗、系统利用率、故障恢复和运维成本,都会影响每个 token 的实际成本。
再次,厂商提交与独立第三方的广泛复测之间仍存在差别。MLPerf 的测试规则和结果页面提供了统一的比较框架,但具体提交仍由参与者完成,读者需要查看系统配置、模型设置、场景和补充说明,才能判断结果是否适用于自己的工作负载。
这意味着,Vera Rubin NVL72 本轮结果更适合被视为一个早期信号:英伟达正在通过新一代 GPU、机架级互联、低精度计算和推理软件协同,争取在高密度推理市场建立新的性能基线。它是否能够转化为稳定的客户吞吐量、更低的运营成本和可规模化的商业收益,还要等待更多独立提交、真实生产数据和后续 MLPerf 轮次的验证。
英伟达官方博客:NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut
MLCommons 官方结果:MLCommons Sets Participation Record with New MLPerf Inference v6.1 Benchmark Results
MLPerf Inference 结果页面:MLPerf Inference
NVIDIA Vera Rubin NVL72 产品页面:NVIDIA Vera Rubin NVL72
AIFlux此前报道:NVIDIA Nemotron 3 Embed 登顶 RTEB,押注更高效的智能体检索