英伟达宣布 Vera Rubin 平台进入全面量产,面向 Agentic AI 工厂
英伟达在2026年GTC宣布Vera Rubin平台进入全面量产,将多类专用机架(Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4、Spectrum-6)整合为可扩展POD级AI工厂,宣称在特定条件下对Agent工作负载可实现约10倍吞吐量,但实际部署与商业验证仍待观察。公司同时推进共封装光学的Spectrum-X以扩展网络并强调DSX参考设计与安全、供应链和云厂商生态的配套。
英伟达在2026年GTC宣布Vera Rubin平台进入全面量产,将多类专用机架(Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4、Spectrum-6)整合为可扩展POD级AI工厂,宣称在特定条件下对Agent工作负载可实现约10倍吞吐量,但实际部署与商业验证仍待观察。公司同时推进共封装光学的Spectrum-X以扩展网络并强调DSX参考设计与安全、供应链和云厂商生态的配套。
英伟达于2026年8月26日在台北举行的 GTC 活动上宣布,面向下一代 Agentic AI 工厂的 Vera Rubin 平台开始进入全面量产。该平台不再只是单一 GPU 或服务器产品,而是将计算、推理、CPU 环境、存储和网络整合为可扩展的 POD 级系统。
英伟达表示,Vera Rubin 由 Vera Rubin NVL72、Vera CPU、Groq 3 LPX、BlueField-4 STX 存储系统和 Spectrum-6 SPX 网络机架组成。按照公司的规模化 Agent 工作负载比较,Vera Rubin 相较上一代 Grace Blackwell 平台,最高可实现约10倍的 Agent 吞吐量。
不过,这些数字均来自英伟达披露的特定比较条件,尚未由独立机构针对广泛客户环境复测。平台进入量产,也不等同于客户已经完成部署或相关收入已经确认。
从单个加速器转向五类机架协同
Vera Rubin 的核心变化,是把 AI 基础设施从离散芯片和独立服务器,推进到由多类专用机架共同组成的 POD 级超级计算机。
英伟达开发者博客介绍,一个完整的 Vera Rubin POD 包含五类面向不同阶段的机架:NVL72 负责大规模训练和推理,Vera CPU 为强化学习及 Agent 沙箱提供通用计算能力,Groq 3 LPX 加速低延迟的逐 token 生成,BlueField-4 STX 处理面向 AI 上下文的存储,Spectrum-6 SPX 则负责连接各类计算和存储资源。
其中,Vera Rubin NVL72 集成72块 Rubin GPU 和36颗 Vera CPU,并通过第六代 NVLink 连接。英伟达称,该系统面向预训练、后训练、测试时扩展和 Agent 扩展等不同工作负载;在特定条件下,它可以用更少的 GPU 训练大型混合专家模型,并降低推理阶段的 token 成本。
这种架构与此前已经单独进入量产的 Groq 3 LPX 低延迟推理系统相衔接。后者主要针对 Agent 在推理、工具调用和代码执行过程中反复生成 token 所产生的延迟,而不是取代 Rubin GPU 的通用计算能力。
为 Agent 工作负载重新安排计算分工
英伟达对 Vera Rubin 的定位,建立在一个判断之上:Agent 的计算需求与传统聊天式 AI 并不相同。
一个复杂的 Agent 任务可能先规划步骤,再检索资料、调用工具、执行代码、检查结果,并根据返回结果继续行动。模型需要处理越来越长的上下文,也需要在多个连续步骤中稳定地产生 token。因此,系统的瓶颈不仅是训练速度,还包括上下文处理、内存容量、网络通信、代码执行环境和每一步的响应延迟。
在这一分工中,Rubin GPU 更适合处理大规模上下文和并行计算,Groq 3 LPX 面向对延迟敏感的 decode 阶段,Vera CPU 则为大量 CPU 沙箱和强化学习环境提供资源。BlueField-4 STX 引入面向 KV cache 的 AI 原生存储层,试图让跨会话、跨 Agent 的上下文能够被更快地保存和调用。
英伟达开发者资料称,Vera Rubin POD 可由40个机架组成,包含1,152块 Rubin GPU、近2万个英伟达芯片,以及每秒10 PB 的总 scale-up 带宽。这些是平台级设计数据,并不代表每一个客户部署都会采用完整配置。
光子网络瞄准百万 GPU 规模
网络是 Vera Rubin 平台的另一项重点。英伟达宣布,Spectrum-X Ethernet Photonics 已进入生产,将共封装光学技术与 Spectrum-X 交换机结合,用于扩大 AI 工厂的横向扩展能力。
传统可插拔光模块在大规模集群中会带来功耗、布线和可靠性压力。共封装光学把光学器件更紧密地集成到交换系统中,英伟达称,这一方案在特定对比条件下可实现5倍光学电源效率、5倍更长的 AI 运行时间和1.3倍更快的部署速度,并为百万 GPU 级别的 AI 工厂提供网络基础。
需要注意的是,这些指标来自厂商公布的比较结果。实际效果会受到网络拓扑、光模块方案、并发规模、通信模式、软件栈和故障恢复机制等因素影响,不能直接理解为所有数据中心的普遍提升。
BlueField-4 DPU 还被用于网络隔离、存储访问和基础设施安全。英伟达表示,BlueField-4 可提供最高800Gb/s的软件定义网络能力,并支持多租户隔离;配合 DOCA 软件平台,运营商可以在不占用主机 CPU 资源的情况下实施零信任策略、运行时威胁检测和端到端加密。
350多座工厂正在推进生产
英伟达称,全球供应链中已有超过350座工厂、分布在30个国家,正在推进 Vera Rubin 系统生产,其中台湾有150多家供应链合作伙伴参与。戴尔、惠普企业、联想和超微等系统厂商,以及富士康、广达、纬创、和硕等台湾及亚洲制造商,都被列入合作生态。
英伟达还表示,AI 云服务商和基础模型公司正在采用或规划采用 Vera Rubin 相关系统。名单包括 CoreWeave、Lambda、Oracle Cloud Infrastructure、微软 Azure、Nebius、IBM Cloud、Nscale 和 Vultr 等云服务商,以及 Anthropic、Meta、Mistral AI 和 OpenAI 等模型开发者。
这类生态扩张与云厂商提前锁定大规模算力的趋势相互关联。AIFlux此前报道,AWS与英伟达计划在2027年至2028年新增部署200万块 GPU,合作范围也从 GPU 延伸到 CPU、网络、数据处理和机器人平台。这表明,云服务商采购的对象正在从单一加速卡转向包含机架、电力、网络、软件和运维在内的完整基础设施组合。
但“供应链进入生产”与“客户完成部署”之间仍有明显距离。系统需要经过制造、运输、机房改造、液冷和供电配套、网络调试以及软件适配,最终能否形成可用算力,还取决于客户项目的建设进度。
DSX 把机架设计延伸到数据中心
英伟达同时强调 DSX 平台的作用。DSX 被定位为从芯片到电网的 AI 工厂参考设计,将计算、网络、存储、电力、冷却、设施控制和生命周期管理放在同一套架构中。
对于大规模 AI 工厂而言,机架本身只是基础设施的一部分。GPU 和 LPU 的性能必须与电力容量、液冷系统、网络带宽、存储层和调度软件匹配,否则理论峰值难以转化为持续的有效吞吐量。英伟达称,DSX Max-Q 等设计可以根据工作负载动态配置功率,在固定电力预算下部署更多 AI 基础设施;这些同样属于英伟达公布的架构目标,仍需通过实际项目验证。
随着数据中心规模扩大,土地、电力和机房外壳也成为算力建设的约束条件。英伟达近期与 SB Energy 围绕俄亥俄州 AI 数据中心容量展开的合作,显示公司正在把 GPU 供应与土地、电力、长期租赁和融资支持结合起来。AIFlux对该项目的报道指出,容量和 GPU 交付计划仍属于分阶段安排,不能直接等同于已经建成的算力。
安全问题被纳入平台级设计
英伟达还把机密计算和多租户安全列为 Vera Rubin 的组成部分。随着 Agent 开始处理企业内部数据、受监管内容和任务执行权限,数据中心不再只是运行模型的场所,也需要对上下文记忆、工具调用和推理过程进行隔离。
Vera Rubin NVL72 将 Vera CPU、Rubin GPU、NVLink 网络和安全功能整合在统一平台中。英伟达表示,系统能够对高速互联中的数据进行加密,并通过硬件级证明确认运行环境没有被篡改。
这类机制可以提高共享云环境中的隔离能力,但它并不能单独解决 Agent 的全部风险。企业仍需对工具权限、身份认证、输出验证、操作审计和异常回滚进行软件层面的控制。硬件安全能力能否转化为易于使用的生产策略,也将影响客户是否愿意把更多自主任务交给 Agent 执行。
量产之后,商业验证才刚开始
从目前公开信息看,英伟达已经确认 Vera Rubin 平台进入全面量产,并计划从2026年秋季开始出货。已确认的内容包括平台组成、合作供应链范围、Spectrum-X Ethernet Photonics 的生产状态,以及英伟达对 Agent 吞吐量和网络效率的比较结果。
仍未明确的是,不同客户将采用哪些机架组合,完整 POD 的实际部署规模如何,首批系统何时在云平台上线,以及客户在真实模型、长上下文和多租户环境中能够获得怎样的成本收益。英伟达也没有在这份公告中披露统一的客户价格、每 token 成本或已经确认的相关收入。
因此,Vera Rubin 的意义目前更多体现在基础设施路线的变化:英伟达试图把 AI 工厂从“堆叠更多 GPU”转变为由 GPU、专用推理处理器、CPU 沙箱、上下文存储和高速网络共同组成的系统工程。对于 Agent 应用而言,最终竞争的指标可能不只是模型回答得多好,还包括它能否在数百次连续行动中保持足够快的响应、稳定的运行和可控的成本。
如果这一整套架构能够按计划量产并被云服务商规模化采用,Vera Rubin 将成为英伟达从 GPU 供应商进一步转向 AI 工厂基础设施平台的重要一步。但在出货、部署和商业收入真正形成之前,厂商披露的性能数字仍应与具体工作负载、软件栈和运营条件一起理解。
来源
- NVIDIA Newsroom:NVIDIA Vera Rubin Ramps Into Full Production to Power Agentic AI Factories Worldwide
- NVIDIA Newsroom:NVIDIA Vera Rubin Opens Agentic AI Frontier
- NVIDIA Developer:NVIDIA Vera Rubin POD: Seven Chips, Five Rack-Scale Systems, One AI Supercomputer
- NVIDIA:Vera Rubin NVL72
- NVIDIA:Vera Rubin Driving Performance Per Watt, Lower Token Costs
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

