英伟达宣布 Groq 3 LPX 进入全面量产,瞄准 Agent 推理低延迟
英伟达宣布面向交互式 AI 推理的 Groq 3 LPX 已进入全面量产,作为 Vera Rubin 平台的低延迟扩展,针对 Agent 在多次生成 token 的循环中降低响应等待。英伟达和合作云商 Nebius 称在特定基准下实现显著加速,但实际部署性能、成本和软件生态还需进一步验证。
英伟达宣布面向交互式 AI 推理的 Groq 3 LPX 已进入全面量产,作为 Vera Rubin 平台的低延迟扩展,针对 Agent 在多次生成 token 的循环中降低响应等待。英伟达和合作云商 Nebius 称在特定基准下实现显著加速,但实际部署性能、成本和软件生态还需进一步验证。
英伟达于 2026 年 8 月 24 日宣布,面向交互式人工智能推理的 Groq 3 LPX 已进入全面量产。该加速器是 Vera Rubin 平台的扩展,主要处理 Agent 在推理、工具调用和代码执行过程中反复生成 token 所带来的延迟问题。
英伟达表示,Groq 3 LPX 在 Artificial Analysis 的测试中运行 Gemma 4 31B、并使用 100,000 token 上下文时,达到每秒 3,400 个输出 token。公司称,这一结果是该模型目前记录到的最高速度,并声称相关 Agent 工作负载的响应速度较最近的替代平台快约 4 倍。
不过,这些数字来自英伟达引用的第三方基准,不能直接等同于所有生产部署中的实际表现。模型类型、上下文长度、并发规模、软件栈和系统配置,都会影响最终速度。
Groq 3 LPX 解决的是 Agent 循环中的“生成等待”
传统 AI 推理通常把重点放在整体吞吐量上,例如每秒能够服务多少请求,或一套系统能够生成多少 token。但 Agent 的工作方式不同:它们往往需要在多个步骤中读取文件、调用工具、执行代码、检查结果,再根据结果继续行动。
在这种循环里,每一步生成的延迟都会累积。即使单次响应只慢一小段时间,当一个任务包含数十乃至数百次模型调用时,等待时间也可能成为整个工作流的主要瓶颈。英伟达因此把 Groq 3 LPX 定位为“交互式 AI 推理加速器”,重点不是取代 Vera Rubin 的通用计算能力,而是为低延迟 token 生成提供专门路径。
根据英伟达的官方产品介绍,Vera Rubin GPU 更适合处理大规模上下文输入和通用推理任务,LPX 则承担对延迟敏感的 decode 工作。两者共同构成异构推理架构:GPU 负责处理较大的上下文和相关计算,LPX 加速模型逐 token 生成的部分。
这类分工与英伟达近期把模型能力拆分为规划、检索和执行层的做法相呼应。AIFlux此前报道的英伟达 Nemotron 3.5 Lightning 高频 Agent 执行模型关注的是用更快、更低成本的模型承担重复性任务;Groq 3 LPX则从硬件层面缩短这些任务的生成等待。两者共同指向同一个变化:Agent 的竞争不再只是比较单次回答能力,也开始比较持续运行时的延迟和成本。
一个 LPX 机架包含 256 个 LPU 加速器
英伟达开发者博客显示,Groq 3 LPX采用机架级设计,一个系统最多包含 256 个相互连接的 Groq 3 LPU 加速器。整机提供 128GB 片上 SRAM,片上 SRAM 带宽达到每秒 40PB,芯片之间的 scale-up 总带宽达到每秒 640TB。
每个 LPU包含约 500MB 的高速 SRAM,并通过直接芯片间连接组成大规模推理系统。英伟达强调,这种设计采用确定性执行和编译器协调的数据移动方式,试图减少动态调度带来的延迟波动,让每个 token 的生成时间更稳定。
在与 Vera Rubin NVL72 配合时,LPX并不是一个孤立运行的通用加速器。英伟达的技术说明称,Rubin GPU和 LPU 会共同计算模型的各个层,其中 GPU 继续承担上下文处理和部分注意力计算,LPX则加速对延迟敏感的前馈网络和混合专家模块执行。
这种架构反映出大模型推理正在分化为不同阶段。输入上下文可能达到数十万甚至上百万 token,需要较大的高带宽内存和并行计算能力;而输出阶段则更依赖稳定、快速的逐 token 生成。把两个阶段交给不同类型的处理器,有望在交互速度和整体吞吐量之间取得更好的平衡,但也会增加系统部署、编排和软件优化的复杂度。
英伟达在其技术博客中称,Vera Rubin 与 LPX 配合后,在特定模型和系统条件下,推理吞吐量每兆瓦最高可提升 35 倍,并可能为万亿参数模型带来更高的收入机会。这些属于英伟达公布的性能和经济性预测,实际结果仍需由客户部署和独立测试验证。
Nebius计划率先把 LPX带入云服务
在商业化方面,Nebius计划把 Groq 3 LPX加入其 Token Factory生产推理平台,向开发者提供高吞吐、低延迟的 Agent 推理服务。英伟达称,Nebius是首个采用 Groq 3 LPX 的 AI 云服务商;Groq本身也计划成为较早采用该平台的用户之一。
Nebius 首席技术官 Danila Shtan 在英伟达公告中表示,公司希望通过开发者已经在使用的 API 提供这项能力,而不要求客户迁移到新的软件栈。不过,公告使用的是“计划带入生产”和“计划采用”等表述,并不意味着相关部署已经全面完成。
这一步的重要性在于,低延迟推理加速器是否有价值,最终取决于它能否进入开发者实际使用的服务,而不只是停留在机架规格或实验室测试中。Nebius此前公布的业绩显示,AI 云业务正通过大型合同和基础设施扩张快速增长,但公司也同时承受高额资本支出、设备交付和现金流压力。其AI 云合同与容量扩张能否转化为实际可用的容量,将决定类似 LPX 平台能否获得规模化需求。
对于 AI 云服务商来说,部署新型推理硬件也不仅是采购芯片的问题。机架需要匹配电力、液冷、网络、存储和调度软件,模型还必须经过编译和适配,才能发挥 LPU 的确定性执行优势。系统越专用,理论上的性能上限可能越高,但运营商也越需要在模型支持范围和软件生态上投入。
行业从“训练规模”转向“推理经济性”
Groq 3 LPX进入全面量产的背景,是 AI 基础设施的关注点正在从模型训练逐步转向模型推理。随着推理模型和 Agent 被用于代码开发、客户服务、数据分析和企业自动化,系统需要持续生成更多 token,且每个任务可能经历更长的工具调用链。
英伟达在 LPX 产品页面中称,Agent 系统消耗的 token 数量可能达到传统 AI 应用的 15 倍。这个数字属于英伟达的行业判断,但它说明了硬件厂商正在用新的指标衡量基础设施:不只是训练一个模型需要多少算力,还包括一个 Agent 完成任务需要生成多少 token、每个 token 的成本是多少,以及用户能否在等待时间尚可接受的情况下持续交互。
AI云服务商的扩张也在提高这种推理经济性的重要性。AIFlux此前报道,CoreWeave上调2026年资本支出计划,将全年指引提高至350亿至390亿美元;这类AI 云基础设施扩张反映出市场仍在为算力需求增加大量服务器、电力和数据中心容量。对这些运营商而言,能够以更低延迟和更高利用率提供推理服务,可能比单纯增加 GPU 数量更直接地影响投资回报。
但更快的 token 生成并不等于更可靠的 Agent。企业仍然需要验证模型输出、管理工具权限、记录操作过程,并在代码或数据处理出错时进行回滚。速度提升后,系统可能在更短时间内执行更多动作,因而也需要更严格的测试和控制机制。
基准成绩之外仍有几个问题待验证
目前可以确认的是,英伟达已宣布 Groq 3 LPX进入全面量产,并把它作为 Vera Rubin 平台面向 Agent 推理的低延迟扩展;Nebius计划成为首批云端采用者之一;英伟达引用的 Artificial Analysis 测试则给出了 Gemma 4 31B 在 100,000 token 上下文下每秒 3,400 个输出 token 的结果。
仍需要进一步观察的,是这些性能能否在不同模型、不同上下文长度和不同并发条件下保持,以及 LPX 是否会被更多 AI 云服务商和模型提供商采用。英伟达还没有公布面向客户的统一价格、每 token 成本或完整的生产部署数据,Nebius也尚未披露该平台的具体上线时间和服务定价。
此外,LPX的价值将取决于软件生态能否跟上硬件。若只有少数模型能够充分利用编译器、片上 SRAM和专用数据通路,运营商可能需要在灵活性与峰值速度之间作出取舍。相反,如果更多开源模型和商业模型能够在这一架构上运行,低延迟推理加速器才可能从单一平台的性能卖点,发展为 AI 云基础设施的常见组成部分。
从目前的信号看,英伟达正在把 Vera Rubin打造为一个由 GPU、LPU、网络和软件共同组成的推理平台。Groq 3 LPX 的量产,标志着英伟达开始以专用硬件回应 Agent 工作负载中的另一类瓶颈:不是模型能否生成答案,而是它能否在数百次连续行动中,以足够快、足够稳定的速度生成每一个下一步。
来源
- NVIDIA Newsroom:NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI
- NVIDIA:Groq 3 LPX Interactive AI Inference Accelerator
- NVIDIA Developer:Inside NVIDIA Groq 3 LPX
- NVIDIA:With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference
- Artificial Analysis:Gemma 4 31B
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

