基础设施与工程

英伟达发布 Nemotron 3.5 Lightning:30B 开放模型面向高频 Agent 执行

英伟达发布 Nemotron 3.5 Lightning(30B 混合专家模型)及开源路由库 NeMo Switchyard,定位为长时间运行 AI Agent 中负责高频、低成本执行的模型与多模型协作基础设施。这两项发布旨在通过模型路由与更快的执行模型降低持续运行的延迟和成本,同时保留前沿模型用于规划与复杂推理。

英伟达发布 Nemotron 3.5 Lightning:30B 开放模型面向高频 Agent 执行

英伟达发布 Nemotron 3.5 Lightning(30B 混合专家模型)及开源路由库 NeMo Switchyard,定位为长时间运行 AI Agent 中负责高频、低成本执行的模型与多模型协作基础设施。这两项发布旨在通过模型路由与更快的执行模型降低持续运行的延迟和成本,同时保留前沿模型用于规划与复杂推理。

英伟达于 2026 年 8 月 11 日发布 Nemotron 3.5 Lightning,并同步推出开源模型路由库 NeMo Switchyard。前者被定位为长时间运行的 AI Agent 中负责高频执行的小型模型,后者则试图在不同模型之间自动分配任务。

英伟达的判断是,复杂 Agent 并不会在每一步都需要最强的推理模型。规划、任务拆解等环节可以交给前沿模型,而工具调用、结果校验、代码检查和子代理协作等重复性工作,则可以由更快、更便宜的执行模型完成。两项发布合在一起,构成了英伟达对“模型系统”而不是单一模型的押注。

面向 Agent 执行层的混合专家模型

根据英伟达的开发者文章,Nemotron 3.5 Lightning 是一个总参数量 300 亿、每个 token 约激活 30 亿参数的混合专家(MoE)模型。它采用 Mamba-2、MoE 与 Attention 相结合的混合架构,并配合多 token 预测和推测解码等技术,以提高生成速度。

官方模型卡显示,该模型支持最长约 100 万 token 的上下文,提供 BF16 和 NVFP4 两种版本,面向长时间运行的自主 Agent、子代理工作负载及其他 Agent 工作流。模型卡列出的主要支持语言包括英语、西班牙语、法语、德语、意大利语和日语,同时支持编程语言。

英伟达还表示,该模型在 OpenMDW License Agreement 1.1 下开放权重、训练数据和训练配方。开发者可以使用 NeMo Automodel 或 NeMo Megatron Bridge 进行监督微调,也可以借助 NeMo RL 和 NeMo Gym 进行强化学习和环境评估。此次发布还包括 Nemotron-RL Agentic Terminal Pivot 数据集,用于支持部分编码 Agent 能力的训练。

这类开放方式意味着,企业可以围绕自己的工具、领域数据和操作流程进行定制,而不必完全依赖一个封闭的通用模型。模型卡同时披露,预训练使用了超过 20 万亿个 token,后训练阶段覆盖工具调用、结构化输出、多步工具使用和多轮对话等任务。

速度优势来自英伟达自己的评测体系

英伟达称,Nemotron 3.5 Lightning 在同级模型中实现了最高可达约 4 倍的输出速度。在 PinchBench 上,英伟达给出的表述是模型达到约 86% 的准确率,并比 Qwen3.6 35B 更快完成 1 万项任务。

不过,这些数字需要放在英伟达指定的评测环境中理解,而不是视为独立第三方结论。模型卡列出的 BF16 版本 PinchBench 得分为 85.37,NVFP4 版本为 83.43;其中还同时列出了 SWE-bench Verified 51.56、Terminal-Bench 2.1 24.58 和 MMLU Pro 81.94 等结果。英伟达也说明,这些结果来自其 NeMo Gym 或 NeMo Evaluator 评测流程,不同供应商自行报告的数字可能无法直接比较。

这与 NVIDIA Nemotron 3 Embed 登顶 RTEB、押注更高效的智能体检索所体现的方向相似:英伟达正把模型能力拆分成检索、规划和执行等不同环节,再分别优化准确率、延迟与部署成本,而不是只用一个总榜名次概括产品价值。

Switchyard 试图让多模型协作变得可管理

与 Lightning 同步发布的 NeMo Switchyard,是一个面向 AI Agent 的模型路由库。英伟达在技术博客中说,路由器可以根据任务能力、成本、延迟、负载和基础设施等信号,把不同步骤交给开发者配置的模型池。

在一个典型的 Agent 流程中,系统可能将复杂规划发送给前沿推理模型,把工具调用、格式化结果和常规代码检查发送给 Lightning,另一些任务则交给特定领域模型。路由可以发生在整个请求层面,也可以发生在多轮任务的每一个步骤,从而避免开发者为每个模型分别重写应用。

英伟达表示,Switchyard 提供与模型供应商无关的 SDK,路由逻辑与具体模型端点相互分离,也支持免调参和可调参的路由算法。其内部测试称,Switchyard 在保持前沿模型级别准确率的同时,可将任务完成成本降至单独使用 Opus 4.8 的近三分之一;LangChain、Cognition、Ramp 等合作方也报告了不同程度的成本或延迟下降。但这些同样属于英伟达或合作方的测试结果,实际收益取决于任务分布、模型池和路由策略。

这一层基础设施的重要性在于,模型路由不只是“哪个模型更强”的问题。对于连续运行数小时甚至更长时间的 Agent,真正消耗预算的往往是大量中间步骤。路由系统如果能够判断任务难度,并在不影响结果质量的前提下使用更小的模型,就可能比单纯提升单次回答的基准分数更直接地影响运营成本。

Agent 的竞争正在转向执行、验证与控制

Nemotron 3.5 Lightning 的发布也反映出 Agent 开发重点的变化。过去,行业主要比较哪个模型更擅长回答复杂问题;现在,企业需要处理的是模型如何调用工具、如何检查结果、如何在多个子任务之间分工,以及如何在延迟和预算受限时持续运行。

微软此前在Agent Framework 的 harness 中加入 Skills、受控 Shell、CodeAct 和 Background agents时,也把重点放在代理的工作系统和控制层,而不是单纯增加模型参数。英伟达如今将更快的执行模型与模型路由结合起来,走的是相近的工程化路线。

但更快的执行并不自动等于更可靠的自动化。Agent 可能在工具调用和任务分解上更高效,却仍然需要测试、审批、追踪和回滚机制。正如 OpenAI 对科学计算中 Agent 的报告所指出的,验证正在成为新的瓶颈,当生成和执行的成本下降后,证明结果正确、可追责并能长期维护,反而会占据更多工程资源。

因此,Nemotron 3.5 Lightning 的意义可能不在于它是否成为所有任务上的最佳模型,而在于它是否能成为 Agent 系统中稳定、低成本的“工作马”。NeMo Switchyard 则把这个问题进一步扩展到系统层面:未来的 Agent 可能不再围绕一个默认模型构建,而是由多个能力、价格和部署位置不同的模型共同完成工作。对于开发者和企业而言,真正需要验证的将是整条链路的质量、成本和可控性,而不是某一个模型的宣传数字。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读