OpenAI公布Jalapeño首轮测试:推理性能与能效同时提升,但大规模部署仍待验证
OpenAI公布首轮Jalapeño推理芯片测试,称在多款公开模型上实现每瓦性能提升1.5–1.9倍、端到端延迟缩短1.7–3.6倍,但芯片仍处于生产资格认证和软件成熟阶段,能否在大规模部署中保持优势有待验证。
OpenAI公布首轮Jalapeño推理芯片测试,称在多款公开模型上实现每瓦性能提升1.5–1.9倍、端到端延迟缩短1.7–3.6倍,但芯片仍处于生产资格认证和软件成熟阶段,能否在大规模部署中保持优势有待验证。
OpenAI表示,其首款定制推理芯片Jalapeño在首轮测试中同时实现了更高吞吐量和更低延迟。公司称,在三款公开模型上,Jalapeño每瓦可完成的AI工作量达到对比系统的1.5至1.9倍,端到端延迟降低1.7至3.6倍;在交互性更强的工作负载中,性能最高提升4.1倍。
这项结果来自OpenAI于8月25日发布的官方测试说明。不过,相关数据目前主要由OpenAI公布,芯片仍处于生产资格认证、软件成熟和规模化部署准备阶段。公司计划在2026年底前把Jalapeño部署到自己的计算基础设施中,并继续使用英伟达及其他合作伙伴的加速器。
从“更快”转向同时优化吞吐量与延迟
Jalapeño的核心卖点不是单一指标上的峰值,而是试图解决AI推理中长期存在的取舍:高吞吐量通常意味着批量处理更多请求,但会牺牲交互响应速度;低延迟系统则往往难以在大规模并发下保持能效。
OpenAI称,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三款公开模型上,都位于吞吐量、功耗和延迟的“帕累托前沿”。在规模最大的Kimi K2.5 1T测试中,芯片的峰值每瓦性能约为对比系统的1.5倍,端到端延迟降低约3.4倍。
公司使用SemiAnalysis推出的公开InferenceX推理基准进行测试。该基准覆盖多种GPU、模型、框架和并发设置,并提供公开的自动化运行记录。OpenAI表示,测试按照相同用户体验进行比较,即在满足用户和交互式代理所需延迟的前提下,衡量系统每单位功耗能够完成多少有用的AI工作。
OpenAI披露,Jalapeño的额定功耗为700瓦,但在这些测试负载中的持续实测功耗不超过550瓦。按照公司公布的具体数据,在一组混合吞吐量测试中,Jalapeño每千瓦可达到约85,448的处理量,而对比系统为44,960;端到端延迟则从1.80秒降至1.03秒。
在另一组更偏向交互式使用的测试中,Jalapeño每千瓦处理量为19,641,对比系统为11,781;端到端延迟从5.99秒降至1.65秒。OpenAI还报告称,在最低每用户令牌间隔时间和固定延迟条件下,芯片的优势会进一步扩大。不过,这些数字对应特定模型、硬件配置和测试区间,不能直接等同于所有生产环境中的性能提升。
芯片、内存和网络被作为一个系统设计
OpenAI称,Jalapeño并非从既有训练加速器改造而来的通用芯片,而是从一开始就围绕现代语言模型推理设计。其架构重点处理数据移动、计算与内存资源之间的平衡,以及多芯片系统中的网络通信延迟。
语言模型推理通常包括两个差异明显的阶段。Prefill阶段负责处理用户输入,计算密集度较高;decode阶段则逐个生成令牌,更容易受到内存带宽限制。与此同时,模型状态和KV缓存需要在不同计算单元之间移动,通信延迟可能让部分处理单元处于等待状态。
Jalapeño试图通过更明确的本地数据放置和系统级网络设计,减少这些等待。OpenAI表示,芯片、内存、网络、软件和机架级系统是协同设计的,模型状态可以尽可能保持在本地,并根据不同推理阶段调度相应的计算、内存和通信资源。
这也是OpenAI所谓“全栈优势”的具体体现。公司不再只负责模型和产品,而是进一步介入芯片架构、内核、内存系统、网络、调度和部署软件。此前,OpenAI与博通在2026年6月宣布Jalapeño时曾表示,芯片从最初设计到流片只用了九个月,并在部分设计和优化环节使用了OpenAI模型。
芯片设计的意义,还在于它可能改变AI服务的成本结构。OpenAI此前在下调GPT-5.6部分模型定价时,也把模型、推理系统和代理运行环境的效率提升作为降价依据。两者指向同一个产业趋势:随着模型能力趋于同质化,企业竞争将越来越多地落在每瓦、每美元和每秒能够完成多少实际工作上。
AI也参与了芯片自身的开发
OpenAI表示,AI模型直接参与了Jalapeño的开发。早期模型帮助团队探索实现方案、缩短设计和验证循环;较新的模型则继续用于内核编程、算术电路优化以及模型工作负载调优。
公司还称,工程团队使用Codex和GPT-Astra,在两个月内把三款并不属于Jalapeño最初生产计划的开放权重模型带到较高性能水平。在部分GPT-OSS注意力模块和混合专家模块上,AI生成的实现速度达到原有人类专家实现的1.5至1.8倍。
OpenAI特别强调,这些数字只适用于被选中的模块,并不代表完整模型的整体加速。它们更像是对一种新开发流程的展示:模型不仅运行在芯片上,也可能帮助工程师编写、优化和验证运行模型所需的软件。
公开数据仍不足以证明长期优势
Jalapeño的首轮结果显示了定制推理芯片的潜力,但距离证明其能够在大规模生产环境中稳定替代部分通用GPU,还有几个环节需要完成。
首先,OpenAI目前公布的是公司主导的测试结果。虽然测试使用了公开的InferenceX基准,但芯片本身尚未形成可供外部用户独立复现的完整硬件和软件环境。OpenAI表示,未来几个月将发布更详细的技术报告,并继续扩大模型覆盖范围。
其次,真实服务中的表现不仅取决于芯片峰值性能,还会受到编译器、内核质量、模型并行方式、网络拓扑、故障率和资源调度的影响。对代理型应用而言,一个任务往往需要连续完成多个步骤,单次延迟下降能否转化为整项任务的稳定提速,仍要看长期运行数据。
第三,OpenAI并未计划完全放弃外部加速器。公司明确表示,未来仍将广泛部署英伟达和其他合作伙伴的芯片,尤其用于训练和不同类型的推理任务。这意味着Jalapeño更可能成为多供应商基础设施中的一部分,而不是立即取代GPU的单一路线。
OpenAI押注的是多代基础设施平台
OpenAI称,Jalapeño只是多代计算平台的第一代产品,第二代已经进入深入开发,第三代也正在形成。公司计划在今年年底前开始部署第一代芯片,并根据生产运行结果继续改进后续产品。
这项计划的商业目标并不只是让ChatGPT回答得更快。更高的推理效率可以为交互式代理提供更短等待时间,为API客户降低服务成本,也可以让OpenAI在相同电力和硬件资源下处理更多请求。对于一家仍在快速扩大算力投入的公司而言,这直接关系到收入增长能否跑在服务成本之前。
但芯片性能最终能否转化为更低的用户价格、更稳定的服务和更好的运营杠杆,仍需要经过实际部署检验。正如OpenAI在关于代理进入科研计算的另一份报告中所指出的,AI系统的能力展示只是第一步,验证、维护和长期可靠性往往才是决定能否落地的关键。
Jalapeño的首轮数据因此更适合被理解为一个阶段性信号:OpenAI正在把模型、软件和硬件放进同一条优化循环,并且已经看到了初步的性能收益。至于这些收益能否在更大规模、更复杂模型和持续增长的用户需求下保持,仍要等待后续技术报告和生产数据。
原始来源:Jalapeño’s first results show industry-leading speed and efficiency in AI inference。
背景来源:OpenAI与Broadcom公布面向大语言模型优化的Jalapeño推理芯片、Broadcom官方公告、路透社报道。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

