基础设施与工程

OpenAI预览GPT-5.6 Sol Ultrafast:输出速度最高达每秒750个Token

OpenAI于2026年8月13日宣布向少量客户预览GPT-5.6 Sol的Ultrafast模式,利用Cerebras推理硬件实现最高14倍的处理速度,峰值输出可达每秒750个Token。该功能仍处于有限预览阶段,实际效果受任务类型、输入长度、网络延迟和系统负载等因素影响,定价和全面可用性尚未公布。

OpenAI预览GPT-5.6 Sol Ultrafast:输出速度最高达每秒750个Token

OpenAI于2026年8月13日宣布向少量客户预览GPT-5.6 Sol的Ultrafast模式,利用Cerebras推理硬件实现最高14倍的处理速度,峰值输出可达每秒750个Token。该功能仍处于有限预览阶段,实际效果受任务类型、输入长度、网络延迟和系统负载等因素影响,定价和全面可用性尚未公布。

OpenAI于2026年8月13日宣布,正在通过OpenAI API向少量客户预览GPT-5.6 Sol的Ultrafast模式。该模式由Cerebras提供推理基础设施,OpenAI称其相较Standard处理速度最高提升14倍,输出速度最高可达每秒750个Token。

Ultrafast目前仍是有限预览,并未向所有用户正式开放。OpenAI表示,访问范围将随着可用容量增加而扩大。此次发布的重点,不是推出一个新的基础模型,而是尝试在保留GPT-5.6 Sol能力的前提下,把前沿模型带入对延迟更敏感的实时工作流。

从“更聪明”转向“每秒完成更多工作”

过去,企业在部署AI模型时往往需要在能力和速度之间作出取舍:规模更大的模型通常能够处理更复杂的任务,但生成响应的等待时间也更长;更快的模型则可能在复杂推理、长文档分析或多步骤任务上有所妥协。

OpenAI希望通过Ultrafast改变这种选择逻辑。公司在公告中把它描述为一种新的“速度等级”,目标是让GPT-5.6 Sol进入那些不仅要求答案准确,也要求系统及时响应的场景。

OpenAI列举的使用方向包括事故响应、实时客户支持、金融研究、交易和安全分析、电子商务,以及交互式实验。在一次生产系统发生故障时,模型可以同时分析日志、追踪信息、近期代码变更和工程师报告,帮助团队在事故仍在发展时缩小原因范围并准备修复方案。

在客户支持场景中,较低的延迟意味着系统可以在对话不中断的情况下完成多步检索和判断。对于金融研究或安全监测,信息本身持续变化,等待时间缩短也可能影响分析结果是否仍然具有决策价值。

但这些都是OpenAI提出的应用方向,而不是对所有客户都已经开放并经过独立验证的产品能力。Ultrafast当前只向一小批客户提供预览,实际效果仍取决于任务类型、输入长度、推理设置、网络延迟和系统负载。

Cerebras的推理架构成为关键环节

Cerebras表示,Ultrafast模式使用其Wafer-Scale Engine架构。该架构试图通过把模型权重尽可能保留在芯片上的静态随机存取存储器中,减少传统GPU推理过程中在片上内存与片外存储之间反复搬运数据所造成的瓶颈。

Cerebras在技术说明中称,其晶圆级芯片包含44GB SRAM,模型权重可以留在芯片上,并通过分布在晶圆上的计算单元进行流水线处理。公司认为,生成式AI推理的速度限制不仅来自计算能力,也来自模型权重和中间数据的移动效率。

这一技术路线解释了为什么此次合作的重点是推理速度,而不是重新训练GPT-5.6 Sol。OpenAI仍然提供同一个模型家族的能力,Cerebras则试图通过不同的硬件和系统设计缩短生成响应所需的时间。

Cerebras首席执行官Andrew Feldman表示,GPT-5.6 Sol Ultrafast说明速度和智能不再必然互相排斥。OpenAI计算战略与GPT基础设施副总裁Sachin Katti则表示,公司正在与少量客户合作,以了解更低延迟在真实业务中的价值,并据此决定如何扩大服务。

厂商测试显示速度提升,但不能等同于独立基准

Cerebras披露,在其测试中,GPT-5.6 Sol Ultrafast完成“人类最后考试”(Humanity’s Last Exam)全部2500道题耗时11小时11分钟;该公司称,另一模型Claude Fable 5完成相同测试需要78小时27分钟,Ultrafast达到相近准确率的速度接近快7倍。

在GDP-Val这一面向经济价值知识工作的评测中,Cerebras称,Ultrafast带来了5.6倍的端到端速度提升,同时没有出现质量下降。GDP-Val覆盖法律简报、金融模型和工程报告等任务。

不过,这些结果需要保留测试条件和来源属性。Cerebras说明,人类最后考试的对比测试分别使用了不同日期、不同工具链和推理设置:GPT-5.6 Sol Ultrafast与Codex结合使用,另一模型则与Claude Code结合使用;GDP-Val测试也由Cerebras完成,使用的是特定推理配置。

因此,5.6倍、接近7倍以及“不影响质量”等表述,首先应被理解为厂商测试结果,而不是已经由独立第三方在统一条件下验证的全面性能结论。它们可以说明Cerebras希望展示的速度优势,但还不足以单独证明Ultrafast在所有任务、所有模型比较和所有生产环境中都能取得同样结果。

OpenAI官方公告则只确认了Ultrafast相较Standard处理速度最高提升14倍、输出速度最高达到每秒750个Token,以及其有限预览状态。至于首个Token延迟、长上下文任务的稳定吞吐量、成本和不同输入规模下的实际表现,公告没有给出完整数据。

有限预览意味着产品仍处于学习阶段

OpenAI称,Ultrafast已经在编码、电子商务、金融研究、客户支持和其他交互式应用中由一批企业进行测试。公司希望通过真实生产条件观察:当模型能够更接近实时响应时,哪些工作流会发生变化,以及速度提升是否足以创造新的产品形态。

OpenAI还描述了内部事故响应和研究工作流。在事故处理中,工程师可以更快读取日志、分析追踪信息、汇总对话并提出下一步检查;在研究工作中,原本可能需要隔夜运行的实验,有望在工作时间内完成多轮检索、分析、调整和重试。

这里的关键并不只是“答案更快出现”,而是人和模型之间的反馈循环被压缩。模型响应足够快时,用户可以更频繁地修改问题、验证假设并继续下一步,而不必把任务拆散到多个并行会话中。

但这也带来新的工程要求。速度越快,系统可能在更短时间内调用更多工具、处理更多数据或执行更多步骤。对于事故响应、金融分析和安全工作,低延迟并不等于可以取消人工判断、权限控制或结果复核。OpenAI在公告中也强调,工程师仍需对判断和部署负责。

这一点与OpenAI近期围绕高风险网络安全能力采取的分层访问做法相互呼应。在OpenAI推出GPT-5.6-Cyber并扩展Daybreak访问计划的报道中,模型能力被放入身份验证、用途限制、监控、隔离环境和人工复核等控制链条中。Ultrafast虽然面向更广泛的企业工作流,但其快速响应可能同样需要更细致的工具权限和审计设计。

推理基础设施竞争进入速度阶段

此次合作也显示,AI基础设施竞争正在从“谁拥有更多训练算力”扩展到“谁能以更低延迟运行前沿模型”。当模型能力逐渐成为企业应用的基础设施时,响应时间会影响客户支持、交易监测、代码开发、生产运维和交互式研究的整体体验。

这也是Cerebras希望强调的市场位置。与主流GPU集群相比,晶圆级处理器试图从内存带宽和数据移动角度解决大模型推理问题。若这类架构能够在真实负载中持续提供稳定的高吞吐量,模型供应商就可能为不同客户提供标准、低延迟和高速度等不同服务层级。

但基础设施扩张本身也面临供电、数据中心、设备交付和融资等限制。近期CoreWeave上调2026年资本支出计划的案例显示,AI云服务商正在大规模建设专用算力,但高资本支出、债务和交付能力也会影响增长能否转化为稳定现金流。对于Ultrafast而言,未来能否从少量客户预览扩大到更广泛的企业服务,同样取决于可用的推理容量和部署成本。

价格、可用性与实际收益仍待公布

截至此次公告,OpenAI没有公布Ultrafast的公开定价、具体客户名单、服务等级协议或适用于所有API用户的正式开放时间。访问范围将如何扩大、Standard与Ultrafast之间的计费差异如何设定,以及客户是否需要为更低延迟支付明显溢价,仍不清楚。

另一个问题是,输出速度并不等同于整体任务速度。一个模型每秒生成更多Token,可能缩短长答案的生成时间,但用户最终等待时间还包括请求排队、输入处理、首个Token生成、工具调用、外部系统响应和结果后处理。对于需要检索数据库、运行代码或调用多个API的代理式工作流,端到端延迟可能远高于模型本身的生成延迟。

此外,模型生成得更快也可能增加单位时间内的使用量。企业是否能够从节省的等待时间中获得足够的业务收益,以抵消更高的推理成本,需要通过实际部署数据判断,而不能只看每秒Token数。

OpenAI的Ultrafast预览因此更像是一次面向企业客户的基础设施和产品实验:它试图验证前沿模型是否可以在不明显牺牲能力的情况下进入实时工作流。14倍速度和每秒750个Token是清晰的厂商目标,但有限预览、缺少公开价格以及测试由厂商主导,意味着外界仍需等待更广泛的客户数据和独立测试。

如果Cerebras和OpenAI能够随着容量扩大保持相近的速度与质量表现,AI应用的竞争重点可能进一步从“能否完成任务”转向“能否在用户仍处于工作状态时完成任务”。而这场竞争的最终结果,不只取决于模型本身,也取决于推理芯片、数据中心容量、网络系统、成本结构和企业能否建立相应的安全控制。

来源

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读