d-Matrix宣布其下一代Raptor推理XPU将通过NVLink Fusion接入英伟达的MGX机架和Spectrum-X网络等基础设施,双方计划首批集成系统在2027年第四季度可用。该合作旨在让专用推理芯片复用英伟达成熟的机架、互联和供应链,以加速低延迟推理系统在云和AI工厂中的部署,但性能、成本与量产时间仍有待验证。
美国AI推理芯片公司d-Matrix与英伟达于2026年9月10日宣布一项多年期产品路线图合作。按照双方公布的计划,d-Matrix下一代Raptor推理XPU将接入英伟达NVLink Fusion,并采用MGX机架架构以及Spectrum-X网络等基础设施组件。
这项合作的核心,不是英伟达已经把Raptor纳入现有GPU产品线,而是让一家专注于推理的芯片公司借助英伟达已经建立的机架、互联、供电、散热和供应链体系,开发可与英伟达AI系统共同部署的专用推理基础设施。d-Matrix称,首批集成Raptor的英伟达MGX机架系统预计在2027年第四季度具备可用性。
Raptor计划如何接入英伟达AI基础设施
英伟达在官方博客中说,d-Matrix计划通过NVLink把Raptor连接到一个高带宽、低延迟的机架级扩展域,并让这类系统与Vera Rubin NVL72等英伟达GPU系统协同工作。
d-Matrix在新闻稿中列出的合作内容包括:将Raptor接入英伟达MGX机架参考架构,配合英伟达Vera CPU、NVLink交换机、BlueField-4 DPU、ConnectX-9 SuperNIC和Spectrum-X以太网网络。双方还将与互联方案公司Astera Labs合作,为系统内部的数据传输提供定制连接方案。
英伟达的NVLink Fusion平台说明显示,该技术面向希望把定制XPU或CPU接入英伟达AI基础设施的云服务商和AI公司。平台的设计目标,是让定制加速器与英伟达GPU共享机架、网络、冷却、供电和管理系统,并支持不同处理器在同一数据中心进行异构部署。
这意味着,d-Matrix不必为Raptor单独从头建立完整的机架级基础设施。对于需要把专用芯片交付给AI实验室、超大规模云服务商或新型云服务商的公司而言,复用成熟的机架和供应链,可能缩短工程整合与部署路径。但这仍然是合作和产品路线图,并不等于Raptor已经完成大规模商业部署。
推理工作负载为何需要专用芯片
大模型推理通常可以分为两个阶段:首先是处理用户输入上下文的prefill阶段,其后是逐个生成输出token的decode阶段。前者往往更依赖计算吞吐,后者则更容易受到内存带宽、数据搬运和响应延迟的限制。
d-Matrix的产品路线围绕低延迟推理展开。公司目前的Corsair平台已经进入生产阶段,而Raptor是其后续产品。d-Matrix称,Raptor采用一种将DRAM内存芯片与SRAM计算芯片组合在同一封装中的3D堆叠方案,试图在内存容量和带宽之间取得不同于传统GPU的平衡。
《The Next Platform》报道,d-Matrix预计在2026年底前完成Raptor流片,并以2027年第四季度发布为目标。该报道还援引公司资料称,Raptor的3D内存方案目标带宽为每秒100TB。不过,这些数字属于公司产品设计或路线图披露,不能直接视为已经经过独立、广泛工作负载验证的商业性能结果。
Raptor的潜在应用场景包括代码助手、实时聊天机器人和语音代理等对交互延迟较敏感的服务。d-Matrix和英伟达在新闻稿中描述了一种“解耦推理”模式:GPU可以负责prefill等计算密集型阶段,而Raptor等专用推理XPU负责对延迟更敏感的decode阶段。
这种安排并不意味着专用XPU会全面取代GPU。它更可能反映AI基础设施正在出现的异构化趋势:不同处理器根据模型结构、上下文长度、批处理方式和服务价格,被分配到推理链条的不同环节。
英伟达正把竞争范围从GPU扩展到机架平台
NVLink Fusion的意义在于,英伟达试图把定制芯片纳入自己的AI工厂平台,而不是只依靠自有GPU覆盖所有工作负载。按照英伟达的平台资料,NVLink Fusion可以支持XPU与GPU在同一数据中心共同部署,并让运营商根据需求重新配置不同类型的计算资源。
英伟达的Vera Rubin NVL72平台采用第三代MGX机架设计,整合Rubin GPU、Vera CPU、NVLink 6、ConnectX-9和BlueField-4等组件。d-Matrix的方案则试图在相同或相近的机架级框架中加入专用推理XPU。
英伟达近期还通过扩展NVLink Fusion并推出NVHBM把平台范围进一步延伸到定制芯片的内存架构。对英伟达而言,互联、内存、网络、机架和软件的组合,可能成为比单一GPU型号更重要的生态控制点。
对芯片初创公司而言,问题也从“能否设计出一颗更快的芯片”,扩展为“能否把芯片装进客户已经使用的AI工厂”。AI推理芯片公司Positron近期完成融资并推进专用推理系统的案例,也显示资本和产业界正在把注意力从模型训练扩展到长期运行推理服务所需的硬件与系统。Positron的融资与产品路线同样强调了内存、延迟和系统级部署的重要性。
合作公布后,哪些问题仍未解决
目前能够确认的是,d-Matrix与英伟达已经宣布多年期合作,Raptor将以NVLink Fusion为连接基础,接入英伟达MGX机架生态,并配合英伟达的网络和数据中心组件。d-Matrix还披露,首批集成机架预计在2027年第四季度具备可用性。
但以下事项仍未被公告完全说明:Raptor的独立性能和每token成本、芯片与机架的具体价格、首批客户名单、实际部署规模,以及Raptor能否按期完成流片、验证和量产。公告也没有披露已经确认的商业订单或由该合作带来的收入。
因此,这项合作更准确的表述是一次面向规模化部署的技术路线和生态整合,而不是已经完成商业化验证的产品交付。对于d-Matrix,英伟达的机架和供应链可能降低进入大型AI工厂的工程门槛;对于英伟达,接纳Raptor等专用XPU则有助于证明其AI基础设施能够容纳更广泛的处理器架构。
最终,Raptor能否在真实的代码生成、语音代理和实时对话工作负载中兑现低延迟与能效目标,将取决于芯片量产、软件适配、客户测试和持续运行数据,而不仅仅是NVLink Fusion或MGX的兼容性。
来源: NVIDIA官方博客:d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU Deployment;d-Matrix新闻稿:d-Matrix Adopts NVIDIA NVLink Fusion Rackscale Infrastructure for Ultra-Low Latency AI Inference;NVIDIA NVLink Fusion平台说明;The Next Platform相关报道。