基础设施与工程

AWS与英伟达计划在2027至2028年新增部署200万块GPU

AWS与英伟达宣布在2027-2028年间新增部署200万块英伟达GPU,并将合作扩展到Vera CPU、网络互联、开放模型、数据处理和机器人平台等基础设施层面,但未披露具体交付时间表或金额。双方还计划为美政府提供10万块GPU的AI基础设施,并强调机架级协同与数据中心、电力等配套挑战。

AWS与英伟达计划在2027至2028年新增部署200万块GPU

AWS与英伟达宣布在2027-2028年间新增部署200万块英伟达GPU,并将合作扩展到Vera CPU、网络互联、开放模型、数据处理和机器人平台等基础设施层面,但未披露具体交付时间表或金额。双方还计划为美政府提供10万块GPU的AI基础设施,并强调机架级协同与数据中心、电力等配套挑战。

亚马逊云服务(AWS)与英伟达8月26日宣布扩大双方的战略合作,计划在2027年至2028年间,于AWS全球基础设施中新增部署200万块英伟达GPU。此次合作覆盖Blackwell Ultra、Rubin和Rubin Ultra等新一代产品,但双方没有公布交易金额,也没有表示这些算力已经交付或上线。

这项协议的意义不只在于GPU数量。AWS与英伟达还计划把Vera CPU、网络互联、开放模型、数据处理和机器人技术纳入同一套基础设施合作,显示云服务商正在把AI算力竞争从单纯采购加速卡,扩展到芯片、网络、软件、电力和数据中心整体协同。

从100万块到200万块:部署计划快速扩大

根据英伟达新闻稿以及通过GlobeNewswire发布的公告,AWS在2026年英伟达GTC大会期间曾宣布,计划从2026年开始在其全球区域部署超过100万块英伟达GPU。英伟达称,此后客户需求超过了原先预期,因此双方又把2027年至2028年的新增部署规模设定为200万块。

这批GPU将面向智能体、科学发现、企业自动化和具身智能等工作负载。AWS同时计划扩大Blackwell系列产能,包括用于Amazon EC2 G7实例的RTX PRO 4500 Blackwell Server Edition GPU。英伟达称,与上一代G6实例相比,G7实例的AI推理性能最高提高4.6倍,图形性能提高2.1倍。不过,这些性能数字来自厂商披露,实际表现仍取决于工作负载、软件栈和部署配置。

双方还将合作优化大规模训练所需的网络系统,并把英伟达平台与AWS Nitro System和Elastic Fabric Adapter(EFA)结合,以强化隔离、安全性和集群间通信能力。

合作延伸到CPU、内存和自研芯片协同

AWS并没有放弃自研芯片路线。相反,这次公告显示,英伟达GPU与AWS定制芯片之间可能形成更紧密的机架级协同。

AWS与英伟达计划把英伟达Vera CPU基础设施引入AWS,为需要高性能通用计算与GPU加速并行运行的智能体工作负载提供更多选择。同时,英伟达和亚马逊旗下Annapurna Labs还将扩大对NVLink Fusion的支持,把英伟达定制高带宽内存(NVHBM)纳入Trainium相关设计。

按照公告描述,NVLink Fusion可以帮助不同芯片在高速互联下共同工作,而NVHBM则有望为Trainium提供更快、能效更高的内存。双方的目标,是让Trainium和英伟达GPU在共同的机架级架构中协同运行,而不是把云厂商自研芯片与英伟达产品完全视为互相排斥的两条路线。

这也解释了为什么此次合作不能简单理解为“亚马逊向英伟达多买了一批GPU”。TechCrunch在相关报道中指出,亚马逊一方面在扩大英伟达芯片采购,另一方面也在推进Trainium和Graviton等自研芯片。对AWS而言,关键可能不是选定一种芯片,而是根据训练、推理、数据处理和客户合约,在同一云平台内组合不同类型的计算资源。

AI工厂与美国政府工作负载

公告还提到,AWS与英伟达计划为美国政府建设AI工厂,并计划在AWS安全基础设施上提供10万块GPU,用于联邦政府及国家安全相关工作负载。双方称,相关基础设施将支持影响级别6(IL6)及以上的工作负载。

不过,现阶段公开信息只说明了合作方向和规划规模,没有披露具体项目地点、建设时间表、合同金额、采购主体或GPU型号分配。因此,10万块GPU应被理解为政府AI基础设施计划中的目标部署量,而不是已经完成交付的设备数量。

AI基础设施建设本身也越来越受到电力、土地和冷却条件的制约。英伟达近期入股数据中心开发商Cloverleaf,合作内容已经延伸到数据中心选址、电力、冷却和算力规划。类似地,AWS将2026年资本开支上调至约2200亿美元的背景,也说明云厂商需要提前为已经预订或预期增长的容量配置资金和设施。

因此,200万块GPU并不等同于200万块GPU会在同一时间形成可供客户使用的算力。芯片供应、服务器组装、网络互联、数据中心建设、电力接入以及软件适配,都可能影响最终上线节奏。

从云端算力到物理AI平台

此次合作的另一条主线,是把英伟达的开放模型、数据处理工具和物理AI技术嵌入AWS服务。

英伟达Nemotron开放模型将继续通过Amazon Bedrock以托管模型形式提供,也可通过Amazon SageMaker部署和微调。双方还计划利用cuDF和cuVS CUDA-X库,加速Amazon EMR的数据处理以及Amazon OpenSearch的向量索引。英伟达称,在特定配置下,GPU加速的数据处理速度最高可达CPU方案的3.7倍,向量索引速度最高提高9倍,成本可降至四分之一。这些数字同样属于厂商给出的特定场景指标,不应直接视为所有客户工作负载的普遍结果。

在机器人领域,Amazon Robotics将采用英伟达的物理AI全栈,包括Jetson、Omniverse和Isaac平台,覆盖仿真、合成数据生成、机器人训练、路线优化、功能安全以及从现实到仿真的验证流程。此前,英伟达已经通过Cosmos 3 Edge把物理AI推向边缘设备,这次与AWS的合作则更强调云端训练、仿真和规模化基础设施。

对亚马逊来说,仓储机器人是一个相对明确的内部应用场景;对英伟达来说,AWS则可以成为其物理AI软件栈和硬件平台面向更多企业客户的交付渠道。两家公司希望把机器人从单一设备研发问题,转变为云端数据、仿真环境、模型训练和现场部署连成一体的工作流。

需求增长能否转化为回报仍待验证

英伟达和AWS都把此次扩张归因于来自AI实验室、初创企业、大型企业和政府的“需求激增”。但公告没有披露客户名单、预订规模、使用率或财务承诺,也没有说明200万块GPU对应的具体采购合同结构。

因此,目前可以确认的是:双方宣布了2027年至2028年的新增部署计划,并扩大了从GPU到CPU、网络、开放模型、数据处理和机器人平台的合作范围。尚不能确认的是,这些GPU何时完成交付、哪些客户将使用这些资源,以及新增基础设施何时能够转化为稳定收入和利润。

这项合作最值得观察的后续问题有三个:AWS能否按计划把大规模GPU部署转化为可用容量;Trainium等自研芯片能否与英伟达平台形成经济有效的混合架构;以及AI工厂对电力、资本和政府安全要求的适应速度,能否跟上模型和智能体工作负载的增长。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读