AWS与NVIDIA扩大合作 部署新一代GPU加速代理型与实体AI发展
Amazon旗下Amazon Web Services(AWS)与NVIDIA近日宣布大幅扩展双方策略合作,以因应全球对于人工智能(AI)基础设施持续加速成长的需求。随着客户快速采用AWS上的NVIDIA加速运算,双方计划在AWS全球基础设施中新增部署200万颗NVIDIA GPU,并进一步深化AI工厂、CPU、网络、开放式模型、数据处理与机器人领域的合作,共同打造协同设计的AI解决方案,让客户能以前所未有的规模加速AI开发与部署。
AI工作负载正快速扩展,涵盖模型训练与执行,以及数据处理、建立索引并用于驱动智能应用程序等个个环节。客户正从试点阶段迈向正式部署,并扩大代理型AI、科学探索、企业自动化与机器人等领域扩展工作负载。这些客户需要更多元的模型选择、更快速的数据管道,以及支持实体AI等新兴使用情境的全新能力,同时也需要确保底层基础设施能与自身创新同步发展,并为关键任务工作负载维持最高等级的安全性与可靠性。
为因应前瞻AI实验室、全球企业、新创公司与政府机构快速成长的需求,AWS与NVIDIA将延续16年的共同创新基础,扩充AI运算容量,并更快将共同设计的新型解决方案提供给客户。
作为扩大合作的一部分,双方正致力于2027至2028年间,在AWS全球基础设施中新增部署200万颗NVIDIA GPU。将以NVIDIA Vera CPU为基础的基础设施导入AWS。以NVIDIA定制化高带宽存储器(NVHBM)扩展NVIDIA NVLink Fusion。为美国政府打造AI工厂,包括在安全的AWS基础设施上部署10万颗GPU,以执行联邦政府与国家安全工作负载。
将NVIDIA平台与AWS Nitro System及Elastic Fabric Adapter(EFA)整合,强化安全性与可靠性。持续在Amazon Bedrock与Amazon SageMaker上支持NVIDIA Nemotron开放式模型,为客户提供更多开放式模型选择。
运用NVIDIA cuDF与cuVS CUDA-X函式库,加速Amazon EMR与Amazon OpenSearch上的数据处理与矢量索引,实现更快速、更具成本效益的分析与AI应用。透过Amazon Robotics采用NVIDIA实体AI平台,进一步推动机器人工作负载,加速仓储自动化与新一代机器人的创新。
AWSCEOMatt Garman表示:「客户希望能自由选择最适合其AI工作负载的工具,也希望确信所有技术都能彼此无缝协作。这正是我们与NVIDIA深度合作,致力让AWS成为执行NVIDIA AI技术最佳平台的原因,我们从网络、安全到部署,全方位最佳化基础设施效能。此次扩大合作,将让前瞻实验室、企业与政府机构有更多在AWS上建置与部署AI的管道。」
NVIDIA创始人暨CEO黄仁勳表示:「NVIDIA与AWS共同打造了AI时代最强劲的成长引擎之一,而市场需求更远超所有预测。过去16年来,我们携手将NVIDIA的运算能力扩展至云端。如今,我们正将合作扩展至全端堆叠,包括GPU、CPU、网络、开放式模型与软件,以只有AWS与NVIDIA能实现的空前速度与规模,推动代理型AI与实体AI落地。此次扩大合作,亦反映出客户对AWS上NVIDIA平台的需求。」
大规模扩充AI运算能力
AWS提供云端服务供应商中最广泛的GPU执行个体类型,可支持多元AI与机器学习工作负载。NVIDIA GTC 2026大会上,AWS宣布计划自2026年起新增超过100万颗NVIDIA GPU。此后,需求已超出原先预期。AWS计划于2027至2028年间,在AWS全球基础设施(包括AI工厂)中新增部署200万颗NVIDIA Blackwell Ultra、Rubin与Rubin Ultra GPU。
新增的运算能力将协助驱动客户的各项工作负载,涵盖代理型AI、科学探索、企业自动化到物理AI等。此外,AWS也将扩充NVIDIA Blackwell容量,包括为Amazon EC2 G7执行个体导入NVIDIA RTX PRO 4500 Blackwell服务器版本GPU。相较上一代G6执行个体,G7的 AI推论效能可达4.6倍,图形效能可达2.1倍。
AWS是首家提供由RTX PRO 4500加速之运算执行个体的主要云端服务供应商。AWS与NVIDIA也正合作导入NVIDIA Spectrum网络技术,进一步最佳化GPU丛集中大规模AI训练工作负载的网络效能。
AWS与NVIDIA正合作将基于Vera CPU的基础设施导入AWS,为需要兼具高效能CPU运算与加速运算基础设施的代理型AI工作负载提供另一项选择。Vera专为新一代AI打造,与AWS提供最广泛运算选择的策略相辅相成,选项涵盖AWS定制化芯片,以及合作夥伴最新的加速器与CPU。
在re:Invent 2025大会上,AWS宣布将在下一代Trainium芯片支持NVIDIA NVLink Fusion高速芯片互连技术。NVIDIA与Amazon旗下Annapurna Labs正进一步扩展此支持,携手存储器供应商导入NVIDIA全新定制化高带宽存储器(NVHBM)技术,让Trainium得以采用速度更快、能源效率更高的存储器。结合NVLink Fusion技术后,Annapurna Labs即可运用NVIDIA定制化存储器技术与垂直扩展架构,在提升AI工作负载效能与效率的同时,将Trainium与GPU无缝整合于共通的机架级架构。
以最高等级安全性驱动美国联邦AI
政府机构需要安全的AI基础设施,以因应国家安全的需求。AWS与NVIDIA计划为美国政府打造AI工厂,导入NVIDIA的AI技术堆叠,其中包括计划在AWS安全基础设施上部署10万颗GPU,以执行联邦政府与国家安全工作负载。此次合作让AWS与NVIDIA位居推进美国联邦政府国家安全AI发展的核心,使政府机构能针对Impact Level 6(IL6)及以上等级的工作负载,大规模部署AI。
这些新的承诺奠基于AWS与NVIDIA深度技术整合的基础之上,而这些整合目前已为客户带来实际成果,包括透过AWS Nitro System与EFA强化安全性与可靠性:此次扩大合作中,所有采用NVIDIA GPU Trainium 芯片的EC2执行个体,包括运用NVLink Fusion的执行个体,皆建置于AWS Nitro System之上,并透过EFA互连。无论是GPU加速或采用Trainium芯片的EC2执行个体,未来也将持续建置于Nitro System,并透过EFA进行水平扩展。
Nitro与EFA的结合有助确保AWS在扩充NVIDIA GPU规模并整合新互连技术时,客户仍能维持其大规模正式环境AI工作负载所依赖的安全性、可靠性与网络效能。AWS上的NVIDIA Nemotron模型:作为AWS致力于提供最广泛AI模型选择承诺的一部分,NVIDIA Nemotron系列开放式模型现已透过Amazon Bedrock以完全托管、无服务器模型的形式提供。
同时,对于希望在自有基础设施上进行部署和微调的客户,亦可透过Amazon SageMaker取得这些模型。这样的整合让客户得以使用NVIDIA最新的开放式模型,同时运用AWS的安全性、可扩展性与营运工具。GPU加速数据处理与矢量索引:随着数据量成长,特徵工程、大规模ETL与实时分析等工作负载需要更快的处理速度。
AWS与NVIDIA正合作在Amazon EMR上透过Amazon EC2 G7执行个体与NVIDIA cuDF函式库提供GPU加速的数据处理,相较基于CPU的配置,处理速度最高可提升3.7倍,且性价比提升30%。而随着AI应用、检索增强生成流程与语意查找将矢量数据库规模推升至数十亿笔记录的规模,索引建立与调校也成为瓶颈。
Amazon OpenSearch Service上的GPU加速矢量索引,可将索引建立作业卸载至专用GPU,以四分之一的成本实现最高9倍的矢量索引速度,并可用于托管丛集与Amazon OpenSearch Serverless。机器人领域的物理AI:Amazon Robotics正与NVIDIA合作,加速开发新一代机器人,整合NVIDIA全端堆叠物理AI平台,包括NVIDIA Jetson平台、NVIDIA Omniverse函式库与NVIDIA Isaac开放式机器人开发平台。
合作范围涵盖模拟、合成数据生成、机器人训练、路径最佳化、功能安全与Real-to-Sim验证,所有工作皆在GPU加速的Amazon EC2执行个体上执行。AWS与NVIDIA共同推进机器人工作负载在大规模部署时所需要的能力,包括大规模模拟、多元训练数据,以及持续的真实世界验证。更多内容请参考NVIDIA。







