
亚马逊云科技 (AWS) 和 NVIDIA 今日宣布大幅扩展战略合作,以应对全球对 AI 基础设施日益高涨且不断加速的需求。基于客户对亚马逊云科技上 NVIDIA 加速计算的快速采用,双方计划在亚马逊云科技的全球基础设施中新增部署 200 万个 NVIDIA GPU,并在 AI 工厂、CPU、网络、开放模型、数据处理和机器人领域深化合作。
亚马逊云科技计划于 2027-2028 年间,在其包括 AI 工厂在内的全球基础设施中部署这 200 万个 NVIDIA Blackwell Ultra、Rubin 和 Rubin Ultra GPU。这些新增算力将支持客户从智能体 AI、科学发现到企业自动化和物理 AI 的各种工作负载。此外,亚马逊云科技将扩展 NVIDIA Blackwell 的算力容量,包括为 Amazon EC2 G7 实例配备 NVIDIA RTX PRO Blackwell 服务器版 GPU,与上一代 G6 实例相比,G7 实例的 AI 推理性能提升了 4.6 倍,图形性能提升了 2.1 倍。
在处理器层面,亚马逊云科技正与 NVIDIA 合作,将基于 Vera CPU 的基础设施引入亚马逊云科技,为那些需要加速基础设施与高性能 CPU 计算协同运行的智能体 AI 工作负载提供额外选项。在异构基础设施方面,NVIDIA 和亚马逊旗下 Annapurna Labs 正在进一步扩大合作,双方将与内存供应商共同推进对 NVIDIA 全新定制高带宽内存 (NVHBM) 技术的支持,使 Trainium 能够采用更快、更高效的内存,并结合 NVLink Fusion 将 Trainium 和 GPU 无缝集成到相同的机架级架构中。
面向政府客户,亚马逊云科技和 NVIDIA 计划为政府建立 AI 工厂,提供 NVIDIA 的 AI 技术栈,并计划在亚马逊云科技的安全基础设施上为国家级安全工作负载提供 10 万个 GPU,用于处理影响级别 6 及以上的机密工作负载。同时,所有基于 NVIDIA GPU 和 Trainium 的 EC2 实例都基于亚马逊云科技 Nitro 系统构建,并通过 Elastic Fabric Adapter (EFA) 进行互连,以保持大规模量产级 AI 工作负载所需的安全性、可靠性和网络性能。
在开放模型与数据加速方面,NVIDIA 的 Nemotron 系列开放模型可在 Amazon Bedrock 上作为全托管无服务器模型提供,同时也可在 Amazon SageMaker 上提供。亚马逊云科技正在和 NVIDIA 合作,通过 Amazon EC2 G7 实例和 NVIDIA cuDF 库在 Amazon EMR 上实现 GPU 加速的数据处理,与基于 CPU 的配置相比处理速度可提升至原来的 3.7 倍,性价比提高 30%;Amazon OpenSearch Service 上的 GPU 加速向量索引功能可以四分之一的成本实现高达 9 倍的向量索引速度提升。
在机器人领域,Amazon Robotics 正与 NVIDIA 展开合作,加速开发集成 NVIDIA 全栈物理 AI 平台的新一代机器人,涵盖 NVIDIA Jetson 平台、NVIDIA Omniverse 库和 NVIDIA Isaac 开放机器人开发平台,合作领域包括仿真、合成数据生成、机器人训练、路线优化、功能安全和从现实到仿真验证。亚马逊云科技首席执行官 Matt Garman 表示,此次扩展合作将为前沿实验室、企业和政府提供更多在亚马逊云科技上构建和部署 AI 的方式。
WeChat
Profile