业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
利用 NVIDIA SHARP 网络计算提升系统性能:这些问题太大了,计算太密集,无法在单台机器上运行
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。

AI 和科学计算应用是分布式计算问题的绝佳示例。这些问题太大了,计算太密集,无法在单台机器上运行。这些计算被分解为并行任务,这些任务分布在数千个计算引擎中,如 CPU 和 GPU。
为了实现可扩展的性能,该系统依赖于在多个节点上划分工作负载,如训练数据、模型参数或两者。然后,这些节点必须频繁交换信息,例如模型训练中反向传播期间新处理的模型计算的梯度,需要高效的集合通信,如 all-reduce、broadcast 以及 gather 和 scatter 操作。
这些集合通信模式可确保整个分布式系统中模型参数的同步和收敛。这些操作的效率对于最大限度地减少通信开销和最大限度地提高并行计算至关重要,因为优化不佳的集合通信可能会导致瓶颈,限制可扩展性。
瓶颈源于以下几个因素:
· 延迟和带宽限制: 集合操作依赖于节点间的高速数据传输,而这些高速数据传输受物理网络延迟和带宽的限制。随着系统规模的增加,要交换的数据量也随之增加,通信所花费的时间成为比计算更重要的因素。
· 同步开销: 许多集合操作需要同步点,在此之前所有参与的节点必须先达到相同的状态,然后才能继续。如果某些节点速度较慢,整个系统会出现延迟,从而导致效率低下,被称为 stragglers 。
· 网络争用: 随着越来越多的节点试图同时通信,网络变得更加拥塞,对带宽和网络资源的争夺也在增加,这进一步减慢了集体操作的速度。
· 非优化通信模式: 一些集合通信算法(例如基于树的归约或基于环的 all-reduce)并非始终针对大规模系统进行良好优化,导致可用资源的低效利用和延迟增加。
克服这一瓶颈需要改进网络技术(例如 InfiniBand 或 RDMA)和算法优化(例如分层 all-reduce 或流水线技术),以最大限度地减少同步延迟、减少争用并优化分布式系统之间的数据流。
关键的集合通信使所有计算引擎能够相互交换数据。在 NIC 或服务器上管理此类通信需要交换大量数据,并且会受到延迟或集合性能差异的影响,也称为 服务器抖动 。
通过在交换机结构上迁移管理和执行这些集合通信的责任,可以将传输的数据量减半,并最大限度地减少抖动。NVIDIA Scalable Hierarchical Aggregation and Reduction Protocol(SHARP)是实现这一概念的技术,并引入了 网络计算 概念。它集成在交换机 ASIC 中,旨在加速分布式计算系统中的集合通信。
SHARP 已随 NVIDIA InfiniBand 网络一起推出,可将集合通信运算(如 all-reduce、reduce 和 broadcast)从服务器的计算引擎卸载到网络交换机。通过直接在网络结构中执行归约(求和、平均等),SHARP 可改进这些运算和整体应用程序性能。
第一代 SHARP 专为科学计算应用而设计,侧重于小消息归约操作。它随 NVIDIA EDR 100Gb/s 交换机生成而推出,并得到领先的消息传递接口(MPI)库的快速支持。SHARPv1 小消息归约以并行方式支持多个科学计算应用。
MVAPICH2 是 MPI 标准的开源实现,专为高性能计算 (HPC) 环境而设计。俄亥俄州立大学负责 MVAPICH MPI 库的团队已经证明了 SHARP 在德克萨斯州高级计算中心 Frontera 超级计算机上的性能成就。从 MPI AllReduce 的性能提高了 5 倍,到 MPI Barrier 集合通信的性能提高了 9 倍。
第二代 SHARP 随 NVIDIA HDR 200Gb/s Quantum InfiniBand 交换机一起推出,并增加了对 AI 工作负载的支持。SHARPv2 支持大型消息简化操作,一次支持单个工作负载。这一版本进一步提升了该技术的可扩展性和灵活性,支持更复杂的数据类型和聚合操作。

图 1. 加州大学伯克利分校机器学习系统课程示例 (来源:分布式深度学习,第 II 部分:扩展约束)
最近,第三代 SHARP 推出了 NVIDIA Quantum-2 NDR 400G InfiniBand 平台。SHARPv3 支持 AI 工作负载的多租户网络计算,这意味着与使用 SHARPv2 的单个工作负载相比,多个 AI 工作负载可并行支持。
Microsoft Azure 首席软件工程师 Jithin Jose 在“ 将云转变为云原生超级计算:借助 Microsoft Azure 实现最佳实践 ”专题会议上展示了 SHARPv3 性能。Jithin 在 Azure 上介绍了 InfiniBand 的网络计算技术,并展示了 AllReduce 延迟方面的近一个数量级的性能优势。
通过 all-reduce 运算,可以看到 SHARP 的一个强大示例。在模型训练期间,多个 GPU 或节点之间的梯度求和,SHARP 聚合网络中的梯度,从而无需在 GPU 之间或节点之间发送完整的数据集。这缩短了通信时间,从而加快 AI 工作负载的迭代速度并提高吞吐量。
在网络计算和 SHARP 时代到来之前,NVIDIA Collective Communication Library (NCCL) 通信软件会从图形中复制所有模型权重,执行 all-reduce 运算来计算权重之和,然后将更新的权重写回图形,从而产生多个数据复制。
2021 年,NCCL 团队开始集成 SHARP,引入了用户缓冲区注册。这使 NCCL 集合能够直接使用指针,从而消除了在此过程中来回复制数据的需求,并提高了效率。
如今,SHARP 已与广泛用于分布式 AI 训练框架的 NCCL 紧密集成。NCCL 经过优化,可将关键的集合通信操作分流到网络,从而充分利用 SHARP,显著提高分布式深度学习工作负载的可扩展性和性能。
SHARP 技术有助于提高分布式计算应用程序的性能。SHARP 正被高性能计算(HPC)超级计算中心用于其科学计算工作负载,也被人工智能(AI)超级计算机用于 AI 应用程序。SHARP 是实现竞争优势的“秘诀”。一家大型服务提供商使用 SHARP 将其内部 AI 工作负载的性能提高了 10% 到 20%。
SHARPv4 引入了新算法,可支持更多种类的集合通信,这些通信现已用于领先的人工智能训练应用。SHARPv4 将随 NVIDIA Quantum-X800 XDR InfiniBand 交换机平台一起发布,从而将网络计算能力提升至更高水平。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。