
生成式 AI 的爆发正在从根本上改变数据中心的设计方式。当分布式训练扩展到数十万 GPU 规模时,连接这些节点的扩展网络已经成为首要的性能瓶颈。传统以太网凭借标准化、低成本与成熟生态统治企业网络数十年,但在承载 AI 架构特有的大规模、高同步通信模式时,正撞上物理与架构的双重极限。
传统数据中心流量属于"高熵"流量:海量小流量分散在不同方向,ECMP 通过静态流哈希即可获得大致均衡。而 AI 训练流量是典型的"低熵"流量:GPU 通过 All-Reduce、All-Gather、All-to-All 等集合通信持续同步,形成数量少、体量大的同步流,这暴露出传统以太网的三大局限:ECMP 哈希冲突导致"掉队流"拖慢整个集合通信,使大量 GPU 空转;拥塞溢出交换机缓冲引发丢包重传,RoCEv2 依赖的 PFC 暂停帧又可能造成队头阻塞并扩散拥塞;DCQCN 等慢速拥塞控制在同步突发面前难以调优,容易导致缓冲堆积、利用率下降与延迟尖峰。
为弥合这一差距,NVIDIA 推出了 Spectrum-X 以太网——一套为超大规模 AI 工厂从零设计的硬件加速网络架构。其核心设计原则是:在微秒级时间尺度上响应拥塞,将网络控制按作用域、信号与职责拆解为三个互不干扰的硬件加速控制环。其一,交换机内的逐包自适应路由(Adaptive Routing):以 Join-Shortest-Queue 的量化硬件近似,在亚微秒间隔内采样 ECMP 组中每个出口端口的队列深度,把每个数据包动态导向最空闲的物理端口。其二,定向拥塞控制(Targeted Congestion Control):交换机仅在自适应路由能力完全耗尽且队列继续增长时才产生 ECN 标记,发送端结合精确 RTT 探测调整速率,既不会对短暂微突发过度反应,又能在真实的端点级拥塞发生时快速降速。其三,SuperNIC 内的平面负载均衡器(PLB):在主机边缘结合本地队列反馈与逐平面端到端拥塞遥测,将数据包动态分配到多个网络平面。
在扩展能力上,Spectrum-X Multiplane 技术将一个 800Gbps 的 8 通道 ConnectX SuperNIC 分解为四个独立的 200Gbps 平面,每个平面都是高效的浅层两级胖树。相比传统架构需要增加层级来扩展,这种拓扑可在不引入多级 Fabric 时延与抖动开销的情况下扩展到 12.8 万以上端点。与"盲目喷射"(对平面状态无感知的顺序分发)不同,PLB 为每个目标 GPU 独立维护逐平面的有状态拥塞上下文:发送前先过滤掉存在端到端拥塞或链路故障的平面,再从剩余健康平面中选择本地出口队列最浅者。当某个平面出现链路故障时,流量可在 3 毫秒内透明切换到其余健康平面,保留 75% 的对分带宽。
NVIDIA 在生产线级集群与高保真模拟中的实测数据进一步凸显了差异:在 DeepSeek-V3 训练模拟中,标准以太网在背景噪声流量下训练步进时间从 735ms 膨胀到 1.18 秒(约 1.6 倍减速),而 Spectrum-X 以太网在单租户与高拥塞多租户条件下均稳定在 668ms;在最坏 RDMA 对分基准下,标准以太网的部分 GPU 对吞吐可跌至 25Gbps,Spectrum-X 则以自适应路由与 PLB 维持 98% 的理论线速率,75% 负载下 P99 尾时延仅 8 至 9 微秒(传统以太网为 22 微秒);主机到叶链路抖动时,硬件 PLB 在 2.68 毫秒内完成故障切换,相比软件负载均衡提升约 400 倍。在 10% Fabric 链路故障场景下,传统以太网的集合通信带宽可能崩塌 50% 以上,而 Spectrum-X 严格按容量比例降级,带宽仅下降约 11%。
从通用云计算转向超大规模生成式 AI,本质上是网络需求的一次范式转移。Spectrum-X 以太网通过在 Fabric 内自适应路由、传输层定向拥塞控制与主机侧平面负载均衡,将关键控制环解耦并全面硬件加速,为超大规模 AI 提供可预测、稳定且超低时延的网络性能,也让多租户隔离与故障恢复能力成为 AI 工厂的架构标配。
WeChat
Profile