
AI 集群网络压力应从作业使用的数据并行、张量并行、流水并行或专家并行方式反推,因为不同集体通信会形成环、树、多对多和阶段性突发。只按每节点网卡速率乘节点数,既看不到热点,也无法判断通信与计算是否重叠。
适用条件与判断边界
适用于需要新建网络、扩容或解释作业扩展效率的训练与分布式推理集群。建模输入包括节点数、每节点 GPU、并行组、张量大小、精度、梯度累积、专家路由、批量和通信频率。框架与 NCCL 算法可能按规模改变路径,因此模型用于提出测试假设,不能替代实测。
实施与选型方法
先从框架配置提取每个通信组和同步点,估算单次通信数据量与每步频率,再映射到节点内互连、主机网卡和交换 Fabric。对 All-Reduce 关注双向持续流,对 All-to-All 关注多对多热点与尾部,对检查点和数据加载则分开建模。随后通过 NCCL 测试和业务 profiler 采集接口流量、通信占比与阶段时间,校准估算。
主要风险与控制方式
常见误差来自把模型参数量等同于每步网络流量、忽略压缩和梯度累积、只测平均带宽、未区分节点内外通信,以及作业并发后产生同步突发。合成工具能验证链路上限,但不能完整代表框架调度、数据不均与专家倾斜。容量结论应包含假设和误差范围。
如何核验结果
- 把 profiler 中的通信调用、大小和持续时间与端口采样对齐,确认模型能够解释主要流量。
- 分别运行单作业、并行作业和混合规模作业,观察热点、尾延迟与计算等待变化。
- 在单链路或单设备降级下复测,确认故障后路径和作业影响符合容量保护设计。
下一步行动
建立按模型和并行策略维护的流量档案,用真实作业持续校准。网络扩容前先用档案重放最不利并发窗口,再决定端口、上联、隔离和作业编排策略。
核对具体版本与功能边界时,可查看NVIDIA NCCL 用户指南、NVIDIA NCCL 环境变量,并以目标版本页面为准。
WeChat
Profile