
AI 数据中心不能把所有流量简单放进同一张“高速网络”。GPU 集合通信、训练数据读写、镜像与检查点、BMC 管理、监控和用户访问具有不同的带宽、时延和故障要求。分层的目的不是增加设备数量,而是让容量、策略和故障影响可以分别计算。
计算网络关注同步和扩展效率
计算网络承载 GPU 或加速器之间的高频通信,常见目标是低时延、稳定吞吐和可预测的多节点扩展。它需要与服务器 PCIe、网卡、RDMA、NCCL 和交换拓扑一起验证。业务突发和拥塞对训练迭代时间的影响通常比平均流量更值得关注。
存储网络关注持续吞吐和恢复
存储网络承载数据集、检查点、模型和日志。设计时应分别核算顺序吞吐、小文件元数据、并发客户端和故障恢复流量。若训练数据和检查点与计算通信共享链路,应证明高峰期不会互相挤占,并明确 QoS 与容量余量。
管理网络必须在故障时仍可用
管理网络连接 BMC、交换机管理口、部署服务、监控和自动化平台。它的带宽通常不是最高,但对带外访问、故障定位和恢复至关重要。管理路径不应依赖正在排障的数据平面,否则网络异常时可能同时失去控制能力。
| 网络层 | 主要流量 | 首要目标 |
|---|---|---|
| 计算 | GPU 集合通信、RDMA | 时延、吞吐和扩展效率 |
| 存储 | 数据集、检查点、模型 | 持续吞吐、并发和恢复 |
| 管理 | BMC、部署、监控、运维 | 隔离、可达和故障恢复 |
分层可以是物理网络,也可以在共享设备上通过 VRF、VLAN、QoS 和访问控制实现逻辑边界。无论采用哪种方式,都应分别给出容量表、地址与路由、权限、监控、故障场景和验收方法。
WeChat
Profile