新闻中心

计算、存储与管理网络为什么要分层:AI 数据中心的流量与故障边界 NEWS DETAIL

资讯分类 · AI 集群架构 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-24 更新时间 · 2026-07-25 来源 · NVIDIA 参考架构
计算、存储与管理网络为什么要分层:AI 数据中心的流量与故障边界
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

AI 数据中心不能把所有流量简单放进同一张“高速网络”。GPU 集合通信、训练数据读写、镜像与检查点、BMC 管理、监控和用户访问具有不同的带宽、时延和故障要求。分层的目的不是增加设备数量,而是让容量、策略和故障影响可以分别计算。

计算网络关注同步和扩展效率

计算网络承载 GPU 或加速器之间的高频通信,常见目标是低时延、稳定吞吐和可预测的多节点扩展。它需要与服务器 PCIe、网卡、RDMA、NCCL 和交换拓扑一起验证。业务突发和拥塞对训练迭代时间的影响通常比平均流量更值得关注。

存储网络关注持续吞吐和恢复

存储网络承载数据集、检查点、模型和日志。设计时应分别核算顺序吞吐、小文件元数据、并发客户端和故障恢复流量。若训练数据和检查点与计算通信共享链路,应证明高峰期不会互相挤占,并明确 QoS 与容量余量。

管理网络必须在故障时仍可用

管理网络连接 BMC、交换机管理口、部署服务、监控和自动化平台。它的带宽通常不是最高,但对带外访问、故障定位和恢复至关重要。管理路径不应依赖正在排障的数据平面,否则网络异常时可能同时失去控制能力。

网络层主要流量首要目标
计算GPU 集合通信、RDMA时延、吞吐和扩展效率
存储数据集、检查点、模型持续吞吐、并发和恢复
管理BMC、部署、监控、运维隔离、可达和故障恢复

分层可以是物理网络,也可以在共享设备上通过 VRF、VLAN、QoS 和访问控制实现逻辑边界。无论采用哪种方式,都应分别给出容量表、地址与路由、权限、监控、故障场景和验收方法。