新闻中心

AI 集群架构 NEWS CENTER

结合训练、推理和存储业务,分析 InfiniBand、RoCE、Leaf-Spine 与 Rail-Optimized 架构的适用条件、产品组合和扩容路径。

常见问题 点击展开 收起
FAQ 01

AI 集群应选择 InfiniBand 还是 RoCE?

需要结合训练或推理业务、GPU 规模、时延和扩展效率目标、现有以太网能力、运维团队经验、预算与交付周期判断,不能只比较端口速率。

FAQ 02

GPU 利用率低一定是交换机性能不足吗?

不一定。常见问题还包括数据读取慢、CPU 或内存瓶颈、PCIe 与 NUMA 路径不合理、网卡位置错误、线缆或 FEC 异常,以及 NCCL 和 RDMA 参数没有对齐。

FAQ 03

文章中的 Leaf-Spine 拓扑可以按端口数直接复制吗?

不能。正式设计还要核算节点数、每节点 GPU 和网卡数量、收敛比、故障域、Rail 划分、上联带宽、布线距离、冗余方式与后续扩容规模。

FAQ 04

扩容规划应在什么时候开始?

应在首期设计时完成。交换机端口、机柜位置、光纤与配线、地址和路由、Rail 数量、管理平面以及电力散热都可能限制后续扩容。