新闻中心

在线推理与离线训练能否混用 Fabric:先算拥塞传播和服务等级 NEWS DETAIL

资讯分类 · AI 集群架构 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-08-02 更新时间 · 2026-08-02 来源 · NVIDIA Spectrum-X 文档
在线推理与离线训练能否混用 Fabric:先算拥塞传播和服务等级
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

训练网络通常承载高带宽、同步明显的东西向通信,在线推理则更关心首响应、尾延迟和持续可用。两类业务共享 Fabric 可以提高端口利用率并减少重复建设,但平均带宽有余量并不说明互不影响:训练 AllReduce、检查点、模型加载或故障重试的突发可能在很短时间内抬高队列,推理请求只需经历一次拥塞就会反映到 P99。

选择共享还是分离,应先量化业务服务等级、流量矩阵和故障边界。共享方案必须从主机、网卡、交换队列到路由全程保持分类一致,并证明异常训练作业无法耗尽推理资源;分离方案则要承担端口、布线、运维和跨网数据交换的复杂度。逻辑隔离并不等同物理故障隔离,两个方案都要明确电源、交换和控制面的共同点。

用时间序列描述两类流量

训练按集合通信、数据读取和检查点记录峰值与周期;推理按请求、KV 传输、模型加载和健康检查记录吞吐与尾延迟。至少覆盖业务高峰、训练同步和维护恢复,不使用日平均值决定。流量模型还要包含重试,因为拥塞时的重试可能放大压力。

分离方案核对交叉依赖

即使物理网络分开,DNS、控制面、存储、模型仓库、带外管理或机柜电源仍可能共享。画出这些交叉依赖并演练故障。模型从训练区进入推理区需要受控的制品传递与校验,不能用临时双网卡连接绕过安全边界。

共享方案验证逐跳分类

从应用或主机标记到网卡优先级、交换队列、拥塞控制和出口策略逐跳核对,防止中间设备重写或丢失。为推理保留最小资源并测试训练超额、错误标记和队列拥塞。隔离规则必须有监控,不能只在上线时抓一次配置。

变更和扩容也是服务等级的一部分

共享 Fabric 的升级可能同时影响两类业务,需要更严格的分批与回退;分离 Fabric 可以错开窗口,但增加版本组合。计算未来节点和端口时保留故障后容量,避免正常时可用、单链路或单设备退出后互相争抢。

用干扰实验形成决策

在推理稳定负载下逐步加入训练通信、检查点和故障重试,记录 P99、队列、水位和丢包;再反向验证推理突发对训练 step time 的影响。若无法通过端到端分类保证服务等级,应选择更强的隔离。结论绑定当前规模与版本,扩容后复核。

工程记录必须覆盖什么

  1. 建立训练与推理的周期、突发、重试和尾延迟模型。
  2. 共享时逐跳验证标记、队列、拥塞与保留资源。
  3. 分离时盘点 DNS、存储、控制、管理和电源共同依赖。
  4. 评估升级窗口、故障后容量和未来端口扩展。
  5. 运行双向干扰和故障重试实验形成决策证据。

技术判断应绑定当前版本

NVIDIA Spectrum-X 文档提供面向 AI 以太网 Fabric 的部署与运维资料。

网络隔离、拥塞控制和服务等级的实际效果取决于完整端到端配置、流量与平台版本。

文中机制与配置边界依据NVIDIA Spectrum-X 文档的当前版本核对;官方说明用于确定候选条件,实际部署仍需结合完整料号、服务器支持清单、软件组合与现场测试。

平台与网络的联合验证

中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 Spectrum-X、SuperNIC、ConnectX 与业务服务等级协助构建共享/分离对照和干扰测试,使网络边界来自实际证据。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。

网络平均利用率不到一半,是否适合训练和推理共享?

不能由平均值判断。需要测试同步突发、队列竞争、错误标记、故障后容量和推理 P99,并核对端到端隔离是否真正生效。

用于验证的产品范围