新闻中心

UFM 遥测如何定位 Fabric 异常:先关联时间、链路与作业 NEWS DETAIL

资讯分类 · NVIDIA 网络互连 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-25 更新时间 · 2026-07-25 来源 · NVIDIA 官方文档
UFM 遥测如何定位 Fabric 异常:先关联时间、链路与作业
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

UFM 遥测应被用来回答“哪个时间窗、哪条链路、哪些端点和哪些作业同时异常”,而不是只看 Fabric 是否显示绿色。有效定位需要先建立正常基线,再把拓扑事件、端口错误、拥塞计数和作业日志统一到可比较的时间轴。

适用条件与判断边界

适用于需要集中管理 InfiniBand Fabric、快速定位间歇性链路或拥塞问题的集群。部署前确认 UFM 版本、设备支持、数据采集粒度、保留周期、时间同步和告警出口。若无法取得调度器或作业时间信息,仍可定位网络事件,但很难判断业务影响和责任范围。

实施与选型方法

先在稳定运行期记录端口错误、符号错误、链路降级、拥塞与拓扑变更的典型范围,按设备角色和速率建立基线。事件发生时锁定作业开始、异常和恢复时间,再逐层查看 Fabric 总览、相关交换节点、端口与端点。对间歇问题保留原始计数增量,避免只截图累计值。必要时结合线缆、端口替换和端点互换缩小范围。

主要风险与控制方式

累计计数容易让历史问题看似仍在发生,采样间隔过长又可能漏掉瞬态异常。时间不同步会造成错误关联,告警阈值统一套用也可能让不同角色产生噪声。UFM 结论仍需与交换日志、主机 HCA、作业和物理层证据交叉验证,不能据单一告警直接更换设备。

如何核验结果

  1. 确认 UFM、交换设备、计算节点和调度系统时间一致,并能导出同一事件窗口的数据。
  2. 用受控链路中断或错误演练验证拓扑事件、告警、定位路径和恢复状态是否完整。
  3. 选取历史异常复盘,从作业影响追溯到端口计数,再反向确认修复后增量恢复正常。

下一步行动

建立按严重度分类的事件模板,要求每次记录时间窗、受影响端点、作业、计数增量、处置和复测。基线与阈值应随扩容和软件升级复核,不把默认值长期视为生产标准。

核对具体版本与功能边界时,可查看NVIDIA UFM Enterprise 文档UFM Fabric Dashboard,并以目标版本页面为准。