
UFM 遥测应被用来回答“哪个时间窗、哪条链路、哪些端点和哪些作业同时异常”,而不是只看 Fabric 是否显示绿色。有效定位需要先建立正常基线,再把拓扑事件、端口错误、拥塞计数和作业日志统一到可比较的时间轴。
适用条件与判断边界
适用于需要集中管理 InfiniBand Fabric、快速定位间歇性链路或拥塞问题的集群。部署前确认 UFM 版本、设备支持、数据采集粒度、保留周期、时间同步和告警出口。若无法取得调度器或作业时间信息,仍可定位网络事件,但很难判断业务影响和责任范围。
实施与选型方法
先在稳定运行期记录端口错误、符号错误、链路降级、拥塞与拓扑变更的典型范围,按设备角色和速率建立基线。事件发生时锁定作业开始、异常和恢复时间,再逐层查看 Fabric 总览、相关交换节点、端口与端点。对间歇问题保留原始计数增量,避免只截图累计值。必要时结合线缆、端口替换和端点互换缩小范围。
主要风险与控制方式
累计计数容易让历史问题看似仍在发生,采样间隔过长又可能漏掉瞬态异常。时间不同步会造成错误关联,告警阈值统一套用也可能让不同角色产生噪声。UFM 结论仍需与交换日志、主机 HCA、作业和物理层证据交叉验证,不能据单一告警直接更换设备。
如何核验结果
- 确认 UFM、交换设备、计算节点和调度系统时间一致,并能导出同一事件窗口的数据。
- 用受控链路中断或错误演练验证拓扑事件、告警、定位路径和恢复状态是否完整。
- 选取历史异常复盘,从作业影响追溯到端口计数,再反向确认修复后增量恢复正常。
下一步行动
建立按严重度分类的事件模板,要求每次记录时间窗、受影响端点、作业、计数增量、处置和复测。基线与阈值应随扩容和软件升级复核,不把默认值长期视为生产标准。
核对具体版本与功能边界时,可查看NVIDIA UFM Enterprise 文档、UFM Fabric Dashboard,并以目标版本页面为准。
WeChat
Profile