
InfiniBand Subnet Manager 的高可用应设计为受控主备与可验证选举,而不是让多个实例各自独立管理。项目需要明确优先级、配置同步、管理地址、启动顺序和故障恢复时间,并验证主 SM 失效后备 SM 接管期间现有业务和新链路的实际行为。
适用条件与判断边界
适用于对新节点上线、路径计算和故障恢复有连续性要求的 InfiniBand 集群。规模较小且维护窗口可控的环境也应至少保留已验证的备用方案。若 SM 由交换机、UFM 或独立主机承载,必须确认具体软件版本、授权功能和部署模式,不能把不同实现的配置方式混用。
实施与选型方法
先盘点所有可能运行 SM 的位置,确定唯一主用和有序备用优先级,统一路由、分区、日志和安全配置。管理网络、DNS、时间同步与主机资源应独立可用。上线前记录当前主 SM 标识和子网状态,依次测试进程退出、主机掉电、管理链路中断和恢复,观察选举、拓扑收敛、新端口加入及告警。恢复后避免原主节点未经检查自动争抢控制权。
主要风险与控制方式
风险包括配置不一致导致接管后路径或分区变化、两个实例优先级错误、备用服务长期未启动,以及管理网络故障同时影响主备。SM 切换不等于作业完全无感,链路变化和新节点加入可能在窗口内受影响。故障测试必须避开未知影响的生产高峰,并准备恢复步骤。
如何核验结果
- 核对当前主备角色、优先级、配置哈希、版本和时间同步,确认监控能识别角色变化。
- 在受控窗口逐类中断主实例,记录接管时间、子网状态、现有作业和新节点行为。
- 恢复原主后验证不会产生角色震荡,检查日志、告警、路径与分区仍符合基线。
下一步行动
形成包含角色、优先级、配置同步、演练频率和人工接管方式的 SM 运行手册。每次升级或分区变更先更新备用实例并做切换测试,再进入主用环境。
核对具体版本与功能边界时,可查看NVIDIA Networking 文档中心、NVIDIA UFM Enterprise 文档,并以目标版本页面为准。
WeChat
Profile