
PFC 能在拥塞时暂停特定优先级,但配置错误、故障接收端或环路可能形成持续 pause,影响沿路径扩散。Watchdog 的意义是识别异常持续时间并采取止损动作,不过止损往往意味着开始丢包。若业务重试、ECN 和队列容量没有一起设计,网络从“完全停住”转成“大量重传”仍然不可用。
验收要在隔离环境中制造可控的 pause storm,记录从异常开始、看门狗触发、队列处理、告警到恢复的完整时间线。关注的不只是功能是否触发,还包括影响了哪些优先级和端口、丢包是否有界、应用是否在允许时间内恢复,以及正常微突发是否被误判。
触发阈值来自业务容忍度
过短阈值可能把正常微突发当异常,过长则让暂停扩散。先测正常负载下 pause 持续分布与队列深度,再结合应用超时和故障恢复目标设定候选。参数不能从其他网络照搬,速率、缓存和拓扑都会改变时间尺度。
故障注入必须可控可回收
使用独立端口或测试节点制造接收停滞、持续拥塞等场景,提前设定最大时长和紧急停止条件。不要在未隔离的生产 Fabric 上直接尝试。保存流量发生器、端口、优先级和配置,使结果能够复现。
观察触发后的队列和丢包
记录 watchdog 事件、端口队列、PFC、ECN、丢包、重传与链路利用率,并确认普通优先级是否仍可服务。触发后如果整个端口或多个无关队列同时受损,配置范围需要收紧。计数器清零和采样窗口要保持一致。
应用恢复比网络计数更重要
运行真实 RDMA 作业或等价业务,观察超时、重试、连接恢复和数据正确性。网络解除暂停并不代表应用会自动恢复,部分连接可能需要重建。把业务恢复时间和失败率写进验收,不用“watchdog fired”作为完成条件。
与 ECN 和容量治理共同收口
Watchdog 是异常止损,不是日常拥塞控制。正常状态应依靠合理队列、ECN/DCQCN 等机制和容量规划减少 PFC。上线后监控触发频率与根因,每次触发都应调查;频繁触发不能被当成系统正常工作。
可执行的验证动作
- 用正常 pause 分布和业务超时制定候选阈值。
- 在隔离端口实施有停止条件的可控故障注入。
- 同步采集 watchdog、PFC、ECN、队列、丢包和重传。
- 验证普通流量与真实 RDMA 应用的恢复时间。
- 将频繁触发视为根因调查事件而非正常状态。
官方能力与项目结论的边界
NVIDIA Networking 文档提供数据中心以太网、PFC 与拥塞相关配置资料入口。
Watchdog 的支持、触发和恢复行为需按具体交换平台、软件版本与配置确认。
具体功能、版本、兼容与部署条件请以NVIDIA Networking 文档的当前页面为准。官方系列信息用于建立候选范围,不能替代完整料号、目标平台支持清单和现场验证。
项目协同与能力边界
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 Spectrum、SuperNIC/ConnectX 和目标 RoCE 业务协助设计隔离故障注入、计数器采集与应用恢复验收。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
启用 PFC Watchdog 后是否就不需要处理 pause storm 根因?
不是。Watchdog 只是在异常持续时止损,可能通过丢包恢复转发。仍需定位拥塞、环路、接收端或优先级配置问题,并完善 ECN 与容量设计。
WeChat
Profile