
RoCE 上线时,很多团队同时在交换机、操作系统、驱动脚本和编排平台中写 PFC 与 ETS 参数,却没有明确哪一侧是权威。DCBX willing 端点倾向于接受对端通告,non-willing 则保持本地配置;如果模式与运维责任不一致,同一节点重启或更换交换端口后可能得到不同结果。
部署前应先确定策略所有者和期望状态:优先级如何映射,哪些流量需要无损,ETS 比例如何定义,端点是否允许从网络学习。然后分别读取交换机与主机的运行状态,验证协商后结果,而不是只检查配置文件。分批上线必须保留旧策略与端口级回退。
用责任矩阵决定 willing 模式
如果网络团队统一控制端口策略并能保证通告一致,端点接受网络参数可能便于集中治理;如果主机有固定的本地要求或对端不可信,则需保持本地策略。选择必须有明确原因,不能让不同节点由默认值随机决定。
配置值与运行值要分别采集
保存交换端配置、端点配置、DCBX 通告以及最终生效的 PFC、ETS 和应用优先级。运行值不一致时,先定位策略所有权和协商状态,再调整。只看某一侧配置“正确”不能证明端到端成立。
优先级映射覆盖完整流量路径
从应用 DSCP/PCP、主机队列、交换端口到远端主机逐段核对,确认无损优先级和普通流量不会混淆。路由、隧道或虚拟交换层可能重写标记。使用可识别的测试流量验证每类队列,而不是依赖静态表格。
混合模式阶段限制故障范围
先在独立叶交换或小节点池试点,避免同一业务组同时出现多种策略。迁移期间标记节点与端口状态,并让调度器只把作业放到已完成验收的组。发现 pause、丢包或吞吐异常时可以整组回退。
变更后用压力与重启验证
运行 RDMA 与普通以太网混合负载,观察 PFC、ECN、队列、吞吐和尾延迟;随后重启主机、重载驱动和切换端口,确认协商结果保持一致。验收记录绑定版本,升级驱动或交换软件后重新检查默认行为。
实施前需要形成的证据
- 明确交换机、主机和编排平台各自的配置责任。
- 采集配置值、DCBX 通告和最终运行值三类证据。
- 逐段验证应用标记、主机队列与交换优先级。
- 按叶交换或节点池分批试点并准备整组回退。
- 在混合流量、重启和端口切换后复核运行状态。
官方资料如何约束本次判断
NVIDIA Networking 文档为 ConnectX 驱动与数据中心桥接配置提供官方入口。
DCBX、PFC 和 ETS 行为取决于适配器、驱动、固件、交换平台与具体配置模式。
具体功能、版本、兼容与部署条件请以NVIDIA Networking 文档的当前页面为准。官方系列信息用于建立候选范围,不能替代完整料号、目标平台支持清单和现场验证。
从技术判断落到项目实施
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 ConnectX 与 Spectrum 以太网方案协助梳理 DCBX 配置权、优先级路径、试点范围和回退证据。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
所有 ConnectX 都设置为 willing 是否最容易统一管理?
不一定。只有当网络侧通告是可信且统一的权威策略时才合理;若责任不清或存在不同业务要求,统一 willing 可能把错误配置扩散到全部端点。
WeChat
Profile