
DPU 进入 AI 集群后,网络、存储和安全功能不再全部运行在服务器主机操作系统中。这可以建立更清晰的基础设施隔离,但也增加了一个独立计算与管理域。若项目只列出 BlueField-3 料号,没有说明哪些服务运行在主机、哪些运行在 DPU、谁负责升级与恢复,故障时很难判断问题属于业务、主机还是基础设施。
边界设计应从数据路径和控制路径两方面展开。每类流量写明入口、处理位置、策略来源、可观测点和回退路径;每项服务则明确所有者、版本、变更窗口与失效影响。DPU 不是把复杂度消除,而是把复杂度移动到可隔离、可治理的位置。
网络职责从数据路径开始划分
需要明确虚拟交换、路由、RDMA、隧道或服务链由哪一侧执行,主机看到的是物理功能、虚拟功能还是抽象接口。队列、MTU、拥塞控制和遥测也要有唯一配置来源。主机与 DPU 同时修改同一策略,会造成表面配置正确、实际路径不一致。
存储卸载必须保留一致性边界
数据面加速不能替代存储协议、权限、路径冗余和一致性设计。项目要说明 DPU 处理哪些 I/O 流程,故障时能否切换或回退,主机与存储端如何观察同一会话。检查点和训练数据属于关键资产,任何卸载方案都必须经过异常断链与恢复验证。
安全隔离要覆盖 DPU 自身
把策略从主机移到 DPU 可以减少主机管理员绕过基础设施控制的空间,但 DPU 的管理接口、镜像、凭据和升级通道也成为新的高权限边界。应实施最小权限、签名或可信镜像来源、审计和管理网络隔离,并明确紧急恢复账户的保管方式。
生命周期不能跟随主机随意变化
DPU OS、固件、驱动和主机组件存在兼容关系。主机重装、内核升级或容器平台更新前,应判断是否影响 DPU 管理与数据路径。建议维护一份组合版本矩阵,并在小规模节点池完成升级、回退和断电恢复演练后再扩大。
可观测性要打通三个视角
故障定位至少需要主机、DPU 和交换网络三侧时间一致的日志与计数器。只采集主机接口状态会遗漏 DPU 内部处理,只看交换端口又无法解释主机侧队列。统一资产标识、时间同步和事件关联,是实现可运维卸载的基础。
可执行的实施检查项
- 逐项标注网络、存储和安全服务的实际运行位置。
- 确定主机、DPU、BMC 与管理平台的访问和恢复路径。
- 锁定 DPU OS、固件、驱动与主机软件组合。
- 验证断链、重启、升级失败与策略错误下的回退。
- 关联主机、DPU 和交换网络的日志与设备身份。
以官方资料约束实施边界
BlueField DPU 面向网络、存储与安全基础设施处理,具体能力由硬件代际、DPU 软件和部署模式决定。
DPU 与主机、BMC 和外部管理系统之间具有独立的软件与运维边界,需要按平台文档管理。
核对具体功能、版本和部署条件时,请以NVIDIA BlueField 官方资料与 DGX 文档(1)、NVIDIA BlueField 官方资料与 DGX 文档(2)的当前页面为准;公开平台方向不能替代完整料号、兼容矩阵和目标环境验证。
选型支持与实施边界
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 BlueField-3、Spectrum 网络与服务器环境,协助梳理数据路径、控制路径、版本矩阵和异常恢复场景,使 DPU 方案从设备清单落到可运维架构。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
使用 BlueField-3 后,主机侧就不需要网络与安全配置了吗?
不是。职责会重新划分,但主机接口、驱动、路由、应用权限和监控仍需配置。关键是确定唯一控制来源并验证主机与 DPU 的协同边界。
WeChat
Profile