新闻中心

BlueField-3 在 AI 集群中负责什么:网络、存储与安全卸载的边界设计 NEWS DETAIL

资讯分类 · AI 集群架构 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-30 更新时间 · 2026-07-30 来源 · NVIDIA BlueField 官方资料与 DGX 文档
BlueField-3 在 AI 集群中负责什么:网络、存储与安全卸载的边界设计
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

DPU 进入 AI 集群后,网络、存储和安全功能不再全部运行在服务器主机操作系统中。这可以建立更清晰的基础设施隔离,但也增加了一个独立计算与管理域。若项目只列出 BlueField-3 料号,没有说明哪些服务运行在主机、哪些运行在 DPU、谁负责升级与恢复,故障时很难判断问题属于业务、主机还是基础设施。

边界设计应从数据路径和控制路径两方面展开。每类流量写明入口、处理位置、策略来源、可观测点和回退路径;每项服务则明确所有者、版本、变更窗口与失效影响。DPU 不是把复杂度消除,而是把复杂度移动到可隔离、可治理的位置。

网络职责从数据路径开始划分

需要明确虚拟交换、路由、RDMA、隧道或服务链由哪一侧执行,主机看到的是物理功能、虚拟功能还是抽象接口。队列、MTU、拥塞控制和遥测也要有唯一配置来源。主机与 DPU 同时修改同一策略,会造成表面配置正确、实际路径不一致。

存储卸载必须保留一致性边界

数据面加速不能替代存储协议、权限、路径冗余和一致性设计。项目要说明 DPU 处理哪些 I/O 流程,故障时能否切换或回退,主机与存储端如何观察同一会话。检查点和训练数据属于关键资产,任何卸载方案都必须经过异常断链与恢复验证。

安全隔离要覆盖 DPU 自身

把策略从主机移到 DPU 可以减少主机管理员绕过基础设施控制的空间,但 DPU 的管理接口、镜像、凭据和升级通道也成为新的高权限边界。应实施最小权限、签名或可信镜像来源、审计和管理网络隔离,并明确紧急恢复账户的保管方式。

生命周期不能跟随主机随意变化

DPU OS、固件、驱动和主机组件存在兼容关系。主机重装、内核升级或容器平台更新前,应判断是否影响 DPU 管理与数据路径。建议维护一份组合版本矩阵,并在小规模节点池完成升级、回退和断电恢复演练后再扩大。

可观测性要打通三个视角

故障定位至少需要主机、DPU 和交换网络三侧时间一致的日志与计数器。只采集主机接口状态会遗漏 DPU 内部处理,只看交换端口又无法解释主机侧队列。统一资产标识、时间同步和事件关联,是实现可运维卸载的基础。

可执行的实施检查项

  1. 逐项标注网络、存储和安全服务的实际运行位置。
  2. 确定主机、DPU、BMC 与管理平台的访问和恢复路径。
  3. 锁定 DPU OS、固件、驱动与主机软件组合。
  4. 验证断链、重启、升级失败与策略错误下的回退。
  5. 关联主机、DPU 和交换网络的日志与设备身份。

以官方资料约束实施边界

BlueField DPU 面向网络、存储与安全基础设施处理,具体能力由硬件代际、DPU 软件和部署模式决定。

DPU 与主机、BMC 和外部管理系统之间具有独立的软件与运维边界,需要按平台文档管理。

核对具体功能、版本和部署条件时,请以NVIDIA BlueField 官方资料与 DGX 文档(1)NVIDIA BlueField 官方资料与 DGX 文档(2)的当前页面为准;公开平台方向不能替代完整料号、兼容矩阵和目标环境验证。

选型支持与实施边界

中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 BlueField-3、Spectrum 网络与服务器环境,协助梳理数据路径、控制路径、版本矩阵和异常恢复场景,使 DPU 方案从设备清单落到可运维架构。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。

使用 BlueField-3 后,主机侧就不需要网络与安全配置了吗?

不是。职责会重新划分,但主机接口、驱动、路由、应用权限和监控仍需配置。关键是确定唯一控制来源并验证主机与 DPU 的协同边界。

本文关联的产品与方案