新闻中心

NVIDIA DOCA 2.9:面向 AI 与云基础设施的软件框架能力 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 中科新远内容团队 审核人 · 中科新远技术内容组 发布时间 · 2025-01-21 更新时间 · 2026-07-22 来源 · 原页面资料;原厂信息待核验
NVIDIA DOCA 2.9:面向 AI 与云基础设施的软件框架能力

NVIDIA DOCA 2.9 面向需要利用 NVIDIA 网络硬件加速数据路径、网络可观测性、云网络隔离和设备运维能力的 AI 与云基础设施团队。该版本覆盖 Spectrum-X、BlueField DPU、SuperNIC 等相关场景中的软件框架、API、库和工具。实际可用功能取决于具体硬件型号、主机软件栈、许可证、部署拓扑及版本兼容性,项目立项前应以带日期的 NVIDIA 官方文档、完整 SKU/BOM 和验证环境结果为准。

DOCA 2.9 要解决什么问题

AI 集群和云平台通常同时面对东西向训练流量、南北向外部连接、多租户隔离、设备配置一致性及数据路径性能分析等问题。DOCA 提供用于工作负载卸载、加速和隔离的软件框架,帮助开发者调用 NVIDIA 网络平台相关能力,而不是分别维护彼此割裂的底层接口。

对于规模化环境,重点不只是单一链路带宽,还包括拥塞定位速度、配置变更范围、故障切换行为、租户边界和运维自动化。DOCA 2.9 中的网络、管理和安全组件为这些问题提供了可评估的实现路径,但并不意味着任何现有网络均可直接获得相同效果。

面向 AI 计算结构的网络与遥测能力

在东西向 AI 网络场景中,DOCA 2.9 提到对 Spectrum-X 1.2 参考架构的支持,并增强 NVIDIA 网络拥塞控制(NVNCC)、InfiniBand 拥塞控制(IBCC)及拓扑检测能力。源资料指出,IBCC 面向 InfiniBand 上的 AI 工作负载,NVNCC 则面向 Spectrum-X 并支持长距离 RoCE。参考架构中涉及 NVIDIA BlueField-3 SuperNIC、NVIDIA Spectrum-4 交换机以及 NVIDIA DGX H100、NVIDIA HGX H100 平台;是否适合特定集群,仍需核对实际互连、GPU 平台和软件版本。

DOCA 遥测库新增高频采样能力,源资料称计数器读取间隔可低于 100 微秒,并支持 RX/TX 字节、端口、拥塞通知和 PCIe 延迟等性能计数器。团队可据此规划集群级异常检测和本地性能分析,但应先测量采样频率对 CPU、存储、控制面和告警系统的影响,避免用高频数据放大运维负担。

云连接、隔离与数据服务路径

DOCA 2.9 为南北向云网络列出多项组件。DOCA Flow 包含处于 alpha 阶段的 tune 性能分析工具,可用于查看已配置的流处理流水线;其 alpha 状态意味着生产采用前应确认支持范围和稳定性。OVS-DOCA 提供本地镜像能力,并通过 DOCA Flow API 改进连接跟踪功能。源资料中的 CPS 与 PPS 提升为预期值,不能直接作为采购验收或容量规划依据。

对于裸金属多租户场景,DOCA HBN 2.4 基于 BGP EVPN,提供无控制器 VPC 网络相关增强,并提到 ECMP、OVS-DOCA 故障转移及 Overlay 网关有状态 SNAT+PAT。OVN 裸机租户隔离服务则面向 SDN 环境中的南北向隔离,可通过 API 和 Ansible 手册部署到 BlueField DPU。设计时应明确租户路由域、地址转换策略、故障域、策略回滚方式及与既有控制器的职责边界。

安全、存储与设备管理的评估重点

DOCA App Shield 增强了主机监控和威胁检测相关能力,包括预生成操作系统配置文件、Linux 容器监控和进程网络连接信息。它可作为主机与容器可见性方案的候选组件,但检测覆盖范围、告警准确性、日志留存和对现有安全平台的集成方式需要项目测试确认。

DOCA SNAP virtio-fs 处于测试版,目标是在 BlueField-3 DPU 上运行远程文件系统存储逻辑,并向主机公开本地文件系统语义。该能力不应在未经验证的关键生产数据路径中直接替代既有存储方案。设备运维方面,DOCA 管理服务(DMS)支持通过单个 API 端点管理多台 BlueField DPU 和 SuperNIC,并提供重启期间配置持久化及批量导入、导出功能;团队应验证权限模型、接口限流、配置审计和故障恢复流程。

从试点到部署的建议路径

  1. 依据业务目标划分试点范围,例如 AI 训练网络拥塞分析、多租户裸金属隔离或 DPU 集中管理,避免一次性替换全部网络栈。
  2. 建立完整兼容性清单,核对 DPU、SuperNIC、交换机、GPU 平台、主机操作系统、驱动、固件、DOCA 软件包及编排工具版本。
  3. 在接近生产的拓扑中测试拥塞、链路或节点故障、策略变更、租户逃逸风险、回滚和可观测性数据量。
  4. 为测试版或 alpha 功能设置隔离边界和退出方案,并以官方支持策略及项目验收数据决定是否进入生产。

常见问题

DOCA 2.9 是否适合所有 AI 集群?

不一定。其价值与 NVIDIA 网络硬件、网络协议、集群规模、现有软件栈和运维能力有关。使用 Spectrum-X、InfiniBand、BlueField DPU 或相关 SuperNIC 的环境可优先评估,但必须根据实际 BOM 和官方兼容性资料确认。

可以把源资料中的性能提升用于采购承诺吗?

不应直接使用。OVS-DOCA 连接跟踪的 CPS、PPS 数字在源资料中以“有望”描述,且性能受硬件、流量模型、配置及测试方法影响。采购或验收应预先定义拓扑、负载、指标、测量工具和通过条件。

结论

DOCA 2.9 将 AI 网络拥塞控制、高频遥测、云网络隔离、DPU 数据路径、主机监控和集中设备管理纳入同一软件框架。对建设 NVIDIA 网络加速型 AI 或云基础设施的团队,合理起点是围绕一个明确业务场景开展兼容性与性能试点,再依据官方文档和项目测试结果决定部署范围。

围绕“NVIDIA DOCA 2.9:面向 AI 与云基础设施的软件框架能力”继续了解 NVIDIA 产品与网络方案