
采购清单中分别出现“支持 GPUDirect 的 GPU”和“支持 RDMA 的网卡”,仍不能推出整台服务器能够建立目标数据路径。主板可能把设备放在不同 CPU 根复杂下,固件或 BIOS 可能改变 IOMMU 行为,网卡形态也可能限制实际可用插槽。服务器厂商的正式支持组合、NVIDIA 软件要求和现场配置必须同时成立。
因此,GPUDirect RDMA 选型不是把两个兼容产品拼在一起,而是确定一个可复现的平台配置。BOM 中要记录 GPU、网卡完整料号、服务器型号、插槽位置、CPU 配置、系统软件和线缆网络,再用目标工作负载验证。
主板拓扑决定设备能否走预期路径
服务器插槽可能经过不同 PCIe 交换层级或分别连接多颗 CPU。跨根复杂访问会改变数据路径和性能特征,部分平台还可能受 ACS、IOMMU 或虚拟化设置影响。应在采购前取得主板拓扑、厂商推荐安装位和完整支持清单,并把插槽位置写进交付配置。
网卡不能只按端口速率选择
ConnectX 不同代际、端口数、PCIe 代际和卡型会影响服务器适配。PCIe 插卡与 OCP 3.0 形态使用不同机械和管理接口,不能互相替代。还要核对挡板、功耗、散热、固件分支和操作系统支持,确保选中的完整料号与服务器配置对应。
软件组合要锁定版本和安装来源
GPU 驱动、CUDA 组件、网卡驱动、固件、内核模块和通信库之间存在版本边界。测试机临时安装成功,不代表企业镜像或离线源能稳定复现。应明确软件由操作系统仓库、NVIDIA 包还是平台镜像提供,并保存版本、校验值与回退步骤。
虚拟化和容器会增加一层边界
直通、虚拟功能、容器设备映射和安全策略可能改变应用看到的设备与权限。若生产环境使用 Kubernetes、虚拟机或多租户调度,验证必须在同等隔离方式下完成。宿主机裸机测试只能证明基础能力,不能替代生产运行形态。
用对照实验确认直接路径
验收应保存系统拓扑和模块状态,并比较目标路径与明确回退路径下的通信行为。测试覆盖不同消息尺寸、持续负载和多进程并发,同时观察 CPU 占用、链路状态和错误日志。结论只能绑定当前服务器、插槽、版本与网络配置,不能外推到同系列其他机型。
交付与验收的关键动作
- 锁定服务器、CPU、GPU、ConnectX 完整料号与安装位置。
- 取得服务器厂商支持清单和主板 PCIe 拓扑。
- 固定驱动、固件、内核、CUDA 与通信库来源和版本。
- 在生产同等容器或虚拟化方式下验证设备权限。
- 保存直接路径、回退路径和持续压力测试证据。
产品事实与项目结论要分开
GPUDirect RDMA 的成立条件涉及 GPU 内存与第三方 PCIe 设备的直接数据交换。
平台支持与配置边界应以当前 NVIDIA 文档和服务器厂商支持信息为准。
核对具体功能、版本和部署条件时,请以NVIDIA GPUDirect RDMA 官方文档的当前页面为准;公开平台方向不能替代完整料号、兼容矩阵和目标环境验证。
规划、验证与项目支持
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可围绕 ConnectX 网卡、GPU 服务器和 RDMA 网络协助核对完整料号、主板拓扑、软件组合和实机验收;产品页面用于确定候选范围,最终配置仍以服务器支持清单和项目验证为准。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
同一款 ConnectX 网卡换到另一款服务器还能沿用验证结果吗?
不能直接沿用。服务器主板拓扑、BIOS、插槽供电散热和厂商支持范围都可能不同,应重新核对安装组合并完成路径与业务测试。
WeChat
Profile