新闻中心

ConnectX Socket Direct 双 PCIe 设计怎么选:带宽与 NUMA 必须一起看 NEWS DETAIL

资讯分类 · NVIDIA 网络互连 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-31 更新时间 · 2026-07-31 来源 · NVIDIA ConnectX 官方文档
ConnectX Socket Direct 双 PCIe 设计怎么选:带宽与 NUMA 必须一起看
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

Socket Direct 通过两个主机 PCIe 连接把适配器资源更贴近双路服务器的不同 CPU 域,目标是减少跨处理器访问并改善可用主机带宽。但它不是把一张普通网卡插两次这么简单:服务器要提供匹配的布线和插槽,固件与驱动要正确枚举,端口、队列和中断还要分配到对应 NUMA 节点。

选型应从应用流量归属反推。若两个 CPU 域都有本地 GPU 或存储流量,双连接可能帮助缩短路径;若所有工作负载集中在一侧,额外复杂度未必带来收益。BOM 必须锁定网卡完整料号、主机连接组件、服务器型号和安装位置,并通过实际拓扑与双向负载验收。

先确认服务器是否原生支持该形态

主板需要提供正确的两个 PCIe 连接路径、机械空间、供电和厂商认可的连接组件。不能依靠转接或根据插槽数量推断兼容。采购前应取得服务器厂商支持清单与安装指南,并核对 BIOS 版本和插槽占用对 GPU、存储卡的影响。

设备枚举要映射到两个 CPU 域

安装后记录 PCI 地址、NUMA 节点、端口、功能和中断亲和。若两个连接都落在同一 CPU 根复杂,设计目标可能没有实现。容器与虚拟化环境还要确认设备功能如何暴露,避免调度器只看到逻辑端口却不知道其主机路径。

亲和策略需要与调度系统联动

应用进程、GPU、内存、网卡队列和中断应尽量位于同一 NUMA 侧。双路服务器上的作业调度要识别这一资源组合,不能随机分配 GPU 后再靠网络参数补救。更换插槽或升级固件后重新生成拓扑标签,防止静态绑核脚本失效。

端口速率不等于主机侧有效带宽

网络端口、PCIe 代际与宽度、CPU 内存带宽和应用包大小共同限制吞吐。测试要分别覆盖单端口、双端口、单 CPU 域和跨域流量,并观察 PCIe 重放、CPU 利用率和内存带宽。只跑一个大包 RDMA 峰值无法说明混合业务。

故障与维护复杂度要计入选型

双连接增加了线缆、固件、枚举和诊断对象。验收应模拟一侧主机连接异常、端口降速和驱动重载,确认告警能指向真实路径,业务回退符合设计。备件必须匹配完整形态,不能用外观相近的普通适配器直接替换。

实施前需要形成的证据

  1. 取得服务器对目标完整料号和双连接组件的正式支持信息。
  2. 记录两条 PCIe 路径与 CPU、GPU、端口的枚举关系。
  3. 测试单端口、双端口、本地 NUMA 与跨域四类负载。
  4. 让调度、绑核、内存和中断策略使用同一拓扑数据。
  5. 演练单侧连接异常并保存可复现的故障证据。

官方资料如何约束本次判断

ConnectX 硬件文档按具体适配器形态说明接口、主机连接和环境要求。

Socket Direct 的适用条件需要结合完整料号、服务器支持清单和目标软件栈确认。

具体功能、版本、兼容与部署条件请以NVIDIA ConnectX 官方文档的当前页面为准。官方系列信息用于建立候选范围,不能替代完整料号、目标平台支持清单和现场验证。

从技术判断落到项目实施

中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可围绕 ConnectX 完整料号、双路 GPU 服务器与 NUMA 拓扑协助核对主机连接、BOM、安装位置和端到端性能证据。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。

Socket Direct 是否一定比普通双端口 ConnectX 更快?

不一定。它主要解决特定双路拓扑下的主机路径问题,收益取决于服务器支持、PCIe 布局和业务流量归属。没有正确亲和或流量集中在一侧时,复杂度可能大于收益。

与本文场景相关的产品入口