
一台 GPU 节点往往同时需要业务、管理、RDMA、存储、BMC、容器或服务地址,BlueField 等设备还可能引入额外控制面。若这些地址分别由表格、DHCP、装机脚本和集群平台管理,扩容时容易重复分配,重装后旧 DNS 与监控对象残留,退役时又只回收了主机管理地址。地址耗尽经常不是网段真的太小,而是生命周期没有闭环。
IPAM 设计要先定义每类网络的所有权、分配方式、DNS 语义和回收条件,再把地址绑定服务器资产、网卡/端口和集群节点身份。静态与动态分配都通过统一 API 或审批记录,装机系统不得自行猜测下一个可用地址。多轨 RDMA 的地址和 GID 需要与 rail、VLAN 和拓扑标签一致,避免节点看似可达但通信走错网络。
地址角色和路由边界分开建模
为业务、主机管理、RDMA rail、存储、BMC、DPU 与服务网段定义用途、VRF/VLAN、是否路由、DNS 和访问方。避免一个接口地址同时承担管理与训练。每类地址预留扩容、故障替换和基础服务空间。
以资产和端口作为关联对象
IPAM 记录服务器资产、BMC、PCI/网卡身份、物理端口、交换端口、rail 和集群节点,地址只是属性。硬件更换时更新关联而不是复制旧记录。接口名可能变化,不作为唯一身份。多端口设备分别登记。
申请与分配必须具备原子性
装机、DHCP、云平台和人工操作使用受控接口,先预留再确认,失败能够释放。并发扩容时不能读取“最大地址加一”。外部系统写入带幂等键,网络超时后先查询状态,避免重复创建。
DNS 与证书跟随状态转换
地址预留、装机、生产、隔离、维修和退役对应不同 DNS/反向记录与证书状态。重装期间旧节点不得继续以同一名称响应。TTL、缓存和传播时间进入切换计划,不能把数据库更新视为立即全网生效。
回收需要多系统对账
退役或替换时检查 IPAM、DHCP、DNS、NAC、监控、调度、交换和证书,确认没有活动租约与流量后再回收。定期发现无资产地址、重复 DNS、长期预留和网段高水位。删除记录前保留审计,不重写历史。
从试点到放量的检查项
- 定义业务、管理、RDMA、存储、BMC/DPU 与服务地址角色。
- 将地址关联资产、网卡/端口、交换口、rail 和节点身份。
- 通过原子预留、幂等确认和失败释放支持并发扩容。
- 联动 DNS、反向记录、证书、TTL 与节点状态。
- 退役时对账 IPAM、DHCP、DNS、监控、调度和网络。
把产品事实转成测试条件
Infoblox 官方文档提供 IP 地址管理、网络对象和相关运维功能说明。
具体能力与集成方式取决于使用版本、授权范围和企业系统,地址生命周期需按实际平台设计。
文中机制与配置边界依据Infoblox IPAM 文档的当前版本核对;官方说明用于确定候选条件,实际部署仍需结合完整料号、服务器支持清单、软件组合与现场测试。
让工程证据贯穿实施
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 GPU 节点、Spectrum/ConnectX/BlueField 网络与企业基础服务协助建立地址角色、资产映射和扩容回收验收。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
GPU 节点采用固定 IP,是否就不需要 IPAM?
仍然需要。固定地址更依赖唯一分配、资产关联、DNS、重装和回收记录,否则扩容与替换容易重复或留下残留。
WeChat
Profile