
AI 机房的带外管理网承担 BMC、交换机管理口、DPU、PDU、环境传感器、串口控制和恢复服务。当生产 Fabric 因配置错误、拥塞或设备故障不可用时,带外网络应仍能提供观察、隔离、重启和回退能力。如果它与生产网络共享核心路由、认证、供电或同一配置模板,所谓“带外”可能只是在 VLAN 名称上独立。
设计应从最坏故障场景反推依赖:生产叶脊不可达、某机柜断电、集中认证异常或 DNS 失败时,值班人员如何进入,能够访问哪些对象,操作如何审计。每个恢复步骤都需要最小权限和明确授权,不能为了应急把所有管理接口长期暴露。
设备清单覆盖所有基础设施对象
除服务器 BMC 外,还要列入交换设备、DPU 管理、PDU、环境监控、串口服务器、镜像仓库、日志与时间服务。记录端口速率、地址方式、认证能力和固件更新路径。按服务器数量简单乘端口,会遗漏网络与供电设备的管理需求。
网络独立性要逐项拆解
物理交换、上联路由、光纤路径、电源、DNS、NTP、认证和跳板都可能成为共同故障点。项目可按风险选择物理或逻辑隔离,但必须画出共享依赖和失效影响。VRF 或 VLAN 可以隔离路由,不会自动解决共享设备与供电问题。
跳板与身份策略约束高权限操作
管理接口应通过受控跳板或特权访问系统进入,实施多因素认证、短期凭据、角色分离和会话审计。监控只读、日常变更和紧急恢复使用不同权限。不能因管理网不可直达互联网,就默认其中所有终端可信。
恢复服务减少外部依赖
故障时可能无法访问企业主 DNS、软件仓库或云端身份服务。应确定本地时间、名称解析、镜像、配置备份和紧急身份的最低可用集合,并安全维护。离线恢复资料要定期更新和验证,避免真正使用时版本过期或凭据失效。
演练验证的是故障中的可用性
在受控窗口阻断生产网络或关键依赖,验证值班人员能从授权终端进入跳板、定位目标设备、读取日志并执行模拟回退。记录访问路径、耗时和审计证据。演练发现的共享依赖应进入整改,而不是只更新文字手册。
项目评审需要留下哪些证据
- 盘点 BMC、交换、DPU、PDU、环境和恢复服务端口。
- 标出管理网与生产网共享的路由、供电和身份依赖。
- 实施跳板、多因素认证、最小权限和会话审计。
- 准备可验证的本地恢复服务与配置备份。
- 定期在生产 Fabric 不可用条件下演练恢复路径。
把官方信息转化为项目条件
NVIDIA DGX 文档按系统提供安装、管理和维护入口,具体管理接口以目标型号文档为准。
NIST SP 800-207 强调以资源和身份为中心的访问决策,不因网络位置而默认信任。
核对具体功能、版本和部署条件时,请以NVIDIA DGX 文档与 NIST 零信任架构(1)、NVIDIA DGX 文档与 NIST 零信任架构(2)的当前页面为准;公开平台方向不能替代完整料号、兼容矩阵和目标环境验证。
方案落地与服务范围
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 AI 集群中的 Spectrum 网络、BlueField 与服务器管理需求,梳理带外设备清单、共享依赖、访问控制和恢复演练用例。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
管理网使用独立 VLAN 就算带外网络吗?
不一定。独立 VLAN 只提供部分逻辑隔离,仍需检查交换设备、路由、供电、身份和物理路径是否共享,并以故障演练验证。
WeChat
Profile