
DGX OS 更新不是普通 Linux 包升级。系统镜像内的内核、GPU 驱动、Fabric Manager、容器运行时、网络/RDMA 组件、固件工具和监控依赖共同决定节点能否运行目标训练与推理栈。仅验证系统启动和 nvidia-smi 输出,会遗漏 NVSwitch、多 GPU 通信、容器挂载、存储和调度准入问题。
平台应把官方版本与发行信息映射为节点池组合:硬件平台、DGX OS、内核、驱动、CUDA 容器、NCCL、网络驱动和业务镜像均有明确状态。新版本先进入隔离试点,完成安装、功能、性能、故障和回退后再逐池升级。旧节点池保留到业务验证完成,不能让同一分布式作业跨未经批准的混合组合。
官方版本映射为内部组合
记录 DGX 平台、OS 分支、内核、驱动、Fabric Manager、容器运行时、网络组件和镜像摘要,附官方依据与内部验证状态。支持信息更新时新增评审记录,不改写历史组合。任何关键组件偏离都应被资产发现。
试点覆盖裸机与容器两层
验证 GPU/NVSwitch、存储、网络、时间、日志和监控,再运行目标容器的设备发现、CUDA、NCCL、模型与数据路径。镜像内库与宿主驱动的兼容单独核对。不能用一个示例容器替代全部业务后端。
升级顺序按节点池和作业边界
先排空节点,保存健康与版本证据,完成升级后通过准入再开放。分布式作业固定在同一批准组合,避免混合驱动或通信库。共享文件系统、调度和监控升级依赖提前处理,并为容量保留故障余量。
故障演练证明平台可恢复
演练节点重启、Fabric Manager 异常、容器运行时重启、网络驱动问题和作业恢复,保存诊断与恢复时间。观察长时间训练和推理尾延迟,性能只对记录的硬件与负载成立。升级后错误计数基线重新建立。
回退包括系统与业务制品
保留旧系统镜像、配置、驱动/固件前置条件和业务镜像摘要,试点中执行一次真实回退。若数据或配置格式已迁移,明确还原顺序。无法原地降级时准备重装和节点池切换,不把未验证的回退写入维护计划。回退完成后同样运行节点准入,避免系统版本恢复而监控、调度或网络状态仍停留在新组合。
实施前的验证序列
- 维护 DGX 平台、OS、内核、驱动、网络和容器组合矩阵。
- 在裸机与目标业务容器分别验证 GPU、网络、存储和监控。
- 按节点池排空、升级、准入并限制作业跨组合。
- 演练重启、Fabric Manager、容器和网络故障恢复。
- 保留旧镜像与配置并执行系统和业务完整回退。
适用版本与技术边界
NVIDIA DGX OS 文档提供安装、升级、软件组件和版本相关说明。
具体支持平台、升级路径与组件组合应以目标 DGX OS 版本和 NVIDIA 当前文档为准。
文中机制与配置边界依据NVIDIA DGX OS 文档的当前版本核对;官方说明用于确定候选条件,实际部署仍需结合完整料号、服务器支持清单、软件组合与现场测试。
项目实施中的能力边界
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 GPU 节点与 NVIDIA Networking 基础设施协助整理节点池组合、通信回归和分批准入,具体平台支持以当前资料为准。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
DGX OS 升级后所有 GPU 可见,是否可以直接开放训练调度?
不可以。还要验证 NVSwitch/Fabric Manager、容器兼容、NCCL、网络、存储、监控、长稳和回退,并通过节点准入。
WeChat
Profile