新闻中心

AI 集群稳定性测试怎么做:从短时基准到长时间压测 NEWS DETAIL

资讯分类 · 部署调优与验收 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-25 更新时间 · 2026-07-25 来源 · NVIDIA 官方文档
AI 集群稳定性测试怎么做:从短时基准到长时间压测
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

AI 集群稳定性验收不能只跑一次短时性能测试。应先建立单节点和网络基线,再逐步增加节点、消息规模和并发作业,最后使用长时间业务负载、存储读写和受控故障观察温度、错误、性能漂移与恢复能力。

分层建立可定位的基线

先检查硬件健康、GPU、PCIe、网卡和链路,再运行单节点计算与显存测试、双节点通信和多节点集合通信。每层都固定软件版本、拓扑、消息大小和持续时间。若直接从全规模失败开始排查,很难区分节点、网络或业务问题。

长时间测试关注趋势而非峰值

选择代表性训练或推理任务持续运行,记录吞吐、迭代时间、GPU 频率、温度、功耗、ECC、PCIe、RDMA、FEC、队列和系统日志。并发作业要覆盖调度和共享资源。允许短时波动,但需要为持续下降和错误增长设定停止条件。

故障与恢复是稳定性的一部分

在安全范围内模拟进程退出、节点重启、单链路或设备维护,观察作业、调度、监控和数据恢复。测试前明确影响范围和回退方式。若系统只能在无故障条件下维持性能,就不能证明它具备生产所需的可维护性。

项目核验要点

  • 测试矩阵覆盖单节点、递增多节点、并发和长时间负载。
  • 监控同时采集 GPU、PCIe、网络、存储和系统层指标。
  • 设定性能漂移、错误增长、温度和恢复时间的判定标准。
  • 每次故障注入都有范围、负责人、停止条件和恢复记录。

稳定性报告应保留原始结果、环境版本和异常时间线,并能将每项结论追溯到测试条件。峰值性能用于了解上限,长时间一致性和故障恢复才决定系统能否交付。