新闻中心

NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 训练表现解读 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 中科新远内容团队 审核人 · 中科新远技术内容组 发布时间 · 2025-01-22 更新时间 · 2026-07-22 来源 · 原页面资料;原厂信息待核验
NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 训练表现解读

对于评估大模型训练基础设施的团队,NVIDIA Blackwell 在 MLPerf Training v4.1 提交中展示了较高的每 GPU 训练性能:相较于基于 Hopper 的提交,GPT-3 预训练每 GPU 性能提高 2 倍,Llama 2 70B 的 LoRA 微调提高 2.2 倍。该结果适合用作平台选型和测试设计的参考,但不应直接等同于任何自建集群、模型或业务数据集上的实际训练时长。

Blackwell 回应的训练扩展问题

随着模型参数规模和训练数据量增长,训练系统不仅需要更高的计算吞吐量,也需要处理显存容量、内存带宽以及多 GPU 间通信效率的约束。资料显示,NVIDIA Blackwell 平台整合 GPU、CPU、DPU、NVLink Switch 芯片、InfiniBand Switch 和 Ethernet Switch 等组件,目标是支持更大规模的 AI 集群与下一代 LLM 开发。

本轮 MLPerf Training v4.1 中,NVIDIA 提交的 Blackwell 系统均配置 8 个 Blackwell GPU,运行时 TDP 为 1,000W,并采用第五代 NVLink 和 NVLink Switch 互连;节点之间使用 NVIDIA ConnectX-7 SuperNIC 与 NVIDIA Quantum-2 InfiniBand 交换机连接。这说明性能结果对应的是包含 GPU、节点内互连和网络连接在内的系统配置,而非单独 GPU 的孤立表现。

MLPerf Training v4.1 中的已提交结果

资料列出的性能提升均按每 GPU 标准化,并以最新 H100 性能为比较基础。LLM 工作负载的提升最受关注:GPT-3 预训练为 2.0 倍,Llama 2 70B LoRA 微调为 2.2 倍。其他已提交基准还包括图神经网络 2.0 倍、文本转图像 1.7 倍、推荐系统和物体检测各 1.6 倍、自然语言处理 1.4 倍。

MLPerf Training 工作负载Blackwell 每 GPU 性能提升
LLM LoRA 微调2.2 倍
LLM 预训练2.0 倍
图神经网络2.0 倍
文本转图像1.7 倍
推荐系统、物体检测各 1.6 倍
自然语言处理1.4 倍

对于 GPT-3 175B 基准,资料称 HGX B200 可使用 64 个 GPU 运行该测试且不影响每 GPU 性能;要获得 HGX H100 的最佳每 GPU 性能,则对应 256 GPU、32 台 HGX H100 服务器的提交规模。这一差异表明,显存容量和带宽可能影响可采用的并行映射与集群规模,但不能据此推导其他模型的最小 GPU 数量。

性能提升依赖的软件与系统条件

资料将结果归因于硬件与软件协同优化,包括面向 Tensor Core 的 GEMM、卷积和多头注意力内核,更高效的计算与通信重叠,以及对内存带宽利用率和并行映射的改进。所列软件组件涉及 cuBLAS、cuDNN、cuDNN Runtime Fusion Engines 与 NVIDIA Transformer Engine。

因此,采购或迁移评估不宜只比较 GPU 型号。团队应确认目标训练框架、模型结构、精度策略、注意力实现、通信库和软件版本能否使用相应优化;同时检查 NVLink、网络拓扑和节点配置是否与计划部署相匹配。资料还提及 GB200 NVL72、ConnectX-8 SuperNIC 与 Quantum-X800,但仅说明其预期具备更高每 GPU 性能和扩展能力,未提供可用于项目承诺的实际测试数据。

适合哪些评估与部署场景

Blackwell 的提交结果可优先作为以下场景的评估起点:

  • 需要进行 GPT-3 类大模型预训练,并希望比较每 GPU 性能与集群规模取舍的团队。
  • 基于预训练 LLM 进行领域定制,采用 Llama 2 70B LoRA 等参数高效微调方法的团队。
  • 同时运行图神经网络、文本转图像、推荐、检测或自然语言处理训练任务,需要横向比较已提交基准覆盖范围的团队。

建议按实际项目建立验证路径:先取得带日期的 NVIDIA 官方产品文档与完整 SKU/BOM,确认 GPU、服务器、互连、网卡和交换机配置;再以代表性模型、数据规模、批量设置和训练目标开展试点;最后测量端到端训练时间、扩展效率、显存余量、网络行为和运行时功耗。MLPerf 的规范化结果不能替代上述项目测试,也不能单独证明成本、供货、兼容性或部署周期。

常见问题

MLPerf Training v4.1 的 2 倍和 2.2 倍是否代表所有 LLM 都会获得同等提升?

不是。这些数字分别对应 GPT-3 预训练和 Llama 2 70B LoRA 微调的特定 MLPerf 提交与比较条件。实际结果会受模型架构、上下文长度、训练精度、并行策略、数据管道、软件版本和集群网络影响,应以项目测试确认。

能否只更换 GPU,而保留原有服务器和网络架构?

不能仅根据本资料作出判断。提交结果使用了第五代 NVLink、NVLink Switch、ConnectX-7 SuperNIC 和 Quantum-2 InfiniBand 等系统组件。应依据带日期的官方兼容性文档、完整 BOM 及现有机房条件,核对服务器、电力散热、互连和网络设计。

结论

MLPerf Training v4.1 提交显示,NVIDIA Blackwell 在所列 LLM 预训练和 LoRA 微调基准中相对 Hopper 提供了更高的每 GPU 性能,并体现出计算、显存与互连协同的重要性。将这些结果用于初步技术筛选是合理的;进入采购或部署决策前,仍需用完整配置资料和面向自身工作负载的测试验证。

围绕“NVIDIA Blackwell 在 MLPerf Training v4.1 的 LLM 训练表现解读”继续了解 NVIDIA 产品与网络方案