新闻中心

从数据中心到 AI 工厂:评估 GPU 驱动基础设施的路径 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 中科新远内容团队 审核人 · 中科新远技术内容组 发布时间 · 2025-01-16 更新时间 · 2026-07-22 来源 · 原页面资料;原厂信息待核验
从数据中心到 AI 工厂:评估 GPU 驱动基础设施的路径

将传统数据中心转向面向 AI 工作负载的“AI 工厂”,核心不是单独增加 GPU,而是围绕训练与推理需求协同评估计算、互连、供电和冷却能力。根据 2025 年 1 月发布的原始资料,NVIDIA 首席数据中心杰出工程师 Wade Vinson 在 DC Anti-Conference Live 演示中,分享了 NVIDIA 自 2016 年以来设计、构建和运营 NVIDIA DGX SuperPOD 多兆瓦级数据中心所积累的经验。对于规划 AI 基础设施的团队,这一方向意味着数据中心设计需要从通用资源承载,转向持续供给大规模 AI 工作流的系统工程。

AI 工厂要解决什么问题

传统以 CPU 为主的数据中心可服务多类企业应用,但大模型训练、推理及其他密集型并行计算任务,对计算密度、节点间数据交换和基础设施配套提出了不同要求。原始资料将数据中心向 AI 数据中心的演进归因于 AI 工作流不断增长的计算需求。

所谓 AI 工厂,可理解为将计算资源、网络互连、电力与冷却作为整体来规划,使其能够支持 AI 任务的运行与扩展。这个概念不等同于某一台设备或单一软件平台;项目成效取决于工作负载规模、模型类型、数据流向、部署地点以及既有设施条件。

GPU 在架构中的作用

资料指出,GPU 自 2012 年进入数据中心后,为并行处理提供了基础,并缩短了密集型任务的处理时间。原文还引用了相较传统 CPU 系统“每瓦性能提高 30 倍、每美元性能提高 60 倍”的表述。这些数字应视为原始演示中的背景性主张,而非所有配置、模型或业务场景均可复现的采购指标。

因此,评估 GPU 平台时,不宜只比较芯片数量或理论算力。团队还应确认目标训练与推理任务的精度要求、显存需求、批处理方式、数据预处理位置和任务调度方式,并以本项目的代表性工作负载进行测试。

需要协同规划的基础设施能力

  • 计算:根据训练、推理或混合负载确定 GPU、CPU 及节点规模,而不是以通用服务器扩容方式直接推算。
  • 互连:原始资料将互连列为平台创新重点之一。多节点任务的网络拓扑、带宽和通信特征需要与软件框架及实际任务共同验证。
  • 供电与冷却:资料强调每瓦性能,并将电源和冷却纳入 AI 工厂平台。多兆瓦级部署尤其需要审查机房电力容量、散热路径和设施改造条件。
  • 运营扩展:资料提出可扩展至不同规模和地点的目标。实际项目应分别核验站点条件、运维流程、资源调度及扩容阶段的限制。

能效主张如何用于决策

原始资料称,大型语言模型训练和推理的能效已有提升,并以“曾需 40 吉瓦时、现需 3 吉瓦时”作为示例;同时提到典型 ChatGPT 查询“每小时仅消耗 0.4 瓦”。这些表述缺少模型版本、硬件配置、负载边界、计量方法和比较基线,不能直接用于估算某个项目的电费、碳排放或容量需求。

更可执行的做法是建立本地测量口径:分别记录训练与推理的任务吞吐、完成时间、节点功耗、网络利用率及冷却相关能耗,再按业务峰值和增长假设进行容量规划。涉及具体产品规格、兼容性、功耗或部署要求时,应查阅带日期的官方产品文档、完整 SKU/BOM,并完成项目测试。

实施前的评估路径

  1. 梳理目标 AI 工作负载,区分训练、推理和数据处理,并定义可测量的完成条件。
  2. 以代表性数据集和模型开展试点,观察计算、网络和存储链路是否形成瓶颈。
  3. 核对机柜、供电、冷却和网络改造条件,避免仅按服务器规格作出部署判断。
  4. 形成完整 SKU/BOM 后,逐项验证硬件、软件、互连与设施配置的兼容性。
  5. 将试点结果与扩容计划关联,重新评估规模扩大后的功耗、散热和运维要求。

常见问题

AI 工厂是否只适合超大规模数据中心?

原始资料讨论了 NVIDIA DGX SuperPOD 多兆瓦级数据中心的经验,也提及扩展到不同规模和地点的目标,但并未给出适用规模门槛。是否适合应取决于组织的 AI 工作负载、现有设施和扩展计划,并通过试点评估。

可以用原文中的性能和能效数字直接选择方案吗?

不可以。原文中的性能倍数和能耗示例没有提供完整测试条件,不能替代具体项目的测试、官方规格核验或完整 BOM 审查。采购与设计决策应基于相同工作负载下的实测数据。

结论

AI 工厂的价值在于将 GPU 计算、互连、供电和冷却放在同一架构中评估,以适应增长中的 AI 工作负载。原始资料提供了 NVIDIA 多兆瓦级数据中心实践的方向性背景,但具体配置、性能、能耗与部署可行性仍须以带日期的官方文档、完整 SKU/BOM 和项目测试为准。

围绕“从数据中心到 AI 工厂:评估 GPU 驱动基础设施的路径”继续了解 NVIDIA 产品与网络方案