
选择 GPU 时,不应先从某个型号或单一峰值算力开始。更可靠的顺序是先明确工作负载,再核算显存占用和数据移动,最后把互连、功耗与服务器条件放进同一张约束表。训练、在线推理、离线推理、可视化和边缘任务的瓶颈不同,同一个型号在不同负载下可能得到完全不同的利用率。
先把业务负载转成可测量条件
训练任务需要记录模型参数量、训练精度、批量大小、优化器状态、激活值和是否采用并行策略;推理任务还要加入上下文长度、KV Cache、并发数、首字延迟和吞吐目标。图形与渲染任务则应确认软件认证、帧缓冲需求和远程会话数量。只有这些输入明确后,显存容量才有可计算的意义。
建议先在代表性模型上采集峰值显存、稳定阶段显存和主机到 GPU 的数据量,并为框架缓存、碎片和业务增长保留余量。不能只用模型文件大小推算显存,也不能把一次短测试的空闲量当成长期安全余量。
容量、带宽和互连解决的是不同问题
- 显存容量决定单卡能否容纳模型、缓存和批数据,容量不足通常需要切分模型或降低并发。
- 显存带宽影响数据在 GPU 内部移动的效率,内存受限任务不能只比较计算单元数量。
- GPU 间互连影响多卡通信路径;只有在软件和任务确实产生大量跨卡通信时,互连能力才会转化为收益。
- 网络互连决定跨节点扩展边界,多机训练还要同时检查网卡、PCIe 拓扑、RDMA 与交换网络。
最后回到整机条件
GPU 不能脱离服务器单独采购。必须确认插槽代际和通道宽度、双宽或多宽空间、供电接口、持续功耗、风道、机房电力、CPU 与 NUMA 位置、驱动和整机厂商支持范围。标称可安装不等于能够在目标负载下持续运行。
最终选型表应至少包含工作负载基线、目标性能、显存峰值、精度、并发、单机 GPU 数量、跨节点规模、功耗上限和软件版本。先用小规模 PoC 验证瓶颈,再确定批量配置,比直接选择最高等级型号更容易控制风险。
WeChat
Profile