
MIG 适合需要把一块受支持 GPU 划分给多个相对独立工作负载的场景,例如中小型推理、开发测试和有明确资源配额的多租户任务。它不是所有 GPU、所有实例组合或所有通信模式都通用,采购与部署前必须核对具体 GPU、驱动、编排平台和业务框架的支持范围。
隔离能力不等于任意切分
MIG 实例按支持的配置组合划分计算与显存资源,可减少工作负载之间的干扰。可选实例规格和数量由具体平台决定,不能把显存容量简单按百分比自由切割。需要先统计每个服务的峰值显存、计算占用和延迟,再映射到官方支持的实例配置。
调度与生命周期要一起设计
启用、调整或关闭 MIG 可能涉及节点排空、实例重建和设备重新发现。容器平台需要正确暴露实例资源,调度器、设备插件、监控和计费也要识别实例级状态。若业务频繁改变资源需求,固定分区带来的运维成本可能抵消共享收益。
通信密集任务要单独验证
需要高带宽跨实例通信、整卡一致性能或大显存连续空间的任务,通常不应仅因利用率较低就切分。训练、推理和开发任务混部时,要验证缓存、I/O、CPU、网络及故障恢复的共同影响,不能只检查实例能否被创建。
项目核验要点
- 核对 GPU 型号、驱动、MIG 配置和编排组件支持矩阵。
- 记录每类负载的显存峰值、计算占用和延迟波动。
- 验证实例重配、节点维护、监控告警和故障恢复流程。
- 保留整卡节点池,为不适合切分的任务提供明确路径。
合理做法是先选择资源曲线稳定、互相独立的服务开展小规模试点,再决定实例规格和节点池比例。MIG 的价值来自可控隔离和更细粒度调度,而不是保证所有业务都获得同样的性能提升。
WeChat
Profile