新闻中心

vGPU 与 MIG 怎么选:虚拟化交付和硬件切分不是一回事 NEWS DETAIL

资讯分类 · NVIDIA 计算平台 作者 · 中科新远技术编辑部 审核人 · 中科新远 发布时间 · 2026-07-25 更新时间 · 2026-07-25 来源 · NVIDIA 官方文档
vGPU 与 MIG 怎么选:虚拟化交付和硬件切分不是一回事
场景示意图,不对应具体设备型号、端口布局或技术拓扑。

需要把 GPU 能力交付给虚拟机并纳入虚拟化平台生命周期时,重点评估 vGPU;需要在支持 MIG 的 GPU 上获得固定计算与显存实例边界时,重点评估 MIG。两者解决的问题层次不同,不能只按“能否多人共享”做替换判断,也不能假设所有型号、配置和软件都支持同样组合。

适用条件与判断边界

vGPU 更贴近 VDI、虚拟工作站或虚拟机内 AI 负载,依赖虚拟化平台、来宾系统、主机驱动与许可配置。MIG 更贴近容器或裸机平台中的实例切分,依赖具体 GPU、驱动、运行时和调度器支持。若业务需要跨实例高速通信、动态占满整卡或频繁改变切分,必须提前验证重配置对任务和运维窗口的影响。

实施与选型方法

先列出租户单元是虚拟机、容器还是进程,再明确显存下限、故障隔离、性能抖动容忍度、镜像管理、迁移需求和监控粒度。建立候选资源模型后,用代表性负载测试实例创建、分配、回收、节点重启和驱动升级。对于同时使用虚拟化与 MIG 的设计,还要逐项核对官方支持矩阵,避免把各自可用误认为组合后必然可用。

主要风险与控制方式

主要风险包括配置档位与实际负载不匹配、资源碎片、调度器看不到正确实例、监控归属混乱,以及升级后主机与来宾组件失配。共享方案还需要明确数据清理、访问控制和故障影响边界。不能依据理论分片数量推导并发能力,实际结果受模型、显存访问、编解码和运行时影响。

如何核验结果

  1. 在目标平台枚举可用配置,确认每个租户看到的设备、显存和监控指标与设计一致。
  2. 并行运行轻重不同的代表性任务,记录尾延迟、吞吐、错误和资源回收后的残留状态。
  3. 执行主机升级、实例重建和节点故障演练,验证调度、告警、配额和回退流程。

下一步行动

先选两类差异明显的租户完成小规模对照验证,再决定资源档位和池化方式。方案文档应写明支持范围、不可混用的配置、重切分窗口与容量核算规则,后续版本变化必须重新复核。

核对具体版本与功能边界时,可查看NVIDIA vGPU 文档NVIDIA MIG 用户指南,并以目标版本页面为准。