新闻中心

NVIDIA Dynamo 推出 Shadow Engine 恢复:LLM 推理故障实现秒级恢复 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 超级管理员 审核人 · 内容审核团队 发布时间 · 2026-08-26 更新时间 · 2026-08-26 来源 · 本站

在 LLM 推理生产中,引擎进程崩溃、可恢复的 CUDA 错误与瞬时集合通信故障并不罕见。传统恢复方式依赖冷启动:从存储重新加载权重到显存、编译内核并捕获 CUDA 图,对大规模模型而言往往要数分钟,期间幸存的实例必须独自扛下全部流量,服务质量明显劣化。

NVIDIA 在 Dynamo 中推出的 Shadow Engine Recovery(影子引擎恢复,预览功能)把绝大部分恢复工作移出了服务路径。它让一个完全初始化好的影子引擎与主引擎同卡常驻、保持空闲;GPU 内存服务(GMS)让两个引擎共享同一份权重,无需在显存中再复制一份。一旦主引擎进程故障,影子引擎可在数秒内接管服务,重新初始化则在后台完成,完全不影响在线流量。

冷启动之所以缓慢,根源有二:一是权重与引擎进程绑定,进程退出后驱动会释放包括已驻留显存的权重在内的全部资源;二是 NCCL、torch.distributed 通信器与 CUDA 图等初始化状态无法跨进程继承,只能每次重建。Shadow Engine Recovery 的解法是:基于 CUDA 虚拟内存管理 API 的 GMS 作为每 GPU 的旁路服务独立持有物理显存,使权重生命周期脱离进程、跨故障持久留存,vLLM、SGLang 与 TensorRT-LLM 均只需在启动时打开一个开关即可接入;影子引擎则在故障发生前完成全部不可转移的初始化,静默驻留时只保留 CUDA 上下文、通信器与权重映射,不占独立权重副本、也不物化 KV 缓存,旁路成本极小。

实测数据印证了这套方案的价值。NVIDIA 在双 worker 的 GLM-5.2(NVFP4 量化、B200 节点、TP=8、200K 上下文)部署中故意终止一个 worker:基线冷重启需要 283 秒才能让第二个 worker 恢复服务,而影子引擎方案仅需 7.3 秒(1.7 秒故障检测 + 5.6 秒角色切换),快了近 39 倍。故障后首 token 时延(TTFT)中位数从 23,815 毫秒降至 1,311 毫秒,每用户解码速率从 12 token/秒升至 46 token/秒;399 个请求中出现首 token 等待超 5 秒或解码速率低于 20 token/秒的请求数从 200 余个降至 0 至 1 个,基本消除了服务等级协议(SLA)违约风险。

目前该功能为预览版:主要支持 vLLM 后端,要求 Kubernetes 1.34 及以上并启用 Dynamic Resource Allocation(DRA)与 NVIDIA GPU DRA 驱动;硬件、节点或多节点故障仍走标准重调度流程。接管后的影子引擎从空 KV 缓存开始服务,切换瞬间首 token 延迟会略有抬升,缓存状态跨切换继承是正在推进的方向。该功能可与 Dynamo Snapshot 组合使用,未来数月将逐步扩大支持范围,相关部署示例与讨论可见 ai-dynamo/dynamo 开源仓库。