
TensorRT Weight Streaming 可以用于在显存受限时调整权重驻留策略,但上线判断不能只看模型能否加载。真正需要同时成立的是:设定的显存预算能覆盖运行期峰值,冷缓存首请求可被业务接受,热缓存下的延迟分位数保持稳定,且主机到 GPU 的数据路径没有成为新的共享瓶颈。若高并发下频繁替换已驻留权重,容量收益可能直接转化为尾延迟恶化。
先把它当作容量与时延的联合决策
权重流式的价值通常来自降低全部权重同时常驻显存的要求,使同一张 GPU 能容纳更大的模型或为激活、KV 缓存和并发工作区留出空间。但它不等于免费扩容:未常驻部分需要在推理过程中按需取得,数据传输、调度和缓存状态都会进入请求关键路径。因此,适合的前提是显存确实是主要约束,访问模式相对可预测,并且业务能够区分首次访问和稳定命中后的服务目标。
不要仅以单请求平均延迟决定是否启用。在线交互、严格实时控制或请求内容高度离散的场景,首请求和低命中率更关键;离线批处理、可预热的固定模型服务或有明确排队缓冲的任务,则更有机会从显存预算中获益。
显存预算要给运行期而非权重名义大小
预算应从设备可用显存倒推,而不是以模型文件大小直接设定。至少预留引擎执行所需的激活与工作空间、上下文和运行时开销、输入输出缓冲、并发请求带来的峰值,以及业务侧可能使用的 KV 缓存。再将剩余部分定义为可用于权重驻留的额度,并在目标并发下测量是否仍有稳定余量。
同一模型在不同 batch、序列长度、profile 和并发形态下的内存曲线可能不同。部署前应固定代表性输入集合,分别测量空闲、预热后和峰值负载时的显存使用;一旦预算只在单请求下成立,就不应据此扩大实例密度。TensorRT 的构建、部署接口与版本说明应以对应版本的TensorRT Developer Documentation为准,硬件、驱动和运行时组合也应在现场复核。
冷缓存和热缓存要拆成两套服务目标
冷缓存测试模拟进程刚启动、模型刚切换、GPU 刚被回收或请求分布突然变化后的状态。记录从请求到达开始的端到端时间,并单独观察等待、主机到设备传输和 GPU 执行是否同步上升。热缓存测试则应在达到稳定命中后持续运行,确认平均值之外的 P95、P99 和超时比例没有随运行时间漂移。
首请求慢不一定意味着方案不可用,但必须有产品层面的承接方式,例如预热、灰度路由或将少量实例保持在热态。把冷启动数据混入常态平均值,会掩盖用户真正感知到的抖动;反过来,只有一次冷启动测试也无法代表高并发下的缓存竞争。
PCIe 与 NVLink 路径决定实际代价
流式权重的供给路径需要逐段确认:权重位于哪个主机内存区域,服务进程与目标 GPU 的 NUMA 关系如何,GPU 之间是否需要交换数据,以及链路是否会与其他任务争用。PCIe 和 NVLink 的可用性、拓扑及实际带宽受具体平台影响,不能用其他机器的结果替代现场测量。即使链路条件良好,CPU 内存压力、I/O 抖动或多个实例同时拉取数据也可能放大请求延迟。
压测应刻意制造不利路径,包括跨 NUMA 访问、多个实例同步冷启动和热点请求突然迁移。若路径差异显著,应优先通过实例绑定、请求亲和和预热降低跨域访问,而不是仅继续压低显存预算。
上线按阶段推进并保留对照组
- 建立不使用流式策略的基线,固定模型、输入分布、并发阶梯和采样窗口。
- 选择保守显存预算,在单实例下分别采集冷缓存与热缓存数据,确认功能、输出一致性和显存余量。
- 逐步增加并发和实例数,同时注入请求分布变化,观察缓存命中变化与尾延迟是否同步恶化。
- 小流量灰度时保留基线实例作为对照,并把预算、预热状态和路由策略纳入可观测配置。
安装、构建和基础运行流程可结合TensorRT Quick Start Guide核对;具体能力是否可用、参数语义和限制必须按当前 TensorRT 版本与现场软件栈验证。
验证指标应能解释容量收益是否真实
至少同时看每实例可承载的模型或并发量、显存高水位、冷缓存首请求延迟、热缓存 P50/P95/P99、请求排队时间、错误和超时比例,以及主机到 GPU 路径的利用与等待情况。容量增加而 P99 上升,不能简单视为成功;需要确认增加的排队、传输或缓存失配是否已经突破业务目标。
尤其要在高并发和热点轮换下观察抖动。此时不同请求争夺有限驻留空间,反复换入换出可能使稳定热缓存退化。若尾延迟对缓存状态高度敏感,权重流式不适合作为主要在线扩容手段,应改用更高的常驻预算、更多隔离实例或维持基线部署。
回退必须是可操作的运行开关
回退路径应在灰度前验证:能够将流量切回基线实例,或恢复到经过验证的较高权重驻留预算,并保留当前引擎、配置和观测标签以便比对。触发条件宜围绕冷请求超时、P99 持续超过服务目标、显存余量不足、传输等待异常及错误率上升设定。回退后继续保留一小段对照观测,避免把短暂的流量变化误判为策略恢复效果。
WeChat
Profile