
按每秒请求数限制大模型推理,默认假设所有请求成本相近。现实中,输入上下文、最大输出、实际生成长度、并行采样和工具调用会让同一个请求消耗完全不同的 GPU 时间与 KV Cache。少数超长会话就能占满批处理槽位,让大量短请求的首 Token 和尾延迟同时恶化,而网关仍认为请求率没有超过上限。
更合理的准入模型要估算 Token 成本并区分两个阶段:prefill 主要消耗输入计算,decode 长时间占用序列和缓存。进入队列前依据租户配额、当前缓存水位、运行中 Token 与最大生成预算判断是否接受、排队或拒绝;运行中还要处理客户端取消和实际长度超过估计的情况。策略必须对用户提供稳定错误语义,而不能等 GPU OOM 后才重启服务。
成本模型至少分输入和输出
记录 input tokens、请求最大输出、实际输出、批中等待和 KV Cache 占用,按模型版本建立分位数。最大输出是风险上界,实际输出决定平均消费,两者都要进入准入。多模态输入和并行采样单独建模,不能简单折算成普通文本请求。
队列要按服务等级隔离
交互式、批量、内部任务和不同租户使用独立预算或加权队列,保留关键业务的执行机会。只做总量限流会让一个大租户占满全局缓存。队列等待超过业务时限时尽早拒绝,避免请求排队到客户端超时后仍消耗后端资源。
运行中水位触发渐进降载
监控可用 KV Cache、运行序列、等待 Token、首 Token 和每 Token 延迟,在安全水位前减少新长请求、降低批任务份额或暂停低优先级。降载动作逐级执行并设置恢复滞后,避免水位边缘频繁开关。不要通过虚构固定容量承诺替代实测。
取消必须传递到执行后端
客户端断开或网关超时后,路由、调度和模型后端都应停止后续生成并释放缓存。验证取消信号在网络异常和代理重试下不会丢失,也不会误杀同一连接的其他请求。统计无客户端消费的 Token,作为资源泄漏指标。
用突发和长尾验证过载恢复
回放真实长度分布,加入超长输入、慢客户端、取消、租户突发和模型切换,观察拒绝比例、排队、首 Token、P99、缓存水位与恢复时间。过载结束后服务应自动回到稳态,无需反复重启。配置结论绑定模型、引擎和 GPU 组合。
上线门禁需要哪些证据
- 采集输入、最大输出、实际输出与 KV Cache 分布。
- 按租户和交互/批量服务等级隔离 Token 预算。
- 设置缓存水位、渐进降载与带滞后的恢复条件。
- 验证取消跨网关、调度与后端释放执行资源。
- 回放长尾、突发、慢客户端和模型切换压力。
版本条件决定实施范围
NVIDIA Dynamo 文档提供分布式推理、请求处理和相关运行组件的信息。
具体调度与支持能力随版本和部署组件变化,容量边界必须在目标模型、硬件与流量分布上验证。
文中机制与配置边界依据NVIDIA Dynamo 文档的当前版本核对;官方说明用于确定候选条件,实际部署仍需结合完整料号、服务器支持清单、软件组合与现场测试。
中科新远的协同范围
中科新远是 NVIDIA Networking Elite 合作伙伴。中科新远可结合 GPU 推理节点、企业网关和高速网络协助建立 Token 成本、缓存水位与过载回放基线,使容量策略对应真实请求分布。具体合作范围和项目交付内容以当前有效资质、官方目录及书面确认结果为准。
已经限制每秒请求数,为什么仍会出现 GPU OOM 或长尾延迟?
请求成本并不相同。长上下文和长输出会占用更多计算与 KV Cache,应结合 Token 预算、运行水位和队列隔离做准入。
WeChat
Profile