新闻中心

TensorRT-LLM 支持 ReDrafter:LLM 推测解码的评估要点 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 中科新远内容团队 审核人 · 中科新远技术内容组 发布时间 · 2025-01-08 更新时间 · 2026-07-22 来源 · 原页面资料;原厂信息待核验
TensorRT-LLM 支持 ReDrafter:LLM 推测解码的评估要点

对于希望降低大语言模型生成阶段延迟、且在线请求批量较小的 NVIDIA GPU 推理项目,TensorRT-LLM 对 Recurrent Drafting(ReDrafter)的支持提供了一条可评估的推测解码路径。根据本来源于 2025 年 1 月 8 日发布的信息,ReDrafter 将 draft token 的生成、验证与路径选择更多地整合到 TensorRT-LLM 引擎中;实际收益仍取决于模型、任务、接受率、GPU 利用率和部署配置,不能仅依据公开基准推断项目结果。

ReDrafter 解决什么问题

自回归 LLM 通常按 token 逐个生成结果,生成阶段可能成为交互式应用的响应瓶颈。推测解码通过较小的 draft 模块并行预测后续 token,再由主模型验证可接受结果,目标是在保持主模型验证机制的前提下缩短生成时间。

ReDrafter 结合基于循环神经网络(RNN)的 drafting 与树状注意力,可从多个候选路径预测和验证 draft token,并在一次解码迭代中接受一个以上 token。来源将其描述为苹果公司为 LLM 推理开发并开源的技术,并称其已可与 NVIDIA TensorRT-LLM 配合使用。

TensorRT-LLM 中的实现特点

TensorRT-LLM 是用于 LLM 推理优化的库,提供 Python API 用于定义模型和构建 NVIDIA TensorRT 引擎。来源列举的优化能力包括自定义 Attention Kernel、Inflight Batching、Paged KV Caching,以及 FP8、INT4 AWQ、INT8 SmoothQuant 等量化技术;这些能力是否适用于某个模型和 SKU,需以对应版本的官方文档、完整 BOM 与构建日志确认。

与将部分路径接受和 token 采样留在运行时处理的方式相比,ReDrafter 将 drafting 和验证逻辑整合进单个引擎,减少对独立引擎或运行时路径处理的依赖。这样可让 TensorRT-LLM 在内核选择和调度上拥有更多优化空间,但并不意味着所有模型或工作负载都会获得相同收益。

与 Inflight Batching 的关系

Inflight Batching(IFB)可将上下文阶段与生成阶段请求进行批量处理,以提升吞吐量。来源指出,推测解码与 IFB 结合时,由于生成请求还涉及 draft token 验证,管线复杂度会上升。

ReDrafter 兼容的工作流会将批处理拆分为上下文请求和生成请求两个较小批次,进入计算流程后再合并用于 drafting。实现这一流程要求任一路径上的算子支持空张量,因为某个批次可能只包含上下文请求或只包含生成请求。部署前应检查模型图、插件、算子支持范围及目标 TensorRT-LLM 版本,而非假定现有引擎可以直接迁移。

适合优先评估的场景

  • 交互式生成请求较多、单次或小批量请求导致 GPU 利用率偏低的服务。
  • 后续 token 相对容易预测、预期 draft 接受率较高的任务,例如来源提到的代码补全。
  • 能够同时测量首 token 延迟、后续 token 延迟、吞吐量、接受率与资源利用率的推理平台。
  • 具备主模型、draft 组件、TensorRT-LLM 构建流程及回归测试能力的工程团队。

高并发且已通过大批量充分利用 GPU 的服务,推测解码未必是首要优化手段。额外的 drafting 与验证计算会增加每个解码步骤的工作量;若接受率不足以抵消该开销,端到端表现可能不会改善。

建议的评估与上线步骤

  1. 确定基线:在固定模型、精度、上下文长度、输出长度、并发度和硬件条件下,记录未启用 ReDrafter 的延迟与吞吐量。
  2. 核验兼容性:依据发布日期对应的 NVIDIA 官方 TensorRT-LLM 文档,确认 ReDrafter、IFB、所需算子及目标模型定义的版本要求。
  3. 测量接受率:按真实任务类型分组,观察束数量、束长度和 draft 质量对可接受 token 数的影响。
  4. 进行质量回归:比较输出格式、任务正确性和业务约束结果,确认验证机制及工程实现未引入不可接受的行为变化。
  5. 分阶段压测:分别覆盖低流量、小批量和高并发条件,再决定是否将其用于生产流量。

FAQ

ReDrafter 是否保证将吞吐量提升至 2.7 倍?

不保证。来源引用苹果公司的基准测试称:在采用 TP8、即 8 卡 GPU 张量并行的 NVIDIA GPU 上,使用 TensorRT-LLM 的 ReDrafter 吞吐量最多可达基础 LLM 的 2.7 倍。这是特定测试条件下的最高结果,不是所有模型、硬件、请求分布或任务的承诺。项目应通过自身压测验证。

为什么接受率是关键指标?

推测解码会产生额外计算,部分候选路径在主模型验证后会被丢弃。只有平均接受率足够高时,单次解码增加的开销才可能被一次接受多个 token 的收益抵消。接受率会受到束数量、束长度、束搜索质量及训练数据等因素影响。

结论

TensorRT-LLM 对 ReDrafter 的支持,为低利用率或小批量 LLM 生成服务提供了引擎内推测解码的评估方向。其价值应通过目标模型的兼容性核验、真实任务接受率、质量回归和分场景压测来判断;版本支持范围与最终部署配置需以日期匹配的官方产品文档和完整 SKU/BOM 为准。

围绕“TensorRT-LLM 支持 ReDrafter:LLM 推测解码的评估要点”继续了解 采购与选型问答