新闻中心

NVIDIA DFlash + Blackwell:在相同交互性下把大模型推理吞吐最高提升 15 倍 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 超级管理员 审核人 · 待复核 发布时间 · 2026-07-23 更新时间 · 2026-06-24 来源 · 本站

随着 AI 应用逐步从单轮问答走向多智能体协同和低延迟交互,大模型推理系统正面临一个越来越突出的瓶颈:token 逐个生成的自回归过程,会让 GPU 难以充分释放并行能力,也让高交互场景下的吞吐和时延难以兼顾。NVIDIA 这篇文章介绍的 DFlash,正是针对这一问题提出的一种新型 speculative decoding 路径,并在 Blackwell 平台上展示了显著的推理加速效果。

与传统 speculative decoding 依赖小模型逐 token 起草不同,DFlash 使用轻量级 block diffusion drafter,一次前向计算就能并行生成一整块候选 token,再由目标大模型并行验证。这意味着原本仍带有串行特征的“起草”阶段,被改造成更适合 GPU 并行执行的 block 级工作流。在保持目标模型输出质量不变的前提下,系统得以显著提升吞吐,并改善高交互场景下的资源利用率。

根据 NVIDIA 披露的测试结果,在使用八张 NVIDIA DGX B300 GPU 运行 gpt-oss-120b 时,DFlash 在每用户 500 到 600 tokens/s 的高交互区间内,可把吞吐提升到传统自回归解码的 15 倍以上,同时也比 EAGLE-3 speculative decoding 高出约 1.5 倍。在更低并发下,它还能把单用户交互速度提升到原来的两倍以上。对面向编码、推理和 agent 工作流的在线服务来说,这种改进直接对应更高并发承载能力和更低单位服务成本。

文章同时指出,DFlash 的价值不只在研究层面,更在于它正快速进入开发者现有的推理栈。研究团队已经公开发布 20 个 DFlash checkpoint,并提供 Blackwell 与 Hopper 的使用 recipe;在 vLLM、SGLang 以及 TensorRT-LLM 中,开发者也可以较低改动成本接入该方案。比如在单张 Blackwell Ultra GPU 上运行 Gemma 4 31B 时,vLLM 路径下 DFlash 对不同任务可实现最高约 5.8 倍吞吐提升;在 Qwen3 8B + SGLang 路径下,也能获得最高约 5.1 倍提升。

从原理上看,DFlash 的关键在于把 speculative decoding 的 draft 阶段从自回归式 token-by-token 预测,转换为 block-diffusion 并行预测,再结合目标模型 hidden states 条件化与 KV 注入机制,提高候选 token 的接受率。这样一来,目标模型依旧负责最终验证,输出分布不被破坏,但整个生成链路获得了更强并行性。这种设计尤其适合 Blackwell 这样具备超高 NVFP4 计算能力和强大互连带宽的平台。

对部署大模型推理服务的团队而言,DFlash 传递出的信号很明确:推理优化的竞争,正在从单纯拼模型大小,转向更深入的系统级生成路径重构。谁能更好地把 GPU 的并行潜力转化为真实交互性能,谁就更有机会在代码生成、检索增强、推理型助手和多智能体平台中拿到更好的成本效率比。DFlash 在 NVIDIA 生态中的快速落地,也让这种优化不再停留在论文层面,而开始进入可以直接试用的工程实践。