新闻中心

NVIDIA Vera Rubin 与 Blackwell 树立智能体 AI 每瓦性能新标杆:AgentX 基准最高提升 30 倍 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 超级管理员 审核人 · 内容审核团队 发布时间 · 2026-08-31 更新时间 · 2026-08-31 来源 · 本站
NVIDIA AgentX 智能体推理每瓦性能基准

AI 智能体正把推理从单轮问答推向多步工作流:调用工具、协调子智能体,并在轮次之间不断累积上下文。OpenRouter《State of AI》报告基于 100 万亿 token 的真实使用数据发现,单次请求的平均提示词 token 数增长约 4 倍,而单个智能体请求的 token 消耗是普通对话的 15 倍。面对这类高度动态的负载,固定长度的静态基准已难以反映真实的服务水平。

为准确刻画智能体推理基础设施,SemiAnalysis 在开源基准套件 InferenceX 中推出 AgentX。该基准以 AIPerf 客户端逐轮回放预录的 Claude Code 生产会话,完整保留上下文与输入输出序列长度、推理时间及工具调用延迟,衡量平台能否快速响应回放流量、复用已处理上下文,并将每兆瓦 token 数(tokens per megawatt)作为 AI 工厂最关键的指标,同时辅以端到端归一化交互性、标准交互性、端到端延迟与首 token 时间等用户体验指标。

在 AgentX 的 DeepSeek V4-Pro 工作负载、160 token/秒/用户的交互性目标下,NVIDIA Vera Rubin NVL72 预览结果显示,其 AI 工厂每兆瓦吞吐最高达 GB300 NVL72 的 30 倍。该结果由 NVIDIA 测量、尚待 SemiAnalysis 复核,但指向一个明确的方向:在相同功耗与基础设施预算下,新一代平台可承载显著更多的智能体推理容量。

Blackwell 平台的表现同样突出。GB300 NVL72 在 DeepSeek V4 Pro 1.6T 工作负载上,每兆瓦吞吐相对 H200 NVL8 最高提升 15 倍,每百万 token 成本最高下降 10 倍;在 Kimi K3 2.8T 工作负载上优势进一步扩大至约 80 倍,并把可交互性前沿拓展到约 215 token/秒/用户。即使在早期静态 8K/1K 序列长度场景中,GB300 NVL72 相对 H200 的每兆瓦 token 优势也达到约 40 倍。

这些成绩来自推理运行时、模型内核与扩展互联的全栈协同:SGLang、TensorRT-LLM 与 vLLM 等框架通过 Wide Expert Parallelism 与 DeepEP 在 NVL72 域内均衡专家负载;基于 DeepGEMM 的内核与 MXFP4、MXFP8 等混合精度格式减少专家间数据搬运;Dynamo 将预填充与解码分离为独立扩展的工作池,并通过会话感知路由与 KV 缓存感知调度降低重复预填充;NVLink 域内互联则为大规模模型的专家并行通信与 KV 缓存流动提供高带宽底座。

Vera Rubin NVL72 展示了针对长上下文、交互式与分布式智能体推理定制的机架级系统能力。在完整的 Vera Rubin 平台上,Rubin GPU 高效处理长上下文与解码、Vera CPU 承担工具执行与 KV 缓存卸载、Groq 3 LPX 提供超快交互;配合 NVLink 6、ConnectX-9、BlueField-4、Spectrum-X 等互联与 Dynamo 等软件层,把固定的功耗预算转化为更多可用的智能体产出,为 AI 工厂的能效与单位经济性树立了新的标杆。