新闻中心

NVIDIA Groq 3 LPX 获第三方基准验证:100K 上下文交互速度超 3400 token/秒 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 超级管理员 审核人 · 内容审核团队 发布时间 · 2026-08-25 更新时间 · 2026-08-25 来源 · 本站

NVIDIA Groq 3 LPX 是面向 Vera Rubin 平台的交互式 AI 推理加速器。NVIDIA 近日公布了该产品在 Artificial Analysis 基准上的首个第三方评测结果:在 100K 输入上下文的评测中,Gemma 4(310 亿参数密集模型)在 NVIDIA 自建数据中心的 Groq 3 LPX 系统上以 3431 token/秒的中位速度生成输出;10K 上下文下的中位速度为 3382 token/秒。

在面向编码场景的 SPEED-Bench 基准上,同一配置的中位输出速度为 4767 token/秒,其中约两成任务的生成速度超过 5500 token/秒。以此速度估算,生成 5000 个输出 token 仅需约 1.5 秒,而传统 100 token/秒的服务速度需要约 50 秒。NVIDIA 表示,测试配置在精度与模型质量上均无损失。

Groq 3 LPX 采用确定性执行模型:编译器在任务开始前即可规划 256 个 LP30 处理单元、128 GB SRAM 总内存以及每芯片 96 条 112 Gbps 芯片间(C2C)链路上的数据传输调度,从而将小批量推理中通信的首比特延迟降至最低,并以 320 字节向量粒度实现计算与通信的精细重叠。

在与 Vera Rubin NVL72 的搭配中,Groq 3 LPX 支持预填充-解码分离、注意力-FFN 分离以及外部草稿模型投机解码等多种部署形态,让机架各自承担最擅长的计算环节。NVIDIA 表示,这一协同方案可将 Vera Rubin 平台的交互性能推向更高水平,服务 2 万亿参数级模型的智能体工作负载。