
对于计划部署 Llama 3.2 的团队,关键不只是选择模型参数规模,还要根据视觉输入、上下文长度、并发目标和部署位置匹配推理软件栈。来源资料显示,NVIDIA 针对 Llama 3.2 的视觉语言模型(VLM)和纯文本小语言模型(SLM)提供了从数据中心、云端到 RTX 工作站及 Jetson 边缘设备的优化路径。实际性能、精度和成本仍取决于具体模型版本、量化方式、硬件配置、请求特征及服务配置,应以对应日期的官方文档、完整 SKU/BOM 与项目测试结果为准。
Llama 3.2 支持的模型与输入范围
资料将 Llama 3.2 分为两类:11B 和 90B 参数的 VLM,以及 1B 和 3B 参数的纯文本 SLM。VLM 可接收文本和图像输入,支持最长 128K 文本 token,并支持单张最高 1120 x 1120 像素的图像输入。对于需要结合文档图片、界面截图或其他单图视觉内容生成文本响应的应用,VLM 是资料中明确覆盖的模型类别。
SLM 则面向纯文本推理场景。资料指出,Llama 3.2 SLM 已针对 NVIDIA RTX PC 和工作站进行优化,并可经量化后在 NVIDIA Jetson 边缘设备上本地部署。是否能满足特定设备的内存、响应时间和输出质量要求,仍需依据所选模型检查点、量化格式和目标设备实测确认。
全栈推理优化路径
对于 Llama 3.2 VLM,视觉编码器可通过 NVIDIA TensorRT 优化,文本解码器可通过 NVIDIA TensorRT-LLM 优化。资料称,TensorRT-LLM 支持通过交叉注意力机制将视觉编码器的信息融合至 Llama 文本解码器,使模型在文本上下文中处理视觉理解与推理。
- 视觉编码器:资料说明 TensorRT 支持以 BF16 数据格式运行。
- 文本解码器:资料说明 TensorRT-LLM 支持 FP16 和 BF16。
- FP8 路径:NVIDIA 使用 Hopper 架构第四代 FP8 Tensor Core 开发后训练量化(PTQ)recipe,并通过 TensorRT Model Optimizer 提供。
- 部署形式:资料将 TensorRT、TensorRT-LLM 与 TensorRT Model Optimizer 的组合指向 NVIDIA NIM 微服务部署。
资料称,其 FP8 PTQ recipe 在 ScienceQA、OCRBench、TextVQA 和 MMMU 等所列基准中保持相同准确性,同时提升吞吐量并降低延迟。但这一结论适用于资料所述的测量与 recipe 条件,不能直接外推到自有数据、不同提示词、不同图像分布或其他软件版本。
已披露的 H200 测试结果如何解读
来源披露了 Llama 3.2 90B VLM 在八张 NVIDIA H200 Tensor Core GPU 上的内部测量结果。该系统基于 NVIDIA HGX H200,单卡具有 141 GB HBM3e,并通过 NVLink 和 NVLink Switch 连接。吞吐量测试采用 BF16 编码器与 FP8 解码器,图像输入均为 1120 x 1120 像素,输出 token/s 包含首 token 时间。
| 输入/输出序列长度 | 最大吞吐量(输出 token/s) | 最低延迟测试(输出 token/s) |
|---|---|---|
| 8000 / 2000 | 2646 | 64 |
| 20000 / 2000 | 1417 | 63 |
| 60000 / 2000 | 480 | 55 |
两组数据的优化目标不同:最大吞吐量测试针对节点总吞吐量调整批量大小;最低延迟测试使用 TP8 和批量大小 1。资料还说明,吞吐量数据于 2024 年 11 月 14 日测量,延迟数据于 2024 年 11 月 4 日测量,涉及 TensorRT Model Optimizer 0.21(预发布)、TensorRT-LLM 0.16.0.dev 和 TensorRT 10.4.0。采购或架构评估时,应避免将这类内部测量直接视为生产 SLA,应复现目标上下文长度、并发度、图像尺寸和首 token 指标。
RTX 工作站与 Windows 场景
资料还给出了 NVIDIA GeForce RTX 4090 上运行 Llama 3.2 3B Instruct 的测试信息:模型检查点采用 AutoAWQ 量化为 AWQ INT4,并转换为 ONNX,以带 DirectML 后端的 ONNX Runtime Generative API 运行。在输入/输出长度为 100/100、2000/100、4000/100 时,批量大小 1 的最大吞吐量分别为 253、203、165 输出 token/s;批量大小 4 分别为 615、374、251 输出 token/s。
这些数据来自 2024 年 10 月 7 日的 NVIDIA 内部测量,且仅描述 GeForce RTX 4090、所列量化检查点、DirectML 与 ONNX Runtime Generative API 条件下的结果。本地 PC 部署应重点验证 Windows 驱动、DirectML 软件兼容性、实际并发、模型加载时间、显存占用及业务语料下的输出质量。
适用场景与评估步骤
从资料披露的范围看,90B VLM 更适合需要单图视觉理解、长文本上下文以及数据中心级推理资源的服务;1B 或 3B SLM 则可作为 RTX PC、工作站或 Jetson 本地文本推理的评估对象。模型选择不能仅依据参数量或单项 token/s 数据,还应结合请求结构和运维边界决策。
- 明确任务是否需要图像输入、最长上下文、目标输出长度及并发模式。
- 选择模型类别与部署位置:数据中心或云端 VLM、本地 RTX 文本推理,或经量化的 Jetson 边缘推理。
- 核对目标模型检查点、TensorRT/TensorRT-LLM、NIM、ONNX Runtime 与驱动版本的官方兼容性说明。
- 以业务提示词、图像尺寸和并发曲线进行压测,同时记录首 token 延迟、端到端延迟、输出 token/s、显存或内存占用及错误率。
- 在上线前验证量化后模型在自有准确性、安全性和稳定性验收集上的表现。
常见问题
Llama 3.2 90B VLM 的测试数据能代表所有部署环境吗?
不能。资料中的数据限定于八张 H200、特定输入输出长度、1120 x 1120 单图输入、指定 TensorRT 组件版本及特定批量策略。不同 GPU 数量、网络拓扑、模型版本、量化方案、上下文长度和并发请求都会改变结果。
是否可以直接把 Llama 3.2 SLM 部署到 NVIDIA Jetson?
资料指出,SLM 经量化后可在 NVIDIA Jetson 上进行本地部署,但未给出具体 Jetson 型号、支持的模型规模、内存需求或性能数据。项目应查验对应日期的官方部署文档、量化模型要求和完整硬件配置,并完成端侧实测。
结论
Llama 3.2 的部署评估应围绕模型类型、输入形态和推理目标展开。资料展示了 NVIDIA 对 VLM 的 TensorRT、TensorRT-LLM、FP8 PTQ 与 NIM 路径,以及针对 RTX Windows 环境的 ONNX Runtime DirectML 路径。其披露的测试结果可作为特定配置下的参考基线,但生产决策仍应以官方版本兼容性信息和贴近业务负载的验证结果为依据。
围绕“Llama 3.2 在 NVIDIA 平台上的全栈推理优化解析”继续了解 NVIDIA 产品与网络方案。
WeChat
Profile