新闻中心

NVIDIA TensorRT Model Connect 发布:两条命令将开源模型从检查点部署到 C++ 原生推理 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 中科新远内容团队 审核人 · 待复核 发布时间 · 2026-08-31 更新时间 · 2026-08-31 来源 · 中科新远

开源大模型迭代速度越来越快,但要把模型接入原生应用,仍需要为每个模型单独处理格式转换、预处理、后处理与运行时代码。NVIDIA 日前发布开源项目 TensorRT Model Connect,以一套开放参考实现合集,帮助开发者基于 TensorRT 在原生 C++ 应用中运行受支持的开放模型,实现从 Hugging Face 模型 ID 到推理的两步部署。

TensorRT Model Connect 将部署拆分为两个阶段。第一步使用 Python 命令行工具 trtmc build,从 Hugging Face 模型 ID 或本地检查点构建部署包(bundle),其中包含 TensorRT 引擎与运行时所需的模型专属资源;第二步由原生 C++ 应用加载该部署包,直接以任务级输入输出调用模型推理。权重映射、引擎构建、预处理、运行时编排与后处理均由 Model Connect 统一处理,开发者无需为每个模型家族重复搭建集成代码。Python 仅用于准备阶段,生产运行时完全不需要 Python 解释器或 PyTorch。

Model Connect 提供两级 C++ API。语义级 API 面向提示词、图像、音频等常见输入输出,自动处理模型专属的预处理、执行与后处理;模块级 API 则允许开发者直接操作命名张量与各 TensorRT 组件,按需定制推理流水线。两级 API 共用同一套实现,开发者可以先从简单的任务级接口入手,仅在必要时深入定制。

通过 TVM FFI,Model Connect 支持将模型中的指定部分替换为自定义 GPU 内核,TensorRT 继续执行其余推理流水线,方便集成新开发的算子。Model Connect 并非新的推理框架,也不是 TensorRT 的替代品,而是连接开放模型端到端推理体验与 TensorRT 加速能力的桥梁;每个模型的实现既可直接运行,也可作为学习样例或扩展基础,支持相关架构、自定义检查点与应用需求。

为跟上开放模型生态的更新节奏,Model Connect 采用 AI 原生的工程方式,编码智能体在人工指导与审查下生成实现代码、测试、集成与文档,并以夜间发布模式快速迭代,自动化验证作为发布门槛。在受支持并经过验证的工作负载上,Model Connect 的推理性能可优于 torch.compile,并随项目演进持续测试与优化。

开发者可访问 NVIDIA/TensorRT-Model-Connect GitHub 仓库,获取受支持模型的实现列表并构建部署包,直接使用、按需适配,或贡献新的模型支持。