业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
金山办公采用 NVIDIA T4 GPU、TensorRT 8.2.4 与 Triton 推理服务器优化图像文档识别与理解业务,20+ 模型 pipeline 耗时从 15 秒降至 2.4 秒,相比 CPU 下降 84%,部署成本节省 23%。
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。
金山办公主要从事 WPS Office 办公软件产品及服务的设计研发及销售推广,产品可在 Windows、Linux、macOS、Android、iOS、Harmony 等众多主流平台应用。在办公场景中,证件、发票、合同、保险单、扫描书籍、拍摄的表格等文档类型图像被广泛使用,这类图像既包含大量纯文本信息,也包含表格、图片、印章、手写、公式等复杂版面布局和结构信息。核心挑战:图像识别与理解是一个复杂过程,一个任务的 pipeline 用到的深度学习模型多达 20+ 个,且日请求量级上亿,需要大量计算资源。业务落地时团队主要面临两个挑战:任务的绝对耗时不能过长;以及成本问题。
解决方案名称:基于 NVIDIA T4 GPU、TensorRT 与 Triton 的 WPS 图像文档识别与理解推理方案
核心技术:金山办公采用 NVIDIA T4 Tensor Core GPU 进行推理、NVIDIA TensorRT 8.2.4 进行模型加速、NVIDIA Triton 推理服务器 22.04 在 K8S 上进行模型部署与编排。业务主要使用 CV(计算机视觉)与 VIE(视觉信息抽取)等深度学习技术,例如通过 CV 技术识别发票和 PDF 大纲并获取其中的数据关系,日请求次数已达上亿次。
TensorRT 模型加速:长链路(多达 20+ 个模型的 pipeline)意味着长耗时,若基于 CPU 推理,pipeline 耗时会长达 15 秒左右;通过 GPU 推理和 TensorRT 加速,耗时成功降低到 2.4 秒左右。以具体模型为例,文本检测模型在 CPU 上耗时 1402ms,TensorRT FP32 为 286ms,TensorRT FP16 进一步降至 127ms;字体生成模型从 CPU 的 124ms 降至 TensorRT FP16 的 13ms。
Triton 解耦与 GPU 资源池化:模型部署时常见做法是把推理与业务代码(前后处理)放在同一个进程空间,每个模型需要在每个进程中加载一次,受显存限制难以获得较高单卡 GPU 使用率;即便采用进程池提高单卡利用率,也会因 CPU 限制导致机器整体 GPU 利用率不高。引入 Triton 推理服务器后,推理与业务代码解耦,初步实现 GPU 资源池化调度,最终在同等业务规模情况下部署成本节省 23%。
金山办公图像文档识别与理解业务通过采用 NVIDIA T4 Tensor Core GPU 及 TensorRT 加速,相比 CPU 其 pipeline 耗时下降 84%;采用 NVIDIA Triton 推理服务器部署后,部署成本节省 23%。金山办公 CV 团队总监熊龙飞表示,公司多个业务的后端 AI 服务已经通过该方案提高速度和资源利用率,不仅给用户端带来更快的响应、提升体验,也为公司节约了大量服务端 GPU 资源,收获更高效益。
WPS AI 正持续扩展阅读理解、问答、人机交互等能力,覆盖文字、表格、PPT、PDF 四大组件,并在 PPT 一键生成与美化、PDF 文档问答与溯源等场景落地。面向上亿级日请求,基于 TensorRT 与 Triton 的推理优化将持续支撑办公 AI 服务的体验与成本目标。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。
上一篇:NVIDIA NeMo 与 Omniverse 赋能中科深智实现 NPC 千人千面多模态互动
下一篇:没有了!