业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
美团机器学习平台将 CTR 模型从 CPU 迁移至 NVIDIA T4 GPU,通过算子融合与计算图等价替换等优化,神经网络模型吞吐提升 10 倍,搜索精排端到端吞吐提升一倍以上。
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。
美团是一家集生活服务及商品零售的电商平台,业务涵盖餐饮、配送、网约车、共享单车、酒店及旅游预订等 200 多个服务品类,覆盖全国 2800 个市区县,服务 6.7 亿活跃用户和 830 万活跃商家。CTR(Click-Through-Rate)模型作为推荐系统的核心模型,其效果直接影响业务收入。核心挑战:美团 CTR 模型过去一直使用 CPU 推理,但随着用户访问量提升和深度神经网络的引入,模型结构趋于复杂,吞吐和计算量越来越大,CPU 已不能满足算力需求,而单纯堆叠 CPU 服务器带来的性能提升性价比偏低。同时时延是业务侧高度重视的指标,许多复杂模型虽有更好准确度,却因响应时间不达标而无法落地。
解决方案名称:基于 NVIDIA T4 GPU 的美团 CTR 预测加速方案
核心技术:美团基础研发平台将 CTR 模型部署到 GPU 上,采用 NVIDIA AI 计算平台与 T4 GPU 提供预测支持,并通过一系列针对 CPU 与 GPU 异构系统的并行计算设计、数据存储方式与传输方式优化,充分发挥 GPU 并行算力。GPU 拥有数以千计的计算核心,可在单机内提供密集的并行计算能力,特别适合深度学习场景。
算子融合与计算图优化:美团机器学习平台使用 NVIDIA GPU 支持多方面优化策略,通过算子融合、计算图等价替换等一系列优化手段,提高吞吐能力并降低响应延迟。相较于 CPU,在相同成本约束下,NVIDIA T4 GPU 大幅加速了 CTR 模型预测性能,神经网络模型吞吐能力提升 10 倍;在搜索精排场景中,端到端整体吞吐能力提升一倍以上。
时延敏感场景落地:以搜索框自动补全场景为例,由于其天然的交互属性,时延要求非常苛刻,通常难以使用复杂模型。在 GPU 能力加持下,复杂模型的平均响应时间从 15 毫秒降低至 6~7 毫秒,缩短一倍多,达到了上线要求。
通过 NVIDIA T4 深度优化方案,美团 CTR 模型获得了更多应用机会,不仅极大提升了系统吞吐量,也进一步提升了整个模型训练的速度并降低训练成本,落实了 AI 框架在 GPU 上性能推理的优化实践。美团研发工程师、机器学习平台预测引擎负责人王新表示,在美团与英伟达的共同努力下,CTR 预测服务成功迁移到 GPU 平台,在为业务提供更好支撑的同时也获得了更好的性价比。
美团机器学习平台计划采用 NVIDIA Triton 推理服务框架和 NVIDIA Ampere A30,进一步提升推理服务效率,持续推动推荐系统在效果、时延与成本之间取得更优平衡。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。
上一篇:NVIDIA TensorRT 助力极视角打造极星 AI 推理平台:算法推理效率提升 20-40 倍
下一篇:没有了!