解决方案

SOLUTION DETAIL

NVIDIA Merlin 助力陌陌推荐系统训练吞吐提升最高 12 倍

NVIDIA 与陌陌推荐系统团队合作,用 Merlin TensorFlow Plugin(SOK)与 HierarchicalKV 替换原有 CPU+GPU 混合训练方案,精排模型训练吞吐提升 5 倍以上,结合通信与 IO 优化后极限可达 12 倍。

当前位置:首页 > 解决方案
NVIDIA Merlin 助力陌陌推荐系统训练吞吐提升最高 12 倍
解决方案
SOLUTION OVERVIEW

NVIDIA Merlin 助力陌陌推荐系统训练吞吐提升最高 12 倍

NVIDIA 与陌陌推荐系统团队合作,用 Merlin TensorFlow Plugin(SOK)与 HierarchicalKV 替换原有 CPU+GPU 混合训练方案,精排模型训练吞吐提升 5 倍以上,结合通信与 IO 优化后极限可达 12 倍。

  • 方案分类 解决方案
  • 内容形式 场景方案 / 技术解析
  • 服务支持 咨询、测试申请、实施建议

如果你正在评估对应场景,我们可以基于当前方案继续细化产品组合、测试路径与实施节奏。

浏览更多相关方案
DETAIL MODULES

方案详情

查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。


一、方案背景与核心挑战

挚文集团旗下陌陌是基于地理位置的移动视频社交应用,是中国领先的开放式社交平台之一。随着用户规模增加和业务发展,推荐算法准确度要求提高,导致模型复杂性和训练样本量显著增加。核心挑战:陌陌原有方案本质是基于 PS-Worker 的 CPU + GPU 混合训练方案,可支持大规模稀疏参数训练,但在性能上难以满足业务日益增长的需求,对单次模型训练速度和新模型算法探索效率都构成更大挑战,亟需优化训练速度以加快算法迭代。

二、解决方案名称与架构

解决方案名称:基于 NVIDIA GPU 与 Merlin 的陌陌推荐系统训练加速方案

核心技术:NVIDIA 团队与陌陌推荐系统团队深度合作,使用 NVIDIA GPU 和 Merlin 软件解决方案替代原有方案,核心组件为 Merlin TensorFlow Plugin(即 Sparse Operation Kit,SOK)和 HierarchicalKV(HKV)。在不影响模型效果的前提下,模型整体吞吐提升 5 倍以上,再结合通信和 IO 进一步优化后,极限情况下可提升 12 倍吞吐。

三、核心技术组件

SOK 模型并行:NVIDIA Merlin HugeCTR 可高效利用 GPU 进行推荐系统训练,Merlin TensorFlow Plugin 将 HugeCTR 的高级特性封装为 TensorFlow 可直接调用的形式。SOK 以数据并行方式接收输入数据,将稀疏参数以模型并行方式分布在多个 GPU 上,稠密参数以数据并行方式分布,内部实现"数据并行—模型并行—数据并行"的转换流程。其使用方式尽可能与原有 TensorFlow 算子对齐,减少代码修改,并针对 embedding vector 的拷贝与 combiner 做了高度优化与内核融合。

HKV 层次化动态嵌入存储:Merlin HierarchicalKV 是面向推荐系统训练设计的 KV 加速库,为兼容大模型训练支持层次化动态 Embedding 存储(CPU+GPU)、灵活的 eviction 机制和丰富 API,目前已集成入 SOK 协同加速 Embedding 计算。在陌陌实际应用中,动态 Embedding 特性大大简化了连续训练时需人工控制显存中 embedding tab 大小的问题。

端到端性能优化:陌陌推荐团队在 SOK + HKV 架构基础上结合业务特点进一步优化,包括梯度合并减少梯度计算通信开销、并行特征数据读取与转换以及特征数据预取到 GPU 提速特征 IO、使用 XLA 编译优化融合 kernel 以减少 kernel launch 时间、设置 GPU 亲和等,使整体性能提升达到 12 倍。

四、实施成果

双方团队通过 SOK 和 HKV 对原方案进行深度优化后,成功帮助陌陌提升 12 倍训练效率,极大降低了模型训练成本和新模型算法尝试成本,整体方案已上线并全面支持陌陌推荐系统模型训练。近期双方还针对基于 Transformer 的推荐模型开展性能优化,将 XLA+AMP+半精度 allreduce 应用到该模型后端到端性能实现 50% 加速;进一步优化 multi-head-attention 热点并集成 Flash-Attention 后,预计整体加速比可达 3 倍,同时显存使用量下降约 70%。

五、未来展望

陌陌与 NVIDIA 将继续在推荐系统训练和推理等方面持续合作,推进 GPU 和 AI 软件加速计算在陌陌的全面落地。

EVALUATION CHECKLIST

方案评估清单

在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。

GOAL

业务目标

明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。

NETWORK

现网条件

整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。

VALIDATION

验证范围

确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。

DELIVERY

落地边界

确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。

ANSWER FIRST

方案快速回答与常见问题

先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。

FIT CHECK

先判断当前方案是否匹配业务目标和现网条件

如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。

TEST PATH

不确定时,优先进入咨询与测试验证

对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。

NEXT STEP

整理现网信息后,再细化产品组合与实施建议

业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。

FAQ 01

NVIDIA Merlin 助力陌陌推荐系统训练吞吐提升最高 12 倍 适合什么业务场景?

适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。

FAQ 02

评估方案前需要准备哪些信息?

建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。

FAQ 03

是否可以先做测试或 PoC?

可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。

FAQ 04

如何继续获取实施建议?

可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。

FAQ 05

判断方案是否适配时最先看什么?

建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。

FAQ 06

方案落地前有哪些风险需要前置确认?

需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。