业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
NVIDIA 与陌陌推荐系统团队合作,用 Merlin TensorFlow Plugin(SOK)与 HierarchicalKV 替换原有 CPU+GPU 混合训练方案,精排模型训练吞吐提升 5 倍以上,结合通信与 IO 优化后极限可达 12 倍。
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。
挚文集团旗下陌陌是基于地理位置的移动视频社交应用,是中国领先的开放式社交平台之一。随着用户规模增加和业务发展,推荐算法准确度要求提高,导致模型复杂性和训练样本量显著增加。核心挑战:陌陌原有方案本质是基于 PS-Worker 的 CPU + GPU 混合训练方案,可支持大规模稀疏参数训练,但在性能上难以满足业务日益增长的需求,对单次模型训练速度和新模型算法探索效率都构成更大挑战,亟需优化训练速度以加快算法迭代。
解决方案名称:基于 NVIDIA GPU 与 Merlin 的陌陌推荐系统训练加速方案
核心技术:NVIDIA 团队与陌陌推荐系统团队深度合作,使用 NVIDIA GPU 和 Merlin 软件解决方案替代原有方案,核心组件为 Merlin TensorFlow Plugin(即 Sparse Operation Kit,SOK)和 HierarchicalKV(HKV)。在不影响模型效果的前提下,模型整体吞吐提升 5 倍以上,再结合通信和 IO 进一步优化后,极限情况下可提升 12 倍吞吐。
SOK 模型并行:NVIDIA Merlin HugeCTR 可高效利用 GPU 进行推荐系统训练,Merlin TensorFlow Plugin 将 HugeCTR 的高级特性封装为 TensorFlow 可直接调用的形式。SOK 以数据并行方式接收输入数据,将稀疏参数以模型并行方式分布在多个 GPU 上,稠密参数以数据并行方式分布,内部实现"数据并行—模型并行—数据并行"的转换流程。其使用方式尽可能与原有 TensorFlow 算子对齐,减少代码修改,并针对 embedding vector 的拷贝与 combiner 做了高度优化与内核融合。
HKV 层次化动态嵌入存储:Merlin HierarchicalKV 是面向推荐系统训练设计的 KV 加速库,为兼容大模型训练支持层次化动态 Embedding 存储(CPU+GPU)、灵活的 eviction 机制和丰富 API,目前已集成入 SOK 协同加速 Embedding 计算。在陌陌实际应用中,动态 Embedding 特性大大简化了连续训练时需人工控制显存中 embedding tab 大小的问题。
端到端性能优化:陌陌推荐团队在 SOK + HKV 架构基础上结合业务特点进一步优化,包括梯度合并减少梯度计算通信开销、并行特征数据读取与转换以及特征数据预取到 GPU 提速特征 IO、使用 XLA 编译优化融合 kernel 以减少 kernel launch 时间、设置 GPU 亲和等,使整体性能提升达到 12 倍。
双方团队通过 SOK 和 HKV 对原方案进行深度优化后,成功帮助陌陌提升 12 倍训练效率,极大降低了模型训练成本和新模型算法尝试成本,整体方案已上线并全面支持陌陌推荐系统模型训练。近期双方还针对基于 Transformer 的推荐模型开展性能优化,将 XLA+AMP+半精度 allreduce 应用到该模型后端到端性能实现 50% 加速;进一步优化 multi-head-attention 热点并集成 Flash-Attention 后,预计整体加速比可达 3 倍,同时显存使用量下降约 70%。
陌陌与 NVIDIA 将继续在推荐系统训练和推理等方面持续合作,推进 GPU 和 AI 软件加速计算在陌陌的全面落地。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。
上一篇:NVIDIA INT8 QAT 助力蚂蚁链版权 AI 平台推理吞吐提升 3 倍
下一篇:没有了!