业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
DolphinDB 与 NVIDIA 团队合作,基于 RAPIDS RMM 显存池化与 libcudf 二次开发重构 Shark 异构计算平台,因子挖掘效率提升 2-10 倍,算子迁移成本大幅降低。
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。
DolphinDB 公司推出的 CPU-GPU 异构计算平台 Shark,将 DolphinDB 上的复杂指标计算能力无缝切换到 GPU 算力平台,以提升计算性能。核心挑战:Shark 的因子挖掘功能通过遗传算法从数据中挖掘有效因子,过程中会随机生成大量因子公式,公式长度不等、参数数量不同,需要频繁创建和释放临时空间存储中间结果,直接使用原生 CUDA C 显存分配和释放接口会严重降低执行效率;而在因子计算方面,若从零开始将 CPU 函数迁移至 GPU,需要为 GPU 重新实现一套底层数据结构与基础计算函数,会导致开发周期延长与开发成本增加。
解决方案名称:基于 NVIDIA RAPIDS 的 Shark 异构计算加速方案
核心技术:利用 RAPIDS RMM 解决因子挖掘过程中频繁申请和释放显存导致的性能问题;基于 RAPIDS libcudf 进行二次开发实现因子计算,从而缩短开发周期、降低开发成本。RMM 是一套开源的内存/显存管理库,提供 C++ 和 Python 接口,相比 cuMalloc、cuFree 等操作具有更好的性能和灵活性;libcudf 是基于 GPU 的 C++ DataFrame 库,提供基础数据结构并内置基础函数算子。
显存池化:DolphinDB 开发团队通过 RMM 对显存进行池化,对中间结果所使用的显存进行高效分配、释放和重用,从而缓解遗传算法在因子挖掘过程中频繁申请释放显存带来的性能损耗。
基于 cuDF 的算子迁移:Shark 支持用户输入自定义公式,并自动将自定义公式转换为计算图在 GPU 上完成计算。团队复用 cuDF 的 column、table 等底层数据结构,并借助 cuDF 的 groupby 和 rolling 框架,只需完成算子的核心计算逻辑,即可完成 DolphinDB 时序算子与横截面算子的迁移,极大提升开发效率、降低开发成本。
在不同规模数据下,使用 RAPIDS RMM 显存管理库相对于原生 CUDA 显存分配 API,Shark 因子挖掘效率显著提升,最高可达到 10 倍的加速比。在因子计算方面,以 1000 个 group、每组 10 万行数据的算子分组计算为例,与 CPU 相比,利用 GPU 的总体耗时(含拷贝时间)基本达到一个数量级的加速比。综合来看,借助 RAPIDS,Shark 的因子挖掘效率提升最高 10 倍;基于 cuDF 进行二次开发只需实现算子核心逻辑即可获得一个数量级的加速,并大幅降低算子迁移成本。
面向金融行业持续增长的实时计算与因子研究需求,NVIDIA RAPIDS 生态将继续为 CPU-GPU 异构数据分析提供底层支撑,帮助平台在成本可控的前提下获得更高的计算效率。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。