2026.07.31
RAG 与向量数据库网络路径怎么设计:检索时延不是只有数据库指标
入口、Embedding、向量检索、重排和生成跨越多个服务,任何一次跨区调用都可能成为答案尾延迟。
结合训练、推理和存储业务,分析 InfiniBand、RoCE、Leaf-Spine 与 Rail-Optimized 架构的适用条件、产品组合和扩容路径。
2026.07.31
入口、Embedding、向量检索、重排和生成跨越多个服务,任何一次跨区调用都可能成为答案尾延迟。
2026.07.31
拆分计算阶段后,KV Cache 从本地状态变成跨节点数据,吞吐、排队和故障恢复都随之改变。
2026.07.31
token 路由的不均衡会把少数 rank 推成尾部,容量模型必须覆盖突发、重排与专家并行边界。
2026.07.30
交换机端口总数不是可接入节点数,轨道划分、上联比例、存储流量与维护余量必须一起计算。
2026.07.30
平台价值来自端到端协同,但交换设备、主机适配器、网络软件和应用验证仍有各自责任。
2026.07.30
DPU 能把基础设施服务从主机侧分离,但责任边界、管理路径和故障恢复必须先定义。
需要结合训练或推理业务、GPU 规模、时延和扩展效率目标、现有以太网能力、运维团队经验、预算与交付周期判断,不能只比较端口速率。
不一定。常见问题还包括数据读取慢、CPU 或内存瓶颈、PCIe 与 NUMA 路径不合理、网卡位置错误、线缆或 FEC 异常,以及 NCCL 和 RDMA 参数没有对齐。
不能。正式设计还要核算节点数、每节点 GPU 和网卡数量、收敛比、故障域、Rail 划分、上联带宽、布线距离、冗余方式与后续扩容规模。
应在首期设计时完成。交换机端口、机柜位置、光纤与配线、地址和路由、Rail 数量、管理平面以及电力散热都可能限制后续扩容。