新闻中心

NVIDIA PAIR 虚拟推理路由器发布:把本地网络里的闲置算力并入智能体推理 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · 超级管理员 审核人 · 内容审核团队 发布时间 · 2026-09-10 更新时间 · 2026-09-10 来源 · 本站

NVIDIA PAIR 虚拟推理路由器发布:把本地网络里的闲置算力并入智能体推理

NVIDIA 推出 PAIR(Personal AI Router)虚拟推理路由器,面向在本地网络中运行 AI 智能体的用户。它本身不是新的推理引擎,模型仍由 Ollama 或 LM Studio 在选定机器上执行;PAIR 负责发现可用系统、判断其是否可接受请求、调度独立作业并把结果回传给发起请求的应用。

多智能体工作流会把一个任务拆成多个子任务并行推进。从用户视角看是一次任务,在推理层却可能变成数十次独立的模型调用。如果这些调用都指向同一台本地引擎,它们会争抢执行槽位,队列变长,主机被占满,而网络中可能闲置的 RTX PRO 工作站、笔记本或 DGX Spark 却用不上。

PAIR 采用代理方式工作:智能体继续通过熟悉的本地接口发送请求,PAIR 接收后识别引擎与模型需求,选择一台符合条件的节点,由该节点从头到尾执行,再通过 PAIR 把响应送回。智能体始终只看到一个连接。它复用 Ollama 与 LM Studio 的兼容接口,不要求智能体框架做改造。

调度时会综合判断多项条件:配对节点是否在线可用、是否启用了受支持的推理引擎、是否已具备请求的确切模型、当前节点与引擎的作业负载,以及 GPU 是否正被图形密集型应用占用。系统间通过 mDNS 发现并配对,客户端可以随时加入或退出,以适应家用硬件经常开关、休眠、离开网络的实际情况。

需要说明的是,PAIR 属于工作负载级并发:单个推理请求不会被拆分到多张 GPU 上,而是分配给一台合格节点并在此完成;同时它被设计为让提示词、数据与推理流量保留在用户既有的本地网络中。

PAIR 目前为 beta,提供图形界面与终端界面,支持 Windows、macOS 与 Linux,覆盖 GeForce RTX 20 系列及更新型号、RTX PRO 工作站 GPU(Turing 架构及更新)、DGX Spark 以及 Apple M4+ 芯片。官方演示以 Hermes Desktop 编排五个子智能体、Ollama 执行模型:在同一台 RTX Spark 笔记本上运行 Qwen 3.6 35B A3B,该任务平均需要 18 分钟;改用三设备 PAIR 集群后,平均耗时降至 8 分 48 秒。NVIDIA 同时说明这是特定配置下的非正式演示,不是通用基准,也不代表线性扩展的承诺。