新闻中心

NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 发布:为长时运行智能体提供高效任务执行 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 作者 · NVIDIA 审核人 · 内容审核团队 发布时间 · 2026-09-11 更新时间 · 2026-09-11 来源 · 本站

NVIDIA Nemotron 3.5 Lightning 与 NeMo Switchyard 发布:为长时运行智能体提供高效任务执行

NVIDIA 宣布推出 Nemotron 3.5 Lightning,进一步扩展其 Nemotron 3 模型系列。这是一款面向长时间运行代理式 AI 工作负载的开放模型,与同类模型相比输出速度至高可提升至原来的 4 倍,可帮助将智能体任务的完成速度提升 30%。同时,NVIDIA 还发布了 NeMo Switchyard,这是一款旨在为热门智能体工具提供智能路由的开源库。

Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家 (MoE) 模型,专为大型多智能体系统中的特定任务而构建。现代智能体系统正越来越多地作为由多个模型组成的模型集合运行,其中不同的模型专门负责不同的任务:前沿推理模型可以规划和协调工作流,而像 Nemotron 3.5 Lightning 这样的小型专用模型则可以执行代码审查、工具使用、安全警报监测和回答计费问题等目标任务。

该模型的开发得益于 Nemotron Coalition 的贡献,其成员提供了评估方法、推理软件和数据集。得益于开放且可定制的特点,企业可以借助 NVIDIA NeMo 结合自身的领域数据、工具和工作流对其进行后训练,以提高专用任务的准确性。NVIDIA 表示,CrowdStrike 将其用于网络安全,Harvey with Trajectory 将其用于法律服务,CodeRabbit 结合 Baseten 将其用于代码审查,Lila Sciences 正利用它提升物理和生命科学领域的智能体推理能力。

NeMo Switchyard 则面向模型选择与成本控制问题。企业如果仅依赖一个默认模型,可能会导致成本超支或降低质量;如果手动管理路由,则会变成集成工作,从而拖慢部署速度。NeMo Switchyard 能够根据特定需求,自动将提示词路由到智能体工作流每个步骤中能力较强、效率较高的模型,开发者可以使用不同的路由算法来调整路由器,以满足质量、延迟和成本方面的优先级要求。

NVIDIA 内部基准测试表明,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅为使用 Opus 4.8 时的约三分之一。生态伙伴的测试也给出了具体数据:LangChain 在 145 个多轮 Deep Agent 任务中仅将 7% 的调用路由到前沿模型,在 6% 的准确率妥协下实现了 74% 的成本降低;Ramp 在 Ramp SWE-Bench 上匹配了前沿模型的性能,同时将成本降低 58%、运行时间缩短 33%。

在部署方面,Nemotron 3.5 Lightning 可以在本地 AI 系统上运行,包括 NVIDIA RTX PC、NVIDIA DGX Spark 以及 NVIDIA Jetson,也可以扩展到 RTX PRO 工作站、数据中心和云环境。模型已在 Hugging Face、魔搭社区和 OpenRouter 上作为 NVIDIA NIM 提供,NeMo Switchyard 则已在 GitHub 上提供,并即将登陆各合作伙伴平台。