新闻中心

NVIDIA Nemotron 3 Ultra 发布:面向长时运行智能体的高效推理与编排模型 NEWS DETAIL

当前位置:首页 > 新闻中心
资讯分类 · 新闻中心 发布时间 · 2026-07-21

随着 AI 应用从一次性问答转向长时运行的智能体系统,模型面对的挑战已经不只是“答得对”,而是要在多轮推理、工具调用、子代理协作和长上下文处理中持续保持效率与稳定性。NVIDIA 最新发布的 Nemotron 3 Ultra,正是围绕这类场景打造的一款开放模型,目标是在复杂智能体工作流中兼顾高精度、更高吞吐与更低任务成本。

根据 NVIDIA 介绍,Nemotron 3 Ultra 采用 550B 参数的 Mixture-of-Experts 架构,但每次推理仅激活其中约 55B 参数,因而在维持前沿级推理能力的同时,尽量降低实际执行开销。它面向的不是简单的单轮聊天,而是要支撑长期任务中那些“关键但不频繁”的高难度决策,例如跨多次编码会话维持架构一致性、在大量研究资料中综合矛盾证据,或在复杂约束下执行工程级验证。

文章强调,Nemotron 3 Ultra 在效率上同样是核心卖点。NVIDIA 表示,该模型相较同等级开放模型可实现最高约 5 倍吞吐提升,并在部分智能体基准任务中用更少的总 token 完成目标,从而把任务完成成本降低最高约 30%。这意味着对于需要持续运行、频繁调用模型的智能体系统而言,性能提升不只是响应更快,也直接关系到部署成本与可持续运营能力。

支撑这些表现的关键,在于模型和训练方法的多项协同设计。Nemotron 3 Ultra 结合了 Hybrid Mamba Transformer、NVFP4 精度支持、LatentMoE 路由以及 Multi-Token Prediction 等技术,使其在长上下文效率、跨架构部署和生成吞吐上获得更优平衡。训练阶段则引入 Multi-Teacher On-Policy Distillation,让多个专长不同的教师模型对学生模型在不同领域进行异步评分和迭代优化,从而持续增强跨领域推理能力。

在数据层面,NVIDIA 也延续了 Nemotron 系列强调开放与可追溯的策略。官方披露,该版本建立在 10T token 预训练基础上,并额外补充了法律、通用知识与 GitHub 代码等高价值领域数据,同时发布新的监督微调样本、强化学习任务和环境。对企业与主权 AI 场景来说,这种更透明的数据与训练路径,有助于在评估模型能力的同时,更清楚其来源、偏向与可定制空间。

从实际落地角度看,Nemotron 3 Ultra 并不是孤立发布的模型,而是被放入更完整的智能体参考栈中。NVIDIA 同时强调了它与 Hermes Agent、NemoClaw、OpenShell 等组件的配合方式:由高能力模型承担复杂编排与推理,再借助安全运行时和开放式 harness 承接长期执行。对正在构建生产级智能体平台的团队来说,这释放出一个清晰信号——未来的竞争重点,不仅是谁的模型更大,而是谁能在真实多代理工作流中,以更低成本稳定完成复杂任务。