业务目标
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
一个前沿大语言模型只是 AI 智能体的一部分,真正决定智能体如何接收上下文、调用工具、维护状态、应对反馈并从失败中恢复的,是环绕模型的智能体系统,即常说的“harness”。如何构建能让前沿模型在长时程多步任务中稳定工作的通用智能体架构,是当前智能体研究的关键问题。NVIDIA 研究项目 Agent
查看方案背景、关键能力与适配场景,帮助你更快判断下一步应进入测试、咨询还是部署阶段。
一个前沿大语言模型只是 AI 智能体的一部分,真正决定智能体如何接收上下文、调用工具、维护状态、应对反馈并从失败中恢复的,是环绕模型的智能体系统,即常说的“harness”。如何构建能让前沿模型在长时程多步任务中稳定工作的通用智能体架构,是当前智能体研究的关键问题。NVIDIA 研究项目 Agentic Variation Operators(AVO)正是针对这一挑战提出的通用智能体架构,其成果已在 ARC-AGI-3 基准上达到满分。
AVO 最初在难度极高的软件工程与 GPU 内核优化任务上得到验证。在这类任务中,智能体必须检查既有实现、形成假设、修改代码、执行基于硬件的测试、解读反馈并反复调整方案,单次响应的代码生成远不足以解决问题。在注意力内核优化实验中,AVO 连续运行七天,探索超过 500 个优化方向,产出了 40 个已提交的内核版本;在 NVIDIA DGX B200 系统上,所得到的多头注意力内核在测试配置中最高比 cuDNN 快 3.5%、比 FlashAttention-4 快 10.5%,随后智能体又仅用约 30 分钟将内核适配到分组查询注意力(GQA)。
支撑 AVO 长时程自主运行的两大机制是持久记忆与监督器。持久记忆将先前的实现、评估结果、编译器与性能分析器输出以及累积的推理过程携带到后续迭代,使智能体能够从当前状态继续而非反复重建搜索;监督器则持续监控整体搜索轨迹,在进展停滞或陷入无效循环时引导主智能体转向替代策略。在七天的内核优化运行中,主智能体始终负责决定检查什么、改什么、测什么,监督器则在搜索陷入平台期时帮助维持前进动力。
NVIDIA 团队随后将同一套 AVO 架构应用到 ARC-AGI-3 交互式推理基准上。该基准将智能体置于完全陌生的类游戏环境中,不给任何指令、显式规则或目标,智能体必须通过交互探索推断环境动态与目标,并在逐步加难的关卡中高效规划行动。AVO 在 ARC-AGI-3 公开集全部 25 个环境中取得 100.00 的 RHAE 分数,完成全部 183 个关卡。RHAE(相对人类行动效率)将任务完成度与相对新手人类基线的单关卡行动效率相结合,是极具挑战的长时程智能体任务指标。
这一结果传递的核心观点是:评估模型不等于评估智能体。GPU 内核优化与 ARC-AGI-3 表面上看截然不同——前者涉及源码、编译器与吞吐,后者是陌生交互环境中的目标发现——但底层计算模式一致:从不完整证据构建假设、通过外部接口行动、观察后果、保留有用状态、修正问题模型、从错误假设中恢复,并在长时程中持续推进。领域在变,反馈通道在变,核心智能体循环不变。AVO 证明了围绕模型构建的智能体系统,是把模型能力转化为可持续自主进展的关键。
在进入报价、测试或实施前,先把业务目标、现网条件和风险边界整理清楚。
明确要解决的性能、扩容、稳定性、覆盖、互连或运维问题,并确认上线优先级。
整理拓扑、服务器/交换机型号、接口速率、链路距离、供电散热和现有管理平台。
确认是否需要 PoC、兼容测试、吞吐测试、时延测试、无线覆盖测试或故障切换测试。
确认交付窗口、责任分工、备件策略、培训需求、验收指标和后续扩容路径。
先回答“适合谁、如何评估、下一步怎么做”,再决定是否继续进入测试与实施阶段。
如果你已经明确业务规模、性能目标和实施时间,这类方案更容易直接转化为可执行的落地路径。
对兼容性、吞吐、延迟和交付风险有要求的项目,更适合先通过 PoC 或测试申请把关键问题前置。
业务规模、接口需求、现网架构和时间节点越清楚,后续选型、测试和部署节奏越容易收敛。
适合已经明确业务目标,需要继续判断网络架构、产品组合和实施路线的团队,用于加快技术评估与落地决策。
建议准备业务规模、性能目标、现网架构、关键接口、时间节点,以及是否需要测试验证等信息。
可以。对于需要验证兼容性、性能或交付风险的项目,可先进入咨询、测试申请和 PoC 节奏,再推进部署。
可在当前方案基础上继续沟通品牌方向、业务场景、计划规模和时间要求,再细化产品组合、测试路径和实施建议。
建议先看业务目标、现网瓶颈、性能指标、扩展规模、上线窗口和预算约束,再判断方案架构与产品组合是否匹配。
需要前置确认兼容性、链路带宽、时延要求、设备供电与散热、施工窗口、测试范围和交付责任边界。