NVIDIA 研究项目 Agentic Variation Operators(AVO)近日在交互式推理基准 ARC-AGI-3 公开集上取得 100.00 RHAE 的满分成绩,完成全部 25 个环境、183 个关卡。AVO 是 NVIDIA 面向长周期自主任务设计的通用智能体架构,其核心思路是让智能体在外部工具和持续反馈的支撑下,长期保持假设、行动、观察、修正的完整闭环。
AVO 此前已在软件工程与 GPU 内核优化任务上展现能力。在注意力内核研究中,AVO 连续自主运行七天,探索了 500 多个优化方向,提交了 40 个内核版本;在 DGX B200 平台上,其生成的多头注意力内核在评测配置上较 cuDNN 最高提升 3.5%,较 FlashAttention-4 最高提升 10.5%。
本次 ARC-AGI-3 评测中,AVO 采用纯文本交互方式,将每个观察点表示为 64×64 的文本网格,在无指令、无规则、无明确目标的环境中通过交互推断环境动态。使用 Claude Opus 5 作为底层模型,AVO 以 6,624 次环境动作完成全部公开集关卡,较对照系统 VISTA 的 7,542 次减少约 12%。NVIDIA 同时指出,该结果仅针对公开测试集,不代表半私有或私有竞赛集成绩。
NVIDIA 强调,评估模型并不等于评估智能体:模型能力固然重要,但决定能力能否转化为长期自主进展的是整个智能体系统,包括持久记忆、工具使用、反馈机制与故障恢复等环节。AVO 在不同任务间的迁移也说明,通用性不仅来自领域知识,也来自让推理与反馈随时间累积的系统机制。
相关论文《AVO: Agentic Variation Operators for Autonomous Evolutionary Search》已公开发布,ARC-AGI-3 基准与评分方法文档亦可从 ARC Prize 官网查阅。
WeChat
Profile