NVIDIA 的 AVO 智能体架构在 ARC-AGI-3 公开集 25 个环境全部通关,取得 100.00 RHAE 并完成 183 个关卡
相关研究与后续进展核心概要
NVIDIA 将通用长时程智能体架构 AVO 从 GPU 内核优化迁移到 ARC-AGI-3 交互推理基准,在公开集 25 个环境、183 个关卡上以 100.00 RHAE 全部通关,共使用 6,624 次环境动作,并报告其持久记忆与监督机制支撑跨领域的持续自主推进。
深度剖析
同一套 AVO 架构在两类差异极大的任务上都完成了长时程自主工作:在注意力内核研究中连续运行七天、探索 500 多个优化方向、产出 40 个提交版本;在 ARC-AGI-3 公开集上完成全部 25 个环境、183 个关卡。 以往长时程智能体工作多与特定领域绑定,本文把 GPU 内核优化与交互式推理放在同一架构下对照,说明可迁移的是“持续自主推进的机制”而非领域知识。 以两次完整运行的规模指标为证:七天连续运行、500 多个探索方向、40 个提交内核版本,以及公开集 25 个环境、183 个关卡全部完成;作者同时说明这不是受控消融。
AVO 在 ARC-AGI-3 公开集取得 100.00 RHAE,用 6,624 次环境动作完成 183 个关卡;文中引用的 VISTA 在相同公开集关卡上报告 7,542 次动作,AVO 约少用 12% 动作。 把“模型评测”与“智能体系统评测”区分开:同一模型家族在不同智能体系统与评测设置下表现不同,ARC Prize 另行报告 Claude Opus 5 在 High 推理档约为 30%。 跨系统比较,作者明确说明两系统在智能体后端、观测表示、记忆、上下文管理等方面不同,因此不构成受控消融,12% 的差异不能归因于单一组件。
AVO 以持久记忆和监督两个机制维持跨上下文进展:记忆携带先前实现、评测结果、编译器与性能分析输出及累积推理;监督器监测停滞或重复无效循环并重定向主智能体。 把长时程能力定位为系统属性——记忆决定什么被保留、工具决定可执行动作、反馈为进展提供依据、恢复能力让工作超越单次模型调用。 机制描述配合七天内核运行中的角色分工说明(主智能体决定检查、修改、测试与评估,监督器在搜索停滞时帮助维持推进);文中指出该实验未单独分离记忆系统的贡献。
在 ARC-AGI-3 配置中,模型以纯文本模态接收精确的 64 x 64 文本网格观测,不发送图像或图像 token,且只获得可用动作而不含规则或目标描述,需通过交互推断其效果。 与 VISTA 主配置使用 512 x 512 渲染 PNG 的观测接口不同,也与 Tycho 的显式可执行世界模型路线不同,本文采用直接交互设计并独立重实现任务接口。 接口与模态的明确说明,加上对 VISTA、Tycho 路线的对照描述;作者强调任务接口部分元素受 VISTA 启发,但智能体后端根本不同。
启示与展望
该结果适用于 ARC-AGI-3 的 25 个环境公开集,使用官方记分卡与 RHAE 指标,不涉及半私有或完全私有竞赛集。对读者而言,这为在长时程、反馈驱动的任务上复用同一智能体架构提供了可参照的案例:需要持续状态、工具接口、执行验证与失败恢复的场景,例如软件工程与 GPU 内核优化,以及规则与目标未明示的交互式环境。文中也把跨模型运行作为设计目标,并给出与 GPT-5.6 Sol 在部分游戏子集上的初步配对观察,供后续系统比较参考。
跨系统动作数比较(6,624 对 7,542)涉及智能体后端、观测表示、记忆与上下文管理等多处差异,作者明确说明这不是受控消融,因此 12% 的动作差异不能归因于某一组件。ARC Prize 报告的约 30% 来自同一模型家族的不同推理档与不同智能体系统及评测设置,不能作为 AVO 贡献的直接度量。记忆系统在长时程中的作用尚未被单独分离;与 GPT-5.6 Sol 的配对实验仅覆盖部分游戏子集,更系统的跨模型比较仍待开展。此外,本文为项目介绍性文章,未给出完整实验表格与统计细节,读者若需复现应查阅其引用的论文与基准评分方法。
