跳到主要内容
返回时间线
arXiv来源发表:

VISTA 视觉外挂让 Claude Opus 5.0 在 ARC-AGI-3 上把相对人类动作效率从 40.68 提升到满分 100.00,并以少 57.4% 的动作通关全部 25 个公开游戏

相关研究与后续进展

核心概要

作者提出 VISTA——一种为通用多模态模型提供长时程视觉的视觉外挂,让模型直接以视觉观察感知环境、以无损视觉记忆保留原始观察并主动检索重组视觉输入;在 ARC-AGI-3 上把 Claude Opus 5.0 的相对人类动作效率从 40.68 提升到满分 100.00,用比首次参与的人类少 57.4% 的动作完成全部 25 个公开游戏,并在另外三个覆盖多种视觉游戏与谜题的基准上大幅超过同一底层模型配最小外挂的基线。

Source-provided article image: VISTA: A Visual Harness for Reasoning in an Interactive World
Figure 1 ·

Figure 1: Comparison of different agent designs. (a) Language agents reason over textual observations. (b) Multimodal agents encode images into visual representations only once, but these representations may be compressed, lossy, and insufficient for subsequent reasoning, potentially limiting the models’ reasoning capabilities. (c) VISTA allows the multimodal model to iteratively call visual tools to retrieve past visual observations and reorganize its visual input as it reasons. For simplicity, we show the VLM as a vision transformer (ViT) encoder followed by an LLM. The two VLM blocks represent the same underlying model.

arXiv

深度剖析

VISTA 让通用多模态模型获得长时程视觉能力:模型直接通过视觉观察感知环境,并以无损视觉记忆按原始形式保存过去的观察,在推理过程中主动检索这些观察并重组视觉输入。 相对以往依赖最小外挂或压缩式记忆的交互式智能体方案,这里把“保留原始视觉观察 + 主动检索重组”作为外挂的核心机制,而不是让模型只处理当前帧或经过有损摘要的历史。 摘要以机制描述与 ARC-AGI-3 上的量化结果共同支撑:相对人类动作效率由 40.68 升至 100.00,全部 25 个公开游戏通关,动作数比首次参与的人类少 57.4%。

在 ARC-AGI-3 上,VISTA 把 Claude Opus 5.0 的相对人类动作效率从 40.68 提升到满分 100.00,并完成全部 25 个公开游戏。 该结果把同一底层模型在有无 VISTA 外挂之间的差距直接量化,说明提升来自外挂而非更换模型。 摘要给出具体分数(40.68 → 100.00)、游戏数量(25 个公开游戏)与动作节省比例(57.4%),属于同一基准上的对照式报告。

VISTA 的设计简单,能以极小适配自然扩展到多种视觉环境;在另外三个覆盖多种视觉游戏与谜题的基准上,它大幅超过使用同一底层模型配最小外挂的基线。 这表明该外挂不是针对单一基准的定制方案,而是可迁移到不同视觉交互任务的通用组件。 证据来自三个额外基准上与同模型最小外挂基线的对比,摘要称其“大幅超过”,但未在摘要中给出具体数值。

启示与展望

该工作面向需要长时程视觉与交互式推理的多模态智能体研究者与工程实践者,适用场景是模型可通过视觉观察感知环境、并需要保留与检索历史观察的交互式视觉任务。摘要所述结果集中在 ARC-AGI-3 与另外三个视觉游戏与谜题基准上,因此其直接适用范围是这类视觉交互环境;作者将 VISTA 定位为可通用、可最小适配迁移的视觉外挂,后续可在此基础上探索更多视觉环境与更长时程的任务。

摘要未说明 VISTA 的具体实现方式、视觉记忆的存储与检索机制细节,也未给出三个额外基准的名称与具体分数,因此这些对比的幅度只能从“大幅超过”这一表述了解。ARC-AGI-3 上的满分 100.00 与 57.4% 动作节省是在该基准与首次参与人类对照下取得的,向其他视觉环境迁移时的表现仍需以原文实验为准。此外,本次仅基于摘要进行总结,未读取正文、图表与附录,关于消融、失败情形与计算开销的问题仍属开放。

来源