跳到主要内容
返回时间线
arXiv来源发表:

冻结基础模型上的编码智能体在ARC-AGI-3中跨任务重写并丢弃74%脚本,把硬编码常量改为参数以修复负迁移

核心概要

作者提出一套测量协议,仅凭编码智能体写下的脚本与笔记,追踪其在ARC-AGI-3的关卡边界上如何保留、改写或丢弃知识;在来自两个模型家族、三个骨干的七次运行中,脚本几乎不跨任务复用(630次引用中仅33次跨边界),74%的边界前脚本被丢弃,笔记只增不删,而最昂贵的错误是把硬编码值带入新任务,唯一有效的修复是把常量改成必须逐任务重新提供的参数。

Source-provided article image: Tracing the Thoughts of a Coding Agent Playing ARC-AGI-3: Lessons for Continual Learning
Figure 1 ·

Figure 1: The loop, taken unmodified from PRO-LONG ( Fox et al., 2026 ) , with runs differing only in backbone, prompt and operating mode (Table 1 ). The analyzer, the only component that makes a decision, reads logs.txt and writes its intended actions to actions.json . The runner issues one action at a time, appends each action and the returned board to logs.txt , and invokes the analyzer again once its queue empties, discarding any queued plan when the score changes.

arXiv

深度剖析

提出一套无需访问模型的白盒测量协议:把每个脚本归属到写入时打开的任务,从而在七次运行、689个关卡边界上得到4,786个脚本的可计数结果,把保留与迁移从只能由任务表现推断变为可直接从文件读出。 此前持续学习研究多从任务表现估计保留与迁移,且知识表示由设计者预先选定;这里知识表示由智能体自己以文件形式写出,因此保留、改写与丢弃可被直接读取。 协议定义四类边界后结果(按引用复用、按复制复用、改写、丢弃),全部仅由文件内容判定;边界由运行日志的时间戳恢复,Qwen运行因控制台日志未保留而改用交互记录中的关卡号,三个未写该记录的Qwen游戏被排除,因此94%的Qwen脚本与全部Anthropic脚本被归属。

跨任务更新以重新推导而非引用发生:脚本几乎不跨关卡被调用,因为多数脚本在导入时即执行并嵌入当前关卡状态,关卡一变即失效。 技能库类设计假设可复用过程集合只增不减,而这里的边界计数显示相反:跨边界迁移的是被复制的函数体,而不是被保留的工件。 七次运行中共630次脚本导入或exec,其中597次发生在同一关卡内,仅33次跨关卡;273个被引用脚本中263个在导入时即运行代码,229个在该代码中嵌入五个以上数字,例如R4游戏sp80的L5模拟器以ROWS=19与COLS=19固定棋盘尺寸,导入它的四个脚本全部写于L5。函数体跨脚本重复出现562次,其中72对跨越关卡变化,多于按引用的33次。

改写是主要跨边界行为,其单位是单个脚本,新版本多为重打而非扩展,保留与关卡无关的规则、丢弃关卡特定细节。 改写被刻画为智能体区分“游戏法则”与“本关事实”的时刻,这一区分此前只能从表现间接推断。 七次运行中2,319个脚本写于边界之前,其中523个在边界之后被改写;R4中734个脚本有230个是旧脚本的新版本,101个脚本达到两个及以上版本,一个达到十二个。改写时新版本丢弃旧版本函数的比例在R4为56%,R2与R3为62%与61%,R1为38%,R5、R6、R7为73%、74%与52%。游戏su15的L6模拟器原样保留L5模拟器的五个函数并替换四个(玩家移动的圆盘、棋盘上的棋子、追逐单位与获胜条件)。

丢弃是最常见结果,笔记只增不删,而最昂贵的失败是来自陈旧记忆的负迁移,其有效修复是把常量变为参数。 负迁移被定位为“在一个任务为真、在下一个任务为假”的信念,这类信念无法被第一个任务的日志暴露;修复改变的是信念的存储形式,而这一形式只存在于脚本中,笔记没有。 2,319个边界前脚本中1,726个(74%)既未被改写也未被复用,各运行丢弃比例为R3 60%、R2 73%、R4 74%、R1 88%、R5 84%、R6 93%、R7 100%。笔记中修正以追加而非删除方式出现:R4游戏wa30先写两格玩家模型,后以KEY MECHANIC CORRECTION改为一格,八十个动作后又以MAJOR REVISION恢复两格,两个版本相隔65行并存且都未标注撤回。游戏m0r0的水平控制镜像,三次Opus 5运行都把L4方向带入L5;两次运行把固定值改为参数(def solve(polarity, ...)与S3 = int(sys.argv[1])),在L6几个动作内确定方向,而R4把值放在字典中编辑,把L5的值带入L6再次失败。

启示与展望

该协议面向把知识写入文件系统的编码智能体,适用于任务边界未宣告、只有分数反馈的设定,例如ARC-AGI-3中同一局内关卡切换;它使保留、改写、复制与丢弃成为可直接计数的量,便于比较不同骨干与提示条件下的记忆行为。对设计智能体记忆的读者,可直接使用的线索是:把随任务变化的量存为必须逐任务提供的参数,并让可执行规则而非散文承担校验。由于没有重访已通关卡,反向迁移未被定义,所计遗忘是工件的处置而非能力的丧失。

结果来自ARC-AGI-3的25个演示游戏与七次运行,其中Qwen运行的控制台日志未保留、三个游戏被排除,因此边界恢复依赖交互记录中的关卡号;不同骨干的丢弃比例差异较大(60%至100%),提示条件与动作上限也不同,跨骨干的定量比较需谨慎。笔记的“只增不删”与“由日志裁决矛盾”是否在其他记忆形态或更长回合下保持,仍是开放问题。此外,本文为快速解析版本,图表内容未包含在文本中,涉及图1至图3的具体细节无法在此核对。

来源