跳到主要内容
返回时间线
arXiv来源发表:

Memento 3 用自然语言规则手册加可执行代码,让冻结 LLM 智能体在 ARC-AGI-3 全部公开游戏通关并以 44% 人类动作数达到 RHAE 上限

核心概要

Memento 3 提出 Code as Model:冻结的 LLM 智能体把对环境的假设写成自然语言规则手册,编译为可执行代码用于预测与规划,并通过观察、反思、规则修订、编译、验证的循环持续修正两者;更新只有在 LLM 判定代码忠实于规则手册且逐格回放能复现全部已记录转移时才被采纳。在 ARC-AGI-3 上,单模型智能体通关全部公开游戏的全部关卡,平均 RHAE 达到上限,动作数为人类基线的 44%;Atari Pong 案例中学习到的反馈控制器在三个不同开局的对局中全部获胜,执行期不再调用 LLM。

Source-provided article image: Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
Figure 1 ·

Figure 1: From a rulebook to an executable world model. Numbered rules map to corresponding branches of a simplified transition function. A planner uses the model to predict a route that changes the badge’s pattern and colour, collects a refill, and reaches the matching door within the move budget.

arXiv

深度剖析

提出 Code as Model,把智能体的世界模型表示为自然语言规则手册(world_model.md)与其可执行实现(world_model_engine.py)的组合,规则手册承担语义记忆与规则级修订,代码承担预测、回放验证与规划。 Memento 系列此前把外部记忆用于策略侧:Memento 用情景记忆做持续适应,Memento 2 把记忆读写解释为策略评估与改进,Memento-Skills 扩展到可复用可执行技能;本文把反思学习推进到模型侧,即环境规则本身。 以确定性目标导向 POMDP 与 Bayes-adaptive POMDP 形式化,给出更新算子与控制的定义、五阶段循环(观察、反思、规则修订、编译、验证)以及接受条件:LLM 判定规则手册忠实性加逐格精确回放复现全部已记录转移。

在 ARC-AGI-3 全部 25 个公开游戏上,单模型智能体通关全部 183 个关卡,平均 RHAE 达到 100.0 的上限,总动作数 7,518,为人类基线 17,135 的 0.44。 对比系统来自 ARC Prize 官方记分卡:baseline1 同样通关全部游戏但用 8,347 个动作(约 0.49 人类预算),NOOA 为 85.1、OPINE-World 为 78.4、DreamTeam 为 38.1、Continual Harness 为 20.5,后四者均留有未通关游戏,其总动作数反映的是未完成运行。 所有基线数字(含逐游戏 RHAE、动作数、通关关卡数)与人类动作基线均取自各系统官方 ARC Prize 记分卡,计数口径一致;智能体只能观察动作接口,无法查看环境源码。

消融显示自然语言规则手册本身有贡献:在 ft09、ka59、cn04 三个难度带上,保留规则手册的版本在每个难度带都使用更少动作与更少智能体轮次,三局合计动作数更少、智能体轮次也更少,且所有运行都通关全部关卡并达到 RHAE 上限。 该消融在保持测试框架、回放验证器、计划执行器、骨干模型与推理强度逐字节一致的前提下移除规则手册,只留下代码世界模型,从而把差异归因于持久规则手册而非其他组件。 三个游戏分别代表按每关人类动作数划分的易、中、难难度带;动作数计的是计分环境交互,智能体轮次计的是完成所需迭代次数,不受墙钟延迟影响。

群体扩展让多个规则手册–可执行对共享同一交互历史,每个规划回合采样一个行为等价类;在 wa30 上以两个成员运行,总动作数从单模型的 899 降到 597,九个关卡中有八个的动作效率持平或更好,两者都通关全部九关并达到 RHAE 上限。 单模型点信念近似会锁定一个解释,若其动作从不暴露错误就可能自我确证;群体通过让不同模型引导探索来降低整轮运行对一次早期随机初始化的依赖。 骨干模型、推理强度与测试框架固定为单模型设置,只改变保留对数;执行期有通信机制同步两成员,告知哪个成员提供了当前计划、发送了哪些动作以及真实转移结果,使两者从同一证据更新。

启示与展望

该结果面向在有限真实动作预算下、通过黑盒交互学习确定性目标导向环境的智能体:ARC-AGI-3 的关卡被建模为确定性目标导向 POMDP,动作接口语义初始未知,智能体看不到环境源码或语言任务描述。规则手册与可执行代码持久保存并跨尝试与关卡复用,因此后续关卡引入新机制时仍可继续修订;Git 记忆让每次规则手册与模块版本可寻址、可 diff、可回退,便于智能体自己回顾已测试过的假设。群体扩展面向单次早期模型可能自我确证的情形,通过共享历史让不同模型引导探索。Atari Pong 案例说明同一机制可支撑反馈控制:控制器在评估期固定、不再调用 LLM,学习成本以模拟器帧计。

规则手册忠实性由冻结 LLM 判定,属于语义条件,其判定稳定性在文本中未给出量化刻画;群体扩展目前只在 wa30 上以两个成员验证,成员数更多时的行为未报告;消融只覆盖三个难度带各一个游戏,且作者说明每次 Claude Code 运行的时间与费用成本较高;Atari Pong 的评估为三个不同开局的对局,全帧回放仍保留渲染与球拍运动的残差误差;公开集在更强前沿模型下已接近饱和,因此单看公开集通关不足以隔离世界模型架构的贡献,模型选择与推理预算也需一并计入。

来源