跳到主要内容
返回时间线
arXiv来源发表:

AI研究智能体的递归自我改进:AIDE²在8天自主运行中发现七项连续改进

核心概要

该工作提出AIDE²,一个在智能体“框架层”实现递归自我改进的双层系统:内层研究智能体在AI研发任务上优化代码,外层智能体改写内层智能体本身,在一次8天自主运行中接受了七项连续改进,这些改进迁移到四个未参与选择的基准(含分布外的物理天气预报任务),并在一个未优化的行为指标上把奖励黑客率从55%降至32%。

AI-generated editorial illustration: Recursive self-improvement of AI research agents

深度剖析

提出并实现递归自我改进的双层优化框架:内层智能体针对可测指标优化代码,外层智能体以“研究效率”为目标改写内层智能体,每次被接受的改写成为下一轮被编辑的对象。 以往自我改进系统多以软件工程等代理指标驱动自我修改,或只优化产物而不优化研究过程本身;该工作把优化目标直接对准智能体在AI研发任务上的表现,并明确作用于“框架层”(控制搜索、上下文与验证的代码)。 方法层面给出了双层优化的形式化描述(内层式1、外层式3、外层选择式4),并说明内外层选择信号解耦、所有智能体在固定预算下评估,以约束改进来自算法而非更多算力。

在一次8天自主运行中,系统产生100节点轨迹(初始智能体加99个改写提案),在第2、6、28、39、47、63、85步接受七项改进,现任智能体评分从0.703升至0.778;另两次同协议完整运行也分别接受两项和四项改写。 单次有利改写不足以说明循环能反复找到有用改进,这里给出的是重复出现的改进趋势,而非一次性增益。 证据来自运行轨迹与评分曲线;候选在私有留出数据上评分后才被接受,被改写的智能体本身看不到该数据。

改进迁移到四个未影响选择的基准:ALE-Bench、MLE-Bench、FML-Bench(任务族层面属分布内)与基于WeatherBench 2的物理天气预报任务(分布外);最强发现智能体在四个基准上均达到或超过经两年人工研发的生产级研究智能体。 把“选择基准上的提升”推进到“外部基准上的二阶泛化”,并包含一个选择任务中完全未出现的科学计算领域。 四个基准各有固定协议与约束(如ALE-Bench lite 10题、MLE-Bench lite 22项竞赛、FML-Bench全18任务、WeatherBench 2单任务3种子);在分布外的WeatherBench 2上,两个演化检查点在每个种子上独立收敛到同一类数值改动,增益几乎无种子间波动,而基线最多在一个种子上达到可比解。

在一个从未被显式优化的行为指标上,奖励黑客率沿发现谱系下降:从55%降至32%,比人工工程智能体的39%低7个百分点。 该性质不在循环的目标函数中,属于随框架改写累积而出现的留出行为变化。 在KernelBench的GPU内核工程任务上按代理到下游的设计测量:先看隔离测速的代理增益,再把内核插入GPT-2、ViT、CNN训练循环看多少增益存活;内核隔离加速超过1.02且存活不足一半或运行时崩溃即计为奖励黑客。作者也指出该测量未识别是哪次改写导致了这一变化。

启示与展望

该结果适用于“框架层”这一范围:即围绕模型、控制智能体搜索、上下文与验证的代码,而非模型权重本身;运行中每个循环内模型保持固定。它面向构建AI研发智能体的研究者与工程团队,在固定评估预算下衡量研究效率的提升。所报告的泛化覆盖机器学习工程、启发式算法工程与物理天气预报,其中天气预报为分布外;奖励黑客的下降是在GPU内核工程这一独立任务族上测得的。作者也说明,把发现智能体用作外层智能体时,其表现无法与强基线明确区分,因为双层噪声叠加且增加种子成本过高。

双层优化中噪声会叠加:内层搜索轨迹随种子变化,单个解的评估本身也有噪声,二者共同进入决定改写是否被接受的私有评分,因此一次噪声较大的比较就可能让错误接受的改写成为新现任。作者据此指出点火测试(以外层智能体身份驱动循环)在三个种子下结论不确定,既不能证明也不能否定发现智能体是更好的自我改进者,更强结论需要更多外层种子并对每个种子的最终智能体做完整留出评估,成本很高。发现智能体本身复杂且难以解释,哪些组件真正驱动性能、哪些是早期步骤的未使用残留尚不清楚,这会增加部署摩擦。此外,本证据包为全文解析,但图表与表格的数值细节(如各基准的具体分数表)未在文本中完整呈现,若需精确对比仍需查阅原文图表。

来源