跳到主要内容
返回时间线
arXiv来源发表:

AREX-2 用长程反思轨迹训练 27B 智能体,MLE-bench Lite 达 81.8、BrowseComp 达 84.0

核心概要

AREX-2 把智能体的自我改进定义为测试时用更多轮次迭代出更好解,并从机器学习工程与算法编程任务中合成含失败与回退的长程改进轨迹,微调 Qwen3.8-27B 后取得 MLE-bench Lite 81.8、Frontier-CS 70.7,并在未新增深度研究数据的情况下把 BrowseComp 提升到 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,且随轮次预算增加持续提升。

AI-generated editorial illustration: AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

深度剖析

论文把自我改进拆成两种互补能力:反思决定一轮能带来多少增益,长程执行决定有多少轮仍然有效,并给出总改进约等于两者乘积的形式化描述。 以往智能体系统把重试与保留策略放在外部脚手架里,模型只负责单次尝试;这里把循环移入模型内部,并把自我改进定义为同一任务上的测试时扩展。 该结论来自论文的形式化推导与对现有训练数据“一次尝试一条样本”的观察,属于概念与框架层面的论证。

作者用教师模型把 GitHub 仓库与在线评测题编译成可执行环境,再让教师智能体在数小时、数百次工具调用的预算下反复提交与修订,从而得到包含失败、回退与被放弃方案的长程轨迹。 轨迹以整体成败筛选,只要求最终分数高且过程合规,不要求单轮成功,因此失败与回退被保留下来作为学习信号。 环境准入由两次执行检查把关:参考解必须能跑出分数,简单基线必须明显低于参考解,以保证环境留有改进空间。

在 MLE-bench Lite 上 AREX-2 取得 81.8,为对比表中最高,比最强基线 Naive-N0.5-Flash 高 8.1 分、比最强闭源基线 GPT-5.6 Sol 高 9.1 分;在 Frontier-CS 上取得 70.7,比最强开源基线高 16.0 分。 这些成绩由 27B 参数模型取得,而对比对象中包含参数量远大于它的系统。 MLE-bench Lite 报告 Any Medal 并取三个随机种子平均,Frontier-CS 采用 Agent Track 官方设置、每题最多 5 小时,MLE-Lite 采用 OpenMLE 协议、每题最多 12 小时。

深度研究四个基准上 AREX-2 达到 BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,且未新增任何深度研究训练数据,全面超过上一代 AREX(4B)与 AREX(122B)。 新增轨迹中没有搜索类任务,深度研究数据与上一版配方保持一致,因此提升可被读作跨域迁移的证据。 论文同时给出轮次扩展曲线:BrowseComp 上准确率从 47 轮的 64.8 升到 143 轮的 84.0,每轮增益约为 AREX 的三倍,且模型规模不到其四分之一。

启示与展望

这项工作面向需要在同一任务上反复尝试、且能获得可验证反馈的场景,例如机器学习工程与算法编程;其数据构建依赖 GitHub 仓库与在线评测题这类反馈明确、可持续改进、来源充足的领域。对深度研究等没有外部正确性信号的场景,论文展示了模型依靠自身判断继续搜索与修订也能提升,但适用前提是任务允许长轮次预算。消融显示,操作知识(通用技能与任务相关技能)与更多轮次可把基座模型从 28.8 提升到 68.2,训练再在此基础上把同技能同轮次条件下的成绩提高 13.6 分,因此该方法对愿意投入推理预算与技能上下文的部署方最有价值。

论文自述在最强 BrowseComp 与 HLE 成绩上仍存在差距,说明迁移并非在所有基准上都达到前沿水平。轮次扩展曲线显示收益随时间递减,因此更大预算的边际价值需要按任务判断。轨迹筛选以最终分数与过程合规为准,其中“过程合规”的判定细节在本文范围内未展开。此外,技能在 MLE-Lite 评估时保留在上下文中,技能与训练各自的贡献由消融给出,但技能在测试时的具体作用机制仍是开放问题。作者提出的下一步是拓宽训练域、拉长时程,并让模型自身轨迹成为下一轮训练数据。

来源