DUET让求解器与评分器智能体交替共同进化,在四个智能体基准上同时提升任务执行与评分一致性
相关研究与后续进展核心概要
DUET把求解器智能体与评分器智能体都当作优化目标,每轮自适应挑选训练任务、由求解器执行、由评分器打分并给出有证据支撑的评语,再用带工具的更新模块在求解器与评分器之间交替修订其可优化组件(系统提示或技能库),训练不使用参考答案或真值标签;在SpreadsheetBench、GDPval、τ-Bench与Finance Agent Benchmark四个基准上,DUET同时提升求解器与评分器表现,并在求解器指标上超过使用固定评分器的SkillOpt与GEPA,甚至超过它们使用基准参考评估器的版本。
深度剖析
DUET把评分器从固定的反馈来源变成与求解器并列的优化目标,通过交替更新让任务执行与评估共同进化。 此前的智能体优化方法(如GEPA、SkillOpt)在优化求解器时保持评分器固定,而DUET在优化循环内更新评分器。 在四个基准上,DUET的求解器表现均优于固定评分器基线;在Finance Agent Benchmark上DUET达到96.5%的评分,高于未优化求解器的92.8%、SkillOpt的94.0%与GEPA的94.4%,也高于使用基准参考评估器的SkillOpt(95.7%)与GEPA(95.9%)。
共同进化同时提升了评分器自身的评估能力。 评分器在训练过程中从最小初始化出发,发展出更可靠的评分与评语能力,而基线方法不产出训练后的评分器。 在Finance Agent Benchmark上评分器成对一致性从初始的67.9%提升到75.0%;在GDPval上从68.4%提升到78.5%,提升10.1个百分点;在τ-Bench与SpreadsheetBench上因参考评估器只提供二元结果,一致性仅小幅变化(88.7%到89.3%,71.9%到72.8%)。
三个设计要素——交替更新、自适应任务选择与有界组件更新——各自对DUET的效果有贡献。 消融实验把这些设计选择与整体性能联系起来,而非仅报告最终结果。 在Finance Agent Benchmark上,自适应任务选择把求解器从95.9%提升到96.5%、评分器一致性从62.7%提升到75.0%;交替更新把求解器从95.4%提升到96.5%、评分器一致性从70.1%提升到75.0%;仅优化评分器而固定求解器时,一致性只从67.9%提升到68.8%。
DUET可扩展到系统提示之外的组件,并对不同底层模型与不同提示初始化保持稳健。 DUET可联合优化系统提示与技能库,并在空、有信息与对抗性初始化下均能改进两个智能体。 在τ-Bench上联合提示与技能优化达到91.9%成功率,高于仅提示优化的89.4%、SkillOpt的83.3%与GEPA的84.4%;在Finance Agent Benchmark上对抗性初始化下求解器从91.1%提升到95.8%,有信息初始化下从93.3%提升到95.0%,且DUET在首次更新中即移除有害的对抗性指令。
启示与展望
该框架面向开放式智能体任务,训练更新不使用参考答案或真值标签,默认仅用带标签的验证集做检查点选择与早停,也验证了无验证选择的固定预算变体。它适用于可表示为系统提示、技能库或其组合的可优化组件,底层模型、工具与执行环境保持固定。结果覆盖电子表格操作、多轮客服工具使用与检索增强问答四类基准,并在不同底层模型与空、有信息、对抗性提示初始化下评估。对于希望在新任务集合上引导评估、又缺少现成评分规则或参考答案的团队,这一设置说明评分实践可以与求解器改进同步发展。
评分器评估依赖基准参考评估器而非人工判断,作者将此列为范围限制;在τ-Bench与SpreadsheetBench上,参考评估器只提供二元结果,成对样本主要反映粗粒度的通过/失败差异,更细微的评分判断改进可能未被这些基准捕捉。超参数消融中探索系数的差异相对观测到的方差较小。此外,加载文本中部分表格与公式的具体数值未完整呈现,因此某些消融与成本比较只能依据正文叙述,读者若需精确数字应查阅原文表格。
