arXiv 2026年10月6日DUET把求解器智能体与评分器智能体都当作优化目标,每轮自适应挑选训练任务、由求解器执行、由评分器打分并给出有证据支撑的评语,再用带工具的更新模块在求解器与评分器之间交替修订其可优化组件(系统提示或技能库),训练不使用参考答案或真值标签;在SpreadsheetBench、GDPval、τ-Bench与Finance Agent Benchmark四个基准上,DUET同时提升求解器与评分器表现,并在求解器指标上超过使用固定评分器的SkillOpt与GEPA,甚至超过它们使用基准参考评估器的版本。DUET把求解器智能体与评分器智能体都当作优化目标,每轮自适应挑选训练任务、由求解器执行、由评分器打分并给出有证据支撑的评语,再用带工具的更新模块在求解器与评分器之间交替修订其可优化组件(系统提示或技能库),训练不使用参考答案或真值标签;在SpreadsheetBench、GDPval、τ-Bench与Finance Agent Benchmark四个基准上,DUET同时提升求解器与评分器表现,并在求解器指标上超过使用固定评分器的SkillOpt与GEPA,甚至超过它们使用基准参考评估器的版本。DUET让求解器与评分器智能体交替共同进化,在四个智能体基准上同时提升任务执行与评分一致性DUET把求解器智能体与评分器智能体都当作优化目标,每轮自适应挑选训练任务、由求解器执行、由评分器打分并给出有证据支撑的评语,再用带工具的更新模块在求解器与评分器之间交替修订其可优化组件(系统提示或技能库),训练不使用参考答案或真值标签;在SpreadsheetBench、GDPval、τ-Bench与Finance Agent Benchmark四个基准上,DUET同时提升求解器与评分器表现,并在求解器指标上超过使用固定评分器的SkillOpt与GEPA,甚至超过它们使用基准参考评估器的版本。DUET把求解器智能体与评分器智能体都当作优化目标,每轮自适应挑选训练任务、由求解器执行、由评分器打分并给出有证据支撑的评语,再用带工具的更新模块在求解器与评分器之间交替修订其可优化组件(系统提示或技能库),训练不使用参考答案或真值标签;在SpreadsheetBench、GDPval、τ-Bench与Finance Agent Benchmark四个基准上,DUET同时提升求解器与评分器表现,并在求解器指标上超过使用固定评分器的SkillOpt与GEPA,甚至超过它们使用基准参考评估器的版本。