跳到主要内容
返回时间线
arXiv来源发表:

智能体的“品味”:用轨迹事后证据测量并训练长程决策

核心概要

该工作把智能体在长程任务中“在结果可见之前选对方向”的能力定义为品味,用已有智能体轨迹中的分叉点自动构建了502道题的Taste-Bench基准,发现最强模型仅答对59.7%,且分叉的决定性证据出现越晚越难、增加推理预算无改善,同时通过把“已知答案的教师”的推理蒸馏进学生模型,使学生在未见任务上的判断提升17.9个百分点,并在留出的SWE-bench Pro任务上把执行成功率从14.6%提升到33.7%。

AI-generated editorial illustration: The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

深度剖析

把“品味”形式化为决策分叉上的二选一判断,并用轨迹自身的事后结果自动打标签。 既有长程基准只报告任务是否完成,不衡量沿途决策质量;该工作指出轨迹后段为前段决策提供事后证据,并利用同一任务的多次尝试在分叉处共享前缀、随后分道扬镳这一结构,把“除判断外其余条件相同”的比较从已有轨迹中挖出来。 方法上给出形式化定义与两种构造(平行轨迹、绕路轨迹),并说明标签来自记录的结果(测试通过或实验目标达成);作者对100道抽样题做人工复核,在172个明确A/B判断中170个与挖掘标签一致,即98.8%一致率。

发布Taste-Bench:502道覆盖软件工程与机器学习研究的品味题,并给出当前前沿模型的成绩分布。 此前没有专门测量智能体品味的基准;该基准由4657个候选分叉经生成器与四个评委模型过滤后保留10.8%构成,工程390题、研究112题,且每题以正反两种顺序各评一次,只有两次都答对才算正确。 评测覆盖14个当代模型,统一接口与token预算;最佳模型GPT-5.6 Sol平均准确率59.7%,GPT-5.5为59.5%,随机猜测为25%,始终偏好同一位置的模型为0%;各单元格均值显示平行工程58.1%、平行研究50.9%、绕路研究50.8%、绕路工程35.9%。

分叉的时间跨度决定难度:决定性证据出现越晚,模型越接近随机猜测,而增加推理预算并不改善。 该工作为每个分叉标注“时间跨度”四个等级(前缀内、可推断、下一步、更多工作),把“长程”从直觉变成可测量量,并检验推理预算是否是准确率下降的原因。 14个模型的均值从前缀内62.3%降到更多工作21.0%,接近25%的随机水平;在两个模型上改变推理强度形成六种条件、共6024条回答,从最低到最高设置的变化在置信区间内不显著,且模型在准确率最低的“更多工作”等级反而生成最多推理token。

品味可以被训练:把“看过结果”的教师的推理蒸馏进学生模型,判断能力可迁移到未见任务并提升端到端成功率。 该工作不只测量品味,还利用题目自带的两候选加结果监督,用同一冻结基座模型在不同上下文下充当教师与学生,做token级前向KL蒸馏,从而把上下文中的判断转入权重。 在390道工程题按任务切分的两折上,学生在留出折的准确率从基座30.0%升到47.9%,两顺序平均从42.7%升到62.4%,即提升17.9个百分点;在41个留出的SWE-bench Pro任务上,正确建议把成功率从14.6%提到39.0%(上界),学生建议达到33.7%,提升19.1个百分点。

启示与展望

该结果面向已能产生大量轨迹的智能体系统:只要同一任务存在多次尝试或单次运行中的自我纠正,就能挖出分叉并自动打标签,因此基准可随轨迹产出而扩展。它适用于软件工程与机器学习研究这两类已有轨迹池的场景,蒸馏实验也在这两类任务上验证;对缺少可比较结果信号、或结果无法清晰归因于判断的领域,这套构造并不直接适用。

读者仍会关注:标签质量依赖生成器与四个评委模型,评委在平行工程单元格的成对一致率为51.7%,说明判断本身存在分歧;与SWE-bench Verified的相关性在工程子集上仅约0.2且置信区间较宽,两个基准的排序关系尚不稳定;蒸馏实验只在一个基座模型与工程题上验证,研究题上的迁移效果未报告;端到端实验仅41个任务、98个分叉,且“正确建议”的上界与学生建议之间仍有差距。此外,本次读取为全文,但图表与部分附录表格以文本形式呈现,个别数值(如部分置信区间与相关系数)在文本中未完整给出,若需精确复现应查阅原文图表。

来源