任务进度蒸馏让1.7B小智能体在ALFWorld上以404条演示达到72.4%未见任务成功率
核心概要
该工作提出任务进度蒸馏(TPD),在离线条件下把教师演示中的每个动作与一个简短任务阶段标签配对,学生通过联合打分可行动作与阶段对来选择动作;在ALFWorld上,1.7B学生用404条演示在TPD或仅动作监督下均达到72.4%平均未见任务成功率,而用受限动作选择的推理训练学生为48.3%;显式阶段在200条演示时把成功率从48.0%提升到67.7%,演示增多后仅动作监督追平,两者在808条时均达76.9%。
Figure 1 : Offline training and closed-loop execution. (a) A frozen annotator reads each teacher-history prefix and pairs the current task stage with the demonstrated action for student SFT. (b) The student scores 3 | 𝒜 ( h t ) | 3|\mathcal{A}(h_{t})| stage–action candidates, and the harness executes the action from the highest-scoring pair. The next input includes the action and environment feedback; the predicted stage is logged only for analysis.
arXiv深度剖析
提出任务进度蒸馏(TPD):把教师演示的每个动作与一个描述当前任务阶段的短标签配对,学生用联合打分在可行动作与阶段对上选择动作,由确定性执行框架送入环境。 相比仅模仿动作或模仿长推理轨迹的做法,TPD用短阶段标签替代长推理目标,并把阶段作为打分上下文;阶段标签由冻结标注器依据动作前可用的环境反馈生成。 在ALFWorld六个任务族上,用Qwen3-1.7B、三个训练种子、四个演示预算(98/200/404/808条轨迹)进行完整参数SFT,主评测覆盖全部134个valid_unseen任务,50步上限。
紧凑监督本身就能训练出有效的小智能体:仅动作监督(C)与TPD(B)在404条演示时均达72.4%平均未见成功率,808条时均达76.9%。 此前从演示学习智能体的报告多依赖更大模型或更多演示;这里1.7B模型用数百条LLM教师演示即达到该水平,且评测时不调用教师。 结果为三个种子的均值;教师参考为88.1%(118/134),808条演示时留有11.2个百分点差距;与外部方法的比较是已报告系统的对照,训练与评测协议不同。
显式任务阶段在中间演示预算下带来额外收益:200条演示时TPD达67.7%,仅动作监督为48.0%,相差19.7个百分点,三个种子分别领先29.9、19.4、9.7个百分点。 阶段标签的增益并非在所有预算下都出现:98条时增益为5.5个百分点,404与808条时均值差距为零,说明其价值集中在演示有限的中间区间。 配对结果显示200条时B单独成功89/402次种子–任务评测,C单独成功10次;808条时各自单独成功25次,说明均值相等并不代表成功集合相同。
共享历史分析把TPD的部分局部优势与子目标切换决策联系起来:在38个固定前缀上,200条演示时匹配阶段固定后83.3%的评测选出推进动作,两个不匹配阶段平均为65.4%;15个仅B推进的案例中11个对阶段条件敏感,其中9个涉及加热的transform阶段。 该分析在相同交互历史下比较下一动作,并加入常量阶段与打乱阶段对照:打乱标签后seen任务成功率从55.2%降至37.6%,说明标签与当前进度对齐是关键。 打乱对照使用三个种子、116个seen任务;共享历史分析覆盖72个前缀、三个预算、三个种子,且作者说明这些是探索性分析,其对整集成功率的贡献需要闭环干预才能确定。
启示与展望
该结果面向具备可行动作集合与完整交互历史的环境,以及能提供任务进度规则的任务类型;作者指出实验覆盖一个环境(ALFWorld)与一个学生模型规模(Qwen3-1.7B),标注器通过手工定义的进度规则提供任务知识。对希望以数百条演示训练小智能体的读者,这提供了可复现的配方:紧凑序列化、仅补全损失、候选打分与确定性执行框架,以及用seen探针做检查点选择。阶段标签的额外价值集中在演示有限的中间预算,适合在演示获取成本高、又需要多步子目标切换的任务上优先尝试。
阶段敏感性与仅B推进案例的重叠只覆盖三个任务、五个前缀,且从全联合打分切换到仅动作值打分后,11个案例中只有2个保持B所选动作,说明该重叠对打分规则敏感。作者指出多个因素在比较中同时变化(目标长度、动作token占比、候选数量、标签可预测性),当前结果未分离这些贡献;三个种子只衡量同一固定数据集上的训练波动;打乱与共享历史分析是在seen分布上的探索性研究。输出token计数只描述轨迹文本,不含候选打分计算,端到端延迟与总训练成本仍待测量。此外,若读者只看到快速解析而缺少表格与图,配对结果、seen诊断与外部对照的具体数值需要回到原文核对。
