AdviSD 让 Qwen3-8B 小顾问选择性学习反馈修正,在 BFCL-v3 上比 advisor-GRPO 高出 4.2–6.4 个百分点
核心概要
该工作提出 AdviSD:用一个可训练的小顾问(Qwen3-8B)通过自然语言建议引导冻结的前沿执行模型(Gemini 3.7 Flash、Claude Sonnet 4.6),把结果奖励的 GRPO 与“有选择性”的反馈条件自蒸馏结合——由反思提出修正,再用顾问在“带建议”与“不带建议”两种上下文下对同一段已记录执行器响应的打分差幅来挑选要监督的决策,从而在 BFCL-v3 上比 advisor-GRPO 高 4.2–6.4 个百分点、在 EnvScaler 上高 3.9–5.1 分,并超过同数量的随机选择与无门控变体。
深度剖析
论文给出一个关于“该保留哪些修正”的理论说明:在共享参数模型中,若来自持续失败(对执行不敏感)的修正所指向的目标对“有用建议”的偏好弱于其他修正,那么随着建议变好、可避免的失败变少,这类修正占监督的比例上升,会限制学习所能达到的水平;把它们保留得比其他修正更少,可以提高最终性能(定理 1–2)。 此前反馈条件自蒸馏(如 SDPO、DistIL)主要关注如何构造教师或分配监督,而这里把问题定位在“顾问的建议要经过另一个模型才起作用”,因此拟合教师与改善执行是两件事(引理 1)。 证据为形式化分析:引理 1 在固定前缀、固定完成与执行律下给出梯度恒等式;定理 1–2 在两类情境、单一共享 log-odds 的简化模型中证明保留混合决定学习极限,并给出显式均衡式。作者明确说明该模型不描述反射器、演化中的语言模型或优化器的完整动力学。
AdviSD 把“提出修正”和“选择在哪里学习”分开:顾问对同一段已记录的执行器响应,分别在含其已发出建议与不含该建议的两个上下文下打分,用分数差的幅值作为选择信号,因此不需要执行器的似然,也不需要额外的执行器 rollout;被选中的决策由一份带反馈条件的更新前顾问副本进行自蒸馏,同时保留原有的 GRPO 优势不变。 与轨迹级或回合级监督相比,这里的选择发生在“顾问—执行器”接口上,且选择信号来自对执行器已记录响应的配对打分,而非执行器行为或任务回报的直接测量。 方法细节完整:打分上下文由发给执行器的请求构造,目标为序列化并分词后的响应(含工具调用顺序、不含后续工具结果);阈值由“捐赠建议”(来自其他任务的建议,只打分不执行)的对比幅值经验分位数校准并在训练中固定;教师与学生分布在前 100 个 token 上重新归一化。
在 Qwen3-8B 顾问、Gemini 3.7 Flash 与 Claude Sonnet 4.6 两个冻结执行器上,AdviSD 在 BFCL-v3 与 EnvScaler 的域内聚合指标最高,超过 advisor-GRPO 4.2–6.4 个百分点与 3.9–5.1 分;它比同数量随机选择高 2.5–4.9 分、比无门控高 3.2–5.1 分,而两个对照之间最多相差 0.9 分,倒置门控在两个基准上都落后于 GRPO。 这些消融把“选择哪些决策”与“单纯减少监督量”区分开:随机减少监督无法复现 AdviSD 的增益,优先低对比度决策还不如只用奖励学习。 每个训练方法三次独立训练,每次取验证集选出的检查点做四次测试评估并取平均;BFCL-v3 测试集固定为 320 个任务(四类各 80),EnvScaler 固定 200 个任务。作者说明报告的是测试结果而非检查点选择用的验证分数。
无需再训练,AdviSD 的顾问可迁移到域外基准与不同执行器版本和模型族:在 ACEBench、ToolHop、τ²-bench、RoTBench 四基准宏平均上领先,比独立执行分别高 2.7 分(Gemini)与 3.6 分(Claude),而 GRPO 的领先不足一分;跨族迁移中两个方向都超过迁移后的 GRPO 3.1 个百分点。 作者同时指出迁移后的分数仍低于为评估执行器专门训练的 AdviSD,因此迁移模型不能替代针对执行器的训练;在 Claude 的 ACEBench 多步任务上 AdviSD 仍落后独立执行与 GRPO 1.7 个百分点。 域外评估沿用各基准原生工具、策略与指标,直接复用 BFCL 训练并选出的检查点;迁移实验固定 320 个 BFCL-v3 测试任务,只更换执行器。
启示与展望
该结果面向的是“执行器冻结、只能通过自然语言建议影响”的设定:顾问在每次执行器回应前决定给出建议还是弃权,建议放在临时请求中而不进入执行器持久历史。适用对象是需要外部适配前沿 API 模型、又愿意训练一个小顾问的团队;训练侧需要一次反思器(论文中两个执行器设置都用 Gemini 3.7 Flash 做反思)和一次基于捐赠建议的阈值校准,部署时反思与打分都不再使用。理论结论适用于固定教师与平稳保留的简化模型,随机教师扩展还要求条件律平稳。
学习分析假设教师固定、保留平稳,作者明确说明这些结果并未证明 AdviSD 在教师不断变化、配合 GRPO–AdamW 的训练下收敛;评估覆盖两个执行器族、一个共享反思器和每个方法三次训练,且对 API 模型的更新可能限制精确复现。选择信号本身是顾问预测的变化幅值,作者说明它既不是行为效果的测量,也不是任务回报的改进,更不等同于理论中的敏感类;捐赠校准也不消除“响应是在有建议条件下观测到的”这一不对称。此外,论文正文中的结果表格在本次读取的文本里只保留了行标签而没有数值,因此具体分数只能依据摘要与正文陈述,无法逐项核对。训练动态统计显示建议频率下降、普通门控保留率从早期 58.0% 降到后期 32.2%、弃权旁路在中后期约占被选决策的五分之一,作者说明这些是分配统计而非梯度幅值或因果敏感性测量。
