跳到主要内容
返回时间线
arXiv来源发表:

Q&D 用“问题后果”训练 8B 提问者:MuSiQue 必需证据覆盖从 78% 升到 90%,并在零售客服中把任务成功率从 13% 提到 34%

核心概要

该工作把智能体的主动性拆成“内容”这一新维度——横向主动性指追问当前上下文已点明但用户未说的信息,纵向主动性指追问只有先前证据才揭示的需求——用从多跳问答基准自带分解中机械恢复的“需求图”在无模型裁判的情况下给运行打分,并提出 Q&D(提问者与起草者)算法:在记录运行的某一步分叉、采样八个候选问题并各自续跑到结束,按“是否答对、是否更早凑齐全部必需证据、每轮新增多少证据”排序来偏好问题,从而无需奖励模型或裁判即可训练提问者;在 MuSiQue、StrategyQA、2WikiMultiHopQA 三个留出测试集上,等检索开销下训练后的 8B 提问者比同模型提示版恢复更多必需证据(MuSiQue 89.5%

AI-generated editorial illustration: Asking for What Was Never Requested: Horizontal and Vertical Proactivity in Agents

深度剖析

提出并度量了主动性的“内容”轴:横向主动性追问当前上下文已点明但未被请求的信息,纵向主动性追问只有先前证据才使其可被命名的需求,二者由“需求图”上的广度、深度加权召回、最深已解决需求等指标分别读取。 以往关于主动智能体的工作主要研究“是否”和“何时”自主行动,而智能体搜索方法要么沿问题本身写明的链条检索,要么只用最终答案是否正确来训练,因此“每个问题在追求什么”既未被度量也未被奖励;该工作把这一内容轴变成可从转录文本直接打分的量。 需求图由基准自带的分解机械恢复,无人和模型撰写节点或边;MuSiQue 800 个图、2,660 个节点、1,860 条边,StrategyQA 2,290 个图、6,720 个节点、4,483 条边,2WikiMultiHopQA 12,576 个图、31,120 个节点、11,956 条边;打分不依赖模型裁判,且比较在相同问题数下进行。

提出 Q&D 训练算法:把智能体拆成提问者与冻结的起草者,在记录运行的某一步分叉、采样八个候选问题并各自续跑到底,按后果(是否答对、是否更早凑齐全部必需证据、每轮新增证据量)排序偏好,从而无需奖励模型或裁判。 因为起草者是证据的固定函数,状态的每一次变化都由某个问题引起,所以每个问题都能被归因于它之后发生的事;答案只决定训练对的 6%,因此即使最终答案相同,更早触及未言明需求的问题也会胜出。 训练分三阶段:模仿好决策、对问题对做直接偏好优化、再对问题对与“未完成状态下提问优于停止”的对比一起做直接偏好优化;候选问题与续跑由语言模型产生,两名人类评分者在一个套件上检查了标注规则。

在三个多跳问答基准的留出集上,等检索开销下训练后的 8B 提问者比同模型提示版恢复更多必需证据,且多出的证据偏深,即纵向主动性增强。 增益来自“问什么”而非“问多少”或“问多长”:把训练提问者的问题换成同基准其他任务的随机问题会损失 34.7 和 63.3 个百分点的覆盖;隐藏已读证据会损失 8.4 和 8.7 个百分点;允许提示模型花同样多的问题词数仍少 14.9 和 4.7 个百分点。 MuSiQue 覆盖 78.3% 对 89.5%、深度加权召回 77.9% 对 90.5%、最深需求 1.53 对 1.75;StrategyQA 78.4% 对 85.5%;2WikiMultiHopQA 88.2% 对 93.1%;每个训练种子单独在三个套件上都被判定,四次训练运行在一个标准差 0.8 点内一致。

训练后的 8B 提问者在三个基准中的两个上超过同角色更大的提示模型 GPT-OSS-120B,并在未经再训练的情况下迁移到带模拟客户的客服智能体,零售任务成功率大幅上升且客户追问轮数减少。 领先幅度随链条深度变化:在链最深的 MuSiQue 上最大,在需求至多一步深的 2WikiMultiHopQA 上反转,提示“学到的主动性”在必须逐步跟随证据时回报最高;迁移结果说明这是一种通用行为而非问答专属技能。 等开销下对 GPT-OSS-120B 在 MuSiQue 和 StrategyQA 上分别领先 7.0 和 4.3 个百分点,在 2WikiMultiHopQA 上落后 3.5 个百分点;零售成功率从 13% 和 12% 升到 34% 和 32%,在 25 个任务中 10 个更好、0 个更差,比 GPT-OSS-120B 多 17.0 和 12.7 个百分点、少 1.6 和 1.8 轮追问。

启示与展望

该结果面向需要多步补全未言明信息的工具型智能体,尤其是证据必须逐步跟随的场景:多跳问答中的检索式提问,以及带模拟客户的零售客服对话。它使“主动性内容”可被转录级打分并可用偏好训练获得,且提问者从不读取需求图,因此可部署在没有图的环境。适用设定是检索池固定、起草者与回答者冻结、比较在相同检索调用数下进行;在零售域,提问者被明确告知问题只能触及商店记录而非客户。

两个报告种子共享同一个监督检查点和同一份偏好对导出,因此区间只覆盖任务而不估计该检查点与导出的变异;没有任何检查点按预先写定的选择规则通过,最终配置是依据另一条事先固定的理由保留的。训练标签与主要度量共享需求图,答案只决定 6% 的训练对,且额外证据尚未在答案上产生可检测的移动:在 MuSiQue 上找到答案所依赖证据的频率高 9.7 个百分点,按提示模型的答题率推算约合 4.3 个百分点,低于样本可检测的 4.7,与观察到的 2.4 一致;在 StrategyQA 上它会在 92% 和 86% 的未找到该证据的运行中主动停止。发布的检索池较小,多数先决边并不真正阻断检索,因此纵向结果关乎分解中的深度;在 MuSiQue 与 StrategyQA 上每任务只有一条探究线,广度只记录是否越过第一个需求。候选问题与续跑来自语言模型,人类评分者只在一个套件上检查标注规则,所有面向用户的数字都来自模拟客户。Q&D 是一轮离策略训练,未与在策略强化学习比较,也未在自己的续跑上迭代;长度控制未在留出集上运行。此外,若只读到快速解析而缺少图表,则表 2、表 3 与各附录中的具体数值与区间无法核对,这会影响对增益幅度与停止行为的判断。

来源