IntentFlux 把“用户改主意”变成可测失败模式:627 例校准中任务分从 0.476 降到 0.384,StateForge 在 General-Test 上把均分从 0.367 提到 0.467
核心概要
该工作提出 IntentFlux 基准,把可验证任务改写成带受控意图变更(Variant 替换、Decoy 撤回)的多轮对话并保留原评分器,在 627 例校准中观察到均分随被取代与撤回信息增多从 0.476 降至 0.384,八个模型在演化对话下的全对率均低于单轮直给;作者进一步提出 StateForge,在生成前显式维护活跃需求状态,使 General-Test 均分从 0.367 提升到 0.467,并显示即使注入真值最终状态仍无法回到单轮水平。
深度剖析
IntentFlux 把“意图漂移”定义为被取代的旧意图仍影响最终答案或工具动作,并把它做成可执行、可评分的基准:把代码、数学、SQL、数据到文本、摘要与工具调用等可验证源任务改写成受控多轮对话,同时保留原任务的评分器。 此前的多轮评测(如分片指令、演化意图评测)能测“是否最终跟随演化任务”,但不区分“旧意图残留影响结果”与其他多轮错误;IntentFlux 通过 Variant(后被替换的合理备选值)与 Decoy(后被撤回的合理约束,且仅在遵守它会改变源评分器判定时才保留)让陈旧意图的使用直接体现在任务成败上。 627 例 General 校准池、125 例固定 General-Test、100 例 Interactive-Test 与 502 例训练池;人工标注校验 Variant、Decoy 与语义依赖,下游审计在 95% 的 General-Test 上恢复出标注的最终意图。
在受控陈旧信息负荷下,任务表现单调下降:均分从 easy 的 0.476 降到 hard 的 0.384,全对率 CAR 从 0.381 降到 0.298;八个被测模型在演化对话条件下的全对率都低于单轮直给,且各难度层均如此。 该结果把“用户改主意”从定性担忧变成可复现的难度响应曲线,并用配对设计(同一源任务、同一最终意图、同一评分器、同一被测模型)给出 clean–drift 差距 IDG,而不是只报告多轮平均分。 校准使用 gpt-4.1 构造、gemini-3.5-flash 为被测模型、deepseek-v4-flash 为模拟器与评分裁判;easy/medium/hard 的 Variant/Decoy 预算为 1/3/5,实际实现均值分别为 0.95/0.61、1.71/1.67、2.24/2.50,对话平均长度从 13.2 轮增至 37.1 轮;关键比较使用案例配对自助置信区间。
损失不能仅由对话变长解释:在 General-Test 上,轮数匹配但无意图变更的对照得分为 0.734,接近单轮的 0.778,而对应的漂移轨迹只有 0.469,差距 0.265;在实时工具使用环境 Interactive-Test 中,结尾不重述最终意图使部分分评分相对 clean 下降。 这排除了“多轮本身导致退化”的通用解释,把问题定位到需要从演化历史中恢复当前意图;同时交互实验显示该效应延伸到真实工具动作,而不只是静态最终答案。 轮数匹配对照与漂移条件轮数相同、用户消息长度相近(13.2k 对 14.6k 字符);交互实验以 Qwen3.5-122B 为被测智能体,三种非 oracle 条件的 CAR 均为 0.190,说明该证据针对部分分评分。
历史压缩不足以修复:滚动摘要的 Deep Agents 得 0.354、两阶段压缩的 OpenHarness 得 0.392,均未稳定超过裸多轮执行的 0.367;StateForge 在生成前显式折叠出活跃状态,把 General-Test 均分提到 0.467,而注入真值最终状态进一步升到 0.551,仍低于单轮 clean 的 0.778。 作者把“历史管理问保留什么”与“状态折叠还问什么仍然有效”区分开:被删除意图项所衍生的中间结论即使原项被移除也可能残留,因此需要显式表示活跃需求及其依赖;真值状态实验则说明状态估计误差是重要但非全部原因。 harness 比较在同一冻结的 medium 难度 General-Test 轨迹、同一评分器、温度与输出预算下进行;组件匹配消融中,各 recap 基线与完整 harness 的配对差异 95% 置信区间包含零,而 oracle 条件相对完整 harness 呈正向配对差异。
启示与展望
该工作面向具有可执行或可分解意图结构的任务:General 轨道覆盖代码、数学、SQL、数据到文本、摘要与工具调用,交互轨道使用 VitaBench 的配送、到店、OTA 与跨域环境。它适用于需要从演化对话中恢复当前意图再执行的智能体部署场景,包括以较小跟踪器在推理时提供活跃状态的模块化方案,以及把状态折叠内化进基础智能体的方案。对希望直接复用结论的读者,可直接采用的对象是 IntentFlux 的构造方式(Variant/Decoy、保留原评分器、不重述最终意图)与 StateForge 的“生成前显式活跃状态”接口;跟踪器规模比较显示 9B 跟踪器与 122B 参考在统计上不可区分,OPD 把 2B 跟踪器从 0.156 提升到 0.399,思维蒸馏把独立 35B 智能体在漂移条件下从 0.296 提升到 0.461。
校准把 Variant 与 Decoy 预算耦合在一起,因此支持的是联合陈旧信息负荷效应,而非两者或长度的独立因果效应;轮数匹配对照排除了轮数单独解释,但消息顺序与编辑措辞仍是漂移构造的属性。harness 比较与 Interactive-Test 各只使用一个被测模型,前者基于重放轨迹。组件匹配消融未把显式状态表示确立为系统增益的唯一来源,两条迁移路径的规模规律仍待探索。交互实验中,结尾重述完整最终意图会消除所测的部分分差距,提示基准可能无意中提供它本想测试的状态。此外,本证据包中的若干表格数值在正文呈现时被省略,若需精确到每个模型、每个任务族的分数,仍需查阅原文表格。
