LexiHorizon 用 128K 上下文预算与保留推理的观测窗口训练 9B 搜索智能体,在 XBench、WebWalkerQA、BrowseComp-ZH 上超过基座与 MiroThinker-1.7-mini
相关研究与后续进展核心概要
该工作提出 LexiHorizon 长程深度搜索训练框架:把轨迹上下文预算扩到 128K、用只保留最近工具观测而完整保留推理历史的上下文窗口管理累积检索内容、并加入仅在答案奖励非零时生效的有界搜索努力奖励,以 GSPO 在线训练 Qwen3.5-9B;所得 LexiHorizon-9B 在 XBench、WebWalkerQA、BrowseComp-ZH 上均优于基座模型与 MiroThinker-1.7-mini,相对二者最大绝对提升分别为 8.7 与 23.8 个百分点,消融显示 64K 预算使有效答案率从 99.88% 降至 66.97%,去掉窗口则三项基准一致下降。
(a) Response length.
arXiv深度剖析
把长程搜索强化学习刻画为训练稳定性问题,来源是上下文过早耗尽、累积检索内容干扰以及持续探索激励不足。 以往深度搜索工作多假设检索系统相对稳定、交互时程较短,或聚焦问题分解、训练数据与轨迹构建;该工作把长交互时程下的稳定性本身作为训练对象。 以问题形式化与三项基准上的受控消融支撑:64K 预算下有效答案率降至 66.97%,奖励与 actor 熵同时趋近于零。
提出保留推理的上下文窗口:完整保留推理与工具动作历史,仅对最近若干次工具观测保留全文,更早观测替换为标记。 不同于对轨迹做摘要或压缩,该设计只丢弃原始工具输出,而把已写入推理历史的信息继续留给策略使用。 评测轨迹中窗口激活比例超过 80%,整体活跃上下文减少 79.1%;在 55 条被移除观测含有效答案证据的轨迹中,推理历史保留其中 44 条,保留率 80%,11 次失败全部出现在工具调用超过 40 次的轨迹。
提出结果门控的搜索努力奖励:工具调用奖励有界并在达到一定调用数后饱和,且被答案奖励乘性门控,只有答案奖励非零的轨迹才能获得。 与无条件奖励工具使用或引入更密集过程奖励的做法不同,该设计把探索激励绑定在答案质量上,避免零答案奖励轨迹靠增加调用获益。 奖励由 LLM 评判的序数正确性分数、门控有界工具奖励以及格式与重复惩罚组成,策略以 GSPO 在实时工具交互的在线 rollout 上优化。
所得 LexiHorizon-9B 在三项基准上排名第一或第二,并同时改善可靠性与效率。 相对 MiroThinker-1.7-mini 在 XBench、WebWalkerQA、BrowseComp-ZH 上分别提升 23.8、4.6、6.5 个百分点;在 XBench 与 BrowseComp-ZH 上超过更大的 Qwen3.5-27B。 工具调用失败率由 12.80% 降至 2.00%,有效答案率由 87.60% 升至 99.88%,策略生成 token 均值由 9,947 降至 6,124,端到端吞吐达 1,069 token/s。
启示与展望
该框架面向检索对查询措辞敏感、需要反复改写查询的长程深度搜索场景,适用于以 ReAct 式推理与工具调用交替、并可用结果奖励优化的搜索智能体训练。它使 9B 策略在扩展上下文预算下维持更久的查询探索,同时把活跃上下文控制在较小规模:窗口激活时整体活跃上下文减少 79.1%,训练后策略平均工具调用由 29.5 增至 54.9,而活跃上下文长度 95 分位由 120,818.9 降至 28,324.5 token。对需要在有限显存与生成预算下训练长程搜索智能体的团队,该组合提供了可复用的上下文与奖励设计;轨迹重置作为辅助机制,在 BrowseComp-ZH 上提升 1.9 个百分点、WebWalkerQA 不变、XBench 下降 2.3 个百分点,更适合作为困难样本的恢复手段。
仍可关注的是:证据保留率在工具调用超过 40 次的最长轨迹中降至 65.62%,说明窗口在极长轨迹上的信息保全仍有空间;答案正确性由 LLM 评判的序数分数决定,评判一致性会影响奖励信号;轨迹重置的收益呈任务依赖,其触发阈值与重置次数上限的敏感性未在正文展开;此外,正文以图表编号引用训练动态与长度分布,具体曲线数值需查阅原图。
