arXiv 2026年10月6日该工作提出 LexiHorizon 长程深度搜索训练框架:把轨迹上下文预算扩到 128K、用只保留最近工具观测而完整保留推理历史的上下文窗口管理累积检索内容、并加入仅在答案奖励非零时生效的有界搜索努力奖励,以 GSPO 在线训练 Qwen3.5-9B;所得 LexiHorizon-9B 在 XBench、WebWalkerQA、BrowseComp-ZH 上均优于基座模型与 MiroThinker-1.7-mini,相对二者最大绝对提升分别为 8.7 与 23.8 个百分点,消融显示 64K 预算使有效答案率从 99.88% 降至 66.97%,去掉窗口则三项基准一致下降。该工作提出 LexiHorizon 长程深度搜索训练框架:把轨迹上下文预算扩到 128K、用只保留最近工具观测而完整保留推理历史的上下文窗口管理累积检索内容、并加入仅在答案奖励非零时生效的有界搜索努力奖励,以 GSPO 在线训练 Qwen3.5-9B;所得 LexiHorizon-9B 在 XBench、WebWalkerQA、BrowseComp-ZH 上均优于基座模型与 MiroThinker-1.7-mini,相对二者最大绝对提升分别为 8.7 与 23.8 个百分点,消融显示 64K 预算使有效答案率从 99.88% 降至 66.97%,去掉窗口则三项基准一致下降。LexiHorizon 用 128K 上下文预算与保留推理的观测窗口训练 9B 搜索智能体,在 XBench、WebWalkerQA、BrowseComp-ZH 上超过基座与 MiroThinker-1.7-mini该工作提出 LexiHorizon 长程深度搜索训练框架:把轨迹上下文预算扩到 128K、用只保留最近工具观测而完整保留推理历史的上下文窗口管理累积检索内容、并加入仅在答案奖励非零时生效的有界搜索努力奖励,以 GSPO 在线训练 Qwen3.5-9B;所得 LexiHorizon-9B 在 XBench、WebWalkerQA、BrowseComp-ZH 上均优于基座模型与 MiroThinker-1.7-mini,相对二者最大绝对提升分别为 8.7 与 23.8 个百分点,消融显示 64K 预算使有效答案率从 99.88% 降至 66.97%,去掉窗口则三项基准一致下降。该工作提出 LexiHorizon 长程深度搜索训练框架:把轨迹上下文预算扩到 128K、用只保留最近工具观测而完整保留推理历史的上下文窗口管理累积检索内容、并加入仅在答案奖励非零时生效的有界搜索努力奖励,以 GSPO 在线训练 Qwen3.5-9B;所得 LexiHorizon-9B 在 XBench、WebWalkerQA、BrowseComp-ZH 上均优于基座模型与 MiroThinker-1.7-mini,相对二者最大绝对提升分别为 8.7 与 23.8 个百分点,消融显示 64K 预算使有效答案率从 99.88% 降至 66.97%,去掉窗口则三项基准一致下降。