用强化学习训练语言模型自主搜索证据,在265道题上以约5%推理成本超过Claude Opus 4.5
相关研究与后续进展核心概要
该工作构建了基于2100多道已结算Polymarket问题、带分层防泄漏过滤的智能体预测环境与数据集,让模型在 rollout 时自行进行网页搜索、页面阅读和金融时间序列检索,并用单轮 GRPO 与 Brier 分数奖励训练 Qwen3.5-35B-A3B(3B 激活参数);训练后校准提升30-40%,每次 rollout 的搜索次数从3.8降至2.25,在相同评测框架下以约5%推理成本在证据型预测上超过所测四个前沿模型(含 Claude Opus 4.5,soft-Brier 0.254 对 0.256,n=265),且在人群本身尚未定论的最难问题上优势最大。
Figure 1: Soft-Brier on the full held-out test split ( n = 265 n{=}265 ) and on the pre-declared uncertain subset (cutoff price in [ 0.30 , 0.70 ] [0.30,0.70] , n = 104 n{=}104 ). The range [ 0 , 0.24 ] [0,0.24] is compressed for readability.
arXiv深度剖析
把“收集证据”这一技能纳入奖励塑造范围:智能体在 rollout 时自行获取上下文,而非在训练前冻结研究背景或仅在测试时启用检索。 此前预测工作要么冻结研究上下文,要么只在测试阶段部署智能体式研究,因此证据收集能力从未被奖励直接塑造;该工作让搜索行为本身成为可训练对象。 以2100多道已结算 Polymarket 问题构建环境、数据集与评测框架,并用分层防泄漏过滤把可用信息限制在每题截止时间之前发布的内容。
训练改变了智能体与信息交互的方式:校准提升30-40%,每次 rollout 的搜索尝试从3.8次降至2.25次。 说明收益不只来自更多检索,而是来自“证据纪律”的形成,即用更少的搜索获得更好的概率校准。 在单轮 GRPO、Brier 分数奖励下训练 Qwen3.5-35B-A3B(3B 激活参数),并报告训练前后的校准与搜索次数变化。
在相同评测框架下,训练后的策略在证据型预测上超过所测全部四个前沿模型,包括 Claude Opus 4.5(soft-Brier 0.254 对 0.256,n=265),且推理成本约为其5%。 把“小激活参数模型加可训练检索”与前沿大模型放在同一评测条件下比较,并给出成本量级差异。 同一 harness 内对四个前沿模型的对照评测,样本量 n=265,指标为 soft-Brier。
优势在人群本身尚未定论的最难问题上最宽,并公开环境、数据集与逐 rollout 记录作为可复用框架。 把预测能力的提升定位在信息最不充分、共识最弱的问题上,同时以可复用资产形式发布,便于后续时序预测智能体研究。 报告了按问题难度分层的表现差异,并声明发布环境、数据集与逐 rollout 记录。
启示与展望
该结果面向的是在信息截止时间约束下、需要自行检索证据的真实世界事件概率预测场景,适用于可接入网页搜索、页面阅读与金融时间序列的智能体设定。其可复用产物——环境、数据集与逐 rollout 记录——为后续时序预测智能体的训练与同条件比较提供了基础,尤其适合研究“检索行为如何被奖励塑造”以及低成本模型在困难问题上的表现。评测结论限定在相同 harness 内与所测四个前沿模型的比较,以及 n=265 的 soft-Brier 对照。
当前可见文本为摘要,未展示具体的问题筛选标准、分层防泄漏过滤的实现细节、GRPO 超参数、校准提升30-40%的具体度量方式,以及四个前沿模型的逐一结果。soft-Brier 0.254 对 0.256 的差距很小,其稳定性、置信区间与在不同问题子集上的表现仍需在原文中确认。此外,“最难问题”的界定方式与人群未定论的判定标准,也属于读者会继续关注的问题。
