arXiv 2026年10月2日该工作构建了基于2100多道已结算Polymarket问题、带分层防泄漏过滤的智能体预测环境与数据集,让模型在 rollout 时自行进行网页搜索、页面阅读和金融时间序列检索,并用单轮 GRPO 与 Brier 分数奖励训练 Qwen3.5-35B-A3B(3B 激活参数);训练后校准提升30-40%,每次 rollout 的搜索次数从3.8降至2.25,在相同评测框架下以约5%推理成本在证据型预测上超过所测四个前沿模型(含 Claude Opus 4.5,soft-Brier 0.254 对 0.256,n=265),且在人群本身尚未定论的最难问题上优势最大。该工作构建了基于2100多道已结算Polymarket问题、带分层防泄漏过滤的智能体预测环境与数据集,让模型在 rollout 时自行进行网页搜索、页面阅读和金融时间序列检索,并用单轮 GRPO 与 Brier 分数奖励训练 Qwen3.5-35B-A3B(3B 激活参数);训练后校准提升30-40%,每次 rollout 的搜索次数从3.8降至2.25,在相同评测框架下以约5%推理成本在证据型预测上超过所测四个前沿模型(含 Claude Opus 4.5,soft-Brier 0.254 对 0.256,n=265),且在人群本身尚未定论的最难问题上优势最大。用强化学习训练语言模型自主搜索证据,在265道题上以约5%推理成本超过Claude Opus 4.5该工作构建了基于2100多道已结算Polymarket问题、带分层防泄漏过滤的智能体预测环境与数据集,让模型在 rollout 时自行进行网页搜索、页面阅读和金融时间序列检索,并用单轮 GRPO 与 Brier 分数奖励训练 Qwen3.5-35B-A3B(3B 激活参数);训练后校准提升30-40%,每次 rollout 的搜索次数从3.8降至2.25,在相同评测框架下以约5%推理成本在证据型预测上超过所测四个前沿模型(含 Claude Opus 4.5,soft-Brier 0.254 对 0.256,n=265),且在人群本身尚未定论的最难问题上优势最大。该工作构建了基于2100多道已结算Polymarket问题、带分层防泄漏过滤的智能体预测环境与数据集,让模型在 rollout 时自行进行网页搜索、页面阅读和金融时间序列检索,并用单轮 GRPO 与 Brier 分数奖励训练 Qwen3.5-35B-A3B(3B 激活参数);训练后校准提升30-40%,每次 rollout 的搜索次数从3.8降至2.25,在相同评测框架下以约5%推理成本在证据型预测上超过所测四个前沿模型(含 Claude Opus 4.5,soft-Brier 0.254 对 0.256,n=265),且在人群本身尚未定论的最难问题上优势最大。