跳到主要内容
返回时间线
arXiv来源发表:

Forecast-Dojo 用 1568 个 Polymarket 事件与 1880 万篇带日期新闻构建可重放预测环境,12 个模型加研究工具后 Brier 分数全部下降但仍不及市场预测

核心概要

作者提出 Forecast-Dojo,一个把已结算的预测市场问题与带日期新闻结合的可重放环境,让 LLM 预测智能体在连续历史日期上研究事件并反复修正预测;该环境包含 1568 个 Polymarket 事件(按时间划分为训练期与评估期)和 1880 万篇带日期新闻文章,在 12 个模型的评估中研究工具使全部 12 个模型的 Brier 分数下降,预测随事件展开而改善且新增带日期证据更多的步骤增益最大,但每个模型在 Brier 分数和准确率上仍落后于历史市场预测,跨日期携带的信念笔记本降低了研究成本却未稳定提升预测质量,此外该环境还提供交互轨迹与结果反馈用于智能体学习,并以监督微调作为概念验证。

Source-provided article image: Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents
Figure 1 ·

Figure 1: Overview of Forecast-Dojo. Top: resolved Polymarket events are filtered and split by time into training and evaluation events, and CC-News articles are cleaned, dated, and indexed. Middle left: each question is forecast at a fixed sequence of dates as the visible corpus grows, with an optional belief notebook M t M_{t} passed between steps. Bottom left: within one step, the agent searches and reads articles dated on or before τ t \tau_{t} , runs code in a sandbox, and commits a forecast p t p_{t} . Right: the realized outcome Y Y stays hidden from the agent. The evaluator scores each forecast against it, using held-out events for evaluation and training events for learning.

arXiv

深度剖析

Forecast-Dojo 把已结算的预测市场问题与带日期新闻组合成一个可重放环境,使智能体能在连续历史日期上研究同一事件并反复修正预测。 与需要等待新事件结算才能获得反馈的常规预测评测不同,这里用已结算问题加历史新闻,使同一批任务和工具可被重复评估、可收集训练交互,并直接获得已记录结果的反馈。 摘要给出环境构成:1568 个 Polymarket 事件按时间划分为训练期与评估期,以及 1880 万篇带日期新闻文章;这是环境规模与设计层面的证据,未涉及具体模型内部机制。

在 12 个模型的评估中,研究工具使全部 12 个模型的 Brier 分数下降,且预测随事件展开而改善,新增带日期证据更多的步骤增益最大。 这为“检索式研究是否真的帮助 LLM 预测”提供了跨 12 个模型的一致方向性结果,并把改善与证据到达的时间点联系起来,而不只是报告单一模型的总体分数。 证据来自 12 个模型的评估与按步骤的增益对比;摘要未给出各模型的具体 Brier 数值、置信区间或统计检验,因此强度体现为方向一致而非精确效应量。

尽管有上述改善,每个模型在 Brier 分数和准确率上仍落后于历史市场预测。 这把 LLM 预测智能体的表现锚定在一个外部参照上,说明研究工具带来的提升尚未弥合与市场聚合预测之间的差距。 摘要以“Every model still trails historical market forecasts in both Brier score and accuracy”直接陈述该比较结果,未给出差距大小。

跨日期携带的信念笔记本降低了研究成本,但没有稳定提升预测质量;同时环境提供交互轨迹与结果反馈用于智能体学习,并以监督微调作为概念验证。 前者区分了“省成本”与“提质量”两个目标,后者把该环境从纯评测扩展到训练用途,给出可复用的交互轨迹与结果反馈。 摘要明确说明信念笔记本“lowers research cost but does not consistently improve forecast quality”,并把监督微调定位为“proof of concept”,即初步验证而非完整训练结论。

启示与展望

该环境面向需要研究公开事件并给出概率判断的 LLM 智能体,适用于评测、交互轨迹收集与基于已记录结果的反馈,并以监督微调作为概念验证;其数据由 1568 个 Polymarket 事件(按时间分为训练期与评估期)和 1880 万篇带日期新闻构成,因此结果适用于这一预测市场与新闻语料所覆盖的事件类型和时间范围。对希望复现或扩展预测智能体研究的读者,该环境的价值在于同一批任务与工具可反复使用,无需等待新事件结算。

摘要未给出各模型的具体 Brier 分数、与市场预测的差距大小、统计检验或置信区间,也未说明监督微调的具体设置与效果幅度,因此无法从摘要判断提升的实际量级。信念笔记本“降低研究成本但不稳定提升质量”的具体条件、以及不同事件类型或时间段的差异,也需要正文中的分项结果才能确认。此外,本次可获取的文本为摘要与书目信息,图表与正文细节未包含在内,若需核对具体数值与实验设置,应以原文为准。

来源