跳到主要内容
返回时间线
arXiv来源发表:

不再标注个人行为:从预测市场价格学出的推理,零样本迁移到用户模拟

导语

一个语言模型改从预测市场的价格变动里学行为推理,在 Polymarket 上方向准确率做到 0.674,并且不接触任何个人标注就零样本迁移到四个用户模拟基准。

Source-provided article image: Learning to Simulate Individuals from Macro Social Signals
Figure 1 · arXiv

正文

用户模拟的训练信号可以从群体层面的结果里来,而不必来自个人层面的标注。 此前的模拟器要么沿用预训练先验,要么直接拟合个人行为记录,行为推理的监督始终局限在微观数据上。 在 SWM-Bench 上,该模型在 Polymarket 取得 0.674 的方向准确率和 0.362 的相关系数,高于最强的时间序列基线和 GPT-5.5。

模型把一次预测拆成可读的推理步骤:先推断市场里有哪些代表性群体,再预测每个群体如何解读新闻、更新信念,然后推理群体之间的相互影响,最后把这些反应汇总成一个价格。 训练用 GRPO 做强化学习,并配一套事后遗憾课程:先让模型看到真实结果、只让它指出驱动市场的关键群体,再用这个提示带来的预测提升来衡量该样本值不值得学。 训练数据是 SWM-Bench 中 Polymarket 与 Kalshi 的每日市场轨迹及其同期新闻,主干模型为 Qwen3-4B。

接下来

下一步值得做的是把该模型扩展到更大的主干和更多模型家族,因为目前几乎所有实验都共用 Qwen3 主干;同时可以做大规模人类评估,检验推理轨迹是否真的与人的判断一致。对做用户模拟或社会模拟的团队来说,这套推理可以直接当作零样本模拟器使用,也可以当作合成数据生成器,为下游模拟器补充训练样本。

人类评估只由五名标注者对每个模型 20 条推理轨迹打分,规模有限,作者也把大规模人类评估列为后续工作。宏观预测与个体模拟在训练中同步提升这一现象来自四个检查点的观察,是否在其他主干和更大模型上同样成立,仍需验证。此外,用户模拟的绝对分数受评判模型与评分流程影响,跨表比较需要谨慎。

来源