跳到主要内容
返回时间线
arXiv来源发表:

π² 用维基百科表格构建推理数据,使 gpt-oss-20b 与 Qwen3-4B 长上下文推理平均绝对准确率提升 +6.25% 与 +3.37%

核心概要

该工作提出 π² 问答数据构建流程:从维基百科抽取并扩展表格,结合相关元数据生成复杂推理问题,答案通过双路径代码执行自动确定与验证,再反向翻译出扎根真实上下文的思维链解答;用 gpt-oss-20b 与 Qwen3-4B-Instruct-2507 在 π² 上做监督微调,在四个长上下文推理基准及自建的 π²-Bench 上取得一致提升,平均绝对准确率增益分别为 +6.25% 与 +3.37%,分析显示推理风格贡献很小,而反向翻译得到的忠实推理模式与扎根的真实长上下文才是提升关键。

Source-provided article image: $\pi^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
Figure 1 ·

Figure 1: Tables bridge realistic documents and complex reasoning in open-domain tasks. They represent data across sources , while being compatible with programmatic operations .

arXiv

深度剖析

提出 π² 这一面向长上下文复杂推理的问答数据构建流程,包含从维基百科抽取并扩展表格、结合表格与相关元数据生成复杂推理问题、以及反向翻译扎根真实上下文的思维链解答三个环节。 相对既有做法,该流程把数据来源锚定在维基百科表格及其元数据这类结构化真实上下文上,而不是依赖通用文本或人工编写题目。 摘要以编号步骤形式明确给出三个环节,并说明代码、数据与模型全部开源。

问题答案通过双路径代码执行自动确定并验证,从而在生成阶段就为复杂推理问题提供可核验的答案。 把答案正确性交由两条代码执行路径交叉确认,使大规模自动构建的推理问答具备可验证性。 摘要明确写到答案“automatically determined and validated through dual-path code execution”。

在 π² 上做监督微调后,gpt-oss-20b 与 Qwen3-4B-Instruct-2507 在四个长上下文推理基准和 π²-Bench 上均取得一致提升,平均绝对准确率增益分别为 +6.25% 与 +3.37%。 给出了两个不同规模模型上方向一致的量化增益,说明收益并非单一模型或单一基准的偶发现象。 摘要报告了跨四个基准加自建 π²-Bench 的一致改进与两个具体平均绝对增益数值。

深入分析显示推理风格贡献很小,而反向翻译发现的忠实推理模式与扎根的真实长上下文对提升至关重要。 把增益来源从表面推理风格转向数据中的忠实推理模式与真实上下文扎根,为后续数据设计提供了可检验的侧重方向。 摘要以“we observe”陈述该分析结论,属于作者基于自身实验的观察性判断。

启示与展望

该工作面向需要长上下文复杂推理的问答场景,尤其是答案可由表格与元数据支撑、并可用代码执行核验的问题类型;适用对象是希望用监督微调提升长上下文推理的研究与工程团队,前提是能获得类似维基百科表格的结构化真实上下文。摘要说明代码、数据与模型全部开源,因此该流程可在相同数据构建范式下被复用与扩展。

可见文本为摘要级信息,四个长上下文推理基准的具体名称、π²-Bench 的构成、双路径代码执行的具体实现与验证标准、以及“推理风格贡献很小”这一结论所依据的对比设置,均未在摘要中展开;这些是读者在评估结论适用范围时会继续关注的问题。

来源