跳到主要内容
返回时间线
arXiv来源发表:

预测正确、步骤错误?用共识推理知识图谱合成更稳健的思维链

核心概要

该工作先通过 PRMBench 与 ROSCOE 上的对照实验表明,向模型提供正确答案在多数设置下并不能稳定提升推理质量,据此把推理缺陷归因于推理轨迹的结构而非答案可知性,并提出 CRAFT:对每个样本采样 K 条候选轨迹,用 TF-IRF 提取共识术语并以 z-score 过滤步骤,将各轨迹转成以步骤为节点、逻辑关系为边的推理知识图谱并聚合为共识图谱,再按拓扑序逐步合成一条新轨迹;在 FLD、FOLIO、GSM8K、OlympiadBench 上,CRAFT 在 GPT-5.4-nano 与 o4-mini 两个骨干下取得最高或次高的标签预测准确率,并在 OlympiadBench 上以更少步骤同时取得最高准确率,其合成轨迹在 RO

Source-provided article image: Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
Figure 1 ·

Figure 1: Problem background. LLMs’ correct label-prediction is related to, but not fully determined by, whether reasoning steps are correct. Case studies of logical and mathematical reasoning are in Appendix M .

arXiv

深度剖析

提供正确答案并不能稳定改善推理:在 PRMBench 的 Simplicity 与 Soundness 维度上四个模型大多无显著差异,仅 Sensitivity 对 o4-mini(p=0.028)与 DeepSeek-R1(p=0.012)达到边际显著且方向相反;ROSCOE 上仅 eSNLI 在四个模型上一致显著改善(p<0.01,d=0.23–0.31),DROP 无显著影响,个别设置甚至下降(如 GPT-5.4-nano 的 Soundness F1 从 0.79 降到 0.72)。 以往常把正确答案当作正确推理的证据,该工作用两个互补基准、四个骨干模型和配对 Wilcoxon 检验把这一假设变成可检验的对照实验,并指出缺陷是结构性的而非答案可知性问题。 两个基准(PRMBench 三个错误类别、ROSCOE 四个数据集)、四个骨干模型、统一提示模板,并报告配对 Wilcoxon 检验与 95% bootstrap 置信区间;eSNLI 的改善被解释为 NLI 标签本身提供真实帮助,且无答案设置下模型偏向输出 Neutral。

CRAFT 把跨轨迹共识同时用于内容与结构两个层面:Module I 用 TF-IRF 提取共识术语并以 z-score(默认 γ=−1.0)剔除离群步骤,Module II 把每条轨迹转成推理知识图谱、以 LLM 置信度与相邻步骤 Jaccard 相似度的等权组合作为边权(λ=0.5)过滤低权边与孤立节点后取并集得到共识图谱,Module III 按拓扑序逐步生成一条新轨迹。 已有方法或只针对单一领域(如仅逻辑推理),或假设所有样本只存在一种缺陷类型(只处理冗余或只处理缺失),而该框架在同一流程中同时处理步骤内部缺陷与步骤间缺陷,且不依赖训练。 算法与超参数(K=5、α=0.01、β=0.3、γ=−1.0、λ=0.5、θ=0.3)明确给出;过滤统计显示 z-score 过滤在逻辑基准上移除 6–8% 步骤、在数学基准上移除 35–54%,RKG 结构过滤在逻辑基准上额外移除 20–26%(占总删除的 71–80%),边过滤在各基准上占结构删除的 57–81%。

在标签预测准确率上,CRAFT 在四个数据集、两个骨干下取得最高或次高成绩:GPT-5.4-nano 下 FLD 71.6、FOLIO 89.6、GSM8K 96.0、OlympiadBench 73.8;o4-mini 下 FLD 75.6、FOLIO 88.8、GSM8K 98.0、OlympiadBench 73.2;在 OlympiadBench 上比次优基线最多高 8.5% 准确率,同时步骤数减少 70% 以上。 与十三项免训练基线(投票/选择、迭代自精炼、搜索、符号分解、结构/因果轨迹分析)相比,CRAFT 不是从候选中挑一条,而是合成一条新轨迹,因此同时获得更高准确率与更少步骤。 每个数据集 500 个样本、随机种子 42,评测用 Exact-Match 加 LLM-As-A-Judge 并人工核验 200 例;报告 95% Wilson 置信区间,在 OlympiadBench(GPT-5.4-nano)与 FOLIO、FLD 上置信区间与多数基线不重叠,而在 GSM8K 等较易基准上存在天花板效应导致区间部分重叠。

合成轨迹的质量在细粒度评测中更高:ROSCOE 上语法正确率提升(最高 +5.9%)、步骤级与词级冗余下降(约 −1.2% 至 −2.8%);FineLogic 与 ReCEval 用于比较合成轨迹与原始推理的有效性、相关性、原子性与蕴含/非矛盾程度。 把改进从最终答案扩展到中间步骤质量,回应了“答案正确不等于推理正确”的出发点。 在 GPT-5.4-nano 与 o4-mini 上运行 ROSCOE 与 ReCEval,在 GPT-5.4-nano 上运行 FineLogic,并以 Gemini-3.1-Flash-Lite 作为 LLM 评判;消融显示移除整个流程在 OlympiadBench 上准确率下降 20% 以上,移除 RKG 或合成分别下降 6.2%/17.2% 与 21.8%/15.4%,用嵌入余弦相似度替换 Jaccard 仅下降约 2%。

启示与展望

该结果面向顺序式思维链场景,适用于逻辑推理(FLD、FOLIO)与数学推理(GSM8K、OlympiadBench)这类有明确标签或唯一答案的任务,并在 GPT-5.4-nano 与 o4-mini 两个骨干上验证;方法为免训练流程,每样本约 18 次 API 调用(K=5 加 RKG 构建与逐步合成),与 K=10 的多样本基线预算相当。对希望提升推理轨迹质量而非仅提升答案准确率的读者,它提供了可直接借鉴的过滤与合成机制;对需要并行或树状推理、或需要处理三值标签(如 FOLIO 的 UNKNOWN 被排除)的场景,适用性需要另行确认。

共识不等于正确:作者指出当许多候选共享同一错误推理模式时,共识可能放大而非抑制错误,增大 K 可缓解但不能消除;TF 仅在每样本 K 条轨迹上计算,K 较小时频率信号判别力有限,术语重要性估计更嘈杂;K 的敏感性分析显示 FLD 从 K=3 起准确率逐步上升、FOLIO 约在 K=3 达到峰值,之后围绕最高值波动。此外,论文提到所用 API 由合作公司部署在其自有 GPU 集群上,性能与公开版本差异很大,这一点对复现与横向比较的影响值得留意;FOLIO 的 UNKNOWN 样本被排除,三值逻辑下的表现仍是开放问题。

来源