SAGE用代数稀疏化与双曲结构引导缓解长程推理偏差,在12个基准与7个模型族上超越基线,Andrews-Curtis任务提升近8倍
核心概要
该工作提出符号闭包分析(SCA)刻画长程推理中的探索偏差与累积偏差,并据此设计SAGE框架,通过代数稀疏化与双曲结构引导在训练时注入结构先验,在12个基准、7个模型族上优于SFT、GRPO、EMPO、GRPO-PRM等基线,并在Andrews-Curtis开放任务上取得最高约8倍的Lean验证证明提升。
深度剖析
论文提出符号闭包分析(SCA),把长程推理建模为局部可容许变换序列,用前缀封闭的可行域刻画两类偏差:结构复杂度导致探索偏差,稀疏奖励导致累积偏差。 此前工作多把长程推理失败归因于任务难度或奖励稀疏,SCA将其形式化为可行支撑被高体量但无产出的分支稀释,以及终端奖励下局部偏差随深度累积。 论文给出定义3.1、备注3.2与3.3、命题3.4的方差分解,以及定理3.5关于稀有终端奖励下KL正则优化器锚定参考策略的总变差界,并在附录B给出证明。
SAGE把SCA的诊断转化为两个训练时结构引导:代数稀疏化将候选算子投影到算子索引子空间以抑制虚假分支,双曲结构引导把推理状态嵌入负曲率空间以提供稠密的深度信号。 与依赖密集过程标注或学习型验证器的方法不同,SAGE的结构势不需要过程标签或真实解路径,且推理时不增加搜索或过滤开销。 论文给出命题4.1(稀疏奖励下非零结构优势)与命题4.2(引导诱导的可行支撑集中),附录C给出贪心稀疏定位在互相关条件下的支撑恢复定理,附录D给出软可行支撑集中界。
在12个基准、7个模型族上,SAGE一致优于SFT、GRPO、EMPO、GRPO-PRM等基线;35B SAGE平均准确率64.86,超过Llama-3.3-70B-Instruct的38.48。 增益覆盖闭式数学推理、自由形式自然推理与开放长程符号推理三类任务,且在约一半参数规模下超过更大旗舰模型。 表1与表2报告了2B、9B、27B、35B各规模的均值结果,附录H给出五种子均值-标准差,附录E说明所有对比方法使用相同rollout预算、解码约束与KL系数。
在Andrews-Curtis开放长程任务上,SAGE的AC有效性提升至59.83、AC路径求解31.76、Lean验证证明23.69,Qwen3达到近8倍于基线的提升。 消融显示去掉代数稀疏化或双曲引导都会降低AC有效性与Lean验证成功率,用欧氏距离替换双曲嵌入或打乱目标锚点也会削弱性能。 表3与表4给出组件消融与对照实验,AC任务使用1190个构造的群表示,Lean验证证明作为端到端严格性的金标准指标。
启示与展望
该结果面向在稀疏奖励下进行长程推理的后训练场景,适用于具备局部可容许接口的符号任务,以及在数学与自由形式推理中以学习代理近似残差、锚点与算子子空间的情形。对希望减少过程标注依赖、又需要端到端严格性验证的团队,SAGE提供了训练时注入结构先验、推理时零额外开销的路径;附录E说明所有结构模块仅在训练时使用,推理直接使用训练后的策略。
SCA的理论集中结果直接适用于符号设定,在数学与自由形式推理中依赖学习代理能否分离有效与无效前缀,这一保真度是经验性的。结构先验的质量取决于任务接口,附录J指出更自动的结构先验构建与更紧的非符号保证仍是开放问题。此外,SAGE引入候选步打分、残差探测与双曲距离计算的训练时开销,尽管推理不增加成本。论文报告了五种子均值-标准差,但不同基准与模型规模下的方差来源与稳定性仍值得读者结合附录H自行核对。
