研究者提出数学基元概念与四维基准,诊断出发现能力是LLM数学推理的主要瓶颈,并用基元优先自蒸馏框架提升推理表现
相关研究与后续进展核心概要
该工作提出“数学基元”概念与一个从发现、生成、消化、执行四个维度评估数学推理的基准,系统诊断显示解题准确率会掩盖不同的能力画像、基元能释放大量潜在执行能力、发现是数学推理的主要瓶颈,且受发现限制的失败更易修复;据此提出基元优先的自蒸馏框架,将基元引导的推理选择性迁移到学生模型,在多种模型规模和挑战性基准上稳定优于基线。
Figure 1: Diagnosing and internalizing mathematical primitives. We introduce Mathematical Primitives to probe structural mathematical understanding in LLMs across four dimensions: Discovery, Generation, Digestion, and Execution. Our diagnosis further motivates Absorb , which selectively transfers primitive-guided reasoning into the student without requiring primitives at inference time.
arXiv深度剖析
论文提出“数学基元”这一概念,用以探测大语言模型是否具备支撑其解题表现的结构性数学理解,并给出一个沿发现、生成、消化、执行四个维度评估数学推理的新基准。 以往对LLM数学能力的评估主要看最终解题准确率,该工作把数学理解拆解为四个可分别考察的维度,从而把“会不会做对”与“是否具备结构性理解”区分开来。 证据来自作者构建的基准与在此之上的系统诊断,摘要以“systematic diagnosis”描述该诊断过程;具体题目数量、模型清单与统计量未在摘要中给出。
系统诊断发现:解题准确率会掩盖不同的能力画像;引入基元能够释放可观的潜在执行能力;发现是数学推理中的主导瓶颈。 这三点把单一准确率指标下的“能力”拆成可区分的剖面,并指出瓶颈不在执行环节而在发现环节,为后续改进指明了优先方向。 证据来自作者对模型在四维基准上的诊断性评测,摘要以“primitives unlock substantial latent execution capacity”和“Discovery is the dominant bottleneck”表述结论;具体效应量未在摘要中给出。
后训练分析显示,受发现限制的失败特别适合被修复;据此提出的基元优先自蒸馏框架把基元引导的推理选择性迁移进学生模型,在多种模型规模和挑战性基准上稳定优于基线。 该框架不是笼统地蒸馏全部推理轨迹,而是依据诊断结果选择性地迁移基元引导的推理,使后训练干预与已识别的瓶颈对齐。 证据来自跨模型规模与多个挑战性基准的对比实验,摘要称其“consistently improves mathematical reasoning over baselines”;具体基准名称、模型规模与提升幅度未在摘要中给出。
启示与展望
该工作面向研究大语言模型数学推理的研究者与工程实践者,适用于需要区分“解题正确”与“结构性理解”的评测场景,以及希望把诊断结论转化为后训练改进的训练流程。其结论的适用范围以摘要所述的四维基准与所测试的模型规模、挑战性基准为界;基元优先自蒸馏框架被描述为把基元引导的推理选择性迁移到学生模型,因此其定位是后训练阶段的方法,而非预训练或推理时方法。
读者仍需关注:四维基准中每个维度的具体题目形式与判定标准如何定义;诊断结论在不同模型族与规模上是否一致;基元引导推理的迁移在何种条件下收益最大;以及“发现是主导瓶颈”这一判断在摘要之外是否有更细的量化支撑。由于本次可获取的是摘要级文本,缺少图表与实验表格,上述问题无法从现有材料中确认,属于需要查阅原文的开放问题。
