LiveMathematicianBench 用 arXiv 新论文构建研究级数学推理基准,最强模型仅得 43.5%,替换抗性评测下 Gemini-3.1-pro-preview 跌至 17.6%
核心概要
该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多项选择题基准,用于评测研究级数学推理,并引入十三类定理类型逻辑分类、由证明草图引导的干扰项生成流程以及替换抗性机制;评测显示基准远未饱和,最佳模型 Gemini-3.1-pro-preview 仅达 43.5%,在替换抗性评测下 GPT-5.4 最高为 30.6%,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线,同时双模式协议显示提供证明草图可带来一致的准确率提升。
Figure 1: Overall accuracy on LiveMathematicianBench across different LLMs. Even recent frontier models remain far from saturation. Random: 20%.
arXiv深度剖析
提出 LiveMathematicianBench,一个基于模型训练截止之后发表的近期 arXiv 论文构建的动态多项选择题基准,用于研究级数学推理评测。 相较受合成设定与数据污染限制的既有基准,该基准把评测锚定在新近发表的定理上,提供超越记忆模式的现实测试环境。 摘要说明基准来源为训练截止后发表的 arXiv 论文,并称其为可扩展、抗污染的测试平台;具体题目数量与构建细节未在给定文本中给出。
引入覆盖十三类定理类型(如蕴含、等价、存在、唯一)的逻辑分类体系,实现跨推理形式的细粒度评测。 既有基准通常不按定理的逻辑类型分层,该分类使评测能够区分不同推理形式上的表现。 摘要明确给出十三类这一数量与蕴含、等价、存在、唯一等示例类别。
设计由证明草图引导的干扰项生成流程,用高层证明策略构造看似合理但无效的选项,以反映误导性的证明方向。 相比表面匹配式的选项设计,该流程提升了对真实理解而非表层匹配的敏感度。 摘要描述了该流程的构造原理,但未给出干扰项数量或人工校验等细节。
引入替换抗性机制以区分答案识别与实质性推理,并在评测中观察到显著的准确率下降与证明草图带来的增益。 该机制把识别式作答与真正推理区分开来,双模式协议进一步显示模型可利用高层证明策略。 摘要报告最佳模型 Gemini-3.1-pro-preview 为 43.5%;替换抗性评测下 GPT-5.4 最高 30.6%,Gemini-3.1-pro-preview 为 17.6%,低于 20% 随机基线;双模式协议显示证明草图访问带来一致增益。
启示与展望
该基准面向研究级数学推理,适用于以新近发表定理为题的动态评测场景,服务对象是研究 LLM 数学与推理能力的研究者与评测设计者;其抗污染与可扩展特性使其适合在模型迭代后重复使用,并可通过证明草图模式考察模型对高层证明策略的利用。
给定文本为摘要,未提供题目数量、来源论文筛选标准、干扰项与替换抗性机制的具体实现,也未给出置信区间或多次运行方差;因此这些评测数字在不同题目子集与不同运行下的稳定性,以及十三类逻辑分类下各类别的表现分布,仍是需要进一步查看原文才能确认的开放问题。
