LiveMathematicianBench 用训练截止后发表的 arXiv 定理评测大模型,最强模型仅得 43.5%,替换抗性下 Gemini-3.1-pro-preview 跌至 17.6% 低于随机基线
核心概要
该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多选题基准,用于评测研究级数学推理;它引入十三类定理类型的逻辑分类体系、以证明梗概引导的干扰项生成流程,以及替换抗性机制,评测显示基准远未饱和——最佳模型 Gemini-3.1-pro-preview 仅得 43.5%,在替换抗性评测下 GPT-5.4 以 30.6% 居首,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线;双模式协议显示提供证明梗概可带来一致的准确率提升。
Figure 1: Overall accuracy on LiveMathematicianBench across different LLMs. Even recent frontier models remain far from saturation. Random: 20%.
arXiv深度剖析
提出 LiveMathematicianBench,一个基于模型训练截止之后发表的近期 arXiv 论文构建的动态多选题基准,用于研究级数学推理评测。 相较受合成设定与数据污染限制的既有基准,该基准把评测锚定在新近发表的定理上,提供超出记忆模式的更真实测试环境。 论文摘要说明基准来源为训练截止后发表的 arXiv 论文,并给出评测结果:最佳模型 Gemini-3.1-pro-preview 仅达 43.5%,表明基准远未饱和。
引入覆盖十三类定理类型(如蕴含、等价、存在性、唯一性)的逻辑分类体系,支持跨推理形式的细粒度评测。 既有基准通常不按定理的逻辑类型分层,该分类体系使评测能够区分不同推理形式上的表现。 摘要明确列出十三类定理类型并给出蕴含、等价、存在性、唯一性等示例,说明该分类体系用于细粒度评测。
设计以证明梗概引导的干扰项生成流程,用高层证明策略构造看似合理但无效的选项,反映误导性的证明方向。 相较表面匹配式的选项设计,该流程提升了对真实理解而非表层匹配的敏感度。 摘要说明该流程使用高层证明策略构造干扰项,并指出其目的是提高对真实理解的敏感度。
引入替换抗性机制以区分答案识别与实质性推理,并采用双模式协议考察证明梗概的作用。 该机制与协议把识别式作答与实质推理区分开来,并检验模型能否利用高层证明策略进行推理。 摘要给出替换抗性下的结果:GPT-5.4 最高为 30.6%,Gemini-3.1-pro-preview 降至 17.6%,低于 20% 随机基线;双模式协议显示证明梗概访问带来一致的准确率提升。
启示与展望
该基准面向研究级数学推理的评测场景,适用于希望以新近发表定理检验大模型推理能力的研究者与评测设计者;其动态构建方式使其可随新论文持续扩展,十三类逻辑分类与证明梗概引导干扰项可用于按推理形式做细粒度分析,替换抗性机制与双模式协议则为区分答案识别与实质推理提供了可复用的评测设置。
摘要未说明基准的具体题目数量、论文选取范围与时间窗口、十三类定理类型的分布,也未给出各模型在普通模式下的完整成绩表;替换抗性机制的具体实现方式与双模式协议中证明梗概的提供形式同样未在摘要中展开。此外,摘要未报告人类专家或数学研究者在同一基准上的表现,因此难以判断 43.5% 与 30.6% 相对于人类水平的含义。这些属于评测细节与外部效度上的开放问题,值得在阅读全文时留意。
