跳到主要内容
返回时间线
arXiv来源发表:

Endless Exam 用 14 族数学构造题给九个模型打分:GPT-6 Astra 带工具后总分 143.16,但 30 个已发表前沿无一被超越

核心概要

作者提出 Endless Exam 基准,覆盖十四类参数化数学构造问题、共 69 个评测实例,对提交对象自动验证有效性并给出不设上限的相对质量分(100 分等于平均达到参考构造),在九个模型、十七种配置上评测发现:无工具时总分从 7.55 到 91.90,带代码与网络工具后 GPT-6 Astra、GPT-5.6 Luna、Claude Opus 5.5 分别达到 143.16、119.35、180.06,但 30 个已发表前沿参考无一被超越。

AI-generated editorial illustration: The Endless Exam: Mathematical Constructions from Today's Models toward Superintelligence

深度剖析

基准把数学构造质量变成可自动验证的连续分数:每个提交对象先被检查是否满足数学约束,再按其目标值(集合元素数、图顶点数、标量乘法次数等)与已发表前沿或构造基线比较,得到相对质量分,100 分代表平均与参考持平,超过 100 分不被截断。 此前的数学推理基准多以对错或解题比例计分,MathConstruct 检查构造对象、MathConstraint 用求解器判定可行性,而这里对同一实例给出分级质量分,使参考被超越之后的改进幅度仍可比较。 论文给出相对质量公式,并以八色 Schur 构造为例:历史参考 5,041 元素,5,286 与 5,362 的构造分别得到不同分数,说明分数能区分两次超越参考的改进幅度。

十四族参数化构造问题可随参数放大生成新实例,覆盖禁用模式集合、几何、图、编码与代数设计,bench-v1.0 共 69 个实例,其中 30 个以已发表前沿为参考、39 个以可复现构造基线为参考。 与固定题集不同,改变维度、图直径、码长等参数即可在同一数学规则下产生更难实例,作者称这是“Endless Exam”中持续测量的两条路径之一。 论文说明 69 个主评测实例的数学最优值均未知,并给出问题规模实验:如最大度 3 的图在直径 4 到 10 之间参考值从 38 升到 1250,Schur 从 5 色 160 升到 8 色 5362。

紧凑证书让超出枚举规模的构造也能被验证:提交可用乘积、格轨道、数字集、差集、Cayley 生成元或代数证书描述,验证器或展开描述再检查,或直接验证分量与代数条件。 这使评测不限于能逐项列出的对象,论文称检查一个提交的 Shannon 码的有限因子即可认证超过一万亿个码字。 论文报告两个独立实现的验证器在所有模型构造与 69 个参考构造上对有效性和目标值一致,并在故意无效的构造上全部拒绝,在小规模 Shannon 与 trifference 实例上与穷举检查一致。

在九个模型、十四种无工具配置与三种带工具配置上,分数区分出模型规模、推理努力与工具访问的差异,但没有任何模型超越 30 个已发表前沿参考。 带工具的高努力配置在 39 个构造基线实例上取得超过 1 的相对质量(Astra 1.76、Luna 1.37、Opus 5.5 2.43),说明分数能在参考之上继续度量改进,而前沿组仍未被突破。 论文报告无工具总分跨度 7.55–91.90;带工具后 Astra 143.16、Luna 119.35、Opus 5.5 180.06;在前沿组 Astra、Luna、Opus 5.5 分别匹配 29、23、23 个参考,无一超越。

启示与展望

该基准面向需要持续测量数学构造进展的评测者与模型开发者,适用于目标可自动计算、有效性可自动检查的构造族;作者表示欢迎社区提交新构造、新任务族与验证器改进,并计划在现有实例变简单后加入更大参数实例,同时保留旧版本实例与参考以保证分数可比。

论文自述在可用评测预算内只测试了选定模型与推理努力等级,主比较中每个实例与配置只评测一次,重复评测才能量化运行间波动,而按实例自助法得到的区间并不测量这一点;答案格式与验证预算也限制了可评测的构造范围。此外,带工具轨道中 Astra 与 Luna 的评测期间基准材料未在线,而 Opus 5.5 评测期间在线,作者审计其记录未发现直接访问这些材料的证据;不同工具接口与生成预算的差异也需在解读跨模型比较时纳入考虑。

来源