跳到主要内容

数学

72 条内容

  1. arXiv

    冻结7B主干、只训10万偏置参数:无标签TTRL在MATH-500达76.67%,并迁移到4500道未参与优化的问题

    该工作提出无标签的偏置-only测试时强化学习:冻结预训练主干,仅用多数投票伪标签作为奖励、只优化约10万个偏置参数(28层MLP的down_proj.bias),在MATH-500上Qwen2.5-7B达76.67%、Qwen2.5-Math-7B达79.50%,同一流程还改善视觉语言与音频推理,冻结后的偏置向量在4500道验证互斥MATH题上把Qwen2.5-7B从46.3%提升到70.9%、Qwen2.5-Math-7B从52.5%提升到75.4%,并从伪标签可靠性与可及梯度能量两方面解释受限子空间为何仍能有效适配。
  2. arXiv

    RIDE 把 RL 教师的隐藏状态残差外推,在四个基座/教师对上均值追平或超过教师

    该工作提出 RIDE(RL-Induced Direction Extrapolation):在学生自采样轨迹上,逐层计算 RL 教师与其 RL 前检查点之间的隐藏状态残差,把学生的表示回归目标沿该残差外推到教师之外,在四个基座/RL 教师对(R1-Distill-1.5B、Qwen3-4B、Llama-3.2-3B、Phi-4-mini)上于 AIME24、AIME25、AIMO 的 Avg@16 均值均接近或超过 RL 教师,是唯一均值做到这一点的对比方法,并一致优于输出空间外推。
  3. arXiv

    EvoDuet 让大模型在进化搜索中按知识缺口检索网页,在 21 项优化任务上把 OpenEvolve 的归一化发现增益从 74.1% 提到 78.0%(GPT-5.6-Luna)、从 61.3% 提到 82.3%(Gemini-3.8-Flash),并在 8 项任务上超过此前最好成绩

    该工作提出 EvoDuet,一种在模型参数固定的前提下让解与网络搜索查询双层协同进化的方法:每轮由基于知识缺口的检索门决定检索新文档、复用已存文档或不检索,内层循环按“假设证据评分”预测文档能带来的解分数并据此改写查询,外层循环并行生成候选并把评估结果写回搜索数据库;在 21 项优化任务、每轮一个候选的设置下,它把 OpenEvolve 的归一化发现增益从 74.1% 提升到 78.0%(GPT-5.6-Luna)、从 61.3% 提升到 82.3%(Gemini-3.8-Flash),Qwen3.5-9B 未获益,最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,并在 Sums/Diffs 与 Denoising 上同
  4. arXiv

    Endless Exam 用 14 族数学构造题给九个模型打分:GPT-6 Astra 带工具后总分 143.16,但 30 个已发表前沿无一被超越

    作者提出 Endless Exam 基准,覆盖十四类参数化数学构造问题、共 69 个评测实例,对提交对象自动验证有效性并给出不设上限的相对质量分(100 分等于平均达到参考构造),在九个模型、十七种配置上评测发现:无工具时总分从 7.55 到 91.90,带代码与网络工具后 GPT-6 Astra、GPT-5.6 Luna、Claude Opus 5.5 分别达到 143.16、119.35、180.06,但 30 个已发表前沿参考无一被超越。
  5. arXiv

    OASIS把自蒸馏监督限制在已验证轨迹上,在Qwen3-1.7B/4B/8B上把对OPSD的平均提升从0.59分扩大到3.05分

    该工作通过截断续写实验发现,在策略自蒸馏(OPSD)中教师相对学生的优势主要集中在学生答错的轨迹上(1.7B时77%对37%),且这一优势随模型规模增大而缩小,于是提出OASIS:保持OPSD目标不变,只把监督限制在最终答案通过验证的最短在策略轨迹上,并用同题的另一条自生成轨迹(通常是学生自己的失败尝试)替代书面参考解作为教师上下文,在Qwen3-1.7B、4B、8B上于AIME 2024、AIME 2025、HMMT 2025的平均Avg@12上分别比OPSD高0.59、1.86、3.05分,同时不再需要书面解答。
  6. arXiv

    LANTERN 用 Qwen3-32B 隐藏状态在 8 小时内从 OEIS 5000 万对序列中筛出 62 条已验证关系,其中 4 条未见于 OEIS 与定向文献检索

    LANTERN 在预训练模型 Qwen3-32B 的激活上训练线性分类器,对 OEIS 中 1 万个高频引用序列构成的 5000 万对候选关系排序,再经廉价过滤、假设生成、可执行验证与解析检查,产出 62 条此前无 OEIS 交叉引用的已验证关系,内容筛查保留 13 条、其中 9 条具信息性或洞察性,4 条未见于 OEIS 与定向文献检索,端到端耗时不足 8 小时。
  7. arXiv

    LSD 用在线自蒸馏把已解出题目的多余长度从 19.0% 压到 -3.7%,同时保持或提升 Pass@1

    该工作把强化学习后训练中「已解出查询的响应被无谓拉长」定义为长度缩放税(LST),并提出长度自蒸馏(LSD):用当前 rollout 组的正确率把已解出提示路由到在线策略蒸馏、未解出提示保留原 RLVR 目标,教师是同一策略谱系的指数滑动平均检查点、无需外部模型,在单轮推理上把 LST 从 19.0% 降到 -3.7%、在多轮智能体任务上从 31.4% 降到 13.7%,同时平均 Pass@1 与 RL 相当或更好。
  8. arXiv

    S²D-OPD 只保留每条回答中教师-参考 JSD 最高的 10% 状态,在八个师生设定中的七个把留出准确率从 46.36% 提到 47.31%

    该工作指出 Direct-OPD 的 token 级对数比奖励只衡量相对变化,可以在教师与参考检查点分配给学生的候选 token 的概率质量趋于消失时保持不变,而教师-参考 JSD 与两个方向的 KL 会随之消失;据此提出 S²D-OPD,按教师-参考 JSD 对学生采样状态排序并屏蔽低散度状态上的监督,每条回答只保留最高的 10%,在两个教师对和四个 1.7B 至 8B 学生模型上,于 AIME 与 HMMT 留出基准的八个设定中有七个优于稠密 Direct-OPD、第八个持平,且不需要额外前向传播。
  9. What's new

    Rachel Webb 认为 LLM 会大幅改变数学研究的执行方式,但不会改变她对数学“趣味性”的评判标准,也不会改变人类做数学的两个人文理由。

    Rachel Webb 在这篇客座文章中,以自身数学研究经验说明:LLM 让她能更快执行研究、把原本的“数学幻想之地”变成可现实探索的世界,但她对数学“趣味性”的衡量标准不变,并给出人类继续做数学的两个人文理由——数学对个人有趣,以及数学创造共同体。
  10. Statistica Sinica

    Delaunay加权两样本检验:利用几何方向信息在高维流形数据上检测协方差主方向差异

    作者提出Delaunay加权两样本检验:在低维流形假设下用Delaunay三角剖分定义同时包含测地距离与相对方向的Delaunay权重,以组内Delaunay权重均值作为检验统计量并用置换法计算p值,理论上证明原假设下渐近正态、备择假设下相合,模拟显示在两分布协方差主方向不同时功效显著优于k-NN、k-MST、核检验、e-distance、协方差检验与回归检验,并在小鼠蛋白表达数据上以p=0.011检出药物治疗组差异。

第 1 页 · 当前显示 10 项