跳到主要内容

数学

73 条内容

  1. arXiv

    LiveMathematicianBench 用训练截止后发表的 arXiv 定理评测大模型,最强模型仅得 43.5%,替换抗性下 Gemini-3.1-pro-preview 跌至 17.6% 低于随机基线

    该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多选题基准,用于评测研究级数学推理;它引入十三类定理类型的逻辑分类体系、以证明梗概引导的干扰项生成流程,以及替换抗性机制,评测显示基准远未饱和——最佳模型 Gemini-3.1-pro-preview 仅得 43.5%,在替换抗性评测下 GPT-5.4 以 30.6% 居首,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线;双模式协议显示提供证明梗概可带来一致的准确率提升。
  2. Terence Tao blog RSS

    概率学家Ivan Corwin提出以价值为基础的数学应对AI路径,把数学价值分为社会、学生、共同体、个人四个层面并呼吁数学界主动向资助方阐明价值

    概率学家Ivan Corwin在这篇客座博文中主张以“价值为基础”的方式应对AI对数学的冲击,提出数学家的价值产生于四个层面——社会、学生、共同体与个人,并呼吁数学界清晰阐明并向社会与资助方传达数学的价值,同时把教学与培养重新置于核心位置。
  3. arXiv

    Lu与Tsai提出多层随机梯度神经求解器MLSG,用神经网络表示边界密度并在百万级离散上求解第二类边界积分方程

    Lu与Tsai提出多层随机梯度神经求解器(MLSG),用神经网络表示未知边界密度,在一系列逐级细化的Nyström离散上做随机残差最小化,并把上一层的网络参数作为下一层的初始化;该方法避免网格传递算子和分层快速求和机制,转而依赖批量核计算与标准网络前向/反向传播,在Laplace/Poisson与Helmholtz问题(二维、三维)以及R^4中超曲面上的外部Robin问题上,以参数化与符号距离两类曲面表示、最高百万级离散规模进行了实验。
  4. arXiv

    捕食者自我竞争与猎物扩散速度共同决定附加食物捕食-被捕食系统的空间格局:弱竞争全场振荡、强竞争固定斑块、交叉点附近时空脉动

    该研究建立了一个含附加食物与捕食者种内竞争的捕食-被捕食反应扩散模型,在均匀混合情形下精确求出共存态的Hopf分岔并证明其产生的周期解稳定,在空间情形下求出扩散驱动的Turing阈值,并以猎物移动性和竞争强度为控制参数发现图灵不稳定与振荡不稳定在单一点相遇,模拟显示弱竞争导致全场振荡、较强竞争配合较快猎物扩散产生固定斑块、交叉点附近两种模式结合为随时间脉动的格局。
  5. arXiv

    张智恒提出波动监督预训练FSP:在24个非线性连续协变量单元中把宏平均RMSE较S-learner降低7.0%,并在效应漂移下较潜效应监督降低54.2%

    该工作提出波动监督预训练(FSP):用平均处理效应加上其有效影响函数波动来标注每张合成表,部署时仍是一次冻结前向传播;作者证明在路径 T_{λ,P}=θ(P)+λP_nψ_P 上存在端点转变——任何固定 λ<1 都保留量级为 (1-λ)^2/n 的标签模糊性,而完整波动使高斯标签可观测并把最优有限分层因果标签预测风险降到 n^{-2} 量级;实验显示在训练上下文长度下、24个非线性连续协变量单元中,连续行FSP把检查点平均宏RMSE较S-learner降低7.0%并赢下全部12个弱重叠单元,验证集选出的Summary FSP在单线程热启动基准中每表部署快11.6倍,效应漂移下匹配的Raw FSP较潜效应监督把平均
  6. arXiv

    PINN 找到 3D Euler 方程临界爆破率 0.5 的自相似奇异剖面,并用样条表示加以认证

    作者在无界区域 R^3 上研究三维 Euler 方程,用带自相似拟设的物理信息神经网络(PINN)求得临界爆破率 0.5 下的近似奇异剖面,用样条表示对该剖面进行认证,发现其输运场在整个区域具有局部外流性质、提示线性阻尼这一稳定机制,并建立了一个把近似自相似剖面的非线性稳定性证明归约为有限多个显式估计与可计算常数的框架。
  7. arXiv

    ELF-REG 把连续扩散语言模型推到数学推理与代码生成:GSM8K 达 55.96% pass@1,MATH-500 从 10.55% 提升到 13.39%

    该工作将 Embedded Language Flows(ELF)扩展到数学推理与代码生成任务,提出 ELF-REG,用冻结的自回归教师模型监督中间去噪特征并提供与响应联合去噪的全局表示(REPA+REG),在 GSM8K、MATH-500、HumanEval、MBPP 上评估:ELF-REG-L 在 64 NFE 下 GSM8K pass@1 为 55.96%,在 128 NFE 下 MATH-500 为 13.39%、HumanEval 为 22.56%,在 GSM8K 与代码任务上超过所评估的同规模 dLM,并把 MATH-500 从 ELF-L 基线的 10.55% 提升到 13.39%;同一任务专用检查点无需少步训练即可通过 early-stop 在
  8. Journal of Statistical Physics

    Stojnic 用参数化 fl-RDT 在对称二值感知机上得到可满足阈值 1.8159 与算法阈值约 1.6021,指向约 0.21 的计算间隙

    Stojnic 用参数化全提升随机对偶理论(fl-RDT)研究对称二值感知机(SBP)的统计-计算间隙:在 κ=1 时第二提升层给出与理论可满足阈值一致的 αc≈1.8159,第七层给出 αa≈1.6021 并预测收敛到约 1.59–1.60,与局域熵复本方法预测的团簇解裂阈值 αLE≈1.58 接近;在 α→0 时第三层得到 κ≈1.2385√(α/−log α),与 OGP 预测定性一致并与局域熵预测完全一致;作者还设计了 CLuP-SBP 算法,其实际表现接近理论预测。
  9. Letters in Mathematical Physics

    Scalet 证明一维自旋链吉布斯态在任意有限温度下存在有限纠缠长度,隔开足够长的区间后左右半链严格可分离

    Scalet 证明:对一维自旋链上任意有限程、有界强度的局部哈密顿量,在任意固定有限温度下,存在一个只依赖温度与局域性、不依赖系统大小的纠缠长度 ℓ,使得当中间区间 B 满足 |B| ≥ ℓ 时,三区间 ABC 的吉布斯态 ρABC 对 B 取偏迹后得到的 ρAC 在 A 与 C 之间是可分离态,从而纠缠生成、纠缠蒸馏、纠缠代价与纠缠相对熵等度量在该态上精确为零;该结论对系统大小一致成立,并可直接推广到无限系统的 KMS 态,作者称之为“纠缠的空间突然死亡”。
  10. Biometrical Journal

    在基于两项随机对照试验数据的模拟中,Cox比例风险模型与随机生存森林的预测表现随评价指标和风险比例假设而分化

    作者基于两项随机对照试验的参考数据集开展中性模拟比较,按TRIPOD建议的多类指标评估Cox比例风险模型与随机生存森林在个体生存概率预测上的表现,发现仅依据C指数得出的结论未必可推广到其他预测性能维度,总体性能类指标通常给出更合理的结果,随机生存森林的标准对数秩分裂规则在非比例风险情形下可能被替代分裂规则超越,随机生存森林在含治疗—协变量交互的数据中性能下降较小,而Cox比例风险模型的性能受比例风险假设违背的影响。

第 4 页 · 当前显示 10 项