数学
73 条内容
LSPD把在线策略蒸馏改写成KL正则RL:六个数学推理基准上Avg@16平均提升1.59分,回放变体只用约四分之一rollout批次即达饱和
该工作把在线策略蒸馏(OPD)的反向KL目标重新解释为KL正则化策略优化,提出最小二乘策略蒸馏(LSPD):用稳健二次对数概率匹配加熵正则替代策略梯度更新,从而支持多次更新与历史轨迹复用,在六个数学推理基准和三种师生设定上平均提升Avg@16 +1.59分、Pass@16 +1.87分,其全离线回放变体LSPD-RB仅用约四分之一rollout批次即达到与原始OPD相当的性能。
清华LeapLab用二值方向奖励替代KL散度,在数学与代码基准上追平甚至超过在线策略蒸馏,并提出C-MOPD多教师方案
该工作重新审视在线策略蒸馏(OPD)中反向KL散度的必要性,提出仅保留更新方向的二值奖励BinaryOPD,在数学与代码任务的多组师生配对上取得与OPD相当或略优的结果,并进一步发现只有教师与学生分歧较大的少量token的方向才是关键,据此提出让所有教师共同监督每个样本的C-MOPD,在数学与代码基准上稳定优于MOPD。
在Dream-7B与LLaDA-8B上,匹配算力下ORM重排以最高82.71%对70.02%胜过确定性PRM引导
该工作提出一套匹配前向传播算力的诊断协议,在Dream-7B与LLaDA-8B-Base上比较离散扩散语言模型的奖励引导推理,发现确定性top-k过程奖励模型(PRM)引导在GSM8K、MATH与MBPP上均落后于独立采样加任务匹配的结果奖励模型(ORM)重排,并把差距分解为引导造成的候选池损伤与终局选择质量两部分。
SGMR 让策略与多层经济网络链接在同一动态势函数下共同演化,在合成网络上收敛更快、福利更高、抗噪更强
本文构建了一个协同演化的多层势博弈框架,其中有限理性主体更新混合策略,市场、信息与制度三类链接依据观测到的兼容性与扩散信号自适应调整,并提出稳定性守护镜像复制子(SGMR)动态,将熵正则化策略修正、投影式链接重连与谱守护结合;作者证明镜像步在小步长极限下还原复制子动态,并给出精确势性质、势函数单调改进、次线性平稳性与观测扰动下的局部输入-状态稳定性,在合成经济网络上的计算实验显示其相比静态镜像上升、标准复制子动态与虚拟博弈收敛更快、集体福利更高、抗噪更强且网络适应更稳定。
两个混合型养老金管理者在跳跃扩散负债下的博弈:竞争把风险承担推到 K=(μ−r)/σ²,且自身负债跳跃降福利、对手跳跃升福利
该研究把两个相互竞争的混合型DC养老金基金管理者的投资问题建成随机微分博弈,负债风险用带截断指数跳跃幅度的跳跃扩散过程刻画,并采用精确的资产-负债比表述,通过Hamilton–Jacobi–Bellman动态规划得到闭式Nash均衡组合策略与值函数,发现均衡权重不依赖负债跳跃参数,在对称负债相关情形下等于K=(μ−r)/σ²且不依赖双方风险厌恶,竞争相对单代理基准严格放大风险承担,同时自身负债跳跃降低福利而对手跳跃提高福利。
用线性核心区域化模型与协同克里金刻画印尼38省发育迟缓率:中度空间依赖(SDP=68.78%),东部省份预测值最高
该研究以印尼2024年38个省的发育迟缓率及九项决定因素(低出生体重、安全饮水、人类发展指数、平均受教育年限、贫困率、纯母乳喂养覆盖率、平均初婚年龄、产前保健覆盖率、儿科保健服务覆盖率)为数据,用线性核心区域化模型(LMC)联合拟合直接与交叉半变异函数,选定模型为块金加600公里球状结构(LMC = Nug + Sph(600km)),得到发育迟缓率中度空间依赖(SDP=68.78%),低出生体重呈正交叉空间依赖,纯母乳喂养与儿科保健服务覆盖率呈负依赖,贫困在全体本中弱且符号混合、剔除两个0%省份后转为明确正向;协同克里金显示东努沙登加拉、巴布亚部分省份与苏拉威西预测值较高,留一交叉验证平均误差0.2
SAGE用代数稀疏化与双曲结构引导缓解长程推理偏差,在12个基准与7个模型族上超越基线,Andrews-Curtis任务提升近8倍
该工作提出符号闭包分析(SCA)刻画长程推理中的探索偏差与累积偏差,并据此设计SAGE框架,通过代数稀疏化与双曲结构引导在训练时注入结构先验,在12个基准、7个模型族上优于SFT、GRPO、EMPO、GRPO-PRM等基线,并在Andrews-Curtis开放任务上取得最高约8倍的Lean验证证明提升。
LiveMathematicianBench 用 arXiv 新论文构建研究级数学推理基准,最强模型仅得 43.5%,替换抗性评测下 Gemini-3.1-pro-preview 跌至 17.6%
该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多项选择题基准,用于评测研究级数学推理,并引入十三类定理类型逻辑分类、由证明草图引导的干扰项生成流程以及替换抗性机制;评测显示基准远未饱和,最佳模型 Gemini-3.1-pro-preview 仅达 43.5%,在替换抗性评测下 GPT-5.4 最高为 30.6%,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线,同时双模式协议显示提供证明草图可带来一致的准确率提升。
DMA 直接近似因子到变量消息,证明边缘 KL 受消息 KL 约束,并据此构建无需学习率的贝叶斯神经网络推理
该工作提出直接消息近似(DMA),不再像期望传播(EP)和变分消息传递(VMP)那样近似因子图每条边上的边缘分布,而是直接近似因子到变量的消息,对可归一化因子定义一致性条件(当其余入消息均为 Dirac delta 时要求精确),证明了一个主定理:在消息为 proper、图任意的条件下,用消息 KL 界定边缘 KL,并给出三条结构性推论——Dirac 输入一致性、无需 EP 式内层迭代、不产生负精度消息;此外为乘积因子固有的非 proper 反向消息证明了互补的 O(1/r^2) 保证;作为具体实例,推导了乘积因子与 leaky-ReLU 因子的显式 DMA 消息,组装出每个训练样本一次前向/后向扫描、且不含梯度学习率超参数的贝
第 3 页 · 当前显示 10 项