数学
73 条内容
清华团队用GFlowNet把SIS提议分布变成学习问题:一个网络在1190个未见边际上零样本匹配或超越31种解析提议的事后最优
该工作证明固定边际二值矩阵的零方差序贯重要性采样(SIS)提议分布恰好是单位奖励GFlowNet的策略,并提出MarginFlow——一个读取剩余边际的集合Transformer,在1904个边际上训练后,于1190个留出边际上零样本运行,在1187个边际上匹配或超越31种解析设计配置的事后最优,中位有效样本比例为99.8%。
SAKI 用最大耦合的接受/纠正事件路由教师监督,在七个数学推理基准上把 1.7B 与 0.6B 学生的 Mean@8/Pass@8 同时推高到同规模最佳
SAKI 在 KL 约束的教师引导 rollout 中用最大耦合实现中间行为分布,并把实际发生的接受/纠正事件当作 token 级监督路由器:接受位置保留采样 token 的反向 KL,纠正位置改为直接监督教师最高概率 token,纠正概率恰为 TV(p_t,q_t) 因而受同一信任域半径上界约束;配套的引擎内投机验证器保持精确 q 轨迹分布与耦合语义,把同等工作负载下的 rollout 吞吐提升 4.22 倍,并在七个数学推理基准上让 1.7B 与 0.6B 学生的 Mean@8 与 Pass@8 均优于匹配的教师引导基线。
GRAFT让两个异构模型互换轨迹:同预算下双双超过GRPO,平均提升2.1分
该工作提出GRAFT框架,在可验证奖励强化学习(RLVR)中把接收方全部失败的rollout组替换为同伴模型同时含成功与失败回答的组,并用序列级兼容性加权与token级重要性比率裁剪控制跨模型失配;在三对异构模型和五个数学推理基准上,GRAFT在相同单模型rollout预算下同时提升两个模型,平均提升2.1分、最高4.5分,且复用已存储的同伴轨迹仍平均提升1.8分。
浙大团队用Qwen2.5从0.5B到14B做25组同族在线蒸馏,发现峰值能力可由学生规模与教师得分提前预测,弱教师反而教出更强的学生
该研究在Qwen2.5(0.5B–14B)数学推理上系统刻画同族在线策略蒸馏(OPD)的缩放性质,发现训练初期存在“有效迁移区”,其中留出准确率随学生初始化的token级反向KL平方根近似线性上升,并拟合出以学生规模、教师规模与教师得分为自变量的幂律,可预测峰值准确率与迁移速率,且每个弱到强配对中学生的峰值都超过其教师本身。
OptimAI 用多智能体 LLM 流水线把自然语言优化问题转成求解器代码,在 NLP4LP 上达 88.1%、Optibench 上达 82.3%,错误率较此前最佳分别下降 58% 和 52%
该工作提出 OptimAI,一个由 LLM 驱动的多智能体框架,把自然语言描述的优化问题依次经过建模(formulator)、规划(planner)、求解器代码生成(coder)与反思式调试(code critic)四个阶段,并引入基于 UCB 的调试调度在多个候选方案间动态切换;在零样本设置下,使用 GPT-4o+o1-mini 在 NLP4LP 上达到 88.1% 准确率,使用 DeepSeek-R1 在 Optibench 上达到 82.3%,相比此前最佳方法错误率分别下降 58% 和 52%,消融显示移除 planner 或 code critic 会使生产力分别下降 5.8 倍和 3.1 倍,启用 UCB 调试调度带来额外 3.3 倍生产力提升。
Chen、Ji 与 Xu 提出 DiGCA 相分类器,在 Lifshitz-Petrich 模型上以约两个数量级加速生成相图,分类精度超过 98%
作者提出导数信息图卷积自编码器(DiGCA)相分类器,将 Lifshitz-Petrich 模型的解与其导数(非局部项 G(φ))一同输入图卷积自编码器进行降维,再用全连接神经网络分类,在参数域 [−0.01,0.05]×[0,1] 上生成相图,分类精度超过 98%,相比 MCMS-RBM 约快两个数量级,并在最高 10% 加性白噪声下保持稳定。
DCSD把自蒸馏的信用方向与幅度拆开:11个基准总体最优,数学推理较基座提升8.45分
该工作提出解耦信用自蒸馏(DCSD),用信念边际探测确定每步推理的信用方向、用边际信息增益量化其贡献幅度,再让特权教师只负责步内token分配,在11个数学与多模态推理基准上总体得分优于GRPO、OPSD、RLSD与RLCSD,相比基座模型数学推理总体提升8.45分、多模态推理提升7.01分,并纠正约6% token的信用方向、使token信用幅度降低约1.5倍。
把矩阵乘法换成结合代数积:110M参数模型生成吞吐提升6.2–7.8%,但GSM8K、MBPP、IFEval三项指标同时下降
该工作提出用结合代数乘法表替换Transformer投影中的普通矩阵乘法,在保留全部学习权重块与参数量的前提下把q=2情形的双线性秩从Strassen 2×2算法的7降到6,并在约110M参数、12.3B token的对照预训练中观察到四个提示域上6.2–7.8%的端到端生成吞吐提升,同时GSM8K、IFEval、MBPP三项下游指标均低于稠密基线。
CIS 把训练-推理不匹配改写为对数几率位移,在三个 MoE 模型五个数学推理基准上取得最高平均分
该工作研究大语言模型可验证奖励强化学习(RLVR)中推理引擎采样、训练引擎计算梯度所导致的训练-推理不匹配,提出校准重要性采样(CIS):先用对数几率上的加性位移刻画不匹配,再对正位移施加单一常数阈值截断,从而得到随 token 置信度升高而收紧的重要性比率上限;在三个 MoE 模型与五个数学推理基准上,CIS 在全部三个模型上取得所评估基线中最高的五基准平均分,诊断分析显示其对低置信度 token 的截断偏差小于截断重要性采样(TIS),而对小重要性权重的上向裁剪会降低留出准确率。
第 2 页 · 当前显示 10 项