跳到主要内容

检索

“全部学科” · 1379 项结果

第 11 页 · 当前显示 20 项
arXiv

ROSS 把训练中丢弃的历史自生成轨迹重新利用,在 Qwen3.6-35B-A3B 上把 MOPD 六基准均值从 58.40% 提到 62.20%、SWE-bench Verified 从 64.20% 提到 68.40%

ROSS 提出一种选择性监督的再学习流程:从原始 RL、多教师在线蒸馏(MOPD)或智能体 RL 训练中保存的历史自生成轨迹里,先用结果验证器筛出成功轨迹,再由 LLM 审阅者标出值得模仿的模型生成片段,保留完整轨迹作为上下文但只对被选中的 token 施加损失,从而在不产生新 rollout 的离线 SFT 阶段提升上游检查点,在 Qwen3.6-35B-A3B 上把 MOPD 六基准平均从 58.40% 提升到 62.20%、SWE-bench Verified 从 64.20% 提升到 68.40%。
arXiv

TabFM-Auto 用 LLM 智能体围绕冻结的 TabFM 演化数据管线,在 TabArena 全部 51 个数据集上把 Elo 从 1785 提升到 2013

TabFM-Auto 把冻结的表格基础模型 TabFM 与一个语言模型编码智能体配对,让智能体依据数据集元数据与验证反馈迭代改写数据清洗、特征工程、上下文选择和后处理四个阶段的管线,在 TabArena 全部 51 个数据集上五种配置占据总榜前五名,最佳配置(Codex 配 Opus 5)把 TabFM 从 1785.3 Elo 提升到 2013.0 Elo,所发现的管线无需再搜索即可迁移到 TabPFN-3、TabICLv2 和 EXAONE-Tabular(提升 69 至 143 Elo),并在 MLE-Bench 的 8 个表格竞赛中在 MLE 智能体里排名第一。
arXiv

清华团队用GFlowNet把SIS提议分布变成学习问题:一个网络在1190个未见边际上零样本匹配或超越31种解析提议的事后最优

该工作证明固定边际二值矩阵的零方差序贯重要性采样(SIS)提议分布恰好是单位奖励GFlowNet的策略,并提出MarginFlow——一个读取剩余边际的集合Transformer,在1904个边际上训练后,于1190个留出边际上零样本运行,在1187个边际上匹配或超越31种解析设计配置的事后最优,中位有效样本比例为99.8%。
arXiv

HDL 用「事后分歧」定位分支点:生成 token 减少 35–61%,智能体任务最高提升 12.46 分

该工作提出 Hindsight-Divergence Localization(HDL),用加入验证器反馈与反思后 token 对数似然的变化幅度来挑选轨迹中的分支点,只生成少量完整根轨迹、其余槽位用复用前缀的续写填充,在数学、代码与智能体三类任务、三个模型上相对 GRPO 减少 35–61% 生成 token、缩短 18–45% rollout 墙钟时间,同时提升任务表现,智能体任务最高提升 12.46 个百分点。
arXiv

HSTA 用 3 万条 arXiv 预印本与 USPTO 专利文本追踪技术扩散,发现大语言模型子领域语义漂移最高(0.332),但论文数量增速无法格兰杰预测前沿算力激增

该研究提出无监督的“超球语义轨迹分析”(HSTA),把 2 万条 arXiv 预印本与 1 万条 USPTO 专利摘要经 Sentence-BERT 编码后投影到单位超球面,用球面 K-Means 聚成八个子领域并配合 UMAP 降维,定义“语义质心向量漂移”与“商业化时滞”两个指标,并联合 Epoch AI 的算力数据做向量自回归格兰杰检验,结果显示大语言模型(漂移 0.332)与人工智能系统(0.234)语义演化最快,而季度论文数量增速在常规显著性水平上并不格兰杰导致前沿训练算力激增。
arXiv

TRM 先为每个案例生成自适应评分细则再打分,在图像生成与编辑奖励建模基准上超过开源模型并逼近专有模型

该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。
arXiv

PMOPD用参数更新子空间投影缓解多教师蒸馏的能力跷跷板,在Qwen2.5-7B与Llama-3.1-8B上把三任务均分分别提高2.54和2.09分

该工作提出PMOPD,从已完成任务块的累积参数位移中构建逐矩阵的低维子空间记忆,并对后续任务的梯度与Adafactor优化器更新做双重投影以去除与受保护任务方向冲突的分量,同时用轻量冲突探针确定任务顺序、用子空间一致性选择循环次数;在Code、Reason、Math三个任务上,PMOPD在Qwen2.5-7B和Llama-3.1-8B上均优于MOPD,三任务平均分分别提升2.54分和2.09分,且每个单项任务都有提升。
Nature News

克拉克用Z机器冲击含水玻璃,发现熔融岩石在深部压力下可能越压越易压缩,为地球形成期留住水提供一条线索

矿物物理学家Alisha Clark在美国桑迪亚国家实验室的Z机器上,对注水玻璃样品施加冲击波以模拟地球形成期核部附近的极端压力,此前实验显示注水玻璃在高压下反而更易压缩,她据此提出熔融岩石可能在地球熔融的岩浆洋阶段把水锁在内部,而非全部散失或被后期彗星、小行星带来。
arXiv

PrismQuant 把激活主能量旋进分组量化的零空间,在 Llama-3.1-70B 上以 W4A4KV4 达到 3.85 困惑度、仅比全精度低 0.22 个百分点

该工作提出 PrismQuant:把旋转设计与分组非对称 INT4 量化器自身的“组内常数子空间”对齐,将旋转设计写成 Ky Fan 迹最大化并给出闭式最优解,用紧凑 Householder(compact-WY)实现、无需梯度训练,在 Llama、Qwen、Mistral 上(含 70B 稠密模型与 30B 混合专家模型)做 W4A4KV4 实验,Llama-3.2-3B 上在困惑度与准确率上优于所比较方法,Llama-3.1-70B 上取得 3.85 困惑度与 72.46% 平均零样本准确率(比全精度低 0.22 个百分点),并在 Llama-3.1-8B 部署研究中相对匹配 FP16 基线取得预填充与 CUDA Graph 解码加速、解码峰值内存
arXiv

Braco 把视觉 token 压缩从“挑token”改成“换表示”,在 23–64 倍压缩下达到 95.2% 归一化精度并把 prefill FLOPs 降 84.2%–86.7%

该工作把极端视觉 token 压缩重新表述为 token 参数化问题,将“基变换与结构化截断”(决定保留子空间/可压缩性)与“坐标组织”(决定优化与跨模态对齐/可学习性)分离,并据此设计四步轻量编码器 Braco(变换基截断、输入无关的基坐标嵌入、随预算变化的正交重参数化、来自轻量池化的学习式空间残差 token),实验显示 Braco 在 23–64 倍压缩下形成更优的精度—效率前沿、在 144 倍压缩下仍具竞争力,达到 95.2% 精度并把 prefill FLOPs 相对未压缩上界降低 84.2%–86.7%,相比此前方法在精度持平或提升的同时实现最高约 36% 端到端加速,压缩器延迟/FLOPs 分别低 16.6 倍/78.8 倍。
arXiv

WISE-ATTA 把主动测试时适应的监督预算从“标哪张”转向“何时标”,在 ImageNet-C/R/K/A 上以更少标签取得更低误差

该工作提出“预算化主动测试时适应”(budgeted ATTA)设定,即长测试流中只有一部分批次可获得标签,并给出 WISE-ATTA:用在线轻量信号(低熵预测占比)配合滑动历史分位数与预算“欠账”控制器决定何时请求监督,再用相对 EMA 锚模型的预测漂移挑选单个样本标注;在 ImageNet-C 的 CTTA/FTTA 与 ImageNet-R/K/A 上,它以每批 1 个标签达到或优于近期 ATTA 方法,并报告最多减少 50% 标签。
arXiv

FRAC 用分数阶动力学把 SSM 的指数遗忘换成幂律长记忆,1.3B 模型长上下文优于 Mamba 与 GDN

该工作提出 FRAC,一种从分数阶动力学推导的选择性状态空间模型架构,用有限状态、对数间隔的指数模式之和逼近重尾分数阶核,把指数遗忘替换为幂律长记忆,在合成长尾与召回任务、1.3B 参数语言模型的长上下文评测以及 DNA 建模上优于 Mamba2、GDN、Mamba3 等 SSM 基线,同时在短上下文任务上保持竞争力。
arXiv

SaveRouter 只用约三分之一监督反馈就把 LLM 路由的盈亏平衡点最多提前约 9.5 倍

该工作提出 SaveRouter 稀疏监督路由框架,通过自适应选取信息量大的查询—模型反馈并跨相关查询共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈即保持有竞争力或更好的路由质量,并把盈亏平衡部署量相对最快的传统全监督路由降低约 1.9–9.5 倍。
arXiv

把粒子扩张推迟到Transformer后层并引入时间相关评分规则调度,DDM在ImageNet-256²上以单阶段从零训练实现4步4.48 FID、50步2.38 FID

该工作针对分布扩散模型(DDM)扩展中的两个障碍——多粒子训练开销随粒子数增长、以及全局固定的评分规则超参数迫使采样预算只能取单一权衡——提出把粒子扩张推迟到Transformer后层、并引入受Biroli2024动力学区间启发的时间相关评分规则调度,配合DiT潜空间设置,使DDM训练在类条件ImageNet-256²上可行,用DiT-XL/2从零单阶段训练、无教师、无自蒸馏、无JVP即达到4步4.48 FID与50步2.38 FID,且同一配方可迁移到文生图。
arXiv

美团LongCat团队用ResearchSpec把深度研究拆成规划、并行分节研究与全局到局部编辑,在三个公开基准上取得55.25、51.35和79.83分

美团LongCat团队提出LongCat-DeepResearch,把深度研究的早期迭代从整篇报告转移到一份可执行的ResearchSpec上:多个规划智能体先检索外部来源并整合出研究计划,各研究智能体在独立上下文中并行调查并撰写带引用的章节,再由Global Editor分配跨章节内容归属、Local Editor做定向修改,系统在DeepResearchBench、DeepResearchBench II和ResearchRubrics上分别取得55.25、51.35和79.83分,在自建基准上以76.04分位列四个对比系统第二。
arXiv

APM-Bench 用 549 段会话、104 条生活轨迹测试流式视频助手的跨会话持久记忆,发现现有方法难以同时兼顾召回、延迟与存储

该工作提出 APM-Bench,把第一视角流式交互重构为多会话生活轨迹(549 段会话、104 条轨迹、2,719 个候选问题,平均每条轨迹 69 分钟视频),在跨会话理解、实时感知与自适应响应三类能力上评测通用视频模型与八种专用记忆系统,并设置证据可用性感知测试,结果显示存在明显的效用—延迟—存储权衡:原始视频记忆跨会话表现最强但需 GiB 级存储与高延迟,文本摘要把存储降到 KiB 级却损失跨会话性能,事件结构化记忆在专用系统中效用最好,而自适应响应即使给出丰富历史仍然困难。
arXiv

VoxMem 用 3196 道题测 15 个音频大模型:32K 上下文下无一超过 40%,换成文字稿后说话人识别从 69.8% 掉到 10.3%

研究者提出按“声学证据类型(语音语义、说话人身份、副语言线索、环境声音)×记忆操作(信息抽取、多会话推理、时序演化追踪、拒答)”两轴组织的口语对话记忆分类法,并据此构建 VoxMem 基准:3196 个评测实例、34743 段会话、177 小时音频,覆盖 8K 至 64K 四种上下文预算;评测 15 个大型音频语言模型后发现,32K 预算下无一模型总体准确率超过 40%(最强 38.5%),模型对“说了什么”的记忆明显好于“谁说的、怎么说的、周围有什么声音”,且把音频换成精确文字稿后说话人准确率从 69.8% 降至 10.3%,而语音语义仅从 75.9% 微降至 71.0%。
arXiv

浙大团队用Qwen2.5从0.5B到14B做25组同族在线蒸馏,发现峰值能力可由学生规模与教师得分提前预测,弱教师反而教出更强的学生

该研究在Qwen2.5(0.5B–14B)数学推理上系统刻画同族在线策略蒸馏(OPD)的缩放性质,发现训练初期存在“有效迁移区”,其中留出准确率随学生初始化的token级反向KL平方根近似线性上升,并拟合出以学生规模、教师规模与教师得分为自变量的幂律,可预测峰值准确率与迁移速率,且每个弱到强配对中学生的峰值都超过其教师本身。
arXiv

SoL-Refiner 用单步去噪把低分辨率生成视频精修到 4K,2K 延迟从 57.461 秒降到 6.447 秒

该工作提出 SoL-Refiner,一个单步视频精修器,通过高分辨率持续训练、基于帧级奖励模型的强化学习后训练和最终一步蒸馏三阶段配方,把低分辨率生成器输出转换为 4K 视频,并构建 Refiner-Bench 用共享输入协议在约 2K 输出分辨率下比较精修器,在 2K 下其单步模型在 VBench 与 UniPercept 平均值上优于所有被评估的外部精修器,在 3840×2176 下两项指标均超过三步 LTX-2.3 Refiner,完整加速栈在 2K 延迟设定下相对同一基线取得 8.91 倍精修延迟加速。
arXiv

PanoVLN 用全景视觉把 R2R-CE 成功率推到 77.3%,比此前最好结果高 11.9 个百分点

PanoVLN 以 4B 视觉语言模型和纯 RGB 全景输入做连续环境视觉语言导航,通过更长动作序列监督、置信度引导执行、面向决策的训练数据与全景几何特征融合,在 R2R-CE 与 RxR-CE Val-Unseen 上把成功率提升到 77.3% 和 78.0%,分别超过此前最好结果 11.9 和 8.7 个百分点,并在四足机器人上实现更少停顿的实机导航。