跳到主要内容

检索

“全部学科” · 1367 项结果

第 7 页 · 当前显示 20 项
arXiv

跟踪微调轨迹发现:安全对齐的LLM在窄域微调中并非被“转向”有害,而是安全子空间被侵蚀,投影掉有害梯度子空间可在Qwen2.5-14B-IT上把自由生成涌现失准压低最多80.0%

该工作对涌现失准(EM)做了动态二阶几何研究:追踪训练轨迹发现方向性Hessian曲率集中在语义枢轴token上,Grassmann投影显示有害-安全差距扩大主要源于安全梯度重叠下降而非转向新的有害回路,据此提出参数级几何缓解框架,把经验有害梯度子空间从LoRA更新中正交投影掉,在Qwen2.5-14B-IT上把自由生成EM压低最多80.0%,并在四个开放权重指令模型家族(3B–20B)中通过教师强制评估显示同一有害子空间控制着冻结EM响应的条件支持度。
arXiv

EvoDuet 让大模型在进化搜索中按知识缺口检索网页,在 21 项优化任务上把 OpenEvolve 的归一化发现增益从 74.1% 提到 78.0%(GPT-5.6-Luna)、从 61.3% 提到 82.3%(Gemini-3.8-Flash),并在 8 项任务上超过此前最好成绩

该工作提出 EvoDuet,一种在模型参数固定的前提下让解与网络搜索查询双层协同进化的方法:每轮由基于知识缺口的检索门决定检索新文档、复用已存文档或不检索,内层循环按“假设证据评分”预测文档能带来的解分数并据此改写查询,外层循环并行生成候选并把评估结果写回搜索数据库;在 21 项优化任务、每轮一个候选的设置下,它把 OpenEvolve 的归一化发现增益从 74.1% 提升到 78.0%(GPT-5.6-Luna)、从 61.3% 提升到 82.3%(Gemini-3.8-Flash),Qwen3.5-9B 未获益,最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,并在 Sums/Diffs 与 Denoising 上同
arXiv

ThinkV2V 让 MLLM 先思考再剪辑:5B 模型在复杂与标准视频编辑基准上均取得最佳总分

该工作提出 ThinkV2V,一个在视觉生成前显式激活多模态大模型思考的推理驱动视频编辑框架:它用 Qwen3-VL-Thinking-8B 对源视频与指令做思维链推理并输出精炼提示,经可学习查询连接器把隐藏状态注入 Wan-2.1-5B 的 DiT,配合渐进式课程训练与推理时思考扩展,并构建 ThinkV2V-150K 数据集与 ThinkV2V-Bench 基准;在两种评判模型下,该 5B 规模模型在复杂与标准编辑场景中均取得最佳总分,并超过若干 10B 级基线。
arXiv

用熵位移筛选蒸馏位置,让LLM评审在主观任务上比Dr. GRPO高出2–9个百分点

该工作研究如何用自然语言反馈训练LLM评审,提出以教师与学生之间的逐位置熵位移来区分“语境锐化”和“语境扩散”两种机制,并据此遮蔽高熵位移位置,使自蒸馏评审在主观子类上比结果监督RL(Dr. GRPO)高出2–9个百分点,同时在客观子类上保持竞争力。
arXiv

OASIS把自蒸馏监督限制在已验证轨迹上,在Qwen3-1.7B/4B/8B上把对OPSD的平均提升从0.59分扩大到3.05分

该工作通过截断续写实验发现,在策略自蒸馏(OPSD)中教师相对学生的优势主要集中在学生答错的轨迹上(1.7B时77%对37%),且这一优势随模型规模增大而缩小,于是提出OASIS:保持OPSD目标不变,只把监督限制在最终答案通过验证的最短在策略轨迹上,并用同题的另一条自生成轨迹(通常是学生自己的失败尝试)替代书面参考解作为教师上下文,在Qwen3-1.7B、4B、8B上于AIME 2024、AIME 2025、HMMT 2025的平均Avg@12上分别比OPSD高0.59、1.86、3.05分,同时不再需要书面解答。
arXiv

MIST压力测试:给VLM评审员加一张图,约两成标签改变,且与图的内容无关

研究者构建了MIST(误导性图像压力测试),包含200个英文句子,每句含一个可作字面或比喻解读的短语,并分别配以与句意一致的图像、与句意相反的图像或不配图像;在13个视觉语言模型评审员上,配一致图像改变20.5%的标签、配误导图像改变19.4%,而仅删除“忽略图像”指令、图像保留只改变11.6%,且两张图像之间出现分歧的标签中只有37%朝图像所示含义移动,与人类标注者的一致率在无图、一致图、误导图三种情况下基本不变。
arXiv

NavHarness 让机器人把地图、搜索记录与房屋笔记带进下一次对话,GOAT-Bench 上 s-SR 提升 18.6 至 34.8 点

NavHarness 是一个无需训练的具身导航外壳,把记忆处理放进导航循环:每次任务开启新的多轮智能体会话,但通过地图、任务记录与房屋笔记继承先前经验,并在任务结束时做结果核验与运行末整合;在 GOAT-Bench 上相对仅用当前上下文的独立会话,s-SR 分别提升 18.6 点(GPT-6 Astra)、22.6 点(Opus 5)、34.8 点(GPT-4o)和 30.3 点(Qwen3.8-27B),使用 SLAM 估计位姿时 Astra 达到 83.7 s-SR 与 36.9 e-SR,在 IR2R-CE 上达到 85.9 s-SR。
arXiv

AREX-2 用长程反思轨迹训练 27B 智能体,MLE-bench Lite 达 81.8、BrowseComp 达 84.0

AREX-2 把智能体的自我改进定义为测试时用更多轮次迭代出更好解,并从机器学习工程与算法编程任务中合成含失败与回退的长程改进轨迹,微调 Qwen3.8-27B 后取得 MLE-bench Lite 81.8、Frontier-CS 70.7,并在未新增深度研究数据的情况下把 BrowseComp 提升到 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,且随轮次预算增加持续提升。
arXiv

不重训模型、只保留注意力权重最高的少量token,九个检查点的有效注意力集合大小从7到283不等,且上下文越长所需集合越大

该研究在不重训模型的前提下,在每个头、层和查询处只保留注意力权重最高的若干token并保持其原始权重不变,通过测量负对数似然(NLL)的上升来估计维持给定损失容差所需的“有效注意力集合大小”,发现较小的集合即可让NLL接近全注意力基线、基于注意力的选择明显优于随机选择、所需集合大小随上下文延长而增大但其占上下文的比例下降,并且在固定标注支持事实的BABILong实验中,额外背景会把支持token挤下注意力排名并降低其注意力质量,而对保留权重做重归一化可大幅减小所需集合大小。
arXiv

把掩码扩散解码拆成五个轴后,研究者发现状态自适应只在少数可预测状态上值得做,选择性干预让三个模型的整任务宏平均效用分别提升3.2、4.0和5.6个百分点

该工作把掩码扩散语言模型的解码策略拆成 score、cardinality、region、commitment、planning 五个轴,用“策略反转”定义自适应机会(最优候选动作相对验证集选出的固定动作的一步效用优势),在三个模型(LLaDA-8B-Instruct、LLaDA-1.5、Dream-7B)和十个任务上发现自适应机会高度异质,并据此提出选择性自适应:用验证提示校准的轻量检测器识别高机会状态,例如在 LLaDA-8B 的 Constrained JSON Fill 上只对排名前 10% 的状态做 region 自适应即可捕获 56.9% 的候选集 oracle 机会,端到端选择性解码把任务宏平均效用从 0.392
arXiv

Physis-Lang 用自演化物理语言改写视频世界模型:开源 Cosmos3-Nano 在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1

Physis-Lang 把物理语言当作数据筛选、模型训练与视频生成共享且可优化的表示,用物理感知评论器与 PhysCapBench 驱动的智能体循环迭代改进物理描述指令,并用语言引导检索补齐模型缺失的物理过程,在 Wan 与 Cosmos 骨干的四个物理视频基准上取得一致提升,其中基于开源 Cosmos3-Nano 的模型在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1。
Nature News

人类世提案被否两年后,学者指投票程序不透明并要求公开文件,同时12处全球地层记录综述重申1952年钚标记可作为界线

2024年国际地质科学联合会维持否决将人类世确立为正式地质时代的提案(地层学家小组委员会以12票反对、4票赞成、2票弃权否决),两年后,Jürgen Renn等学者在《Earth's Future》发文称存在未公开文件显示否决程序不合法且理由未获充分解释,呼吁IUGS公开关键文件并接受独立审查;与此同时,支持方在《Nature Reviews Earth & Environment》发表综述,汇总12处全球分布地层记录,指出20世纪中叶地球系统变化突然、全球同步且地层上可区分,1952年热核试验产生的钚增加是最合适的界线主标记,大气二氧化碳和甲烷浓度分别比全新世水平高51%和157%,全球升温达工业化前以
arXiv

DuoOPD 用师生联合结果改写蒸馏反馈:Qwen3 宏观准确率较 OPD 提升 2.58 个百分点,Llama 提升 5.98 个百分点

该工作提出 DuoOPD,一种多任务在线策略蒸馏方法:由学生自身的验证结果决定反馈方向,由教师与学生的联合结果决定教师如何提供支持——仅教师成功时把其已验证答案作为评分上下文,仅学生成功时用任务内共享权重强化整段回答,一条规则覆盖四种结果组合且无需任务特定设置;在 Qwen3 与 Llama 上,DuoOPD 在平均宏观准确率上超过全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等另外两个任务混合上同样领先。
arXiv

跨会议说话人归属评测:ThyVoice 以 47.13 的平均 SI-cpWER 领先全部商业级联,而单场最优的 ElevenLabs 在 CHiME-6 上归属误差增加约 30 个百分点

该工作提出以语料级全局说话人映射计算的 SI-cpWER 指标,在 CHiME-8 NOTSOFAR(干净与加噪)及 CHiME-6 上评测五个商业 diarize-then-identify 级联、两个开放基线以及端到端参考系统 ThyVoice,发现要求跨会议保持同一身份会改变商业系统排名:ThyVoice 在三种条件下均优于所有被评测的商业级联,全组平均 SI-cpWER 为 47.13,次优系统为 54.75。
arXiv

S²D-OPD 只保留每条回答中教师-参考 JSD 最高的 10% 状态,在八个师生设定中的七个把留出准确率从 46.36% 提到 47.31%

该工作指出 Direct-OPD 的 token 级对数比奖励只衡量相对变化,可以在教师与参考检查点分配给学生的候选 token 的概率质量趋于消失时保持不变,而教师-参考 JSD 与两个方向的 KL 会随之消失;据此提出 S²D-OPD,按教师-参考 JSD 对学生采样状态排序并屏蔽低散度状态上的监督,每条回答只保留最高的 10%,在两个教师对和四个 1.7B 至 8B 学生模型上,于 AIME 与 HMMT 留出基准的八个设定中有七个优于稠密 Direct-OPD、第八个持平,且不需要额外前向传播。
arXiv

PatchHolmes 让智能体一次读完 100 个候选提交,把漏洞补丁检索的 Recall@1 从 32.63% 提到 59.95%

PatchHolmes 是一个两阶段补丁检索系统,第一阶段用 BM25 加时间衰减与 Qwen3-Embedding-8B 稠密检索经 RRF 融合出 top-100 候选,第二阶段让一个冻结的开源权重 LLM 智能体通过 list_candidates、read_commit、read_file_diff、submit_answer 四个工具以列表式方式查看全部 100 个候选并只提交一个最佳提交;在 GitHubAD 的 809 个 CVE 上 Recall@1 达 59.95%,比逐点分类器 Favia 高 25.34%、比 IRCoT 高 31.40%,在候选集完全相同的条件下智能体本身比直接取检索器首位高 27.32%,同一智能体不加改动迁移到
arXiv

ReaLVR 用视觉证据监督潜空间推理,在 Qwen2.5-VL-7B 上取得 63.7% 五任务均值并把潜空间视觉推理扩展到 235B

该工作先分析潜视觉推理(LVR)中潜 token 的行为,指出存在“潜证据—信用缺口”——潜 token 对改变正确答案的图像扰动反应很弱,并认为这源于 GRPO 训练缺少显式监督;为此提出 ReaLVR,在模型自身自由运行的潜轨迹上引入视觉证据监督,用正确与错误答案的对比决定哪些位置需要更强监督、用相关与不匹配视觉证据的对比决定应保留什么,在三个模型家族上一致优于所评估的 LVR 基线,Qwen2.5-VL-7B 上五任务平均达 63.7%,并首次把潜空间视觉推理扩展到 235B 参数规模。
arXiv

Imagine3D-LLM 让多模态大模型先“想象”出紧凑 3D 场景再作答,在 SPAR-Bench 上以 7B 规模取得 68.5 平均分

该工作提出 Imagine3D-LLM:在图像 token 之后追加一小组可学习的 Gaussian summary token,将其解码为紧凑的 3D Gaussian Splatting 表示,并用光度重建损失与标准下一 token 预测联合训练,使多视图多模态大模型在作答前先组装一个粗略的 3D 场景表示;在七个空间推理与 3D 场景理解基准上一致优于此前方法,SPAR-Bench 平均分达 68.5,超过最强空间感知基线 3DThinker-7B 5.2 分。
arXiv

强化学习后训练视觉-语言-动作模型时,参数更新集中在仅占动作专家14.83%–27.58%的Timestep Modules,且其低秩方向可预测并提升任务成功率

该工作系统分析了强化学习(RL)如何重塑基于流匹配的视觉-语言-动作(VLA)模型,发现RL在π0.5与GR00T N1.5/N1.6等模型、LIBERO/ManiSkill/MetaWorld/CALVIN等基准上诱导出高度集中于动作专家Timestep Modules的低秩参数更新,这些模块以14.83%–27.58%的参数占比承载了不成比例的RL性能增益,其shift向量更新方向能以最高99.6%的ROC-AUC预测任务成功,且沿该方向引导可在不额外RL训练的情况下进一步提升策略表现。
arXiv

EVOKE 用同一状态下的多目标排序,把预训练世界知识逼进决策:ALFWorld 未见任务从 60.4% 升到 91.8%

EVOKE 是一种后训练方法,它在固定环境状态与交互历史的前提下为同一批候选动作引入替代目标并做对比排序,从而迫使策略调用预训练中已有的动作后果知识;在 ALFWorld、WebShop 与搜索式问答三类任务、三个骨干模型上,它取得最佳平均成绩,ALFWorld 未见游戏成功率由 πboot 的 60.4% 提升到 91.8%,且用更少动作完成。