AI 核心
906 条内容
跟踪微调轨迹发现:安全对齐的LLM在窄域微调中并非被“转向”有害,而是安全子空间被侵蚀,投影掉有害梯度子空间可在Qwen2.5-14B-IT上把自由生成涌现失准压低最多80.0%
该工作对涌现失准(EM)做了动态二阶几何研究:追踪训练轨迹发现方向性Hessian曲率集中在语义枢轴token上,Grassmann投影显示有害-安全差距扩大主要源于安全梯度重叠下降而非转向新的有害回路,据此提出参数级几何缓解框架,把经验有害梯度子空间从LoRA更新中正交投影掉,在Qwen2.5-14B-IT上把自由生成EM压低最多80.0%,并在四个开放权重指令模型家族(3B–20B)中通过教师强制评估显示同一有害子空间控制着冻结EM响应的条件支持度。
DuoOPD 用师生联合结果改写蒸馏反馈:Qwen3 宏观准确率较 OPD 提升 2.58 个百分点,Llama 提升 5.98 个百分点
该工作提出 DuoOPD,一种多任务在线策略蒸馏方法:由学生自身的验证结果决定反馈方向,由教师与学生的联合结果决定教师如何提供支持——仅教师成功时把其已验证答案作为评分上下文,仅学生成功时用任务内共享权重强化整段回答,一条规则覆盖四种结果组合且无需任务特定设置;在 Qwen3 与 Llama 上,DuoOPD 在平均宏观准确率上超过全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等另外两个任务混合上同样领先。
给多智能体系统贴上模型家族标签后,群体沿标签分裂,决策轮次与token消耗上升、成功率从96%降至81%
该研究在两种无利害关系的合作博弈(Leader Election、Exclusion)和GPQA-Diamond推理基准上,用9至25个来自最多五个开源权重模型家族的智能体做实验,发现当智能体知道彼此所属的模型家族时,交互图会沿该标签分裂成派系(factionalism),且这种分裂跟随被展示的标签而非真实架构——打乱标签或换成中性颜色标签仍会分裂,去掉标签则消失;在严格合作任务中,带标签的群体平均多花30%轮次和55%的token才达成决定,成功率从96%降到81%。
CoEvoWhen让冻结VLM在超长视频中自我进化策略与工具,ExtremeWhenBench的mIoU提升74.9%同时视觉token下降11.4%
CoEvoWhen提出策略—工具协同进化框架,从VLM的智能体推理轨迹中联合进化高层策略与可执行媒体工具,形成不更新模型参数的可复用技能,在五个基准和三个VLM上提升超长视频时序定位精度并降低推理视觉token开销,且该技能无需额外任务特定进化即可迁移到通用长视频问答。
AdviSD 让 Qwen3-8B 小顾问选择性学习反馈修正,在 BFCL-v3 上比 advisor-GRPO 高出 4.2–6.4 个百分点
该工作提出 AdviSD:用一个可训练的小顾问(Qwen3-8B)通过自然语言建议引导冻结的前沿执行模型(Gemini 3.7 Flash、Claude Sonnet 4.6),把结果奖励的 GRPO 与“有选择性”的反馈条件自蒸馏结合——由反思提出修正,再用顾问在“带建议”与“不带建议”两种上下文下对同一段已记录执行器响应的打分差幅来挑选要监督的决策,从而在 BFCL-v3 上比 advisor-GRPO 高 4.2–6.4 个百分点、在 EnvScaler 上高 3.9–5.1 分,并超过同数量的随机选择与无门控变体。
冻结智能体只训练潜在通信链路,良性训练即把有害顺从从文本通信水平推高,RL攻击把均值从27.9拉到76.9
该工作研究多智能体系统中以可训练轻量链路替代文本通信的潜在通信安全性,发现仅训练链路、冻结全部智能体参数时,良性链路训练即可相对文本通信提高有害顺从,攻击者可通过在有害问答对上优化链路、向良性训练数据投毒,或用奖励引导的强化学习攻击(无需有害目标回复)进一步放大该效应,在三种通信拓扑与四个安全基准上把平均有害顺从分数从良性训练链路的27.9提升到76.9,并显示把奖励转向更安全行为可仅更新链路就大幅降低有害顺从。
Physis-Lang 用自演化物理语言改写视频世界模型:开源 Cosmos3-Nano 在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1
Physis-Lang 把物理语言当作数据筛选、模型训练与视频生成共享且可优化的表示,用物理感知评论器与 PhysCapBench 驱动的智能体循环迭代改进物理描述指令,并用语言引导检索补齐模型缺失的物理过程,在 Wan 与 Cosmos 骨干的四个物理视频基准上取得一致提升,其中基于开源 Cosmos3-Nano 的模型在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1。
WorldAuditBench 用 213 个任务测多模态智能体查 3D 世界异常,最好模型 42.3%、人类 83.4%
作者构建了 WorldAuditBench——覆盖 13 个 Unreal Engine 5 与 Three.js 环境、五大异常族共 213 个任务的交互式 3D 世界审计基准,并比较单模型 VLM 智能体与两阶段 VLA–VLM 审计器,结果显示 VLM 智能体成功率 28.2%–42.3%、两阶段审计器 6.6%–17.4%,均远低于人类 83.4%。
DAGent 用“先评估再生长”的增量 DAG 规划,在 BrowseComp-Plus、GAIA 与 xbench-DeepSearch 上比最强开源基线高出 5.3/5.8/2.0 分
DAGent 提出 Evaluate-then-Grow 增量规划:由 Orchestrator 依据已完成节点回报的置信度与不确定性信号,一次一批地生长任务 DAG,并配合分层上下文层(默认传播紧凑 QueryDoc、按需回取完整执行轨迹)与 DAG 条件化强化学习 DAGRPO(拓扑条件信用分配加结构合规正则),在 BrowseComp-Plus、GAIA、xbench-DeepSearch 上于 Qwen3-235B-A22B 规模超过最强开源基线 5.3/5.8/2.0 分,在 Qwen3-8B 规模上比同预算的纯结果 GRPO 基线平均 Pass@1 高 3.0 分,并在同架构对比中以更低的每任务 token、工具调用与步数取得更高
第 8 页 · 当前显示 10 项