跳到主要内容

检索

“全部学科” · 1364 项结果

第 5 页 · 当前显示 20 项
arXiv

南科大与港城大提出Box2-Bench:前沿模型用得上好工作流,却在坏工作流下最多掉43.3分

作者提出Box2-Bench,在固定模型与任务的前提下只改变工作流的可用性与可靠性(无、好、坏、部分、混合五种匹配条件),发现Gemini 3.7 Flash、DeepSeek V4 Flash、GLM 5.2等前沿模型在12个模型–任务对中8对受益于好工作流、12对全部被坏工作流拉低(降幅3.3至43.3分),且混合条件在12对中10对低于匹配的部分条件;随后仅用坏工作流训练两个开放权重模型,反事实SFT把坏工作流惩罚从20.0分降到6.7分(AIME)和从9.8分降到0.6分(WebShop),但削弱了对留出好工作流的利用,结果奖励RL又把AIME上的利用率从-3.3恢复到+6.7,并在多智能体协作
arXiv

AED 把 50,228 条失败轨迹变成错误—诊断对:首次修正让验证器通过率从 18.4% 升到 51.1%,全诊断微调把 Qwen3-8B 的步级一致率从 47.2% 提到 63.6%

该工作构建了 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,并用五阶段 Agentic Error-to-Training(AET)流水线把自然失败连到诊断、修正建议与可选回放证据;在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%(+32.7 个百分点),在单独冻结的诊断发布上做全诊断微调,使 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 升至 63.6%(三个种子、943 例留出集平均),而单种子的 actor 训练对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练
arXiv

EvolvingNav用时间索引的4D信念预测目标去向,在EvoWorld-Bench上把首次检查成功率从45.33%提升到61.32%

该工作提出EvolvingNav,用带时间戳的3D物体历史构建“持续—迁移”信念,并通过事件驱动的预测—观察—重规划滤波器在目标可能于查询前或导航途中被移动的情况下推断其当前位置,同时发布包含54个场景、803,680个任务的EvoWorld-Bench基准,在仿真与真机实验中相比所评估基线提升了导航成功率与搜索效率。
arXiv

LANTERN 用 Qwen3-32B 隐藏状态在 8 小时内从 OEIS 5000 万对序列中筛出 62 条已验证关系,其中 4 条未见于 OEIS 与定向文献检索

LANTERN 在预训练模型 Qwen3-32B 的激活上训练线性分类器,对 OEIS 中 1 万个高频引用序列构成的 5000 万对候选关系排序,再经廉价过滤、假设生成、可执行验证与解析检查,产出 62 条此前无 OEIS 交叉引用的已验证关系,内容筛查保留 13 条、其中 9 条具信息性或洞察性,4 条未见于 OEIS 与定向文献检索,端到端耗时不足 8 小时。
arXiv

DC-SAE 用语义加像素双分支把图像压缩到 32 倍,ImageNet 上 gFID 3.37、PSNR 29.79,并比 DC-AE 快 4.41 倍

北京大学与新加坡科技设计大学提出 DC-SAE 解耦紧凑语义自编码器,用冻结语义编码器提供生成友好的紧凑潜空间、用可训练像素编码器保留低层细节,在 32 倍空间压缩下于 ImageNet 取得 29.79 PSNR 与 3.37 gFID,较 DC-AE 在 PSNR 上提升 13.5%、gFID 上提升 54.9%,并实现 4.41 倍加速,同时一个 B 参数 DiT 在 GenEval 得 0.84、DPG-Bench 得 86.007。
arXiv

RIDE 把 RL 教师的隐藏状态残差外推,在四个基座/教师对上均值追平或超过教师

该工作提出 RIDE(RL-Induced Direction Extrapolation):在学生自采样轨迹上,逐层计算 RL 教师与其 RL 前检查点之间的隐藏状态残差,把学生的表示回归目标沿该残差外推到教师之外,在四个基座/RL 教师对(R1-Distill-1.5B、Qwen3-4B、Llama-3.2-3B、Phi-4-mini)上于 AIME24、AIME25、AIMO 的 Avg@16 均值均接近或超过 RL 教师,是唯一均值做到这一点的对比方法,并一致优于输出空间外推。
arXiv

CUA-SWE 用 105 个可执行任务测出:给智能体看运行界面后,GPT-6-Astra 四域均值从 11.3% 升到 59.9%

作者提出 CUA-SWE——一个覆盖 Web、Game、DevOps、Mobile 四个软件工程领域、共 105 个任务的基准、交互式开发环境与评测流水线,让智能体在同一任务中改代码、跑命令、操作运行中的软件并查看截图,用任务专属的确定性测试判定结果;在代码-only 与混合 CUA 两种条件下对比前沿模型,GPT-6-Astra 取得最高四域均值 59.9%,且每个前沿模型在混合 CUA 下聚合成功率都更高,增益集中在必须从应用材料(图纸、服务契约、图形参考卡)中恢复需求的任务上。
arXiv

六个预训练语言模型的残差流在早期就偏向自身终点,但竞争者集合随深度收缩时成员仍在换血

该研究把每个上下文自身的最终残差状态与来自其他上下文的最终状态库作比较,在 Gemma-2B、Gemma-7B、Qwen2.5-1.5B、Qwen2.5-7B、Mistral-7B 和 Llama-3-8B 六个预训练模型上发现:自身终点在最早测量层就比平均替代终点更近,但许多单个替代终点仍更近;竞争者集合随深度总体缩小,却同时存在进入与退出,且方向对齐可以在欧氏距离几乎不变时改善;作者还给出一个高维模型分离范数、对齐与终点几何的作用,并证明朝自身终点的直线路径不会引入新竞争者。
arXiv

CoEvoWhen让冻结VLM在超长视频中自我进化策略与工具,ExtremeWhenBench的mIoU提升74.9%同时视觉token下降11.4%

CoEvoWhen提出策略—工具协同进化框架,从VLM的智能体推理轨迹中联合进化高层策略与可执行媒体工具,形成不更新模型参数的可复用技能,在五个基准和三个VLM上提升超长视频时序定位精度并降低推理视觉token开销,且该技能无需额外任务特定进化即可迁移到通用长视频问答。
arXiv

AdviSD 让 Qwen3-8B 小顾问选择性学习反馈修正,在 BFCL-v3 上比 advisor-GRPO 高出 4.2–6.4 个百分点

该工作提出 AdviSD:用一个可训练的小顾问(Qwen3-8B)通过自然语言建议引导冻结的前沿执行模型(Gemini 3.7 Flash、Claude Sonnet 4.6),把结果奖励的 GRPO 与“有选择性”的反馈条件自蒸馏结合——由反思提出修正,再用顾问在“带建议”与“不带建议”两种上下文下对同一段已记录执行器响应的打分差幅来挑选要监督的决策,从而在 BFCL-v3 上比 advisor-GRPO 高 4.2–6.4 个百分点、在 EnvScaler 上高 3.9–5.1 分,并超过同数量的随机选择与无门控变体。
arXiv

JEV类直接决策模型在36个有序数据集上只用掉67–76%的有效标签空间,BA-LoRA后训练可把利用率从约47%提到86%

该研究分析JEV 1.13与三个开源KEV模型(0.8B/4B/9B),在ANLI上发现JEV以74.95%准确率却把38.8%的预测和51.3%的错误都给了Neutral,进而在36个有序数据集上测得最终决策只覆盖67–76%的有效金标支持(四个名义任务为87–102%),并通过候选顺序随机化、同一批样本上把量表从K=2细化到K=14(K=14时利用率降至26–75%)、以及BA-LoRA定向后训练(八个受监督量表上金标相对利用率从约47%升至86%)表明这种“有序量表利用率偏差”是习得且可修改的决策阶段候选空间压缩。
arXiv

SpatialCORE 把「框得准不准」和「框得自不自信」一起写进奖励,8B 模型在 OmniSpatial 与 SpatiaLab 上超过同规模开源与专用空间推理模型

SpatialCORE 是一个基于 GRPO 的后训练框架,它用模型自身生成 grounding(边界框)时的坐标 token 不确定性来加权几何匹配质量,并用答案门控把 grounding 优化与最终答案正确性绑定,使模型学会从「既准确又自信」定位到的任务相关物体出发进行空间推理;在 OmniSpatial 留出测试集上 SpatialCORE-8B 取得开源与专用空间推理模型中最高的加权平均准确率,并在未参与训练的 SpatiaLab 上零样本领先,消融显示去掉置信度加权后准确率从 56.33% 降到 52.33%。
arXiv

BiasReducer 只改奖励头:五个奖励模型在三个偏见基准上平均提升 8.3/18.0/6.9 个百分点

该工作提出 BiasReducer,一个只编辑线性奖励头、不重训奖励模型的轻量框架:先用带语义监督的稀疏自编码器式编码器学习长度、自信、谄媚等预设属性的内部表示,再为每个属性确定调整奖励头的方向与幅度并存入编辑库,最后针对新数据集按属性对奖励分数的影响力排序并选择相应编辑;在五个奖励模型上,BiasReducer-M 使 RM-Bench-Hard、Arena-StyleConflict、JudgeBiasBench 平均提升 8.3、18.0、6.9 个百分点,优于两个基于训练的基线,并在下游 best-of-n 选择与 GRPO 训练中减少冗长与谄媚而保持质量可比。
arXiv

让 Builder 学会设计执行环境:元技能让固定权重智能体宏平均分提升 8.95 个百分点

该研究提出“元技能”(meta-skill)——即规定何时需要支持、提供何种资源、Target 应如何使用这些支持的原则——让 Builder 在 Builder 与 Target 权重均固定的条件下,从 Target 在开发集上的执行反馈中学习这些原则,冻结技能库后为未见任务构建 harness;在 Harness-Bench 与 NewtonBench 上,全库元技能相对无技能构建使宏平均分提升 8.95 个百分点,相对把同一技能库直接交给 Target 提升 12.02 个百分点。
arXiv

LEAP 让小时级音视频问答不再整段塞进上下文:在 Qwen3-Omni-30B 上比官方配方高 4.5–16.8%,并迁移到 MiniCPM-o 4.5

LEAP 把小时级录音切成固定时长块、对每块做一次轻量定位打分以挑出少量候选窗口,再把这些窗口重新编码进一次有界作答,从而让作答输入与峰值上下文不随录音时长增长;在多个 AVQA 基准上比 Qwen3-Omni-30B-A3B 基线提升 4.5–16.8%,并迁移到 MiniCPM-o 4.5 超过其已发表结果 3.1–13.0%。
arXiv

RoboCoach 用世界模型想象失败来挑选示范:仅 150 条子任务示范把 Franka 成功率从 13.3% 提到 75.0%

该工作提出 RoboCoach,一个由世界模型引导的主动教练框架,其 Route–Imagine–Diagnose–Improve(RIDI)循环让可复用技能专家在共享动作条件世界模型 CoachWorld 中闭环执行,用进度判定器记录首个未完成的子任务,再据此决定采集哪些子任务示范、更新哪些专家适配器;在 LIBERO 与 RoboTwin 两套仿真和 Franka 与 AgileX 两个真机平台上,想象成功率与实机成功率在 22 个任务–策略对上 Spearman 相关为 0.840,每平台仅增加 150 条子任务示范后 Franka 成功率由 13.3% 升至 75.0%、AgileX 由 40.0% 升至 83.8%,并在四个留出组合上取得
arXiv

系统提示中隐藏的当前日期让9个模型成绩波动,最高达14%并重排榜单

该研究在9个近期大模型和6个数据集上固定其他配置、只改变系统提示中隐藏注入的当前日期(2024年全年逐日扫描),发现仅日期变化即可让多选问答准确率波动最高6%、数学推理最高14%、代码生成最高7%、机器翻译最高2.84 BLEU,模型排名随之改变,且该效应大于批大小与数值精度等已知非确定性来源,思维链提示不但不能缓解反而放大敏感性。
arXiv

给多智能体系统贴上模型家族标签后,群体沿标签分裂,决策轮次与token消耗上升、成功率从96%降至81%

该研究在两种无利害关系的合作博弈(Leader Election、Exclusion)和GPQA-Diamond推理基准上,用9至25个来自最多五个开源权重模型家族的智能体做实验,发现当智能体知道彼此所属的模型家族时,交互图会沿该标签分裂成派系(factionalism),且这种分裂跟随被展示的标签而非真实架构——打乱标签或换成中性颜色标签仍会分裂,去掉标签则消失;在严格合作任务中,带标签的群体平均多花30%轮次和55%的token才达成决定,成功率从96%降到81%。
arXiv

循环混合专家模型首次拥有联合缩放定律:稀疏度把循环的有效参数增益抬高并延后饱和

该工作提出 Loop Scaling Laws,首次把循环(recurrence)与 MoE 稀疏度同模型规模、训练数据一起纳入同一个缩放定律,用一个有界且以稀疏度为条件的循环映射刻画循环带来的有效参数增益及其饱和点,在留出集上比线性与幂律映射预测损失更准,并据此在算力与显存约束下选择循环次数与专家数,在万亿 token 规模上让 0.3B 激活/1.3B 总参数的循环 MoE 在推理基准上追平约 2 倍大的非循环 MoE。
arXiv

SkillGym 把 18.4 万个社区技能变成可验证训练环境,9B 微调模型在两个基准上超过 397B 未训练模型

SkillGym 提出一条自动流水线,从互联网抓取技能并筛选出可离线复现的部分,用 builder-reviewer 智能体系统围绕四种推理结构构造带参考解与可执行验证器的技能关键型任务,再用三个教师模型和四个 agent harness 采集成功轨迹做监督微调,使 2B 到 122B 的六个模型在四个技能使用基准上 24 项比较中 22 项提升,其中 9B 模型在 SkillGym 测试集与 SkillEval 上超过 Qwen3.5-397B-A17B,并把智能体读取相关技能的比例从 28% 提高到 96%。