跳到主要内容

AI 核心

906 条内容

  1. arXiv

    EVOKE 用同一状态下的多目标排序,把预训练世界知识逼进决策:ALFWorld 未见任务从 60.4% 升到 91.8%

    EVOKE 是一种后训练方法,它在固定环境状态与交互历史的前提下为同一批候选动作引入替代目标并做对比排序,从而迫使策略调用预训练中已有的动作后果知识;在 ALFWorld、WebShop 与搜索式问答三类任务、三个骨干模型上,它取得最佳平均成绩,ALFWorld 未见游戏成功率由 πboot 的 60.4% 提升到 91.8%,且用更少动作完成。
  2. arXiv

    SkillSeek 用 BM25 加小型重排器在 89 项 SkillsBench 任务上追平 LLM 介导检索,单次花费从 51.30 美元降到 27.54 美元

    该工作提出开源两阶段技能检索器 SkillSeek(BGE-base 双编码器接小型交叉编码器,经 MCP 暴露),在 89 项 SkillsBench 基准、两种技能池与两种骨干模型的网格上,观察到纯 bm25 在四个设置中的三个达到或超过 Liu 等人 LLM 介导循环的通过率,小型交叉编码器在第四个设置(34K 池 + Qwen3.5)补齐差距至相同的 0.442,同时把每次试验总花费从 51.30 美元降到 27.54 美元(距无技能基线 27.41 美元不到五十美分),并把这一模式归因于第一阶段召回上限。
  3. arXiv

    Endless Exam 用 14 族数学构造题给九个模型打分:GPT-6 Astra 带工具后总分 143.16,但 30 个已发表前沿无一被超越

    作者提出 Endless Exam 基准,覆盖十四类参数化数学构造问题、共 69 个评测实例,对提交对象自动验证有效性并给出不设上限的相对质量分(100 分等于平均达到参考构造),在九个模型、十七种配置上评测发现:无工具时总分从 7.55 到 91.90,带代码与网络工具后 GPT-6 Astra、GPT-5.6 Luna、Claude Opus 5.5 分别达到 143.16、119.35、180.06,但 30 个已发表前沿参考无一被超越。
  4. arXiv

    UniEvo-VL 让多模态模型用自己的批评做老师,GenEval 从 0.747 升到 0.808

    UniEvo-VL 提出一种在线策略自蒸馏(OPSD)训练配方:让同一个多模态模型分别扮演只看原始提示的学生和额外看到批评改写提示的老师,在学生的去噪轨迹上最小化两者逐状态分布差异,在 Qwen-Image-2512 上把 GenEval 从 0.747 提升到 0.808、GenEval2 Soft-TIFA 从 32.97 提升到 35.53,并显示更强外部批评者(GPT5.6-Luna)可带来更高上限,而文本渲染等任务的收益并不一致。
  5. arXiv

    ThinkV2V 让 MLLM 先思考再剪辑:5B 模型在复杂与标准视频编辑基准上均取得最佳总分

    该工作提出 ThinkV2V,一个在视觉生成前显式激活多模态大模型思考的推理驱动视频编辑框架:它用 Qwen3-VL-Thinking-8B 对源视频与指令做思维链推理并输出精炼提示,经可学习查询连接器把隐藏状态注入 Wan-2.1-5B 的 DiT,配合渐进式课程训练与推理时思考扩展,并构建 ThinkV2V-150K 数据集与 ThinkV2V-Bench 基准;在两种评判模型下,该 5B 规模模型在复杂与标准编辑场景中均取得最佳总分,并超过若干 10B 级基线。
  6. arXiv

    系统提示中隐藏的当前日期让9个模型成绩波动,最高达14%并重排榜单

    该研究在9个近期大模型和6个数据集上固定其他配置、只改变系统提示中隐藏注入的当前日期(2024年全年逐日扫描),发现仅日期变化即可让多选问答准确率波动最高6%、数学推理最高14%、代码生成最高7%、机器翻译最高2.84 BLEU,模型排名随之改变,且该效应大于批大小与数值精度等已知非确定性来源,思维链提示不但不能缓解反而放大敏感性。
  7. arXiv

    OASIS把自蒸馏监督限制在已验证轨迹上,在Qwen3-1.7B/4B/8B上把对OPSD的平均提升从0.59分扩大到3.05分

    该工作通过截断续写实验发现,在策略自蒸馏(OPSD)中教师相对学生的优势主要集中在学生答错的轨迹上(1.7B时77%对37%),且这一优势随模型规模增大而缩小,于是提出OASIS:保持OPSD目标不变,只把监督限制在最终答案通过验证的最短在策略轨迹上,并用同题的另一条自生成轨迹(通常是学生自己的失败尝试)替代书面参考解作为教师上下文,在Qwen3-1.7B、4B、8B上于AIME 2024、AIME 2025、HMMT 2025的平均Avg@12上分别比OPSD高0.59、1.86、3.05分,同时不再需要书面解答。
  8. arXiv

    同一观测对应多个有效动作时,CVAE 的 KL 正则与流模型的 Lipschitz 平滑度决定策略能否保留多模态,而主流机器人仿真基准其实几乎单模态

    该工作形式化定义了行为克隆中的多模态,证明潜变量策略保留示范模态需要潜表示携带动作条件信息、过强的后验—先验正则会压制该信息,动作空间生成策略则受基分布到动作映射的 Lipschitz 常数限制,并在合成多模态导航、真实机器人双模态组织抓取任务上验证这些机制,同时用基于 GMM 模态聚类的诊断发现 Push-T、UR3、LIBERO、Meta-World 等标准仿真基准的条件多模态很有限、确定性回归仍有竞争力。
  9. arXiv

    WUSH-KV 用数据自适应变换把 2-bit KV 缓存困惑度从 OSCAR 的 13.74 降到 10.51,并在 8B 四项下游任务上全面领先

    该工作把原本用于权重-激活量化的 WUSH 变换迁移到分组查询注意力的 KV 缓存上,用校准数据为每个 KV 头分别构造键变换与值变换(值变换折进权重、键变换置于 RoPE 之后),在 QuEST 量化器下证明该变换在灵敏度均衡的变换类中近最优,并在 SGLang 中以 OSCAR 式百分位裁剪仿射量化做端到端评测:2-bit 下 Qwen3-8B 的 WikiText-2 困惑度为 10.51(OSCAR 13.74),8B 的 AIME 2025、MATH-500、GPQA Diamond、LiveCodeBench v6 四项均高于 OSCAR。
  10. arXiv

    NavHarness 让机器人把地图、搜索记录与房屋笔记带进下一次对话,GOAT-Bench 上 s-SR 提升 18.6 至 34.8 点

    NavHarness 是一个无需训练的具身导航外壳,把记忆处理放进导航循环:每次任务开启新的多轮智能体会话,但通过地图、任务记录与房屋笔记继承先前经验,并在任务结束时做结果核验与运行末整合;在 GOAT-Bench 上相对仅用当前上下文的独立会话,s-SR 分别提升 18.6 点(GPT-6 Astra)、22.6 点(Opus 5)、34.8 点(GPT-4o)和 30.3 点(Qwen3.8-27B),使用 SLAM 估计位姿时 Astra 达到 83.7 s-SR 与 36.9 e-SR,在 IR2R-CE 上达到 85.9 s-SR。

第 7 页 · 当前显示 10 项