跳到主要内容
返回时间线
arXiv来源发表:

Omni-Decision 用证据账本把全模态智能体的规划瓶颈变成可归因对象,在 OmniGAIA 上以 81.4% 准确率、约 43% 成本超过 Gemini-3.1-Pro

核心概要

该工作提出 Omni-Decision:用任务级证据账本取代不断增长的对话历史,由 critic 把每个含噪多模态观测消化为类型化证据事件、经确定性 reducer 提交,使规划器始终在紧凑且已验证的状态上决策;受控替换实验显示替换规划器造成的性能损失远大于替换感知后端,系统在 OmniGAIA 上达到 81.4% 准确率(约为 Gemini-3.1-Pro 每题成本的 43%),在 WorldSense 长视频理解上达到 65.0%,并可用执行轨迹对较弱规划器做监督微调与决策级强化学习。

AI-generated editorial illustration: Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents

深度剖析

通过受控后端替换,把全模态智能体的主要瓶颈定位在规划侧:固定 Gemini-3.1-Pro 感知时,规划器从 GPT-5.2 依次换为 GLM-5.2、Qwen3.5-Plus、Qwen3.5-27B,总体准确率从 81.39% 逐步降到 46.94%,换成 Qwen3-Omni-30B 只剩 14.72%;而固定 GPT-5.2 规划器时,三种感知替换都保持在 58.89% 以上。 此前关于规划是短板的判断多来自跨基准的间接观察(如无原生音视频感知的编码智能体可与原生模型相当、同一模型不同 harness 差异可超过模型间差异),该工作在同一全模态任务域内用逐后端替换把这一判断变成可归因的对照结果。 同一评测窗口、同一 judge、其余组件固定,逐项替换一个后端;Qwen3.5 同代 Plus 档给出最直接对比:换规划器损失 23.3 分,换感知损失 15.8 分,比例约 1.5;当规划器足够弱时(同时替换两者得 13.89%)感知质量几乎不再影响结果。

证据账本机制把观测噪声挡在持久上下文之外:每个任务维护记录未闭合需求、事实与计算槽位、已确认证据原子和未解决冲突的类型化账本,critic 在瞬时调用中把每个观测消化为类型化证据事件,reducer 作为唯一写入者按确定性规则逐字段提交,规划器的持久上下文只含账本的控制投影与当前正在审查的那一条原始观测。 既有系统把中间观测放在自由文本轨迹、文件工作区或未类型化的文本记忆中,规划直接在这些序列上运行;压缩类方法(如 ACON、复杂度陷阱研究)是在消息进入历史之后再压缩,而该设计在观测到达时即消化为类型化状态更新,使持久上下文长度在任务中近似恒定。 状态消融中,完整方法在 OmniGAIA 上为 81.39%,滚动自然语言摘要的 Memory 为 68.33%,无账本的 ReAct 为 60.28%;相对无账本 ReAct,Medium 与 Hard 提升约 24 分,Easy 约 16 分,说明长任务更依赖对需求闭合状态的追踪。

执行轨迹本身构成无需逐步人工标注的训练信号:state-SFT 保留 judge 判为正确的运行、把每步展开为账本状态与规划动作的配对,closure-aligned 强化学习则针对弱规划器在需求未闭合时弃答或过早收敛的主导失败,用规则化闭合检查与轻量奖励 judge 对单个决策打分,无需系统级 rollout。 该配方把账本中显式列出的开放需求当作可离线评分的依据,使决策级 RL 不必执行动作即可获得密集反馈;与 Orchestra-o1 的 DA-GRPO 相比,四维奖励中两维由账本规则直接决定,另两维以开放需求列表为锚,减少了奖励 judge 的自由裁量。 Qwen3.5-27B 经 state-SFT 加 RL 从 46.94% 提升到 50.56%,Medium 与 Hard 一致改善;Qwen3-Omni-30B 仅 state-SFT 即从 14.72% 升到 18.61%;训练集为 640 条轨迹(100 条 OmniGAIA Easy 与 540 条 WorldSense),Medium 与 Hard 评测集按任务 ID 与训练数据不相交。

在开放世界工具交互与常规长视频理解两类任务上,该系统分别取得 81.39% 与 65.0%:OmniGAIA 上高于同窗口同 judge 测得的 Gemini-3.1-Pro 79.44%,每题平均约 1.2 美元对约 2.8 美元;WorldSense 上与公开榜单领先端到端模型持平(Gemini-3.1-Pro 为 65.5%),每题约 0.3 美元对约 0.8 美元。 同一对后端下,各 harness 的总体准确率从 5.56% 到 81.39% 不等,说明系统层决定模型能力被实现的程度;该工作把这一层做成可定义、可消融的显式对象,并给出成本账单记录而非由 token 数推算的开销对比。 OmniGAIA 含 360 道跨视频、音频、图像、网络证据与计算的开放世界问题;WorldSense 为答案包含在视频、音频与字幕中的多选长视频基准且禁用网络搜索;成本来自计费记录,OmniGAIA 上每题区间 0.46–2.77 美元,WorldSense 上 0.08–0.40 美元。

启示与展望

该结果面向需要跨视频、音频、网页与计算寻找证据的全模态问答场景,以及答案包含在媒体中的长视频理解场景;账本机制在推理时不需要训练,因此可直接用于不同规划器骨干,并支持原生多模态输入与按需工具化感知两种接口。对实践者而言,这意味着可以把系统层当作独立对象来定义、消融与替换后端,并用执行中记录的账本状态、动作与 verdict 作为无需逐步人工标注的后训练信号;对研究者而言,它提供了一个在同一任务域内逐项替换规划器与感知后端、从而归因瓶颈的实验范式。作者也指出当前设计的一个范围边界:critic 只以文本形式读取观测,媒体从不进入其输入,因此账本质量受感知工具文本输出的限制,直接读取多模态输入的 critic 是自然的下一步。

读者仍会关注若干开放问题:账本质量受感知工具文本输出限制这一范围边界在更强多模态 critic 出现后会如何变化;训练收益随规划器骨干初始能力而不同,这一梯度在更强骨干上是否仍然成立;证据进度审计显示剩余失败集中在媒体感知与外部检索(67 个错误案例中媒体感知 27 例、外部事实检索 22 例、验证与冲突解决 9 例、计算 6 例、过早停止 3 例),这些环节的改进空间如何与规划层改进相互作用;此外,同窗口比较中 Gemini-3.1-Pro 使用内置检索且无法施加同样的域名屏蔽,作者报告的是未调整的实测分数,这一比较条件值得读者留意。本总结基于所加载的论文全文与外部报道文本,未包含图表与附录中的全部细节。

来源