跳到主要内容
返回时间线
arXiv来源发表:

Omni-Decision 用证据账本替代对话历史,在 OmniGAIA 上取得 81.4% 准确率且成本约为 Gemini-3.1-Pro 的 43%

核心概要

该工作提出 Omni-Decision 全模态智能体,用显式证据账本取代不断增长的对话历史,由 critic 过滤噪声观测、只把可用内容写入账本,使规划器全程在紧凑上下文中工作,并在每步记录状态、动作与判定,用监督微调和决策级强化学习进一步改进规划器;结果显示其在 OmniGAIA 上达到 81.4% 的最先进准确率、每题成本约为 Gemini-3.1-Pro 的 43%,在 WorldSense 长视频理解上达到 65.0%,与最强端到端模型持平。

Source-provided article image: Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents
Figure 1 ·

Figure 1: Omni-Decision on an OmniGAIA task. Each tool call is digested into ledger updates that close open evidence needs; once all needs are closed, the system answers against the recorded evidence.

arXiv

深度剖析

论文把全模态智能体的主要瓶颈定位为规划,而非感知:噪声多模态观测在对话历史中累积并干扰后续决策,同时多模态模型的多步规划能力有限。 相对以往把改进重点放在感知或端到端模型上的做法,这里通过受控的后端替换实验给出诊断,即替换规划器造成的性能损失远大于替换感知后端。 证据来自摘要所述的受控后端替换对比,属于诊断性实验;摘要未给出具体替换配置、样本量或损失数值。

Omni-Decision 以显式证据账本替代不断增长的对话历史,账本记录仍缺失的证据、已确认的证据以及记录之间冲突之处,critic 读取每个噪声观测并只把可用内容传入账本、丢弃其余部分。 这使规划器在整个任务过程中都基于紧凑上下文工作,而不是让原始多模态观测持续堆积在历史中。 证据为系统设计与摘要中的机制描述;摘要未报告账本规模、critic 过滤比例或消融数据。

每次运行都记录每一步的状态、动作与判定,并据此对规划器做监督微调和决策级强化学习。 把决策级轨迹作为训练信号,使规划器本身可被改进,而不只是依赖提示或固定策略。 证据为摘要所述训练流程;摘要未给出训练数据规模、超参数或训练前后对比数字。

Omni-Decision 在 OmniGAIA 上取得 81.4% 的最先进准确率,每题成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解上取得 65.0%,与最强端到端模型持平。 相对此前工作,该结果同时给出准确率与成本两个维度的定位,并在长视频理解上对标端到端模型。 证据为摘要报告的两个基准成绩与成本比例;摘要未给出置信区间、重复次数或各基准的评测细节。

启示与展望

该结果面向需要在视频、音频、网页与计算之间搜集证据的多步问答场景,适用于希望以较低每题成本获得高准确率的全模态智能体部署;证据账本与 critic 过滤机制也可为其他长程多模态任务提供设计参考。

摘要未给出受控后端替换的具体配置与损失数值、账本规模与 critic 过滤比例、训练数据规模与超参数,也未报告置信区间或重复次数;此外本次载入文本为摘要与元数据,缺少正文图表与消融结果,因此上述机制细节与成绩稳定性仍需以原文为准。

来源