OmniSeek 让 Omni-LLM 在多轮推理中自主决定看或听,并在多模态基准上稳定提升音视频推理表现
相关研究与后续进展核心概要
作者提出 OmniSeek 智能体框架,把证据获取纳入推理过程:模型在多轮协议中动态决定看或听以及时间窗口,将检索到的原始音频或视觉片段追加回上下文,并用合成的 OmniTraj-170K 多跳思维链轨迹做冷启动监督,再经两阶段可验证奖励强化学习优化,同时引入音视频必要性目标奖励真正依赖双模态的成功轨迹,实验显示其学到自适应跨模态证据搜寻并稳定提升音视频推理表现。
Figure 1 : Interleaved Multi-turn Audio-Visual Reasoning. OmniSeek acts as an active agent operating through an iterative <think> → \rightarrow <tool_call> → \rightarrow <observe> loop. The agent dynamically alternates between fetching audio cues and extracting visual evidence from different time spans to answer a complex multi-hop question, avoiding the pitfalls of single-modality shortcuts.
arXiv深度剖析
OmniSeek 把证据获取变成推理的一部分,而不是一次性前向处理整段音视频序列。 相对被动处理完整音视频序列的做法,该框架让模型动态决定看还是听、以及覆盖哪个时间窗口,以在长上下文中检索稀疏但关键的跨模态证据。 摘要以框架描述与多轮协议说明为主,未给出具体基准名称、数值或消融结果。
通过迭代多轮协议,检索到的原始音频或视觉片段被追加回上下文以支撑后续推理。 把检索结果回注上下文,使后续推理建立在已获取的原始证据之上,形成多轮闭环。 摘要层面的机制描述,未提供轮数、上下文长度或检索粒度的量化细节。
作者构建数据引擎合成 OmniTraj-170K,用多跳思维链轨迹冷启动多轮工具使用能力。 以交错音频与视觉证据的多跳思维链轨迹先做监督,再以两阶段可验证奖励强化学习进一步优化策略。 摘要给出语料名称与规模量级以及训练流程顺序,未报告数据构成比例或训练超参。
引入音视频必要性目标,显式奖励推理确实依赖两种模态的成功轨迹,抑制单模态捷径。 在奖励设计中加入对双模态依赖的要求,而非仅以任务成功为奖励信号。 摘要说明该目标的作用方向,未给出奖励权重、对照设置或捷径行为的量化下降。
启示与展望
该工作面向需要从长音视频上下文中检索稀疏关键证据的多轮音视频推理场景,适用于具备工具调用能力的 Omni-LLM 智能体。它使模型能够在推理过程中主动选择看或听以及时间窗口,并把原始片段回注上下文,从而为长上下文多模态问答、跨模态证据定位等任务提供可复用的训练与优化范式;OmniTraj-170K 与两阶段可验证奖励强化学习流程也为后续冷启动多轮工具使用提供参考。
当前仅依据摘要,无法确认具体基准、评价指标、提升幅度、消融结果以及音视频必要性目标的权重设置;OmniTraj-170K 的合成方式、数据质量与覆盖范围,以及两阶段强化学习的稳定性与可复现细节,仍需在正文中核对。多轮工具调用在更长上下文或更高时间分辨率下的表现,以及是否会出现对单一模态的残余依赖,也是值得继续观察的开放问题。
