跳到主要内容
返回时间线
arXiv来源发表:

OmniSeek 让 30B 全模态模型自己决定看还是听:在 10 个音视频基准上超过同规模开源模型,VideoHolmes 达 74.6%

核心概要

研究者提出 OmniSeek,把全模态大模型改造成可多轮调用工具(get_audio_clip、get_video_clip)的主动取证智能体,并用自建数据引擎合成 169,725 条交错音视频证据的思维链轨迹 OmniTraj-170K,配合三阶段训练与 Audio-Visual Necessity 奖励,在 10 个全模态基准和 4 个通用视频基准上取得领先或具竞争力的成绩。

AI-generated editorial illustration: OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

深度剖析

OmniSeek 把音视频推理从单次前向的被动编码改成多轮主动取证:模型在 <think> <tool_call> <observe> 循环中自行决定查音频还是查视频、查哪一段时间窗,检索到的原始片段被直接追加回上下文。 此前多模态思维链方法(如 OmniVideo-R1、OmniReasoner)主要依赖文本推理轨迹、模态耦合或单轮检索,OmniSeek 用解耦的双工具实现跨模态、跨时间窗的独立路由。 论文给出工具定义 get_audio_clip(start, end) 与 get_video_clip(start, end, fps, resolution),并说明终止条件由模型自反思决定而非硬编码;对照实验中多轮多模态范式相对同等两阶段 RL 训练的纯文本 CoT 基线在 OmniVideoTest 上高 13.5%、WorldSense 高 8.1%、Daily-Omni 高 7.0%。

作者构建了 OmniTraj-170K:169,725 条轨迹、覆盖 39,797 个视频,每条问题绑定 2 至 7 个带绝对时间戳的证据片段,且强制至少包含一个音频片段和一个视频片段。 数据引擎分三阶段(结构化音视频对齐、证据锚定问答生成、交错轨迹组装),工具调用与观察内容由证据链确定性构造,模型只生成 <think> 节点,以降低标注幻觉。 统计显示 76.1% 轨迹需要两次工具调用、23.9% 需要三次及以上;证据片段大多持续 3 至 10 秒;源视频来自 FineVideo,覆盖 122 个类别。在受控单轮 SFT 对比中,用 100K 子集训练在 LVOmni 上比基座高 5.8%、Daily-Omni 高 3.9%。

三阶段训练(冷启动 SFT、GSPO 强化学习、难例精修)逐步恢复并超越基座:Phase 1 出现“对齐税”导致多数基准下滑,Phase 2 RL 大幅回升,Phase 3 加入 Audio-Visual Necessity 奖励后进一步提升。 Audio-Visual Necessity 通过注意力掩码做两次无梯度前向,计算每个模态的逐 token 对数似然下降,并用逻辑与门取较弱模态作为奖励,从而在不增加 rollout 的前提下抑制单模态捷径。 消融显示 Phase 1 使 Daily-Omni 从 71.9% 降至 69.1%、WorldSense 从 55.1% 降至 50.3%;Phase 2 后 VideoHolmes 从 55.9% 升至 69.6%;加入该奖励相对标准 RL 基线再得 WorldSense +3.2%、OmniVideoTest +2.2%。

在 10 个全模态基准上,OmniSeek 取得开源模型中的领先或具竞争力表现,并在长视频与稀疏线索场景中优势最明显。 相对基座 Qwen3-Omni-Instruct,MMOU 提升 16.3%、LVOmni 提升 8.4%;相对文本推理模型 OmniVideo-R1,VideoHolmes 为 74.6% 对 62.9%、OmniVideoBench 为 47.7% 对 44.8%。 结果来自论文表格:Daily-Omni 80.0、AVUT 78.8、WorldSense 62.4、FutureOmni 58.3、OmniVideoTest 69.5、VideoHolmes 74.6、JointAV 72.8、OmniVideoBench 47.7、MMOU 70.4、LVOmni 44.2;通用视频基准 Video-MME 78.5、MLVU 77.1、LongVideoBench 66.4、LVBench 51.4。

启示与展望

该工作面向需要跨模态、跨时间窗取证的长音视频问答场景,适用于具备工具调用能力的全模态大模型;其数据引擎与训练流程可被其他 Omni-LLM 复用,OmniTraj-170K 与 Audio-Visual Necessity 奖励为后续研究提供了可直接借鉴的起点。

论文自述在极长视频(如 2 小时)上存在结构性瓶颈:音频 token 随时间线性增长,基座 32K 上下文在约两小时音频(约 90K token)时被突破,模型会陷入重复 <think> 循环并虚构观察内容而不再调用工具;作者提出的线性加速启发式可能扭曲音高与环境声纹理,原生扩展上下文与模态非对称 token 压缩仍属未来工作。此外,OmniVideoTest 上 OmniVideo-100K 训练数据因同源同分布而占优,跨分布泛化程度仍需更多独立基准检验。

来源