跳到主要内容
返回时间线
arXiv来源发表:

Ovis-Embedding 用共享 Qwen-Omni 骨干把文本、图像、视频、音频放进同一检索空间,在 MMEB-v3 上以 3B 规模取得 58.46 的总分

核心概要

该工作报告了 Ovis-Embedding 系列通用全模态嵌入模型:以预训练 Qwen-Omni 为共享骨干、去掉语音生成通路并以最后一个非填充 token 的末层隐状态作为嵌入,配合约 5000 万查询—目标对的全模态语料、同源采样、focal 损失与嵌入蒸馏训练,以及低秩特征分解的弹性维度推理,在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 上报告了领先成绩。

AI-generated editorial illustration: Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

深度剖析

Ovis-Embedding-Omni-3B 在 MMEB-v3 上取得 58.46 的总分,高于最强基线 Tianmu-Emb-Uni 的 53.27 达 5.19 分,并在图像(77.55)、视频(64.99)、视觉文档(78.26)、文本(47.15)、音频(50.08)和智能体(45.52)六个评测组的总分上均列第一。 此前的全模态嵌入系统通常是在文本—视觉嵌入器上追加音频通路,或把独立训练的音频编码器对齐到既有嵌入空间;该工作直接从原生处理文本、图像、视频、音频的 Qwen-Omni 理解模型出发,不添加模态专用投影头。 证据来自 MMEB-v3 的 190 项任务评测,报告了各组总分与子任务分数,并给出与 LCO-Embedding-Omni-7B、omni-embed-nemotron-3b、e5-omni-7B、Tianmu-Emb-Uni 的逐项对比;在 31 个汇总与子任务条目中该模型 22 项第一、8 项第二。

在音频与视频的专项基准上,Ovis-Embedding-Omni-3B 报告 MAEB 的 Mean(Task) 57.29、Mean(Type) 61.22,以及 MVEB 的 Mean(Task) 61.77、Mean(Type) 59.72,分别高于各自第二名 3.75/4.10 分和 4.19/3.49 分。 该工作把音频与视频的细粒度判别能力放在同一个共享嵌入空间内考察,而不是让音频表示依附于一个未见过声学输入的几何结构。 MAEB 覆盖 30 项任务、MVEB 覆盖 23 项任务,报告了任务均值与任务类型聚合均值;作者说明 Omni-3B 尚未提交官方榜单,表中排名是把本地结果插入榜单快照后重算的 Borda 排名。

视觉—语言变体 Ovis-Embedding-VL-9B 在 MMEB-v2 上取得 81.13 的总分,VL-2B 取得 77.46,两者在各自对比组内均为最高;从 2B 到 9B 总分提升 3.67 分,其中视频提升 5.78 分最大。 两个变体分别从 Qwen3.5-2B 与 Qwen3.5-9B 初始化,沿用同一套去掉语言建模输出头、取末层最后非填充 token 的极简适配方式,覆盖不同精度与效率需求。 MMEB-v2 总分是 78 个组成数据集的非加权平均,报告了图像、视频、视觉文档三类的模态级分数与子任务分数,并与 seed1.6-embedding-1215、Qwen3-VL-Embedding-8B、DME-Medium、Octen-VL-Embedding-Large 等对比。

训练配方由四阶段构成:低秩对比预训练、全参数同源采样微调、退火式嵌入蒸馏,以及推理期的弹性维度适配;作者报告把嵌入从 2048 维减半几乎无损失,降到 128 维(十六分之一)仍保留 93.2% 的平均成绩,而朴素截断只保留 85.8%。 同源采样让每个微批次来自同一数据集,从而获得任务一致的难负例;focal 损失按查询难度重加权;嵌入蒸馏用教师在全候选集上的软分布提供分级监督;弹性维度用共享正交变换加零初始化残差线性适配器实现,避免把多宽度目标混入编码器训练。 弹性维度结果以 MMEB-Text、Image、Video、Audio、VisDoc、Agent 六个套件在 2048/1024/512/256/128 五个宽度上的分数呈现,并以朴素截断为基线;作者指出 512 维时三个套件略高于全宽,幅度很小,视为无可测变化。

启示与展望

该结果面向需要跨文本、图像、视频、音频统一索引的检索与检索增强生成场景,包括工具、GUI 与知识检索等智能体用例;模型族以 Omni-3B 覆盖含音频的四模态,以 VL-2B 与 VL-9B 覆盖文本、图像、视频,输出维度分别继承自骨干的 2048 与 4096 维。弹性维度适配面向存储、延迟与精度预算不同的部署配置,作者称其有用区间是较短的嵌入前缀。作者表示将开源检查点、训练与数据构建配方、推理代码与统一评测工具包,使音频、音视频与任何到任意检索这些现有开源资源较少的设置可以直接复用。

语料规模约 5000 万查询—目标对,但作者明确标注该小节数字是基于当前数据冻结的占位估计,最终数字将在正式版更新,因此数据规模与配比仍需以最终版本为准。MAEB 与 MVEB 使用的是 beta 版本,且 Omni-3B 尚未提交官方榜单,表中排名由本地结果插入榜单快照后重算。弹性维度部分在 512 维时三个套件略高于全宽,作者将其读作无可测变化;音频与视频在短前缀下的损失大于视觉文档与智能体,作者归因于低维向量的信息容量而非压缩器本身。此外,MMEB-v3 上 MultiConIR 与记忆检索是相对薄弱的两项,多条件约束下的检索与长程记忆匹配仍是开放方向。

来源