跳到主要内容
返回时间线
arXiv来源发表:

Omni-Embed-Mini 用冻结文本主干把语音、音频、图像、视频与视觉文档并入同一余弦空间,0.9B 文本检索保持 49.57 nDCG@10 不变

核心概要

MBZUAI 提出 Omni-Embed-Mini:把跨模态对齐改写为“共享冻结主干的自蒸馏”,每个媒体样本配一段密集级联描述、教师目标就是同一冻结主干对该描述的嵌入,仅训练投影器与分阶段 LoRA,0.9B 版本在文本权重逐位不变的前提下把文本、语音、音频、图像、视频和视觉文档映射进同一余弦空间,MTEB-v2 BEIR-8 保持 49.57 nDCG@10,2.3B 版本在总体模态平均上以 51.39 对 49.51 略高于闭源 gemini-embedding-2。

AI-generated editorial illustration: Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

深度剖析

论文把“多模态扩展困境”拆成两个耦合失效模式:文本侧灾难性遗忘与模态膨胀,并给出一个不更新文本侧任何参数的配方。 以往 omni 嵌入器(LCO-Embedding-Omni-3B/7B、BidirLM-Omni-2.5B、omni-embed-nemotron-3B、e5-omni-3B/7B)通过联合对比训练吸收新模态,参数量升到数十亿;这里把文本当作不可移动的锚点,新增模态只经由外部模态编码器与投影器接入。 论文报告 0.9B 推理参数 935.35M,其中冻结 869.98M、可训练 68.32M(7.3%);2.3B 版本可训练 141.68M(5.8%),并给出与各开源 omni 嵌入器的参数量对照表。

教师信号不需要单独的嵌入模型:每个媒体样本配一段密集级联描述,教师目标就是冻结主干自身对该描述的 EOS 池化嵌入,教师与学生共享权重因而处于逐位相同的几何中。 ImageBind 以图像为绑定模态、LanguageBind 以语言为绑定模态但使用独立冻结文本塔;这里教师与学生是同一套未训练权重,因此不需要投影头,目标可完全缓存。 论文说明教师嵌入因主干冻结而在训练中恒定、按稳定样本 id 缓存到磁盘;对齐损失为原生池化隐空间中的余弦自蒸馏,并给出完整损失式。

训练配方把 Matryoshka SigLIP 成对 sigmoid 对比损失、在线混合难负例挖掘与分阶段 LoRA 组合起来,并可从 0.9B 迁移到 2.3B。 在线挖掘沿用 ANCE 的“随编码器刷新负例池”思路,但推广到多模态与 Matryoshka:文本索引因文本分支不接收梯度而完全稳定,只有媒体侧索引漂移;SigLIP 成对损失在小批量下表现良好。 消融显示只有文本与媒体挖掘同时启用才明显优于无挖掘(五个媒体模态均值上 +1.81),视觉文档对挖掘最不敏感(四种配置在 ViDoRe-V3 上相差 0.6 nDCG@10 以内);三个随机种子下文本恒为 49.57,媒体模态标准差为图像 0.43、通用音频 0.59、视频 0.95、语音 1.03、视觉文档 1.76。

密集描述是数据侧最关键成分,替换为原始短描述会显著掉点。 论文把数据准备当作一等方法贡献,用 Qwen3-Omni-30B-A3B-Instruct 在低温度下生成级联描述,并把源数据集真值描述作为“Reference caption”写进系统提示作为接地先验。 表 2 显示密集描述相对原始描述在语音 +2.68、音频 +2.70、图像 +8.60、视频 +14.06,总体 30.79 对 23.78;视觉文档上替换原始描述损失 4.8 nDCG@10(46.98 到 42.21)。

启示与展望

该结果面向研究原型场景下的多模态检索:文本、语音、音频、图像、视频与视觉文档被映射进同一余弦空间,文本推理路径只触及未改动的主干权重,因此适用于希望在不牺牲既有文本检索质量的前提下增加模态的部署。0.9B 版本适合对体积敏感、可接受语音与音频检索弱于更大基线的场景;2.3B 版本在视频(55.18)与图像(64.80)、视觉文档(58.10)上更强,适合需要视觉模态质量的应用。由于主干冻结,未来文本嵌入器升级原则上只需重跑投影器与 LoRA 训练,论文以从 0.6B 文本编码器换到 Qwen3-VL-Embedding-2B 作为例证。Matryoshka 截断使 1000 万条目的 float32 索引在 128 维下从 41 GB 降到 5 GB,为大规模索引提供空间。

论文自述的开放问题值得留意:级联描述全部由机器生成,作者明确表示未对描述做事实性过滤、未与源媒体核验,也未做受控的描述扰动研究,因此无法量化检索质量随描述质量下降的幅度;唯一自动检查是挖掘中用于丢弃疑似假负例的 0.92 余弦阈值。音频路径采用语音与环境音 token 的固定时间交错,对单一音频类型主导的输入可能不是最优。视觉文档密集描述平均约 4157 字符,远超其他模态的约 582 字符,主干 2048 token 上下文会截断长尾,教师与学生路径截断一致所以余弦对齐不受影响,但视觉文档细节的上限被削掉。视频在 MMEB-V2 上对所有 omni 模型统一使用基准自带的 8 帧按图像嵌入并均值池化,这保证了可比性但压低了视频性能上限。0.9B 与 2.3B 的视觉方案不同(前者用从 Qwen3.5-0.8B 抽取的 ViT,后者用主干原生视觉模块),跨变体的视觉策略消融留待未来工作。此外现有基准各自只探测单一模态切片,尚无覆盖全部六种模态任意查询—语料组合的统一 any-to-any 检索基准,因此结果未必推广到所有语言、领域与真实检索流程。

来源