Cohere 发布 Embed 5 双模型家族:Pro 在 ViDoRe V3 平均 85.8、Fast 以 2.4 倍吞吐共享同一嵌入空间
核心概要
Cohere 发布 Embed 5 嵌入模型家族(Pro 与 Fast 两档),两者共享同一嵌入空间并支持 128K 上下文、文本/图像/融合输入、100 多种语言与 2048 至 256 维的 Matryoshka 输出,其中 Pro 在 ViDoRe V3 上平均 85.8(较 Embed 4 提升 8.8)、在 FinanceBench 得 80.1、在解析 PDF 套件平均 84.8,Fast 在 ViDoRe V3 平均 84.5 且文档吞吐平均为 Pro 的 2.4 倍,定价分别为每百万 token 0.12 美元与 0.08 美元。
深度剖析
Embed 5 以 Pro 与 Fast 两档覆盖不同检索场景,并共享同一嵌入空间,因此可以用 Pro 建索引、用任一模型查询而无需重建索引。 相较以往需要按模型重建索引的做法,这里把质量档与延迟档解耦;文中报告在 40 个开发数据集上跨模型组合相对同模型基线平均仅损失 1.6%(Fast 查询)与 2.7%(Pro 查询),且没有数据集出现明显失败。 依据为跨 40 个开发数据集、覆盖文本、图像、融合与解析文档检索的语料/查询配对测试,并以 Pro 语料加 Pro 查询归一化为 100 给出 nDCG@10 均值表。
Embed 5 Pro 在视觉信息密集的企业文档与金融文档检索上取得文中所述的最高平均分。 ViDoRe V3 上 Pro 平均 85.8,较 Embed 4 提升 8.8,高于 Voyage 4 Large(83.7)、Gemini Embedding 2(83.2)与 OpenAI text-embedding-3-large(75.5);金融三项基准中 Pro 均列第一(FinanceBench 80.1、FinQA 90.0、ViDoRe V3 Finance 85.0),Fast 均列第二。 依据为 ViDoRe V3 覆盖金融申报、技术手册、监管材料、政府报告、教材与讲座等企业领域,以及 FinanceBench、FinQA、ViDoRe V3 Finance 三项公开金融基准的对比分数。
Embed 5 把多模态与多语言检索纳入同一模型家族,并给出可压缩的向量输出以控制存储成本。 融合文本-图像语料上 Pro 在五个数据集平均 82.3(Gemini Embedding 2 为 61.3),页面图像检索 Pro 在五个金融数据集平均 77.0;多语言方面 Pro 在德法西意俄五语平均 77,较 Embed 4 平均提升约 7 分,波斯语 +13、泰卢固语 +12、印地语 +12;输出支持 float、int8、binary 与 Matryoshka 维度,文中称 100 亿分块下原始向量存储可从约 819 GB 降至 3.2 GB。 依据为融合与页面图像数据集上的平均分、十种语言的逐语言分数表,以及关于 2048 维 float32 为 8 KB、1024 维 int8 为 1 KB、256 维 binary 为 32 字节的存储换算说明。
Embed 5 Fast 面向延迟与成本敏感的高并发检索,在保持同等上下文、多模态与多语言覆盖的同时提供更高吞吐。 Fast 定价为每百万 token 0.08 美元、比 Pro 低三分之一,文档吞吐平均为 Pro 的 2.4 倍;在 ViDoRe V3 上领先 Voyage 4 Nano 近 7 分,领先 Jina Embeddings v5 Text Small、Perplexity 与 Microsoft Harrier 0.6B 达 10 分以上,并以约一半的规模超出 Qwen3-VL-Embedding-2B 约 20 分。 依据为跨上下文尺寸的吞吐测量、ViDoRe V3 与金融检索的平均分对比,以及解析 PDF 上 83.4 对 Gemini Embedding 2 的 80.8、略低于 Voyage 4 Large 的 83.6 的分数。
启示与展望
该发布面向需要企业级检索的团队:可用 Pro 做离线索引与质量优先检索,用 Fast 承担交互式搜索、智能体循环与高并发查询,并按 1024 维 int8 作为性能与效率的推荐折中点。模型支持 128K 上下文、文本与图像及融合输入、100 多种语言、2048 至 256 维输出与 float/int8/binary 格式,可经 Cohere API、Model Vault、Microsoft Foundry、Amazon SageMaker 或 vLLM 私有部署,并接入既有向量数据库与框架。跨模型混用需两侧使用相同输出维度,Matryoshka 截断与 int8 量化下同样兼容。
文中分数均为发布方自测,读者若要判断是否适用于自身语料,仍需在自有数据上复现。RCP-nDCG@10 采用两阶段检索设置,用相似度分数对固定候选集重排,因此其分数反映重排质量而非首阶段检索性能,文中说明首阶段性能在别处以 nDCG 与 Recall 评估。多语言表中部分语言(如日语、韩语、阿拉伯语、孟加拉语、泰卢固语、印尼语、泰语)Gemini Embedding 2 或 Voyage 4 Large 的分数高于 Embed 5 Pro,因此“最高平均”是就所测语言集合的平均而言。二进制格式存在一定精度取舍,文中建议用于首轮检索后再精排。此外,Parse 5、Compass Cloud 私有测试与 10 月 8 日的线上活动仅被提及,未给出结果。
