跳到主要内容
返回时间线
arXiv来源发表:

ZooWork 用跨家族 LLM 评审标签对齐电商重排器,8B 与 4B 在 ShopRank-Bench 上显著超过最强开源基线,0.6B 蒸馏版在结构化文本上追平 4B 基座

核心概要

ZooWork 提出 ZooWork-ShopRanker 系列电商重排器(0.6B、4B、8B),用 Qwen3.5-122B、Gemma-4-31B、DeepSeek-V4-Pro 三个推理 LLM 家族按“先硬约束、后软偏好”的双序评审协议生成偏好标签,并以对齐后的 8B 蒸馏出 4B 与 0.6B;在基于 Gensmo 私有流量的 ShopRank-Bench(10,511 对,分金/银/铜三级)上,8B 与 4B 显著优于最强开源基线 Jina-m0,各尺寸均显著优于自身未对齐基座,0.6B 在结构化文本上与 4B 基座统计上不可区分,且对齐在 MTEB 三个重排任务上未损失通用能力、推理延迟与基座持平。

AI-generated editorial illustration: ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker

深度剖析

构建了以跨家族 LLM 评审为标签来源的电商偏好重排器家族,8B 与 4B 在 ShopRank-Bench 上显著超过最强开源基线,各尺寸均显著优于自身基座。 此前开源重排器(BGE-Reranker-v2-m3、Jina、Qwen3-Reranker)主要在 BEIR、MS MARCO 等通用检索基准上训练与评测,本文把监督信号换成“先检查硬约束、再权衡软偏好”的评审标签,并给出 0.6B/4B/8B 三档开放模型。 结构化文本上 8B 总体 83.4、4B 81.2,Jina-m0 为 79.2;配对 McNemar 检验支持显著差异,并另用查询聚簇自助法与 Holm–Bonferroni 校正复核,结论不变。

发布 ShopRank-Bench:来自 Gensmo 私有搜索流量的 10,511 对偏好数据,按评审家族承诺数分为金(1,843,3/3)、银(4,445,2/3)、铜(4,223,1/3)三级,并提供结构化与自然语言双格式。 公开电商集合(如 ESCI 风格)的答案可能被预训练记忆,且单一序列化会奖励格式伪影;该基准的配对与标签从未公开,且同一查询、商品、标签在两种格式下固定,另附属性层级(1,500 对)与预算(1,302 对)诊断轨道。 23,000 对候选经双序评审后保留 10,511 对(45.7%),丢弃 12,350 对全票平局与 139 对直接冲突;训练切片与基准零查询重叠、零精确配对重叠;长度启发式最高仅 50.2%,价格启发式在可比子集上 59.9%,均远低于学习模型。

对齐后的 8B 作为蒸馏教师,使 0.6B 与 4B 学生同时获得教师的高覆盖与评审标签的高精度排序;蒸馏优于从同一基座直接对齐。 小模型并非 8B 配方的缩小版,而是先拟合 8B 对约 13.5 万条查询–文档的软分数,再用成对损失在评审对上锐化;这使 0.6B 在结构化文本上与 4B 基座统计上不可区分,而吞吐为 433 对 155 docs/s、显存 4.5 对 11.2 GB。 直接对齐的 4B 在两种格式下均显著弱于发布的蒸馏 4B(结构化 79.0 对 81.2,自然语言 77.4 对 79.5);面板教师(DeepSeek+Gemma 等级)在可行规模下反而更差,开发集硬结构化切片上 0.6B 学生为 70.7 对 78.3。

对齐不牺牲通用重排能力与推理成本:LoRA 合并后各模型延迟与自身基座持平,MTEB 三个重排任务上 4B 与 8B 领先平均分。 常见担忧是领域对齐会带来通用能力回退;本文用同一架构跨三档规模、仅更新约 1% 参数的 LoRA 适配器,并报告了唯一回退点 SciDocsRR。 MTEB 平均分 4B 与 8B 均为 0.799,Qwen3-Rnk-8B 为 0.793;中位延迟 0.6B 17.6 对 18.6 ms、4B 25.2 对 24.5 ms、8B 25.8 对 25.4 ms;受控对比显示 LoRA 与全量微调相当或略优。

启示与展望

该工作面向电商搜索栈的最终重排环节,适用于查询短且欠指定、候选来自生产检索的部署场景,并明确以 Gensmo 私有流量为评测底座。对读者而言,可直接复用的是三档开放模型、双格式 ShopRank-Bench 及其金/银/铜分级、属性层级与预算诊断轨道,以及“对齐在推理时免费”的结论:LoRA 合并后各模型与自身基座同延迟,0.6B 在结构化文本上以约七分之一的规模达到 4B 基座水平,因此质量敏感处选 8B、吞吐敏感处选 0.6B 或编码器交叉编码器。诊断轨道进一步说明,显式预算这类可程序化检查的约束,用少量定向监督即可接近解决,而手工设计的属性优先级不是好的训练目标。

标签来自三个 LLM 家族而非人工核验,第四家族 45 对抽查仅是一致性检查且区间很宽;铜级占基准 40% 且主要由 Gemma 决定,聚合分数会被最弱标签主导。评审面板在承诺率上并不对称(Gemma 92.7%、DeepSeek 66.1%、Qwen3.5-122B 18.6%),且两个基准家族也参与了训练标签,作者用训练不相交家族子集把优势从约 8 分压到约 3 分来界定这一效应,但未做交互检验。零样本推理 LLM 在基准上仍高出 8B 约 8–9 分,说明偏好尚未被重排器完全恢复;自然语言视图由模型渲染且属性包含度可变,未审计每次渲染是否保留标签所依赖的属性;公开 MTEB 对比可能受预训练污染影响。若只读到快速解析而缺少图表,上述分级与配对检验的细节需要回到原文核对。

来源