RPTune 用学习式目录整理加后训练,把 7 家真实商户的对话式商品搜索准确率最高提升 31.4 个百分点
核心概要
RPTune 面向目录可整体放入长上下文窗口的中小商户,把「编码器—重排器」学习式目录整理与基于自动生成、目录锚定监督的 LLM 后训练耦合起来:在 7 家真实商户、每家 100 条复杂对话查询上,上下文整理使 9 个冻结 LLM 骨干的精确匹配平均提升 13.5 个百分点、最高 20 个百分点,gemini-3.7-flash 上整理带来 14.6 个百分点提升,gemma-4-E4B-it 上整理加后训练把 EM 从 10.7% 提升到 31.0%。
深度剖析
论文把「上下文内目录搜索」确立为适合中小商户的独立问题设定:目录整体可放入长上下文窗口时,直接把全目录喂给 LLM 比多阶段检索更合适。 此前商品搜索方法主要面向拥有数百万商品、专职机器学习团队和丰富行为信号的大型市场;作者分析 56 家真实 Shopify 店铺,92.9% 的目录可放入 1M token,中位目录仅 51K token,并报告全目录 LLM 搜索比既有检索方法最高提升 20 个百分点。 基于 56 家店铺的目录规模统计,以及以 gemini-3.7-flash 为共同骨干的对比:全目录提示比所有基线至少高 9.0 EM 点,延迟保持个位数秒(8 秒)。
RPTune 的编码器—重排器整理器按下游 LLM 反馈对商品排序、剪枝并安排位置,在相同 25% 保留预算下优于现成的稠密检索与列表式重排。 以往上下文压缩与重排方法并非针对下游 LLM 在具体目录上的实际选择行为训练;RPTune 的重排器用冻结 LLM 的多次采样选择与目录级相关性奖励做组相对归一化的强化学习更新。 在 9 个冻结骨干上 EM 平均提升 13.5 个百分点、FR 提升 10.1 个百分点,63 个骨干—商户组合全部提升;gemini-3.7-flash 上替换为 Jina Reranker 3.5 或 Gemini Embedding 2 时分别在 7 家中的 5 家和 3 家出现下降,而 RPTune 在 7 家全部提升;端到端延迟平均降低 28%,最高 71%。
在整理后的上下文上做 LLM 后训练能带来超出推理期整理的额外收益,且「上下文相对奖励」是关键设计。 后训练使用自动生成、目录锚定的监督,无需商户提供相关性标注或用户行为日志;奖励按整理后目录内最高相关商品给分,从而在全局最优商品被剪掉时仍保留有效学习信号。 gemma-4-E4B-it 上 EM 从 10.7% 经编码器 16.4%、完整整理器 20.7% 到整理加后训练 31.0%,FR 从 56.7% 到 74.4%,7 家商户在每个阶段单调提升;消融显示改用连续奖励或全局 top-1 奖励时 Beauty Bakerie 上 EM 下降 10 个百分点。
RPTune 对新上架商品和未见商户具有零样本泛化能力。 商户库存频繁变动使持续重训不现实;作者在 Beauty Bakerie 上只用一半商品训练一次,再逐步注入被扣留商品,并做 7 家商户模型的交叉评估。 目录规模翻倍时后训练版 RPTune 的 EM 相对下降 14.7%,约为基线 29.5% 的一半,FR 基本不变,且在每一注入水平上保持 35.0 EM 与 19.2 FR 的绝对优势;跨商户交叉评估中所有组合的 EM 与 FR 均优于 gemma 基线,尽管目录间平均成对 Jaccard 相似度仅 0.146。
启示与展望
该结果面向目录能整体放入长上下文窗口的中小商户:作者统计的 56 家 Shopify 店铺中 92.9% 的目录在 1M token 以内,中位仅 51K token,实验中的 7 家商户目录从 37,506 到 126,958 token。评估限于单轮查询,作者明确把多轮评估留作后续工作,并指出这类查询可拆解为多轮约束,RPTune 可通过在每一轮运行编码器—重排器来适配。方法只需要商户目录作为数据源,训练监督由前沿 LLM 自动生成,因此适用于没有相关性标注或用户行为日志的商户;跨商户交叉评估与逐步注入新商品的协议说明该框架可用于库存频繁变动的场景。
评估查询由 gemini-3.1-pro 合成并经共识筛选与人工审核,作者自己指出参考标签可能偏向 Gemini 家族,并用非 Gemini 评审团审计、以及 Grok 平均增益(+19.3 EM)高于 Gemini(+12.5 EM)来回应;审计显示参考标签在 64.9% 的查询上被接受,而 BM25 干扰项为 1.1%、随机项为 0%,同时平均每条查询有 1.85 个可接受变体、评审之间对最佳变体的成对一致率仅 36.4% 至 46.1%,说明单一参考标签无法覆盖所有合理答案。错误分析显示剩余错误多为近似替代品:错误试验的平均特征奖励较高,同产品不同变体占相当比例,例如 Package Free 上 10 次试验有 8 次返回同一洗衣液的 100 次装而非 140 次装。此外,新商品注入实验在低注入水平下 New-product 组仅 4 至 7 条查询,作者提示这些最左端点只宜作参考。读者若只读到摘要层面,将无法看到这些标签审计、错误结构与注入协议的细节。
