SEEK 将搜索评估标准外化为可路由技能库,在快手短视频搜索中提升列表级质量评估与归因诊断
核心概要
该工作提出 SEEK(Skill-routed Evaluation with Evolvable Knowledge),把具体的搜索评估标准外化到一个技能库中,为每个查询—结果列表对动态路由相关技能,并用任务适配的列表级评估器给出页面级判断与失败模式归因;两阶段训练流程使评估器将评估标准与人类偏好对齐,而带重放门控的技能库允许把反复出现的评估知识缺口纳入其中而无需重新训练模型;在工业短视频搜索上的实验显示,SEEK 提升了列表级质量评估准确率并在归因诊断上取得显著进展,且已在日活跃用户超过 4 亿的快手部署,显著提升了线上搜索评估的规模与质量。
Figure 1. Illustrative example of skill-routed listwise evaluation in SEEK. The router selects task-relevant skills, and the listwise evaluator applies their guidance over the complete result page to produce a page-level judgment and attribution.
arXiv深度剖析
SEEK 将搜索评估标准外化为技能库,并为每个查询—结果列表对动态路由相关技能,从而避免把所有标准塞进统一提示所带来的无关上下文与标准干扰。 相对于把全部评估标准打包进单一提示的做法,SEEK 把标准拆分为可路由的技能,按查询—结果列表对选择相关技能。 该设计由论文对现有两类做法(统一提示与后训练内化)的问题陈述所支撑,并在工业短视频搜索实验中验证。
SEEK 采用任务适配的列表级评估器,产出页面级判断与失败模式归因,回应用户在页面层面体验搜索结果、而评估标准是多维且持续演化的现实。 相对于仅给出整体评分的评估方式,SEEK 同时输出页面级判断和失败模式归因,把评估从打分扩展到诊断。 论文报告在工业短视频搜索上提升了列表级质量评估准确率,并在归因诊断上取得显著进展。
两阶段训练流程使评估器将评估标准与人类偏好对齐,而带重放门控的技能库允许把反复出现的评估知识缺口纳入其中,无需重新训练模型。 相对于通过后训练把标准内化、从而把规则更新与昂贵的模型重训练周期绑定的做法,SEEK 让知识更新与模型训练解耦。 论文描述了该两阶段训练流程与重放门控技能库机制,并在实验中验证其效果。
SEEK 已在快手部署,该平台日活跃用户超过 4 亿,部署后显著提升了线上搜索评估的规模与质量。 相对于仅在离线实验环境中验证的评估方法,SEEK 在真实工业平台上落地并报告了线上评估规模与质量的提升。 论文报告了在快手的部署及其对线上搜索评估规模与质量的影响。
启示与展望
该工作面向工业搜索系统的质量评估,尤其是页面级、多维且标准持续演化的场景,实验与部署均围绕工业短视频搜索展开。它使评估标准的更新可以经由技能库完成而无需重训练模型,因此适合需要频繁调整评估规则、又希望保持评估规模与质量的搜索团队;对希望把人工评估替换为可扩展自动评估的工业场景,提供了可参考的架构与训练流程。
当前可获取的是摘要层面的信息,缺少具体实验数值、样本规模、对照设置与归因诊断的评价方式,因此无法判断提升幅度的量级与统计稳健性。技能库的构建与维护成本、路由错误对评估结果的影响、以及重放门控在知识缺口判定上的具体标准,都是读者在阅读全文时需要进一步确认的问题。此外,部署效果以线上搜索评估的规模与质量描述,其与人工评估的一致性程度仍待了解。
