跳到主要内容
返回时间线
arXiv来源发表:

SkillSeek 用 BM25 加小型重排器在 89 项 SkillsBench 任务上追平 LLM 介导检索,单次花费从 51.30 美元降到 27.54 美元

核心概要

该工作提出开源两阶段技能检索器 SkillSeek(BGE-base 双编码器接小型交叉编码器,经 MCP 暴露),在 89 项 SkillsBench 基准、两种技能池与两种骨干模型的网格上,观察到纯 bm25 在四个设置中的三个达到或超过 Liu 等人 LLM 介导循环的通过率,小型交叉编码器在第四个设置(34K 池 + Qwen3.5)补齐差距至相同的 0.442,同时把每次试验总花费从 51.30 美元降到 27.54 美元(距无技能基线 27.41 美元不到五十美分),并把这一模式归因于第一阶段召回上限。

AI-generated editorial illustration: SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale

深度剖析

在 89 项 SkillsBench 任务、192 技能精选池与 34K 市场池、Qwen3.5-397B-A17B 与 MiniMax-M2.7 两个骨干构成的网格上,确定性检索达到与 LLM 介导循环的观察持平:纯 bm25 在四个设置中的三个高于 liu_refined(192/Qwen3.5 为 0.430 对 0.397,192/MiniMax 为 0.387 对 0.344,34K/MiniMax 为 0.346 对 0.329),仅在 34K/Qwen3.5 落后(0.420 对 0.442),而 Qwen3-Reranker-0.6B 在该格达到相同的 0.442。 此前文献把技能选择外包给智能体自身,用 LLM 介导的查询改写与候选精炼循环;该工作给出确定性检索这一对照点,并共享稀疏加稠密的第一阶段、在重排器处分岔。 主网格每个设置是单次 89 任务试验,作者对其中一个设置重跑三次得到约 1% 的标准差,因此把 2% 以内的差异视为噪声,并把结论表述为观察持平而非已确立优势;liu_refined 为保守复现,作者指出完全忠实的复现会抬高其通过率。

成本结构被明确拆开:SkillSeek 检索侧为零 LLM 成本(双编码器与交叉编码器在 CPU 上运行,每次 skill_lookup 中位约 1.1 秒、p95 约 1.9 秒),智能体侧花费 27.54 美元,距无技能基线 27.41 美元不到五十美分;liu_hybrid 因在主循环内做检索使循环膨胀 44%(39.43 美元),liu_refined 另加精炼子智能体后总计 51.30 美元。 把“准确率持平”与“成本差异”分开陈述,使检索方案的选择可以按每任务 token 支出而非仅按通过率来权衡。 成本来自同一驱动、同一骨干、同一任务预算下的对照运行,并以表格分解检索侧与主循环侧两部分。

作者提出第一阶段召回上限解释轻量重排器在精选池够用、重量方法在市场池才追上的现象:192 池上 bm25 的 R@5 为 0.546、BGE-base 与之相当,交叉编码器只再加 3.5%;34K 池上 bm25 为 0.391、BGE-base 为 0.379,重排器加 5.4%,在 Tool-REX v3 重构索引后增至 9.9%。 把池规模差异归因到一个可测量的机制量(第一阶段剩余召回),并用同一方法在两种池上的表现以及 Liu 等人自身两个变体的顺序反转来交叉印证。 该分析以 R@5 为比较量,作者明确说明召回不等于下游通过率,并用 helpfulness gap 诊断展示两者可能反向移动。

索引文本与候选深度被证明主导设计空间:Tool-REX v3 四标签画像比 name+description 高 2.2%,追加原始 SKILL.md 正文再降 3.2%;第一阶段深度取 20 最好,减半损失 2.1%,加倍或五倍损失 3.5% 至 4.5%;返回给智能体的技能数在 top-3 之后基本不再增益。 把“索引什么文本”和“取多深”作为可复现的消融项给出,并记录两版早期标签方案的具体失败模式(自由标签丢失 excel/xlsx 字面形式使 pdf-excel-diff 的 R@5 从 1.0 降到 0.5;库名标签使 court-form-filling 在 34K 规模降到 0.0)。 消融在 34K/Qwen3.5 设置上运行,作者说明该批试验并行度更高、绝对通过率被压低,因此以 0.360 为参考基准报告相对变化。

启示与展望

该结果面向在 OpenHands harness 下、以 SkillsBench 89 项任务与 192 精选池或 34K 市场池为技能来源、以 Qwen3.5-397B-A17B 或 MiniMax-M2.7 为骨干的部署场景,主张确定性 IR 配方是值得先试的默认起点,而把 LLM 介导检索留作确定性方法不足时的回退。检索器以 MCP 服务器形式暴露三个只读工具(skill_lookup、skill_load、skill_list),任何支持 MCP 的 harness 无需改动源码即可接入,索引文本与第一阶段深度是可复用的调参入口。作者同时指出,风险感知的扩展方向是把检索与载入前风险评分组合,在候选到达智能体之前丢弃高风险技能。

主网格每格为单次 89 任务试验,作者自述约 1% 的试验噪声并因此把 2% 以内差异视为噪声,所以各设置的排名不宜当作已定结论;作者把核心结果表述为观察持平,并指出要建立更强意义上的等价需要预先设定的实际边界与对头条设置的重复独立运行。liu_refined 是保守复现,作者说明完全忠实的复现会抬高其通过率,因此 34K/Qwen3.5 上的持平应读作对 SkillSeek 偏乐观的一侧。MiniMax-M2.7 上约半数任务受网络或超时失败影响,绝对通过率被压低 5% 至 10%,该骨干只作支持性证据。192 池由人工策展以保证每任务都有相关技能,其绝对数值同时反映检索质量与策展选择。第一阶段替代方案仅以 R@5 比较,而召回与下游通过率可能反向移动。全部结论限于所测任务、harness、池与骨干,向终端、网页与软件工程智能体以及独立构建的技能检索基准(如 SkillRet)的迁移仍是开放问题。

来源