跳到主要内容
返回时间线
arXiv来源发表:

CANOPY 用随机路径探针在线检测平滑性违背,在路由、top-k 识别、测试时搜索、缓存与提示裁剪上以同等预算取得更好结果

核心概要

该工作提出 CANOPY,一种多保真度树状 bandit 方法:它用廉价的随机路径探针构建局部聚合偏差的在线证书,把昂贵的叶子评估导向证书检测到平滑性违背的单元,从而不再预先假定全局平滑先验;作者给出固定预算与遗憾保证,其额外代价随不连续点数量可加,并在无违背时恢复平滑树速率、在违背密集时趋近结构盲搜索;在路由、top-k 识别、测试时搜索、缓存与提示裁剪中,CANOPY 在匹配预算下持续提升表现,包括在 1000 模型池上 top-10 召回率提高 2.9 倍、在 SWE-bench Verified 上比 best-of-N 多解决 1.6 倍问题、前缀缓存下中位首 token 时间降低 3.6 倍。

Source-provided article image: Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits
Figure 3 ·

Figure 3: Multi-fidelity top- k k on a 1024 1024 -leaf tree ( 60 60 seeds, 95% CI bands). Left: recall vs. probe/leaf cost ratio at a fixed budget. Right: recall vs. cost budget with cheap probes, for the beam and sound hierarchical variants against successive elimination.

arXiv

深度剖析

CANOPY 把 LLM 推理中的模型路由、前缀缓存管理、提示裁剪与测试时搜索统一刻画为树上的优化问题:每个前缀是一个节点,其延续构成子树,内部节点给出廉价但有偏的区域价值估计,叶子评估昂贵但准确。 此前分层 bandit 方法虽可利用该结构,但通常需要预先指定特定的平滑性日程,而真实目标往往只是分段平滑、其最优解可能位于尖锐边界附近。 该统一视角与问题设定在摘要中明确陈述,并作为方法设计的出发点。

CANOPY 不全局假定平滑先验,而是学习平滑先验在何处成立:它用廉价随机路径探针构建局部聚合偏差的在线证书,并把昂贵叶子评估导向证书检测到平滑性违背的单元。 相对需要预先指定平滑性日程的分层 bandit,这一机制把平滑性从输入假设变为可在线检验的对象。 摘要描述了探针、证书与评估导向的机制,但未给出证书的具体形式、阈值或探针预算分配细节。

作者证明固定预算与遗憾保证,其额外代价随不连续点数量可加:无违背时恢复平滑树速率,违背密集时趋近结构盲搜索。 该保证把分段平滑这一更弱假设纳入理论分析,而非只在全局平滑假设下成立。 摘要给出保证的形式与两端极限行为,未在摘要中给出常数、速率表达式或证明技术。

在路由、top-k 识别、测试时搜索、缓存与提示裁剪中,CANOPY 在匹配预算下持续提升表现,包括 1000 模型池上 top-10 召回率提高 2.9 倍、SWE-bench Verified 上比 best-of-N 多解决 1.6 倍问题、前缀缓存下中位首 token 时间降低 3.6 倍。 这些结果覆盖多个下游任务,而非单一基准,说明方法在多种树状推理优化场景中可迁移。 摘要报告了匹配预算下的对比与三个具体倍数,但未给出各任务的基线细节、预算规模或统计不确定性。

启示与展望

该结果面向把 LLM 推理问题建模为树状多保真度优化的场景:每个前缀为节点、内部节点廉价有偏、叶子昂贵准确,且目标仅分段平滑、最优解可能靠近尖锐边界。它适用于需要在固定预算下分配廉价探针与昂贵评估的读者,例如做模型路由、top-k 识别、测试时搜索、前缀缓存管理与提示裁剪的工程与研究场景。理论保证的适用范围是额外代价随不连续点数量可加,并在无违背与违背密集两端分别退化为平滑树速率与结构盲搜索。

摘要未给出证书的具体形式与判定阈值、随机路径探针的预算分配方式、固定预算与遗憾保证的速率表达式与常数,也未说明各任务基线的具体设置、匹配预算的规模以及结果的统计不确定性。此外,摘要只列出三个倍数结果,未说明这些提升在多大模型池、多少问题或何种硬件条件下测得。若读者关心这些细节,需要查阅正文与实验部分。

来源