跳到主要内容
返回时间线
arXiv来源发表:

RECAST 用可训练路由器把检索与计算统一为证据构建,在六个基准上超越检索与程序生成基线

核心概要

RECAST 把证据构建建模为在检索与计算操作上的序贯决策过程:轻量 RouterLM 迭代选择词法、语义或关系原语,或请求由冻结 CompilerLM 编译为可执行代码的定制操作,判定证据充分后交给冻结 AnswerLM 作答,并用 SFT 加 GRPO 训练 RouterLM;在六个异构基准上取得最高平均成功率,并在三个留出基准上零样本泛化。

Source-provided article image: RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing
Figure 1 ·

Figure 1: Overview of RECAST. At each round, RouterLM uses the task, compact source profile, and evidence and feedback from earlier rounds to either select and formulate a primitive or synthesized operation or pass the evidence to AnswerLM when it considers the evidence sufficient.

arXiv

深度剖析

论文把上下文构建从“检索已有内容”扩展为“主动推导证据”,将检索与计算视为互补的证据操作,由 RouterLM 在每轮选择 CALL_PRIMITIVE、SYNTHESIZE 或 ACCEPT_CONTEXT。 相对固定相似度检索与以检索为中心的迭代/智能体方法,RECAST 允许通过过滤、聚合、算术与定制代码从多个源条目中派生出源中并不直接存在的证据。 框架在六个源表示异构的基准族上训练与评测,每族 100 道未见问题,多轮方法统一限制为六轮与 4,000 字符保留证据,所有方法共用同一 AnswerLM 与同一冻结评判模型。

训练只更新 RouterLM,SFT 建立合法的多轮证据构建行为,GRPO 用下游任务结果改进路由策略,奖励以最终答案正确性为主、token 级 F1 与结构有效性为辅。 论文报告 SFT 与 GRPO 相互补充,二者结合优于任一单独阶段,并让较小的可训练 Qwen3.5-9B 路由器超过未经训练的大模型 Gemini 3.5 Flash 路由器。 训练使用 3,368 条 SFT 轨迹与 608 条 GRPO 实例,RouterLM 以 LoRA 微调;GRPO 采用混合结果过滤,只保留同时含成功与失败轨迹的组,消融显示去掉该过滤或改用纯正确性奖励都会降低平均表现。

原语操作与合成操作提供互补能力,合并两者在免训练设置下取得最强平均表现,且学到的策略在不同基准上呈现不同的操作使用模式。 论文给出操作空间消融与操作使用统计,显示仅原语或仅合成都不占全面优势,合成在约 27.3% 的问题上被使用,路由轮数从约 2.16 轮到 4.22 轮不等。 消融在同一测试集上比较仅原语、仅合成与两者合并三种配置;操作使用统计基于 600 道域内测试问题,报告每问原语调用、合成调用、合成使用比例与平均路由轮数。

学到的路由策略可迁移:在三个未参与训练与检查点选择的留出基准上零样本泛化,并在替换 CompilerLM 后保持较强表现。 论文报告留出基准上平均成功率高于最强基线,且把默认编译器换成更轻量的 Gemini 3.5 Flash Lite 或 Qwen3.5-9B 后,域内与留出表现仍高于所评估的最强基线。 留出评测覆盖 2WikiMultiHopQA、TAT-QA 与 WikiTableQuestions,每个 100 例;编译器迁移实验固定已训练 RouterLM,仅替换在训练中未用作编译器的模型。

启示与展望

该工作面向需要从异构源中派生证据的任务,源包括数据框、含文本与表格的财务报告、层级表格、维基百科段落集合与用户画像;方法在每问最多六轮、保留证据不超过 4,000 字符的设定下运行,关系操作为只读 SQLite 查询,合成程序在隔离环境中执行。对希望把迭代证据构建交给较小可训练模型、同时用较大模型承担编译与最终作答的工程实践,这一设定可直接参考;论文也说明代码、数据与训练好的 RouterLM 检查点将在接收后以开源许可公开。

正文与附录中的多张结果表在所提供的文本中数值缺失,因此摘要只能报告“取得最高平均成功率、优于最强基线”这一方向性结论,无法核对具体百分点;读者若需精确数值与逐基准对比,应查阅原文表格。此外,训练数据依赖执行结果筛选,推理时迭代调用与偶发代码合成会带来延迟与算力开销,论文将更高效的轨迹构建与成本感知路由列为后续方向;失败案例分析也指出,路由器可能找到相关主题或中间实体却未取得所需关系或约束,或在计算解释上出现偏差,这些是继续改进证据请求与充分性判断的开放问题。

来源