跳到主要内容
返回时间线
arXiv来源发表:

SourceLearn让LLM智能体把反复使用同一权威来源变成可累积的来源专属能力,在15个设置中13个取得最佳成绩

相关研究与后续进展

核心概要

该工作提出“来源学习”,用可持久修订的“来源模型”表示对某一持久权威来源的可复用理解,并通过自主导向来源学习(检查—研究—整合,自适应选择深化或连接动作)与任务导向来源学习(失败引导的局部修补加跨任务表示策略再校准)两种机制逐步完善该模型,且持久更新始终从权威来源重建;在文档问答、代码问答、工具使用与交互环境五个基准、三个LLM后端共15个设置中,SourceLearn在13个取得最佳,较Hybrid RAG平均提升14.3、4.9、13.4分,最高提升22.6分。

AI-generated editorial illustration: From Knowledge Access to Source Learning: Developing Source-Specific Competence

深度剖析

论文把“来源学习”形式化为对某一持久权威来源发展可复用的来源专属能力,并用显式、持久、可修订的“来源模型”表示这种能力,该模型与直接访问来源互补,来源仍是事实权威。 此前工作分别优化来源内容的访问与组织(检索、长上下文、结构化来源表示)或保存交互经验(智能体记忆),而把同一来源的反复使用当作重复访问;这里把“对来源本身的理解”作为学习对象。 以问题形式化(式1–式3)与来源模型、实体表示、激活预算(式6–式7)的设计给出,属于概念与表示层面的贡献,其有效性由后续实验间接支持。

SourceLearn用两种互补机制构建并逐步精炼来源模型:自主导向来源学习以“检查—研究—整合”循环,用当前模型驱动对来源的再阅读,并由自适应规划器选择“深化”或“连接”动作;任务导向来源学习用下游任务经验揭示局部表示缺口与反复出现的表示需求。 两种机制共享同一“接地重建”原则:学习信号只决定“重新考虑什么”,持久更新必须从权威来源重建,观察本身从不直接写入持久记忆;任务导向学习还区分失败引导的局部修补与跨任务表示策略再校准两条路径。 方法在式4–式14中完整给出,并配有提示细节(附录C);消融实验显示去掉任一机制或任一路径都会降低三个问答基准上的准确率,初始来源模型最低。

在五个基准(MultiDoc2Dial、NarrativeQA、SWE-QA、APIBench、AppWorld)与三个后端(GPT-5.6-Luna、gpt-oss-120b、DeepSeek-V4.1-Flash)共15个设置中,SourceLearn在13个取得最佳、另1个第二,较Hybrid RAG平均提升14.3、4.9、13.4分,最高提升22.6分。 对比对象包括任务局部检索(Hybrid RAG)、静态来源表示(RAPTOR、HippoRAG 2)与基于经验的记忆(AWM,使用相同引导任务);论文指出后三者在各基准上提升更不均衡。 主表覆盖文档、代码与API来源;引导任务与测试任务不相交,QA由GPT-5.6-Luna评判,APIBench与AppWorld使用官方评测器;在匹配上下文预算的对照中SourceLearn仍在四个来源中的三个最佳。

来源学习不只是压缩:从初始模型到自导向模型再到任务导向模型,表示从孤立查表内容转向结构化规则与流程,带显式适用条件的单元从约30%升至65–82%;测试问题所需来源论断被模型覆盖的比例从23.2%升至40.0%,且覆盖率与下游成功相关(无覆盖时67.5%,全覆盖时86.6%)。 这回应了“来源模型是否只是来源摘要”的疑问,用表示构成、条件显式化与任务所需论断覆盖率三类分析说明学习改变了“表示什么”。 分析基于来源模型单元的类别划分与论断覆盖统计;论文同时报告接地审计中直接矛盾很少、93–100%被删论断在重写后仍被保留,但部分任务导向单元仅部分被支持或未被支持。

启示与展望

该结果面向持久、权威且相对稳定的来源,以及反复出现的同源任务序列;适用对象是需要在同一文档集合、代码仓库或API文档上连续完成任务的LLM智能体系统。它使后续工作可以在任务时把“激活的来源理解”与“直接检索到的来源证据”并用,在检索不完整时仍保留可用的来源理解,并把任务经验转化为对来源表示的改进而非任务答案的留存。论文报告在无检索证据时来源模型单独使用可与Hybrid RAG使用全部八个检索元素相当,去掉金标文档时Hybrid RAG下降约25分而SourceLearn仅下降约8分;在匹配上下文预算下SourceLearn仍在四个来源中的三个最佳。

主表的具体数值在所提供的材料中未逐格呈现,因此各基准与各后端的逐项差距只能依据正文概述判断;接地审计显示任务导向单元在文档与代码来源上存在部分支持或未支持的情况,来源模型因此被定位为累积理解而非来源替代品。自导向学习在四个循环的扩展实验中未显示超过第一循环的一致增益,最优循环数与来源规模、类型的关系仍是开放问题。论文把演进、噪声或冲突来源下的来源学习列为未来方向,这类设定下的行为尚待检验。

来源