DISCO 把长上下文拆成 Worker 并行检索加 Driver 推理,在 RULER-QA 百万 token 上保持 78.4% 准确率,推理成本降逾 80%
核心概要
该工作提出 DISCO,把长上下文处理拆分为由轻量 Worker LLM 并行执行的局部证据检索(grounding)与由中心 Driver LLM 负责的全局推理(reasoning),Driver 用 GRPO 强化学习优化动态 DAG 规划;在 RULER-QA 1M token 上以 Qwen3-8B 保持 78.4% 准确率(RAG 基线跌至 10.9%),在 LongBench v2 上比全上下文基线最高提升 9.8 分,并在与 Gemini-3-Pro-Preview 相当的表现下把推理成本降低逾 80%。
深度剖析
论文把长上下文失效归因于“grounding 与 reasoning 的结构性纠缠”,并提出把两者彻底解耦:Worker 只做局部原子抽取,Driver 只在精炼证据上做多跳推理。 相比 RAG 依赖 embedding/BM25 的浅层检索、以及 Chain-of-Agents、LLMMapReduce 等串行或单轮 agent 流程,DISCO 让生成式 LLM 承担检索,并把检索与推理在结构上分离。 论文给出分解式(式 1–式 6)与系统设计,并在 LongBench v2 上以同参数规模的 Qwen3-Embedding-4B 检索器替换生成式 Worker 做对照:47.3 对 39.6,说明生成式 grounding 优于静态向量检索。
DISCO 在百万 token 级检索上保持稳定:RULER-QA 1M token 下 Qwen3-8B 达 78.4%,而 RAG 基线跌至 10.9%,且 256K/512K/1M 分别为 77.6/77.5/78.4,几乎不随长度衰减。 论文称其 grounding 表现对总上下文长度“不变”,并比最强基线 LLMMapReduce 高约 6%。 结果来自 RULER-QA 合成多跳基准在 256K、512K、1M 三个长度上的评测,并与 Naive 全上下文、RAG、CoA、LLMMapReduce、RLM 五类基线对比。
解耦与迭代重规划释放推理能力:LongBench v2 上 DISCO(Qwen3-14B)比全上下文基线高 9.8 分(48.7% 对 38.9%),且 Thinking Mode 的增益被放大(8B 从 +0.9 到 +5.5,14B 从 +5.6 到 +13.5)。 论文解释为 Worker 已把证据蒸馏成紧凑形式,Driver 的思考预算全部用于推理而非在噪声上下文中检索。 对比对象为 Full Long Context 与 LLMMapReduce(33.7%),并给出 Thinking Mode 开关下的增益对照。
成本与规模解耦:以 Gemini-3-Pro 为 Driver 时,DISCO 保持与全上下文基线接近的推理水平(71.3% 对 72.2%),同时把评测成本从 126.7 降到 20.4(约 6.2 倍降幅,论文表述为降低逾 80%)。 论文把 token 密集的扫描卸载给轻量 Worker,使“读”的成本与“想”的成本分离。 来自 Gemini-3-Pro 的成本对比实验,以及固定 8 张 H100 等算力预算下 256K–1M 的延迟曲线:DISCO 延迟近乎平坦,而 agentic 基线呈陡峭线性增长。
启示与展望
该结果面向需要在百万 token 级上下文上做多跳问答的推理服务场景,适用对象是希望以轻量 Worker 加中心 Driver 组合替代单模型长窗口的工程与研究团队。它使“按上下文长度扩展 Map 动作、按推理复杂度扩展 Wide 动作”的纯推理期扩展成为可操作路径,并给出 Worker 规模、奖励设计与容错的调参依据:Worker 从 4B 到 14B 仅带来 2.9% 准确率提升(50.9% 到 53.8%),而 Driver 从 8B 到 14B 带来 39.8% 到 50.9% 的提升,说明算力应优先投向 Driver。
读者仍会关注若干开放问题:Fact Dropout 实验显示在丢弃比例超过约 20% 后平均执行阶段从 4 骤增至 7、准确率在 40% 丢弃时跌至 33%,说明容错存在相变点,实际部署中 Worker 失败率落在哪一侧尚待观察;训练数据由 MuSiQue 经 Recursive Context Augmentation 扩增为 4.5k 样本(16K–512K token),这种合成长上下文与真实超长文档的分布差异会如何影响迁移,文本未给出答案;RLM 基线在 Qwen3-8B/14B 上表现不佳,论文将其归因于小模型缺乏 REPL 环境所需的编码与规划能力,因此与其他基线的比较需结合这一前提理解;此外,本次读取为全文,但表格与图(如 Figure 2–6)在文本中以引用形式出现,部分数值只能通过正文转述获得,细粒度曲线仍需查阅原文图表。
