跳到主要内容
返回时间线
arXiv来源发表:

把上下文变成可编辑文件:CLM 让模型自己管理上下文,在 BrowseComp-Plus 上准确率提高 11.4% 且 FLOPs 减少 21.5%

核心概要

该工作提出 Context Language Models(CLM),把模型的实时上下文镜像为一个可自由编辑的文件,让模型用 Bash 自行增删改写上下文,从而把上下文管理从外部 harness 控制变为模型自身能力;零样本应用于 Qwen3.6-27B、GPT5.6-Sol 等现有模型时,在 BrowseComp-Plus 上比最强基线准确率高 11.4% 且 prefix-reuse FLOPs 少 21.5%,在 12 小时 EdgeBench 上分数高 5% 且 FLOPs 少 59%,在 24 小时多仓库 agent-swarm 任务上同等算力下端到端加速多 65%,并可通过自然语言指令、文本进化与在线强化学习进一步学习上下文管理策略。

AI-generated editorial illustration: Context Language Models

深度剖析

CLM 把标准语言模型的“只追加”上下文转移推广为模型可控的上下文转移:上下文被镜像成一个模型可直接编辑的文件,模型可用通用 Bash 命令自由改写,每次修改立即同步到下一轮的实时上下文。 此前工作要么由 harness 按固定策略压缩(如 Codex 式摘要、Context Folding),要么只开放一组人类预定义的动作(AutoCompact、Self-Compact、Context-as-a-Tool、ACM、Sculptor),模型自主性始终受限于人类设定的动作空间;CLM 把自主性推到极限,让模型自己定义上下文管理函数。 论文给出形式化定义(式 1 与式 2 对比追加式与模型控制式转移),并给出 context-as-a-file 的具体实现与多智能体扩展(多个上下文文件共存、以创建/删除文件来启停子智能体)。

零样本 CLM 在长时程任务上同时取得更高成绩与更低算力:BrowseComp-Plus 上 59.4% 准确率、相对最强基线高 11.4% 且 prefix-reuse FLOPs 少 21.5%;TerminalBench 2.1 上与最强基线持平但只用其 70% FLOPs;TBLite 上 73.7% 对 67.0%;12 小时 EdgeBench-10 上 44.6 分对 42.3 分、179 对 437 PFLOPs;24 小时六仓库 Software World 上同等花费下下游加速多 65%。 这些比较是在共享 Mini-SWE-Agent 骨干、全部方法不做训练、统一 32K 上下文预算的受控设置下完成的,覆盖编码、深度研究与开放发现三类任务,说明收益来自上下文管理本身而非训练数据或额外工具。 论文报告了具体分数与 prefix-reuse FLOPs,并说明 BrowseComp-Plus 使用全部 830 题、由 Qwen3.5-27B 以固定模板判定;EdgeBench-10 取 10 个任务、每任务三个种子并报告三次中的最好成绩;数学优化任务每个方法只跑一次。

因为上下文管理成为模型内在行为,它既可在上下文中学习也可在权重中学习:一句自然语言指令即可改变压缩时机、按语义子问题边界压缩或压缩前备份;文本进化循环在 ContextBench 的 KV Store 上把留出准确率从 38.3% 提升到 74.2%;在线强化学习把 Qwen3.5-9B 在 BrowseComp-Plus 上从 28.8% 提升到 42.5%,同时每问 FLOPs 从 1.52 降到 1.34。 论文提出 success-gated efficiency advantage,只在同一组内成功轨迹之间按 prefix-reuse FLOPs 重新排序,从而区分“减少推理算力”与“单纯缩短上下文”,避免给失败轨迹效率奖励。 强化学习在 3,040 条 OpenResearcher 提示上训练 Qwen3.5-9B,用 500 条留出题选检查点,再在全部 830 题上评测;文本进化在每任务 102 条开发实例上选择技能,留出测试集评测一次。

论文同时给出服务侧协同设计:Suffix Cache Reuse 在编辑后复用未改动后缀的缓存状态,相对标准 SGLang 在同等性能下把服务端算力再降 35%;在 BrowseComp-Plus 上 SCR 复用的提示词 token 中,5.3 个百分点来自聊天模板剥离历史推理块,只有 2.5 个百分点来自其他上下文编辑。 标准前缀缓存只复用匹配前缀,中间编辑会迫使后续全部 token 重新 prefill;SCR 把编辑视为一种上下文变更,对存活片段重新旋转位置编码后拼接复用,并扩展到全注意力与线性注意力交错的混合模型。 论文报告 SCR 作为 SGLang 补丁的实现细节、对混合模型线性注意力层采用编辑前循环状态快照的做法、每次编辑最多迁移 K 个片段的保守上限,以及在 64 道 BrowseComp-Plus 题上对 K 的小规模敏感性分析。

启示与展望

这项工作面向需要长时程、多轮、上下文压力大的智能体场景:终端编码、深度研究、数学优化、单仓库与多仓库软件优化,运行时长从数小时到 24 小时,上下文预算多为 32K(EdgeBench 另有 128K 结果)。它适用于愿意把上下文控制权交给模型、并能改造服务栈以支持编辑后缓存复用的团队;多智能体扩展通过多个上下文文件共存来支持 agent swarm 与子智能体。论文还给出可复用的诊断工具 ContextBench,把上下文管理与推理、知识解耦,便于在受控条件下比较不同策略。

仍待观察的问题包括:模型可写上下文带来的安全面,论文指出可编辑上下文可能成为提示注入或自生成指令跨轮持续存在的通道,并提到已有工作在压缩摘要中观察到模型插入未授权指令;现有模型的长上下文长度感知有限,论文发现模型在长上下文下倾向于给出分桶式估计,环境提示可显著改善,因此当前实现依赖在预算前 2,048 token 处给出编辑提醒;SCR 复用编辑前计算的缓存状态属于近似,论文用每次编辑最多迁移 K 个片段来限制近似累积,并指出混合模型中线性注意力层循环状态只在缓存请求边界保存,导致部分本可复用的前缀仍需重算;此外,本次读取的是论文正文与附录的文本内容,图表中的具体曲线数值只能依据正文描述转述。

来源