把公开文档改写后合成约1万条训练样本,35B学生模型在CL-bench上从13.7%升到24.6%,接近万亿参数前沿模型
核心概要
该工作提出一条无需人工标注的合成监督流水线:对3,515篇公开文档做实体改名与数值扰动等深度改写,用大模型生成需要依赖文档才能回答的问题与评分细则,并通过“有文档/无文档”评分差距检查只保留真正依赖上下文的样本,共得到约9,625条训练样本;用它做SFT把Qwen3.6-35B-A3B在CL-bench上从13.7%提升到22.8%,再加评分细则奖励的RL达到24.6%,与Qwen3.8-2.4T的23.9%相当,并在长上下文理解、指令遵循和推理上出现广泛迁移,而代码与知识类基准基本持平。
深度剖析
流水线用“深度改写+差距检查”把已被预训练读过的公开文档变成上下文学习监督:改写包含专有名词改名、数值扰动、章节重编号和列表顺序打乱,差距检查比较同一问题在有文档与无文档时的评分细则通过率,只保留“有文档可答、无文档不可答、文档确有必要”的样本。 此前合成长上下文监督要么基于真实文档(存在记忆风险),要么完全合成文档(逻辑更简单、更同质);这里保留真实文档但施加扰动,使教师无法凭参数记忆作答而必须从文档中提取信息并推理。 论文报告一次记忆审计:某模型在无文档情况下能完美回答某知名技术标准的问题,但该标准被改写后得分接近零;流水线在重试前过滤掉32.5%的生成样本,消融显示使用未过滤数据训练的模型在CL-bench上为17.75%,低于使用过滤数据的19.17%。
在无人工标注条件下,流水线从3,515篇公开文档生成9,625条训练样本,覆盖CL-bench 18个子类别中的16个,来源包括IETF RFC、SEC文件、法院意见、arXiv论文、公开手册、wiki与百科。 相比需要专家设计数万字文档并逐条核对答案的人工标注方式,该流程把监督构造完全自动化,并给出可复现的数据来源与子类别分布。 论文给出各子类别文档数量表(如Humanities 376、Science 370、Technical Standards 250、Healthcare 244等,合计3,515),并说明文档准入标准为至少4,000字符且全局URL去重。
训练效果显著且部分迁移到目标基准之外:SFT把Qwen3.6-35B-A3B在CL-bench上从13.7%提到22.8%、CL-bench Life从8.4%提到12.6%,随后评分细则奖励RL达到CL-bench 24.6%、CL-bench Life 13.8%;长上下文理解(AALCR 62.6→69.8)、指令遵循(IFBench 57.7→71.7)、推理(ARC-AGI-1 47.4→63.8)明显改善,代码生成基本不变,知识类略有下降(SimpleQA 20.9→18.7)。 该结果说明用公开文档合成数据可以在不教世界知识的前提下提升“使用上下文”的能力,且提升不局限于训练数据所覆盖的公开文档类型。 结果来自同一学生模型的SFT与SFT+RL对照,并列出多个公开参考模型(GLM-5.2 20.9、Qwen3.8-2.4T 23.9、Kimi-K3 27.0、Hy4-preview 27.6)作为比较;RL在ARC-AGI-1上从63.8回落到51.8,说明RL的额外收益集中在目标能力上。
分析显示收益主要出现在虚构上下文任务上:按论文对500个CL-bench上下文的粗略归类,836个任务基于公开文档、1,063个基于虚构或不明上下文,SFT+RL在虚构组从17.5%提升到32.9%,在公开文档组仅从9.0%提升到14.1%。 这提示训练数据教会的是一种可迁移的推理方式,而不是对特定公开文档内容的记忆,与“扰动以抑制记忆”的设计意图一致。 该归类为作者自行审计的粗略估计而非官方划分,论文明确说明这一点;同时公开文档组本身难度更高这一可能解释也被作者提出。
启示与展望
该结果面向需要模型“读文档并据此推理”的场景,例如内部文档与手册问答、检索段落推理、工具输出与日志解读、以及检查方案是否符合规范;适用对象是希望用公开文档构造长上下文监督数据、且能使用强教师模型的研究与工程团队。论文覆盖CL-bench 18个子类别中的16个,未覆盖的Workflow Orchestration与Operational Procedures因以智能体式对话轨迹为主而难以从公开文档获取。数据规模消融显示在100到9,625条的测试范围内性能单调上升且未见饱和,说明当前约1万条样本池可能尚未耗尽学习容量。
论文自述改写“不保证完美”,只是足以让原文与改写文本可检测地不同;差距检查在重试前过滤32.5%的样本,其判定依赖评审模型。SFT结果强烈依赖教师:相同问题下不同教师答案训练出的学生在CL-bench上从19.7到22.8不等,最强教师Kimi-K3(27.0)反而给出最弱学生(19.7),而中等排名的Qwen3.8-2.4T给出最好的22.8,作者把更细致的分析留待未来工作。RL阶段模型推理与答案变长,且在要求避免幻觉的评分细则上失败率约2%,作者据此提出可能存在奖励钻空子;加入长度惩罚后CL-bench降到20.91,加入整体通过率后未超过SFT。可复现性声明指出官方CL-bench评审提示词会触发内容审核,作者把全角括号替换为半角,并说明这可能改变评审行为、无法保证结果与官方提示词完全一致。此外,上下文来源的公开/虚构归类是作者对500个上下文的粗略审计估计,并非官方划分。
