GraphForge 用真实文件证据图合成 2169 条轨迹,把 Qwen3.6-27B 的 GDPVal Elo 从 1380.0 提到 1445.7
核心概要
GraphForge 提出一个以证据图为核心的框架,从 O*NET 职业种子出发抓取真实文件组成工作区、在文件关系上构建证据图,并由该图编译出任务陈述与评分细则,再用一次初始 rollout 与修订代理校验可执行性;在 2169 条轨迹上微调 Qwen3.6-27B 后,OpenHands 下 GDPVal 达到 1445.7(+65.7),Claude Code 下 Workspace-Bench-Lite 与 SpreadsheetBench II 分别达到 63.7(+7.7)与 24.0(+13.7),同一数据也提升了 Qwen3.6-35B-A3B。
深度剖析
框架把任务与验证同时锚定在真实文件上:种子来自 O*NET 职业及其 Detailed Work Activities,只保留被标注为 DIGITAL 的任务,过滤后剩 246 个职业、16 个部门、43 个子部门、891 个 DWA 任务类型与 3419 个有效职业—任务类型对;每个种子由搜索代理实例化为真实文件工作区,并在其上构建记录文件、事实与跨文件依赖的证据图。 相较 EnvCraft 用模型生成文件并以 Python 脚本检查工作区状态、NexForge 在真实文件上建任务但不提供任务专属评分细则或验证器,GraphForge 让任务陈述与评分细则都从证据图编译而来,每条正向准则都带有证据锚点与验证流程。 论文给出五阶段方法描述、种子筛选后的具体计数,以及构建漏斗:3638 个物化任务中 2967 个(81.6%)复用未改动的 rollout,2153 个(59.2%)被接纳,最终得到 2169 条有效轨迹、2150 个唯一工作区。
训练效果在三个基准与多个脚手架上都出现提升:SFT 让 35B 基座在 GDPVal 上提升 101.7 Elo(OpenHands)与 101.4 Elo(Codex),27B SFT 模型达到 1445.7 Elo(OpenHands)与 1427.4 Elo(Codex);Workspace-Bench-Lite 提升最多 6.6 与 7.7 分,SpreadsheetBench II 提升最多 16.5 与 13.7 分。 所有 GraphForge 轨迹都用 Codex 脚手架 rollout,而评测覆盖 OpenHands、Codex 与 Claude Code,SFT 模型在每个脚手架下都优于基座,说明语料教的是可跨脚手架迁移的工作技能,而非绑定某一脚手架的习性。 评测采用 pass@1 与固定工作区接口,同一脚手架内比较;GDPVal 用 Bradley–Terry 拟合内部 Elo 池,并把 GLM-5.3(OpenHands)固定为 1667 作为锚点,附录给出 95% bootstrap 置信区间。
以证据锚定评分细则做拒绝微调可提供额外的选择信号:从 2000 个新合成查询中各采样最多四条 SFT 模型自身轨迹,锚定臂保留评分超过 0.95 的细则最优轨迹,经有效性过滤后剩 462 条;在 Workspace-Bench-Lite 与 SpreadsheetBench II 上,锚定选择增益最大,无锚点选择增益更小或为负,随机选择整体最弱。 三个 RFT 臂共享同一批 462 个查询 ID、候选池与优化预算,只改变选择规则,因此这一匹配设计隔离的是查询内轨迹选择本身,而不是整套任务接纳流程。 论文明确说明 GDPVal 上各臂差异在该规模下未被统计分辨,220 个任务的 Elo 差异偏噪声;附录 D 显示所有差值区间都包含零,因此作者把结论限定为选择质量在跨基准上重要、证据锚定的优势体现在 Workspace-Bench-Lite 与 SpreadsheetBench II。
作者对污染与判官敏感性做了审计:39201 个训练文件哈希与 GDPVal 的 260 个文件哈希无一重合,13-gram 相似度最高的 20 对文本没有实质共享内容,44 个 GDPVal 职业中只有 13 个被训练分类覆盖;按覆盖分组比较时,155 个未覆盖任务的胜率 0.739(95% CI [0.671, 0.803])不低于 65 个覆盖任务的 0.692(95% CI [0.585, 0.800])。 这组审计把提升解释为可迁移的工作技能而非对基准内容的记忆,并进一步用受控扰动检验判官是否真的读取被引用文件。 删除某条准则引用的工作表会让对应得分平均下降 0.377,非目标准则基本不变;但对行、数字与引用的细粒度破坏只带来小于 0.03 的变化,作者将其归因于 GLM-5.2 作为代理判官的能力上限。
启示与展望
这套方法面向需要读取多样文件、协调工具并产出可交付物的工作型代理训练场景,适用于能获得公开真实文件、且任务结果可由文件内容核验的职业任务;种子来自 O*NET 职业与官方工作活动,因此适用面受限于该分类体系覆盖的职业与可数字化执行的任务。对使用者而言,它提供的是可复用的合成数据、评分细则、轨迹与训练检查点,以及一条把验证锚定到源文件的流程;论文也指出后续计划把 GraphForge 扩展到更多任务族与文件类型,并研究证据锚定验证与更长时程代理脚手架之间的相互作用。
语料规模为 2169 条轨迹,收益如何随数据预算扩大而变化尚未研究;合成管线与代理判官都由 GLM-5.2 驱动,更强的前沿模型能否提高数据质量与判官可靠性仍是开放问题;实验只覆盖同一家族的两个基座模型,跨模型家族的迁移未知。判官敏感性实验显示它能可靠识别结构性证据缺失,却难以核查行、数字与引用层面的细粒度内容,因此以细则分数作为选择信号时,这一能力边界值得持续关注。此外,GDPVal 上锚定与无锚点两种判官变体无法被区分,220 个任务的 Elo 差异偏噪声,相关结论应视为方向性而非定论。
