CRAFT 用模板感知的反思与局部修复做表格填表,在 FormFillBench 上把配对准确率提升 8.51 与 23.38 个百分点
相关研究与后续进展核心概要
作者提出 CRAFT,一个模板感知的智能体表格填表框架:它把反思式校验与受限局部修复相连,先定位可疑区域、必要时恢复被覆盖的模板内容,再用矩形感知槽位定位器(RASG)重新定位可写单元格,并以标签—槽位提示和保护区域约束后续编辑;同时发布含 327 份表单、分 Instruction-Only 与 Multi-File 两条赛道的 FormFillBench,CRAFT 相对最强基线在两条赛道上分别把配对准确率提升 8.51 和 23.38 个百分点,组件移除实验支持结构裁决与槽位重定位的作用,换用第二个骨干模型后仍保持相对优势。
Figure 1: Example of spreadsheet form filling and its key challenges. The agent needs to gather evidence from auxiliary files, satisfy field-level constraints, preserve cross-field consistency, and interpret diverse form layouts.
arXiv深度剖析
CRAFT 把反思从“自由重写整份工作簿”改为“定位到具体区域的受限修复”:可疑区域携带错误类型、校验来源、恢复指示与可靠单元格,模板完整性违规先触发恢复再重填。 既有表格智能体(如 SheetAgent 的迭代反思、SheetBrain 的执行结果校验)已包含反思与验证,但本文的增量在于把诊断与修复以模板为单位连接起来,使可疑范围把恢复决策与保护约束带入槽位重定位与局部重填。 组件移除实验显示,去掉结构感知局部裁决(SALA)在两条赛道分别降低配对准确率 6.71 与 41.04 个百分点,去掉渐进式槽位重定位(PSR)分别降低 9.23 与 41.66 个百分点,后者还把 Multi-File 端到端准确率从 43.31 降到 3.15。
矩形感知槽位定位器(RASG)以 SegFormer-B1 为骨干,用矩形 logits 加水平、垂直边界线索重建可写槽位掩码,并按面积阈值对齐到候选单元格,为局部重填提供候选位置。 通用视觉语言智能体在精确槽位定位上可靠性有限,RASG 显式建模表单槽位的矩形几何,把修复空间收窄到可信的可写槽位;训练分三阶段,从合成表格到 CommonForms 的 PDF 布局,再到人工筛选标注的 FUSE 子集。 论文报告了 RASG 在多种布局(相邻字段、细长区域、不规则分区)上的方向线索与槽位预测可视化,并说明当找不到可靠槽位时控制器回退到带保护的局部修复。
作者构建 FormFillBench,含 327 份表单:Instruction-Only 赛道 200 份、5,499 个标签—值对;Multi-File 赛道 127 份、2,288 个对,每例约五个支撑文件、共 11 种文件类型。 既有表单填表基准多面向网页或文档场景,既有表格评测侧重表格理解与操作而非表格填表;该基准把两条赛道分开,以区分“把给定值落到正确位置”与“跨异构文件整合证据后再落地”两类难点。 模板来自 FUSE、VEUSES、Venron2、公开在线来源与合成模板,候选样本经自动一致性检查与人工核验;指标为配对准确率与端到端准确率,另有填充精确率、召回率、F1 与填充覆盖率。
在默认骨干 Gemini 3.1 Flash-Lite-Preview 下,CRAFT 在 Instruction-Only 达到 59.68 配对准确率与 15.5 端到端准确率,在 Multi-File 达到 66.52 与 43.31,均领先 11 个基线。 相对 Instruction-Only 最强基线 VLM+HTML+Image 提升 8.51 与 2.00 个百分点;Multi-File 上最强基线因指标而异(OpenAI Agents SDK 配对 43.14、CrewAI 端到端 18.90),对应提升 23.38 与 24.41 个百分点。 换用 GPT-5.4 mini 骨干后 CRAFT 仍在所评估方法中领先,Instruction-Only 配对 41.57、Multi-File 60.66,分别高出对应最强基线 7.51 与 10.75 个百分点;但绝对性能依赖模型,Multi-File 端到端准确率在该骨干下为 9.45。
启示与展望
该工作面向电子表格表单填表:给定模板、指令与辅助文件,产出“哪个值写入哪个区域”的条目,并保持静态标签、格式、合并区域等模板约束。它适用于需要跨邮件、PDF、表格等异构来源整合证据并精确落位的企业表单场景,例如报销单与合规问卷;双视图表示与区域级修复规范也为其他模板化文档填表提供可复用的接口。评估配置限定为最多一轮反思与六步修补,因此返回的工作簿可能仍保留未解决的错误。
论文自述其受可用源文件解析器限制,遇到歧义标签或单元格内多重规格时可能需要人工澄清;基准为人工策展,报告的点估计覆盖两个骨干与一个基于大模型的语义评判器,说明的是该评测协议下的表现,而非任意企业工作流的可靠性。严格的表单级完成仍然困难,尤其在 Instruction-Only 赛道与第二个骨干下。两条赛道表单集合不同,其绝对分数不是任务难度的受控比较;运行间波动性尚未量化,是后续方向。
