ProgramDistill:把交互式网页应用转化为可验证的参考引导式软件工程任务
核心概要
该工作提出 ProgramDistill 基准与全自动 mine–craft–patch 流水线,将 26 个交互式网页应用分解为 1,975 条可重放验证的行为并构建 4,063 个任务,让编码智能体在隐藏源码的情况下通过交互参考应用推断并恢复缺失功能,结果显示九个前沿智能体在完整应用重建中最高成功率 49.2%,且随恢复深度从 1 增至 8,部分应用重建成功率从 100% 降至 64.0%、从 96% 降至 32%。
Figure 1: ProgramDistill evaluates reference-guided software engineering for interactive web applications. A coding agent is given a working reference application whose source implementation is hidden and an editable current application with missing functionality. The agent interacts with the reference to infer the intended behavior, restores that behavior by modifying the current implementation, and validates the result against the reference.
arXiv深度剖析
提出参考引导式软件工程基准 ProgramDistill,包含 4,063 个可重放验证的 SWE 任务,源自 26 个交互式网页应用中的 1,975 条行为,覆盖原子修复、累积修复与完整应用重建。 以往编码智能体评测通常以 issue、指令或测试预先给定目标行为,而该基准要求智能体从可运行的参考应用中自行推断行为,并以重放交互是否一致作为成功判据。 任务由全自动流水线生成,每条行为均通过重放验证器 V(A,L_d)=1 才被接纳,并配有 gold patch 作为端到端正向对照。
提出沿两个轴定义的程序蒸馏:应用—任务分解把可运行应用转为结构化 SWE 任务,参考—当前蒸馏要求智能体从可执行参考中恢复行为。 与把程序视为整体重建目标的 ProgramBench 不同,该工作利用交互式网页应用中由 UI 动作与应用状态构成的前置依赖,把行为组织成前置谱系。 通过 mine–craft–patch 流水线在 26 个应用上无人工干预地实例化,并报告 1,201 个累积任务中 629 个确定性合成、572 个需合并智能体。
引入恢复深度作为可控难度轴,前置谱系提供从原子修复到完整重建的渐进路径,并可作为未来课程式训练的天然基础。 该轴使同一基准能够系统暴露随恢复深度增加而出现的失败模式,而不仅是给出单一总体成功率。 报告九个前沿智能体的结果:完整应用重建中 GPT-6 Astra 与 Claude Opus 5 分别恢复 49.2% 与 28.8% 的评测工作流;部分应用重建中随恢复深度从 1 增至 8,成功率分别从 100% 降至 64.0%、从 96% 降至 32%。
轨迹分析显示重建负担与智能体投入之间存在日益扩大的错配,每个所需行为的观察投入随任务加深而显著下降,且 Astra 在修复表现最强时观察活动最高、编辑/写入步骤最少。 把观察、验证与编辑之间的投入分配识别为参考引导式软件工程中与实现能力并列的重要维度。 基于对九个前沿编码智能体轨迹的分析,属于对评测过程中行为模式的观察性总结。
启示与展望
该基准面向交互式网页应用这一设定,任务由 26 个应用(含改编自 OSWorld 网页应用套件以及公开仓库中的开源项目与 SaaS 克隆)经 mine–craft–patch 流水线生成,评测在隐藏参考源码、禁用公网出口的隔离环境中进行,成功以重放交互是否与参考一致为准,而非源码级匹配。它适用于评测和诊断编码智能体在原子修复、累积修复与完整应用重建上的表现,并为未来课程式训练提供任务来源;对非网页类软件或行为无法通过浏览器交互重放的系统,其适用性需另行考察。
读者仍可关注:重放验证依赖确定性执行与稳定可观察属性,时间相关行为被共享确定性时钟削弱,这类设定在多大范围的行为上保持稳定尚待观察;mask 深度评审用于拒绝表层改动,其判定边界值得进一步了解;累积任务中随恢复深度增加而更多依赖合并智能体,合并质量对任务有效性的影响可作为后续观察方向;此外,本次加载文本为论文正文,附录中的语料细节、提示词与实现细节未包含在内,若需评估流水线可复现性,附录内容是需要查阅的开放部分。
