WebLoop 用执行反馈训练无执行 Critic,9B 模型在 WebRise 达 41.5、WebGen-Bench 达 38.9%
核心概要
WebLoop 把功能型网页生成中的生成、批评与修复三个角色放在同一策略下联合优化:Generator 与 Refiner 的输出由浏览器执行给出直接奖励,而 Critic 不接触执行结果,仅凭任务需求与源码做需求级判断,其训练信号来自需求级执行标签(判别力)与后续修复带来的执行提升(有用性),并采用先建立诊断、再引入后果感知信用的分阶段奖励。用 Qwen3.5-9B 时,WebLoop 在 WebRise 上 Overall 达 41.5、在 WebGen-Bench 上准确率达 38.9%,分别比基座模型提升 11.3 与 15.4 分。
Figure 1: Conceptual comparison of execution-based learning paradigms for functional Web generation. (a) Generation-only RL optimizes executable outputs directly. (b) Execution-guided RL feeds external feedback back into the code policy. (c) WebLoop jointly learns Generator, Critic, and Refiner, assigning execution-derived credit to the intermediate Critic.
arXiv深度剖析
论文把功能型网页的自改进形式化为一个结构化强化学习问题,并指出核心难点是中间 Critic 的信用分配:Generator 与 Refiner 产出可执行产物、能拿到直接环境奖励,而 Critic 只影响下游行为、没有可直接执行的结果。 此前基于执行的学习多聚焦最终页面质量,或用执行反馈做迭代编辑,未直接处理如何优化引导后续修复的中间 Critic。 该问题设定由论文的循环公式化与奖励定义支撑,属于框架层面的论证而非单一实验结论。
WebLoop 用两个互补信号训练一个推理时不接触执行的 Critic:需求级执行标签监督其判别力,后续修复带来的执行提升衡量其有用性,并采用先判别力、后加入有用性的分阶段奖励。 相对只优化单一信号或从一开始混合两种信号的做法,分阶段组合在受控对比中表现更好,且两种信号在不同基准上的相对强弱不同。 表 4 的受控消融显示仅判别力、仅有用性、一开始就混合三种方案均低于 WebLoop;论文同时说明判别力在 WebRise 上更强、有用性在 WebGen-Bench 上更强。
三个角色在共享策略下以角色专属比较组做组相对优势估计,并联合用 GRPO 优化,使循环整体可学习。 相对把修复或 Critic 学习当作孤立阶段的训练方式,联合优化在首轮生成上就已拉开差距。 表 3 显示 Staged Training 精修后为 40.1 与 36.1%,WebLoop 为 41.5 与 38.9%;表 1 显示 WebLoop (Gen) 把 9B 基座从 30.2 提到 39.1、从 23.5% 提到 34.2%。
增益可迁移:既体现在首轮生成,也在 27B 规模上保持,并从纯文本训练泛化到 Markdown、Sketch、Image、Video 输入。 说明循环级训练强化的是底层生成策略本身,而不只是批评条件下的改写。 表 2 显示平均 WebRise 分数从基座 31.9 升到 WebLoop (Gen) 37.5、完整循环后 40.1,且三个功能指标一致提升;27B 上 WebLoop (Refine) 达 52.2 与 42.8%。
启示与展望
该结果面向功能型网页生成这一设定:任务由自然语言描述与显式、隐式需求定义,并由浏览器中的 Interaction Contract Graph 执行交互与断言来判定。训练语料为 2,880 个可执行任务、覆盖 21 个领域与 1,442 个场景,受控训练使用文本条件任务,主结果在 WebRise 的文本模态下评测。方法适用于能提供可执行验证的生成场景,Critic 在推理时保持无执行,因此部署时不需要浏览器结果或执行轨迹作为输入。对希望把执行监督用于中间决策而非仅最终产物的研究者与工程团队,这套角色专属比较组加联合 GRPO 的配方可直接借鉴。
读者仍会关注:Critic 的判别力与有用性在不同基准上相对强弱不同,这种差异在更多任务分布下是否稳定;分阶段奖励中控制第二阶段判别力权重的系数取值如何影响结果;定性分析显示失败可来自 Critic 误判、修复指导不足或 Refiner 未落实指导,这三类来源在整体失败中的占比尚未量化;批评长度与修复质量的关系被作者明确标注为描述性而非因果。此外,正文中的公式与部分图表以占位形式呈现,若需复现具体目标函数与提示模板,应查阅附录 A、B、D 的完整定义。
