跳到主要内容
返回时间线
arXiv来源发表:

FloWright 把工作流当作训练场:让多个角色共同进化,小模型在文档、幻灯片、图表、代码、数学与金融任务上最高提升 7.41%

核心概要

该工作提出 FloWright,把工作流本身当作“训练场”,用分层且结构感知的奖励把工作流的单一稀疏结果分解到各个角色,使一个角色可自我进化、两个及以上角色可共同进化,并配套 DataWright 把单智能体能处理的既有数据集硬化成工作流级任务;在文档、幻灯片、图表、代码、数学与金融任务上,用 FloWright 训练的小型开源模型性能最高提升 7.41%,共同进化(+5.03%)优于只优化单一角色(+2.83%)。

AI-generated editorial illustration: It Takes Workflows to Evolve Better Workflows

深度剖析

FloWright 让工作流中不止生成器一个角色可以学习:它用执行轨迹把工作流的单一标量结果定位到具体角色,按角色自身节点在失败中所占比例计分,因此不需要额外的模型、标注或重复执行。 此前从执行结果训练工作流的方法通常只优化工作流生成器,而构建或执行工作流的其他智能体保持固定,尽管每个结果都取决于它们全体。 论文给出角色级信用公式(Eq. 2)与分层奖励(Eq. 3),并说明只有真正的根因被计分、级联失败沿边传播、基础设施故障被排除;实验在留出测试集上比较四种进化模式。

FloWright 支持四种进化模式:单角色自我进化、智能体—技能共同进化、上游—下游共同进化、多智能体共同进化;共同进化的角色越多,收益越大。 既有工作要么单独训练每个智能体,要么只在固定配对或手工设计的系统中协同训练,而 FloWright 的协同发生在为每个任务构造的工作流之上。 在 Qwen3.5-4B 的四种模式中,多智能体共同进化整体增益最高(+5.03%),高于智能体—技能共同进化(+2.83%)、上游—下游共同进化与单角色自我进化;每个臂在至少一种模式下都有提升。

DataWright 通过 Shared、Paired、Decoy 三种硬化策略与两个硬化等级,把单智能体已能处理的数据集转成更难的工作流级任务,用于训练与评测。 论文指出工作流常在单问题数学、函数级代码、短问答等单智能体已能处理的数据上训练和评测,这类数据既无法揭示也无法优化工作流相对单智能体的增量。 论文报告了硬化前后的对照:在原始 MMLongBench-Doc(200 样本子集)上工作流与单智能体分别为 与 ,在原始 DocFinQA(200 样本子集)上分别为 与 ;同一工作流在 DataWright 硬化后的 MMLongBench-Doc 上达到 ,单智能体为 ,提升 点。

FloWright 的收益在训练时与测试时叠加,并跨角色、骨干、强化学习算法、工作流拓扑与组件池泛化。 同一套训练场既在训练时提供强化学习信号,也在测试时通过元蒸馏把成功经验变成可复用的先验,而无需更新权重。 测试时从自身经验蒸馏先验带来整体增益,从更强教师(GPT-5.4)蒸馏亦然;五样本元蒸馏测试时增益最大,而单样本低于未训练基线;训练时与测试时优化叠加后达到整体水平。消融显示 GRPO、CISPO、DAPO 均可实例化该目标,四种拓扑下优化都带来提升,按需增长的组件池相对固定池增益最大。

启示与展望

该结果面向需要多智能体协作的复杂任务,例如跨异构输入收集证据、长上下文推理与多步累积中间结果;训练与评测在 DataWright 硬化后的工作流级任务上进行,覆盖文档、幻灯片、图表、代码、数学与金融等领域,并区分分布内、分布外与领域外三种评测情形。论文的强化学习实验主要在两个同族开源模型 Qwen3.5-4B 与 Qwen3.5-9B 上评估,同时用元蒸馏在四个骨干(含两个未被优化的闭源模型)上验证;评测任务在任务开始后输入固定。对读者而言,这意味着该方法适用于“单智能体已难以一次完成、需要分解、路由、定位证据并聚合”的场景,而不是单问题数学或函数级代码这类单智能体已能处理的任务。

论文自述的局限包括:强化学习实验主要在两个同族开源模型上评估,作者表示希望纳入更多模型家族;评测任务在任务开始后输入固定,作者计划扩展到输入与所需组件在工作流运行中变化的动态环境。此外,首页证据包给出的是论文全文的解析文本,其中的表格与图(如 Tab. 1、Fig. 12–16)在文本中以占位形式出现,部分具体数值只能从正文叙述中读取,若需精确对照各臂数字仍需查阅原文图表。硬化策略对数据集的适用性也受前提约束:Shared 需要同一输入承载多个独立问题,Decoy 需要问题能唯一指向自己的输入,因此并非所有数据集都支持全部策略。

来源