跳到主要内容
返回时间线
arXiv来源发表:

DAGO 用上下文老虎机选择多父代工作流融合,在六个基准上把宏平均分从 80.3 提升到 81.7 并降低 11.2% 搜索开销

相关研究与后续进展

核心概要

DAGO 把每个父代工作流组合建模为老虎机的一个臂,用代码与提示的预训练嵌入表示该臂,以对角 LinUCB 在预测子代质量与不确定性探索之间权衡,由 LLM 经摘要引导融合生成子代并以子代验证分作为奖励,在数学推理、代码生成与问答六个基准上取得所评估基线中最高的宏平均分,并在与 AFlow 相同的验证评估预算下把宏平均分从 80.3 提升到 81.7、把总搜索开销降低 11.2%。

Source-provided article image: Fusion is the New Mutation: Bandit-Guided Evolution on Workflow Graphs
Figure 1 ·

Figure 1: Overview of the DAGO framework. (a) The DAG stores workflows, validation scores, and parent lineage. (b) Annealed score sampling proposes parent combinations. (c) Diagonal LinUCB selects a combination from code-and-prompt embeddings. (d) Summary-guided fusion generates a child. Validation feedback updates LinUCB and the DAG; the highest-scoring workflow is returned.

arXiv

深度剖析

把工作流融合的父代选择显式建模为上下文老虎机问题:每个候选父代组合是一个臂,奖励是生成子代的验证分,而不是父代已有分数的聚合。 此前的工作流重组方法(如 EvoFlow 的 LLM 交叉、MermaidFlow 的约束保持交叉)提供了融合算子,但没有决定该融合哪些父代;DAGO 把这一选择本身作为学习对象。 论文给出该建模的形式化定义(臂、潜在奖励、部分可观测),并在六个基准上与 AFlow、MaAS 等基线比较,报告宏平均分 81.7 对 80.3 与 79.3。

用共享的对角 LinUCB 奖励模型跨臂复用稀疏融合反馈,配合退火分数采样提出候选臂,避免枚举组合空间。 不是为每个组合单独学习奖励估计,而是用预训练代码与提示嵌入的拼接作为臂特征,让已评估臂的反馈影响新提出臂的排序。 消融显示默认 LinUCB 在 GSM8K、HumanEval、DROP 三个测试基准上均高于随机选择与无探索变体;去掉父代摘要或改用随机选择使三任务平均从 84.9 降到 82.9 与 83.0。

把臂选择嵌入以 DAG 记录多父代谱系的生成循环,由 LLM 摘要父代优势与约束后从最强父代出发做定向修改生成子代。 DAG 记录的是搜索谱系而非单个工作流的执行图,为后续臂提议提供不断扩大的父代池。 附录报告六个基准上最优融合工作流均由 5 父代融合产生,最优节点出现在第 11 至 29 轮,且 MBPP、HotpotQA、DROP 的最优工作流祖先深度达 3 至 7。

在匹配验证评估预算下同时报告性能、搜索开销与跨任务迁移,并给出不假设线性可实现性的决策分析。 分析把候选提议损失与臂选择损失分离,并指出对角近似同时改变拟合系数与探索项,因此经典线性老虎机保证不能直接迁移。 总搜索成本从 AFlow 的 86.45 美元降到 76.78 美元,但 HotpotQA 与 DROP 上更贵;三个迁移对的平均迁移遗憾从 3.43 降到 2.80。

启示与展望

该结果面向以验证集反馈驱动、评估成本高昂的 LLM 工作流搜索场景,适用于数学推理、代码生成与问答三类基准任务,并可与不同执行模型搭配使用。方法默认臂大小为 5、初始种群 10、最多 30 轮融合、候选臂上限 200,且要求至少有 10 个初始父代;若部署中初始父代更少,需要先扩展初始化或明确填充与掩码约定。对角 LinUCB 的轻量更新使臂打分与在线更新成本较低,适合在验证执行预算受限时使用;论文也给出前序预测记录、冻结档案多臂探针与匹配预算端到端对照等可证伪诊断,供后续在相同协议下检验选择质量。

正文多处数值在表格中给出而正文占位缺失,例如第 5 节正文中 AFlow 与 DAGO 的宏平均分、搜索开销降幅以及若干消融差值未在正文数字中呈现,需要以表格为准。论文自身指出对角近似同时改变拟合系数与探索项,探索项是探索代理而非校准置信区间,且加性表示不建模父代之间的交互;附录 A 明确不声称次线性遗憾,并指出在报告的配置下数值界可能相对基本界是空洞的。测试分数是同一验证选中工作流的三次执行均值,而非独立优化运行,因此运行间方差未被刻画。MBPP 与 HotpotQA 各出现一个 0.0 分节点,说明生成与运行期格式检查仍是开放问题。跨任务迁移与推理成本比较仅覆盖部分任务对与三个测试集,扩展到更多任务类型与更大父代池时的表现仍待观察。

来源