InFlowOp 用一套无标签成本同时决定任务拆分与故障修复,在 Braid 上比单智能体最高提升 11.97%
核心概要
该工作提出 InFlowOp,用一套无需标签的成本(智能体能力与子任务需求的匹配程度,对比该智能体的运行开销)在执行前双向决定任务分解粒度与智能体分配、在执行中定位并就地修复故障,并配套提出要求多智能体协作的 Braid 基准,在八个领域、六个骨干模型上相对单智能体基线最高提升 11.97%,其中在流内优化带来 9.64%。
深度剖析
InFlowOp 把工作流的构建与运行统一到同一个无标签成本之下:构建阶段由 Coalesce 做双向、成本驱动的原子合并,决定分解粒度与智能体分配;运行阶段复用同一成本矩阵,把每个子任务声明的输入输出条件与实际产出比对,判定故障归因于分配还是分解,并按成本从低到高依次尝试重新分配、重新分解。 既有做法把分解粒度固定在模板、提示或预设步数中,或只针对任务本身自适应;故障定位通常需要参考答案、评分结果或训练好的评估器,修复单位是整个工作流(重执行、重搜索或重训练)。该工作把创建新智能体、分配、分解都放进同一个搜索与同一套定价里,并在执行中就地修复。 论文给出成本矩阵、信用矩阵、成本有序阶梯与作用域恢复的形式化定义,并说明修复只有在子任务重新执行且未满足条件被清除时才提交,否则回滚,因此“tempering can improve a workflow, but never leaves it worse than the one construction produces”。
论文提出 Braid 基准,其任务被设计为需要超出单智能体能力的多智能体协调:每个任务由多个问题组成,并额外提供不服务于任何问题的干扰源,且不说明哪个源对应哪个问题;任务以分布式(每个问题各有金标源)与锚定(所有问题共享一个金标源)两种方式组合,并施加分离、路由、泄漏、可答性四项质量控制。 论文指出既有工作流多在单模型基准上评测,而这类任务单个强智能体已能解决,重复采样即可获得协调带来的大部分收益;已有的强调协调的基准多由环境强加分工(状态分区、工具拆分、知识隐藏),而非任务本身要求分工。 Braid 建立在十个公开数据集之上,覆盖文档、幻灯片、金融、图表、数学、物理、科学、代码八个领域,构成十四个 Braid 数据集上的十九个评测臂,每个臂仅用于评测并继承原数据集的测试侧;论文报告了各臂的题目数量统计。
在八个领域、六个骨干模型(Qwen3.5-4B/9B 与 GPT-5-mini、GPT-5.4-mini、GPT-5.4、GPT-5.6-luna)上,InFlowOp 相对单 LLM 基线最高提升 11.97%,在匹配轮次预算下相对单智能体基线最高提升 9.64%;在 Qwen3.5-9B 上,单智能体为 17.38、贪心搜索为 15.49、Coalesce 为 22.21、Coalesce 加流内为 23.80、完整 InFlowOp 为 25.13。 论文用同一组 Braid 臂上的对照说明增益并非来自“拆分任务”本身:贪心构造的工作流反而低于单智能体基线,而按成本决定拆分则反超;同时增益超过单纯换更大骨干模型带来的提升,例如 InFlowOp 下的 Qwen3.5-4B 达到 20.81,高于单智能体的 Qwen3.5-9B、GPT-5-mini 与 GPT-5.4-mini。 结果以表格形式给出各领域与总体准确率,并说明单智能体基线在相同任务上获得与工作流逐任务匹配的算力预算;论文同时报告增益在图表、数学、金融上最大,在物理上最小,且所有方法在该领域均低于任一骨干模型。
消融显示:用评分量表估计器计算成本优于让 LLM 一次性判断匹配分数;随 Coalesce 动态更新的成本矩阵优于静态矩阵;可动态增长的智能体池优于静态池;智能体画像只有在保留成功记录时才有帮助,把失败也纳入画像反而低于仅用智能体卡片。 这些消融把“成本如何被计算”“池子能否补足缺口”“画像记住什么”分别隔离出来,说明收益来自成本估计能否有效引导原子匹配与合并,以及池子是否能为无人覆盖的原子创建专家。 论文报告了各消融在 Qwen3.5-4B 与 Qwen3.5-9B 等骨干上的具体差值,并指出全局定位在本地流内优化之外启用时反而降低准确率,因此主实验一律采用本地作用域。
启示与展望
该结果面向的是有可核对参考答案、可分解为带契约子任务的任务设定,适用于需要在有限算力下构建并在线修复多智能体工作流的场景,受益者包括智能体系统与工作流编排的研究与工程实践者。Braid 的十九个评测臂、八个领域与六个骨干模型给出了可直接对照的评测面,其分布式与锚定两种组合方式也为后续基准构建提供了可复用的构造流程。
论文自述其评测限于 Braid 中可对照参考答案评分的任务,开放式生成与需要与有状态环境长期交互的任务不在本研究范围内,作者计划在未来扩展到这些设定以及运行中环境会变化的工作流。此外,成本估计依赖智能体卡片与自演化画像,画像中失败记录的处理方式会改变结果,这一点在消融中已有体现但仍值得持续观察;全局定位在本地流内优化之外启用时准确率下降,说明“在哪里找故障”的扩展仍有开放空间。本证据包为全文,包含正文、附录与数据统计表,但部分公式与图表以占位形式呈现,具体数值细节需回到原文核对。
