跳到主要内容
返回时间线
arXiv来源发表:

Adobe Research与KAIST提出FlowTool:把修图工具参数当作条件生成问题,参考指标最高降低L1 28.8%、L2 47.4%,推理延迟至少降50倍

核心概要

Adobe Research与KAIST的研究者提出FlowTool,用条件整流流(conditional rectified flow)直接建模图像与指令条件下的高质量修图工具参数分布,以视觉语言模型骨干加DiT参数生成器和工具存在性预测头替代自回归MLLM的推理与逐token数值生成,在MMArt-Bench、FlowTool-Eval、ArtEdit-Bench和MIT-Adobe5K上参考指标优于专用MLLM编辑智能体与专有MLLM,并在无参考评测中与专有模型相当,同时把推理延迟降低至少50倍、峰值显存降低近2倍。

AI-generated editorial illustration: FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching

深度剖析

把基于工具的图像修图从自回归语言生成重新表述为结构化连续工具参数空间上的条件生成建模,直接建模 p(a | x, c)。 此前工作(如JarvisArt、RetouchIQ等)用MLLM逐token生成推理、工具选择与离散化参数值;本文改为在连续参数空间上做条件流匹配,从而保留参数的连续结构并建模工具参数上的条件联合分布。 论文给出问题形式化:参数归一化到[-1,1],用工具存在性掩码m区分激活工具,并以整流流线性路径与速度匹配损失定义训练目标;作者在引言中给出三点动机(连续数值表示、级联误差、推理开销),属于论证性依据而非消融证据。

FlowTool由VLM骨干、DiT工具参数生成器和工具存在性头组成,用两阶段监督流匹配课程加基于奖励的后训练进行训练。 相对纯模仿专家参数的监督训练,第二阶段用DiffusionNFT式前向过程奖励后训练,奖励由与专家编辑图的负L1参考奖励和VLM-as-a-judge的无参考奖励加权组成,使模型不必精确复制单一专家解。 方法部分给出完整公式(流匹配损失、存在性BCE损失、奖励归一化与正负分支目标);训练数据为内部专家编辑记录加Gemma4-31B合成指令,共496,693条训练样本;消融显示两阶段课程优于仅第一阶段(L1 9.63、L2 18.92、SC 7.73、O 8.50)与仅第二阶段(L1 9.90、L2 20.10、SC 5.99、O 7.42),完整课程为L1 9.37、L2 17.78、SC 7.96、O 8.69。

在四个基准上FlowTool的参考指标显著优于专用MLLM智能体与专有MLLM,无参考指标与专有模型相当。 相对最强专用基线,L1最多降低28.8%、L2最多降低47.4%;相对前沿专有模型,L1与L2最多降低13.0%与21.7%,同时在感知质量上更强、语义一致性保持竞争力;在MIT-Adobe5K上优于所有基线。 结果来自表1在MMArt-Bench、FlowTool-Eval、ArtEdit-Bench、MIT-Adobe5K四个数据集上的对比,含L1、L2、SC、PQ、O以及MIT-Adobe5K上的PSNR、SSIM、LPIPS;FlowTool-Eval为300条内部留出样本,与训练数据无重叠;无参考指标由GPT-5作为评判模型。

直接生成编辑参数带来显著效率收益:延迟至少降低50倍,峰值显存降低近2倍。 自回归智能体可能生成冗长推理与工具调用轨迹,这些token并非最终目标;FlowTool在推理时不需要自然语言推理与数值生成,默认仅用3步ODE积分。 效率对比在NVIDIA A100上从四个基准各抽50例共200例做单样本推理,FlowTool延迟0.19秒,对比基线为9.66秒至32.11秒;本地部署基线峰值显存9.89GB与17.09GB,专有MLLM经API访问故显存不可得;消融显示1步不足、2步大幅提升、3步为最佳平衡,更多步收益很小。

启示与展望

该工作面向由连续参数控制、参数被归一化到统一区间的标准化工具集,作者明确说明当前设计针对“standardized linear parameter spaces, such as parameters normalized to [−100, 100]”。适用对象是需要把自然语言编辑意图转成具体工具与参数值的修图场景,尤其是对交互延迟敏感或部署在资源受限设备上的场景;评测覆盖MMArt-Bench、ArtEdit-Bench、MIT-Adobe5K与内部留出的FlowTool-Eval,训练语料来自内部专家编辑记录并用Gemma4-31B合成指令。作者指出扩展到循环或极值参数(如色相)以及离散或类别参数(如文本选项)是未来方向,这决定了方法目前可覆盖的编辑工具范围。

论文的评测依赖内部专家编辑数据与内部留出集FlowTool-Eval,外部读者无法直接复核该部分数据构成;无参考指标由GPT-5作为评判模型,其评分行为本身是一个需要留意的变量。效率对比中专有MLLM经API访问,显存不可得,因此显存结论主要针对本地部署的专用智能体。消融显示骨干从4B扩到9B并未带来额外提升,这一现象的原因在文中未展开。此外,本证据包为论文全文,但表格与图以文本形式呈现,个别数值的完整对照仍需以原文表格为准。

来源