跳到主要内容
返回时间线
arXiv来源发表:

AutoRef 用编码智能体自动改写 harness,把冻结的 FLUX.2 [klein] 4B 在四参考图 MultiBanana 上从 5.72 提到 7.37,追平 Nano Banana Pro 与 GPT-Image-1.5

核心概要

AutoRef 让一个编码智能体在不更新图像生成模型与推理模型参数的前提下反复改写 harness 代码,并把用于提出改进的任务与用于挑选候选的任务分开、以集束搜索延续排名靠前的 harness,由此得到的 AutoRef-Harness 把开源 FLUX.2 [klein] 4B 在 MultiBanana 四参考图留出测试集上的平均分从 5.72 提升到 7.37(满分 10),与 Nano Banana Pro、GPT-Image-1.5 等专有模型相当或更好,并在不重新优化的情况下迁移到不同参考数量、不同基准与评测器、不同生成器和不同推理模型。

AI-generated editorial illustration: AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation

深度剖析

AutoRef 把 harness 优化本身当作搜索对象:图像生成模型与推理模型全部冻结,只有指定参考图如何被解读、提示如何构造、候选如何生成与评估、最终图像如何被选出的可执行程序被改写。 此前的 harness 优化方法(如 Meta-Harness)主要面向数学、代码等可用离散标签或可执行测试验证的任务,而图像生成依赖带噪的视觉评估、标量分数难以诊断失败原因;AutoRef 针对这一差异重新设计了搜索流程。 论文给出 harness 优化的形式化目标(式 2、式 3),并说明优化只作用于模型外围的可执行代码,可改变提示、生成、评估、选择与控制流。

AutoRef 将用于提出改进的任务与用于挑选候选的任务分离,并用集束搜索保留在验证集上排名靠前的多个 harness 作为下一轮父代。 Meta-Harness 让提出者读取全部历史并在同一批任务上排序候选,Greedy Search 只保留单个最优 harness;AutoRef 同时引入训练—验证分离与多父代集束,以缓解对搜索任务和评测器噪声的过拟合。 在相同生成器、推理模型与评测器下,AutoRef 在留出测试集上得到最强 harness,其次是 Greedy Search,再次是 Meta-Harness;Meta-Harness 与 Greedy Search 的最终 harness 每任务分别生成 4.2 与 5 张图,而 AutoRef-Harness 为 3 张,且 AutoRef 的第二名 harness 仍优于两者的最终 harness。

搜索得到的 AutoRef-Harness 由四个可分离组件构成:参考图锚定的提示、结构上不同的两份草稿、针对具体抱怨的修订、以及先数硬失败再做成对判断的失败感知选择。 与人工编写的 harness 相比,它把每一步都针对多参考图特化并串联起来:每个提示把请求的每个元素指派到对应参考图,两份草稿在提示结构而非仅采样上不同,抱怨会指明所涉参考图,选择先统计缺失参考图等硬失败。 逐项消融显示移除结构多样草稿(7.37→7.01)、抱怨导向修订(→6.99)或失败感知选择(→6.93)都会降低平均分;仅做参考图锚定提示(单图)得 6.91,接近使用三张图的 IPR(7.02),仅做选择得 6.15,接近 Best-of-3(6.01),而没有任何部分组合能达到完整 harness 的 7.37。

AutoRef-Harness 的收益不依赖搜索时使用的具体配置:在参考数量、基准与评测器、生成器、推理模型改变后仍能提升表现。 搜索只在四参考图 MultiBanana 训练/验证划分上进行,测试划分在搜索期间不可见;迁移测试覆盖三参考与五参考设置、从未用于搜索的 OmniContext 及其官方 GPT-4.1 评测器、FLUX.2 [klein] 9B 与 Qwen-Image-Edit-2511 等生成器,以及开源 Qwen3-VL-32B 推理模型。 四参考留出测试集 5.72→7.37;三参考 6.94→7.76、五参考 5.19→6.36;OmniContext 上 FLUX.2 [klein] 4B 由 8.30 提升到 8.85;换成 Qwen3-VL-32B 后仍由 5.72 提升到 6.90;人工评估中相对基础生成器胜率 70%(负 17%),对 FLUX.2 [klein] 9B 为 64% 对 24%,对 Seedream 4.5 为 63% 对 27%,对 Nano Banana Pro 为 46% 对 40%。

启示与展望

这项工作面向多参考图生成这一具体任务,适用于希望在不重新训练生成模型的前提下提升现有模型组合效果的场景,例如广告、虚拟试穿与内容创作中需要分别指定人物、物体、服装、背景与风格的控制需求。它使后续工作可以在冻结模型上继续优化提示构造、候选生成、诊断与选择等环节,也提示 harness 优化与模型权重优化(如 DyRef 微调)可以叠加使用。论文释放了 AutoRef 实现与 AutoRef-Harness,并给出数据划分与固定模型版本,便于在相同协议下复现与扩展;作者也提出评测器与提出者均可替换,更强的视觉语言模型与编码智能体、以及结合分割模型等更丰富的评测器是可能的方向。

搜索以单一视觉语言模型评测器的分数为目标,虽然论文报告该 harness 迁移到 OmniContext 及其 GPT-4.1 评测器,但评测器本身的偏好如何影响最终 harness 的结构仍值得继续观察。harness 只改变冻结生成器的使用方式,因此当生成器本身在给定参考数量下几乎不产生可接受图像时(如 Qwen-Image-Edit-2511 在五参考设置下,硬失败检查在 96 个任务中有 87 个判定三份草稿全部不合格),更好的选择无法补偿,论文也指出突破这一限制可能需要减少生成器一次需要组合的参考图数量。此外,人工评估使用四名评分者、每个基线 50 个任务,定性示例是按基础生成器与 AutoRef-Harness 分差最大挑选的,并非随机样本,因此这些示例用于说明被消除的失败类型而非总体分布。搜索规模为五次迭代、集束宽度与候选数量固定,更大预算或不同提出者会带来什么变化,论文将其列为可探索方向。

来源