SolveEdit 用 2728 个场景变换任务测出最强生成模型仅 57.0% SolveScore,两阶段规划器把 GPT-Image-2 提到 71.6%
核心概要
作者提出 SolveEdit 基准,把「视觉问题求解」定义为对给定图像按目标推断并执行有效场景变换、同时保留无关内容,包含 2,728 个案例、10 个领域与 54 个子领域,按决定变换的信息来源分为指令指定(IS)、状态依赖(SD)与规则依赖(RD)三类,并用原子变换契约与 SolveScore 在不依赖单一参考输出的情况下衡量完成度与附带改动;在 9 个图像到图像模型与 2 个图像到视频模型上,最强模型仅得 57.0% SolveScore,且 RD 比 IS 低 17.2 至 23.7 分,缺口集中在必需语义与关系条件;作者进一步提出两阶段视觉规划器 SolveEdit-Plan,在不改动生成器的前提下把 GPT-Image-2 从 57.
深度剖析
论文把「视觉问题求解」形式化为场景变换:给定图像与目标,模型必须推断出有效变换并在同一场景中实现,同时不破坏无关内容,并据此构建 SolveEdit 基准,含 2,728 个案例、覆盖 10 个应用领域与 54 个子领域。 既有评测多隔离感知、抽象推理、生成或「已明确指定」的变换执行,未隔离「所需变换从何而来」;SolveEdit 把变换信息来源本身设为评测轴,分为 IS、SD、RD 三种互不重叠的机制。 案例经固定标注流程与质量审查,要求意图变更可语义检查、证据在图中可见、正确性无需匹配唯一参考、且可与受保护内容分离;图像来源包括 AI 生成 1,375 例、真实照片 646 例、动画与游戏截图 377 例、影视帧 330 例。
论文提出原子变换契约与 SolveScore:每个案例记录必需条件与受保护条件,评分同时衡量完成度并对非预期改动做有界扣分,并给出必需与受保护两侧各三个诊断维度(语义 SA、关系 RA、视觉质量 VQ)共六个诊断分数。 参考图式评分会惩罚与唯一作者输出不同的合法解;契约式评分允许同一变换的多种合法渲染,并把「没做到」与「改坏了」分开报告。 契约清单共 29,460 条原子判据(必需 14,831、受保护 14,629;SA 14,322、RA 10,520、VQ 4,618),每案例平均 10.8 条、中位数 10 条,且每个案例至少有一条受保护判据;评测由 VLM 与固定分配的 SAM、YOLO 检查器共同完成,弃权不重分配权重。
在 11 个系统上,最强模型 GPT-Image-2 仅得 57.0% SolveScore,Seedream 5.0 Pro 为 56.6%、Gemini 3.1 Flash Image 为 55.5%;性能随信息依赖程度下降,RD 比 IS 低 17.2 至 23.7 分,SD 低 7.0 至 8.8 分,且经领域构成调整后缺口集中在必需语义(-25.0 分)与必需关系(-13.0 分),必需视觉质量仅 -5.6 分。 该诊断把失败区分为「解恢复错误」(选错变换)与「视觉执行错误」(变换对但没渲染好),并指出当前失败主要来自前者,而非仅渲染质量。 同一 2,728 案例清单、同一隐藏契约与确定性评分器;GPT-Image-2 完成度最高但附带损伤高于 Seedream(23.9 对 17.6),说明相近总分可对应不同的完成—保留权衡。
两阶段规划器 SolveEdit-Plan 在生成前先实例化变换:Inspect 找出未解析变量并采集定向视觉证据,Resolve 比较候选变换并编译成一次生成调用所需的完成条件与保留义务;在匹配的单次生成预算下把 GPT-Image-2 从 57.0% 提升到 71.6%,比同预算的 Generic Vision Rewrite 高 6.3 分,并迁移到 Qwen-Image-Edit-2509(20.8%→26.9%)与 HunyuanVideo-1.5(7.4%→14.0%)。 该干预直接检验 RQ2 的诊断:若失败主要源于解恢复,那么在生成前显式确定变换应当有效;且规划器无学习参数、不改动编辑器,仅通过指令接口起作用。 匹配比较固定案例清单、输出数量、评分契约与最终生成调用次数;相对 Generic Vision Rewrite,必需完成度从 72.8 升至 75.8,附带损伤从 16.3 降至 8.6;规划每案例两次 LLM 调用,平均 3,207 输入 token 与 635 输出 token。
启示与展望
该基准面向「以改变场景作答」的生成式视觉问题求解,适用于图像编辑与视频终帧评估场景;对视频仅以终帧套用同一契约,用于检验变换契约的跨模态迁移,时间维度的生成不在范围内。规划器面向单次生成调用、编辑器参数不变的设定,其增益在匹配调用预算下成立;对希望在不重训模型的前提下提升场景依赖与规则依赖任务完成度、并减少附带改动的开发者与评测者,这套契约与规划接口可直接复用。
规划带来的提升伴随额外的测试时计算(每案例两次 LLM 调用),等调用次数并不等于等 token 消耗,成本与延迟的核算需结合实现细节;开源图像编辑器与视频生成器的绝对分数仍低(26.9% 与 14.0%),残余错误究竟来自规划还是生成尚未区分;评测主要由 VLM 完成,部分判据由 SAM、YOLO 等工具提供证据并在分歧时追加一次 VLM 调和,弃权会降低证据覆盖度;此外,本次读取为全文,但图表与附录中的逐类别、逐机制与敏感性结果以文字描述为主,具体数值细节仍需查阅原文与发布材料。
