跳到主要内容
返回时间线
arXiv来源发表:

ReImaGin 把图像生成当作多模态推理工具,在六项视觉推理任务上比纯文本推理与专用视觉工具基线最高提升 25%

核心概要

该工作提出 ReImaGin,一个免训练的多模态智能体框架,让多模态大模型在推理循环中调用一个自由形式的 generate_image 工具(由指令跟随的图像生成模型驱动),在深度感知、拼图补全、遮挡计数、碰撞预测、多视图空间推理与路径追踪六项任务上,一致优于纯文本推理与固定专用视觉工具基线 Visual Sketchpad,路径追踪提升最高达 25%,遮挡计数相对提升约 40%,并显示有效的视觉推理策略可通过提示优化自动发现。

AI-generated editorial illustration: Reasoning with Image Generation

深度剖析

ReImaGin 用单个指令跟随的图像生成模型替代固定专用视觉工具集,作为多模态大模型推理循环中的自由形式视觉操作接口。 此前工具增强方法(如 Visual Sketchpad)依赖裁剪、深度估计、目标检测等预先实现的窄操作,无法执行开放式生成或变换;ReImaGin 的 generate_image 接受自然语言提示,可完成去除遮挡、由多个不连续视角生成房间平面图等操作,且无需任务特定训练。 论文在六个任务上使用同一个图像生成模型(主模型 Nano-Banana-Pro),并给出碰撞预测任务的完整推理轨迹示例:智能体先调用 generate_image 画出从机头出发的前向向量并圈出首个被撞物体,再据此读出答案。

在六项视觉推理任务与三个多模态大模型骨干上,ReImaGin 一致优于纯文本推理与专用视觉工具基线。 论文报告路径追踪提升最高 25%、遮挡计数相对提升约 40%;在拼图补全上 Visual Sketchpad 甚至低于无工具基线(GPT-5 下 16.7% 对 29.5%),说明需要生成能力的任务上固定专用工具难以奏效。 结果覆盖 Gemini-3.1-Pro、GPT-5 与开源 Qwen-3.5-27B 三个骨干,指标为多选准确率(遮挡计数用 sMAPE),取 3 个随机种子的均值与标准误;消融实验把 generate_image 替换为原样返回输入图像的空操作,在保持提示、工具定义与代码环境不变的情况下六项任务全部下降,路径追踪与拼图补全降幅最大。

生成图像的保真度与最终答案正确率强相关,且可通过测试时缩放提升。 论文对六个任务各人工审核约若干张生成图像,发现多数生成是忠实的,忠实图像下答案正确率明显高于不忠实图像;在空间推理任务上对生成图像重复采样并由多模态大模型选出最忠实的一张,使 Gemini-3.1-Pro 从 51.0% 提升到 59.0%,Qwen-3.5-27B 从 42.0% 提升到 54.3%,而文本推理过程未变。 该相关性被作者明确标注为相关性而非因果;测试时缩放实验提供了补充证据,因为额外算力只花在图像采样上。其余五项任务生成样本方差很小,因此未应用测试时缩放。

有效的视觉推理策略可以自动发现,并可在不同多模态大模型之间迁移。 此前策略由人工编写的上下文示例指定,需要逐任务人工投入;论文把策略发现问题化为对智能体提示的迭代搜索,由提议模型根据训练集上的成功与失败轨迹生成候选提示、在开发集上评估并筛选。自动发现的策略常与人工设计相似(如深度任务学会生成深度图、碰撞任务学会沿运动方向画箭头),并恢复人工策略的大部分收益。 在 Gemini-3.1-Pro 与 Nano-Banana-Pro 组合下,自动策略在五项任务上均超过无工具基线并一致超过无策略设置;在 Qwen-3.5-27B 与 Nano-Banana-2 组合下五项中四项超过无工具基线(MMSI 持平)。把 Gemini 发现的提示原样迁移给 Qwen 后,在碰撞、空间推理与路径追踪上仍优于 Visual Sketchpad 与无策略设置,但在遮挡计数与深度上收益减弱。

启示与展望

该框架面向需要空间与物理直觉的多模态视觉推理任务,适用于希望在不做任务特定训练的前提下为多模态大模型增加开放式视觉操作能力的研究者与工程团队;其收益随底层图像生成模型能力提升而扩展,论文也显示开源生成模型在局部编辑类变换上已具竞争力。策略自动发现适用于有少量训练与开发样本、且策略可通过提示表达的任务,论文报告的一次性发现成本约为每任务 214 美元。

论文正文表格中的具体数值在本次加载的文本中多为空白,因此除摘要与正文明确写出的数字(如路径追踪最高 25%、遮挡计数相对约 40%、空间推理 51.0% 到 59.0% 与 42.0% 到 54.3%、拼图补全 16.7% 对 29.5%、深度 94.6% 对 91.7% 对 99.2%)之外,逐任务逐模型的完整对比无法在此复述。生成图像保真度与答案正确率之间的关系被作者标注为相关性,仍需更严格的因果验证。自动发现的策略在路径追踪上因额外着色而略低于人工策略,MMSI 的复合策略未被当前搜索设置恢复,说明策略搜索空间与生成模型可靠性仍是开放问题。此外,评测任务规模有限(如 BLINK 验证集 124 例、CAPTURe 随机 100 例、MMSI 共 100 例、路径追踪程序生成 100 例),向更大规模与更真实场景的推广仍需观察。

来源