MaLiang-Harness 用可执行程序生成图像与视频:GPT-6-Astra 在两个基准上达成 100% 生成成功,图像 96.0%、视频 76.9% 满足全部质量阈值
核心概要
该工作提出 MaLiang-Harness 框架,把 MLLM 驱动的图像与视频生成组织为“构建—检查—修订”的持续过程,用持久可执行生成状态、可追踪生成过程和修订感知编辑与验证三项机制共享同一修订参照,并在 MaLiang-IBench(50 个文生图提示)与 MaLiang-VBench(13 个文生视频提示)上评测 11 个与 4 个闭源 MLLM,测得 GPT-6-Astra 在两个基准上生成成功率均为 100%,96.0% 图像任务与 76.9% 视频任务满足全部质量阈值。
深度剖析
论文定义“程序到视觉(P2V)差距”,即程序执行正确但输出违反所要求的构图、外观或运动,并据此把视觉程序生成表述为有状态的构建、检查与修订过程。 此前可执行视觉表示相关工作(如 VISPROG、Design2Code、BlenderAlchemy)证明程序可以中介视觉理解与构建,本文把这一前提扩展为跨多个渲染后端、围绕持久作品状态的图像与视频统一生成流程。 该定义由框架设计与评测共同支撑:成功生成与满足视觉要求被分开度量,例如 GPT-5.6-Luna 与 GPT-5.6-Terra 各成功生成 50 张中的 46 张,但满足全部三项质量标准的分别只有 22 与 24 张。
框架由三项机制组成:持久可执行生成(PEG)状态保存程序、资产、任务要求、当前计划与修订索引;可追踪生成过程(TGP)把操作、执行结果与渲染证据关联到具体修订;修订感知编辑与验证(REV)支持恢复历史内容并在交付前重新检查当前修订。 与直接视觉合成范式(扩散、流匹配)不同,该路径不依赖扩散或流匹配过程,而是由 MLLM 规划并生成绘制与动画代码,由渲染后端(如 Canvas、SVG、Scene2d、Three.js)产出图像或视频。 机制在正文中以状态、操作与评审的形式化定义给出,并通过定性案例展示,包括路径追踪后端下的静物场景、超写实风格笔触细化,以及六面板研究插图的构建记录。
在 MaLiang-IBench 上,GPT-6-Astra 生成成功率 100%,50 个任务中 48 个满足全部质量标准;GPT-6-Sol 与 GPT-6-Luna 分别为 46 与 44;GPT-5.6-Sol 为 43。 结果把“生成成功”与“满足视觉要求”区分为两个不同指标,并显示三个 GPT-6 模型所有成功生成的图像都达到美学与构图阈值,剩余质量失败集中在提示遵循上。 评测覆盖 11 个模型、50 个文生图提示,质量由 GPT-6-Sol 以 1–5 分对提示对齐、美学、构图打分,阈值计数以全部任务为分母;成本方面 GPT-5.6-Sol 每张合格图像 3.28 分钟,Astra 为 3.70 分钟。
在 MaLiang-VBench 上,GPT-6-Astra 生成成功率 100%,13 个任务中 10 个满足全部四项阈值;GPT-5.6-Sol 成功 7 个、满足全部阈值 5 个;Kimi-K2.6 完成 3 个但无一满足全部标准;DeepSeek-V4.1-Flash 未完成任何任务。 视频结果把运动一致性识别为最受限的维度:Astra 全部 13 个视频达到美学阈值,但只有 10 个达到运动一致性阈值;同时 token 预算耗尽只解释了部分失败(DeepSeek 13 次失败中的 5 次、Kimi 10 次中的 1 次、GPT-5.6-Sol 6 次中的 3 次)。 视频评测由单一评审者基于原始提示与 12 帧按时间排序的采样完成,覆盖四个模型共 23 个成功视频,评审未正式盲化,运动一致性衡量采样帧中可见的推进,不建立逐帧流畅性。
启示与展望
该框架面向需要显式空间与时间控制的程序化图像与视频创作,适用于可接入 Canvas、SVG、Scene2d、Three.js 等渲染后端并允许 MLLM 迭代规划与改码的场景;对希望检查构建历史、比较修订证据并保留早期版本的用户,PEG、TGP、REV 提供了共享的修订参照。评测结论适用于 MaLiang-IBench 的 50 个文生图提示与 MaLiang-VBench 的 13 个文生视频提示,以及所评测的 11 个与 4 个模型配置。
成本列在不同模型间采用不同聚合规则(如 Kimi 的 Time/Task 为成功任务中位数、token 统计按成功任务数平均),因此效率比较描述的是所评测配置而非统一口径;图像质量均值只覆盖成功生成,DeepSeek 与 Kimi 的均值基于 6–20 张的有限子集,Kimi-K3 的 4.56 对齐分仅基于 9 张图像;视频评审由单一评审者完成且未正式盲化,运动一致性不建立逐帧流畅性;通用能力对比使用公开指数分数,其中 DeepSeek-V4-Pro 的公开分数对应检查点与所评测检查点的一致性未经验证,因此该分析刻画的是关联而非能力效应的隔离;超写实方向仍属探索,论文指出需要受控比较才能确立更丰富渲染后端对感知真实感的贡献,且细化过程可能停滞,机制本身不保证有效修正。
