跳到主要内容
返回时间线
arXiv来源发表:

PROWBench用170个可回放程序化世界检验视频模型:代理条件模型实体定位更强,但30秒长时程与多视角身份绑定仍普遍失守

核心概要

该工作提出PROWBench,用170个程序化构建的剧集、200个选定相机视角与600段同步代理视频,把可回放的世界状态与带时间戳的引擎事件作为真值,评估视频模型能否忠实渲染程序指定的场景结构、规则与交互,并引入Logic-Render Alignment与Interaction Success Rate两项基于VLM的指标,结果显示代理条件模型在实体控制上明显优于仅受相机条件控制的模型,但长时程记忆、多视角身份与外观绑定仍是未解问题。

AI-generated editorial illustration: ROWBench: Do Video Models Render What the Program Specifies?

深度剖析

PROWBench把可执行世界与视觉生成分开评估:数据引擎记录实体状态与带时间戳事件(包括相机视野之外的事件)作为可回放世界记录,再渲染出同步视角与代理表示,使生成视频可以对照程序执行的可见后果来检查。 既有基准多评估视觉质量、可控性、指令或物理遵循,但缺少可回放的实体状态与时间戳事件记录,因而只能判断视频是否合理,无法判断它是否与程序实际执行一致;PROWBench补上了这一对照层。 论文报告170个程序化剧集、200个选定视角、600段代理视频,共37,500个视角级相机帧观测与112,500个代理视频帧,合计62.5分钟代理视频时长;每个选定视角提供coarse 3D、CWM proxy与Colored-OBB三种同步表示,部分剧集提供同步多视角观测。

论文提出两项基于VLM的指标:Logic-Render Alignment衡量引擎提示中每个时间线段规定的动作是否在其时间窗内被可见地呈现,Interaction Success Rate则要求引擎登记事件的预定动作与预期结束状态同时被判定存在才算成功。 全局相似度无法判断某个规定交互是否被成功执行,这两项指标把评估从画面合理性推进到时间线与事件实现层面,并给出按实体定位加权的gISR与gLRA变体。 ISR对每个事件用Qwen3.6-27B查看事件窗口附近采样的八帧(含全帧上下文与引擎定位裁剪);LRA对每个时间线段用十二帧加相邻描述作上下文;表项按样本等权平均,避免事件多的样本获得更大权重。

主赛道结果显示,接收代理条件的模型在实体控制上明显优于只接收相机轨迹的相机条件世界模型:Verified-FF中LynnReal-Omni、MiniMax-H3与CWM的BBox IoU分别为0.518、0.494、0.454,而四个相机条件世界模型仅0.303–0.351;Unverified-FF中LynnReal-Omni与MiniMax-H3为0.457与0.409,相机条件模型为0.204–0.255。 论文用同一记录世界状态轨迹派生的配对代理表示,在固定场景演化下隔离表示与视角的影响,并给出类别层面的配对比较,而非跨模型、跨数据集的混杂对比。 类别均值在40个Verified-FF场景中的38个、89个Unverified-FF场景中的87个里更高;配对符号检验给出相应显著性;相机控制差距则小得多,多数方法旋转误差与位姿估计器在引擎渲染上的误差相当。

挑战赛道显示长时程与多视角仍是开放问题:30秒设置下BBox IoU仅0.175–0.280,离场后重现实体的Reappearance IoU仅0.053–0.131;多视角设置中接收身份着色框或首帧的方法达到82.2–94.0的Appearance Compliance与81.0–89.7的Cross-view Consistency,而使用灰色coarse 3D代理且无首帧的C2R仅为32.2与25.5。 论文把长时程记忆与跨视角身份一致性作为独立评估维度,并指出几何一致性与参与者身份一致性并不等价,几何指标不能作为身份一致性的可靠代理。 长时程设置含十个30秒记录、每记录一个相机;多视角设置含十个四人场景、每个四个同步第三人称跟随视角并独立生成;论文同时说明状态持久性仅覆盖每种方法17–21个事件且评判器未校准,因此这些数字指示倾向而非稳定排名。

启示与展望

该基准面向可编程世界模型的渲染保真度评估:适用于已有程序化世界记录、需要检验生成视频是否按时间线实现引擎事件的场景,主要使用者是构建游戏引擎式世界模型与生成式渲染器的研究者。其数据引擎可扩展,可在共享状态记录上新增场景布局、动作与视觉表示,并复用已记录剧集生成对齐的多视角与多表示观测,而无需重跑行为控制器。主赛道针对五秒短片,挑战赛道针对30秒长时程与四人四视角同步场景;论文也说明Verified-FF对应智能体已有概念图或角色设定的情形,Unverified-FF对应只有世界状态、文本与控制信号的情形。

论文自述若干范围限制:ISR、LRA与外观指标依赖尚未与人工标注校准的VLM评判器;相机指标继承位姿估计器的误差,该估计器在引擎渲染上也达到相应误差水平;Unverified-FF集合由MiniMax-H3输出策展且所有首帧由MiniMax-H3生成,可能对其有利;挑战赛道集合较小,各含十个记录或场景。长时程状态持久性仅覆盖每种方法17–21个事件,且窗口链接协议各不相同(例如Seedance 2.5额外接收上一窗口的最后一帧),因此该部分衡量的是各方法实际协议下的端到端长时程保持,而非孤立的内部记忆。此外,代理本身的设计仍是开放问题:输出有时过于贴近输入几何而继承低多边形代理的粗糙形状,盒代理则未指明哪段描述外观属于哪个实体,朝向也可能被反向渲染。

来源