StoryEngine 用显式“故事世界状态”约束多镜头视频生成,在 60 个故事基准上把锚点跨切持续率提到 0.9389
核心概要
该工作提出 StoryEngine,一个把“权威语义计划”与“不可靠的生成像素”分离的状态驱动智能体框架,通过故事状态传播、落地渲染规划和有界评估修复循环生成多镜头长视频,并在自建的 60 个故事基准上、以 Veo 3.1 与 Wan2.2-TI2V-5B 两个视频骨干,在叙事实现、跨镜头连贯与视觉一致性等全部指标上优于 ViMax、MovieAgent 与无规划器的 Direct I2V 基线。
深度剖析
StoryEngine 把故事世界状态显式化:用结构化表示记录反复出现实体的位置与故事相关属性,把叙事事件转成显式状态转移,并据此确定每个镜头的预期起始与结束状态。 此前的智能体流程多用松散结构的文本分镜描述,或以已生成帧/片段作为后续镜头的条件,缺少传播事件后果的显式机制;该工作让镜头的开场状态来自计划的状态轨迹,而不是从可能有误的生成像素中反推。 论文给出状态归约与校验的形式化定义,并说明事件按叙事顺序处理、无状态变化的事件不改变状态,且每次更新后校验实体引用、位置关系与属性域;消融中移除该阶段(w/o SSP)使 Avg 下降 0.0142,SPS 下降 0.0307,APR 下降 0.0278。
落地渲染规划为反复出现的实体与环境构建规范参考(角色身份表、有状态道具的按状态参考、环境全景图),选择与动作相关的机位,并把状态、机位与视觉约束编译成可执行的渲染计划。 该工作把“必须为真”的语义契约翻译成生成器可直接执行的镜头级契约,按 start、motion、end、always 分阶段标注判据,使视觉条件从计划的状态轨迹中选取,而不是按每个镜头的措辞重新生成。 论文描述了资产筛选(身份/布局判据、无未请求文字或人物)、全景图六向探针,以及判据归一化;消融中移除该阶段(w/o GRP)造成最大降幅,Avg 从 0.7690 降至 0.7119,GPC 与 LCS 分别下降 0.1074 和 0.1411。
连续性感知生成通过单向“证据闸门”决定前一个镜头的尾帧是复用、部分参考还是弃用,并用有界评估引导修复循环在固定重试预算内纠正局部状态不一致。 已有系统反复把生成像素当作后续上下文,可能把错放物体或损坏细节当成新的叙事事实;该工作让前序像素只能在与下一镜头预期开场状态兼容时提供条件,且永远不能改写状态轨迹或编译好的判据。 论文给出复用/参考/新鲜三种模式的确定性解析策略与单调回退顺序,并说明 UNKNOWN 不被当作 PASS;消融中移除该阶段(w/o SCVC)使 Avg 降至 0.7251,并在三个组件消融中取得最低的 ECS、APR 与 MIR。
作者构建了 60 个故事、三个诊断套件(N20 叙事实现、T20 跨镜头连贯、C20 视觉一致性)的基准与八项指标,StoryEngine 在两个骨干上均取得全部七项视频指标的最佳成绩。 该基准在生成前固定评测目标,使失败可定位到具体镜头与剪切点,并配有内容哈希冻结、方法不可见的标注表;指标覆盖计划事件覆盖、事件完成、锚点持续、状态推进、地点遵循、几何地点一致、最小身份保持与光照连贯。 论文报告 StoryEngine 的 Avg 在 Veo 3.1 下为 0.7690、在 Wan2.2-TI2V-5B 下为 0.7372,分别比最强基线 ViMax 高 0.1416 与 0.1304;APR 提升至 0.9389 与 0.8444,LAR 至 0.9800 与 0.9749,LCS 至 0.5691 与 0.5372,而所有基线的 LCS 都在 0.21 至 0.27 之间。
启示与展望
该框架面向有明确实体、地点与镜头计划的叙事型长视频生成,适用于需要跨镜头保持因果推进与视觉身份的制作场景,例如分镜驱动的短片或广告式内容;其收益在较弱视频骨干上更明显,说明显式渲染判据与修复循环对生成质量不稳定的后端更有价值。对研究者而言,它提供了一套可复用的评测思路:在生成前固定评测目标、用冻结标注与干扰事件约束判断,并把计划文本与视频指标分开报告。
论文自述的开放问题包括:权威计划一旦出错便无法由后续视觉证据自动纠正,结构校验能发现矛盾但覆盖不了所有常识或文化错误;规范参考与全景图并不构成真正的三维场景,大视角变化、严重遮挡、镜面、透明物体、可变形道具、人群与精细手物接触仍属困难;兼容的端点也不能证明中间运动在物理上成立。评测方面,基准为英文、虚构、无音频,每故事 10 个镜头、两个地点、一至两名角色,未覆盖多地点长叙事、多人互动、对白与音频连贯、口型同步、屏幕文字与交互式编辑,光照对比也只在地点之间标注。此外,SPS 在所有方法上仍低于 0.67,不可逆状态推进被作者列为待解挑战;指标解读上,PEC、ECS、APR、SPS、LAR 与 GPC 的地点门依赖 VLM 判断,而该 VLM 与 StoryEngine 的循环内评估器为同一模型,尽管输入不同,共享偏好仍可能影响这些指标,MIR 与 LCS 不涉及 VLM。本次读取为全文,但表格中的逐项数值未在文本中完整展开,因此各指标的具体分项对比只能依据正文叙述。
