Physis-Lang 用自演化物理语言改写视频世界模型:开源 Cosmos3-Nano 在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1
核心概要
Physis-Lang 把物理语言当作数据筛选、模型训练与视频生成共享且可优化的表示,用物理感知评论器与 PhysCapBench 驱动的智能体循环迭代改进物理描述指令,并用语言引导检索补齐模型缺失的物理过程,在 Wan 与 Cosmos 骨干的四个物理视频基准上取得一致提升,其中基于开源 Cosmos3-Nano 的模型在 Physics-IQ Verified、PhyGround、PhyGenBench 上超过 Veo 3.1。
深度剖析
论文提出把语言本身作为物理世界表示,而不是把语言仅当作语义条件、再额外引入视觉、潜变量、数值或规划信号。 既有工作多假设自然语言不足以承载可靠生成所需的物理知识,因而补充几何、运动、物理正确性等辅助信号;该工作重新审视这一假设,让语言显式描述物理实体、原因、相互作用、支配原理、时间演化与结果。 论文以方法设计与消融支撑这一主张:物理推理提示在不微调时把预训练模型从 61.67 提升到 63.33,说明语言侧的结构化本身即可带来零样本增益。
构建 PhysCapBench 与物理感知评论器,把物理过程拆成原子断言,用精确率与召回率评估字幕,并驱动智能体循环迭代改进字幕指令。 PhysCapBench 含 246 段物理视频、3,794 条人工核验的物理断言,平均每段 15.4 条;评论器把生成字幕拆成可独立验证的断言并判定正确、错误或不确定,召回率则衡量人工断言是否被覆盖。 在固定 20 段视频的开发集上迭代,PhysCapBench 的 F1 从第 1 轮的 78.64 升到第 9 轮的 87.82;仅更换推理字幕(骨干固定)时 PhyGenBench 从 64.17 依次升到 65.63、65.83、67.29。
语言引导的数据引擎把模型失败总结为类别级缺陷画像,再用物理标签匹配检索视觉多样但覆盖缺失物理过程的视频,重新配以自演化物理字幕加入训练集。 与仅按视觉相似度检索不同,该检索按物理内容而非外观选片,使训练分布向生成器已观测到的物理弱点倾斜。 加入检索视频后四个基准平均提升 3.01 分;按物理类别拆解 VideoPhy-2 时,化学过程 +8.00、断裂力学 +7.45、布料形变 +7.19 等常见类别均为正增益。
在 Wan2.1-14B 与 Cosmos3 系列(Edge-4B、Nano-16B、Super-64B)上微调后,物理合理性一致提升,且基于开源 Cosmos3-Nano 的模型在三个基准上超过 Veo 3.1。 论文报告跨模型家族平均提升 7.05(Wan2.1-14B)与 6.22(Cosmos3-Nano-16B)分,跨规模提升 3.24、6.22、5.02 分;在 VideoPhy-2 全集上以 68.02 比 68.87 落后 0.85 分,但在 Hard 子集上以 62.36 比 58.43 领先 3.93 分。 四个基准分别为 PhyGenBench、VideoPhy-2(T2V)与 Physics-IQ Verified、PhyGround(I2V),统一评分协议,并把 VideoPhy-2 与 PhyGenBench 的离线 VLM 评估器替换为 GPT-5.5;VBench-I2V 上 Wan2.1-14B 由 86.86 到 87.51、Cosmos3-Nano 由 88.32 到 88.69,通用生成质量未见下降。
启示与展望
该工作面向需要物理合理性的视频世界模型研发者与部署方,适用于文本到视频与图像到视频生成,以及驾驶与机器人场景的演示;其收益来自物理字幕、语言引导检索与推理期正负提示的组合,可在不改动骨干架构与训练目标的前提下叠加到 Wan2.1 与 Cosmos3 系列,并通过 PhysThinker-C 与 PhysThinker-U 以本地 4B 模型替代商业模型,把估计的外部标注成本从 24.12K 美元降到 0.12K 美元乃至零。
PhysCapBench 的 246 段视频与 3,794 条断言、开发集的 20 段视频与 273 条断言规模有限,其覆盖范围是否足以代表更广的物理现象仍是开放问题;VideoPhy-2 与 PhyGenBench 的评估器被替换为 GPT-5.5,分数与原始榜单的可比性、以及评估器自身偏差的影响值得继续观察;PhysThinker 蒸馏后平均增益从 7.05 降到 4.76 分,精度与成本之间的取舍在不同部署预算下如何权衡尚待更多场景验证;物理语言表示能否扩展到更长时序、多物体耦合与交互式仿真,也仍是待探索的方向。
