PhysVista 用“看—推理—评估”闭环测 16 个 VLM:感知尚可,物理推理与可信度打分明显掉队
核心概要
PhysVista 提出一个把物理状态感知、物理动力学推理与物理可信度评估串成闭环的基准,同时纳入真实视频与 AI 生成视频,并在 16 个 VLM 上评测,结果显示模型在可观察状态感知上表现相对较好,但在物理动力学预测、反事实推理以及细粒度可信度打分与排序上明显不足,且真实视频上的表现普遍优于生成视频。
深度剖析
PhysVista 把物理智能评测组织成“看—推理—评估”的闭环,联合评测物理状态感知、物理动力学推理和物理可信度评估三个阶段。 论文指出既有基准多只覆盖闭环中的孤立阶段:PhysBench 偏感知层,多数物理推理基准只覆盖有限任务且主要停留在事件级,PAI-Bench 覆盖感知与推理但缺少最后的评估环节。PhysVista 把三者放在同一框架内,并区分事件级推理与尺度级推理。 论文以表 1 的任务类型对照说明覆盖差异,并给出各阶段子任务定义与数据构建流程;附录列出各任务样本量,如 Spatial 200、Localization 200、Camera 200、Scale 60、Uncertainty 180、Order 150、Mechanism 192、Violation 224、Prediction 135、Counterfactual 119、Critique 100、Score 200、Comparison 100。
基准同时纳入真实世界视频与 AI 生成视频,并据此发现模型在生成内容上的系统性泛化差距。 论文指出早期基准多为仿真环境,近期工作开始引入真实视频,但对 AI 生成内容的物理评测“largely unexplored”。PhysVista 用 WISA-80K 的真实视频与 VideoPhy-2 的生成视频构建任务,并在评估阶段把真实视频统一赋为最高可信度分 5。 论文报告在多数任务上真实视频准确率高于生成视频,其中 Physical Uncertainty Awareness 与 Physical Dynamics Prediction 的差距明显扩大;例外是 Quantitative Scale Estimation,生成视频上略高于真实视频,作者给出的可能解释是生成视频的几何布局更干净、物体配置更受控。
在 16 个 VLM 上的评测显示,感知、推理、评估三阶段之间存在能力排名不一致的“认知鸿沟”。 论文不是只报告单一总分,而是通过跨阶段排名变化说明强感知不等于强因果推理、强机制推理不等于能校准可信度。 论文举例称 GPT-5.2 与 Kimi K2.5 在 State Perception 上分列第三、第四,但在 Dynamics Reasoning 上相对排名大幅下降;Gemini 3.1 Pro 与 Doubao Seed 2.0 Pro 在 Physical Dynamics Reasoning 上分列第三、第四,但在 Physical Plausibility Assessment 上表现下降。表 2、表 3 给出各模型分项与平均准确率,例如 GPT-6 Sol 感知平均 68.59%、推理平均 62.68%,Claude Opus 5.5 推理平均 67.89%。
可信度评估任务暴露出“分数塌缩”与配对比较中的过度自信两类行为模式。 论文把评估阶段拆成单视频 1–5 分打分与视频对排序,并分析打分分布与不同配对类型的难度差异,而不只给出一个准确率数字。 论文报告部分模型(如 Qwen3-VL-8B、Kimi K2.5)把大量预测集中在最高分档,另一些模型(如 Gemini 3.1 Pro、Grok 4)把默认分移向最低档;具备真实打分能力的模型在生成视频与真实视频之间呈现分布分离。配对比较中,真实 vs 生成最容易,生成 vs 生成明显更难,真实 vs 真实准确率低,反映模型难以识别“等价”情形。
启示与展望
该基准面向需要判断动态场景物理一致性的研究者与模型开发者,尤其是要评估生成视频物理真实性的场景。它把评测组织为感知、推理、评估三阶段,并区分事件级与尺度级推理,因此适合用来定位模型在闭环中具体哪一环薄弱,而不是只给出一个总分。真实视频与生成视频并列的设置,使结果可直接用于比较模型在两类数据源上的表现差异。
论文报告的是特定基准与特定模型集合上的结果,模型版本与访问时间在参考文献中标注为 2026 年,读者需注意评测结论与具体模型版本绑定。分数塌缩等现象被描述为模型相关,其成因被归为对特定分数 token 的先验差异,这一解释仍是开放问题。生成视频上 Quantitative Scale Estimation 反而略好,作者给出的是可能解释而非定论。此外,正文提到更详细的基准统计在附录,若只读正文可能看不到完整的数据分布细节。
