跳到主要内容
返回时间线
arXiv来源发表:

WorldAuditBench 用 213 个任务测多模态智能体查 3D 世界异常,最好模型 42.3%、人类 83.4%

核心概要

作者构建了 WorldAuditBench——覆盖 13 个 Unreal Engine 5 与 Three.js 环境、五大异常族共 213 个任务的交互式 3D 世界审计基准,并比较单模型 VLM 智能体与两阶段 VLA–VLM 审计器,结果显示 VLM 智能体成功率 28.2%–42.3%、两阶段审计器 6.6%–17.4%,均远低于人类 83.4%。

AI-generated editorial illustration: WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

深度剖析

论文提出并公开了 WorldAuditBench:213 个任务分布在 13 个交互式 3D 环境中(Unreal Engine 5 承载 126 个任务,Three.js 承载 87 个),每个任务植入一个预先定义并标注的异常,覆盖静态物理、交互物理、空间一致性、时间一致性、语义一致性五个异常族,共十五个类别。 既有基准要么在固定观测上评测视觉推理(如 Video-MME、GlitchBench、VideoGameQA-Bench、VideoGlitchBench),要么评测交互式任务完成(如 SimWorld、UnrealZoo、EmbodiedBench、OpenEQA),FlySearch 虽含异常搜索但主要针对位置异常物体;WorldAuditBench 把“主动取证”本身作为任务核心,纳入只有通过交互、改变视角或隔时重访才能暴露的异常。 任务全部由作者手工构造,先选定无缺陷场景并规定探索区域、起始位姿与可用交互,再通过扰动植入异常;每个任务附带场景描述、真值异常类别与评测 rubric。人工校验由未参与构造的评审在浏览器界面中完成,只有至少两名不同评审对同一任务版本给出 Pass 才被接受,Fail 或 Uncertain 会触发修订与复审。

在两种审计范式下评测五个前沿模型,VLM-only 智能体成功率 28.2%–42.3%,两阶段 VLA–VLM 审计器 6.6%–17.4%,人类基线为 83.4%。 论文把“动作”与“视觉推理”是否耦合作为变量:VLM-only 智能体可在推理中决定下一步动作,两阶段范式则先用 VLA 采集固定轨迹、再由 VLM 离线分析,因此后者的中间观测无法反过来指导探索。结果显示耦合式审计整体更优,说明用观测指导后续探索有助于收集验证疑似缺陷的证据。 VLM-only 范式给 40 步环境动作预算,VLA–VLM 范式用 Open-P2P 1.2B 采集 60 秒模拟探索、每 0.5 秒采样一次观测,轨迹在不同 VLM 主干间共享。成功由 GPT-6 Astra 作为 VLM 裁判按任务 rubric 判定;论文报告该裁判与人类判断的总体一致率为 91.72%(Unreal Engine 92.86%,Three.js 90.00%)。人类基线由约十名计算机科学博士生完成,每任务两人评测、限时十分钟。

消融与分解分析定位了差距来源:VLA 探索难以抵达异常位置,而 VLM 智能体的记忆工具与任务提示显著影响发现率。 论文把失败拆成“异常是否被暴露”和“暴露后是否被识别”两步,而不只报告一个总分。几何覆盖率上 VLM 智能体为 91.1%、VLA 探索器为 47.4%;人工评定的暴露率为 68.1% 对 34.7%。在两者都被几何覆盖的任务上,VLM 智能体成功率 38.5%、两阶段审计器 26.0%;在人工判定已暴露的任务上为 62.1% 对 47.3%。 在 126 个 Unreal 任务上以 Gemini 3.8 Flash 做控制消融:起点靠近异常使 VLM 成功率从 33.3% 升至 38.1%、VLA–VLM 从 5.6% 升至 7.1%;预算减半时 VLM 降至 23.0%、VLA–VLM 降至 4.0%;去掉上下文示例后 VLM 降至 31.0%,再去掉异常类型提示则降至 15.9%,VLA–VLM 降至 2.4%。多异常实验中,锚点异常成功率在一、二、三个异常条件下分别为 42.9%、42.9%、47.6%,但全部找齐的比例仅为 3/42 与 2/42,目标召回率 29.8% 与 29.4%。

启示与展望

这项工作面向在交互式 3D 世界中研究智能行为的研究者与仿真/游戏 QA 实践者,适用场景是智能体以第一人称在有限预算内探索、交互并提交带证据的异常报告。它提供的是评测协议与基线:任务配置、评测代码与可运行环境包计划按相应许可发布,因此后续工作可以在同一 rubric 下比较新的审计策略、记忆机制或探索规划方法。论文也把“知道要找什么”作为可操作变量——异常类型提示比上下文示例影响更大,这为设计任务提示与课程提供了直接依据。

论文报告的成功率来自特定模型与工具链组合(每个模型搭配各自的 CLI 与共享 MCP 接口),换用其他主干或工具集时数值可能变化;两阶段范式使用固定录制轨迹,其表现部分取决于该轨迹的覆盖情况。多异常实验显示锚点异常成功率随异常数量变化不大,但全部找齐的比例很低,说明在固定预算下多目标审计的取舍仍是开放问题。时间一致性异常在所有模型与范式下成功率都不高于 12.5%,这一族为何特别困难、需要何种记忆或重访机制,论文尚未给出答案。此外,本次可读文本中部分表格的模型名称与完整数值以占位形式呈现,若需逐模型逐族的精确数字,应查阅原文表格。

来源