LEGO-Anything 让编码智能体用 Blender 代码重建单图三维场景,GPT-6-astra 室内得分 53.4%、室外 39.6%,LEGO-Plugin 再把六个模型最多提升 62.7%
核心概要
该工作提出 LEGO-Anything 图像到代码框架,让通用编码智能体通过反复编写、执行和修改 Blender 程序,从单张图像重建可执行、可检查、可编辑、可查询的三维场景程序,并配套推出由 104 个室内外场景渲染出 208 张图像的模拟器基准 LEGO-Bench,分别评估产物有效性、可见表面几何与渲染外观;在受评智能体中 GPT-6-astra 取得最强总体结果(室内 53.4%、室外 39.6%),但有效产物与几何、外观保真之间仍有明显差距,轨迹分析指出初始化薄弱、迭代中的回退编辑与不可靠的自我评估三类反复出现的问题,据此设计的免训练插件 LEGO-Plugin 在 Office 子集上提升全部六个模型、总体得分相对
深度剖析
把单图三维重建重新表述为“图像到代码”:智能体不是一次性预测场景,而是交替编辑代码、执行 Blender、检查场景与渲染并修订程序,最终提交可执行的场景程序及其导出与渲染视图。 与网格、点图或对象集合等固定三维输出,以及由感知、重建、资产检索、场景装配组成的模块化流水线相比,这一表示让对象、几何、布局与相机显式化,从而可以像代码一样运行、检查、编辑和查询。 论文以形式化定义给出该设定,并说明智能体在 Blender 中产生中间程序、场景与观测构成的构建轨迹;图 2 以 GPT-6-astra 轨迹为例展示该工作流。
LEGO-Bench 用模拟器渲染的 208 张图像(来自 104 个场景、8 个环境、17 个主题、443 个注册资产)做端到端评测,并把有效性、可见表面几何与渲染外观分开打分。 既有基准或聚焦对象与部件级建模,或以文本而非图像指定世界,或依赖标定多视角室内观测;LEGO-Bench 面向单图、场景级、可执行重建,并覆盖室内外与可控难度。 基准由 LychSim 与 Fab 资产构建,候选场景经碰撞与稳定性检查及人工审核;评测在相机坐标系中不做对齐或缩放地比较可见表面,外观则由评测方重新渲染提交场景后按像素误差比例计算,并附有人类一致性研究(总体兼容一致率 86.6%,人机兼容 83.7%)。
受评编码智能体普遍能交付有效产物,但几何与外观保真明显落后;GPT-6-astra 总体得分最高,为室内 53.4%、室外 39.6%,且难度上升主要损害保真而非可执行性。 结果把“能否交付可评测产物”和“能否忠实恢复场景”区分开来:六个 GPT 配置有效性接近饱和,而总体得分从 GPT-6-astra 到最强的 GPT-5.6 配置差距显著;基线中 Gen3DSR 的几何重建高于 GPT-6-astra 却不产生可评测外观。 主表报告三次运行的均值与标准差;随难度从 Easy 到 Hard,有效性保持稳定而总体得分下降,室外几何重建下降最陡。
轨迹诊断发现弱初始化、迭代中的回退编辑与不可靠自我评估三类问题,据此设计的免训练插件 LEGO-Plugin 通过增强初始化、版本控制与基于参考的细化,在 42 例 Office 子集上提升全部六个模型,相对增益最高 62.7%。 插件以 MCP 工具、工作流技能与运行时钩子形式接入现有 harness,不引入独立规划器,也不访问私有基准真值,仅使用参考图像;增益与基础性能呈反向关系,最弱智能体受益最大。 诊断显示 GPT-5.6-sol 有 29.6% 的编辑使得分下降、最终提交比最佳中间场景低 3.2 分;36 组构建者—评判者配对中,自评在几何上与确定性指标方向的一致率接近或低于随机水平。
启示与展望
这项工作面向从单张 RGB 图像出发、以可执行 Blender 程序为输出的场景重建,适用于希望获得可检查、可编辑、可查询三维产物的研究者与系统开发者;LEGO-Bench 的模拟器渲染管线允许用户用自有场景与资产扩展评测用例并保留自动评分,LEGO-Plugin 则以 MCP 工具、技能与运行时钩子的形式接入现有 harness,不改变智能体作为规划者、Blender MCP 作为场景编辑器的分工。LEGO-World 的读出面向把冻结场景当作自然图像表示的下游视觉任务,其结论限定在 GPT-6-astra 无插件重建的场景上。
需要留意的是,LEGO-Plugin 的评估只在 42 例 Office 子集上进行,其相对增益最高 62.7% 来自该子集,跨室内外全量基准的表现尚待观察;LEGO-World 的检测与分割采用等置信度协议,因为场景导出不提供标定置信度,因此 AP 应被理解为固定排序下的兼容性诊断;深度比较为相对深度,且 LEGO-Anything 在 100 张图像中有 99 个质量有效输出,与直接基线存在覆盖差异。此外,主表汇总了 90 个地面室外视角与 10 个鸟瞰视角,鸟瞰部分在附录中单独作为压力测试报告,未纳入配对难度分析。
