跳到主要内容
返回时间线
arXiv来源发表:

EditHero 用 457 条部件级编辑链评测长程 3D 编辑:LLM 智能体保留未编辑部件更好,但每次编辑需数分钟

相关研究与后续进展

核心概要

该工作构建了 EditHero,一个由数据引擎把库部件装配到已分割宿主物体上、并以 JSON 日志精确重建每一轮目标状态的部件级 3D 编辑链基准,包含 457 条链、2755 次编辑、252 个物体,链长 3 至 30 轮;在自回归自输出协议下评测 4 种非智能体方法(PartFlow、Nano3D、3DEditFormer、VoxHammer)与 6 个 LLM/VLM 智能体,结果显示非智能体方法从第一轮起就常漏掉指令且误差沿链累积,而智能体在未编辑区域保留更好(CC 0.95–0.98 对至多 0.90)、多数指令跟随更好(IF 最高 0.62 对至多 0.36),但单次编辑需约 1.5–6 分钟。

AI-generated editorial illustration: EditHero: A Benchmark for Long-Horizon Part-Level 3D Editing and Vibe Modeling

深度剖析

EditHero 提供带精确逐轮真值的部件级编辑链基准:数据引擎用 add、remove、replace、retexture 四种操作把库部件装配到已分割宿主上,并把每次操作记入 JSON,配合部件库可精确重建任意一轮状态。 既有配对数据集只提供孤立单次编辑,目标来自学习式编辑模型或位姿与语义部件改动,无法判断方法能否在指令序列中保住早先的修改;EditHero 首次在同一资产上按序评测不同的自然语言部件编辑,且每轮都有精确 3D 参考。 经人工复核后包含 457 条链、2755 次编辑、252 个宿主,链长 3 至 30 轮(中位数 6),指令中位长度 17 词;每条链以 JSON 记录被接受操作及其库部件、位姿与纹理,可确定性重建。

在自回归自输出协议下,非智能体方法从第一轮起就常漏掉所请求的修改,且误差沿链累积、未编辑部件持续漂移。 以往评测只做一次干净源物体上的编辑,无法暴露逐轮继承自身输出所带来的退化;该工作用自输出协议让每轮输入都是方法自己的上一轮输出,并单独度量编辑区域与未变区域。 IF 全程仅 0.12–0.32,第一轮就已低至 0.24–0.36;从第 1 轮到第 7 轮 CC0 由 0.60–0.78 降至 0.33–0.67;把每轮输入换成真值上一状态后,第 5 轮对目标的 IoU 由 0.52 升至 0.68(Nano3D)、由 0.36 升至 0.46(3DEditFormer)。

LLM/VLM 智能体采用自下而上方式只改被命名部件,因而在保留未编辑内容上全面优于非智能体方法,多数也更好地跟随指令。 非智能体方法自上而下从学习到的 3D 表示重新生成整个物体,每轮几乎改变资产的每个角落;智能体检查当前网格并写代码只改被命名部件,其余部分按构造保持不变。 在 55 条链、416 轮的共享比较子集上,6 个 LLM 的 CC 为 0.95–0.98,非智能体方法至多 0.90;除 GLM 5.3 Flash 外 IF 均更高,Opus 5.5 达 0.62,非智能体方法至多 0.36;删除最容易(IF 0.88–0.99),添加与替换较难(IF 0.10–0.49 与 0.17–0.52)。

智能体方法在速度上仍不适合交互使用,且从代码构建新几何体依然困难。 该工作把编辑质量与逐次编辑成本一并报告,使智能体路线在保真度上的优势与其时间代价可以同时被看到。 LLM 每次编辑约需 1.5–6 分钟、6–16 次模型调用(中位数),Opus 5.5 为每次编辑 149 秒、10.9 次调用;非智能体方法在本地 GPU 上为 20–50 秒。

启示与展望

该基准面向从带纹理、已做部件分割的宿主物体出发、以文本指令加固定视角目标渲染为条件的多轮部件级编辑,操作限定为 add、remove、replace、retexture 四种,链长 3 至 30 轮。评测在自输出协议下进行,每轮输入是方法自己的上一轮输出,真值状态只用于打分;所有状态共享一个由全部真值状态包围盒归一化的坐标系与 4 个固定视角(1 个条件视角、3 个留出视角),图像指标在 4 个视角上平均。作者表示将公开数据合成引擎与编辑链,供后续 3D 编辑研究使用。

逐轮曲线在第 7 轮后样本缩减到 80 条链,作者据此不对更后轮次下结论;自输出协议下的下降有多少来自后续指令本身更难、多少来自继承的误差,作者用真值输入诊断做了区分,但该诊断只覆盖 Nano3D 与 3DEditFormer 的 200 条链。材料编辑无法由几何指标反映,改用变化像素诊断,其区域比部件定义更窄;Nano3D 没有材料模式,其材料轮被路由到替换模式,因此其材料表现不能按材料准确度解读。智能体评测使用各运行时提供的工具与不同预算,成本以每次编辑的中位时间、token 与调用次数报告。此外,本次可读材料为正文与附录文本,图表本身未随文本给出,涉及具体图号的数值只能依据正文叙述。

来源