DeformSmith:用物理测试台把文本或单图变成可抓取的可变形资产
核心概要
DeformSmith 提出一个分层智能体框架,从文本或单张图像出发,依次构建几何、物理模型、材料行为与机器人交互,并通过共享的物理测试台用仿真探针和机器人抓放反馈反复评估与修正,在 39 个案例的评测中其资产的视觉质量与物理合理性优于 PhysGen3D、PhysGM 与 PhysX-Omni 等基线,同时可产出可回放的机器人操作数据。
深度剖析
提出 L0–L3 的分层构建流程:L0 重建网格、高斯外观与凸分解碰撞代理并对齐到统一坐标系,L1 初始化粒子位置、体积、质量与接触条件,L2 用 MPM 仿真探针选择 neo-Hookean 材料的杨氏模量、泊松比与阻尼,L3 用机器人抓放反馈修正动作与材料。 此前的单图物理生成方法(如 PhysGen3D、PhysGM)主要从静态输入推断交互式物理表示,而这里把几何、物理模型、材料与机器人交互拆成有先后依赖的层级,并要求后续层在保持前层已确立量的前提下做修正。 方法描述完整,含四层结构、接触速度修正与摩擦力公式、以及反应力估计式;消融显示分层相对扁平化把资产交付率从 83% 提升到 93%、独立物理测试通过率从 80% 提升到 87%,且仿真调用次数相当(13 对 13.7)。
构建共享的物理测试台(harness),由 LLM 扮演 Planner、Designer、Critic,Prober 执行几何检查与仿真,Orchestrator 按契约做规则校验,在可编辑字段、参数边界、硬性门槛与修订预算内接受或退回候选。 把仿真证据直接接入生成循环,使材料参数不再是一次性推断,而是被探针观测后反复修订;消融中材料目标满足率从 40% 升至 73%,硬失败率从 17% 降至 7%,平均每个资产 14 次构建调用。 消融在独立于候选筛选的形变与恢复测试上评估,两个变体从同一物理模型与初始材料提案出发;作者也指出增益同时反映了结构化反馈与额外仿真投入。
把机器人抓放纳入生成闭环:L3 规划接近、闭合、抬升、搬运、释放与撤离,用接触与形变观测诊断动作、材料与数值问题,并记录机器人指令、粒子状态、接触观测与任务结果,失败尝试也作为带标签的诊断证据保留。 基础物理探针无法覆盖抓取、搬运与释放中的行为,这里用任务级反馈补充,并要求材料改动回到 L2 重新验证后再在同一指令计划、物理模型与力预算下由机器人确认。 消融使用 6 个资产、每个 5 个留出条件,抓放成功率从 40% 升至 67%,材料通过率从 67% 升至 83%,联合成功率从 27% 升至 57%;资产与动作在留出评估前冻结。
在 39 个案例(30 个文本驱动、9 个来自 PhysGen3D 公开项目资产的图像驱动)上与基线比较,物理真实感 0.70、照片真实感 0.58,均比最强基线 PhysGen3D 高 0.24,语义一致性 0.82 对 0.80;40 名参与者对匿名随机左右配对输出评分,胜率在物理合理性 68%–75%、视觉质量 88%–96%、语义一致性 63%–76%。 评测同时使用 GPT-6 Astra 自动评分与盲测人类偏好,并采用匹配输入图像与统一交互描述(四分之一物体高度的五秒重力下落、30 fps、双视角)。 比较在共享交互描述与相同物理时长下进行,自动评分不提供方法标签;作者明确说明这些结果评估的是所测交互下的感知质量,并未确立材料参数精度。
启示与展望
该工作面向体状可变形固体,流体与颗粒材料不在范围内;结果适用于所测交互设定,即四分之一物体高度的五秒重力下落与仿真抓放,作者也说明其评估的是感知质量而非材料参数精度。对读者而言,这提供了一条从文本或单图到可仿真、可抓取资产的路径,并附带验证记录与可回放交互数据;作者提出可把生成结果作为初始化,与 DeformMaster、EMPM 等观测驱动方法结合,用 RGB-D 视频中的三维点轨迹约束材料参数细化。
材料参数精度未被确立,作者指出从文本或图像推断的物理参数需要真实世界验证;当前接触为近似建模,复杂可变形物体的覆盖有限。评测中的自动评分与人类偏好都基于所测交互与感知标准,换用其他任务、物体类别或接触条件时结论是否保持,仍需进一步观察。此外,本次读取为全文,但图 2 至图 5 的具体画面内容只能依据正文描述理解。
