COSMI用单物体动作捕捉合成22.2万段多物体交互数据,并训练出可生成1至5个物体的扩散模型
相关研究与后续进展核心概要
COSMI提出把单物体人-物交互片段按接触一致性切分、镜像平衡左右手、再用语言模型与几何检查筛选可同时发生的组合,从而把单物体捕捉合成为多物体交互数据,得到22.2万段序列、275小时、最多5个物体的数据集(约为最大多物体捕捉数据集的近三十倍);并训练一个文本驱动的扩散Transformer,物体槽位共享权重、物体相对驱动它的身体关节预测,在留出未见物体与五种未见组合的基准上,其文本对齐与接触精度优于HIMO及多物体改造版MDM、PriorMDM,在未见物体上优势最大。
深度剖析
提出以“交互是局部的”为前提的数据合成方法:从单物体捕捉中抽取接触一致的原子片段,把执行交互的肢体连同其物体转移到另一具身体上,从而由单物体数据组合出多物体交互。 此前多物体全身交互数据集受限于组合式昂贵的采集成本,规模停留在十小时以下,而单物体采集已达21.8小时;该工作把数据量从“录制时间线性增长”变为“随片段组合式增长”。 以13条交互规则(按必须接触与不得接触的身体部位、姿态约束、局部参考关节定义)逐帧判定接触(距物体表面5厘米以内),取至少3秒的连续窗口,共得1,491个原子片段,镜像后为2,663个;组合结果经语义与几何可行性检查保留。
构建COSMI数据集:221,677段序列、275小时动作、59名受试者、36个物体(其中7个为铰接物体),每段最多5个物体,左右手比例平衡在49/51。 规模约为最大多物体捕捉数据集的近三十倍,且不依赖特定源数据集,可通过增加规则而非重新录制来扩展,手-物记录在拟合身体后也可作为源片段进入流程。 用HUMOTO的指标在合成序列与其父录制上对比:脚部滑动不变,人体jerk上升五分之一至近一半,物体jerk与穿透的变化幅度小于各捕捉数据集彼此之间的差异。
提出COSMI方法:单一文本条件扩散Transformer,物体槽位共享输入输出投影、不含与物体数量相关的参数,因此一个模型可生成1至5个物体(含铰接与穿戴物体),并以部件分配头预测驱动每个物体的关节,物体相对该关节表达。 此前的多物体生成器或按物体数量分别训练模型、或填充固定状态、或分多个阶段生成,且未显式指明哪个身体部位驱动哪个物体;该工作以单阶段、单模型覆盖可变物体数量并显式绑定驱动关节。 模型30.4M参数(介于MDM的20.7M与PriorMDM的39.6M之间),在单张RTX 5090上训练8小时;消融显示辅助损失影响最大(去掉后脚部滑动翻倍、时间接触精度下降17个点),部件分配同时改善文本对齐与接触精度。
在留出未见物体(黑色椅子)与五种未见交互组合的基准上,COSMI与基线都能泛化到未见组合,而COSMI在文本对齐与接触精度上最优,且在未见物体上优势最大。 该基准按组合而非按受试者划分,测试的是多物体模型真正需要泛化的对象;基线在未见物体上损失4至8个点的时间接触精度,COSMI则保持在整体测试集数值1个点以内。 测试集35k序列、训练集187k序列;每个测试序列按完整长度生成三次;在HIMO数据集上重训后,COSMI在两个层级上取得最高top-3 R-precision,三物体层级上FID也最优。
启示与展望
该工作面向需要多物体全身交互数据的动画、具身智能与增强现实场景,其数据构造适用于持续性的单次交互,可同时发生或按顺序发生;组合规则建立在统一到性别中立SMPL-X、30fps、共同坐标系的身体之上,因此任何落在该身体上的片段都能通过一条规则进入流程,AMASS行走序列即以此方式加入。方法层面,COSMI面向1至5个物体(含铰接与穿戴物体)的单阶段文本条件生成,训练与评测在作者构建的基准上进行,该基准留出一个未见物体与五种未见组合。作者指出,合成序列可驱动任何以SMPL-X为锚的虚拟人,并演示了在配准为SMPL-X+D的着装扫描上渲染合成序列、把手中物体重新附着到扫描的手上。
合成序列继承父录制的采集质量,作者报告人体jerk在部分来源上上升五分之一至近一半,物体jerk与穿透的变化幅度小于各捕捉数据集彼此之间的差异,这些量级如何影响下游训练尚待更广的验证。铰接物体的铰链运动幅度偏小(扫掠比为0.665),未见黑色椅子偶有相对身体放置不当,作者将其归因于训练中出现的座椅类物体均无扶手。方法侧,接触一致性引导缩小了手指与物体之间的间隙,但手指动作精度尚未达到专用抓取合成的水平;文本作为接口只固定物体与动作,不指定人的路径或顺序动作的时序。此外,本次可读材料为论文正文与附录文本,图表本身未直接呈现,因此部分定性对比与失败案例的细节只能依据文字描述转述。
