arXiv 2026年10月2日COSMI提出把单物体人-物交互片段按接触一致性切分、镜像平衡左右手、再用语言模型与几何检查筛选可同时发生的组合,从而把单物体捕捉合成为多物体交互数据,得到22.2万段序列、275小时、最多5个物体的数据集(约为最大多物体捕捉数据集的近三十倍);并训练一个文本驱动的扩散Transformer,物体槽位共享权重、物体相对驱动它的身体关节预测,在留出未见物体与五种未见组合的基准上,其文本对齐与接触精度优于HIMO及多物体改造版MDM、PriorMDM,在未见物体上优势最大。COSMI提出把单物体人-物交互片段按接触一致性切分、镜像平衡左右手、再用语言模型与几何检查筛选可同时发生的组合,从而把单物体捕捉合成为多物体交互数据,得到22.2万段序列、275小时、最多5个物体的数据集(约为最大多物体捕捉数据集的近三十倍);并训练一个文本驱动的扩散Transformer,物体槽位共享权重、物体相对驱动它的身体关节预测,在留出未见物体与五种未见组合的基准上,其文本对齐与接触精度优于HIMO及多物体改造版MDM、PriorMDM,在未见物体上优势最大。COSMI用单物体动作捕捉合成22.2万段多物体交互数据,并训练出可生成1至5个物体的扩散模型COSMI提出把单物体人-物交互片段按接触一致性切分、镜像平衡左右手、再用语言模型与几何检查筛选可同时发生的组合,从而把单物体捕捉合成为多物体交互数据,得到22.2万段序列、275小时、最多5个物体的数据集(约为最大多物体捕捉数据集的近三十倍);并训练一个文本驱动的扩散Transformer,物体槽位共享权重、物体相对驱动它的身体关节预测,在留出未见物体与五种未见组合的基准上,其文本对齐与接触精度优于HIMO及多物体改造版MDM、PriorMDM,在未见物体上优势最大。COSMI提出把单物体人-物交互片段按接触一致性切分、镜像平衡左右手、再用语言模型与几何检查筛选可同时发生的组合,从而把单物体捕捉合成为多物体交互数据,得到22.2万段序列、275小时、最多5个物体的数据集(约为最大多物体捕捉数据集的近三十倍);并训练一个文本驱动的扩散Transformer,物体槽位共享权重、物体相对驱动它的身体关节预测,在留出未见物体与五种未见组合的基准上,其文本对齐与接触精度优于HIMO及多物体改造版MDM、PriorMDM,在未见物体上优势最大。