WiSPER 用姿态监督预训练加残差流细化,把 WiFi CSI 多人 3D 姿态估计的 MPJPE 降到 63.72 mm
核心概要
WiSPER 是一个两阶段框架:第一阶段 PAMEL 在同一 CSI 可见上下文上把 JEPA 式掩码隐变量预测与辅助姿态集合监督耦合,引导编码器从部分观测定位关节;第二阶段 ReFT 用粗坐标和逐关节解码特征条件化的残差流细化姿态候选。在 PiW3D 上整体 MPJPE 为 63.72 mm,相对 WiFi-JEPA 降低 40.0%,二人与三人分别降低 42.1% 和 38.1%。
Figure 1 : Our WiSPER consists of 2 stages: Stage 1, PAMEL, combines masked latent prediction with auxiliary pose supervision on visible CSI context. Stage 2, ReFT, uses the pretrained encoder and a pose Transformer to generate coarse pose candidates, then refines them through conditional residual flow guided by their coordinates and joint features. Residuals from H H sampled trajectories are averaged, scaled by σ \sigma , and added to each coarse pose.
arXiv深度剖析
PAMEL 把姿态集合监督与掩码隐变量预测放在同一可见 CSI 上下文上联合优化,使编码器在部分观测下同时支持跨链路预测与关节定位。 此前 WiFi-JEPA 的掩码隐变量预训练不使用姿态标注,而该工作在有配对标注时把姿态监督引入预测式预训练。 消融显示姿态监督配置误差低于纯 CSI 的 JEPA:PAMEL 加细化后整体 MPJPE 为 63.72 mm,纯 CSI JEPA 加细化为 92.24 mm,仅姿态预训练加细化为 65.15 mm。
ReFT 以候选的粗坐标和逐关节 Transformer 特征为条件,用端点参数化的残差流对姿态候选做条件修正。 结构化层级姿态 Transformer 的剩余坐标误差被显式建模为条件残差,而非仅依赖直接回归输出。 在三种预训练配置下启用已训练残差细化器,整体 MPJPE 分别降低 15.6%、14.6% 和 13.8%;作者指出这支持在已评估模型内使用细化器,但未确立其优于直接残差回归。
在 PiW3D 上,WiSPER 在单人、双人和三人观测中均取得低于 WiFi-JEPA 的误差,且误差随人数增加而上升。 该工作把单人改进扩展到多人 CSI 姿态估计,并给出同一本地协议下的多人对比。 单人 49.42 mm 对 81.20 mm,PCK@0.2 从 74.26% 升至 89.07%;双人 63.76 mm 对 110.10 mm,三人 81.65 mm 对 131.93 mm。
流采样配置的精度并不随积分步数单调提升。 在同一检查点上改变轨迹数与 Euler 步数,用于刻画细化器的采样行为。 单轨迹单步为 64.71 mm,主配置(8 轨迹、5 步)为 63.72 mm,32 轨迹为 63.33 mm,而 8 轨迹、10 步为 63.98 mm。
启示与展望
该结果面向使用 WiFi CSI、且训练时可获得配对 CSI 与 14 关节姿态标注的室内多人姿态估计场景,推理阶段只需 CSI。它使在视觉不可用或不宜采集可识别影像的环境中进行多人骨架恢复成为可能,例如康复与运动监测类应用。评估基于 PiW3D 的 89,946 训练帧与 7,824 测试帧,覆盖七名志愿者、八种动作与三个室内环境;作者说明训练与测试帧来自同一批录制记录的不同时间片段,因此该评估不构成对未见参与者或环境的泛化结论。后续工作方向包括跨环境与未见参与者的泛化评估,以及通过独立预训练的 CSI 表示与人体姿态先验减少配对监督。
结果来自单次训练运行,未评估训练种子间的波动;报告的匹配姿态误差不评估人数判定准确率;评估使用共享录制的时间切分,未见参与者与环境的泛化以及推理延迟留待后续研究。消融中 PAMEL 与仅姿态预训练在损失权重上不同,作者说明该比较不能隔离掩码隐变量预测的贡献;PAMEL 在双人与三人上更好,而仅姿态预训练在单人上略优(49.36 对 49.42 mm)。此外,GraphPose-Fi 的 622.38 mm 是作者为九条 CSI 链路与 14 关节图所做的本地适配结果,作者说明它刻画的是该适配而非其已发表性能。
