REALM 用延迟先验加表情随机细化,把倾听动作从冻结凝视变成会眨眼微笑的机器人反应
核心概要
REALM 提出一个由粗到细的音频驱动反应式倾听生成框架,用带延迟中心注意力先验与自适应门控的 Reactive Gated Speaker–Listener Fusion 融合听者运动历史与说话人音频,再由粗解码器预测基础运动轨迹、由音频条件化的随机残差在表情子空间内细化,在 ViCo 与 L2L 上于多项运动质量指标上优于所评估的基线,并部署到 Ameca 人形机器人上完成感知用户研究。
深度剖析
REALM 把倾听建模为带延迟的反应过程:Reactive Gated Speaker–Listener Fusion 用移位 ALiBi 实现的延迟中心注意力先验,偏好接近名义反应滞后的说话人表征,再用学习到的门控自适应加权对齐后的说话人上下文与听者历史。 既有方法多依赖说话人条件生成、自回归预测或二元表征学习,让模型自行从数据中发现时间关系;REALM 显式引入延迟先验,并把“何时对齐”与“影响多强”拆成两个互补机制。 ViCo 上的延迟敏感性分析显示,8 帧(约 267 毫秒)移位在表情与头部姿态上取得最低误差、FD 与 rPCC,优于 0、4、12 帧设置;消融显示仅加移位注意力可把姿态 rPCC 从 0.026 降到 0.018,但缺少门控时表情 FD 升至 0.68。
框架采用由粗到细分解:粗解码器给出基础运动轨迹,细化模块只在非刚性表情子空间加入音频条件化的随机残差,刚性姿态参数在构造上保持不变。 确定性重建目标容易把多模态局部变化平均成平滑轨迹,而在整个运动空间注入随机性又会扰动稳定的刚性运动;REALM 把随机性限制在表情子空间,作为对离散运动表征与生成式建模路线的补充。 消融显示细化模块单独可把表情 FD 改善到 0.62、表情误差降到 4.11,完整模型为 0.56 与 3.91;由于残差仅作用于非刚性子空间,姿态运动学不受影响。
在 ViCo 与 L2L 两个对话基准上,REALM 在所评估方法中取得最低的表情与姿态逐点误差,并在时间过渡指标上改善最明显。 论文报告表情误差在 ViCo 上从 8.71 降到 3.91,L2L 上为 6.50,优于 ListenFormer 的 8.71 与 13.41,说明随机细化主要改善帧间面部动态而非静态轨迹跟踪。 评估覆盖逐点精度、分布真实性(FD、FID)、说话人–听者相关性(rPCC)与运动变异性四类指标,对比 RLHG、DSPN、L2L、ListenFormer、UniLS 五个基线;论文同时指出 RLHG 在 ViCo 上的姿态 FD 更低(0.72 对 1.01),ListenFormer 在 ViCo 上的表情方差更接近参考分布(0.142 对 0.133)。
生成动作经机器人专用重定向与相对运动校准后部署到 Ameca 人形机器人,感知用户研究显示 REALM 在自然度、音视频同步、情境恰当性与总体偏好上得分最高。 多数生成式虚拟人停留在虚拟环境,REALM 用逆运动学映射、Savitzky–Golay 平滑与相对中性位姿校准,把 3DMM 系数转成机器人执行器控制,并配合眨眼结构分析验证微动态的解剖合理性。 用户研究采用 1–5 分 MOS,方法身份隐藏、顺序随机并嵌入注意力检查;论文报告 REALM 与最强基线的成对分差在 Wilcoxon 符号秩检验下统计显著,模型规模为 1.50M 参数、每次前向 0.02G FLOPs。
启示与展望
该工作面向离线对话窗口的音频驱动倾听动作生成,适用于数字 avatar 与人形机器人面部表达场景,例如远程临场与具身对话代理;对希望复现或扩展的读者,代码与训练脚本已随补充材料提供,附录给出两阶段课程损失、架构超参与评估指标定义。物理部署部分依赖机器人专用重定向管线,包括逆运动学映射、时间平滑与相对机械中性位姿的校准,并配有执行器范围裁剪与安全约束,因此结果适用于具备相应执行器与安全边界的平台。
论文将 REALM 定位为窗口条件生成,并明确不从注意力掩码推断端到端流式保证,因此向流式人机交互扩展需要显式控制时间信息访问与端到端延迟。名义延迟是共享的对齐先验,可能无法覆盖个体差异,作者把情境依赖的延迟先验列为未来方向。物理部署依赖机器人专用重定向管线,跨不同形态扩展需要形态感知映射与逐平台执行器限制验证。此外,ARIG 与 Wang 等人的方法因缺少公开实现未在本文协议下复现,其可比评估仍是待完成的工作;本总结基于论文全文与首页证据包,未包含附录中全部图表细节。
