跳到主要内容
返回时间线
arXiv来源发表:

EvolvingAvatar 让 3D 头像在对话中边生成边学习,OOD-Hard 上表情统计失配最多降 11.1%

核心概要

EvolvingAvatar 提出一种因果式交互 3D 头部生成器,在推理时用测试时训练从用户人脸视频与双方音频中自适应,通过 Dyadic Context Prediction 自监督目标、持久快权重与瞬时下颌适应来生成说话与倾听动作,并配套发布 455.95 小时的 InterHead-Bench 基准;实验显示其对话动作统计优于强基线,在最难的分布外划分上随对话推进而改善,与录制用户—头像表情统计的失配从第一个区间起最多降低 11.1%。

AI-generated editorial illustration: EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold

深度剖析

提出 EvolvingAvatar:一个在交互过程中进行测试时训练的因果生成器,无需部署时的目标动作标签,也无需预计算的用户 FLAME 轨迹。 既有生成器把到来的观测当作上下文但参数固定,作者指出这使对话模式未被用作学习信号;该工作把对话本身当作自监督适应信号,在生成过程中调整“上下文到动作”的映射。 论文给出任务形式化、区域结构化因果 FLAME 编解码器与自适应生成器的完整设计,并在附录 E 记录架构、训练目标与流式推理细节;消融中“No write”使 ID 表情 P-FD 由 16.79 升至 21.09,支持在线更新确有贡献。

Dyadic Context Prediction 用用户视频与双方音频构造自监督内目标,持久快权重在整段对话内累积更新以引导动作生成,瞬时下颌适应则响应当前发音,预测的说话活动控制持久适应如何影响动作。 相比仅用头像音频、双方音频或双方音频加估计用户动作的既有条件化方式,这里把适应状态分为跨区间保留与单区间丢弃两条路径,并用活动门控调节适应项。 匹配检查点对照显示:相对 No write、Freeze-1、No carry,完整 TTT 在 ID 上把表情 P-FD 分别降低 20.4%、4.2%、8.6%;但颈部 P-FD 相对 No write 上升 8.9%,作者说明 DCP 并不直接约束各区域的动作统计。

发布 InterHead-Bench:由单视角与双视角对话视频统一构建的 455.95 小时基准,含对齐的多模态标注与跨分布的说话/倾听评估。 dialog3d-factory 把两种录制格式统一为同一时间线,保留重叠语音与静默,并组合参数空间、网格空间指标与人类评分。 数据来自 Seamless Interaction 与 RealTalk 录制,划分为 Train、Dev、ID、OOD、OOD-Hard,共 455.95 小时交互与 4,365 个来源参与者 ID;作者同时说明这些元数据 ID 并不构成全局唯一人物标识。

实验显示对话动作统计改善,且在最难分布外划分上随对话推进而改善,人类评分在分布偏移下更偏好该方法。 作者把“与单条录制响应的一致程度”和“感知到的对话质量”区分开来:DualTalk 在 MSE 与 LVE/MHD 上更低但动作覆盖(SID)更小,而 OOD-Hard 上对 DualTalk 的总体真实感偏好为 86%。 OOD-Hard 上说话/倾听 FDD 为 19.09/18.13,对比 ARTalk 的 20.91/19.84;五个等长区间内表情 P-FD 在 OOD 与 OOD-Hard 上分别下降 2.7% 与 7.1%,而四个基线在 OOD 上变差;对 UniLS 的偏好由 ID 的 58% 升至 OOD 的 66% 与 OOD-Hard 的 72%。

启示与展望

该结果面向交互式 3D 头部生成这一设定:输入是因果到达的用户人脸帧与双方音频,输出是 106 维 FLAME 动作(表情、颈部姿态、下颌姿态),时间按 200 毫秒区间划分,流式执行在第五帧到达后输出五帧,带来 160 毫秒缓冲延迟,且所有状态在对话之间重置。它使研究者可以在统一时间线上比较说话与倾听、跨分布评估动作统计与感知质量,并让“在对话中学习”成为可测量的对象。作者把潜在应用指向虚拟导师,以及由人类临床医生共同参与、提供心理健康支持的头像;同时说明录制对话无法捕捉用户对生成动作的反应,实时交互中的持续学习、区分稳定表达习惯与暂时情绪反应、以及临床医生引导下评估感知支持,都是被明确留作后续工作的方向。

需要留意的是,论文自身指出成对误差指标衡量的是与某一条录制响应的一致程度,而一次交互可以容纳多种合理响应,因此 MSE、LVE、MHD 上的优势与感知质量并不等价;UniLS 在 ID/OOD 上仍保持更低的 FDD,说明匹配系数统计并不保证解码后的几何变化同样准确。颈部 P-FD 相对 No write 上升 8.9%,提示 DCP 的适应并不直接约束每个区域的动作统计。下颌流匹配、活动条件与 RGB 对比被作者标注为跨修订的探索性结果,RGB 在 OOD-Hard 上改善表情与颈部统计但在 ID/OOD 上使表情统计变差。人类偏好中 UniLS 的趋势被作者描述为描述性,因为三个不确定区间都包含等偏好。此外,本证据包为全文文本,图表以表格形式给出,图 6 等图形内容无法直接核验,若需确认区间曲线与偏好区间的具体形态,仍需查阅原文图表。

来源