跳到主要内容
返回时间线
arXiv来源发表:

VoxPolyMem 用交互感知分层记忆与 EG-GRPO 检索策略,在多方言谈记忆基准 VoxPolyBench 上取得 85.0 分,超出最强基线 23.6 分

核心概要

该工作提出 VoxPolyMem——一个面向多方言谈的交互感知多模态长期记忆框架,结合增量说话人识别与由交互记忆、事实记忆、参与者画像构成的分层记忆,并把检索建模为序贯决策,用 Evidence-Gain GRPO(EG-GRPO)按轮次奖励新获得的支撑证据;同时构建 VoxPolyBench(18 个场景、176 个会话、18.9 小时合成语音、1,527 个问答对),VoxPolyMem 在该基准上总分 85.0,超过最强被评估基线 23.6 分,在 Mem-Gallery 与 H2HMem-Multi 上分别得 89.6 和 74.4,均超过最强公开记忆基线 8 分以上。

AI-generated editorial illustration: Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations

深度剖析

提出 VoxPolyMem,把多方言谈的长期记忆拆成交互记忆、事实记忆与参与者画像三层,并用有向交互图记录“谁对谁说了什么”。 既有记忆系统多以时间图与语义抽象组织对话历史,未显式存储交互角色;语音侧工作如 AFA 用声纹区分用户记忆,但不表示共享的多方对话。 论文给出交互图边集定义(说话人与受话人集合)、事实与画像的联合抽取字段,以及消融结果:去掉交互关系后 VoxPolyBench 分数从 84.0 降至 78.6。

把检索表述为序贯决策,检索智能体依据已积累证据改写查询、选择记忆层与检索工具,并用 EG-GRPO 按轮次对“新获得的支撑证据”的覆盖度与排序给予信用分配。 Search-R1 等使用终端答案奖励,Mem-T 的 MoT-GRPO 结合树状展开与证据覆盖奖励;EG-GRPO 在每次动作后、上下文选择之后计算奖励,并排除此前已保留的证据。 在固定记忆、工具与推理预算下比较:EG-GRPO 在三个基准上答案分与召回均领先,Mem-Gallery 上相对 MoT-GRPO 由 87.1 提升到 89.6、召回由 91.5 提升到 93.6,且平均检索轮数为 1.2–1.3,低于 w/o RL 的 1.4–1.7。

构建 VoxPolyBench,覆盖跨会话说话人识别、记忆演化、个性化回答、检索与推理、交互归因,并附金标准支撑证据标注。 论文表 1 的对比显示,ContextDialog、MSU-Bench、AFA、Vox-Infinity 等语音基准与 Mem-Gallery、H2HMem 等图文记忆基准,均未同时覆盖多方、多会话、跨会话身份、交互归因、个性化与记忆更新。 基准含 18 个场景、176 个会话、9,599 个对话轮、18.9 小时合成语音、1,527 个问答对;语音合成后经 Whisper large-v3-turbo 评测,语料级 WER 为 2.14%,并有事件锚点人工复核与问答校验流程。

在 VoxPolyBench 与两个公开图文记忆基准上,VoxPolyMem 均取得领先成绩。 论文报告其加权平均 86.6,对比最强外部基线 68.1;且不含 RL 的变体已超过所有外部基线,加权平均 84.4。 VoxPolyBench 总分 85.0(最强外部基线之上 23.6 分),Mem-Gallery 89.6(+11.8),H2HMem-Multi 74.4(+8.4);所有方法与消融共用 GPT-4.1-mini 作答模型、共享题目与评分细则,并由 GPT-4.1-mini 与 GPT-4.1 双评委打分;200 条抽样的人工审计中,LLM 与人工均分分别为 84.6 与 86.1。

启示与展望

该结果面向需要跨会话记住参与者身份与交互关系的多方语音助手场景,例如会议、车载与家庭助理;方法层面,分层记忆与 EG-GRPO 的奖励设计可迁移到其他多模态长期记忆任务,论文也报告了在 Mem-Gallery 与 H2HMem-Multi 这两个公开图文记忆基准上的领先结果。对读者而言,这提供了一条可复用的思路:把“谁对谁说了什么”作为一等公民存入记忆,并让检索策略按轮次为新证据付费,而不是只看最终答案。

VoxPolyBench 使用生成对话与合成语音,论文在伦理声明中明确该受控设置“does not establish robustness across real speakers, accents, or recording conditions”,因此真实口音与录音条件下的表现仍是开放问题;说话人跟踪评测复用冻结的 ECAPA 嵌入与参考话语边界,隔离的是身份跟踪而非端到端说话人分离;EG-GRPO 的训练依赖支撑轮标注,推理时不可用,其停止判断改用证据充分性与轮次预算;此外,人工审计显示 LLM 与人工均分接近,但论文指出“Similar means do not establish item-level agreement”,逐题一致性仍待考察。本次读取为全文,但图表以文本形式呈现,具体图表细节未逐项核对。

来源