VoxMem 用 3196 道题测 15 个音频大模型:32K 上下文下无一超过 40%,换成文字稿后说话人识别从 69.8% 掉到 10.3%
核心概要
研究者提出按“声学证据类型(语音语义、说话人身份、副语言线索、环境声音)×记忆操作(信息抽取、多会话推理、时序演化追踪、拒答)”两轴组织的口语对话记忆分类法,并据此构建 VoxMem 基准:3196 个评测实例、34743 段会话、177 小时音频,覆盖 8K 至 64K 四种上下文预算;评测 15 个大型音频语言模型后发现,32K 预算下无一模型总体准确率超过 40%(最强 38.5%),模型对“说了什么”的记忆明显好于“谁说的、怎么说的、周围有什么声音”,且把音频换成精确文字稿后说话人准确率从 69.8% 降至 10.3%,而语音语义仅从 75.9% 微降至 71.0%。
深度剖析
论文提出一个两轴分类法,把“要记住的声学证据”与“施加于其上的记忆操作”联合刻画,并据此构建 VoxMem 基准,包含 3196 个评测实例、34743 段会话、177 小时音频,覆盖 15 个评测场景与 8K、16K、32K、64K 四种上下文预算。 既有口语基准主要关注词汇内容、记忆操作有限且零散,并把记忆当作单会话问题;VoxMem 首次(据作者所述)建立在多会话历史上,由证据会话、同主题但误导的 haystack 会话与无关 filler 会话组成,覆盖 20 个主题族,且每个问题在四种长度下保持不变。 基准统计在正文表格中给出(799 个问题、3196 个实例、34743 段会话、1326 个证据会话、平均每会话 9 轮、每实例 2.5 至 20 分钟音频);构建经过会话级与问题族两级质控,并用 Gemini-3.7-Flash 做声学必要性检查,该模型不在被评测模型之列。
在 15 个大型音频语言模型上,32K 预算下无一模型总体准确率超过 40%,最强模型为 38.5%;五家专有模型平均 33.0%,十个开放权重模型平均 21.9%。 此前缺少在统一多会话、多证据类型、多操作设定下对 LALM 记忆能力的横向刻画;该结果把“长上下文不等于可靠记忆”从推测变为可测量的现象。 15 个模型(10 个开放权重、5 个专有)通过各自原生音频接口评测,长度以 Whisper 编码器 token 为统一尺度,答案由 Gemini-3.7-Flash 按答案类型规则判定,并用 GPT-5.6-Luna 复评,两者在 11978 条 8K 预测上一致率 97.95%。
模型对非词汇声学信息的记忆显著弱于语音语义:32K 下专有模型在语音语义上平均 55.6%,说话人身份 32.7%、副语言线索 20.0%、环境声音 21.9%;开放权重模型对应为 31.6%、26.7%、14.5%、15.5%。 该结果把“音频原生”信息与可从文字稿恢复的语义信息区分开,说明强词汇表现会掩盖更广泛的口语信息保持失败。 论文报告了全音频与纯文字稿的对照:在 669 个可答问题上,纯文字稿输入使音频原生问题准确率从 46.2% 降至 4.4%,而语音语义仅从 75.9% 降至 71.0%;社区摘要进一步给出说话人准确率从 69.8% 降至 10.3%。
记忆难度取决于操作与证据类型的交互:多会话推理相对稳健(语音语义 41.8%、说话人 43.1%),时序演化追踪在语音语义上为 44.5%,但在副语言线索上跌至 3.4%、环境声音上跌至 1.2%;拒答表现则相反,副语言与环境问题上的拒答准确率(34.3%、34.2%)高于语音语义与说话人(19.9%、16.2%)。 论文指出拒答上的高准确率更可能反映模型难以识别或使用声学证据,而非真正意识到证据不足,从而把“拒答”与“作答”区分为两种不同能力。 论文给出按证据类型与操作分层的准确率,并报告错误归因分析:说话人错误中 48% 为绑定失败,副语言错误中 63% 为定位失败,环境声音错误中 41% 为定位、39% 为无支撑作答。
启示与展望
该工作面向研究多会话口语对话记忆的评测者与系统开发者:分类法与基准可用于在 8K 至 64K 上下文预算下比较不同 LALM 的声学记忆能力,并区分证据类型与操作带来的差异。历史由合成语音构建(Higgs-TTS-3 合成用户语音、固定 VCTK 音色、ESC-50 环境声以 10dB 信噪比混入),助手回合以文本提供,因此结果适用于该设定下的音频输入模型评测;论文也说明长度以 Whisper 编码器 token 为统一尺度,不代表任一被评测模型实际消耗的 token 数。
评测依赖 LLM 评委(Gemini-3.7-Flash)判定开放式短答案,论文报告与 GPT-5.6-Luna 的一致率为 97.95%,并指出评委对 Gemini 系输出约有 0.88 个百分点的偏好,且 8K 下最强三个模型差距在 0.9 个百分点以内,因此该预算下的模型排序不宜过度解读。64K 结果仅基于 15 个模型中完成完整 64K 运行的 10 个。错误归因分析基于 64K、三种音频原生证据类型与这 10 个模型,且排除了拒答、空生成与截断回答。历史由合成语音构成,真实录音中的口音、噪声与重叠语音是否呈现同样模式,仍是开放问题。
