Duplex-MPE 用 2000 组多人对话场景测出:语音助手话多不等于答对,MiniCPM-o 4.5 在四项能力中三项领先
核心概要
研究者提出 Duplex-MPE 基准,用 2000 组含三到四名人类说话者与助手 Aria 的连续多人对话场景(每组配对显式点名与隐式指代两种版本),在无转写、无说话人标签、无轮次边界的音频输入下,用新应答发起率、条件答案正确率、静默保持率与应答窗口让出率四项指标评测五个开源全双工语音系统,发现 MiniCPM-o 4.5 在三项计分能力上领先,而其他系统的高频发声常与答案错误或未能保持静默并存。
深度剖析
基准把“该不该说话”变成可观测的语音控制测试:每个场景恰好含一个未解决的直接请求 T,以及要求静默的 N1(提到 Aria 但未请求)、N2(对他人或他设备说话)、N3(无指定对象的自语)轮次,另有 N4 事件——人类先向 Aria 提问(N4Q),随后由提问者或其他参与者给出解答或明确表示无需回答(N4R),考察助手是否停止说话。 既有基准多围绕一个指定用户评测轮次转换、打断处理与多轮对话,或把非指向语音当作需要过滤的干扰;Duplex-MPE 让每位参与者都参与对话状态,助手只是若干可能被称呼对象之一,且观测输出是模型实际发出的波形。 论文以表格固定六项分子分母,四项计分能力各自独立分母,不合成总分;场景由 Claude Opus 5 依设定、活动、关系、设备环境与语域五属性生成脚本,Qwen3-TTS 逐轮合成语音,六名评审对抽样数据与输出做人工校验。
配对显式/隐式指代设计显示:基于转写的 Gemini 3.1 Pro 参考在点名时回应率为 64.3 个百分点高于未点名时,而五个语音系统的配对回应率差异均未达统计显著。 此前工作多把被称呼人识别当作对给定话语的分类任务;这里把它作为控制端到端模型是否发声的潜在决策,并在保持场景任务与标准答案不变的前提下反转 T 的指代形式。 论文用精确 McNemar 检验,五个语音系统的最小 p 值也超过 0.05 阈值;作者同时指出该模式既可能来自成功从上下文推断被称呼人,也可能来自未把名字识别为指代线索。
分开计分暴露出彼此不同的行为画像:显式条件下 Freeze-Omni 回应存在率最高但新应答发起率最低,FLM-Audio 回应存在率与 MiniCPM-o 相近而条件答案正确率相差悬殊,Freeze-Omni 近乎完美的回应存在率与仅在少数静默窗口保持静默并存。 单一回应率会掩盖行为来源;论文用新应答发起率与回应存在率区分“新决定发声”与“请求结束时已在说话”,并用静默保持率区分选择性回应与无差别发声。 论文报告在显式条件下 Freeze-Omni 的回应存在率最高、新应答发起率最低,FLM-Audio 在回应存在的请求中仅少量答案正确,Freeze-Omni 只在少数需要静默的窗口保持静默;静默保持率在 0、100、300、500 毫秒四档时长阈值下模型排序不变。
让出话轮是受覆盖条件约束的结果:MiniCPM-o 在显式条件下于多数 N4 窗口产生语音,其中一部分在问题播放期间保持静默并在问题结束后三秒内开始说话,只有仍在 N4R 开始时说话的事件才进入应答窗口让出率分母;Freeze-Omni 在所有窗口都有语音,但多为问题开始前延续的语音,仅一个事件进入该分母。 把“停止说话”从整体 N4 表现中分离出来,并明确短暂停顿不算停止——模型必须在截止时刻及观察窗口结束前保持静默。 论文给出各模型显式条件下的让出率分母,并说明 FLM-Audio 在部分计分事件中于 N4R 开始三秒后仍在说话,Moshi 的部分失败事件是在截止时刻静默但随后又发声;Freeze-Omni 因仅一个合格事件而不展示该比率。
启示与展望
该基准面向全双工语音系统:模型需接收连续房间音频、自行决定何时发声并在说话时继续聆听,因此非全双工模型未被计分评测,指令敏感性仅作为非计分探针报告。适用场景是会议、客厅、车内这类多人共享对话,助手 Aria 是若干可能被称呼对象之一,其他参与者的语音既可能提供后续回答所需信息,也可能直接解决已向助手提出的请求。作者表示同一分类体系与自动化生成、评测流程可支持更大规模或新的评测抽样,并计划在十二月前发布数据与代码,同时公开场景清单、逐轮音频与构造边界、职责前言、调度器与检测器设置、逐场景随机种子与评分代码。
论文正文中多处数值在加载文本里以空白呈现,包括表 3 的六项指标、表 9 至表 21 的多数单元格以及数据集时长统计,因此本总结只能依据文字叙述中的定性结论与少数明确给出的数字(如 Gemini 3.1 Pro 的 64.3 个百分点差异、五个语音系统配对检验的最小 p 值超过 0.05 阈值、四档时长阈值下的排序不变)。读者仍需关注:显式与隐式版本除 T 的措辞外还包含上下文编辑与 N4 实现差异,作者因此按完整配对场景比较回应存在与否,而不把差异单独归因于名字的出现;语音系统在两种指代条件下回应率变化很小,这一模式既可能来自成功推断被称呼人,也可能来自未把名字当作指代线索,二者在本研究中尚未区分;场景为合成英语对话,可能继承生成与语音合成模型的偏差;Freeze-Omni 的让出率仅基于一个合格事件,其条件比率不宜外推。
