跨会议说话人归属评测:ThyVoice 以 47.13 的平均 SI-cpWER 领先全部商业级联,而单场最优的 ElevenLabs 在 CHiME-6 上归属误差增加约 30 个百分点
核心概要
该工作提出以语料级全局说话人映射计算的 SI-cpWER 指标,在 CHiME-8 NOTSOFAR(干净与加噪)及 CHiME-6 上评测五个商业 diarize-then-identify 级联、两个开放基线以及端到端参考系统 ThyVoice,发现要求跨会议保持同一身份会改变商业系统排名:ThyVoice 在三种条件下均优于所有被评测的商业级联,全组平均 SI-cpWER 为 47.13,次优系统为 54.75。
深度剖析
论文提出 SI-cpWER,即在整份语料上使用一个全局说话人 ID 映射计算的 cpWER,用来衡量同一人是否在多次会议中保持同一身份。 既有会议转写指标要么忽略说话人,要么在每段录音内独立重映射匿名说话人,因此无法度量跨会议的身份一致性;SI-cpWER 把身份持久性直接纳入评分。 在 129 场 NOTSOFAR 评测会议(12 位互斥测试说话人、13.34 小时、188,036 个计分参考词、约 30% 重叠语音)以及 CHiME-6 两个远场会话(56,886 参考词)上,以匈牙利求解器做全局一对一分配,样本边界保持不变。
在持久归属指标下商业系统排名发生变化:ThyVoice 在干净、加噪、CHiME-6 三种条件下 SI-cpWER 均低于所有被评测的商业级联,全组平均 47.13 对次优的 54.75。 按单场 cpWER 排名时 ElevenLabs 在每种条件下都是商业系统中最优,但这一优势并未延续到跨会议归属;SE-DiCoW 在两个 NOTSOFAR 条件下领先全组,ThyVoice 则在 CHiME-6 上领先。 主表给出各系统三条件数值与均值;ElevenLabs 在 CHiME-6 上 SI-cpWER 比其单场 cpWER 高约 30.0 个百分点,而 ThyVoice 仅高 1.5 个百分点。
分层诊断把最终归属记录的上游误差面拆开:词级识别、局部说话人活动、单场归属与说话人聚类各自约束最终结果。 论文不只报告一个端到端分数,而是同时给出 WER、DER/JER、IAR、身份计数与聚类纯度/覆盖率/重叠召回等互补证据,说明身份层可用的证据面如何影响持久归属。 ThyVoice 的 DiariZen md-v2 组件在每种条件下 DER/JER 最低(干净 18.32/23.65),其聚类纯度 96.2%、覆盖率 95.2%、重叠召回 78.5%;而只输出每词一个说话人的接口重叠召回为 0.0%,无法从时间信息中剔除隐藏重叠。
重叠处理策略的消融显示,把重叠音频用于转写与用于身份证据是两个不同决策:在 20 场干净 NOTSOFAR 子集上,分离加流重匹配取得最低 cpWER 34.39 与 SI-cpWER 32.73,而用含混音音频做身份匹配的 SI-cpWER 升至 67.76。 该子集对比把“重叠是否可用于身份注册”从“重叠是否可用于识别”中分离出来,指向身份证据门控而非单纯识别质量。 四种重叠策略在同一 20 场子集、同一池化注册流程下对比;作者说明该子集提供方向性证据,不确立全语料上的效应大小。
启示与展望
该评测面向把会议音频转成可长期查询记录的语音系统,适用于英语、单通道、无预注册说话人名册的设定:NOTSOFAR 提供自然办公会议与跨会议持久的参与者别名,CHiME-6 提供真实远场晚宴会话。SI-cpWER 与分层诊断可直接用于比较不同 diarize-then-identify 级联与端到端系统在身份持久性上的表现,也可用于检验重叠修复与注册证据门控这类设计选择。作者指出后续应在真实多日使用中评测反复出现的说话人,并衡量归属错误是否改变被检索的事实、摘要、决定或行动项归属。
持久性是通过按固定顺序串行处理录音、共享同一声纹库来模拟的,而非观察同一批人跨天真实复现,因此结果刻画的是该固定序列下的身份一致性,长期时间尺度与录音顺序鲁棒性仍是开放问题。诊断指标各自评分该系统可获得的组件或提供方输出面,并非统一接口,跨层数值不可相加。加噪条件为确定性增强而非真实部署采集,CHiME-6 仅两个会话,多语言与语码转换尚未覆盖。ThyVoice 的注册消融与提供方池化对比为单次、非配对运行,ElevenLabs 的重复抽样显示 SI-cpWER 在加噪条件下存在 6.80 的波动范围,因此这些对比应作描述性证据看待。此外,归属错误在任务层面的实际代价——即是否真的把事实或承诺挂到错误的人身上——论文明确留作未来工作。
