VoxParity 用 183 个场景测试 28 个语音代理:音频要求保护时,所有系统都更常照字面执行常规操作(41% 对 12%)
核心概要
该工作提出 VoxParity 基准:183 个来自 14 个行业的场景,每个场景固定同一段文字稿、只改变音频(教练声音、医疗监护仪蜂鸣、无线电检查中的求救信号、药名上的噪声、下注的儿童声音、惊恐的低语),并让正确的可执行工具调用随之改变;在 206 个带线索单元上,28 个系统(含 9 个生产级实时代理)在音频要求保护时执行常规请求的比例为 41%,而在干净通话上过度触发为 12%,23 个有文字通路的系统中只有 11 个通过“纯文字零假设”检验,且通过几乎全部来自明确写出规则的条目。
深度剖析
该工作构建了一个以“代理实际执行的类型化工具调用”为评分对象的基准:183 个场景、14 个行业、七类可听线索加一个通道控制,28 个系统(13 个文件模式 API 模型、9 个生产级实时代理、6 个本地开源权重模型),采用无评判者的确定性匹配打分,并让约 20 名志愿者在同一音频上从同一动作菜单中选择作为参照。 此前研究只在 3 个场景、每格 5 次试验中观察到实时代理“听到却不照做”,或发现加入音频几乎不改变开放 7B 音频模型的决策;VoxParity 把这些观察变成对已执行调用的规模化测量,并配以“纯文字零假设”基线。 183 个场景中 130 个双变体条目的金标确实翻转;菜单按固定种子打乱,使“听到异常就选第二个工具”的策略得分为 0.977 的捷径失效;评分按伯克利函数调用排行榜的语法树匹配,工具名与类型化参数都须匹配。
错误方向一致偏向文字:全部 28 个系统、11 家厂商、三种服务模式,在保护性通话上执行常规动作的比例都高于在干净通话上的过度触发,合并为 41% 对 12%,四个领先系统为 34% 对 18%,纯文字级联为 58%。 该工作把“听到音频”与“照音频行动”分开:相对每个系统自己的文字孪生,听到音频使不安全执行下降 0.12,但过度触发不变(+0.00),方向从未反转。 在 23 个有文字通路的系统上按条目聚类做差分中的差分,11 个系统在 Holm 校正后显著下降;去掉任一厂商方向仍成立;对 60 个抽样分类的审计与金标理由一致 57 个。
行动主要发生在条目明确写出规则的地方:四个领先系统在写出规则的条目上对情绪单元超过零假设 +0.33,在未写出规则的条目上无可检测增益(+0.00);在听到的感受中,它们对急性警报(恐慌、喘息、悲痛、低语胁迫)照文字行动的比例为 6%,而对安静状态(困惑、认命、含糊、哭泣、讽刺)为 52%。 该工作把“线索改变事实”与“线索改变来电者状态”分开,并按是否写出规则分层报告,从而定位出差距所在。 这些是探索性分析,作者明确说明是在看过数据后选择的;在 23 个系统中,写出规则的条目上有 18 个超过零假设,未写出规则的条目上只有 1 个(未校正、观察性)。
在前沿系统上,瓶颈在“从听到到决策”的桥接:完美听觉只增加 0.04 信用,完美决策增加 0.28;在提示中描述来电者的语气(上界,由变体规格构建)与写出规则各自恢复部分缺口,两者合用使 gemini-3.7-flash 在未写出规则的情绪通话上从 0.40 升到 0.83,但仍比其他线索低 0.17。 该工作把 Hear2Act 关于“音频推断状态写入文字可提升行动”的发现推进到类型化工具调用,并指出描述必须携带模型自身描述所低估的强度。 描述与规则均为上界,来自渲染规格而非片段本身;模型自身的行动前描述常低估其听到的状态(30 条情绪通话中 30 条低估、否认或误标,其中 22 条其强制选择探针已正确识别线索)。
启示与展望
该工作面向部署方、审计方与买方:零假设检验可在开发集(40 个条目、81 个单元)上筛查大效应,并在全量上给出判定,方法是把每个单元分别以音频和文字稿运行,再让纯文字流水线跑同样单元,只有当代理的音频减文字稿变化超过流水线时才通过。它适用于需要按行业规则对可听线索作出反应的语音代理场景,例如紧急呼叫、欺诈防范、航空航海无线电、赌博年龄核验与脆弱客户保护。作者还建议构建者写出规则,并在“同一段文字、不同正确动作”的配对上评估乃至训练工具调用策略。
读者仍需留意:只有零假设判定是确证性的,错误方向、事实与感受之分、听觉与决策之分以及与其他度量的比较都是看过数据后选择的;情绪结果几乎全部依赖 Gemini-TTS 的单一声音(309 个计分单元中 298 个使用同一声音),人类参照来自约 20 名自选志愿者、其中一人贡献了近四分之一答案,且他们在锁定动作后才回答感知问题。刺激为合成,人类录音全部来自知道研究假设的作者本人。规则映射是作者对书面规则的解读而非法律认定,19 个遗留条目缺少书面依据。名册覆盖 2026 年 9 月可得的厂商与实时 API,但不含 Amazon Nova 2 Sonic,也不含每个模型尺寸与代际。此外,本证据包为全文,但部分表格与附录细节以文本形式给出,若需核对具体数值仍应查阅原文与发布仓库。
