跳到主要内容
返回时间线
arXiv来源发表:

DuplexJev 用单 token 读出替代自回归解码,8 卡节点约 0.1 秒完成 8 段语音的 80 项决策,并让冻结 LLM 同时听出性别与情绪

相关研究与后续进展

核心概要

作者提出 DuplexJev:把 ASR 编码器隐状态经小型连接器送入冻结 LLM,将每个封闭式问题读作选项上的单 token 分布而不做任何解码,8 卡节点约 0.1 秒回答 8 段语音的 80 项决策;用末层连接器时口语问答接近读转录(90% 对 91%),用交叉注意力连接器时性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%),并以读出答案 token 的交叉熵训练决策、把蒸馏留给内容。

Source-provided article image: Batched Speech Decisions Without Decoding: Single-Token Supervision Lets a Frozen LLM Hear Beyond the Transcript
Figure 2 ·

Figure 2: R3 from the R2 connector, same data and schedule. Left: gender on 800 real utterances under distillation (flat) and answer-token supervision, for A and B. Right: emotion under answer-token supervision, with ZJU-ML (dashed).

arXiv

深度剖析

DuplexJev 把全双工语音代理中的小型封闭决策改写为单 token 读出:ASR 编码器隐状态经小型连接器进入冻结 LLM,每个问题直接读作其选项上的单 token 分布,不做任何解码。 相对依赖慢速自回归解码的现有系统,这里把决策从逐 token 生成改为一次读出,并保持编码器与 LLM 可互换。 摘要报告 8 卡节点对 8 段语音的 80 项决策约 0.1 秒完成,并说明权重、训练配方、批式推理流水线与双语口语问答集均已发布。

连接器结构决定模型是否保留语音中的副语言信息:末层连接器使口语问答接近读转录(90% 对 91%),交叉注意力连接器则让性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%)。 这给出一种在转录内容与说话人属性之间取舍的可选设计,而不是只优化转录问答。 摘要给出上述成对准确率对比,但未提供数据集规模、统计检验或逐项决策的分解。

训练目标上,决策用读出答案 token 的交叉熵监督,而非通常的转录蒸馏;蒸馏仅保留给内容。 作者指出转录蒸馏的教师从未听到声音,因此该监督方式无法传递副语言线索,而单 token 交叉熵直接作用于决策读出。 摘要以方法描述与上述准确率变化支持这一设计选择,未报告消融细节。

启示与展望

该工作面向全双工语音代理中的小型封闭决策,例如从固定选项中选答,而非开放式生成;其设置是 ASR 编码器加冻结 LLM 加小型连接器,并在 8 卡节点上批式服务。摘要称编码器与 LLM 可互换,并发布权重、训练配方、批式推理流水线与双语口语问答集,因此可直接用于复现、替换骨干模型,以及在同类封闭决策上迁移。适用前提是决策可被表述为选项上的单 token 读出,且延迟目标以批式吞吐为主。

摘要未说明口语问答集与决策任务的规模、语言覆盖与标注方式,也未给出延迟测量的硬件与批处理配置细节;性别与情绪准确率的提升来自交叉注意力连接器,其与末层连接器在口语问答上的差异(83% 对 90%)提示内容与副语言属性之间存在取舍,具体权衡曲线尚不清楚。此外,摘要未报告统计显著性、错误类型分布或跨编码器与跨 LLM 的复现结果,这些是读者在采用前会想进一步确认的开放问题。

来源