Q-SPT 用可学习查询压缩语音令牌:同帧率下重建最优,下游识别与合成感知质量领先
核心概要
该工作提出 Q-SPT,一种低帧率双流语音分词器,用两组分别学习、上下文感知的查询式压缩器独立处理语义流与声学流,并以自回归文本损失显式监督语义压缩器;实验显示其在相同帧率下取得所评估编解码器中最佳重建,在下游语音语言模型中取得最佳语音识别准确率与文本转语音感知质量,可懂度具竞争力。
Figure 1: Comparison of temporal compression strategies for low-frame-rate speech tokenization: (a) average pooling in DualCodec [ 22 ] , (b) similarity-based merging in FlexiCodec [ 23 ] , and (c) learnable query-based compression in Q-SPT. (d) Detailed architecture and training objectives of Q-SPT. Dashed elements indicate components and connections used only during training.
arXiv深度剖析
提出以固定速率查询分别对语义流与声学流做独立注意力聚合的双流压缩架构,使压缩过程按流定制且具备上下文感知能力。 既有方法依赖规则式压缩:平均池化可能丢弃语言信息,基于相似度的合并则对相邻帧相似度使用固定阈值并把所得边界套用到声学流;Q-SPT 改为可学习、按流分离的压缩器。 摘要层面给出架构描述与对比性实验结论,未提供具体数据集、帧率数值或消融细节。
引入自回归文本损失显式监督语义压缩器,以在低帧率下保留语言信息。 把语言信息保持从被动依赖压缩规则转为由文本侧目标直接约束语义分支。 摘要陈述该损失设计及其作用,未给出损失权重、训练配置或单独消融结果。
在相同帧率下,Q-SPT 在所评估编解码器中取得最佳重建,并在下游语音语言模型中取得最佳语音识别准确率与文本转语音感知质量,可懂度具竞争力。 相对既有规则式压缩方案,在重建与下游任务两类指标上同时报告领先表现。 结论以“所评估编解码器”“相同帧率”为限定条件,属摘要级对比陈述,具体指标数值与统计检验未在文本中给出。
启示与展望
该结果面向以神经语音编解码器作为语音语言模型分词器的场景,尤其是需要在低帧率下同时保留语言信息与声学细节的设定。适用对象是构建或部署语音语言模型、并关注计算与内存开销的研究者与工程团队;其价值在于把压缩从固定规则改为可学习、按流分离的聚合,从而在相同帧率下比较重建与下游任务表现。
当前仅依据摘要,无法判断具体帧率、数据集构成、基线选择与指标数值,也无法确认各组件(双流分离、查询式聚合、文本损失)各自的贡献。重建最优与下游最优均以“所评估编解码器”“相同帧率”为限定,其在不同语言、说话人条件与噪声环境下的稳定性仍待观察;文本损失与声学保真之间是否存在权衡,也需原文实验说明。
