跳到主要内容
返回时间线
arXiv来源发表:

无编码器语音大模型用说话人身份与情感元数据预训练,在匹配数据下超过随机初始化的编码器基线

核心概要

该工作提出元数据监督预训练(MSP),利用说话人身份与情感等语音属性,并引入说话人感知话语组合(SAUC)与随机跨度掩码,训练无编码器语音大模型;在多说话人对话的联合ASR与说话人日志任务上,匹配训练数据时该无编码器模型优于随机初始化的编码器基线,在有限元数据标注数据下与使用大规模语料预训练编码器的模型相当,并在若干设置中胜出。

Source-provided article image: Teaching LLMs to Hear Who Spoke What: Metadata-Supervised Pretraining for Encoder-Free Speech-LLMs
Figure 1 ·

Figure 1 : Proposed Metadata-supervised pretraining (MSP) of the encoder-free Speech-LLM.

arXiv

深度剖析

提出元数据监督预训练(MSP),把说话人身份、情感等语音属性作为监督信号,用于无编码器语音大模型的预训练。 此前无编码器语音大模型缺少系统化的预训练策略,MSP 直接以语音属性监督来培养说话人区分与副语言能力,以弥补没有大规模预训练语音编码器的缺口。 摘要说明该方法以语音属性为监督,并在多说话人对话的联合 ASR 与说话人日志任务上评估,辅以副语言语音理解任务实验;具体数据规模与指标未在摘要中给出。

引入说话人感知话语组合(SAUC)以强化说话人区分,并用随机跨度掩码正则化预训练。 在 MSP 之外增加针对说话人区分的组合策略与掩码正则化,构成一套面向无编码器架构的预训练组合。 摘要将其列为方法组成部分,并说明主要评估任务为联合 ASR 与说话人日志;消融细节与量化增益未在摘要中呈现。

在匹配训练数据条件下,无编码器模型优于随机初始化的编码器对应模型;在有限元数据标注数据下,与使用在更大规模语料上预训练编码器的模型相当,并在若干设置中胜出。 把无编码器路线与编码器路线放在匹配数据条件下比较,并进一步与使用更大规模预训练语料的编码器模型比较,显示无编码器架构在语音能力上具备竞争力。 摘要报告了匹配数据条件下的对比结果与有限元数据标注条件下的竞争力,并称在若干设置中胜出;具体数值、任务划分与统计检验未在摘要中给出。

启示与展望

该工作面向无编码器语音大模型,适用于多说话人对话中的联合 ASR 与说话人日志,并辅以副语言语音理解任务;其结论建立在匹配训练数据条件以及有限元数据标注数据的设定下。对希望在没有大规模预训练语音编码器时构建语音能力的研究者与工程师,这一预训练方案提供了可复用的思路,即用说话人身份、情感等语音属性作为监督信号,并配合说话人感知话语组合与随机跨度掩码。

摘要未报告具体指标数值、训练数据规模、元数据标注量以及各组件消融结果,因此 MSP、SAUC 与随机跨度掩码各自的贡献大小仍待正文确认;副语言语音理解任务的具体设置与结果也未在摘要中展开。此外,本次读取范围为摘要,未包含图表与实验细节,上述量化问题属于需要进一步阅读正文的开放问题。

来源