跳到主要内容
返回时间线
arXiv来源发表:

TS-SP 两阶段 LoRA 适配让 Qwen2.5-Omni-7B 的 Vox1-O 等错误率从 7.01% 降至 4.37%

相关研究与后续进展

核心概要

作者提出 TS-SP(两阶段说话人保持)框架:先在 Qwen2.5-Omni-7B 的原生音频编码器上用说话人身份监督训练 LoRA,再冻结该编码器、仅用 LoRA 训练语言模型做成对说话人比较,全部预训练权重保持固定;在 Vox1-O 上把等错误率从配对损失适配基线的 7.01% 降到 4.37%,minDCF 从 0.915 降到 0.611,Vox1-E 与 Vox1-H 也分别从 7.64% 降到 4.41%、从 19.31% 降到 9.43%,未见提示下等错误率保持在 4.31–4.79%,但 CN-Celeb 跨域等错误率与基线相当(16.74% 对 16.49%),且原生阈值下准确率更低。

Source-provided article image: TS-SP: Learning Speaker-Preserving Representations in Audio Large Language Models
Figure 1 ·

Figure 1: TS-SP: Stage 1 learns audio LoRA with intermediate speaker supervision; Stage 2 freezes the adapted audio pathway and trains LM LoRA for speaker comparison. All pretrained base weights remain fixed.

arXiv

深度剖析

TS-SP 把说话人判别式表示学习放进 ALLM 自带的音频编码器,而不是外接说话人编码器,推理时走原生音频到语言通路,不需要说话头或额外连接器。 此前工作或把冻结的 ECAPA-TDNN、ReDimNet 等外部说话人表示投影进语言模型输入空间,或对 QFormer 特征施加联合目标;TS-SP 的差别在于先在原生音频编码器内部施加说话人监督,再做独立的成对语言模型适配。 方法描述明确:第一阶段用无参数统计池化加 AAM-Softmax 说话头,只更新音频编码器第 0–30 层 LoRA(3.809 M)与 2.191 M 说话头;第二阶段只更新 10.093 M 语言模型 LoRA,两系统推理时 LoRA 参数量同为 14.025 M。

在 Vox1-O/E/H 三个测试列表上,TS-SP 相对同骨干的配对损失适配基线一致降低等错误率并提升整体准确率。 基线把成对音频问答范式搬到同一骨干上,但未做说话人预训练;TS-SP 在其上再降等错误率,Vox1-O 由 7.01% 到 4.37%、Vox1-E 由 7.64% 到 4.41%、Vox1-H 由 19.31% 到 9.43%,Vox1-H 的非目标准确率由 52.77% 升到 75.42%。 结果来自表 1,训练仅用 VoxCeleb2 开发集原始录音、无数据增强或速度扰动,基线及第二阶段共用 20 万对录音(10 万同说话人、10 万不同说话人),报告的是各次运行最终检查点而非按验证性能挑选的检查点。

对训练提示之外的多种提示改写,等错误率保持稳定,但固定阈值下的判定并不稳定。 P1–P5 均为未见提示且无需再微调,等错误率落在 4.31–4.79%;数字答案 P3 的等错误率与 minDCF 最高,中文提示 P5 等错误率接近 P0(4.50% 对 4.37%)但目标/非目标准确率变为 99.88%/79.88%,显示更强的同说话人偏置。 表 2 给出六个提示下的等错误率、minDCF 与两类准确率;作者说明 P2–P5 同时改变措辞与答案词,因此无法分离答案格式的影响,P5 还额外改变了语言。

在 CN-Celeb 跨域评测中,两阶段说话人监督带来的增益没有延续,等错误率与基线相当。 两个微调系统都把等错误率从零样本 Qwen2.5-Omni-7B 的 31.93% 降下来,但 TS-SP 的 16.74% 略高于基线的 16.49%,minDCF 仅略低(0.984 对 0.985);原生阈值下整体准确率反而从零样本的 89.72% 降到 TS-SP 的 34.89%。 跨域评测随机抽取 CN-Celeb 10% 试次并保持原始目标/非目标比例,不再微调;该列表 99.49% 为非目标试次,作者指出始终回答 No 即可达到 99.49% 整体准确率,因此该指标由非目标判定主导。

启示与展望

该结果面向需要在音频大语言模型内部保留说话人身份线索的研究者与工程团队,适用场景是具备可访问中间音频特征、且音频与语言组件可分别适配的骨干,本文在 Qwen2.5-Omni-7B 上实例化。方法在 VoxCeleb2 开发集原始录音上训练,无数据增强或速度扰动,音频统一 16 kHz、每段最多取前 6 秒、成对拼接加 1 秒静音,推理走原生音频到语言通路,不需要说话头或额外连接器。可直接复用的部分是两阶段 LoRA 流程与基于答案词概率的评分方式,作者也把跨域泛化与联合训练以在强化说话人建模的同时保持语音识别、内容理解与指令跟随列为后续方向。

作者指出结果支持 TS-SP 整体,但无法把中间说话人监督的贡献与训练日程、额外优化步骤的效应分离;P2–P5 同时改变措辞与答案词,答案格式的影响无法单独判断,P5 还改变了语言。基于答案词概率的分数未必是校准的说话人假设似然比,提示变化下等错误率相近并不保证 minDCF 或固定阈值判定稳定。CN-Celeb 列表 99.49% 为非目标试次,整体准确率由非目标判定主导,零样本模型更高的准确率不宜解读为更强的说话人判别力。此外,语音识别、内容理解与指令跟随等能力是否保持尚待评测,其他骨干也仍待验证。

来源