arXiv 2026年10月6日作者提出 TS-SP(两阶段说话人保持)框架:先在 Qwen2.5-Omni-7B 的原生音频编码器上用说话人身份监督训练 LoRA,再冻结该编码器、仅用 LoRA 训练语言模型做成对说话人比较,全部预训练权重保持固定;在 Vox1-O 上把等错误率从配对损失适配基线的 7.01% 降到 4.37%,minDCF 从 0.915 降到 0.611,Vox1-E 与 Vox1-H 也分别从 7.64% 降到 4.41%、从 19.31% 降到 9.43%,未见提示下等错误率保持在 4.31–4.79%,但 CN-Celeb 跨域等错误率与基线相当(16.74% 对 16.49%),且原生阈值下准确率更低。作者提出 TS-SP(两阶段说话人保持)框架:先在 Qwen2.5-Omni-7B 的原生音频编码器上用说话人身份监督训练 LoRA,再冻结该编码器、仅用 LoRA 训练语言模型做成对说话人比较,全部预训练权重保持固定;在 Vox1-O 上把等错误率从配对损失适配基线的 7.01% 降到 4.37%,minDCF 从 0.915 降到 0.611,Vox1-E 与 Vox1-H 也分别从 7.64% 降到 4.41%、从 19.31% 降到 9.43%,未见提示下等错误率保持在 4.31–4.79%,但 CN-Celeb 跨域等错误率与基线相当(16.74% 对 16.49%),且原生阈值下准确率更低。TS-SP 两阶段 LoRA 适配让 Qwen2.5-Omni-7B 的 Vox1-O 等错误率从 7.01% 降至 4.37%作者提出 TS-SP(两阶段说话人保持)框架:先在 Qwen2.5-Omni-7B 的原生音频编码器上用说话人身份监督训练 LoRA,再冻结该编码器、仅用 LoRA 训练语言模型做成对说话人比较,全部预训练权重保持固定;在 Vox1-O 上把等错误率从配对损失适配基线的 7.01% 降到 4.37%,minDCF 从 0.915 降到 0.611,Vox1-E 与 Vox1-H 也分别从 7.64% 降到 4.41%、从 19.31% 降到 9.43%,未见提示下等错误率保持在 4.31–4.79%,但 CN-Celeb 跨域等错误率与基线相当(16.74% 对 16.49%),且原生阈值下准确率更低。作者提出 TS-SP(两阶段说话人保持)框架:先在 Qwen2.5-Omni-7B 的原生音频编码器上用说话人身份监督训练 LoRA,再冻结该编码器、仅用 LoRA 训练语言模型做成对说话人比较,全部预训练权重保持固定;在 Vox1-O 上把等错误率从配对损失适配基线的 7.01% 降到 4.37%,minDCF 从 0.915 降到 0.611,Vox1-E 与 Vox1-H 也分别从 7.64% 降到 4.41%、从 19.31% 降到 9.43%,未见提示下等错误率保持在 4.31–4.79%,但 CN-Celeb 跨域等错误率与基线相当(16.74% 对 16.49%),且原生阈值下准确率更低。