STAM-ASR 用说话人-时间锚定与记忆扩展预训练 AudioLLM,在 AMI、ICSI、LibriCSS、NOTSOFAR-1 上验证多说话人识别
核心概要
该工作提出 STAM-ASR,一个在已预训练 AudioLLM 之上扩展的轻量框架,不依赖外部说话人分离系统,而是直接从 AudioLLM 中间特征学习说话人活动与说话人感知表示,为语义表示提供显式的“谁在何时说话”线索,并维护固定大小的说话人记忆与会话记忆以跨轮次携带上下文,在 AMI、ICSI、LibriCSS 和 NOTSOFAR-1 上覆盖近讲、远场、重叠与跨域条件进行评估,报告结果显示说话人-时间条件化与记忆带来互补收益,而参考说话人活动与预测说话人活动之间的差距表明稳健的说话人跟踪仍是关键挑战。
Figure 1: Overview of STAM-ASR with internal diarization, speaker-temporal modulation, memory construction.
arXiv深度剖析
STAM-ASR 在不使用外部说话人分离系统的前提下,从 AudioLLM 中间特征直接学习说话人活动与说话人感知表示,为语义表示提供显式的“谁在何时说话”线索。 与依赖外部说话人日志或显式语音分离的常见做法相比,该框架把说话人-时间线索内化到 AudioLLM 的特征调制中,无需显式语音分离。 摘要说明该框架扩展自“已预训练 AudioLLM”,并在 AMI、ICSI、LibriCSS、NOTSOFAR-1 四个数据集上评估,覆盖近讲、远场、重叠与跨域条件;具体数值未在加载文本中给出。
STAM-ASR 维护固定大小的说话人记忆与会话记忆,用于跨轮次携带互补上下文。 在说话人-时间条件化之外引入记忆机制,使模型能够利用跨轮次信息,而不仅是当前片段。 摘要报告“说话人-时间条件化与记忆提供互补收益”,但未给出消融数值或记忆容量的具体设置。
在 AMI、ICSI、LibriCSS 和 NOTSOFAR-1 上的评估显示,参考说话人活动与预测说话人活动之间的差距表明稳健的说话人跟踪仍是关键挑战。 该工作把评估扩展到近讲、远场、重叠与跨域多种条件,并明确指出说话人跟踪而非识别本身是剩余瓶颈。 结论基于四个数据集的评估,但加载文本未提供具体错误率或对比数字。
启示与展望
该工作面向在已预训练 AudioLLM 上扩展多说话人 ASR 的研究与工程场景,适用于近讲、远场、重叠与跨域条件;其价值在于提供一种不依赖外部说话人分离系统的轻量框架,并明确把稳健说话人跟踪列为后续方向。对希望在不引入外部日志模块的前提下提升多说话人识别的读者,这一思路可直接参考。
加载文本仅包含摘要,未给出具体识别错误率、说话人归属准确率、记忆容量、训练数据规模或与基线的数值对比,因此无法判断收益幅度。参考说话人活动与预测说话人活动之间的差距被指出为关键挑战,但文本未说明该差距在不同数据集或条件下的变化。读者若需评估方法在自身场景的适用性,仍需查阅原文中的实验表格与实现细节。
