跳到主要内容
返回时间线
arXiv来源发表:

AURAL 用潜空间推理与联合分块预测,在语音语言模型上以 11.8 倍更快的首答延迟达到与 CoT-RL 相当的性能

核心概要

该工作提出 AURAL,在潜空间中建模多种可能推理延续的分布并联合预测未来状态分块,配合 683K 条双语语音话语(约 1000 小时)的 AuralReason-683K 监督与 AURAL-RL 强化学习,在两个骨干网络上取得与 CoT-RL 相当的性能,多数指标上相对各自监督检查点提升更大,并在 Qwen2.5-Omni 上将首个答案 token 的时间从 1.22 秒降至 0.10 秒(11.8 倍),而直接回答为 0.05 秒。

Source-provided article image: AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models
Figure 1 ·

Figure 1: Overview of AURAL. Top left: AURAL-SFT pools CoT embeddings into latent targets under compression factor c c , then predicts a Gaussian mixture over a joint chunk of m m future states that reenters the backbone in one pass, while the language head keeps each state readable and emits EOL . Bottom left: AURAL-RL scores 8 rollouts per prompt with a quality-gated conciseness reward, making latent depth adaptive. Right: AURAL-RL is comparable to CoT-RL over eleven metrics while cutting time to first token from 1.22 1.22 to 0.10 0.10 s ( 11.8 × 11.8\times ).

arXiv

深度剖析

AURAL 在潜空间中建模多种可能推理延续的分布,并联合预测未来状态分块,从而减少顺序前向传播次数与推理延迟。 相对于依赖单路径监督、且推理预算不随问题难度调整的既有潜推理方法,该设计同时引入多路径分布建模与分块联合预测。 摘要层面的方法描述,未给出消融或分块规模等细节。

构建了 AuralReason-683K:683K 条双语语音话语(约 1000 小时),覆盖情感识别、共情对话与通用推理,并配有简洁 CoT,为潜推理提供初始监督。 为潜推理提供带简洁 CoT 的大规模双语语音监督数据,而非仅依赖显式 CoT 文本。 摘要给出数据规模与任务覆盖,未提供数据构建流程与质量评估细节。

AURAL-RL 在这些轨迹之外继续探索,奖励能带来高质量答案的简洁推理,并按问题自适应调整推理投入。 把奖励信号同时绑定到简洁性与答案质量,使推理预算随问题难度变化,而非固定预算。 摘要层面的训练目标描述,未给出奖励函数形式与超参数。

在两个骨干网络上,AURAL-RL 性能与 CoT-RL 相当,且在多数指标上相对各自监督检查点提升更大;分析显示更难的问题会触发更多潜推理步数。 在保持与显式 CoT 强化学习相当性能的同时,展示推理步数随难度自适应的行为。 摘要报告两个骨干网络上的对比结果与难度—步数关系分析,未列出具体指标数值与统计检验。

启示与展望

该结果面向需要低延迟响应的语音语言模型交互场景,尤其是情感识别、共情对话与通用推理类任务;对希望在保持推理质量的同时压缩首答延迟的研究者与工程团队具有参考意义。方法在摘要所述的两个骨干网络上得到验证,并配套公开描述的 683K 双语语音监督数据,适用于以语音为输入、需要推理式回答的设定。

当前仅依据摘要,无法看到具体评测指标数值、统计显著性、分块规模与奖励函数细节,因此性能“相当”的幅度与延迟收益的稳定性仍需在正文中确认;潜推理步数随难度增加这一现象在不同任务与骨干上的普适性,以及 0.10 秒与直接回答 0.05 秒之间差距的实际体验影响,也值得进一步观察。

来源