跳到主要内容
返回时间线
arXiv来源发表:

纯文本后训练让 Qwen2.5-Omni-7B 九项推理分数几何均值提升 25.83%,GPU 小时减少 56.6%

相关研究与后续进展

核心概要

该工作通过诊断发现全模态大模型存在多跳推理困难以及感知与推理目标局部优化部分解耦,据此提出以纯文本训练承担主要推理优化、再用约减少 90% 输入 token 的原生音视频强化学习精修感知的文本中心后训练范式;最佳纯文本配置(监督微调后接强化学习)使 Qwen2.5-Omni-7B 九项推理分数的几何均值较基座提升 25.83%,GPU 小时比完整原生音视频路线少 56.6%,完全由纯文本 LLM 合成数据训练也能提升 21.01%,精修后感知恢复到基座之上并保留 93.5% 的推理增益。

Source-provided article image: Text-Centric Post-Training for Omni-Modal Reasoning
Figure 1 ·

Figure 1: (a) A diagnostic case of multi-hop reasoning failure despite correct answers to corresponding single-hop questions. (b) Text-only training provides the main reasoning optimization, followed by reduced-data native audio-visual RL to restore perception while retaining most reasoning gains.

arXiv

深度剖析

诊断显示全模态模型在单跳问题全部答对的情况下仍存在多跳推理困难,并提示感知与推理目标的局部优化存在部分解耦。 此前提升音视频联合推理通常依赖大量数据构建与训练开销,该工作把瓶颈定位到多跳推理与两类目标的优化关系上,为后训练的分工设计提供依据。 基于作者所述诊断结果,摘要未给出诊断所用的具体数据集、样本量或统计量。

纯文本推理训练在不同数据来源、模型规模和模型家族上均带来增益;最佳纯文本配置(监督微调后接强化学习)使 Qwen2.5-Omni-7B 九项推理分数的几何均值较基座提升 25.83%,并比完整原生音视频路线少用 56.6% GPU 小时。 把推理能力的提升从昂贵的音视频数据路线转移到纯文本训练,同时报告了跨数据来源、规模与家族的普适性以及算力对比。 以九项推理分数的几何均值为指标,与基座模型和完整原生音视频路线对比,并给出 GPU 小时差异;摘要未列出九项分数的具体构成。

完全由纯文本 LLM 合成数据训练(构建与训练均不含音视频数据)仍使该几何均值提升 21.01%。 说明推理增益不依赖真实音视频数据的构建或训练,降低了对多模态数据管线的依赖。 单一配置下的几何均值提升数值,摘要未报告方差、重复次数或统计检验。

纯文本训练会削弱感知,因此提出文本中心后训练范式:纯文本训练承担主要推理优化,再用减少数据的原生音视频强化学习精修感知;精修使用约少 90% 的输入 token,使感知恢复到基座水平之上,并保留最佳纯文本流程 93.5% 的推理增益。 把推理与感知的优化显式分工,用少量音视频强化学习修补纯文本训练带来的感知损失,在保留大部分推理增益的同时大幅降低输入 token 消耗。 报告了输入 token 减少比例、感知相对基座的变化方向以及推理增益保留比例;摘要未给出感知评测的具体指标与数据集。

启示与展望

该范式面向需要在有限算力与数据条件下提升全模态模型联合音视频推理能力的研究与工程团队,适用于以推理分数为主要目标、并愿意用少量原生音视频强化学习修补感知的场景。其结论建立在 Qwen2.5-Omni-7B 等模型上的后训练实验,摘要所述增益跨数据来源、模型规模与家族出现,因此可作为同类全模态模型后训练流程设计的参考;纯文本主训加减少数据音视频精修的配置,适合数据构建预算受限但需保留感知水平的部署前调优。

读者仍需关注:诊断中多跳推理困难与感知—推理部分解耦的具体测量方式与适用范围;九项推理分数分别覆盖哪些能力,几何均值提升是否在各单项上一致;感知恢复到基座之上所用的评测指标与数据;以及纯文本合成数据路线在更大模型与更多模态上的表现。由于当前仅依据摘要,图表与实验细节未纳入,上述问题的答案需以原文为准。

来源