跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

纯文本后训练让 Qwen2.5-Omni-7B 九项推理分数几何均值提升 25.83%,GPU 小时减少 56.6%

该工作通过诊断发现全模态大模型存在多跳推理困难以及感知与推理目标局部优化部分解耦,据此提出以纯文本训练承担主要推理优化、再用约减少 90% 输入 token 的原生音视频强化学习精修感知的文本中心后训练范式;最佳纯文本配置(监督微调后接强化学习)使 Qwen2.5-Omni-7B 九项推理分数的几何均值较基座提升 25.83%,GPU 小时比完整原生音视频路线少 56.6%,完全由纯文本 LLM 合成数据训练也能提升 21.01%,精修后感知恢复到基座之上并保留 93.5% 的推理增益。