跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

RED 免训练解码方法在三个音视频幻觉基准上把准确率最高提升 7%,首 token 时间约为标准解码的 1.5 倍

该工作提出免训练的 Relevant Evidence Decoding(RED),用逐点互信息把音视频联合预测拆分为音频、视频与残差交互三部分,并通过仅问题推理判断所需证据类型后只增强对应贡献;在三个音视频幻觉基准与三个 AV-LLM 上,RED 相对标准解码最高提升 CMM 7%、AVHBench 6.3%、SVHalluc 3.8%,平均首 token 时间约为标准解码的 1.5 倍。