跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

MEA 用奖励驱动多智能体把模型解释的忠实度提升最高 34%

该工作提出 MEA 多智能体框架:Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体以忠实度为奖励端到端优化,将输出转为自然语言解释;作者同时引入覆盖特征归因、反事实推理与虚假特征检测的问题类型及基于扰动的忠实度指标,发现前沿大模型会系统性地给出不忠实解释,而 MEA 在六个数据集上优于事后解释器、智能体与闭源基线,相对未训练主干在表格、文本、视觉上分别取得 +28%、+21%、+34% 的忠实度增益。