跳到主要内容
返回时间线
arXiv来源发表:

MEA 用奖励驱动多智能体把模型解释的忠实度提升最高 34%

相关研究与后续进展

核心概要

该工作提出 MEA 多智能体框架:Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体以忠实度为奖励端到端优化,将输出转为自然语言解释;作者同时引入覆盖特征归因、反事实推理与虚假特征检测的问题类型及基于扰动的忠实度指标,发现前沿大模型会系统性地给出不忠实解释,而 MEA 在六个数据集上优于事后解释器、智能体与闭源基线,相对未训练主干在表格、文本、视觉上分别取得 +28%、+21%、+34% 的忠实度增益。

Source-provided article image: MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations
Figure 1 ·

Figure 1: Overview of Mea . Given a user question about model behavior, the Proposer agent reasons over the model prediction and input modality to select an explanation strategy, choosing from a multimodal (tabular, text, and vision) toolkit and agent reasoning tasks (grounding, reasoning, and comparison), the Actor agent then executes the strategy, processes raw explanation outputs, and produces a structured natural-language explanation. The explanation is evaluated via input perturbation against faithfulness metrics. In training, both agents are jointly optimized end-to-end via GRPO [ 14 ] , using a reward combining faithfulness and tool penalties.

arXiv

深度剖析

MEA 把解释工具的选择与配置交给 Proposer 智能体,把解释生成交给以忠实度为奖励端到端优化的 Actor 智能体,从而在表格、文本、视觉三种模态上产出自然语言解释。 以往事后解释方法需要使用者自行在高维输出中挑选解释并跨工具综合证据,MEA 将这一知识门槛交由多智能体流程承担。 摘要说明该框架在三种模态上运行,并在六个数据集上与事后解释器、智能体与闭源基线比较;具体实现细节未在摘要中展开。

作者提出覆盖特征归因、反事实推理与虚假特征检测的多种问题类型,并为每类问题配套基于扰动的忠实度指标。 这为解释质量提供了可量化的评测维度,而不仅是人工判断或单一工具输出。 摘要明确列出问题类型与扰动式忠实度指标的配对设计,但未给出指标的具体计算方式与数值。

作者报告前沿大模型会系统性地产生不忠实的解释。 这一观察把问题定位在解释的忠实性而非流畅性上,说明仅靠语言模型直接生成解释并不可靠。 该结论来自摘要中的整体陈述,具体模型清单、评测规模与统计细节未在摘要中给出。

以忠实度奖励并加入模态自适应惩罚进行优化后,MEA 在六个数据集上一致优于事后解释器、智能体与闭源基线,相对未训练主干在表格、文本、视觉上分别获得 +28%、+21%、+34% 的忠实度增益。 增益来自奖励驱动的端到端优化,而非更换更大的模型或更多工具,说明优化目标本身是提升忠实度的关键。 摘要给出跨六数据集的一致比较结果与三模态增益数字,但未提供置信区间、显著性检验或逐数据集明细。

启示与展望

该工作面向需要理解模型行为但缺乏解释工具专业知识的领域从业者,适用于表格、文本与视觉三类模态,并以特征归因、反事实推理与虚假特征检测等问题类型为评测场景。其价值在于把解释工具的选择、配置与自然语言综合交给智能体流程,使解释的忠实度成为可优化的目标而非事后检查项;对希望构建可扩展解释接口的研究者与工程团队,这提供了一条以奖励信号驱动解释生成的路径。

摘要未说明扰动式忠实度指标的具体计算方式、六个数据集的构成、基线配置以及增益的统计显著性,因此难以判断增益在不同任务分布下的稳定性。前沿大模型“系统性地产生不忠实解释”这一观察的模型范围与评测规模也需在正文中确认。此外,模态自适应惩罚的具体形式与作用机制在摘要中未展开,其对跨模态泛化的贡献仍待检验。

来源