DUCX 把胸片智能体的不公平拆到工具暴露、工具切换与推理三个环节,发现端到端差距之外还有最高约50%的工具条件差距
核心概要
该工作以 MedRAX 为实例,对使用工具的胸片问答智能体做分阶段公平性审计,提出 DUCX 框架把端到端偏差分解为工具暴露偏差、工具切换偏差与 LLM 推理偏差,并在 CheXAgentBench 与自建的 MIMIC-FairnessVQA 上、用五个驱动 LLM 评测,发现人口学差距在端到端指标上持续存在(均等机会差最高 20.79%,最低公平-效用权衡降至 28.65%),且工具使用、切换模式与推理文本中的子群差异无法仅由端到端评测预测(例如在分割工具可用条件下,子群效用差距最高达 50%)。
Fig. 1. Overview of DUCX. (1) Dataset curation: we use CheXAgentBench and curate MIMIC-FairnessVQA into a standardized form. (2) MedRAX agent execution (ReAct): a driver LLM iteratively reasons, selects tools, and synthesizes a final answer, where we highlight multiple points where bias can be introduced (tool exposure, tool transi- tions, and final synthesis). (3) Fairness decomposition: We evaluate end-to-end fairness (ACC, ∆ACC, DP, EoD, FUT) and decompose it into tool exposure bias (gaps condi- tioned on tool presence), tool transition bias (gaps in tool routing), and LLM reasoning bias (gaps in synthesis behaviors).
· 第 3 页深度剖析
提出 DUCX 分阶段公平性分解框架,把智能体的不公平拆成工具暴露偏差(在工具被调用条件下比较子群准确率差)、工具切换偏差(用马尔可夫转移矩阵之差刻画不同子群的工具路由差异)与 LLM 推理偏差(对最终回答文本计算 JudgeGap、Hedge、Demographic 三类子群差距)。 以往医学影像公平性研究多把模型当作单一决策函数、只比较最终预测;该工作把审计对象扩展到多步智能体流程,使观察到的差距可以映射到具体环节。 框架定义明确并给出公式,在 MedRAX 的 ReAct 式执行轨迹上实现,使用非参数自助法(1,000 次重采样)报告置信区间。
在五个驱动 LLM(LLaMA3.1-8B、Ministral-3-8B、Qwen3VL-8B、Qwen3-8B、Gemini3-Flash)与两个基准上,端到端公平性差距持续存在:均等机会差最高 20.79%,最低公平-效用权衡分数降至 28.65%;Qwen3 在两个数据集上准确率分别为 69.10% 与 49.89%,同时保持较低的 ∆ACC 与 DP。 这是作者所述首个在统一设置下对 MedRAX 式胸片智能体做系统人口学公平性评测的工作,覆盖性别与年龄两个敏感属性。 结果以表格形式给出准确率、∆ACC、DP、EoD、FUT 及置信区间,并指出 DP 与子群基率紧密相关、采用前需谨慎考察。
中间行为存在无法由端到端评测预测的子群差异:在 CheXAgentBench 上分割工具的条件准确率差距最大且尾部最重,报告生成次之,而分类器与短语定位接近零;在 MIMIC-FairnessVQA 上最大差距集中在可视化工具;在分割工具可用条件下子群效用差距最高达 50%。 说明不同数据分布下“公平性瓶颈”会转移到不同工具,端到端 ∆ACC 因在异质轨迹上平均而小于最差的条件差距。 以跨驱动 LLM 的 |∆ACC| 分布(小提琴图)呈现,并同时报告各子群的工具暴露率以降低与路由的混淆。
工具切换与回答合成同样呈现子群差异:两个数据集中女性患者比男性更可能直接从分类器或报告生成器继续,MIMIC-FairnessVQA 中男性患者常在用可视化工具后再次调用分类器,年长与男性患者更频繁重复调用短语定位;推理偏差高度依赖模型,Qwen3VL 在两个数据集与两个属性上的对冲(hedging)差距均大于其他骨干,且 ∆Demo 低并不代表 ∆Hedge 或 ∆JudgeGap 低。 表明即使问题与工具输出相同,驱动 LLM 也会在不确定性表达等合成行为上产生子群相关差异,这类差异与显式人口学措辞并不同步。 切换偏差以跨 LLM 平均的转移矩阵差呈现,推理偏差以三类响应级特征的子群差距及置信区间报告。
启示与展望
该工作面向使用工具的胸片多选问答智能体,实例化为 MedRAX 的 ReAct 式单智能体流程,工具池为分类器、VQA、报告生成、分割、可视化与短语定位六类,敏感属性限于性别与年龄(阈值 60)。在此设置下,它给出从观测差距到责任环节的映射,可用于定位应优先审计或干预的工具与阶段,并配套发布 MIMIC-FairnessVQA(400 项研究、2,000 个实例,经人工核验答案)与开源代码,供研究者在同类智能体上复用该审计流程。作者指出后续工作将开发针对具体阶段的缓解方法,并把审计扩展到更广的临床任务与智能体设计。
读者仍需留意:分解结果刻画的是差距出现在哪个环节,而非环节之间的因果链条;DP 与子群基率紧密相关,作者也提示采用前需谨慎考察;推理偏差由外部 LLM 评判与模式匹配度量,不同评判模型或匹配规则下的稳定性有待观察;MIMIC-FairnessVQA 的问题由 LLM 按 MedRAX 风格模板生成并人工核验答案,其难度分布与真实临床提问的对应关系仍是开放问题;此外,工具暴露分析报告了各子群暴露率以降低与路由的混淆,但暴露与效用之间仍可能存在未观测的混杂。
