跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

DUCX 把胸片智能体的不公平拆到工具暴露、工具切换与推理三个环节,发现端到端差距之外还有最高约50%的工具条件差距

该工作以 MedRAX 为实例,对使用工具的胸片问答智能体做分阶段公平性审计,提出 DUCX 框架把端到端偏差分解为工具暴露偏差、工具切换偏差与 LLM 推理偏差,并在 CheXAgentBench 与自建的 MIMIC-FairnessVQA 上、用五个驱动 LLM 评测,发现人口学差距在端到端指标上持续存在(均等机会差最高 20.79%,最低公平-效用权衡降至 28.65%),且工具使用、切换模式与推理文本中的子群差异无法仅由端到端评测预测(例如在分割工具可用条件下,子群效用差距最高达 50%)。