npj Digital Medicine 针对Qian等人发现单一大模型能生成可接受的知识型题目但在高阶推理题上表现不足,本文提出将题目开发分解为起草、评审与迭代对抗式修订的专门智能体架构MAID,并在中国国家执业医师资格考试题目的双盲配对评价中,由14位来自7个医学学科的专家对25对匹配选择题共350次题目级观察进行强制二选一比较,多智能体生成题目获得57.7%的专家偏好(95% CI [52.5%, 62.8%]),显著高于单模型基线的42.3%(95% CI [37.2%, 47.5%];χ²(1)=8.33,p=0.004),配对t检验亦显示专家个体层面一致偏好多智能体输出(均差=3.86,SD=5.12,t(13)=2.81,p=0.0
针对Qian等人发现单一大模型能生成可接受的知识型题目但在高阶推理题上表现不足,本文提出将题目开发分解为起草、评审与迭代对抗式修订的专门智能体架构MAID,并在中国国家执业医师资格考试题目的双盲配对评价中,由14位来自7个医学学科的专家对25对匹配选择题共350次题目级观察进行强制二选一比较,多智能体生成题目获得57.7%的专家偏好(95% CI [52.5%, 62.8%]),显著高于单模型基线的42.3%(95% CI [37.2%, 47.5%];χ²(1)=8.33,p=0.004),配对t检验亦显示专家个体层面一致偏好多智能体输出(均差=3.86,SD=5.12,t(13)=2.81,p=0.0
针对Qian等人发现单一大模型能生成可接受的知识型题目但在高阶推理题上表现不足,本文提出将题目开发分解为起草、评审与迭代对抗式修订的专门智能体架构MAID,并在中国国家执业医师资格考试题目的双盲配对评价中,由14位来自7个医学学科的专家对25对匹配选择题共350次题目级观察进行强制二选一比较,多智能体生成题目获得57.7%的专家偏好(95% CI [52.5%, 62.8%]),显著高于单模型基线的42.3%(95% CI [37.2%, 47.5%];χ²(1)=8.33,p=0.004),配对t检验亦显示专家个体层面一致偏好多智能体输出(均差=3.86,SD=5.12,t(13)=2.81,p=0.0
针对Qian等人发现单一大模型能生成可接受的知识型题目但在高阶推理题上表现不足,本文提出将题目开发分解为起草、评审与迭代对抗式修订的专门智能体架构MAID,并在中国国家执业医师资格考试题目的双盲配对评价中,由14位来自7个医学学科的专家对25对匹配选择题共350次题目级观察进行强制二选一比较,多智能体生成题目获得57.7%的专家偏好(95% CI [52.5%, 62.8%]),显著高于单模型基线的42.3%(95% CI [37.2%, 47.5%];χ²(1)=8.33,p=0.004),配对t检验亦显示专家个体层面一致偏好多智能体输出(均差=3.86,SD=5.12,t(13)=2.81,p=0.0