跳到主要内容
返回时间线
Scientific Reports来源发表:

用大模型对散裂中子源三台谱仪的历史提案做两两比较排序,其排名与人工排名正相关且识别高发表潜力提案的能力不逊于人工,成本低两个数量级以上

核心概要

该研究在橡树岭国家实验室散裂中子源(SNS)三台谱仪(EQ-SANS、CNCS、POWGEN)的历史通用用户提案上,用大语言模型对同一运行周期内每一对提案做两两偏好判断,再用Bradley-Terry模型把胜负结果转成排名,结果显示大模型排名与人工排名正相关(Spearman ρ 约0.2–0.8,剔除10%离群后提升到≥0.5),在识别高发表潜力提案上与人工评审无统计显著差异,成本却低两个数量级以上,并能用嵌入模型以线性复杂度做提案相似度分析。

AI-generated editorial illustration: LLMs can assist with proposal selection at large user facilities

深度剖析

提出并验证了用大模型做两两偏好比较、再用Bradley-Terry模型把胜负结果转成提案排名的流程,在SNS三台谱仪过去20个运行周期的历史提案上,大模型排名与人工排名呈正相关,Spearman ρ 约0.2–0.8,剔除10%离群提案后提升到≥0.5。 以往大模型用于同行评审多是对单篇稿件做绝对质量评估,而提案遴选关心的是提案之间的相对强弱;该工作把比较任务拆成两两偏好判断,用Bradley-Terry模型从胜负结果估计相对强度,从而绕开人工评分跨提案相关性弱的问题。 基于SNS三台代表性谱仪(EQ-SANS、CNCS、POWGEN)过去20个运行周期的历史提案与人工评分记录,逐周期计算Spearman秩相关,并报告了剔除离群提案后的变化。

以提案关联的发表记录作为参照,大模型排名与人工排名在识别高发表潜力提案上无统计显著差异:EQ-SANS的发表指标为0.481±0.079(大模型)对0.474±0.110(人工),POWGEN为0.542±0.106对0.514±0.093,CNCS两者均为0.516。 该工作把排名效果与提案后续发表产出挂钩,用折扣发表数(一篇论文关联K个提案时计1/K)构造发表指标,为排名质量提供了一个独立于人工评分的参照。 仅纳入至少4个有关联发表提案的运行周期以提高统计显著性,并报告了各谱仪发表指标的均值与标准差;作者也指出历史接受决定基于人工排名,结果预期偏向人工排名。

成本估算显示,按美国劳工统计局工资数据与模型token价格计算,人工每份提案评审约54.9美元,大模型每次两两偏好比较约0.0046美元;在典型提案规模N∈[30,70]下,人工成本是大模型的346至823倍,即大模型方案约为人工个体评分方案的0.12%–0.29%。 以往关于大模型辅助评审的讨论多停留在能力层面,该工作把两两偏好带来的O(N²)工作量与人工个体评分的O(N)工作量放在同一成本框架下比较,给出可量化的成本差距。 成本输入来自美国劳工统计局2025年数据(博士后工程教师年薪119,340美元、周均工作41.8小时)与所用模型(Gemini-2.5-flash)的token单价,token用量统计来自本工作全部两两比较运行;作者说明每次评审约1小时是粗略估计,但成本差距量级足够大。

用大模型嵌入模型(Qwen3-embedding-8b,4096维)把每份提案转成向量后,可通过余弦相似度做提案相似度分析,计算复杂度为O(N)而非人工的O(N²);在EQ-SANS的25A与25B周期中,最高相似度点分别对应一份修订后重投的提案,以及两位不同负责人提交的同主题提案。 提案相似度检查(查重、查重叠)在人工评审中因认知负荷与疲劳难以稳定完成,该工作把这一任务转成一次前向传播加批量点积,使大规模相似度分析成为常规操作。 在EQ-SANS 25A与25B周期的提案上给出相似度矩阵热图,并指出最高相似度点对应的具体情形(重投、同主题不同负责人);相似度阈值需人工设定后再交由人工复核。

启示与展望

该结果面向大型用户装置(如SNS)的通用用户提案遴选场景,使用同一运行周期内的历史提案与人工评分记录,方法链条为PDF经OCR转markdown、大模型两两偏好判断、Bradley-Terry模型估计相对强度,并可选地加入嵌入向量相似度分析。作者指出该框架不限于SNS,可推广到ORNL其他装置、其他国家实验室以及DOE、NSF、NIH等资助机构;对提案规模很大的批次,比较矩阵可以稀疏化并优化配对选择。作者提出的下一步方向包括扩大实验规模到更多装置、测试不同大模型,以及用历史提案与发表数据微调模型以预测提案的发表可能性。

发表指标仅覆盖被接受的提案,且历史接受决定基于人工排名,因此该指标对人工排名存在预期偏向;作者也指出提案排名缺乏真值。成本估算中每次评审约1小时为粗略估计,作者说明该估计承载了大部分不确定性。相似度分析中阈值需人工设定,最高相似度点对应的重投与同主题情形来自具体周期示例。此外,本文为全文解析,图表中的具体数值细节(如各周期散点与热图的逐点数值)未在正文文字中逐一给出,若需逐周期核对仍需查阅原图。

来源