跳到主要内容
返回时间线
arXiv来源发表:

60篇ICLR投稿改写1260个版本后,AI审稿人暴露“假稳健”,SciCore双分支把ICC提到0.775

核心概要

作者提出“修辞稳健性”这一联合要求(同一论文在保内容改写下判断稳定、且不同论文之间仍可区分),构建含60篇匿名ICLR 2026投稿、10种修辞条件、共1260份全文稿的RobustReview基准并评测30种审稿配置,发现低改写敏感度常与跨论文打分塌缩并存(“假稳健”),且人类对齐与修辞稳健性排序不一致;据此提出SciCore双分支审稿器,将全文判断与从抽取的“科学内核”结构化记录作出的判断等权平均,在GPT-5.5主对比中取得领先的联合稳健—区分表现(ICC 0.775、SPR 0.652、区分度0.726),并保持有竞争力的人类对齐(H-MAE 1.072)。

AI-generated editorial illustration: A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

深度剖析

论文把“修辞稳健性”形式化为两个互补要求:同一论文在保内容改写下的组内稳定,以及不同论文之间的区分能力,并把人类对齐作为独立维度单独测量。 以往AI审稿评测主要看人类对齐、评审质量或分数预测,改写敏感性多被当作孤立偏差处理;这里把稳定与区分绑定为一个联合指标族(MAD、Drift SD 与 ICC、SPR、区分度)。 基准由60篇匿名ICLR 2026投稿构成,按人类均分六个区间各抽10篇,10种修辞条件各由GPT-5.5与Claude Opus 4.8独立生成两个变体,共1260份全文稿;改写保留引用、图表与编译结构,自动与人工保真审计显示五个维度上核心技术内容大体保留。

基准揭示“假稳健”:改写引起的分数漂移很低,但跨论文区分同时塌缩。 这指出仅看组内稳定性会把“给所有论文打相近分数”误判为稳健,因此稳健性必须与区分度联合解读。 Gemini-3.5-Flash-Lite在Standard下MAD最低(0.205),但ICC仅0.199、区分度0.511接近随机;DeepReviewer与OpenJudge漂移较低,ICC分别只有0.161与0.239;在科学内核分支上,Core-Standard与Core-Strict给出恒定置信度分数,SPR为零。

人类对齐与修辞稳健性会给出不同的审稿配置排序,且“只强调看内容”的提示协议不能跨模型稳定提升稳健性。 说明人类一致率不能替代配对改写评测,内容聚焦审稿不是靠提示词就能解决的问题。 GPT-5.5在Strict下人类对齐最好(H-MAE 1.078、Spearman 0.529),而Persistent人类对齐较弱但ICC、SPR、区分度更高;Persistent相对Standard只有GPT-5.5在五项稳健指标上全部改善,Claude Sonnet 5降低MAD与Drift SD却拉低ICC、SPR与区分度,其余骨干变化不一。

SciCore把全文审稿与“科学内核”审稿等权平均,在GPT-5.5主对比中取得领先的联合稳健—区分表现并保持有竞争力的人类对齐。 与仅靠指令忽略修辞不同,该方法先把稿件转成内容归一化的结构化科学记录再评审,并保留全文分支;消融显示直接评审科学内核优于先重建论文,且审稿策略在表示固定时仍影响稳定与区分的平衡。 SciCore在ICC 0.775、SPR 0.652、区分度0.726上领先,H-MAE 1.072最低、Spearman 0.488次高;相对Manuscript-Strict,融合把MAD从0.766降到0.476、ICC从0.632升到0.775,配对论文族自助法支持五项稳健指标改善;科学内核表示诊断中同源匹配相似度0.978,跨论文对照0.616–0.619。

启示与展望

这项工作面向使用或设计AI审稿辅助的研究者与会议流程:它给出一个可复用的受控全文改写基准与一套联合指标,使“改写后判断是否漂移”和“是否仍能区分论文”可以同时被测量;SciCore则提供一种在保留全文审稿的同时加入内容归一化判断的实现路径,等权融合无需调参、无需额外融合调用,适合作为默认设计。结果适用于ICLR 2026风格、有匹配arXiv源码的全文投稿与所评测的模型与协议;科学内核分支的跨骨干实验显示的是分支层面的部分迁移,最终融合仅在GPT-5.5上评测。

改写被设计为保留所报告的科学内容,但作者说明无法保证完全等价,复杂条件下自动保真审计存在非零不匹配率,残余内容差异可能贡献观测到的分数变化;人类均分只提供有限外部参照,不刻画审稿人之间的分歧;科学内核抽取可能遗漏或误读细节,等权融合假设两个分支分数在同一量表上可比;跨骨干实验同时改变抽取与评审,未分离两个阶段,也未测试最终融合的跨骨干表现;主实验采用单次评审,稳健性指标包含随机生成波动。此外,本次读取的文本中部分附录表格(如自助法区间表与部分完整结果表)内容为空,因此这些具体数值无法在此总结。

来源