跳到主要内容
返回时间线
arXiv来源发表:

七款开源权重模型5.25万次判断显示重复评分高度相关,作者提出beta-二项潜类模型将95%区间覆盖率提升至0.90

相关研究与后续进展

核心概要

作者用七款1B至32B开源权重模型在公开基准上、三种提示条件下每项十次采样共52,500条判断,检验潜类模型关于重复评分条件独立的假设,发现平衡划分上组内相关为0.50至0.93、十次评分仅相当于1.07至1.81次独立评分,据此提出带单一相关参数的beta-二项潜类模型,并证明其及协变量、处理效应与部分标注数据扩展的可识别性,在平衡划分上把流行率与假接受率的标称95%区间覆盖率提高到0.90。

AI-generated editorial illustration: Quantifying and Correcting Measurement Error in LLM-Generated Classifications: A Beta-Binomial Latent Class Model for Correlated Repeated Judgments

深度剖析

论文直接检验了潜类模型用于LLM重复分类时的条件独立假设,报告在公开基准平衡划分上组内相关介于0.50与0.93之间,因此十次评分所携带的信息仅相当于1.07至1.81次独立评分。 此前将重复评分聚合为流行率与错误率估计的做法默认评分在给定真实标签下条件独立,该工作用52,500条判断、七款1B至32B开源权重模型、三种提示条件、每项十次采样的实测数据量化了这一假设的偏离程度。 证据来自公开基准上带人工标签的52,500条判断,覆盖七款模型与三种提示条件,并给出组内相关与等效独立评分数的区间估计。

在存在上述相关时,采用二项似然的潜类模型既失校准又有偏:其假接受率的标称95%区间在42个设定中没有一个包含由人工标签计算的值,且在全部42个设定中低估总错误率。 这把条件独立假设的违背从理论担忧转化为可观测的推断后果,说明常规潜类建模在该场景下的区间覆盖与点估计同时失效。 结论基于42个设定下与人工标签计算值的直接比对,覆盖区间是否包含目标值以及总错误率是否被低估两个可核验指标。

作者提出带单一相关参数的beta-二项潜类模型,证明其可识别性以及向协变量、处理效应和部分标注数据的扩展可识别性,并在平衡划分上把流行率与假接受率的标称95%区间覆盖率提升到0.90。 相对二项似然版本,新模型以单一相关参数吸收重复评分间的相关性,同时给出可识别性证明,使相关结构下的推断具备明确条件。 支持来自平衡划分上的区间覆盖率结果(0.90)以及围绕识别条件设计的模拟研究。

潜状态的恢复由模型在真阳性与真阴性项目上接受率之差决定,该差值等于Youden's J,并与恢复程度近乎单调相关(Spearman相关0.96);当该差值较小时,有标注子集能改善流行率估计但不能改善单个项目的分类。 这给出了判断重复评分能否恢复潜在标签的单一可解释量,并区分了标注数据在总体层面与个体层面上的不同作用。 证据为Spearman相关0.96的近乎单调关系,以及关于有标注子集在两类任务上不同效果的观察,另有围绕识别条件的模拟研究支持。

启示与展望

该结果面向以重复LLM评分估计结果流行率与模型错误率的研究与工程场景,适用于公开基准上带人工标签、每项多次采样的设定,并已扩展到协变量、处理效应与部分标注数据。对使用者而言,它提供了在相关结构下进行测量误差校正的建模框架,并给出以真阳性与真阴性接受率之差(即Youden's J)判断潜状态可恢复程度的操作依据;当该差值较小时,有标注子集可用于改善流行率估计。

组内相关与覆盖率结果报告于公开基准的平衡划分,其他数据分布与任务下的表现仍需考察;可识别性结论依赖模型设定与识别条件,实际应用中这些条件是否满足需要逐案判断;当真阳性与真阴性接受率之差较小时,个体项目分类的改善空间有限,此时标注数据的价值主要体现在总体估计上;模拟研究围绕识别条件设计,其结论向真实标注噪声与更复杂提示条件的推广仍是开放问题。

来源