JEV类直接决策模型在36个有序数据集上只用掉67–76%的有效标签空间,BA-LoRA后训练可把利用率从约47%提到86%
核心概要
该研究分析JEV 1.13与三个开源KEV模型(0.8B/4B/9B),在ANLI上发现JEV以74.95%准确率却把38.8%的预测和51.3%的错误都给了Neutral,进而在36个有序数据集上测得最终决策只覆盖67–76%的有效金标支持(四个名义任务为87–102%),并通过候选顺序随机化、同一批样本上把量表从K=2细化到K=14(K=14时利用率降至26–75%)、以及BA-LoRA定向后训练(八个受监督量表上金标相对利用率从约47%升至86%)表明这种“有序量表利用率偏差”是习得且可修改的决策阶段候选空间压缩。
深度剖析
论文把“有序量表利用率偏差”定义为一个总体层面的可靠性问题:最终决策系统性地只占据比同一批金标更少的有序层级,并用基于熵的有效支持利用率比值来度量。 此前关于标签先验、选项顺序和LLM评判者偏好的工作记录的是具体偏好(如低分、Neutral、某个位置),本文把关注点移到“模型与任务特定的有序量表区域被限制使用”这一共同属性上。 在40个数据集(每个5,000条、按金标分层抽样)上对四个模型做宏平均;36个有序数据集上决策仅使用67.2%(KEV-4B)至75.8%(JEV 1.13)的有效金标支持,TVD为29.8–37.5%,而四个名义任务为87–102%、TVD 6.0–18.6%。
论文用候选顺序随机化与同一批样本的量表细化,把该压缩与准确率、金标不平衡、固定位置偏差和候选数量区分开。 随机化会削弱但不消除压缩(六个有序数据集上利用率从55.3–65.0%升到67.7–73.9%,名义任务仍为–99.3%),且宏准确率变化不超过0.55个百分点;在固定样本与源分数、平衡金标支持与位置后,K从2增到14时所有模型利用率下降,K=14时降至26–75%。 顺序干预覆盖六个有序与三个名义数据集、每条样本两个随机排列;细化实验使用三个连续分数来源各1,400条,等频分箱下金标接近平衡(K=2时99.8%、K=14时97.0%),并以DBpedia作为高准确率上限参照。
论文显示该压缩是习得且可修改的:BA-LoRA定向后训练在八个受监督量表上把金标相对利用率从约47%提升到86%,同时改善准确率与有序误差。 这使候选空间压缩从诊断观察变成可操作的后训练目标,并表明它并非候选接口的固定架构限制。 在源ID与归一化文本哈希均与评测面板不相交的32,000条后训练样本上适配KEV-0.8B与KEV-4B;训练源数据集上利用率由47.4%升至86.8%(0.8B)、46.4%升至85.6%(4B),TVD由54.7%降至19.7%、52.9%降至19.0%,准确率分别提高13.0与15.3个百分点。
论文指出迁移到未受监督来源的效果依赖模型规模与来源相似度,并建议评测同时报告利用率与TVD。 它把“域内恢复”与“通用去偏”分开:4B在其余28个有序数据集上利用率升至81.3%、TVD降至27.6%,而0.8B在同一聚合上反向变化(利用率72.7%、TVD 35.1%)。 迁移结论基于完整冻结的40数据集面板;附录中15个数据集的图示按KEV-0.8B增益事后挑选,作者明确说明其仅作描述性展示。
启示与展望
该结果面向使用JEV类直接决策模型做分类、评分与自动评测的研究者与工程团队,适用于候选构成共享有序量表、相邻层级语义接近的任务;在此设定下,利用率与TVD可作为准确率之外的常规审计指标,量表细化可用于检验模型在更细层级上的决策分辨率。BA-LoRA后训练为在受监督量表上恢复候选使用提供了可复现路径,其迁移收益在更大模型上更明显,因此对拥有目标量表标注数据的团队最具直接可用性。
语义耦合以二元的有序/名义分类来操作化,因此“为何有序任务压缩更强”的解释依赖任务类型而非耦合程度的连续度量;同一批样本的量表细化只覆盖三个有序来源,其名义参照DBpedia上各模型接近上限,并非难度匹配的对照;位置结果基于每条样本两个随机排列,所有结果均为点估计;利用率比较的是预测与金标分布的有效支持大小,并不表示两者把概率质量放在相同标签上,因此需与TVD分开解读;研究覆盖一个托管系统与一个单一骨干的开源家族,且SST-5、DBpedia-14与IMDb属于KEV训练来源而作者未审计样本级重叠,这些数据集上的KEV结果可能部分反映训练暴露。
