跳到主要内容
返回时间线
arXiv来源发表:

Porcedda 用 Sys1Cal-v1 测出 Jev 的 Choice 概率被系统性扭曲,补回一个“不确定”分量后中位软准确率从 0.771 升到 0.978

核心概要

Porcedda 构建了 Sys1Cal-v1——一个由 92 个概率问题渲染成 365 个真/假条目的合成数据集,其命题概率由构造已知——并用总变差距离与分布重叠(软准确率)评估 Jev 的 Noul、Choice、Score 三个原语以及开源基线 SemIf,发现 Jev 的 Choice 概率被系统性扭曲,而用一个从 Score 期望估计出的潜在“不确定”第三真值分量反演校正后,Choice 的中位软准确率从 0.771 提升到 0.978。

AI-generated editorial illustration: Jev thinks "I don't know'', but doesn't say it: Introducing Sys1Cal-v1 Dataset for Probability Calibration

深度剖析

论文提出 Sys1Cal-v1:每个条目先定义一个命题并随机生成其真实概率,再渲染成六类状态(显式概率、计数频率、复合概率、条件概率、贝叶斯法则、序贯贝叶斯更新)与多种等价表述(直接陈述、计数、比率、表格、散文、嵌套状态、含干扰项状态),共 365 个渲染样例来自 92 个问题。 已有公开基准评估的是置信度校准,即预测是否过度自信或信心不足,而不是“每个返回的选项概率是否具有正确的数值含义”;Sys1Cal-v1 因构造即知真实概率,可以直接比较模型返回的分布本身。 数据集规模与构造方式在正文中明确给出(365 个渲染样例、92 个问题、六类状态、多种等价表述),并配有简化条目示例;评估指标为总变差距离与由其定义的分布重叠(软准确率)。

在同一批条目上,Jev 的三个原语校准程度不同:Noul 平均 OVL 0.918、Score 0.886、Choice 0.764,开源 Choice 式基线 SemIf 为 0.629;Jev-Choice 在真实概率较低时倾向返回很高的概率。 此前没有公开测试检验 Jev 的概率校准,也没有在同一批条目上比较同一模型的多个概率接口是否语义一致;该结果把“同一模型不同原语给出不同概率语义”这一现象显式呈现出来。 每个条目输入 10 次以估计返回概率,报告了各原语的平均 TV 与平均 OVL 表格;Score 期望与 Noul 高度一致,说明式 (1) 的投影能恢复 Noul 的概率。

论文发现 Score 期望与 Noul 概率线性相关且接近真值,但与 Choice 概率呈非线性关系,据此提出一个潜在三分量分布(真、不确定、假),从 Score 期望估计不确定分量,并拟合出 Score 到 Choice 的扭曲映射;引入该分量后对二元 Choice 概率的预测平均绝对误差下降,95% 置信区间不含零。 这把 Choice 的偏差从“单纯失准”重新解释为“把更丰富的状态压缩成被迫的二元输出”,并给出可估计的潜在结构,而非仅报告误差大小。 在 92 个潜在问题上估计全局与问题级尺度参数(全局 0.978,95% CI [0.789, 1.000];潜在 0.821,95% CI [0.760, 0.882]),并报告拟合优度与误差下降的置信区间;作者明确说明这是观测性解释,不是对 Jev 内部实现的因果断言。

该不确定模型有两种可操作用法:反演映射得到校正后的二元 Choice 概率,使平均 OVL 从 0.764 升到 0.880、中位 OVL 从 0.771 升到 0.903;保留不确定质量则得到 T/U/F 区间表示,中位区间 OVL 达 0.978,平均不确定宽度 0.116,并在一个选择性决策示例中使最优动作从“判真”变为“判假”再变为“推迟”。 校正层保留了原有 Choice 接口即可改善概率恢复,而 T/U/F 表示额外给出未解决的概率质量,把校准问题连接到选择性预测与弃权决策。 报告了原始 Choice、校正 Choice、T/U/F 三种设置下的均值与中位 OVL 表格,并给出一个带具体损失值的决策示例;作者同时提醒区间 OVL 与二元 OVL 不可直接互换,需与区间宽度一起报告。

启示与展望

Sys1Cal-v1 的定位是隔离概率语义,而不是衡量广泛的自然语言能力;其合成构造使每个条目都有精确的点概率,因而分布重叠在此设定下才有意义。该基准面向需要把概率作为一等输出的结构化决策模型,适用于成本敏感分类、自动决策系统以及允许弃权或推迟的场景。两种用法对应不同部署模式:当应用需要单一校准二元概率用于阈值、排序、期望效用决策或风险评分时,可用反演不确定校准;当系统能够表达更丰富状态时,可用 T/U/F 表示在不确定质量小时自动行动、区间跨越决策阈值时请求更多证据或转交更慢的模型或人工复核。

作者指出当前版本使用受控概率族与模板化渲染,未来版本应纳入更丰富的语言变化、对抗性改写、领域特定决策问题与经独立验证的自然语言表述。Score 分析依赖对 10 级有序分布的一维投影(期望),其他摘要方式或直接评估完整有序分布可能暴露额外结构。不确定模型被明确界定为 Score 与 Choice 关系的观测性描述,而非对 Jev 内部实现的因果断言:结果说明 Choice 表现得像是把更丰富状态压缩成被迫的二元输出,且推断出的未解决质量对校准与决策有用,但这指示而非证明 Jev 内部显式表示隐藏的第三真值。此外,表示敏感性可能隐藏在聚合校准之下,模型可以在平均误差尚可的同时因等价表述不同而改变概率,因此表示敏感性与区间宽度需要与主指标一并阅读。

来源