在思维链提示下直接读取答案标签logits,Qwen2.5-VL-7B在ScienceQA上从80.76%跌至45.48%,且93.54%的预测落在第一个选项槽位
核心概要
该工作指出一种被称为“CoT-prefix scoring”的评测做法——在提示中加入思维链推理线索、却在模型生成任何推理内容之前就读取答案标签logits——并报告在ScienceQA上Qwen2.5-VL-7B的准确率从80.76%降至45.48%,在五种选项内容排列下93.54%的预测选择第一个槽位,而条件匹配的线性探针可从相同隐藏状态恢复78.94%、自由生成可恢复75.24%,词汇与层级诊断显示概率质量转向续写词元而答案信息在后期层仍线性可及,说明该效应是评测接口错配而非模型知识缺失。
Figure 1: A single suffix creates an event mismatch. Direct prompting requests and scores B; the CoT prefix requests a rationale, so immediate label scoring can return A even when free generation and a matched probe recover B.
arXiv深度剖析
论文识别并命名了“CoT-prefix scoring”这一评测接口错配:评分器在提示中附加推理线索,却在模型生成任何理由之前读取答案标签logits。 此前对思维链的讨论多聚焦于推理是否提升能力,这里把问题定位到“请求的输出事件”与“被评分的输出事件”不一致这一评测环节。 以ScienceQA上Qwen2.5-VL-7B的对比为例,准确率由80.76%降至45.48%,并配合五种选项内容排列的槽位统计。
该错配下模型预测强烈偏向第一个选项槽位:在五种选项内容排列中,93.54%的CoT-prefix预测选择第一个槽位。 把准确率下降与位置偏置联系起来,说明下降并非随机噪声,而是与选项排列相关的系统性行为。 基于五种选项内容排列的预测分布统计。
答案信息在提示前缀之后往往仍然存在:条件匹配的线性探针从相同隐藏状态恢复78.94%,自由生成恢复75.24%。 用两种独立读出方式表明,直接读取答案标签logits的失败并不等于模型不知道答案。 线性探针与自由生成两条路径在同一隐藏状态上的恢复率对比。
词汇与层级诊断给出机制解释:概率质量转向续写词元,而答案信息在后期层仍线性可及;该效应在不同数据集与模型上以不同严重程度重现,但并非普遍存在。 把现象从单一模型扩展到跨数据集、跨模型的复现观察,同时明确其非普遍性。 词汇分布与层级探针诊断,以及跨数据集与模型的重复观察。
启示与展望
这项工作面向使用思维链提示进行多选评测的研究者与基准维护者,适用场景是评分器在模型生成理由之前读取答案标签logits的流程。它给出的可操作方向是:让被请求的输出事件与被评分的输出事件对齐,或在读取答案时采用条件匹配的探针与自由生成等替代读出方式。跨数据集与模型的重复观察提示该检查可推广到其他多选VLM评测设置,但文本明确说明该效应并非普遍存在,因此适用范围需按具体设置判断。
读者仍需关注:该效应在不同数据集与模型上的严重程度差异由哪些因素决定;条件匹配线性探针与自由生成两种恢复路径在何种条件下更接近真实能力;以及当被请求与被评分的输出事件对齐后,分数会稳定在什么水平。由于本次仅基于摘要级文本,具体的数据集清单、模型清单、探针设置与统计细节未在文本中展开,这些属于需要查阅原文才能确认的开放问题。
