加一个冒号即可让Jev判错:请求呈现方式决定最终答案评分的假接受率
核心概要
该研究检验结构化评判请求的呈现方式是否改变候选文本编辑的效果:在200个未使用过的DROP与GSM8K来源簇上,给候选答案中随机字母后加一个冒号,在排序JSON键呈现下使Jev的假接受率从1.0%升至26.0%(三标签)和从3.0%升至26.5%(四标签),而在插入顺序呈现下两种候选变体均被拒绝;Jev在两种评分配置和两种呈现下都通过了预设控制阈值,GPT-6 Sol未观察到提示条件下的假接受。
(a) Jev, three-label grading.
arXiv深度剖析
固定候选编辑(在随机字母后加一个冒号)可在排序JSON键呈现下使Jev把明确错误的最终答案判为正确,三标签配置假接受从2/200升至52/200,四标签从6/200升至53/200。 此前短字符串评判攻击多关注标点、共享短语或控制令牌本身;这里把候选侧编辑与集成侧请求呈现方式作为交互项配对检验,并用数值参考答案独立认证错误。 200个此前未使用的DROP/GSM8K来源簇,每来源/配置16次调用,含四项干净/修订控制与字节相同重复请求;配对呈现交互经预设的按工作负载分层的零中心聚类自助法与Holm校正,达到预设模拟下限。
Jev在插入顺序与排序两种呈现、三标签与四标签两种评分配置下均通过全部预设控制阈值,但仅在排序呈现下出现冒号编辑导致的超额假接受。 说明仅凭干净控制表现无法暴露这种呈现依赖的脆弱性,控制能力与对候选扰动的稳健性可以分离。 控制阈值要求裸正确、裸错误、仅错误最终答案各至少190/200正确,有效修订至少180/200;Jev四格面板完整,全部达标。
效应集中在被分配较大数值变异的候选上:近变异合并后两种配置交互为零,远变异下三标签与四标签交互分别为正。 给出该构造的边界条件,说明效应随数值幅度、位数与文本可信度等同时变化的来源分组而不同。 每个工作负载含50个近变异与50个远变异;不同问题接受不同变异距离,因此该比较描述来源组间边界而非单一因素隔离。
GPT-6 Sol通过控制阈值,在四个提示单元中未观察到假接受,196个完整交互为零,但六个未知传输完成未重放。 提供一个生成式比较器在同一固定语法与来源面板上的对照观察,而非架构排名或总体等价性结论。 Sol使用默认推理、Standard服务层级与严格分类JSON,不提供置信度;四个主要来源因未知响应而不完整,有限面板界与总体区间分别报告。
启示与展望
该结果适用于参考感知的数值最终答案评分构造、平衡的DROP/GSM8K与近/远变异混合,以及记录的Jev服务窗口;对使用结构化评判接口、需要把候选扰动与请求呈现分开记录的评测者与集成方最有价值。它支持在集成实际使用的呈现方式下测试候选扰动,并保留已执行的请求表示,而不是只记录解码后的字段值。插入顺序呈现下观察到的零提示错误标识的是一个已测试条件,并不构成对其他编辑或输入的通用防御结论。
排序呈现同时改变多个请求对象顺序,状态位置、其他对象顺序与隐藏渲染未被分离,内部提示系数与注意力机制未被识别;效应集中在远变异组,而数值幅度、位数与文本可信度随来源一同变化。GPT-6 Sol的六个未知传输完成未重放,四个主要来源不完整,因此总体等价性未被确立。自然输出中的发生率、未来服务行为与下游后果均未测量;开放实现多数未通过能力门槛,且精度配置改变结果,因此向开放部署的迁移证据有限。
