跳到主要内容
返回时间线
arXiv来源发表:

onPanda 用“定位—改正—续写”的 token 级标注把中位标注时间压低 51.5%,并开源 Panda-CVL 数据集与基准

核心概要

该工作提出 onPanda:标注者在阅读模型回复时定位第一个不合适的 token,从模型候选 token 中选取替代或自由输入正确文本,系统截断其后内容并从修正前缀继续生成,循环往复;一项小规模对照研究显示其中位标注时间比人工后编辑减少 51.5%,产出数据中 97.0% 的 token 由模型生成,并附带位置精确、正负成对的 token 级修正监督,同时开源了中文视觉语言数据集 Panda-CVL 与 token 级修正基准。

AI-generated editorial illustration: onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction

深度剖析

onPanda 把标注交互压缩为“定位—改正—续写”循环:标注者只需找到第一个不合适的 token,点击模型 top-20 候选(默认)中的替代项,或双击后自由输入正确文本,系统随即截断该位置之后的内容并从修正后的前缀继续生成。 此前的对齐数据管线要么从零手写或人工后编辑(成本高且产生 off-policy 数据),要么做回复级偏好排序(监督粒度粗、受限于模型已能采样出的候选);onPanda 把“改正前缀再重生成后缀”这一交互(此前见于交互式机器翻译的 Predictive Translation Memory 与 INMT)带入通用对齐数据标注,并扩展到多模态与结构化 agent 场景。 论文给出系统设计与实现细节:流式返回 logprobs、记录每个 token 的采样概率与 top-20 候选、按字素边界把 token 流分组成可读 chunk、修正后保留修正点之前的 token 不重新生成;自由输入文本通过一次 prompt_logprobs 请求重算概率。这些是系统能力描述,效率结论来自 3.1 节的对照实验。

在 3 名标注者、21 条图像描述提示、拉丁方轮换三种方法的对照实验中,onPanda 的中位标注时间为 330 秒/提示,比 POTATO 的 681 秒低 51.5%,与 Argilla 的 336 秒相当;均值 515.6 秒则分别比 POTATO(711.1 秒)和 Argilla(684.5 秒)低 27.5% 与 24.7%。 论文把效率增益部分归因于“续写”:同一处幻觉或错误常在回复中反复出现,后编辑必须逐处发现并修正,而 onPanda 只改第一次出现、后续生成与修正保持一致。质量侧 onPanda 取得最高成对胜率 66.7%,另有一项匿名人工比较显示人类评估者在 54.8% 的成对比较中更偏好 onPanda 而非 POTATO。 对照实验规模不大(3 名标注者 × 21 条提示,单一 rollout 模型 Qwen3.5-35B-A3B,温度 0.7、top-p 0.8),且论文自述比较的是完整工作流,难以区分增益来自界面、范式还是二者组合;胜率由 GPT-5.5 双向成对评判,人工比较规模较小。

产出数据保持较高的 on-policy 保真度:onPanda 与 Argilla 的困惑度为 1.181 与 1.161,均在基线 1.171 的 1% 以内且处于重采样噪声范围,而 POTATO 为 1.596;同时 onPanda 与 POTATO 的 SFT 覆盖率均为 100%(21/21),Argilla 仅 52%(11/21),onPanda 还平均每提示导出 7.43 对偏好数据,高于 Argilla 的 6.00 与 POTATO 的 0.95。 偏好排序受限于模型已能采样出的候选,当模型无法采样出好回复时纠正信号有限;onPanda 的自由输入回退让标注者可以注入模型自身无法生成的正确文本,只在少数超出模型能力的位置偏离分布,从而在保持分布接近的同时达到 100% 的 SFT 覆盖。 PPL 以每条提示独立采样四次 rollout 的均值为基线,论文称逐提示 PPL 在多次 rollout 间波动约在重采样噪声量级;覆盖率与偏好对数为该实验内的直接计数。

论文开源了 Panda-CVL:一个以中文为主的视觉语言数据集,共 7,491 个标注会话(训练 6,839、测试 652),辅助 rollout 由 32B 稠密 VLM step-1o-turbo 生成;配套基准把一次 token 级修正拆成判断是否合格、定位首个错误 token、给出替换三个子任务,在 652 条测试对话上展开为 2,126 个评测实例(652 条合格、1,474 条不合格)。 评测采用与 tokenizer 无关的协议:用 Qwen3.6 tokenizer 计算修正三元组,预测正确当且仅当模型生成的修正与真值负样本构成的三元组完全一致。结果显示 token 级修正对所有被测模型都很难,最佳 F1 仅 17.09%(GPT-5.5),GPT-6 取得最高 Loc.-NG 24.46% 与 Corr.-NG 15.83%,九成以上推理模型 Format 超过 90% 但 Corr.-NG 均低于 16%。 基准结果来自附录 A 的 Table 3,覆盖 9 个推理模型与 1 个 instruct 模型;附录 B 的多参考分析显示人类位置一致率在精确匹配下为 30.95%(随机基线 0.20%),四 token 容差下为 44.44%(约 1.84%),位置相同时替换 token 一致率为 69.44%。

启示与展望

该工具面向需要构建 on-policy SFT、偏好与过程奖励数据的标注团队与数据平台:轻量网页模式可静态托管、无需数据库,也可作为组件嵌入既有数据平台。它适用于模型回复局部逻辑大体成立、只需在少数位置干预的场景,覆盖纯文本 LLM、多模态与结构化 agent 轨迹;agent 场景通过 MCP 连接外部工具与 harness,工具调用可配置为经标注者批准后执行。论文同时给出可复用的公共资源:Panda-CVL 数据集与 token 级修正基准,供社区研究这类新数据形态。

对照实验规模有限(3 名标注者、21 条图像描述提示、单一 rollout 模型),用户研究参与者均来自内部标注团队,质量评估主要依赖 LLM-as-a-judge 并辅以一项小规模人工比较;论文自述比较的是完整工作流,难以区分增益来自界面、范式还是二者组合。token 级修正的效率与 on-policy 优势建立在“稀疏错误”前提上,当模型远达不到目标任务、修正变得密集时两项优势都会减弱;on-policy 属性也是相对于标注时的 rollout 模型而言,用于训练不同模型或权重持续更新时收益会衰减。论文明确说明尚未通过训练实验验证 token 级修正信号的下游训练收益,也未开展受控的 agent 研究,agentic 证据限于系统能力与部署统计。此外,附录 B 显示人类位置一致率在精确匹配下为 30.95%、四 token 容差下为 44.44%,替换 token 一致率为 69.44%,说明参考标注既有一致性也存在多样性,这为解读单参考精确匹配分数提供了背景。

来源