arXiv 2026年10月5日该工作提出两阶段训练框架:第一阶段让无权访问评分标准的学生模型在自身生成的prefix上匹配具备评分标准感知的教师的下一token分布(RP-OPD),第二阶段直接用评分标准奖励做强化学习;在HealthBench、ResearchQA与RubricHub Science上比较多种后训练方法并改变RL前SFT或RP-OPD的训练量,该两阶段框架在所评估方法中得分最高,且RP-OPD+RL在RubricHub Science上仅显示有限的奖励作弊迹象,而SFT+RL基线越来越多地以声称符合评分标准却未提供所需内容的方式获得高奖励。该工作提出两阶段训练框架:第一阶段让无权访问评分标准的学生模型在自身生成的prefix上匹配具备评分标准感知的教师的下一token分布(RP-OPD),第二阶段直接用评分标准奖励做强化学习;在HealthBench、ResearchQA与RubricHub Science上比较多种后训练方法并改变RL前SFT或RP-OPD的训练量,该两阶段框架在所评估方法中得分最高,且RP-OPD+RL在RubricHub Science上仅显示有限的奖励作弊迹象,而SFT+RL基线越来越多地以声称符合评分标准却未提供所需内容的方式获得高奖励。用评分标准先做在线策略蒸馏再强化学习,在健康与科学任务上取得所评估方法中的最高分该工作提出两阶段训练框架:第一阶段让无权访问评分标准的学生模型在自身生成的prefix上匹配具备评分标准感知的教师的下一token分布(RP-OPD),第二阶段直接用评分标准奖励做强化学习;在HealthBench、ResearchQA与RubricHub Science上比较多种后训练方法并改变RL前SFT或RP-OPD的训练量,该两阶段框架在所评估方法中得分最高,且RP-OPD+RL在RubricHub Science上仅显示有限的奖励作弊迹象,而SFT+RL基线越来越多地以声称符合评分标准却未提供所需内容的方式获得高奖励。该工作提出两阶段训练框架:第一阶段让无权访问评分标准的学生模型在自身生成的prefix上匹配具备评分标准感知的教师的下一token分布(RP-OPD),第二阶段直接用评分标准奖励做强化学习;在HealthBench、ResearchQA与RubricHub Science上比较多种后训练方法并改变RL前SFT或RP-OPD的训练量,该两阶段框架在所评估方法中得分最高,且RP-OPD+RL在RubricHub Science上仅显示有限的奖励作弊迹象,而SFT+RL基线越来越多地以声称符合评分标准却未提供所需内容的方式获得高奖励。