OnePO 让基座模型免 SFT 直接强化学习适配医学领域,HuatuoGPT-3-27B 在 HealthBench Professional 达 71.4
核心概要
该工作提出 One-stage Policy Optimization(OnePO),把教师输出当作阶段性引导而非长期训练目标:用概率下限与梯度重标定强化对低概率教师 token 的学习,并在当前策略奖励超过教师输出时将其退役;仅用 20K 医学样本,OnePO 在 HealthBench(Total)达 67.2,优于同教师下的 SFT+RL 与纯 RL,并据此训练出开源 HuatuoGPT-3 系列,27B 变体在 HealthBench Professional 达 71.4。
深度剖析
论文把标准混合策略强化学习在领域适配中的两个失效模式命名为 Gradient Starvation 与 Teacher-Distribution Anchoring:前者指教师输出中信息量大的 token 因当前策略概率极低而只获得微弱梯度,后者指教师输出在策略已能超越它之后仍持续把策略拉向教师分布。 此前混合策略 RL 通常把教师输出作为持续存在的训练信号,本文将其重新表述为随策略进展而变化的阶段性引导,并用两个受控试点研究分别隔离这两种效应。 诊断由两项试点支撑:AHA-Medicine 试点在零数据泄漏下仅通过教师输出引入虚构知识,纯 RL 与混合策略 RL 均接近零,而 OnePO 更快达到上限;锚定试点从同一 2K 教师输出冷启动模型出发,仅比较是否动态退役教师输出。
OnePO 由两个机制组成:Adaptive Objective Evolution 用概率下限与梯度重标定,使低概率教师 token 获得接近 SFT 量级的梯度,并在 token 概率升高后自动退回标准 GRPO;Teacher Retirement 仅当教师输出奖励严格超过同组最优在策略奖励时才保留它。 与 SFT+RL 的两阶段流程不同,OnePO 在单一 RL 阶段内完成知识吸收与自主探索的切换,无需人工调度;与持续混入教师输出的混合策略 RL 不同,教师信号会随策略变强而自然退出。 消融显示三个组件均不可缺:去掉概率下限 HealthBench 从 65.4 降至 49.1,去掉梯度重标定降至 57.3,去掉 Teacher Retirement 降至 52.7,甚至低于纯 RL 的 59.8;退役阈值越严格最终表现越好(Max > Mean > Min > None)。
在医学领域适配中,OnePO 用 20K 训练样本在 HealthBench 与多项闭卷医学基准上一致优于同教师来源的 SFT+RL 与纯 RL;以 DeepSeek-V3.2(thinking)为教师时,OnePO 在 HealthBench Total/Hard 为 67.2/44.5,SFT+RL 为 64.5/40.7。 论文报告 OnePO 相对 SFT+RL 在 HealthBench Total 提升 2.7 分、相对纯 RL 提升 7.4 分,并指出教师质量有影响:含显式推理轨迹的 DeepSeek-V3.2(thinking)优于 GPT-5 Chat。 受控比较中三种路线使用相同训练数据、RL 算法与超参数,基座为 Qwen3-8B-Base,单节点 8 张 H200;闭卷基准采用精确匹配,开卷采用 HealthBench 官方评分流程。
同一范式扩展到 HuatuoGPT-3 系列后,9B 与 27B 变体在 HealthBench Professional 分别达 68.3 与 71.4,27B 变体在 HealthBench Total 达 70.1,论文称其超过 GPT-6 Astra 等前沿模型;跨写作与法律领域的初步实验也显示 OnePO 优于 SFT+RL。 论文把 OnePO 从受控的 8B 实验扩展到开源医学模型系列,并在写作(rubric 奖励)与法律(精确匹配奖励)两个非医学领域给出初步验证。 扩展训练在开卷侧把子集从 10K 扩到 20K 并加入 RubricHub 的 20K rubric 任务,闭卷侧扩到 30K 医学多选题,训练约 600 步;跨领域实验使用 Qwen3-4B-Base 与各 10K 样本。
启示与展望
该结果面向希望把通用基座模型适配到具体领域的训练流程设计者,尤其是同时具备可验证奖励与 rubric 奖励的医学场景。方法仍依赖两类外部信号:教师输出与奖励函数;Teacher Retirement 降低了对不完美教师的长期依赖,但弱教师或偏置教师仍可能拖慢早期学习或限制领域覆盖。论文的受控实验使用 Qwen3-8B-Base 与单节点 8 张 H200,扩展模型为 9B 与 27B,未验证 100B 以上规模;受控实验中每个提示只使用一个教师输出。作者明确说明该模型是研究原型,未经医学专业人员严格验证不应临床部署。
读者仍需关注:教师输出与奖励函数两类外部信号的质量如何影响结果,模型化评分无法完全排除奖励错配或奖励钻空子;论文的评分者验证降低了这一担忧,但不能替代专家评估。跨领域证据目前限于写作与法律,奖励设计更不成熟或专家标准难以形式化的领域仍需验证。多教师或多输出设置会改变退役动态,论文将其留作未来工作。此外,本次材料为完整正文与附录,但部分图表以文字描述形式呈现,若需核对具体曲线数值仍需查阅原文图表。
