跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

HDPO 让大模型先列出候选解法再择优推理,据报告同时提升推理表现与候选解多样性

该工作提出 Hint-Guided Diversified Policy Optimization(HDPO),让模型先列出所有潜在候选解法大纲作为提示,再选出最可靠的一条继续推理,方法由 Cold Start for Structured Reasoning 与 Hint-Guided Diversified Reinforcement Learning 两个阶段组成,以激励模型沿“propose-select-think”轨迹生成多样且可靠的解;实验结果显示 HDPO 有效提升了大模型推理能力,并增强了候选解的多样性以及模型识别可靠解的能力。