跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

元智能体生成的终端任务让9B模型在20步内达到81.3%平均pass@2,加入困难任务后降至20.6%

该工作提出一个由前沿模型(如Claude Opus)作为元智能体生成终端任务与验证器的流水线,诊断出基准无效、执行框架脆弱和奖励错配三类失败,并通过提示重设计与上下文扩展将基线可解性提升5.6倍;一个9B模型在Claude Opus生成的任务上20步内平均pass@2饱和于81.3%,而在不改变训练配置的情况下加入困难任务后降至20.6%,表明可解性区间是模型特定的。