跳到主要内容
返回时间线
arXiv来源发表:

小米用组内智能体评分重分配优势,让310B与1.02T代码智能体在DeepSWE上分别达到67.9和71.9

核心概要

小米提出GAGAR框架,在代码智能体强化学习中用SFT训练的智能体评分器在同一任务组内联合检查通过测试的轨迹并按五个质量维度排序,再以保和方式把优势从低质量解重分配给高质量解,在MiMo-V2.6-Flash(310B总参数)的纯代码实验中DeepSWE v1.1通过率在step 28达到62.2%、比二值奖励基线高12.1个百分点,并在Flash与Pro(1.02T总参数)的工业级混合任务RL后分别取得DeepSWE v1.1 avg@3 67.9和71.9。

AI-generated editorial illustration: Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

深度剖析

GAGAR把评分从单条轨迹的独立打分改为组内联合比较:评分器在共享工作区中同时看到任务说明、仓库、完整轨迹、提交补丁与测试输出,先看逐轮摘要定位需要细查的部分,再交叉核对补丁与仓库代码和测试日志,必要时运行针对性检查,并且负面判断必须引用补丁位置、轨迹事件或执行结果。 此前的奖励建模与评分工作多依赖固定摘要或单次文本评估,例如文中提到的Groupwise Ranking Reward使用单次、基于文本的评分器;GAGAR则对同一任务的完整实现做交互式检查,并让失败轨迹作为揭示失败模式的上下文。 论文给出评分流程与五维标准(方案适配性、实现精确性、改动最小性、意外副作用、代码库一致性)以及三档质量分层与档内排序规则,属于方法层面的完整描述;评分器本身为SFT训练所得,论文报告其平均端到端评分时间约600秒,而最初使用Claude Opus 5时约为2000秒。

GAGAR提出保和优势重分配:先按质量因子下调低排名通过轨迹的优势,再对所有通过轨迹统一乘以一个公共缩放因子,使通过子集的正优势总和恢复原值,失败轨迹优势不变,从而保持质量排序与相对权重。 论文指出,仅做质量下调而不重分配会移除正优势却不改变负优势,使负优势总量超过正优势;消融实验中下调-only运行的策略梯度损失在step 1–30平均为0.0304,而完整方法为0.0021,熵从0.359升至0.905、训练轨迹长度从47.1k升至114.1k token,完整方法则分别为0.358→0.513和46.5k→69.9k token。 该结论来自同一Flash设置下的对照消融,并给出损失、熵与长度的具体数值;论文同时给出优势空间与等价奖励空间两种表述,并说明在缩放上限生效时精确守恒不再成立。

在纯代码RL的受控实验中,GAGAR相对二值奖励基线提升了任务表现与交互效率:基线因性能快速退化在step 28停止(DeepSWE通过率从step 20的58.5%降至50.2%),GAGAR在step 28达到62.2%、高出12.1个百分点,并在step 44达到峰值63.4%;SWE-bench Pro上基线在step 16至28约59%持平,GAGAR在step 52达到62.5%。 论文把提升同时归因于质量信号与训练稳定性,并报告在共享检查点上GAGAR的轮次与token更少:step 28时DeepSWE平均轮次从132.3降至111.6、token长度从191.9k降至172.9k(降幅15.6%与9.9%),SWE-bench Pro轮次从58.4降至54.6、token从79.9k降至68.6k(降幅6.5%与14.1%)。 结果来自Flash的纯代码RL对照,训练批大小128、每提示16条rollout,评测每任务三次采样并报告avg@3;论文说明基线与GAGAR在相同设置和共享训练步上比较。

在工业级混合任务RL中,GAGAR被接入MiMo-V2.6-Flash与MiMo-V2.6-Pro的训练,最终检查点在DeepSWE v1.1上avg@3分别为67.9和71.9,在SWE-bench Pro上分别为60.9和62.7;论文报告Pro以1.02T总参数超过2.8T的Kimi K3(DeepSWE 69.0),并在SWE-bench Pro上以62.7%超过GPT-5.6 Sol的60.5%,在DeepSWE上接近GPT-5.6 Sol的73.0%与Claude Opus 5的74.0%。 论文强调这是把质量感知重分配用于异构任务负载中的代码任务组,而非仅限纯代码训练,并称MiMo-V2.6系列由此在代码能力上具备与前沿模型竞争的表现。 该部分为工业规模运行结果,每次更新使用1,568个提示、每提示16条rollout,评分与重分配只作用于其中符合条件的代码任务组;对比数字来自论文表1。

启示与展望

这项工作面向以可执行测试提供奖励、且轨迹可长至上百轮交互的代码智能体RL场景,适用于拥有仓库上下文与执行环境的训练流程;论文在MiMo-V2.6-Flash(310B总参数、15B激活)与MiMo-V2.6-Pro(1.02T总参数、42B激活)的预RL SFT检查点上验证,并把评分与重分配接入混合任务RL中符合条件的代码任务组。对希望减少开发者评审与返工、追求精确且可合并实现的团队,这提供了一条把额外算力投向评分器以识别值得学习行为的路径;论文还提到正在探索轮级信用分配,以及把零和重分配用于不同评分器、惩罚机制与优势调整策略。

评分器由SFT训练得到,论文报告其平均评分时间约600秒且保持良好准确率,但评分质量本身如何随任务分布变化、以及评分结果不可用时回退到原始优势的频率,仍需在更多设置中观察;论文说明缩放上限生效时精确守恒不再成立,此时正优势总和与失败轨迹优势未必保持,这一分支的实际影响值得关注;质量审计基于30个DeepSWE任务的固定随机样本,由Claude Opus 5联合评审,样本规模有限;混合任务RL的对比数字来自论文表1,外部基线模型的训练与评测细节不在本文范围内。此外,本次读取为全文,但公式与表格在文本中以占位形式出现,具体系数与完整表格数值需回到原文核对。

来源