跳到主要内容
返回时间线
arXiv来源发表:

SAIL以35B总参数、3B激活参数在SciCode与ArxivDIGESTables上取得对比最高分

核心概要

SAIL团队提出开源科学智能体模型SAIL(35B总参数、3B激活参数),通过“科学感知改进循环”让前沿模型智能体诊断其任务失败并据此从论文与代码库构建训练任务,再经监督微调、专家训练、多教师在线策略蒸馏与智能体强化学习训练;在13项评测中全面优于基座模型,并在SciCode与ArxivDIGESTables上取得对比最高分。

Source-provided article image: SAIL: Scientific Agentic Intelligence via a Science-Aware Loop
Figure 1 ·

Figure 1 : Performance across scientific benchmarks.

arXiv

深度剖析

SAIL是一个面向文献研究、科学编程与多步研究工作流的开源模型,总参数35B、激活参数3B,并释放模型与大部分训练数据。 相比同规模开源模型,它以更少参数覆盖文献检索、代码执行与端到端研究等多类科学任务,而非单一基准。 在13项评测设置中相对基座模型Qwen3.6-35B-A3B全面提升,其中LitQA-search提升37.33分、E2E-Bench Basic提升30.71分、CORE-Hard提升24.37分、E2E-Bench Hard提升21.21分;与对比的35B模型相比在12项设置上领先,LitQA2-FullText为例外。

提出“科学感知改进循环”:由前沿模型驱动的智能体分析SAIL的失败轨迹,定位缺失的科学判断,并从论文集合与科学GitHub仓库构建问题、演示与可执行任务及配套环境。 训练任务的选题与形式由模型的具体能力缺口决定,同一批论文或代码资源可随弱点变化服务于不同训练目标。 诊断覆盖文献检索中的探索与选择权衡、科学编程中的假设与推理、长程研究中的规划与修订;生成材料需对照来源与任务特定检查(含可执行验证)进行校验。

给出把上述任务整合进单一模型的训练配方与基础设施:SFT初始化、专家训练、多教师在线策略蒸馏(MOPD)与智能体强化学习,共用同一套在线策略轨迹采集与执行系统。 MOPD在学生自身轨迹(含工具观测与压缩后的上下文)上施加专家token级监督,智能体RL再以任务反馈训练多步执行,二者共享rollout与采集管线。 基础设施基于verl,分离训练引擎与rollout引擎,采用token-in/token-out接口记录输入输出token、rollout对数概率与训练掩码;长轨迹按上下文压缩切分为段但保留同一episode标识,奖励与优势按原轨迹聚合。

评测显示SAIL在SciCode与ArxivDIGESTables上取得对比最高分,并在多项任务上接近或超过更大规模开源模型。 以35B总参数在SciCode上超过744B的GLM-5.2,在12项任务的无加权平均聚合上以59.76位列第二。 SciCode得分50.35(GLM-5.2为47.57),ArxivDIGESTables为35.24(DeepSeek-V4-Flash-0731为35.13);ScholarQA-CS2为86.51(GLM-5.2为87.87);聚合分59.76对比DeepSeek-V4-Flash-0731的59.15与GLM-5.2的63.30。

启示与展望

该工作面向需要文献检索与综合、科学编程、以及涉及工具使用的多步研究流程的研究者与工程团队,尤其是希望在有限参数预算下部署开源科学智能体的场景。改进循环的适用前提是能够获得失败轨迹、可用的论文集合与科学代码仓库,以及可执行任务所需的工具与环境;评测在统一基准环境下进行,各模型使用其推荐的推理设置。

后续开发循环依赖资源集合的覆盖范围以及诊断与反馈的质量;论文指出科学假设与实验解释仅靠执行难以校验。全文以文字与表格呈现结果,图2至图6的具体内容未在文本中展开,因此对失败诊断流程与系统架构的细节理解仍需查阅原文图表。全文本问答的相对排名偏弱(91.67,与领先者相差3.57分),仓库执行与长程研究流程上最强的大模型仍保持领先,DiscoveryBench相对基座模型的提升较小。

来源