跳到主要内容
返回时间线
arXiv来源发表:

SWR 用 500 个科学软件工作流自监督生成训练环境,使 Qwen3.8-27B 在 Terminal-Bench 2 上从 47.94% 提升到 53.56%

相关研究与后续进展

核心概要

作者提出 software-in-the-loop reconstruction(SWR)自监督框架,从已有软件工作流中自动获取参考输出与验证目标,在 500 个工作流、46 个软件家族、六个领域上实例化,用 Qwen3.8-Max 三次尝试解出 838 个任务并得到 1,422 条已验证轨迹,过采样为 3,000 条重建训练样本,监督微调使 Qwen3.8-27B 在 Terminal-Bench 2 上的平均表现从 47.94% 提升到 53.56%,并在四项报告评测上取得四个等 token 语料对照中的最高均值。

Source-provided article image: Self-Supervised Scaling of Terminal Environments for Scientific Domains
Figure 2 ·

Figure 2 : Software-in-the-loop reconstruction. Public observations are the input–output examples released to the agent. They guide construction of a reusable program. Withheld inputs supply the reference outputs used for verification.

arXiv

深度剖析

提出 software-in-the-loop reconstruction:把已有可执行软件工作流当作参考行为来源,对每个工作流执行多种输入配置,并划分为公开观测与隐藏评测两部分。 以往为终端智能体构建训练环境需要为每个任务单独编写可执行参考行为和领域专用验证器,重复工程量大且难以复用;SWR 改为从现有软件工作流中直接取得参考输出与验证目标。 摘要给出框架的完整流程描述:给定指令、输入模式与公开输入—输出观测,智能体在无法访问源工作流的情况下构建可编辑程序,并在隐藏配置上与工作流输出比对。

设计分层验证器,结合领域专用语义比较、结构有效性与反捷径检查,并允许公开反馈支持迭代修改。 验证不再只判断表面是否合理,而是区分语义正确性与看似可信的产物,同时用反捷径检查约束候选程序。 摘要明确列出验证器的三个组成部分与公开反馈的迭代作用,但未给出各组件在实例化中的权重或消融数据。

在 500 个工作流、46 个软件家族、六个领域上实例化 SWR,Qwen3.8-Max 在每任务三次尝试下解出 838 个任务,产生 1,422 条已验证轨迹,过采样为 3,000 条仅重建训练样本。 该构造允许继续加入工作流与配置,而无需为每个任务编写参考解,因此监督信号可以随已有软件规模扩展。 摘要给出工作流数、软件家族数、领域数、解出任务数、已验证轨迹数与训练样本数等具体计数。

用这些样本对 Qwen3.8-27B 做监督微调,Terminal-Bench 2 平均表现从 47.94% 提升到 53.56%(三个随机种子),并在四项报告评测上取得四个等 token 语料对照中的最高均值。 结果指向现有科学软件可作为终端智能体可扩展且经行为验证的监督来源,而不必依赖人工逐任务编写环境。 摘要报告了三个种子下的均值变化与四项评测上的对照比较,但未列出各评测的具体数值、方差或统计检验。

启示与展望

该工作面向需要终端智能体在科学与其他专业领域执行任务的场景,适用于存在可执行软件工作流、且其输入输出可被结构化记录的条件。受益者包括为终端智能体构建训练环境的工程团队,以及希望复用既有科学软件而非逐任务编写参考解的领域开发者。摘要所述构造允许在不编写逐任务参考解的前提下继续加入工作流与配置,因此其扩展路径是把更多已有软件纳入同一自监督流程。所报告的微调收益针对 Qwen3.8-27B 与 Terminal-Bench 2 及四项报告评测,属于该设置下的结果。

摘要未列出四项报告评测各自的具体数值、方差或统计检验,也未说明分层验证器三个组成部分的权重与消融情况,因此验证器各环节的相对贡献仍是开放问题。六个领域与 46 个软件家族的具体构成、公开观测与隐藏评测的划分比例、以及反捷径检查覆盖的捷径类型,摘要均未展开。此外,本次读取范围仅为摘要,未包含正文、图表与附录,上述细节无法从现有文本核实,读者若需评估可迁移性应查阅原文相应部分。

来源