arXiv 2026年10月5日作者提出 software-in-the-loop reconstruction(SWR)自监督框架,从已有软件工作流中自动获取参考输出与验证目标,在 500 个工作流、46 个软件家族、六个领域上实例化,用 Qwen3.8-Max 三次尝试解出 838 个任务并得到 1,422 条已验证轨迹,过采样为 3,000 条重建训练样本,监督微调使 Qwen3.8-27B 在 Terminal-Bench 2 上的平均表现从 47.94% 提升到 53.56%,并在四项报告评测上取得四个等 token 语料对照中的最高均值。作者提出 software-in-the-loop reconstruction(SWR)自监督框架,从已有软件工作流中自动获取参考输出与验证目标,在 500 个工作流、46 个软件家族、六个领域上实例化,用 Qwen3.8-Max 三次尝试解出 838 个任务并得到 1,422 条已验证轨迹,过采样为 3,000 条重建训练样本,监督微调使 Qwen3.8-27B 在 Terminal-Bench 2 上的平均表现从 47.94% 提升到 53.56%,并在四项报告评测上取得四个等 token 语料对照中的最高均值。SWR 用 500 个科学软件工作流自监督生成训练环境,使 Qwen3.8-27B 在 Terminal-Bench 2 上从 47.94% 提升到 53.56%作者提出 software-in-the-loop reconstruction(SWR)自监督框架,从已有软件工作流中自动获取参考输出与验证目标,在 500 个工作流、46 个软件家族、六个领域上实例化,用 Qwen3.8-Max 三次尝试解出 838 个任务并得到 1,422 条已验证轨迹,过采样为 3,000 条重建训练样本,监督微调使 Qwen3.8-27B 在 Terminal-Bench 2 上的平均表现从 47.94% 提升到 53.56%,并在四项报告评测上取得四个等 token 语料对照中的最高均值。作者提出 software-in-the-loop reconstruction(SWR)自监督框架,从已有软件工作流中自动获取参考输出与验证目标,在 500 个工作流、46 个软件家族、六个领域上实例化,用 Qwen3.8-Max 三次尝试解出 838 个任务并得到 1,422 条已验证轨迹,过采样为 3,000 条重建训练样本,监督微调使 Qwen3.8-27B 在 Terminal-Bench 2 上的平均表现从 47.94% 提升到 53.56%,并在四项报告评测上取得四个等 token 语料对照中的最高均值。