SWE-Serve 用 53 个 SGLang 任务测出:同一批补丁在完整验证器下通过率 45.9%,去掉实时服务测试后升至 69.4%
核心概要
SWE-Serve 把 83 个已合并的 SGLang 拉取请求转化为 53 个可执行任务,覆盖推测解码、模型与后端启用、内核与量化、服务 API、缓存与运行时状态、分布式执行与调度六类推理工程工作,用隐藏验证器判定 AI 编码代理的补丁是否通过;在 19 个需要启动真实服务器并加载模型的任务上,同一批 627 个补丁在完整验证器下通过率为 45.9%,排除实时服务测试后升至 69.4%,即 147 个补丁由失败变为通过,说明本地检查通过并不等于完整服务路径可用。
深度剖析
SWE-Serve 把推理服务软件的仓库级改动做成可执行基准:从 83 个已合并 SGLang 拉取请求生成 53 个任务,其中 37 个来自单个上游拉取请求,16 个合并两到六个相关改动,参考解中位数修改 553 行、涉及七个文件,典型验证器含七个新行为测试与十个回归测试。 既有仓库级基准面向通用软件工程任务,推理基准多聚焦内核生成或性能优化;SWE-Serve 转而覆盖模型启用、解码、缓存、调度、服务 API 与运行时性能等完整推理服务栈。 任务筛选过程为筛查 786 个候选来源、构建 156 个可执行候选、最终纳入 53 个;每个任务在声明硬件上验证,未修改仓库必须在新行为测试上失败且回归测试继续通过,参考补丁必须通过完整验证器,并用代理生成的补丁挑战验证器后修复、收窄或剔除任务。
实时服务检查是区分补丁能否真正工作的关键:19 个任务启动真实服务器,包含 276 个实时服务测试(242 个来自或改编自 SGLang,34 个覆盖对应合并改动引入的行为),同一批 627 个补丁在完整验证器下通过率 45.9%,排除实时服务测试后为 69.4%,147 个补丁由失败转为通过。 该结果把“本地测试通过但服务器加载真实模型并处理请求时失败”这一差距量化,并给出具体案例:Gemma 4 MoE 任务中 33 个补丁有 16 个通过其他所有检查但至少一个实时服务测试失败,涉及模型加载、专家路由、文本与图像服务、带正确顺序与对数概率的批量生成。 19 个任务在声明硬件上加载所需模型并通过实时服务接口测试补丁;三个任务在 H100 上执行校准过的性能门禁;十二个任务在 CPU 上运行,41 个使用单张 NVIDIA H100。
任务跨越的运行时域数量与难度相关:把请求到输出路径分为请求处理与 I/O、调度与请求生命周期、模型执行、KV 缓存与运行时资源管理四个域后,在 11 个模型各自最佳设置下,26 个限于单一域的任务通过率 69.0%,27 个跨多域的任务通过率 47.7%,相差 21.3 个百分点,且每个模型设置都呈现同一方向。 这为“为什么某些推理工程改动更难被代理完成”提供了一个可测量的结构维度,而不仅是总体分数。 统计基于 11 个模型各自最佳设置下的任务分组比较,方向在所有模型设置中一致。
在 mini-swe-agent(仅用 Bash 的最小软件工程代理)与闭卷条件下,11 个模型、31 个模型-努力配置各跑完整 53 任务三次,单次会话上限 210 分钟与 350 步,各模型最佳配置的平均 pass@1 从 34.6% 到 75.5%;Claude Opus 5 与 GPT-5.6 Sol 均为 75%,但成本与耗时差异明显,且没有模型在六个工程家族中全部领先。 结果同时给出通过率、每任务平均成本与平均墙钟时间,显示成本与性能并不清晰对应:四个并列 64% 的模型每任务平均成本从 0.95 美元到 7.24 美元,平均墙钟时间从 25.5 分钟到 99.9 分钟;原生工具链也未提升两名领先者,GPT-5.6 Sol 在 Codex 中为 73.6%、Claude Opus 5 在 Claude Code 中为 69.8%,均低于 mini-swe-agent 下的 75.5%。 每个配置运行完整基准三次,任务仅在补丁通过声明硬件上的完整验证器时计为解决;排行榜背后的 1749 次试验全部审计,196 次被禁止的检索尝试被拦截且无一成功。
启示与展望
该工作面向评估 AI 编码代理在推理服务软件仓库级改动上的表现,适用于在声明硬件上运行 SGLang 任务的场景,并随基准发布任务环境、验证器与基线配置,供他人评估自己的编码代理。首个版本不评估其他推理引擎、多 GPU 执行或多节点服务;十二个任务在 CPU 上运行,41 个使用单张 NVIDIA H100。通过 SWE-Serve 仅表示补丁满足基准验证器,并不代表补丁或参考解可部署、可合并或获得 SGLang 维护者认可。
实时服务测试中 34 个是为覆盖对应合并改动而新写的,其覆盖范围与上游测试的等价程度仍是开放问题;任务来自单一项目 SGLang,且 37 个任务源自单个上游拉取请求,任务间独立性有限;跨运行时域与单域任务的通过率差异在所有模型设置中方向一致,但该差异是否由域数量本身驱动、还是与改动规模等因素共同变化,文本未作分解;闭卷设置允许访问 Hugging Face 获取模型权重,权重获取对结果的影响未被单独量化。
