跳到主要内容
返回时间线
arXiv来源发表:

研究者提出“意图—执行”缺口概念并构建SSA框架,在多个智能体基准上复现或提升pass@1,并分析15.4万条轨迹揭示模型解题行为差异

相关研究与后续进展

核心概要

该工作将AI智能体性能形式化为“意图—执行”缺口(模型意图与框架执行之间的不匹配),提出可定制的Simple Strands Agent(SSA)框架以对齐不同模型家族,在SWE-Pro、SWE-Verified、Terminal-Bench-2和Deep-SWE上复现或提升各模型提供方报告的pass@1,并基于SSA生成的15.4万条轨迹,用代码状态空间表示计算解距离与回溯,结合编辑频率、测试活动和阶段转换等细粒度指标,揭示前沿模型在pass@1相近情况下解题行为与努力分配的差异。

Source-provided article image: Dissecting model behavior through agent trajectories
Figure 1 ·

Figure 1: Reasoning nudges in SSA : Each family is nudged toward tool use in the form, quantitative or qualitative, it responds to.

arXiv

深度剖析

论文将AI智能体性能界定为系统问题而非单纯的建模问题,并形式化提出“意图—执行”缺口:模型意图与框架实际执行之间的不匹配,且这种不匹配会阻碍模型能力转化为智能体表现。 此前对智能体能力的讨论多聚焦于模型本身或工具、执行循环等框架设计要素,该工作把模型假设与框架行为之间的一致性单独提炼为一个可命名、可讨论的设计维度,并主张最小化该缺口与工具、执行循环同等重要。 这是概念层面的形式化与论证,论文以该缺口为出发点设计SSA框架来展示其影响,属于框架性主张而非对照实验结论。

作者开发了简单且可定制的框架Simple Strands Agent(SSA),目标是覆盖跨模型家族(Claude、Gemini、GPT、Grok、Qwen)通用的大部分常见模式,同时保留少量模型特定偏好。 SSA不是针对单一模型调优的框架,而是以跨家族通用模式为主体、模型特定偏好为补充的设计取向,用于检验框架与模型对齐对性能的影响。 论文以SSA在多个基准上的表现作为该设计取向有效性的支撑,具体实现细节与消融在摘要层面未展开。

SSA在SWE-Pro、SWE-Verified、Terminal-Bench-2和Deep-SWE上复现或提升了不同模型提供方家族报告的pass@1表现。 该结果说明在相同模型条件下,框架层面的对齐可以改变基准成绩,而不仅是模型能力本身的体现。 证据为在四个公开智能体基准上的pass@1对比,属于基准层面的复现与提升报告;摘要未给出具体数值、样本量与统计检验。

基于SSA生成的15.4万条轨迹,作者在代码状态空间中表示智能体轨迹,计算解距离与回溯,并引入编辑频率、测试活动、阶段转换等细粒度指标,观察到前沿模型在pass@1相对接近的情况下存在解题行为差异。 该分析把评价视角从单一的pass@1结果指标扩展到过程指标,使模型在问题求解各阶段的努力分配变得可观测、可比较。 证据来自15.4万条轨迹的大规模过程数据分析,指标定义与计算方式在摘要中仅作概述,具体统计结果未在摘要中列出。

启示与展望

该工作面向智能体框架设计与评测场景:当研究者或工程师使用SWE-Pro、SWE-Verified、Terminal-Bench-2、Deep-SWE这类软件工程与终端类智能体基准,并希望在不同模型家族(Claude、Gemini、GPT、Grok、Qwen)上获得可比表现时,SSA的通用模式加模型特定偏好思路可直接借鉴。过程指标(解距离、回溯、编辑频率、测试活动、阶段转换)为分析模型解题行为提供了可操作的观测维度,适用于需要超越pass@1、理解模型在求解各阶段如何分配努力的评测与调试工作。

摘要层面尚未展开的内容包括:SSA的具体实现与配置、跨模型家族通用模式与模型特定偏好的划分依据、四个基准上pass@1的具体数值与对比条件、15.4万条轨迹的采集设置,以及解距离、回溯、编辑频率、测试活动、阶段转换等指标的精确定义与统计结果。这些是读者在评估结论可复现性与适用范围时会继续关注的问题,也提示过程指标与pass@1之间的关系仍需在原文细节中确认。

来源