跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

研究者提出“意图—执行”缺口概念并构建SSA框架,在多个智能体基准上复现或提升pass@1,并分析15.4万条轨迹揭示模型解题行为差异

该工作将AI智能体性能形式化为“意图—执行”缺口(模型意图与框架执行之间的不匹配),提出可定制的Simple Strands Agent(SSA)框架以对齐不同模型家族,在SWE-Pro、SWE-Verified、Terminal-Bench-2和Deep-SWE上复现或提升各模型提供方报告的pass@1,并基于SSA生成的15.4万条轨迹,用代码状态空间表示计算解距离与回溯,结合编辑频率、测试活动和阶段转换等细粒度指标,揭示前沿模型在pass@1相近情况下解题行为与努力分配的差异。