企业智能体技能持续演进下的过程级评测:240次试验中175次终值正确却有162次仍被检出偏差
核心概要
该工作提出面向企业智能体技能的持续评测框架,在真实企业VAR系统的两个BVD技能上,用独立计算的实时API真值、运行时解析占位符的模板测试用例,对工具选择、参数、执行顺序与数据库完整性做程序化检查并辅以窄范围LLM裁判;240次自动试验中175次通过全部适用终值数值检查,其中162次(92.6%,Wilson 95% CI 87.7–95.6%)仍存在至少一项评测器检出的偏差,在更宽的七项终态检查下151/164(92.1%,95% CI 86.9–95.3%)仍违反轨迹检查,依赖归因把平均6.34个失败检查压缩为2.65个根因。
Figure 1: Continuous evaluation pipeline. Stages 1 and 5 are new for each run; Stages 2–4 reuse a template suite within each skill across the evaluated specification, model, and harness configurations.
arXiv · 第 5 页深度剖析
框架把评测从只看最终数值扩展到过程层:工具选择、参数正确性、执行顺序与数据库完整性,并用独立于被测轨迹的实时API真值作为参照。 相较仅校验最终输出的常规做法,该框架在终值正确时仍能检出过程偏差;相较依赖LLM生成预言机的做法,它用真实API独立计算真值。 240次自动试验、两个技能(Revenue 104项检查、Productivity 80项检查)、两个规格变体、两个harness、三个模型,每格10次试验;真值由独立Python脚本调用同一批真实API计算。
终值正确并不等于过程合规:175次通过全部适用终值数值检查的试验中,162次(92.6%)仍有至少一项额外偏差;把基线放宽到每技能七项终态检查后,151/164(92.1%)仍违反轨迹检查。 该结果在排除外部错误运行(131/144,91.0%)与排除未恢复错误运行(136/147,92.5%)后依然成立,且移除no_irrelevant_tools检查后162次计数不变。 全部120次Revenue试验均通过最终收入检查且均至少有一项额外偏差;偏差根因族覆盖数据/数值一致性(106)、缺失阶段或必需工具(66)、允许列表(55)、冗余或调用次数(43)、范围/过滤(13)等。
带运行时解析占位符的模板测试用例可作为可复用回归资产,同一注册套件跨全部24个模型–harness–变体–技能条件复用。 占位符在评测时从实时API状态解析而非硬编码,使同一检查在规格修订、模型更换或工具API变化后仍可重跑;归档物化中同一批检查ID覆盖4种Revenue与16种Productivity期望值状态。 每技能一套注册套件(Revenue 104、Productivity 80),移除一条归档结果中的六项遗留Cloudability检查后各条件共用同一套件。
规格修订敏感度随模型与harness联合变化:Revenue上GPT-5.6-Sol在Claude Code下变体稳健(1.2个百分点)而在Codex下最敏感(12.9个百分点),Sonnet 4.6则相反(6.3对0.4个百分点)。 bootstrap差分中的差分区间在三个Revenue比较与Productivity的GPT比较上排除零,说明规格修订效应可随harness反转;Productivity的Opus与Sonnet比较区间含零,尚不确定。 每格10次试验、20,000次重采样的非参数bootstrap区间,未对六次比较做校正,属探索性分析;MD与TXT在内容上也有差异,故不能归因于格式本身。
启示与展望
该框架面向企业智能体技能的持续演进场景,适用于以工具调用与持久化数据库为输出、可程序化校验的量化技能;对两个BVD技能(Revenue与Productivity)在Claude Code与Codex两个harness、三个模型、MD与TXT两个规格变体下给出可复用回归覆盖。它可作为技能修订、模型升级或harness迁移后的质量门与规格完整性工具,帮助团队在部署前定位过程级回归,并以根因归因缩小人工复核范围。
实时API真值可能在执行与延迟评测之间漂移,不可变响应快照会增强参照完整性;LLM裁判仅用于窄范围检查,两位作者对60个随机抽样裁判案例的一致率为57/60(95%),但该审计按判断而非按运行抽样、未按检查类型分层、评审者为作者,且裁判模型Claude Sonnet 4.6本身也是被评模型之一,因此不宜外推为一般裁判准确率。评测器具有规范性:71/240次试验中“无关工具”检查为根因失败,有时涉及harness工具或模式初始化;顺序与EC2内存/成本零值检查也编码了工作流策略,需领域复核区分有害行为与良性替代。轨迹含执行噪声(83/240次运行至少记录一次工具或harness错误),未恢复错误集中于Codex(38对5),且全部20次Productivity Codex–Sonnet运行均含未恢复错误,故该配置的干净执行效应不可估计。实验比较固定配置而非纵向API或模型升级,两个技能各只用一个组合、一个收入值与一个日期窗口,重复随机试验不提供环境输入多样性;事后陈旧性模拟显示冻结Productivity众数期望值会使80/120次运行至少一个值超出容差。框架只诊断不修复,成本为harness记录的估计值而非对账发票。
