MCRI 框架把智能体技能评估变成执行前的四维打分,在三个基准上把 top-1 技能选择排名提升 17.7 至 22.8 个百分点
核心概要
作者提出基于信息增益与行为约束的四维 MCRI 框架,并将其实现为基于大语言模型的 MCRI-Eval 评估方法,在 OpenClaw 技能库的 63,812 个公开技能与跨 BigCodeBench、BFCL-Fundamental、Mind2Web 的 58,275 次技能条件模型执行上验证:MCRI-Eval 得分与社区热度信号正相关,在受评方法中取得最高的下游排序一致性,并使三个基准的 top-1 技能选择相比各自最强基线分别提升 17.7、22.8 和 19.6 个百分位,说明它可作为执行前优先筛选技能的信号。
Figure 1: Constraint strength spectrum from natural language to skills and formal programs.
arXiv深度剖析
论文提出四维 MCRI 框架,用于系统分析智能体技能,并把它操作化为基于大语言模型的评估方法 MCRI-Eval。 此前学术社区缺少系统分析技能的结构化框架,该工作把信息增益与行为约束作为框架依据,将技能评估从零散经验判断转为可操作的维度化打分。 证据来自框架设计与在 OpenClaw 技能库 63,812 个公开技能上的评估设置,摘要未给出各维度的具体定义与权重细节。
MCRI-Eval 得分与社区热度信号正相关,并在受评方法中取得最高的下游排序一致性。 这为技能质量提供了一个与社区流行度一致、且与下游表现排序更吻合的评估信号,而不仅是单一来源的排序。 基于 58,275 次技能条件模型执行,覆盖 BigCodeBench、BFCL-Fundamental 与 Mind2Web 三个基准;摘要未报告相关系数或一致性指标的具体数值。
MCRI-Eval 在三个基准上均改善 top-1 技能选择,相比各自最强基线分别提升 17.7、22.8 和 19.6 个百分位。 该提升是在下游性能排名上度量的,说明执行前打分可以替代部分昂贵的执行式评估来优先挑选技能。 提升幅度以百分位点报告,比较对象为每个基准上的最强基线,评估规模为 58,275 次执行。
启示与展望
该工作面向需要在执行前对大量候选技能排序的场景,例如从技能库中为智能体挑选 top-1 技能。它适用于以 OpenClaw 技能库为代表的公开技能生态,并在 BigCodeBench、BFCL-Fundamental 与 Mind2Web 三类基准上给出结果。对构建技能市场、技能推荐或智能体能力组合的团队,MCRI-Eval 可作为执行式评估之前的预筛选信号,用于把有限执行预算集中在更可能有效的技能上。
摘要未说明 MCRI 四个维度的具体定义、各维度如何合成总分,也未给出与社区热度信号相关性的具体数值和排序一致性指标。三个基准上的提升以百分位点报告,但未说明基线方法集合与统计不确定性。此外,评估集中在 OpenClaw 技能库与三个基准,其他技能生态与任务域上的表现仍是开放问题。由于本次读取范围仅为摘要,图表与正文细节未纳入,上述数值的稳健性有待原文核对。
