SelfEvoSkill 用配对执行审计在无外部结果监督下改写智能体技能,89 项任务平均奖励达 73.9%
核心概要
该工作提出 SelfEvoSkill,通过在同一智能体、任务与工作区条件下配对比较“使用技能”与“不使用技能”的执行行为差异,将差异定位到相关技能片段并迭代改写与再评估,同时用一次性从任务显式要求导出的检查防止改写违反约束;在 8 个专业领域的 89 个容器化任务上、相同 best-of-two 评估预算下,其平均任务奖励为 73.9%,比无技能条件高 33.0 个百分点,比基准自带精选技能高 17.2 个百分点,且技能演化过程不使用任务奖励或基准验证器输出。
Figure 1: Three paradigms for skill revision. Outcome-Gated (left) and Deployment-Feedback (center) rely on external outcome signals. SelfEvoSkill (right) uses behavioral differences between matched executions with and without the skill to locate relevant skill passages and iteratively revise them, without external outcome supervision.
arXiv深度剖析
提出以配对执行审计替代外部结果监督来驱动技能改写:在固定智能体、任务与工作区的前提下,比较有技能与无技能两次执行的行为差异,把差异关联到具体技能片段,再对这些片段迭代改写并在后续执行中重新评估。 既有技能改写方法通常依赖任务奖励、独立验证集表现或部署反馈等外部结果监督来决定保留哪些更新,而该工作把执行行为本身作为信号来源,针对的是这类监督成本高或不可得的新任务适配场景。 摘要说明该方法在技能演化过程中既不接收任务奖励,也不接收基准验证器输出,因此其信号来源与外部结果监督在设定上被明确区分。
用一次性从任务显式要求导出的检查约束改写,避免改写后的技能违反任务约束。 把任务约束以检查形式前置固定,而不是在每轮改写中重新依赖结果反馈来判断合规性,使改写过程在缺少结果监督时仍有约束依据。 摘要将该机制描述为“Checks derived once from the task's explicit requirements”,属于方法设计层面的说明。
在 8 个专业领域的 89 个容器化任务上,相同 best-of-two 评估预算下平均任务奖励为 73.9%,高于无技能条件 33.0 个百分点、高于基准精选技能 17.2 个百分点。 该对比同时给出无技能基线与基准自带精选技能两个参照,且强调技能演化未使用任务奖励或验证器输出,说明增益来自行为差异驱动的改写而非结果监督。 摘要报告了任务数量、领域数、评估预算与两个对照的百分点差值,属于带对照的定量结果。
消融显示配对比较与多轮改写各自有贡献:用两次“有技能”运行替代匹配的有/无技能配对,平均奖励下降 4.6 个百分点;把改写限制为一轮,相对重复改写下降 9.0 个百分点。 这两项消融分别隔离出“配对”这一信号构造方式与“重复改写”这一迭代机制的作用,而不只是报告总体增益。 摘要以受控消融形式给出两个百分点差值,方向与幅度均有明确数值。
启示与展望
该结果面向需要在缺少外部结果监督时为智能体适配技能的场景,尤其是任务要求可被显式表述、执行可在容器化环境中配对复现的设定;对这类读者,它提供了一条以行为差异定位技能片段并迭代改写的可操作路径,并给出在相同 best-of-two 预算下与无技能、基准精选技能比较的量化参照。
摘要未说明 89 个任务在 8 个领域间的分布、奖励的具体定义与统计不确定性,也未给出逐领域或逐任务的结果;配对执行中“保持智能体、任务与工作区固定”的具体实现方式、检查从任务要求导出的过程,以及改写轮数与成本的权衡,均需在正文中确认。此外,摘要未报告与依赖外部结果监督的方法在同一预算下的直接对比,因此行为差异信号相对结果监督的适用边界仍是开放问题。
