Command Palette
Search for a command to run...
揭秘智能体技能:为何有效——直至失效
揭秘智能体技能:为何有效——直至失效
Zhiyuan Jiang Fangrui Huang Hanwen Xing Xander Wu Yipeng Gao Rui Cao Mengdi Wang Shilong Liu Yijiang Li
摘要
技能已成为一种实用且有效的方法,通过结构化的知识包在推理阶段增强 LLM 智能体。然而,现有评估大多只衡量技能是否提升了聚合任务成功率,一个更根本的问题仍未得到充分探索:技能何时有帮助、为何有效、又在何处失效?通过在多种基准、智能体框架和 LLM 上开展受控实验,我们分离了技能的表示方式、结果标注检索难度以及跨框架鲁棒性的影响。为进一步回答这一问题,我们设计了一项将受控定量实验与配对轨迹分析相结合的对比研究。我们对来自受控实验的 8,135 条试验记录进行了归一化处理,并从 240 条开放编码记录中保留了 238 个有效唯一标签。我们将这些观察结果归纳为一个包含三个高层类别和十二种技能使用模式的分类体系:当嘈杂轨迹成为稳定执行的过程锚点时,技能便发挥作用。在配对比较中,技能相较于 Workflow Memory 提升了 6.06 分。过程锚定占技能有效案例的 65.7%,而显式知识注入仅占 4.5%,表明技能的作用在于稳定行动而非注入缺失事实。检索是另一个独立瓶颈:当候选池从 5 增至 100 时,实际使用精度从 29.6% 降至 3.3%。易混淆的干扰项会损害离线识别,但下游成功率仍保持稳定;精确的真值调用既不充分也不必要。技能在脆弱假设、不兼容情境或适应不足时会失效。这些发现将评估推进到聚合成功率之外,并为可靠的自我进化智能体提供了指导。
一句话总结
普林斯顿大学、加州大学圣迭戈分校等机构的研究者提出一项对比研究,将受控实验与成对轨迹分析相结合,并表明 agent 技能主要作为程序性锚点稳定执行,相比 Workflow Memory 提升 6.06 分,而随着候选池从 5 增长到 100,检索精确率从 29.6% 下降到 3.3%,在脆弱或不兼容条件下会出现失败。
核心贡献
- 一个受控对比评估框架,结合成对轨迹分析,分离技能表示、结果信号、检索难度和跨框架鲁棒性如何影响 agent 性能,使用 8,135 条标准化试验记录和 238 个经过验证的标签。
- 一个包含三大类和十二种技能使用模式的分类体系表明,技能主要充当程序性锚点:程序性锚定占技能案例的 65.7%,而显式知识注入仅占 4.5%;在匹配比较中,技能相比 Workflow Memory 提升 6.06 分。
- 识别了检索与适应失败边界:随着技能池从 5 增长到 100,实际使用精确率从 29.6% 下降到 3.3%;易混淆干扰项会损害离线识别,但不会降低下游成功率;技能在脆弱假设、不兼容上下文或适应不足时会失败,这推动面向自进化 agent 的基于生命周期的设计。
引言
LLM agent 越来越多地复用先前的执行轨迹,而技能将这些轨迹提炼为面向工具使用 agent 的紧凑程序性指导。这一点很重要,因为重复失败往往来自重复发现环境设置、工具使用、调试和验证细节,而非高层推理薄弱。此前工作主要通过总体任务成功率评估技能,难以说明 agent 行为发生了哪些变化、哪些执行阶段被稳定下来,以及为什么同一技能在一个任务中有帮助、在另一个任务中却有害。作者通过引入技能效用与失败的分类体系,以及一种对比轨迹分析方法,来解决这一空白;该方法比较在表示、迁移、检索和调用等维度上使用与不使用技能的匹配执行。研究围绕程序性表示、结果信号、跨框架迁移和技能池检索展开。
方法
作者将技能使用界定为把先前 agent 经验受控转化为程序性知识的过程。核心比较对照同一底层经验的三种表示:Raw 不接收任何先前经验;Workflow Memory 接收来自先前执行的清理过程性轨迹;Skill 接收从相同工作流中提炼出的标准化 SKILL.md 制品。对每个选定任务,成功和失败的 raw 轨迹被收集到一个平衡轨迹池中。固定预算的组合网格将源证据从仅成功变化到仅失败,例如从 5 次成功、0 次失败到 0 次成功、5 次失败。Workflow Memory 和 Skill 由相同的选定轨迹构建,并在相同的目标任务上评估,保持底层经验不变,仅改变其表示。为了隔离技能构建过程中结果信号的作用,作者创建标准 Skill 变体,其中成功和失败身份对技能创建者可见;以及无提示 Skill 变体,其中这些标注被移除,同时保留相同轨迹和执行协议。
跨框架迁移通过以下方式测试:从主要 Codex 环境中采集轨迹来构建技能和工作流记忆,并在 Gemini CLI 中使用 Gemini-3.1-Pro-Preview 进行评估。这一设置保持源经验不变,同时改变目标 agent 的提示风格、工具使用接口和执行行为。比较迁移后的 Skill、迁移后的 Workflow Memory 与目标框架 Raw 基线,可以分离出提炼后的技能是否比直接工作流轨迹更稳健地保留可复用的程序性指导。
对于检索和下游执行,作者构建受控候选池,其中包含任务的真实技能集以及干扰项。池大小从 5 到 100 不等,干扰项按随机、语义相似或不相似技能进行采样。使用三个独立测量臂。臂 1 是嵌入检索器,按任务描述相似度对技能排序。臂 2 是一个 agent,在不执行任务的情况下显式选择可能有用的技能。臂 3 是全池真实执行,完整候选池对 agent 可用。离线诊断与执行实验保持独立,且任何离线臂的选择输出都不会传递到执行环节。
为解释技能使用机制,作者构建了一条对比轨迹分析流水线。异构基准输出被标准化为包含 8,135 条试验记录的共享清单,包括任务标识、执行臂、验证器结果、注入制品以及可获取时的轨迹转写;其中 7,837 条记录包含 agent 转写。对 240 条采样轨迹进行开放式编码,产生 238 个有效的唯一标签,并被合并为 12 种模式的规范分类体系。LLM 辅助分类体系构建由独立人工检查验证。对于每个原始标签,由一名人工标注员检查三条支持轨迹,共进行 714 次轨迹-标签检查。人工与 LLM 聚合分配达到 95.8% 的完全一致率,Cohen's κ=0.952。
机制分析的主要单元是一个配对三元组,比较相同任务和设置在 raw 执行、工作流记忆注入和技能注入下的表现。作者在 SkillsBench、Terminal-Bench 2.0 和 Terminal-Bench-Pro 上构建了 528 个此类三元组,产生 1,584 个臂级模式分配。对于每个三元组,一个 LLM 评判器为每个臂分配分类模式,记录臂之间的成对变化,并识别注入制品是通过程序性锚定、知识注入、失败警告、无有意义使用还是有误导性指导来起作用。12 个细粒度模式被归入三个技能使用类别。SC1 涵盖成功的程序性锚定。SC2 涵盖执行层和验证失败,包括环境设置、输出格式、服务管理、shell 执行、算法实现和运行时验证。SC3 涵盖调用、适用性和边界失败,即指导虽然存在但被误用、过度应用、忽略或受外部限制约束。这一对比设计不仅分解某个臂是否成功,还分解当相同先前经验被表示为直接工作流记忆或提炼技能时,哪些行为发生了变化。
实验
评估将 Terminal-Bench 和 SkillsBench 与 Codex 和 Gemini CLI 配对,对 raw 执行、工作流记忆和提炼技能注入进行受控比较,并进行跨框架迁移以及检索与执行研究。结果表明,技能主要作为程序性锚点而非外部知识注入来提供帮助,减少环境、输出格式和服务生命周期方面的执行失败,同时增加调用和适用性失败。当技能构建中包含失败轨迹时,结果标注最为重要;检索实验表明,更大且语义相似的候选池会使精确技能识别更加困难,尽管下游任务成功仍相对稳定。
在报告的轨迹混合中,技能注入通常相对于 raw 基线提高了任务成功率,而工作流记忆的效果更为复杂,并且在 Terminal-Bench-2 上始终低于 raw 基线。两种方法都倾向于在成功占比高的混合中表现最佳,随着更多失败源轨迹被纳入,收益会减弱。技能注入通常在 SkillsBench 和 Terminal-Bench-Pro 上带来更大提升,但在失败占比高的条件下其优势可能缩小或反转。在 Terminal-Bench-2 的所有报告混合条件下,技能注入始终高于 raw 基线,而工作流记忆始终低于 raw 基线。两种方法在 SkillsBench 和 Terminal-Bench-Pro 上均优于 raw 基线,但任务成功率通常随着失败源轨迹变得更普遍而下降。技能注入通常优于工作流记忆,最明显的例外出现在 SkillsBench 和 Terminal-Bench-Pro 的失败占比高的混合中。
该框架将注入的先前经验对执行的影响归类为:提供程序、补充缺失的领域知识、警示陷阱、无有意义使用或误导 agent。随着候选技能池增长,真实技能使用的精确率急剧下降,而下游任务成功仍相对稳定。相似干扰项比单纯增加池大小构成更强的压力,并且 agent 经常在干扰项中检索到正确技能,而不是完全错过。注入制品可以作为程序性锚点、注入领域知识、警示陷阱、无有意义效果或起反作用。随着候选池增长,真实技能使用精确率大幅下降,但下游任务成功仅发生轻微变化。相似干扰项带来的语义混淆对技能识别的阻碍大于池大小,高召回率表明正确技能通常仍被检索到。
一项人工验证研究在两个阶段评估了分类体系构建流水线。第一阶段确认采样轨迹衍生的标签确实基于记录的 agent 行为;第二阶段发现人工映射与自动映射到 12 种规范模式之间具有高度一致性。人工标注员在 714 次轨迹-标签检查中确认了全部 238 个原始标签。独立人工映射到 12 种规范模式与自动分配达到 95.8% 的完全一致率,Cohen's kappa 为 0.952。
更大的技能池会降低各检索臂的识别精确率,其中语义相似的干扰项导致最明显的下降。即使真实技能使用精确率崩溃,下游任务成功仍相对稳定,而召回率保持足够高,表明 agent 通常会在干扰项中检查正确技能,而不是完全错过。精确率随池大小增长而下降,相似干扰项池始终比随机或不相似池更难。下游成功仅受真实技能使用精确率下降的轻微影响,而选择召回率仍相对较高。
实验比较了技能注入和工作流记忆在不同基准轨迹混合中的表现,表明技能注入通常相对于 raw 基线改善任务成功,而工作流记忆效果更复杂;随着失败占比高的源轨迹增加,两种方法的收益都会减少。分类分析发现,注入的经验可以作为程序性指导、领域知识或陷阱警告,但也可能无用或误导;人工验证确认了标签和规范映射流水线。检索压力测试表明,更大的候选池和语义相似的干扰项会降低精确技能识别精确率,但下游任务成功仍相对稳定,因为 agent 通常会在干扰项中检索到正确技能,而不是完全错过。