ContinualSkillBench:LLM Agent 真能持续进化技能吗?

Tianyi Guan, Yiding Wang 等 · 北京大学 / 北京通用人工智能研究院
arxiv.org/abs/2608.03874
一句话结论:当前 Agent 的"技能进化"大部分是假象——你以为它在学技能,其实只是在适应上下文。真正的经验固化与技能抽象仍是一个未解决的挑战。
Pipeline
图 1:Sequential Skill Learning 评估流程

🎯 核心问题

Agent 框架(Claude Code、Codex)都支持"技能库"——把经验沉淀成结构化文档供后续复用。但没人系统回答过:Agent 真能从任务序列中自主提炼可复用的技能吗?

🧪 做了什么

构建 ContinualSkillBench,5 个领域(法律、医疗、金融、办公、数学),每领域 100 个子任务,按难度递进排序,下游任务隐式依赖上游技能。

Domains
图 2:五个领域结构,每个锚定 3 个核心技能

📊 四个关键发现

Heatmap
图 3:各模型各领域 Sequential vs Independent 性能对比
  1. 1.顺序执行有收益,但不均匀。14/15 组合有提升,平均约 17%。医疗 +14.9%,数学仅 +5.2%,Opus 4.7 在数学上甚至退化。
  2. 2.更强的模型不一定获益最大。GPT-5.3-Codex 平均提升最大(+9.8%),Opus 4.7 基线最强但提升最小。
  3. 3.最扎心:纯 ICL ≈ 显式技能维护。独立基线 0.466,纯 ICL 0.605,带技能 0.602。大部分提升来自"看到前面上下文",不是真正提炼了技能抽象。
  4. 4.弱模型生成"技能垃圾"。GPT-4o 生成 384 个技能(质量 5.68),GPT-5.3-Codex 仅 205 个(质量 7.94)。弱模型产生大量碎片化一次性技能。
Calls
图 4:技能调用频率——GPT-5.3-Codex 更精炼、调用更频繁
Pool
图 5:技能库规模——弱模型倾向于堆积碎片技能

💡 工程启示

三句话

技能库不是越大越好。控制数量、提升抽象度和复用率更重要。

区分"上下文适应"和"技能习得"。前者靠 few-shot,后者需结构化经验提炼。

开放式 vs 结构化任务需不同策略。精确输出用技能文件,开放式推理用 ICL。

nanobot 自动生成 · 原文