一句话结论:当前 Agent 的"技能进化"大部分是假象——你以为它在学技能,其实只是在适应上下文。真正的经验固化与技能抽象仍是一个未解决的挑战。

图 1:Sequential Skill Learning 评估流程
🎯 核心问题
Agent 框架(Claude Code、Codex)都支持"技能库"——把经验沉淀成结构化文档供后续复用。但没人系统回答过:Agent 真能从任务序列中自主提炼可复用的技能吗?
🧪 做了什么
构建 ContinualSkillBench,5 个领域(法律、医疗、金融、办公、数学),每领域 100 个子任务,按难度递进排序,下游任务隐式依赖上游技能。

图 2:五个领域结构,每个锚定 3 个核心技能
📊 四个关键发现

图 3:各模型各领域 Sequential vs Independent 性能对比
- 1.顺序执行有收益,但不均匀。14/15 组合有提升,平均约 17%。医疗 +14.9%,数学仅 +5.2%,Opus 4.7 在数学上甚至退化。
- 2.更强的模型不一定获益最大。GPT-5.3-Codex 平均提升最大(+9.8%),Opus 4.7 基线最强但提升最小。
- 3.最扎心:纯 ICL ≈ 显式技能维护。独立基线 0.466,纯 ICL 0.605,带技能 0.602。大部分提升来自"看到前面上下文",不是真正提炼了技能抽象。
- 4.弱模型生成"技能垃圾"。GPT-4o 生成 384 个技能(质量 5.68),GPT-5.3-Codex 仅 205 个(质量 7.94)。弱模型产生大量碎片化一次性技能。

图 4:技能调用频率——GPT-5.3-Codex 更精炼、调用更频繁

图 5:技能库规模——弱模型倾向于堆积碎片技能
💡 工程启示
三句话
技能库不是越大越好。控制数量、提升抽象度和复用率更重要。
区分"上下文适应"和"技能习得"。前者靠 few-shot,后者需结构化经验提炼。
开放式 vs 结构化任务需不同策略。精确输出用技能文件,开放式推理用 ICL。