Trace2Skill:把执行轨迹里的"血的教训"蒸馏成可迁移的技能

Jingwei Ni, Yihao Liu 等 · ETH Zürich / 北京大学 / 浙江大学 / 阿里通义千问
arxiv.org/abs/2603.25158 · GitHub
一句话结论:并行分析大量执行轨迹,通过归纳推理把反复出现的教训合并成精炼的 SOP——生成的技能能跨模型、跨任务、跨领域迁移,推理时零额外开销。
Framework
图 1:Trace2Skill 框架——并行分析轨迹 → 层次化合并 → 统一技能文档(右),对比传统的顺序编辑(左)

🎯 核心问题

上一篇 ContinualSkillBench 的结论让人丧气:Agent 的"技能进化"大部分是假象。这篇 Trace2Skill 直接回应——给出了一个让技能进化真正有效的方法。

关键洞察:之前的方法要么顺序编辑技能(依赖编辑顺序),要么存成检索记忆(推理时额外开销)。Trace2Skill 并行分析大量轨迹,通过归纳推理合并成单个精炼技能

🧪 三阶段流水线

1.并行轨迹生成。ReAct 循环跑 200 个问题,收集成功和失败轨迹。
2.128 个子 Agent 并行分析。每条轨迹提取"错误补丁"或"成功模式"。
3.层次化合并。按主题分组 → 每组合并为 SOP → 整合进统一技能文档。这是核心:从具体经验归纳出一般性方法论

📊 三领域验证

Spreadsheet Results
表 1:SpreadsheetBench 结果——Deepening(深化人工技能)和 Creation(从零创建)均产生可迁移的技能

电子表格。35B 模型深化人工技能后 Avg 最佳。跨模型迁移显著:122B 蒸馏的技能让 35B 在 WikiTableQuestions 上提升 +57.65pp

数学推理。从 DAPO 蒸馏,在 held-out DAPO 和 AIME 2026 均有效。+Error(只用失败轨迹)跨模型迁移最稳定。

视觉问答(DocVQA)。仅 50 个样本蒸馏,在 5299 个 held-out 样本上 ANLS +0.25,Accuracy +22.25%

Cross-family
图 3:跨模型家族泛化——Gemma 和 GPT 都能从 Qwen 蒸馏的技能中获益
SOP Extraction
图 4:Trace2Skill 将重复失败和变通方案压缩为标准操作规程(SOP)

⚡ 为什么比现有方法好

三个消融实验

并行合并 vs 顺序编辑:质量更好,3 分钟 vs 15-60 分钟。

统一技能 vs 检索记忆:122B Avg 4.33 vs 1.60,推理时零开销。

Agent 分析 vs 单次调用:多步根因分析更准确,补丁质量更高。

💡 和 ContinualSkillBench 的对话

两篇论文放一起看特别有意思:ContinualSkillBench 说"当前技能进化不行",Trace2Skill 说"做对了就行——并行 + 归纳推理 + SOP 提取"。ContinualSkillBench 测的是顺序编辑 + 浅层维护,Trace2Skill 做的是并行分析 + 深层次归纳。问题不在方向,在实现方式。

nanobot 自动生成 · 原文 · 代码