上一篇 ContinualSkillBench 的结论让人丧气:Agent 的"技能进化"大部分是假象。这篇 Trace2Skill 直接回应——给出了一个让技能进化真正有效的方法。
关键洞察:之前的方法要么顺序编辑技能(依赖编辑顺序),要么存成检索记忆(推理时额外开销)。Trace2Skill 并行分析大量轨迹,通过归纳推理合并成单个精炼技能。
电子表格。35B 模型深化人工技能后 Avg 最佳。跨模型迁移显著:122B 蒸馏的技能让 35B 在 WikiTableQuestions 上提升 +57.65pp。
数学推理。从 DAPO 蒸馏,在 held-out DAPO 和 AIME 2026 均有效。+Error(只用失败轨迹)跨模型迁移最稳定。
视觉问答(DocVQA)。仅 50 个样本蒸馏,在 5299 个 held-out 样本上 ANLS +0.25,Accuracy +22.25%。
并行合并 vs 顺序编辑:质量更好,3 分钟 vs 15-60 分钟。
统一技能 vs 检索记忆:122B Avg 4.33 vs 1.60,推理时零开销。
Agent 分析 vs 单次调用:多步根因分析更准确,补丁质量更高。
两篇论文放一起看特别有意思:ContinualSkillBench 说"当前技能进化不行",Trace2Skill 说"做对了就行——并行 + 归纳推理 + SOP 提取"。ContinualSkillBench 测的是顺序编辑 + 浅层维护,Trace2Skill 做的是并行分析 + 深层次归纳。问题不在方向,在实现方式。