当前 agent 有两种学习机制——文本层面(reflection、memory、prompt engineering)和参数层面(PEFT、LoRA、prefix-tuning)。这两条路一直是隔离的:要么写文本知识引导推理,要么微调权重固化技能。从来没有机制把两者混合起来。
举个例子:agent 训练了英语→Twi 翻译的 prefix-cache,也积累了英语法律文档分析的文本笔记。遇到新任务"分析 Twi 法律文档"时,agent 可以说出需要组合翻译和法律分析,但没有任何机制能把这段推理转化为对应的参数。SkillSmith 就是干这个的。
SkillSmith 用 prefix-tuning(KV cache)作为参数技能载体——因为文本片段可以自然通过 forward pass 转化为 KV cache,降低了模态桥接难度。输入包括:源任务的 prefix KV cache + 文本元数据、描述源技能与目标能力关系的组合文本(combo-text)。LLM backbone(Gemma 3 4B)同时处理这两种输入,直接输出目标任务的 prefix KV cache。
这本质上是一个 hyper-network——但不同于传统 hyper-network,它原生处理 weight-space 输入,而非仅处理隐状态。
Zero-shot:SkillSmith 大幅超越所有 weight-space merging baseline(LERP、Concat、SVD),但 ICL 仍然有竞争力——基础模型的文本推理在没有适配时仍有优势。
Fine-tuning 后:用 SkillSmith 生成的 prefix 作为初始化进行任务微调,显著超越所有其他初始化方法,包括直接从 ICL 示例初始化的 prefix-tuning。SkillSmith 提供了更优的参数起点。
| 输入配置 | Elo 评分 |
|---|---|
| 无输入 | 1209 |
| 仅 KV cache | 1455 |
| 所有输入除 KV cache(纯文本) | 1622 |
| 全部输入 | 1714 |
1. "knowing"和"doing"的统一。Agent 的文本知识和参数技能不再是孤立的两条路,而是 LLM 可以原生推理的统一输入模态。这对 agent 架构设计是根本性的。
2. 指令驱动的参数合成。不是简单算术合并(LERP/Concat),而是用自然语言推理引导权重组合方向——agent 可以用"推理"指导"技能合成"。
3. 对 agent 系统的直接参考价值。OpenClaw 的 harness 进化目前主要在文本层面,SkillSmith 提供了一条路径:从纯文本进化扩展到文本+权重联合进化。
4. 合成数据迁移。Composite-SNI 的构建方法证明,合成组合任务可以有效地为跨模态组合能力提供训练信号。