SkillSmith:让 LLM 把"文本知识"和"模型权重"当作同一种东西来推理

SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge
Google DeepMind · arXiv 2607.27497
arxiv.org/abs/2607.27497
核心想法:把模型权重当作 LLM 可以原生推理的一种模态。一个增强 LLM 同时接收文本描述和 prefix KV-cache 权重作为输入,直接输出融合了文本推理和参数知识的新 prefix 权重。Agent 的"knowing"和"doing"不再对立——LLM 可以用推理来指导技能合成。

问题:两种学习机制的隔离

当前 agent 有两种学习机制——文本层面(reflection、memory、prompt engineering)和参数层面(PEFT、LoRA、prefix-tuning)。这两条路一直是隔离的:要么写文本知识引导推理,要么微调权重固化技能。从来没有机制把两者混合起来。

举个例子:agent 训练了英语→Twi 翻译的 prefix-cache,也积累了英语法律文档分析的文本笔记。遇到新任务"分析 Twi 法律文档"时,agent 可以说出需要组合翻译和法律分析,但没有任何机制能把这段推理转化为对应的参数。SkillSmith 就是干这个的。

SkillSmith Pipeline
图1:SkillSmith 管线 — 源任务(文本 + prefix 权重)+ 组合文本指令 → 输出目标任务的 prefix 权重

技术方案

SkillSmith 用 prefix-tuning(KV cache)作为参数技能载体——因为文本片段可以自然通过 forward pass 转化为 KV cache,降低了模态桥接难度。输入包括:源任务的 prefix KV cache + 文本元数据、描述源技能与目标能力关系的组合文本(combo-text)。LLM backbone(Gemma 3 4B)同时处理这两种输入,直接输出目标任务的 prefix KV cache。

这本质上是一个 hyper-network——但不同于传统 hyper-network,它原生处理 weight-space 输入,而非仅处理隐状态。

实验结果

Composite-SNI ELO Ratings
图3:Composite-SNI 上的 ELO 评分 — SkillSmith(橙色)在 zero-shot 和 fine-tuning 下均大幅超越 baseline

Zero-shot:SkillSmith 大幅超越所有 weight-space merging baseline(LERP、Concat、SVD),但 ICL 仍然有竞争力——基础模型的文本推理在没有适配时仍有优势。

Fine-tuning 后:用 SkillSmith 生成的 prefix 作为初始化进行任务微调,显著超越所有其他初始化方法,包括直接从 ICL 示例初始化的 prefix-tuning。SkillSmith 提供了更优的参数起点。

Generalization Breakdown
图7:泛化分解 — Neither-Seen(两个源任务都未见过)上 SkillSmith 仍然大幅领先
MMLU-ProX Results
MMLU-ProX(29 语言 × 14 学科)— bootstrapped SkillSmith 在低资源、高难度组合上的优势

消融:SkillSmith 真的在用 KV cache 吗?

输入配置Elo 评分
无输入1209
仅 KV cache1455
所有输入除 KV cache(纯文本)1622
全部输入1714
Spider Plot Ablation
图6:Spider plot — 把文本直接拼到训练数据上的 baseline(橙色)仍不及 SkillSmith(蓝色),证明增益来自跨模态协同组合
SNI Results
SNI benchmark 上的结果

为什么这篇重要

1. "knowing"和"doing"的统一。Agent 的文本知识和参数技能不再是孤立的两条路,而是 LLM 可以原生推理的统一输入模态。这对 agent 架构设计是根本性的。

2. 指令驱动的参数合成。不是简单算术合并(LERP/Concat),而是用自然语言推理引导权重组合方向——agent 可以用"推理"指导"技能合成"。

3. 对 agent 系统的直接参考价值。OpenClaw 的 harness 进化目前主要在文本层面,SkillSmith 提供了一条路径:从纯文本进化扩展到文本+权重联合进化。

4. 合成数据迁移。Composite-SNI 的构建方法证明,合成组合任务可以有效地为跨模态组合能力提供训练信号。