Recirculation:不训练,只让深层激活「回流」,Transformer 就能追踪状态

Inference-Time Architecture State Tracking Training-Free Google DeepMind
2026-08-18 · arXiv:2608.17981
核心观点:Transformer 的前馈结构限制了状态更新的深度。Recirculation 在推理时将深层激活泄漏回浅层,零训练成本下让模型获得循环网络式的状态追踪能力,perplexity 下降 23%,GSM8k 提升 21%。

一个 Gemini 2.5 Flash 被问到一个简单的问题:"银行经理的名字是 Alice 还是 Bob?"对话前文明确说过 "Alice was the bank manager"。模型回答 "Bob"。

这不是能力不足——同一个模型有时能答对。这是一个架构级的弱点:Transformer 在处理完每个 token 后,状态信息被推到了固定深度,无法持续迭代更新。

深度限制:被锁住的状态

RNN 通过循环更新隐状态来跟踪动态信息——每处理一步,z(t) 更新为 z(t+1) = f(z(t), x(t))。这个更新函数可以是任意的,因为它在同一个网络层上反复执行。

Transformer 的前馈结构天然排斥这种做法。模型有 N 层,就最多只能做 N 次状态转换。Merrill 和 Sabharwal 证明了识别长度为 n 的正则语言串需要 log(n) 层——但这是构造性的界,不是学习性的界。实践中,Transformer 确实学会了各种巧妙的并行状态追踪方案,但这些方案在更长的序列和更复杂的对话中会失效。

这种失效的后果很具体:多轮对话中丢失上下文连贯性、信息收集效率低下、多 Agent 协作中沟通崩溃。

图 1:状态追踪失败的具体案例。模型无法正确回忆前文提到的银行经理姓名。通过将深层激活复制回浅层(activation patching),正确率显著提升。
图 1:状态追踪失败的具体案例。模型无法正确回忆前文提到的银行经理姓名。通过将深层激活复制回浅层(activation patching),正确率显著提升。

Recirculation:一个极简的修复

Recirculation 的做法简单到令人怀疑它能否有效:推理时,在处理每个 token 之后,把某个深层(source layer)的激活取一小部分(系数 α),注入到下一个 token 的某个浅层(destination layer)。

具体来说,对于第 t 个 token,浅层 d 的输入被修改为:

hd(t) = (1 − α) · hd(t) + α · normalize(hs(t−1))

其中 hs(t−1) 是上一个时间步深层 s 的输出,normalize 将源向量缩放到与目标向量相同的 L2 范数。α 通常很小(0.07~0.15)。

只有三个超参数:混合系数 α、源层 s、目标层 d。不需要训练,不需要改模型权重,开箱即用。

图 2:Recirculation 架构示意。每个 token 处理时,两个 transformer stack 并行运行。前一个 token 的深层激活(source)被注入当前 token 的浅层(destination)。
图 2:Recirculation 架构示意。每个 token 处理时,两个 transformer stack 并行运行。前一个 token 的深层激活(source)被注入当前 token 的浅层(destination)。
关键设计选择:Recirculation 将源层激活注入下一个 token 的浅层,而非同一个 token 的浅层。这个「时间步偏移」是它区别于简单 activation patching 的核心。

不是 CoT,不是 Looping

Chain-of-thought 也在深层和浅层之间传递信息——但它通过生成额外的 token 来实现,每个推理步骤都消耗序列长度。CoT 适合复杂的多步推理,但用来做基础的状态追踪(「前面提到的是 Alice 还是 Bob」)就像用牛刀杀鸡。

Recirculation 不生成任何额外 token,在隐空间完成状态传播,专门补充 Transformer 在基本状态追踪上的短板。

Looped transformer 是另一种流行的深度扩展方法——将一段层重复执行多次,本质上等价于一个更深的、带权重共享的前馈网络。Looping 的递归只发生在深度维度上,数学上仍然受限于「深度有限」的性质。

图 3:Looping(左)vs Recirculation(右)的状态传播对比。Looping 中 z(t+1) 必须比 z(t) 更深一层,本质仍是前馈网络。Recirculation 中同一层可以同时承载 z(t) 和 z(t+1),实现了真正的循环状态更新。
图 3:Looping(左)vs Recirculation(右)的状态传播对比。Looping 中 z(t+1) 必须比 z(t) 更深一层,本质仍是前馈网络。Recirculation 中同一层可以同时承载 z(t) 和 z(t+1),实现了真正的循环状态更新。

Recirculation 的递归同时发生在深度和时间步两个维度上。这意味着同一个网络层在不同时刻可以承载不同的状态 z(t) 和 z(t+1)——这恰恰是实现任意状态更新函数所需的计算模式。

超参数搜索:模型自己告诉你答案

作者在 Gemma3 1B 上做了系统性的网格搜索。结果出乎意料地清晰:存在一个稳健的最优区域,在这个区域内,十个语言建模数据集中有九个的 perplexity 显著下降。

图 4:Gemma3 1B 的超参数扫描热力图。蓝色表示 perplexity 下降,红色表示上升。α=0.07~0.15 时,source 层比 destination 层深 5~7 层是最优区域。
图 4:Gemma3 1B 的超参数扫描热力图。蓝色表示 perplexity 下降,红色表示上升。α=0.07~0.15 时,source 层比 destination 层深 5~7 层是最优区域。

对于三个模型规模,最优的源-目标对分别是:1B 使用 {11, 4},4B 使用 {18, 9},12B 使用 {35, 16}。随着模型增大,有效连接跨越的层数也增加,这符合直觉——更大的模型有更丰富的深层特征可以利用。

Perplexity 评估

在十个数据集上的评估结果:

数据集 Gemma3 1B
基线
1B Recirc 1B 降幅 Gemma3 4B
基线
4B Recirc 4B 降幅 Gemma3 12B
基线
12B Recirc 12B 降幅
ArXiv16.5414.8710.1% 11.8910.3413.0% 12.008.9225.7%
PubMed15.6513.5613.4% 10.278.9313.0% 10.367.6626.1%
PG1916.5414.0814.9% 11.8410.2613.3% 11.498.1429.2%
BookSum14.1212.2313.4% 10.158.9611.7% 10.167.4726.5%
Gov Report14.6812.8812.3% 10.259.0212.0% 10.477.7925.6%
OpenWebText16.2814.3411.9% 11.4610.1411.5% 11.578.5626.0%

12B 模型在多个数据集上实现了 25-35% 的 perplexity 下降。九个数据集中有九个显著改善,唯一的例外是 Lambada(极短序列,recirculation 的优势在于长上下文)。

排除替代解释

perplexity 下降是不是只是因为 recirculation 相当于调低了 softmax 温度?作者做了对照实验:单独调温(1.2)降低 perplexity 8.48%,单独 recirculation 降低 14.21%,两者叠加降低 19.55%——接近线性叠加。效果是近似可加的,排除了温度调谐的替代解释。

图 5:Recirculation 与温度调谐的效果对比。两者近线性叠加,说明 recirculation 的作用机制不是简单的分布锐化。
图 5:Recirculation 与温度调谐的效果对比。两者近线性叠加,说明 recirculation 的作用机制不是简单的分布锐化。

和 looping 的对比同样明确。在 Gemma3 1B 上,looping 几乎没有稳定的收益区域;在 4B 和 12B 上 looping 有一定效果但远不如 recirculation 系统且微弱。两者的热力图模式完全不同,确认它们作用于不同的原理。

图 6:Looping(上排)vs Recirculation(下排)在 Gemma3 三个模型规模上的超参数扫描对比。Recirculation 在所有规模上都展示了稳健的蓝色(perplexity 下降)区域。
图 6:Looping(上排)vs Recirculation(下排)在 Gemma3 三个模型规模上的超参数扫描对比。Recirculation 在所有规模上都展示了稳健的蓝色(perplexity 下降)区域。

哪些 token 受益最大?

作者做了精细的分析。位置上,上下文窗口中的第 20~200 个 token 的 recirculation 效果最持久,即使影响跨度达到 256 个 token 仍有可测量的收益。内容上,副词、形容词和动词从 recirculation 中受益最大,而数字、限定词和代词几乎不受影响。

图 7:Recirculation 的 token 级分析。左:滞后 k 处的对数似然增益呈幂函数衰减。中:位置热力图显示 20-200 位置受益最大。右:词性分析显示副词、形容词、动词受益最大。
图 7:Recirculation 的 token 级分析。左:滞后 k 处的对数似然增益呈幂函数衰减。中:位置热力图显示 20-200 位置受益最大。右:词性分析显示副词、形容词、动词受益最大。
图 8:按词性分类的 recirculation 效果。副词、形容词和动词(红/橙色)显著受益,功能词(蓝/青色)几乎不受影响。
图 8:按词性分类的 recirculation 效果。副词、形容词和动词(红/橙色)显著受益,功能词(蓝/青色)几乎不受影响。

GSM8k:推理能力的提升

对于单 token 回答的数据集(MMLU、ARC 等),recirculation 的改善幅度较小但方向一致。但当任务涉及多步推理(GSM8k),recirculation 的优势变得显著。

图 9:GSM8k 准确率对比。左:pass@1(贪心解码),Recirculation 从 30.6% 提升到 35.5%。右:pass@128(采样 128 次),从 94.9% 提升到 96.0%。Adaptive Recirculation 进一步提升至 37.5% 和 96.0%。
图 9:GSM8k 准确率对比。左:pass@1(贪心解码),Recirculation 从 30.6% 提升到 35.5%。右:pass@128(采样 128 次),从 94.9% 提升到 96.0%。Adaptive Recirculation 进一步提升至 37.5% 和 96.0%。

pass@1 从 30.6% 提升到 35.5%,pass@128 从 94.9% 提升到 96.0%。pass@1 的提升意味着能力锐化——正确答案在候选分布中变得更突出;pass@128 的提升意味着能力扩展——正确答案出现在更大的采样空间中。

Adaptive Recirculation:轻量调参,大幅提升

固定超参数的 recirculation 已经有效,但作者进一步提出 adaptive 变体:不调模型权重,只学习 per-token 条件化的 α 和 β 系数向量。训练集只有约 1.5M token。

图 10:六种 recirculation 变体在 Gemma3 1B 上的 perplexity 降幅对比。从左到右:固定超参数 → 学习标量 → 学习向量 → 学习条件向量(Adaptive)→ 完整微调。条件向量变体(21.6%)甚至超过完整微调(11.7%)。
图 10:六种 recirculation 变体在 Gemma3 1B 上的 perplexity 降幅对比。从左到右:固定超参数 → 学习标量 → 学习向量 → 学习条件向量(Adaptive)→ 完整微调。条件向量变体(21.6%)甚至超过完整微调(11.7%)。

结果令人惊讶:学习条件化的 recirculation 系数(不碰模型权重)的效果甚至超过了完整微调模型权重。这说明「学会在正确的位置、用正确的强度注入深层信号」比「调整所有权重」更有效率。

Adaptive recirculation 在 Gemma3 4B 上将 GSM8k pass@1 进一步推到 37.5%,perplexity 在九个数据集上平均下降 23%。

五个模型族都有效

图 11:Recirculation 在五个不同模型族上的超参数扫描。Gemma3、Ministral3、Qwen3、Pythia、Phi2 全部找到了 perplexity 下降的区域,表明这是 Transformer 的普遍特性。
图 11:Recirculation 在五个不同模型族上的超参数扫描。Gemma3、Ministral3、Qwen3、Pythia、Phi2 全部找到了 perplexity 下降的区域,表明这是 Transformer 的普遍特性。

这五种模型使用了不同的归一化方案(Pre-LN、Post-LN、RMSNorm)、不同的训练配方的不同架构细节,但 recirculation 在所有模型上都找到了有效的源-目标对。这不是某个特定训练配方的巧合产物,而是 Transformer 普遍存在的可利用的结构特性。

代价与权衡

Recirculation 在自回归生成阶段几乎零额外延迟——两个 stack 并行跑,现代 GPU 上和单 stack 几乎一样快。但在 prefill 阶段需要逐 token 串行处理,和标准并行 prefill 相比有实质性计算开销。对于长上下文场景,作者提出 blockwise recirculation(每 K 个 token 并行处理再 recirculate)作为可能的缓解方案,但尚未实验验证。

Recirculation 的真正价值不在于它让模型「更强」,而在于它揭示了一个被忽视的事实:现成的 Transformer 内部已经编码了足够的状态跟踪能力,只是前馈结构把它锁在了固定深度。通过一个极简的推理时干预,这些能力就能被释放。

方法论启示

作者没有设计一个「应该有效」的架构然后训练它,而是用超参数搜索让模型自己「告诉」你哪些层的连接最有效。这种「让模型指导架构修改」的范式——用已训练网络的内部动态信号来指导推理时架构调整——和 LOPD(可学习的特权上下文)的哲学一脉相承。

它指向一个更一般的方向:与其人为设计架构改进,不如先问模型——你的内部结构支持什么样的修改?Recirculation 的成功暗示,Transformer 的层间信息流中存在大量未被利用的「冗余容量」,等待被合适的推理时干预所释放。