小规模实验:Scaling Law 说了算吗?

Meta FAIR · NYU · Nicholas Lourie, Kyunghyun Cho, Karen Ullrich, Sanae Lotfi
Scaling Laws Hyperparameters Small-Scale Transformer
2026-08-12 · arXiv:2608.11859

Scaling law 承诺了一个低成本实验的乌托邦——在小模型上跑实验,用规律外推到大模型。但六年过去了,这个承诺几乎没有兑现。研究者发现小模型上的 scaling law 极不可靠,100M 参数以下的 scaling law 基本不可信。这篇论文给出了一个反直觉的答案:问题不在 scaling law 本身,而在超参数。

核心发现:小模型对超参数极度敏感,而大部分人跑的搜索根本不够。Scaling law 只在完全调优的前沿上才浮现——到达那个前沿需要远超常规的大规模搜索。充分调优后,小模型的 scaling law 可以跨一个数量级准确外推。

一个令人不安的实验事实

作者做了一个看似简单的实验:在 4M 到 268M 参数的模型阶梯上,用随机搜索做超参数优化,然后在充分调优的前沿上拟合 scaling law。结果很清晰——

Scaling Laws Across Training Runs
图 1:Scaling law 在极小规模(< 4M 参数)就存在,但只在充分调优的前沿上才显现。小模型更难调优,使得它们的 scaling law 更难被观察到,但并非不存在。

用"最佳单次运行"拟合的 scaling law 完全外推失败(test MSE = 2.20e-03);而加上充分调优加上 learning rate decay 后,test MSE 降到 2.15e-05,改善了 100 倍。参数定义方式(是否算 attention、embedding、unembedding)的影响相比之下微乎其微。你以为 scaling law 在小模型上不工作,实际上是你根本没走到那个前沿。

为什么小模型这么难调?

关键发现是超参数敏感度随模型规模急剧下降。4M 参数的模型上,四分之一随机配置与最优配置之间的差距巨大;268M 参数的模型上,这个差距几乎消失。背后的几何解释很优雅:超参数损失面的有效维度随规模降低。

作者用 noisy quadratic limit 估计了每个规模下损失面的内在维度 γ:4M 参数时 γ ≈ 5-6,34M 时 γ ≈ 2-3,268M 时 γ ≈ 1。维度从 6 降到 1,意味着大模型的超参数空间几乎退化成一条线——随便选一个不太离谱的配置,效果都差不多。而小模型的高维空间里,好配置淹没在差配置的海洋中,必须大规模搜索才能找到。

Hyperparameter Sensitivity Across Scales
图 6:超参数敏感度随规模急剧下降。随着参数和数据增长,随机搜索得到的损失分布越来越集中,有效超参数数量趋近于 1。

参数比数据更关键

维度降低的主导因素是参数量,而非数据量。增加训练 token 对有效超参数数量的影响很小,而增加参数量则显著降低维度。这解释了一个直觉性的观察:大模型的默认超参数配置往往就够用了,而小模型则需要精心的逐层调整。

困惑度-能力对应关系

下游任务的行为五花八门——有涌现、有逆转、甚至有 U 型 scaling。只有 39% 的任务有可预测的 scaling 行为。但一个关键规律揭示了希望:只要预训练数据固定,相同困惑度的模型就有相同的能力分布。 这意味着你不需要预测具体任务的表现——你只需要知道哪个模型的 pretraining loss 更好(在相同计算预算下),它就一定在所有任务上都更好。

小规模实验的设计原则:

  1. 在小规模上充分调优 → 拟合 scaling law
  2. 比较不同架构/方法的 scaling law
  3. Scaling law 更好的方案在所有任务上都更优

实战验证:Pre-Norm vs Post-Norm

作者用这个方法论重做了 transformer 社区一个经典争论:normalization layer 放在 residual 前面还是后面?以前这个问题靠大模型实验才解决,现在用小模型(4M-34M 训练,外推到 268M)就给出了相同的结论。

Pre-Norm vs Post-Norm Comparison
图 12:小规模实验复原了大尺度的结论——Pre-normalization 在模型增大时表现更好。Noisy quadratic limit 确认两个架构的超参数搜索质量相当,结论可信。

外推的陷阱

Scaling law 存在,但外推能力有限。当外推距离超过 1 个数量级时,不同采样估计的不可约误差开始剧烈分化。你不能简单取"外推 loss 最低的那个"——因为你在比较的是对不可约误差的噪声估计。正确的做法是看 scaling law 在数据附近的拟合质量,而不是看远端外推值。

对我们意味着什么

如果你在做模型相关的实验研究:不要在小模型上只跑 3-5 组超参数就下结论。你看到的可能不是模型的极限,而是你搜索的极限。超参数搜索预算要与小模型的敏感度匹配——4M 模型可能需要数百次实验。用 pretraining loss 作为代理指标而不是具体下游任务。验证工具用 noisy quadratic limit——如果超参数损失分布不符合理论预期,说明搜索还不充分。

"Scaling law 没说谎,是我们不够努力。小规模实验可以兑现 scaling law 迟来的承诺——前提是你愿意给它足够的超参数搜索预算。"