AI4AI:强模型不改参数,只写 Harness 就能把弱模型的性能翻倍

Salesforce AI Research  ·  2026-08-12  ·  arXiv:2608.12307
核心发现:不蒸馏、不微调,让强模型充当"编译器"为弱模型设计推理脚手架(Harness),仅靠外部结构改造,就能把 GPT-5.4-mini 的 Theory-of-Mind 准确率从 0.49 提升到 0.91,提升幅度达 87%。提升的因果机制是认知负荷卸载——Builder 把越多推理工作编译成确定性规则,Target 表现越好(r = 0.72)。

核心思路:推理时能力迁移

传统蒸馏的路线是"改弱模型本身"——用强模型的输出做训练数据,或在策略蒸馏中让弱模型边行动边吸收反馈。这篇论文问了一个互补的问题:如果弱模型的失败,不全是能力不足,而是"任务呈现方式"造成的认知负荷过重呢?

答案是肯定的。作者提出"强到弱脚手架"(Strong-to-Weak Scaffolding)范式:一个强 Builder 模型只看 5% 的验证数据,迭代编写代码形式的 Scaffold,交给固定的弱 Target 模型去执行。目标模型参数完全不动,Builder 永远看不到测试集。成功了,说明 Scaffold 捕捉到了可复用的任务结构。

Framework Overview
图1:强到弱脚手架评估框架。左阶段为递归 Scaffold 构建,Builder 用验证集迭代优化;右阶段为隐藏测试集评估。

实验设计

选择四个 Theory-of-Mind(心智理论)基准作为测试场:BigToM(社会推理)、Hi-ToM(高阶嵌套信念)、MMToM-QA(贝叶斯目标推理)、MuMA-ToM(多智能体交互),共 3900 道题。Target 用 GPT-5.4-mini(弱)和 Gemini-3.5-flash(强),Builder 覆盖 11 种配置(GPT-5.5、Opus-4.7 各推理强度档位、Sonnet-4.6、Gemini 等),运行在 Cursor、Claude Code、GPT Codex 三种平台上,每种 3 次重复,共 72 轮实验。

效果有多强?

100%
所有配置超越 baseline
+0.275
平均准确率提升
0.912
最佳单次跑分

三个数字足够震撼:所有 72 轮实验无一例外超越了 baseline。平均提升 +0.275(0.488 → 0.763),最佳单次跑分 0.912(GPT-5.5 搭配 GPT Codex)。更值得注意的是,最佳 Scaffold 的 GPT-5.4-mini 超过了无脚手架的 GPT-5.4,接近人类手工设计的 UserHarness(0.912 vs 0.939)。

Builder Ranking
图2:各 Builder 的 Scaffold 效果排名。GPT-5.5 最好(0.875),Grok-0.1 最弱(0.563),但所有配置都显著超越无脚手架 baseline(0.488)。
Per-benchmark Results
图3:按基准分拆的结果。BigToM 几乎完美解决(1.00),Hi-ToM 和 MMToM-QA 仍有提升空间。自动 Scaffold 在 BigToM 上甚至超过了人类设计的 UserHarness。

同一弱模型给自己建脚手架(self-scaffolding),也已有 +0.17 到 +0.22 的提升。说明 Scaffold 捕捉的结构是真实存在的,只是强 Builder 能挖掘出更深层部分。

性能提升的本质:认知负荷卸载

这篇论文最深刻的洞察,在于量化了提升的因果机制。作者统计每个 Scaffold 中"确定性代码直接回答"的比例(Determinism Fraction),发现它与最终准确率高度相关(r = 0.72)。Builder 把越多推理工作编译成确定性规则,Target 的负担越轻,效果越好。

但不同任务的"可编译性"差异巨大:BigToM 几乎完全可编译(确定性比例 ~94%),因为答案通常取决于"是否观察到世界变化";Hi-ToM 部分可编译(~51%),通过符号化信念状态跟踪;MuMA-ToM 最难编译(~36%),自由对话推理难以转化为规则。

Determinism vs Accuracy
图4(上):确定性卸载比例与准确率的关系(r = 0.72)。卸载越多确定性推理工作到代码中,Target 模型的准确率越高。图4(下):不同基准的可编译性——BigToM 最容易编译,MuMA-ToM 最难。
Solution Approach
图5:各基准的求解方式分布。BigToM 大量使用确定性求解器或混合规则;MuMA-ToM 几乎完全依赖模型自身推理。

不是越多验证越好

一个反直觉的发现:Builder 的验证次数和最终性能几乎无关(r = 0.17)。中位只用了 5 次验证,验证集与测试集准确率的相关系数高达 0.96。关键不是"量",而是 Builder 的假设质量——强 Builder 几次 principled refinement 就够了,弱 Builder 测再多也没用。

Refinement Dynamics
图6:Builder 的验证精炼动态。左:各 Builder 的验证准确率随迭代提升。右:最佳验证分数与最终测试集准确率几乎一一对应(r = 0.96),但验证迭代次数与最终性能无关(r = 0.17)。

Builder 越强越好,平台影响有限

Builder 推理努力是单调杠杆——Opus-4.7 从低到高推理强度,Scaffold 质量严格递增(Spearman ρ = 0.77)。但平台选择是二阶因素:原生平台优势平均仅 +0.013,不具统计显著性。

强到弱迁移的"余量定律"

当 Target 换成更强的 Gemini-3.5-flash 时,整体提升显著缩小(+0.110 vs +0.262)。但论文发现了一个更精确的规律——提升幅度与 Target 的"余量"(1 - baseline)高度相关(r = 0.75)。Scaffolding 本质上是一个"能力恢复"机制:它帮 Target 释放本来就有但未稳定发挥的潜在能力。

Target Model Comparison
图7:不同 Target 模型上的效果。弱 Target(GPT-5.4-mini)全面受益;强 Target(Gemini-3.5-flash)仅在 BigToM 上有明显提升,在已接近饱和的 Hi-ToM 和 MuMA-ToM 上甚至出现轻微回退。
Complementarity
图8:互补性分析。不同强 Scaffold 修复的 baseline 错误有显著重叠但不完全一致。13 个顶级 Scaffold 的联合修复覆盖了 97% 的 baseline 错误。

剩余错误的边界

顶级 Scaffold 修复了 83% 的 baseline 错误,仅破坏 7% 的正确项。残余错误集中在最难编译的核心:Hi-ToM 深层递归(order 3-4 准确率降至 0.70-0.75)和欺骗场景、MMToM-QA 的贝叶斯目标推理。

Residual Errors
图9(左):Hi-ToM 准确率随递归深度下降。图9(右):顶级 Scaffold 的修复 vs 回退分解——修复远多于破坏,接近帕累托改进。

实用配方与评价视角转换

论文给出的行动指南很直接:用最强 Builder + 最高推理努力;验证集少量即可(5%);优先做确定性卸载;预算允许时建多个独立 Scaffold 取最优。

但更深远的影响是一个评价视角转换:"一个模型好不好"不应只问"它能不能解题",还应问"它能不能为更弱的模型设计解题环境"。这对 Agent 系统设计有启示——进步不只来自模型变强,还来自让模型身边的环境变好。