别让模型想更久,让它想得更对
RHI用3轮迭代打败max reasoning,省60%推理成本

Agent Harness优化 Test-time Scaling Sakana AI
2026年7月
AI行业在疯狂卷reasoning token数量——xhigh、max、ultracode,推理预算越拉越高。但这篇来自Sakana AI和UC Berkeley的论文提出了一个反直觉的方向:与其让模型想更久,不如让信息流动得更高效。他们发现,只需要3-4轮迭代优化Agent的"脚手架",低配推理的Agent就能超越max reasoning的表现,同时砍掉60%的推理成本。

被忽视的第三条路:Harness优化

当前AI系统的进步,大家都在盯两个方向:更大的模型(训练缩放)和更多的推理时间(测试时缩放)。这篇论文指出了一条被忽视的第三条路——模型与脚手架的协同进化(model-harness co-evolution)。

什么是harness?通俗讲,就是你给Agent的那套"操作系统":system prompt定义角色,instruction定义任务执行规则,contract定义Agent之间怎么交换信息,hop定义工作流的控制流。你用的Claude Code、Cursor、Devin,底层都有一套精心设计的harness在驱动。

问题在于,harness越好,Agent产出的执行轨迹质量越高,这些轨迹又能反哺训练下一代基础模型,形成一个数据飞轮。但飞轮的起点卡在harness的质量上。让模型提供商去持续更新harness太贵了——那能不能让用户侧的harness自己优化自己

RHI的核心假设:harness不是静态配置,而是可以被迭代优化的"中间件"。优化harness比优化模型本身更便宜、更可控。

RHI的三步循环:跑、比、改

RHI的算法结构出人意料地简单。每轮迭代做三件事:

RHI算法流程图
图1 | RHI算法流程。每轮迭代:①用当前harness跑任务生成输出;②与上一版输出做LLM成对评判;③累积偏好反馈历史;④harness优化器根据历史生成改进版harness。

第一步:跑任务

用当前版本的harness驱动Agent完成任务,生成一个完整的代码仓库。比如"用量化金融方法分析某股票的动量策略",Agent需要生成研究报告、可视化、实验代码等标准交付物。

第二步:自我对比

拿当前版本的输出和上一版的输出做两两对比,用一个独立的LLM裁判(gpt-5.5-max或opus-4.7)判定哪个更好。评判标准覆盖六个维度:交付物完整性、方法论严谨性、可复现性、代码工程质量、任务对齐、展示质量。

第三步:更新harness

一个"harness优化器"LLM拿到所有历次对比的累积反馈历史——不是一次对比,而是完整的偏好演化轨迹——分析"哪个版本哪里做得更好,为什么",然后生成改进后的新harness。

循环往复,2-4轮就收敛。

关键设计选择:RHI的对比对象不是跟外部竞争者比,而是跟自己上一版比——论文称之为"轨迹局部松弛"(trajectory-local relaxation)。好处是成本极低:每轮只需一次Agent执行加一次对比评判,复杂度O(1),而传统种群搜索方法是O(m²)。
RHI与种群搜索的成本对比
表1 | 三种harness搜索目标的单轮计算成本。理想目标需要Θ(M²),有限种群搜索Θ(m²),而RHI的轨迹局部目标仅需Θ(1)。

核心实验:小模型+好harness > 大模型

论文在30个合成ML研究任务上测试(覆盖量化金融、机器人、药学三个领域),用了三档基础模型:Claude Sonnet 4.6、Opus 4.7、Opus 4.8。

RHI与不同reasoning effort的对比
图2 | 核心结果。high+RHI在三档模型上均稳定超越xhigh/max/ultracode等更强reasoning设置。皇冠标记表示在30个任务中平均胜出19.5场以上。

核心发现令人震惊:低推理effort的Agent经过RHI优化后,稳定超越同模型max reasoning的表现。以Sonnet 4.6为例,默认配置是high reasoning effort,开启RHI迭代2-3轮后,它的成对胜率超过了把reasoning拉到xhigh、max、甚至ultracode的同一模型。

Sonnet 4.6的详细性能对比
图3 | Sonnet 4.6-high在RHI各轮次的详细性能。蓝线为RHI优化后,橙线为不同reasoning effort基线。迭代2-3轮后RHI稳定领先。

换到更强的Opus 4.7和4.8,RHI依然有效——增益不随模型变强而消失。

Opus 4.8的bar chart对比
图4 | Opus 4.8上的胜率对比。即使是最强的模型,high+RHI依然在多数任务上超越ultracode基线。

成本分析:性能涨了,钱还省了

推理成本最多降低60%,这是Opus 4.8上RHI相对于ultracode基线的数据。成本下降来自两个地方:一是reasoning effort保持在high不需要拉满,二是优化后的harness减少了cache读写量。

Sonnet 4.6的成本/cache/token分析
图5 | 跨RHI迭代的推理成本、output token、cache读写量变化。性能提升的同时,成本和cache使用量持续下降。

更高效的信息组织意味着Agent不需要反复读取大量上下文。这是一箭双雕:性能上去了,成本下来了。

最反直觉的发现:不是想更久,是想得更对

论文做了一个关键的消融实验:追踪RHI迭代过程中output token数量的变化。结果发现——

从第0轮到第4轮,output token几乎不变,但性能持续提升。这直接否定了"RHI通过让模型生成更长输出来提高质量"的解释。

那增益到底从哪来?答案藏在harness的四个组件中。

Harness拆解:谁在变,变得多?

论文把harness拆解为四种组件类型:role(角色定义)、instruction(指令)、contract(Agent间通信协议)、hop(工作流跳转)。通过embedding分析发现:

Harness组件的演化轨迹(t-SNE/UMAP降维)
图6 | Harness组件表示在RHI迭代中的演化。左图按领域着色,右图按迭代轮次着色。H(0)到H(1)有清晰的分离,说明RHI的第一步是将通用harness特化为任务专属版本。

RHI迭代过程中,contract最先稳定下来并且变化最大,其次是instruction和hop,role变化最慢。这意味着RHI优化的核心是重新组织信息流——让Agent之间的通信更精确、更贴合任务,减少冗余信息传递。

信息论假设:最大化信号,最小化冗余

论文进一步用信息论来形式化这个直觉。RHI的隐式优化目标等价于:

最大化每个harness组件与任务之间的互信息(组件携带的信号越多越好),同时惩罚不同组件之间的冗余(不同组件不应该重复表达相同信息)。

这是一个经典的"信息瓶颈"问题——RHI在无意中学会了它。每个组件都变成任务相关的信息通道,且通道之间不重叠。用大白话说:每个角色都只说该说的,不说不该说的,也不重复别人说过的。

RHI vs 训练缩放:互补而非替代

论文没有过度吹嘘。消融实验明确指出:RHI无法替代更强的模型。Sonnet 4.6经过RHI优化后性能有显著提升,但仍然打不过Opus 4.7的基线。RHI提升的是"给定模型能被用到多好",而不是"模型本身有多强"。

结论很清晰:RHI和训练缩放正交互补。你应该同时用更强的模型和更好的harness。

工程启示

这篇论文对实际构建Agent系统有三个直接启发。

第一,把system prompt当一等公民。我们习惯把prompt当配置文件写一次就不动了,但RHI证明了prompt级别的harness可优化空间巨大。你手写SOUL.md、USER.md、各种skill定义,本质上就是在做RHI第一轮迭代——只不过是人肉版。RHI给了一条自动化这条路。

第二,优化信息流比堆推理预算更划算。60%的成本节约不是靠压缩输出,是靠重新组织Agent之间的信息传递。这对多Agent系统尤其重要——很多时候Agent之间传递的信息充满冗余和噪声,RHI的方向是让通信变得更精确。

第三,成对反馈是实用的优化信号。不需要reward model,不需要人工标注,不需要梯度——只需要"A比B好"这个偏好信号。任何能跑Agent的环境都能加一层RHI循环。

局限性与批判

论文也诚实暴露了几个问题。

30个合成任务的规模偏小,且都是ML研究类任务,RHI在更开放的真实场景(比如Web开发、数据分析)是否同样有效还需验证。RHI只优化prompt级别的harness,结构化的Agent逻辑(Python写的orchestrator)不在优化范围内。另外,信息论假设目前只是观察一致性,还没有被严格证明为RHI的真实优化目标。

还有一个论文没展开讨论的点:RHI的比较对象都是同一模型家族内的不同reasoning effort档位。它没有跟跨模型的harness搜索方法(如Meta-Harness的种群搜索、Self-Harness的验证器回归测试)直接对比——这些方法更重但天花板可能更高。RHI的优势在于"轻量"——每轮Θ(1)的成本——但这个优势在什么情况下会被更强的搜索方法盖过?论文没有回答。

结语

RHI的核心insight:与其让模型想更久,不如让信息流动得更高效。

在行业疯狂卷reasoning token数量的当下,这篇论文从"脚手架优化"这个被忽视的角度,证明了还存在巨大的性能空间没被挖掘。方法轻量(3-4轮迭代)、信号简单(成对偏好)、效果显著(超越max reasoning、省60%成本),实用性很强。

对于每个在构建Agent系统的开发者来说,这篇论文传递了一个行动指南:别只盯着模型参数和推理预算,回头看看你的harness——那里面可能藏着被你忽略的性能金矿。你手写的每一个system prompt、每一条skill指令、每一个Agent间的通信协议,都是可以被系统化优化的对象。

毕竟,人类工程师也是这么工作的——我们不是靠加班加更多时间来提高产出,而是靠优化工作流程和沟通效率。RHI让Agent也学会了这件事。