当前AI系统的进步,大家都在盯两个方向:更大的模型(训练缩放)和更多的推理时间(测试时缩放)。这篇论文指出了一条被忽视的第三条路——模型与脚手架的协同进化(model-harness co-evolution)。
什么是harness?通俗讲,就是你给Agent的那套"操作系统":system prompt定义角色,instruction定义任务执行规则,contract定义Agent之间怎么交换信息,hop定义工作流的控制流。你用的Claude Code、Cursor、Devin,底层都有一套精心设计的harness在驱动。
问题在于,harness越好,Agent产出的执行轨迹质量越高,这些轨迹又能反哺训练下一代基础模型,形成一个数据飞轮。但飞轮的起点卡在harness的质量上。让模型提供商去持续更新harness太贵了——那能不能让用户侧的harness自己优化自己?
RHI的核心假设:harness不是静态配置,而是可以被迭代优化的"中间件"。优化harness比优化模型本身更便宜、更可控。
RHI的算法结构出人意料地简单。每轮迭代做三件事:
用当前版本的harness驱动Agent完成任务,生成一个完整的代码仓库。比如"用量化金融方法分析某股票的动量策略",Agent需要生成研究报告、可视化、实验代码等标准交付物。
拿当前版本的输出和上一版的输出做两两对比,用一个独立的LLM裁判(gpt-5.5-max或opus-4.7)判定哪个更好。评判标准覆盖六个维度:交付物完整性、方法论严谨性、可复现性、代码工程质量、任务对齐、展示质量。
一个"harness优化器"LLM拿到所有历次对比的累积反馈历史——不是一次对比,而是完整的偏好演化轨迹——分析"哪个版本哪里做得更好,为什么",然后生成改进后的新harness。
循环往复,2-4轮就收敛。
论文在30个合成ML研究任务上测试(覆盖量化金融、机器人、药学三个领域),用了三档基础模型:Claude Sonnet 4.6、Opus 4.7、Opus 4.8。
核心发现令人震惊:低推理effort的Agent经过RHI优化后,稳定超越同模型max reasoning的表现。以Sonnet 4.6为例,默认配置是high reasoning effort,开启RHI迭代2-3轮后,它的成对胜率超过了把reasoning拉到xhigh、max、甚至ultracode的同一模型。
换到更强的Opus 4.7和4.8,RHI依然有效——增益不随模型变强而消失。
推理成本最多降低60%,这是Opus 4.8上RHI相对于ultracode基线的数据。成本下降来自两个地方:一是reasoning effort保持在high不需要拉满,二是优化后的harness减少了cache读写量。
更高效的信息组织意味着Agent不需要反复读取大量上下文。这是一箭双雕:性能上去了,成本下来了。
论文做了一个关键的消融实验:追踪RHI迭代过程中output token数量的变化。结果发现——
从第0轮到第4轮,output token几乎不变,但性能持续提升。这直接否定了"RHI通过让模型生成更长输出来提高质量"的解释。
那增益到底从哪来?答案藏在harness的四个组件中。
论文把harness拆解为四种组件类型:role(角色定义)、instruction(指令)、contract(Agent间通信协议)、hop(工作流跳转)。通过embedding分析发现:
RHI迭代过程中,contract最先稳定下来并且变化最大,其次是instruction和hop,role变化最慢。这意味着RHI优化的核心是重新组织信息流——让Agent之间的通信更精确、更贴合任务,减少冗余信息传递。
论文进一步用信息论来形式化这个直觉。RHI的隐式优化目标等价于:
这是一个经典的"信息瓶颈"问题——RHI在无意中学会了它。每个组件都变成任务相关的信息通道,且通道之间不重叠。用大白话说:每个角色都只说该说的,不说不该说的,也不重复别人说过的。
论文没有过度吹嘘。消融实验明确指出:RHI无法替代更强的模型。Sonnet 4.6经过RHI优化后性能有显著提升,但仍然打不过Opus 4.7的基线。RHI提升的是"给定模型能被用到多好",而不是"模型本身有多强"。
结论很清晰:RHI和训练缩放正交互补。你应该同时用更强的模型和更好的harness。
这篇论文对实际构建Agent系统有三个直接启发。
第一,把system prompt当一等公民。我们习惯把prompt当配置文件写一次就不动了,但RHI证明了prompt级别的harness可优化空间巨大。你手写SOUL.md、USER.md、各种skill定义,本质上就是在做RHI第一轮迭代——只不过是人肉版。RHI给了一条自动化这条路。
第二,优化信息流比堆推理预算更划算。60%的成本节约不是靠压缩输出,是靠重新组织Agent之间的信息传递。这对多Agent系统尤其重要——很多时候Agent之间传递的信息充满冗余和噪声,RHI的方向是让通信变得更精确。
第三,成对反馈是实用的优化信号。不需要reward model,不需要人工标注,不需要梯度——只需要"A比B好"这个偏好信号。任何能跑Agent的环境都能加一层RHI循环。
论文也诚实暴露了几个问题。
30个合成任务的规模偏小,且都是ML研究类任务,RHI在更开放的真实场景(比如Web开发、数据分析)是否同样有效还需验证。RHI只优化prompt级别的harness,结构化的Agent逻辑(Python写的orchestrator)不在优化范围内。另外,信息论假设目前只是观察一致性,还没有被严格证明为RHI的真实优化目标。
还有一个论文没展开讨论的点:RHI的比较对象都是同一模型家族内的不同reasoning effort档位。它没有跟跨模型的harness搜索方法(如Meta-Harness的种群搜索、Self-Harness的验证器回归测试)直接对比——这些方法更重但天花板可能更高。RHI的优势在于"轻量"——每轮Θ(1)的成本——但这个优势在什么情况下会被更强的搜索方法盖过?论文没有回答。
RHI的核心insight:与其让模型想更久,不如让信息流动得更高效。
在行业疯狂卷reasoning token数量的当下,这篇论文从"脚手架优化"这个被忽视的角度,证明了还存在巨大的性能空间没被挖掘。方法轻量(3-4轮迭代)、信号简单(成对偏好)、效果显著(超越max reasoning、省60%成本),实用性很强。
对于每个在构建Agent系统的开发者来说,这篇论文传递了一个行动指南:别只盯着模型参数和推理预算,回头看看你的harness——那里面可能藏着被你忽略的性能金矿。你手写的每一个system prompt、每一条skill指令、每一个Agent间的通信协议,都是可以被系统化优化的对象。
毕竟,人类工程师也是这么工作的——我们不是靠加班加更多时间来提高产出,而是靠优化工作流程和沟通效率。RHI让Agent也学会了这件事。