arXiv 2603.28052
PAPER 04 · AGENT HARNESS
Meta-Harness
模型 Harness 的端到端自动优化
Yoonho Lee, Chelsea Finn 等 · 斯坦福 & MIT & KRAFTON · arXiv 2603.28052
arXiv 2603.28052 · 投稿 2026-03 · 中文版收录 2026-09-03
CITE
最会写 harness 的,可能是一个会翻历史记录的 agent。
— 本站导读
固定模型换
harness 能拉开 6 倍的性能差距,但 harness 仍靠工程师手工打磨,而现有文本优化器只喂标量分数或压缩摘要,根本不够诊断 harness 问题。Meta-Harness 用一个 coding agent 做「优化 harness 的 harness」:
通过文件系统按需翻阅所有历史候选的源码、分数和完整执行轨迹,在文本分类、数学推理和 TerminalBench-2 上自动发现超越人类手工设计的 harness。
解决什么问题
LLM 系统的性能不只取决于模型权重,还取决于 harness——决定存什么、检索什么、把什么呈现给模型的代码。同一基准上不同 harness 可造成 6 倍差距,这催生了「harness 工程」,但它仍是手工作坊式循环:工程师看失败案例、调整启发式、迭代少数几个设计。论文问:这个过程能否自动化?
自然的起点是文本优化器(OPRO、TextGrad、AlphaEvolve、GEPA、TTT-Discover 等),但它们与 harness 工程严重错配,因为反馈被过度压缩:
- 只条件于当前候选,或只看标量分数,或把反馈限制在短模板 / LLM 摘要里;
- 每步优化可用的上下文只有约 100–30,000 token,而 harness 是长时程的——「存什么、何时取、怎么呈现」的一个决定可能在很多推理步之后才显效,压缩反馈恰恰抹掉了把下游失败追溯到早期 harness 决策所需的信息。
创新点
01文件系统作反馈通道的 agentic 搜索CORE
提议者本身是 coding agent(Claude Code + Opus-4.6)。每个候选 harness 评估后,其源码、分数、执行轨迹全部写入文件系统;提议者通过 grep / cat 等终端操作选择性检索,而不是把历史塞进单个提示词——实测最重设置下每轮中位读 82 个文件、引用 20+ 个先前候选。单个评估可产生最多 10,000,000 token 的诊断信息,比以往文本优化器的反馈预算约高三个数量级。
02极简外循环:诊断权交给 agent
不依赖固定脚手架、候选归档或持久记忆机制,也没有硬编码的父代选择规则:提议者自由检查任何历史 harness 及其轨迹,自行决定诊断哪些失败模式、做局部修改还是整体重写。这让 Meta-Harness 能随 coding agent 变强而自动变强;提议者永远看不到测试集结果。
03代码空间搜索的先验优势
harness 优化发生在代码空间:检索、记忆、提示构造逻辑的小改动会在很多步之后才起效,局部搜索启发式不适配。把 harness 表示为程序带来天然正则化——coding 模型倾向提出连贯算法而非脆弱的硬编码补丁;且代码空间的过拟合肉眼可查(脆弱的 if-链、硬编码映射),这是权重空间过拟合不具备的可检查性。
关键结果
三个任务域:在线文本分类(GPT-OSS-120B 分类器)、检索增强数学推理(200 道 IMO 级问题)、agentic 编码(TerminalBench-2):
TERMINALBENCH-2 · HAIKU 4.5
- 文本分类:48.6%,超 SOTA 手工 harness ACE +7.7 分,且上下文只用了 11.4K token(ACE 要 50.8K)——精度与上下文双优;用 1/10 的评估次数追平 OpenEvolve / TTT-Discover,最终反超 10+ 分。
- 关键消融——原始执行轨迹是命门:仅分数中位 34.6、分数+摘要 34.9、完整接口 50.0;完整接口的中位候选都好于前两者的最佳候选——摘要补不回被压缩掉的诊断信号。
- OOD 泛化:9 个搜索期未见的数据集上平均 73.1%,仍为最优(ACE 70.2%)。
- 数学推理:单一发现 harness 在 5 个从未参与搜索的模型上平均 +4.7 分(vs 无检索),且在纯 BM25 词法检索栈上实现。
- TerminalBench-2:Opus 4.6 达 76.4%(超手工精调的 Terminus-KIRA 74.7%);Haiku 4.5 达 37.6%,所有 Haiku 4.5 agent 中第 1。
局限
- harness 与模型解耦搜索(模型冻结),未来方向是两者协同演化;只用了一个提议者(Claude Code)做实验。
- 一次搜索数小时即可完成,产出的策略可读、可跨模型复用——一旦搜索空间可访问,通用 agent 就能超过手工设计。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录