arXiv 2603.28052
PAPER 04 · AGENT HARNESS

Meta-Harness

模型 Harness 的端到端自动优化

Yoonho Lee, Chelsea Finn 等 · 斯坦福 & MIT & KRAFTON · arXiv 2603.28052

arXiv 2603.28052 · 投稿 2026-03 · 中文版收录 2026-09-03

CITE

最会写 harness 的,可能是一个会翻历史记录的 agent。

— 本站导读
固定模型换 harness 能拉开 6 倍的性能差距,但 harness 仍靠工程师手工打磨,而现有文本优化器只喂标量分数或压缩摘要,根本不够诊断 harness 问题。Meta-Harness 用一个 coding agent 做「优化 harness 的 harness」:通过文件系统按需翻阅所有历史候选的源码、分数和完整执行轨迹,在文本分类、数学推理和 TerminalBench-2 上自动发现超越人类手工设计的 harness。

解决什么问题

LLM 系统的性能不只取决于模型权重,还取决于 harness——决定存什么、检索什么、把什么呈现给模型的代码。同一基准上不同 harness 可造成 6 倍差距,这催生了「harness 工程」,但它仍是手工作坊式循环:工程师看失败案例、调整启发式、迭代少数几个设计。论文问:这个过程能否自动化?

自然的起点是文本优化器(OPRO、TextGrad、AlphaEvolve、GEPA、TTT-Discover 等),但它们与 harness 工程严重错配,因为反馈被过度压缩:

创新点

01文件系统作反馈通道的 agentic 搜索CORE

提议者本身是 coding agent(Claude Code + Opus-4.6)。每个候选 harness 评估后,其源码、分数、执行轨迹全部写入文件系统;提议者通过 grep / cat 等终端操作选择性检索,而不是把历史塞进单个提示词——实测最重设置下每轮中位读 82 个文件、引用 20+ 个先前候选。单个评估可产生最多 10,000,000 token 的诊断信息,比以往文本优化器的反馈预算约高三个数量级。

02极简外循环:诊断权交给 agent

不依赖固定脚手架、候选归档或持久记忆机制,也没有硬编码的父代选择规则:提议者自由检查任何历史 harness 及其轨迹,自行决定诊断哪些失败模式、做局部修改还是整体重写。这让 Meta-Harness 能随 coding agent 变强而自动变强;提议者永远看不到测试集结果。

03代码空间搜索的先验优势

harness 优化发生在代码空间:检索、记忆、提示构造逻辑的小改动会在很多步之后才起效,局部搜索启发式不适配。把 harness 表示为程序带来天然正则化——coding 模型倾向提出连贯算法而非脆弱的硬编码补丁;且代码空间的过拟合肉眼可查(脆弱的 if-链、硬编码映射),这是权重空间过拟合不具备的可检查性。

关键结果

三个任务域:在线文本分类(GPT-OSS-120B 分类器)、检索增强数学推理(200 道 IMO 级问题)、agentic 编码(TerminalBench-2):

文本分类 · 中位准确率
32.6
GEPA
39.1
OpenEvolve
40.9
ACE
48.6
Meta-Harness
提议者接口消融
34.6
仅分数
34.9
分数+摘要
50.0
完整接口
TERMINALBENCH-2 · HAIKU 4.5
28.3
Terminus-2
35.5
Goose
37.6
Meta-Harness

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录