arXiv 2606.03005
PAPER 05 · AGENT HARNESS · MULTIMODAL

MUSE

面向多模态大模型(MLLM)的统一 Agentic Harness

Jianglin Lu, Yun Fu 等 · 东北大学 & 北京大学 · arXiv 2606.03005

arXiv 2606.03005 · 投稿 2026-06 · 中文版收录 2026-09-03

CITE

许多「模型不行」,其实是「harness 不行」。

— 本站导读
多模态大模型会在人类一眼就会的任务上翻车——从截图走迷宫、挑对拼图块、在几百个相似字符里找目标字。主流思路是重新训练模型,MUSE 反其道而行:模型完全冻结、严格黑盒,在外面套一层模块化 harness——感知工具(OCR 等)、结构化解析、确定性验证器、验证器引导的修复循环。GPT-4o 在找字任务上从 3% 提到 21%,证明许多「模型不行」其实是「harness 不行」

解决什么问题

MLLM 已能统一图像理解、对话与推理,但在人类轻松完成的任务上仍有惊人失败:补全拼图缺角、在网格迷宫里规划合法路径、在密集字符网格中定位目标汉字。主流研究都在改模型本身——合成视觉推理数据、视觉思维链监督、强化学习自验证——但这些方法本质是模型中心优化:要么需要访问模型参数,要么依赖昂贵的重训练管线。实践中最强的商业 MLLM 是闭源的,开源权重也迭代飞快,专用训练管线维护成本高且很快过时。

论文主张一个互补且正交的方向:改模型周围的 harness,不改模型。文本 agent 领域已有 Meta-Harness、AutoHarness 等 harness 优化工作,但全部局限在纯文本任务;把 harness 范式迁移到多模态并不平凡——视觉输入带来感知脆弱性,输出可能需要对照几何/空间结构验证,工具调用必须作用于视觉上下文而非裸文本。

创新点

01首个面向冻结 MLLM 的统一多模态 harness

严格黑盒设定:底座模型绝不微调、蒸馏或更新参数,全部收益来自 harness 层。与 Meta-Harness 的「搜索式」优化互补,MUSE 走设计驱动路线:针对多模态基准中经验观察到的失败模式,系统性构造一个单一 harness。

02模块化管线,一套抽象覆盖全流程CORE

统一任务表示(每个数据集经适配器归一成同一 record 模式)+ 任务钩子(绑定答案抽取、修复策略与工具需求,新增基准只需注册)+ 外置确定性验证器(正确性判定从模型外部化到 harness;每次拒绝按失败分类:格式违规 / 任务逻辑错误 / 证据缺口)+ 模拟器验证(导航任务在模拟器执行动作序列,拼图任务按边界 L1 像素失配评分,能区分「看起来都对」的候选)+ 感知工具注册表(缩放、旋转、OCR、嵌入等按任务声明调用)。

03验证器引导的修复循环

初始候选被拒后进入至多 K 轮修复:原始上下文加失败转录(按序编号、引用模型输出、模拟器反馈与语法错误区分)再调模型,附失败摘要(错误类型计数、最新验证器信号、基于内容指纹的重复输出标志,防止模型在同一个错误承诺上打转)。验证器一通过立即短路退出,简单题只花一次调用成本。与自我批评不同,MUSE 用外置验证器把生成与评估解耦。

关键结果

4 个冻结前沿模型(GPT-4o、GPT-5.4、Claude Haiku 4.5、Opus 4.7)× 4 个异构基准(VSP-Grid 迷宫导航、BLINK-Jigsaw 拼图、CoMT 多模态推理、TIR-Bench 找字)全部一致提升。下图是找字任务(正确数 / 100):

GPT-4O
3
BASE
21
MUSE
GPT-5.4
30
BASE
62
MUSE
HAIKU 4.5
5
BASE
35
MUSE
OPUS 4.7
23
BASE
59
MUSE

意义与局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录