PAPER DIGEST · 2026

Multi-Agent Framework / Harness

2026 年代表性论文 · 中文编译版

11 篇经核验的 arXiv 论文(多智能体编排 / harness / 自生成 / 安全):每篇一页中文编译 + 原文对照;前五篇附本地 PDF,其余直链 arXiv 原文。正文带点状下划线的词可在术语表中查看。

QUERY PLANNER AGENTS ×N VERIFIER ANSWER
multi-agent framework:协调多个 LLM agent 协作的结构——怎么拆任务、怎么并行、怎么合并。
agent harness:包裹在模型外围的执行系统——决定模型每步看到什么、用什么工具、何时验证、何时停止。
2026 年的共同主题:模型能力趋同后,模型之外的结构设计成为新的性能主战场

论文列表

展示模式 · 列表已读 0 / 11
01 · MULTI-AGENT FRAMEWORK

VMAO:验证式多智能体编排

arXiv 2603.11445 · AWS + HSBC · ICLR 2026 Workshop

把「验证」提升为编排层的一等协调信号:DAG 分解并行执行,独立 LLM 检查员评估完整性,发现缺口自动重规划补漏。市场研究查询完整性 3.1→4.2、来源质量 2.6→4.1。

中文版PDF
02 · MULTI-AGENT FRAMEWORK

AdaptOrch:任务自适应拓扑编排

arXiv 2602.16873 · 韩国国民大学

证明「模型趋同时拓扑比选模型重要」(缩放定律 Ω(1/ε²)),给出线性时间路由算法,按任务 DAG 结构自动在并行/顺序/分层/混合四种拓扑中选型。同款模型提升 12–23%。

中文版PDF
03 · AGENT HARNESS

NLAH:自然语言 Agent Harness

arXiv 2603.25723 · 清华深研院 + 哈工大(深圳)

把埋在控制器代码里的 harness 策略外化为可编辑的自然语言文档,由共享运行时解释执行;自然语言管策略,代码管精确机制。策略层 60K→2.9K token,任务表现与代码 harness 相当。

中文版PDF
04 · AGENT HARNESS

Meta-Harness:自动搜索最优 harness

arXiv 2603.28052 · 斯坦福 + MIT + KRAFTON

「用 harness 优化 harness」:coding agent 通过文件系统按需翻阅全部历史候选的源码、分数与执行轨迹,自动发现超越人类手工设计的 harness,TerminalBench-2 Haiku 榜第一。

中文版PDF
05 · AGENT HARNESS · 多模态

MUSE:面向多模态大模型的统一 Harness

arXiv 2606.03005 · 东北大学 + 北京大学

首个面向冻结多模态大模型的统一 harness:感知工具 + 确定性验证器 + 修复循环,模型完全黑盒。GPT-4o 找字任务 3%→21%——许多「模型不行」其实是「harness 不行」。

中文版PDF
06 · MULTI-AGENT · ACTIVATION

MoRe:用角色混合把 MAS 协同压进单次推理

arXiv 2608.27338 · UIUC + Amazon · 2026-08

把多种角色学成可组合的激活引导向量(codebook),查询感知路由器在单次前向中动态混合。性能逼近 MAS,token 成本约降 20×——多视角不必依赖多轮文本通信。

中文版PDF
07 · MULTI-AGENT · SECURITY SoK

SoK:安全的智能体也可能一起失败

arXiv 2609.00595 · 2026-09 · 21 pages

对 197 篇工作做执行中心分析,提出 A-I-R 攻击框架与五部分防御契约;审计 44 项评测。核心主张:真正的 MAS 安全效应必须在交互路径上被证明。

中文版PDF
08 · MULTI-AGENT · SELF-GENERATIVE

MAS²:自生成、自配置、自纠偏的多智能体系统

arXiv 2509.24323 · ICLR 2026 Poster

用 generator–implementer–rectifier 三元 meta-agent 递归定制目标 MAS,运行中纠偏。七项基准相对 SOTA 最高约 +19.6%,处在成本–性能 Pareto 前沿。

中文版PDF
09 · MULTI-AGENT · MODEL ROUTING

OI-MAS:跨多尺度模型的置信感知路由

arXiv 2601.04861 · 哈尔滨工业大学 · 2026-01

把「选 agent 角色」和「选模型规模」统一为状态依赖的两级动态路由,用校准后的模型置信度作为成本惩罚的自适应权重。五基准准确率最高 +12.88%,成本最高 −79.78%。

中文版PDF
10 · MULTI-AGENT · DECENTRALIZED

Symphony-Coord:去中心化的涌现式协调

arXiv 2602.00966 · NUS + NYU + Gradient 等 · 2026-02

把 agent 选择建模为在线上下文多臂老虎机:Beacon 协议先筛 Top-L 候选,LinUCB 按任务与 agent 状态路由,角色专长从交互反馈中涌现。次线性 regret 理论保证,agent 失效下可自愈。

中文版PDF
11 · AGENT HARNESS · TOOL USE

HEART:自然语言工具原语 + 2.5 万函数仓库

arXiv 2609.01736 · 2026-09

让工具适配模型而非相反:Tool Primitive 用 LLM 包装工具、以自然语言为接口,ToolFace 语义检索 25,519 个函数,Planner–Router–Verifier 闭环恢复。8B 骨干超三个商用模型 6%、成本最高降 85%,且结构上免疫 prompt injection。

中文版PDF

横向对比

PAPER解决什么问题核心创新点
VMAO多 agent 系统缺乏有原则的质量验证子问题 DAG + 编排层验证器驱动自适应重规划
AdaptOrch模型趋同后选模型收益递减拓扑缩放定律 + 线性时间路由四种拓扑
NLAHharness 策略埋在代码里难迁移自然语言策略文档 + 共享运行时解释执行
Meta-Harness换 harness 可差 6 倍但仍靠手工coding agent 经文件系统翻阅历史轨迹自动搜索
MUSEMLLM 视觉任务失败常被误判为模型不行冻结 MLLM 统一 harness:工具 + 验证器 + 修复循环
MoReMAS 多轮文本成本高角色 codebook 激活混合;约 20× 更省 token
SoK局部安全检查覆盖不了跨主体失败A-I-R 框架 + 五部分防御契约;路径闭合与恢复
MAS²自动 MAS 多为生成一次就部署Generator–Implementer–Rectifier;运行时纠偏
OI-MAS所有角色配同一大模型造成算力浪费状态依赖角色+模型两级路由;置信度加权成本惩罚
Symphony-Coord静态角色 + 中心化控制难以扩展与自愈Beacon 筛选 + LinUCB 在线路由;次线性 regret 界
HEARTschema 调用脆弱、大工具目录性能崩塌自然语言工具原语 + 2.5 万函数检索 + 验证恢复闭环

共同趋势

1 · 性能瓶颈正在从模型转移到模型外围

AdaptOrch 给出「模型趋同 → 编排主导」的定量证明;MUSE 证明多数多模态失败是 harness 层缺陷。

2 · 「验证」是被反复确认的最有价值组件

把生成与评估解耦,用模型外的信号判定成败。

3 · 更多调用 ≠ 更好

结构与纪律比堆 token 更关键;MoRe 用激活混合替代多轮文本。

4 · 从静态编排到自生成与可恢复安全

MAS² 打破 generate-once;SoK 强调路径闭合与恢复。

建议阅读顺序

先读 Meta-HarnessNLAH / MUSEAdaptOrch / VMAOMAS²MoReSoKOI-MASSymphony-CoordHEART

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录