arXiv 2602.16873
PAPER 02 · MULTI-AGENT FRAMEWORK

AdaptOrch

LLM 性能趋同时代的任务自适应多智能体编排

Geunbin Yu · 韩国国民大学 · arXiv 2602.16873

arXiv 2602.16873 · 投稿 2026-02 · 中文版收录 2026-09-03

CITE

模型都差不多的时候,怎么搭队才是真正的杠杆。

— 本站导读
当各家大模型的基准分数挤进 2–5% 的窄带,「选哪个模型」不再重要,「怎么编排」才是主导性能的杠杆。AdaptOrch 给出这条论断的缩放定律证明,以及一个线性时间算法:分析任务 DAG 的结构特征,自动在并行 / 顺序 / 分层 / 混合四种编排拓扑中选型——同款模型下比静态拓扑基线提升 12–23%。

解决什么问题

2026 年初的模型格局出现悖论:GPT-4o、Claude 3.5 Sonnet、Gemini 2.0、Llama 3.3 70B、Qwen 2.5 72B 在 MMLU、HumanEval、MATH 上的分数聚在 2–5% 区间内(论文实测 MMLU 上 ε≈0.024)。模型选择的边际收益递减,而系统层面的编排结构开始主导结果。

现有编排方案都不做拓扑自适应:

实践界已感受到差距:Claude Code 的 Agent Teams、OpenCode 的并行子 agent 架构能把数小时顺序工作压缩到分钟级,但「怎么拆任务、选什么拓扑」仍留给用户——拓扑选择问题在算法层面悬而未决。

创新点

01性能趋同缩放定律THEORY

Varτ / VarMΩ(1/ε²)

当模型完全趋同(ε→0)且任务可并行时,编排拓扑带来的性能方差相对模型选择发散到无穷。以典型编码任务参数(并行宽度 ω≈3.4、耦合 γ≈0.35、ε≈0.05)估算方差比约 48.7——编排设计是与模型缩放正交的一等优化目标。

02拓扑路由算法(线性时间)CORE

把任务分解成带依赖与耦合强度标注的 DAG,提取三个结构属性:并行宽度 ω(最大反链)、关键路径深度 δ、耦合密度 γ,按决策规则在 O(|V|+|E|) 内路由到四种规范拓扑——τP 并行(无边全并发)、τS 顺序(ω=1)、τH 分层(高耦合+子任务多)、τX 混合(层内并行、层间串行)。路由开销 <50ms。

03自适应合成协议(可证明终止)

并行输出合并时用嵌入余弦相似度做一致性评分;不一致则交仲裁 agent,仍失败就调高耦合估计重路由(每次 +0.2),γ 超阈值必然转入有单一仲裁者的分层拓扑——至多 5 轮迭代保证终止,实测 94% 任务 2 轮内收敛。

关键结果

用 5 个 ε-趋同模型(GPT-4o-mini、Claude 3.5 Haiku、Gemini 2.0 Flash、Llama 3.3 70B、Qwen 2.5 72B)验证——所有方法同一批模型,唯一变量是编排方式:

SWE-BENCH VERIFIED
42.8
最强单模型
52.6
AdaptOrch
GPQA DIAMOND
46.2
最强单模型
53.1
AdaptOrch
HOTPOTQA (F1)
68.3
最强单模型
76.4
AdaptOrch

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录