arXiv 2602.16873
PAPER 02 · MULTI-AGENT FRAMEWORK
AdaptOrch
LLM 性能趋同时代的任务自适应多智能体编排
Geunbin Yu · 韩国国民大学 · arXiv 2602.16873
arXiv 2602.16873 · 投稿 2026-02 · 中文版收录 2026-09-03
CITE
模型都差不多的时候,怎么搭队才是真正的杠杆。
— 本站导读
当各家大模型的
基准分数挤进 2–5% 的窄带,「选哪个模型」不再重要,
「怎么编排」才是主导性能的杠杆。AdaptOrch 给出这条论断的
缩放定律证明,以及一个线性时间算法:分析任务
DAG 的结构特征,自动在并行 / 顺序 / 分层 / 混合四种编排拓扑中选型——同款模型下比静态拓扑基线提升 12–23%。
解决什么问题
2026 年初的模型格局出现悖论:GPT-4o、Claude 3.5 Sonnet、Gemini 2.0、Llama 3.3 70B、Qwen 2.5 72B 在 MMLU、HumanEval、MATH 上的分数聚在 2–5% 区间内(论文实测 MMLU 上 ε≈0.024)。模型选择的边际收益递减,而系统层面的编排结构开始主导结果。
现有编排方案都不做拓扑自适应:
- 静态框架(MCP、LangGraph、CrewAI、AutoGen):定义固定的执行拓扑,拓扑靠人工设计,不随任务变化。
- 路由式系统(Mixture-of-Agents、LLM-Blender):动态选模型或混合输出,但 agent 协调的结构拓扑不动。
实践界已感受到差距:Claude Code 的 Agent Teams、OpenCode 的并行子 agent 架构能把数小时顺序工作压缩到分钟级,但「怎么拆任务、选什么拓扑」仍留给用户——拓扑选择问题在算法层面悬而未决。
创新点
01性能趋同缩放定律THEORY
Varτ / VarM ≥ Ω(1/ε²)
当模型完全趋同(ε→0)且任务可并行时,编排拓扑带来的性能方差相对模型选择发散到无穷。以典型编码任务参数(并行宽度 ω≈3.4、耦合 γ≈0.35、ε≈0.05)估算方差比约 48.7——编排设计是与模型缩放正交的一等优化目标。
02拓扑路由算法(线性时间)CORE
把任务分解成带依赖与耦合强度标注的 DAG,提取三个结构属性:并行宽度 ω(最大反链)、关键路径深度 δ、耦合密度 γ,按决策规则在 O(|V|+|E|) 内路由到四种规范拓扑——τP 并行(无边全并发)、τS 顺序(ω=1)、τH 分层(高耦合+子任务多)、τX 混合(层内并行、层间串行)。路由开销 <50ms。
03自适应合成协议(可证明终止)
并行输出合并时用嵌入余弦相似度做一致性评分;不一致则交仲裁 agent,仍失败就调高耦合估计重路由(每次 +0.2),γ 超阈值必然转入有单一仲裁者的分层拓扑——至多 5 轮迭代保证终止,实测 94% 任务 2 轮内收敛。
关键结果
用 5 个 ε-趋同模型(GPT-4o-mini、Claude 3.5 Haiku、Gemini 2.0 Flash、Llama 3.3 70B、Qwen 2.5 72B)验证——所有方法同一批模型,唯一变量是编排方式:
- 三个基准分别提升 +22.9% / +14.9% / +11.9%;混合拓扑整体被选中 49.7%——多数任务同时含可并行与必须串行的部分。
- 拓扑错配可能有害:静态全并行在 GPQA 上(44.1)反而低于最强单模型(46.2)——推理任务耦合高,盲目并行会丢上下文。
- 与计算量对齐的 Self-MoA 自一致性基线相比,剩余 11% 的一致差距来自拓扑感知的非均匀算力分配;消融显示合成协议贡献最大(去掉 −5.5),其后是自适应路由(−2.8)。
局限
- 分解质量依赖分解器模型;耦合估计是离散四档(0 / 0.3 / 0.7 / 1.0),较粗糙。
- 对单步原子任务编排没有增益——编排收益与任务可分解性成正比;创意写作、多模态场景待验证。
- 落地友好:可直接映射到 Claude Code Agent Teams、LangGraph、OpenCode + MCP 等现有基础设施。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录