arXiv 2601.04861
PAPER 09 · MULTI-AGENT · MODEL ROUTING
OI-MAS
跨多尺度模型的置信感知路由:像指挥家一样动态决定「谁上、用多强的模型」
Jingbo Wang 等 · 哈尔滨工业大学 · arXiv 2601.04861 · 2026-01
arXiv 2601.04861 · 投稿 2026-01 · 中文版收录 2026-09-03
CITE
每个人用得上多大模型,路由说了算。
— 本站导读
现有 MAS 给所有 agent 角色统一配上同一个大模型,但推理各阶段的认知需求并不相同。OI-MAS 把「选 agent 角色」和「选模型规模」统一成
状态依赖的两级动态路由(Role Router + Model Router),并用
校准后的
模型置信度作为成本惩罚的自适应权重——置信度高就罚重(用小模型),置信度低就放松(允许升级大模型)。五个基准上准确率最高 +12.88%,成本最高 −79.78%。
解决什么问题
多智能体系统在复杂推理上优于单 agent,但普遍存在计算低效:框架通常给所有角色清一色部署同一规模的 LLM,忽略了「拆解、生成、批判、修订」各阶段对算力的需求差异。已有模型路由方法(如 MasRouter)在推理开始前就固定架构,无法随推理过程动态调整。缺的是一套边推理、边决定「谁执行、用多强模型」的在线机制。
创新点
01状态依赖的两级层次化路由(Conductor)CORE
推理状态定义为 (查询, 当前上下文),全过程最多 4 轮。第一级 Role Router 用 MiniLM 语义嵌入计算状态与各角色(Generator、Critique、Verifier、Programmer 等 9 种)的相似度,按累计概率阈值 θ=0.3 选出角色子集——可激活单个主导角色或多个互补角色,还内置 EarlyStop 角色直接终止冗余推理。第二级 Model Router 根据三元组 (查询, 上下文, 角色) 从异构模型池(Qwen2.5-3B/7B、Llama3.1-8B/70B)中选模型规模。角色规划与资源分配解耦。
02置信度加权的成本感知强化学习
用生成序列的平均 token 对数概率作为置信度——它是状态复杂度的可靠代理。训练目标 = 稀疏正确性奖励 + 置信度加权的计算成本惩罚:置信度高 → 当前决策已足够 → 施加更强成本惩罚,防止不必要升级大模型;置信度低 → 放松约束,允许重路由到大模型或更丰富的角色组合。针对「对数概率跨模型不可比」问题,用模型专属归一化与几何平均 token 概率回退值平滑插值校准。
03路由行为可解释
案例研究显示:问题越难,模型选择越偏向中大模型;生成类角色集中用最大模型,结构化角色(Programmer、Ensembler)集中在中型模型;Refiner 呈双峰分布——简单修订给最小模型,困难不一致才升级。路由确实学到了「按需分配」。
关键结果
在 GSM8K / MATH / MedQA / GPQA / MBPP 五个基准上对比单模型与 LLM-Debate、GPTSwarm、AFlow、MaAS、MasRouter 等 MAS 基线:
- 准确率最高提升 12.88%、成本最高降低 79.78%;相对 vanilla 模型提升 9.52–21.13%;vs MasRouter 平均 +7.68%,四个基准上胜出。
- OOD 泛化:仅在 MBPP 上训练、HumanEval 上测试,Pass@1 达 91.46%(超最强基线 MaAS 的 89.63%),成本不到次优基线的一半。
- 消融显示去掉置信度加权后性能显著下降(MedQA 78.99→76.47,MBPP 91.59→87.39)——该组件不仅省钱,对精度本身也关键。
局限
- 未显式研究 agent memory 的表示与治理,可能影响长程连贯性与迭代协作可靠性。
- 性能–成本平衡不保证在高并发大规模部署下均匀成立。
- 安全性未作为设计目标:不安全工具调用、涌现行为、策略违规在 agent 间的传播未被处理。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录