arXiv 2601.04861
PAPER 09 · MULTI-AGENT · MODEL ROUTING

OI-MAS

跨多尺度模型的置信感知路由:像指挥家一样动态决定「谁上、用多强的模型」

Jingbo Wang 等 · 哈尔滨工业大学 · arXiv 2601.04861 · 2026-01

arXiv 2601.04861 · 投稿 2026-01 · 中文版收录 2026-09-03

CITE

每个人用得上多大模型,路由说了算。

— 本站导读
现有 MAS 给所有 agent 角色统一配上同一个大模型,但推理各阶段的认知需求并不相同。OI-MAS 把「选 agent 角色」和「选模型规模」统一成状态依赖的两级动态路由(Role Router + Model Router),并用校准后的模型置信度作为成本惩罚的自适应权重——置信度高就罚重(用小模型),置信度低就放松(允许升级大模型)。五个基准上准确率最高 +12.88%,成本最高 −79.78%。

解决什么问题

多智能体系统在复杂推理上优于单 agent,但普遍存在计算低效:框架通常给所有角色清一色部署同一规模的 LLM,忽略了「拆解、生成、批判、修订」各阶段对算力的需求差异。已有模型路由方法(如 MasRouter)在推理开始前就固定架构,无法随推理过程动态调整。缺的是一套边推理、边决定「谁执行、用多强模型」的在线机制。

创新点

01状态依赖的两级层次化路由(Conductor)CORE

推理状态定义为 (查询, 当前上下文),全过程最多 4 轮。第一级 Role Router 用 MiniLM 语义嵌入计算状态与各角色(Generator、Critique、Verifier、Programmer 等 9 种)的相似度,按累计概率阈值 θ=0.3 选出角色子集——可激活单个主导角色或多个互补角色,还内置 EarlyStop 角色直接终止冗余推理。第二级 Model Router 根据三元组 (查询, 上下文, 角色) 从异构模型池(Qwen2.5-3B/7B、Llama3.1-8B/70B)中选模型规模。角色规划与资源分配解耦。

02置信度加权的成本感知强化学习

用生成序列的平均 token 对数概率作为置信度——它是状态复杂度的可靠代理。训练目标 = 稀疏正确性奖励 + 置信度加权的计算成本惩罚:置信度高 → 当前决策已足够 → 施加更强成本惩罚,防止不必要升级大模型;置信度低 → 放松约束,允许重路由到大模型或更丰富的角色组合。针对「对数概率跨模型不可比」问题,用模型专属归一化与几何平均 token 概率回退值平滑插值校准。

03路由行为可解释

案例研究显示:问题越难,模型选择越偏向中大模型;生成类角色集中用最大模型,结构化角色(Programmer、Ensembler)集中在中型模型;Refiner 呈双峰分布——简单修订给最小模型,困难不一致才升级。路由确实学到了「按需分配」。

关键结果

在 GSM8K / MATH / MedQA / GPQA / MBPP 五个基准上对比单模型与 LLM-Debate、GPTSwarm、AFlow、MaAS、MasRouter 等 MAS 基线:

五基准平均准确率
70.55
MasRouter
73.47
MaAS Large
78.23
OI-MAS
GPQA 推理延迟(秒)
39.31
GPTSwarm
36.82
MasRouter
23.12
OI-MAS

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录