arXiv 2608.27338
MULTI-AGENT · ACTIVATION STEERING

MoRe: Mixture of Roles

用「角色混合」把多智能体协同压缩进单次推理
arXiv 2608.27338 · UIUC + Amazon · 2026-08-27

arXiv 2608.27338 · 投稿 2026-08 · 中文版收录 2026-09-03

CITE

多视角不必靠多张嘴——一次推理也能内化一支团队。

— 本站导读
一句话:MAS 靠多轮文本通信融合多种角色视角,成本高;MoRe 把多种「角色」学成可组合的激活引导向量(codebook),用查询感知路由器在单次前向中动态混合,性能逼近 MAS,token 成本约降 20×

要解决什么问题

专业化是 LLM 成功的关键路径之一:单智能体常用固定 persona 或 steering vector,但只能施加一种固定特化;多智能体系统(MAS)通过多角色文本辩论/协作实现动态多视角,却依赖多轮交互,上下文膨胀、推理成本随 agent 数与轮数线性上升,还可能因长上下文损害推理质量。

核心矛盾:要动态多视角,就要多轮文本协同;要低成本,就只能固定单一角色。MoRe 问的是:能否在单次推理里获得动态多视角专业化?

创新点

01Specialization Codebook + 查询感知路由CORE

学习一组可端到端优化的 steering vector(每个对应一种潜在角色),再由轻量路由器按查询生成混合权重,得到查询特异的组合向量 v_Q,在中间层对输入末 token 做激活引导。特化发生在激活空间,而非文本空间。

02三阶段 SFT 课程 + GRPO 后训练

骨干 LLM 全程冻结。SFT 用课程让 composer 学会基本路由;GRPO 把策略定义在候选角色空间上,用相对奖励探索更好的角色协同轨迹,信用分配更清晰。

03单轮、单智能体的多视角推理

彻底去掉 MAS 的多轮文本通信开销:同一模型、一次前向即可融合多种角色视角,实现「One Model, Many Minds」。

关键结果

骨干为 Llama-3.1-8B-Instruct 与 Qwen3-8B。对比单智能体特化(CAA、ActAdd、Prompt FT、IRIS 等)与 MAS(LLM Debate、AutoGen、AgentVerse、DyLAN)基线,覆盖 MMLU、TriviaQA、MATH、GSM8K、MedQA 等推理与性格相关基准。

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录