arXiv 2608.27338
MULTI-AGENT · ACTIVATION STEERING
MoRe: Mixture of Roles
用「角色混合」把多智能体协同压缩进单次推理
arXiv 2608.27338 · UIUC + Amazon · 2026-08-27
arXiv 2608.27338 · 投稿 2026-08 · 中文版收录 2026-09-03
CITE
多视角不必靠多张嘴——一次推理也能内化一支团队。
— 本站导读
一句话:MAS 靠多轮文本通信融合多种角色视角,成本高;MoRe 把多种「角色」学成可组合的
激活引导向量(
codebook),用查询感知
路由器在单次前向中动态混合,性能逼近 MAS,token 成本约降
20×。
要解决什么问题
专业化是 LLM 成功的关键路径之一:单智能体常用固定 persona 或 steering vector,但只能施加一种固定特化;多智能体系统(MAS)通过多角色文本辩论/协作实现动态多视角,却依赖多轮交互,上下文膨胀、推理成本随 agent 数与轮数线性上升,还可能因长上下文损害推理质量。
核心矛盾:要动态多视角,就要多轮文本协同;要低成本,就只能固定单一角色。MoRe 问的是:能否在单次推理里获得动态多视角专业化?
创新点
01Specialization Codebook + 查询感知路由CORE
学习一组可端到端优化的 steering vector(每个对应一种潜在角色),再由轻量路由器按查询生成混合权重,得到查询特异的组合向量 v_Q,在中间层对输入末 token 做激活引导。特化发生在激活空间,而非文本空间。
02三阶段 SFT 课程 + GRPO 后训练
骨干 LLM 全程冻结。SFT 用课程让 composer 学会基本路由;GRPO 把策略定义在候选角色空间上,用相对奖励探索更好的角色协同轨迹,信用分配更清晰。
03单轮、单智能体的多视角推理
彻底去掉 MAS 的多轮文本通信开销:同一模型、一次前向即可融合多种角色视角,实现「One Model, Many Minds」。
关键结果
骨干为 Llama-3.1-8B-Instruct 与 Qwen3-8B。对比单智能体特化(CAA、ActAdd、Prompt FT、IRIS 等)与 MAS(LLM Debate、AutoGen、AgentVerse、DyLAN)基线,覆盖 MMLU、TriviaQA、MATH、GSM8K、MedQA 等推理与性格相关基准。
- 相对单智能体基线平均准确率约 +2.2%。
- 与 MAS 性能相当,同时 token 成本约降低 20×。
- 说明:多视角增益主要来自「角色混合」本身,而非必须依赖昂贵的多轮文本交互。
局限
- 依赖对中间层激活的干预,部署需模型可注入 hook;黑盒 API 场景难以直接使用。
- 角色 codebook 规模与路由质量受训练数据与课程设计影响,跨领域泛化仍需更多验证。
- 当前实验以 8B 级模型为主,更大规模模型上的增益与稳定性有待报告。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录