arXiv 2602.00966
PAPER 10 · MULTI-AGENT · DECENTRALIZED
Symphony-Coord
把 agent 选择变成在线老虎机:去中心化、无预定义角色的涌现式协调
Zhaoyang Guan 等 · NUS + NYU + Gradient 等 · arXiv 2602.00966 · 2026-02(v2 2026-05)
arXiv 2602.00966 · 投稿 2026-02 · 中文版收录 2026-09-03
CITE
没有中央指挥,秩序照样从交互中长出来。
— 本站导读
现有多智能体协调依赖静态角色分配和中心化控制器,agent 池一大就路由低效、适应性差、故障恢复脆弱。Symphony-Coord 把 agent 选择建模为
在线上下文多臂老虎机问题:两阶段动态 Beacon 协议先轻量筛出 Top-L 候选,再用
LinUCB 选择器按任务与 agent 状态路由,角色专长从交互反馈中
涌现而非人工预定义。理论上给出次线性
regret 界;实验中在分布偏移与 agent 失效下表现出自愈能力。
解决什么问题
AutoGen、CrewAI 类框架靠显式编排结构(manager/controller 模式)协调 agent,即便走去中心化路线,多数系统仍用静态预定义角色。这带来三大问题:agent 池与任务分布持续演化时路由低效;任务–角色映射固定导致适应性差;高能力 agent 退化或不可用时缺乏快速替换机制。缺的是一套不预设角色、能从反馈中持续学习、可自愈的协调机制。
创新点
01两阶段动态 Beacon 协议CORE
Stage 1 轻量预筛:对每个 agent 计算复合分数(任务–agent 嵌入相似度 + 历史成功率 + 短期可靠性),取 Top-L(默认 3)构成候选集,剪枝决策空间、控制通信开销。Stage 2 在候选集内用 LinUCB 上下文选择器路由:上下文向量含相似度、当前负载、归一化延迟、历史声誉、可用性标志,UCB 分数 = 利用 + 探索,岭回归估计器在线更新。
02延迟 post-vote 反馈的信用分配
奖励在 P 次独立执行 + 多数投票确定最终答案后才构造:基础有效性 + 赢家奖励 + 延迟惩罚。未解决的 action 保留在 pending 队列,奖励就绪前不进入回归估计器,防止投票信息篡改历史记录。论文同时坦承赢家奖励是「一致性代理信号而非正确性 oracle」——多 agent 共享相同偏差时可能强化共同错误,需 verifier 门控与多样性监控缓解。
03次线性 regret 理论保证
在候选条件线性 bandit 假设下,证明期望 regret 为 O(d·√T):平均每轮次优性 O(d/√T),长期平均任务质量趋近「每轮都选最优 agent」的 oracle。另给出 M 个变点的非平稳扩展 O(d·√((M+1)T))。作者明确区分:贡献不是新 bandit 算法,而是「能力感知筛选 + 上下文选择 + 反馈驱动路由专业化」的集成。
关键结果
在 GSM8K / BBH / MedicalQA 上对比单 agent 与 MetaGPT、AFLOW、GPTSwarm 等多智能体基线(骨干 DeepSeek-V3、GPT-5-nano 等)。MedicalQA 消融最能说明问题:
- 每个骨干下平均准确率最高,超出最强竞争者 1.0–4.7 分;对单 agent 基线最高提升 33 分(MedicalQA)。同预算对照证明提升来自「筛选 + 学习路由 + 子任务感知执行」的互补,而非堆测试时算力。
- 可扩展性:agent 池从 5 扩到 100 保持稳定(N=20 最佳);N=100 时路由开销仍低于 100ms(基线达数百毫秒);DeepSeek 上延迟比 AutoGen 低 31.5%,token 比 MetaGPT 低 26%。
- 自愈:Stage 1 的可靠性项聚合近期超时/错误/可用性——平均分高但近期退化的 agent 不会主导预筛;探索机制避免反复把任务派给退化 agent;worker 失效被局部化在其子任务内,可在反馈后绕开路由。
局限
- 共识奖励偏差:多数投票在 agent 共享错误模式时可能误导路由学习「共同但错误」的答案。
- 延迟 post-vote 反馈的形式化 regret 分析留作未来工作,当前只有启发式的「陈旧项」分解;regret 保证依赖最优 agent 未被 Top-L 过滤掉。
- 去中心化是有界的任务局部协调,路由平面仍是集中式组件,可能成为扩展瓶颈。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录