arXiv 2602.00966
PAPER 10 · MULTI-AGENT · DECENTRALIZED

Symphony-Coord

把 agent 选择变成在线老虎机:去中心化、无预定义角色的涌现式协调

Zhaoyang Guan 等 · NUS + NYU + Gradient 等 · arXiv 2602.00966 · 2026-02(v2 2026-05)

arXiv 2602.00966 · 投稿 2026-02 · 中文版收录 2026-09-03

CITE

没有中央指挥,秩序照样从交互中长出来。

— 本站导读
现有多智能体协调依赖静态角色分配和中心化控制器,agent 池一大就路由低效、适应性差、故障恢复脆弱。Symphony-Coord 把 agent 选择建模为在线上下文多臂老虎机问题:两阶段动态 Beacon 协议先轻量筛出 Top-L 候选,再用 LinUCB 选择器按任务与 agent 状态路由,角色专长从交互反馈中涌现而非人工预定义。理论上给出次线性 regret 界;实验中在分布偏移与 agent 失效下表现出自愈能力。

解决什么问题

AutoGen、CrewAI 类框架靠显式编排结构(manager/controller 模式)协调 agent,即便走去中心化路线,多数系统仍用静态预定义角色。这带来三大问题:agent 池与任务分布持续演化时路由低效;任务–角色映射固定导致适应性差;高能力 agent 退化或不可用时缺乏快速替换机制。缺的是一套不预设角色、能从反馈中持续学习、可自愈的协调机制。

创新点

01两阶段动态 Beacon 协议CORE

Stage 1 轻量预筛:对每个 agent 计算复合分数(任务–agent 嵌入相似度 + 历史成功率 + 短期可靠性),取 Top-L(默认 3)构成候选集,剪枝决策空间、控制通信开销。Stage 2 在候选集内用 LinUCB 上下文选择器路由:上下文向量含相似度、当前负载、归一化延迟、历史声誉、可用性标志,UCB 分数 = 利用 + 探索,岭回归估计器在线更新。

02延迟 post-vote 反馈的信用分配

奖励在 P 次独立执行 + 多数投票确定最终答案后才构造:基础有效性 + 赢家奖励 + 延迟惩罚。未解决的 action 保留在 pending 队列,奖励就绪前不进入回归估计器,防止投票信息篡改历史记录。论文同时坦承赢家奖励是「一致性代理信号而非正确性 oracle」——多 agent 共享相同偏差时可能强化共同错误,需 verifier 门控与多样性监控缓解。

03次线性 regret 理论保证

在候选条件线性 bandit 假设下,证明期望 regret 为 O(d·√T):平均每轮次优性 O(d/√T),长期平均任务质量趋近「每轮都选最优 agent」的 oracle。另给出 M 个变点的非平稳扩展 O(d·√((M+1)T))。作者明确区分:贡献不是新 bandit 算法,而是「能力感知筛选 + 上下文选择 + 反馈驱动路由专业化」的集成。

关键结果

在 GSM8K / BBH / MedicalQA 上对比单 agent 与 MetaGPT、AFLOW、GPTSwarm 等多智能体基线(骨干 DeepSeek-V3、GPT-5-nano 等)。MedicalQA 消融最能说明问题:

MedicalQA 消融(准确率 %)
51.0
单 Agent
55.0
朴素投票
73.0
仅 UCB
79.0
Top-L+UCB
86.0
完整系统

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录