arXiv 2509.24323
MULTI-AGENT · SELF-GENERATIVE

MAS²: Self-Generative Multi-Agent Systems

自生成、自配置、自纠偏的多智能体系统
arXiv 2509.24323 · ICLR 2026 Poster · NTU / ZJU / NUS 等

arXiv 2509.24323 · 投稿 2025-09 · ICLR 2026 Poster · 中文版收录 2026-09-03

CITE

别再手搓 MAS 了,让系统自己生成、自己纠偏。

— 本站导读
一句话:多数自动 MAS 仍是「生成一次就部署」,面对动态环境易崩。MAS² 用 generator–implementer–rectifier 三元 meta-agent 递归地为任务定制多智能体系统,并在运行中纠偏;七项基准上相对 SOTA 最高约 +19.6%,且处在成本–性能 Pareto 前沿。

要解决什么问题

MAS 设计经历了手工配置 → 部分自动化(拓扑/路由)→ 全自动生成。近期基于 LLM 自身生成 MAS 的工作(如 MAS-GPT、ScoreFlow、FlowReasoner)仍多采用「generate-once-and-deploy」:为任务实例化一次系统后固定执行,无法应对工具崩溃、网络失败、中间结果错误等真实动态。

外部优化模块(贝叶斯、MCTS、GNN)又受限于预定义算子搜索空间,架构创新有限。需要一种能在运行中持续生成、配置并修正目标 MAS 的范式。

创新点

01MAS² 范式:用 MAS 生成 MASCORE

递归自生成:一个 meta 级多智能体团队,为不同问题自主设计专用多智能体系统,突破「一次生成、终身部署」的刚性。

02Generator–Implementer–Rectifier 三元组

Generator 产出高层工作流模板;Implementer 为每步填入具体 LLM 骨干与配置;Rectifier 监控执行与环境反馈,实时纠偏。三者分工明确、可分别特化。

03Collaborative Tree Optimization (CTO)

三 agent 协作扩展决策树(多种 MAS 配置与执行路径),终端环境反馈经路径信用传播回传到各角色,得到角色特异偏好数据,再用相对奖励对齐算法分别训练。

关键结果

在多跳检索(HotpotQA 等)、代码(HumanEval)、数学(MATH)等七项基准上对比手工 MAS(DyLAN、MedPrompt、LLM-Debate 等)与自动 MAS(ScoreFlow、MaAS、AFlow 等):

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录