arXiv 2609.00595
MULTI-AGENT · SECURITY SoK
SoK: When Safe Agents Fail Together
安全的智能体也可能一起失败:多智能体 LLM 系统的安全系统化
arXiv 2609.00595 · 2026-09-01 · 21 pages
arXiv 2609.00595 · 投稿 2026-09 · 中文版收录 2026-09-03
CITE
单个 agent 再安全,也架不住一群 agent 一起犯错。
— 本站导读
一句话:
多智能体系统在主体边界之间传递信息、状态、决策与权限,局部安全检查无法覆盖的系统级失败会因此产生。本文对
197 篇工作做执行中心分析,提出
A-I-R 攻击框架与五部分防御契约,并审计 44 项评测工作,推动「交互感知」的 MAS 安全观。
要解决什么问题
单智能体安全研究已积累大量防御与评测,但一旦多个 LLM agent 协作,攻击面从「模型内部」扩展到「交互接口与信任边界」。信息、状态、决策与权威跨主体流动时,局部安全检查可能全部通过,系统整体仍失败——「安全的智能体一起失败」。
现有工作往往把「用了多个 agent」直接等同于「存在真正的多智能体安全效应」,缺少以执行为中心的统一视角,导致攻击机制碎片化、防御难以比较、评测无法隔离交互效应。
创新点
01执行中心的系统化梳理CORE
覆盖六类交互接口、四种对手位置、七类系统级风险、八条反复出现的攻击路径;强调必须端到端追踪攻击路径,而不是只看局部模块是否「安全」。
02A-I-R 攻击组织框架
按 Adversary position(对手位置)→ Interaction interface(交互接口)→ Resulting system-level risk(系统级风险)组织攻击,把分散机制统一到同一坐标系,便于比较与复用。
03五部分防御契约
路径目标、观测、干预、信任边界、恢复。作者特别指出:路径闭合(path closure)与恢复(recovery)是当前最薄弱、也最关键的挑战。
04评测审计与开放问题
审计 44 项评测与基准工作,指出需更好隔离交互效应、设计可比较可诊断指标、支持跨 MAS 设计复用,以及评估开放系统运行。
主要结论
- 交互感知:真正的 MAS 安全效应必须在交互路径上被证明,而不能从「多 agent」标签直接推出。
- 防御应回答:是否闭合了具体攻击路径?信任边界是否被正确放置?失败后能否恢复?
- 评测应引入适当的反事实对照,区分「多智能体设定」与「多智能体特有安全效应」。
局限与展望
- 作为 SoK,侧重框架与分类而非提出新攻击/防御算法;具体防御方案的可落地性仍依赖后续工作。
- 开放系统、跨组织协作、长期运行下的路径演化等场景仍是评测空白。
DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录