arXiv 2609.00595
MULTI-AGENT · SECURITY SoK

SoK: When Safe Agents Fail Together

安全的智能体也可能一起失败:多智能体 LLM 系统的安全系统化
arXiv 2609.00595 · 2026-09-01 · 21 pages

arXiv 2609.00595 · 投稿 2026-09 · 中文版收录 2026-09-03

CITE

单个 agent 再安全,也架不住一群 agent 一起犯错。

— 本站导读
一句话多智能体系统在主体边界之间传递信息、状态、决策与权限,局部安全检查无法覆盖的系统级失败会因此产生。本文对 197 篇工作做执行中心分析,提出 A-I-R 攻击框架与五部分防御契约,并审计 44 项评测工作,推动「交互感知」的 MAS 安全观。

要解决什么问题

单智能体安全研究已积累大量防御与评测,但一旦多个 LLM agent 协作,攻击面从「模型内部」扩展到「交互接口与信任边界」。信息、状态、决策与权威跨主体流动时,局部安全检查可能全部通过,系统整体仍失败——「安全的智能体一起失败」。

现有工作往往把「用了多个 agent」直接等同于「存在真正的多智能体安全效应」,缺少以执行为中心的统一视角,导致攻击机制碎片化、防御难以比较、评测无法隔离交互效应。

创新点

01执行中心的系统化梳理CORE

覆盖六类交互接口、四种对手位置、七类系统级风险、八条反复出现的攻击路径;强调必须端到端追踪攻击路径,而不是只看局部模块是否「安全」。

02A-I-R 攻击组织框架

Adversary position(对手位置)→ Interaction interface(交互接口)→ Resulting system-level risk(系统级风险)组织攻击,把分散机制统一到同一坐标系,便于比较与复用。

03五部分防御契约

路径目标、观测、干预、信任边界、恢复。作者特别指出:路径闭合(path closure)与恢复(recovery)是当前最薄弱、也最关键的挑战。

04评测审计与开放问题

审计 44 项评测与基准工作,指出需更好隔离交互效应、设计可比较可诊断指标、支持跨 MAS 设计复用,以及评估开放系统运行。

主要结论

局限与展望

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录