GLOSSARY · 术语表

Multi-Agent 术语表

读论文前可查的 30 个词

各论文页里带 点状下划线 的词都可以点到这里。按主题分组,中文释义尽量一句话说清「它解决什么、为什么重要」。

基础与训练

LLM大语言模型

Large Language Model,以自回归方式预测文本的大规模神经网络,是 agent 的「大脑」;本系列多篇论文把它当作可冻结、可外包的外围能力。

MLLM多模态大语言模型

Multimodal LLM,能同时处理文本与图像(乃至音频)输入的大模型;其感知能力常依赖外围工具补强(见 MUSE)。

token词元

模型处理文本的最小单位,约为词或子词;「token 成本」指一次任务消耗的输入输出词元总量,是 agent 方案的重要开销指标。

SFT监督微调

Supervised Fine-Tuning,用标注好的输入-期望输出对继续训练模型,使其学会某种技能(如工具调用);是让通用模型变专用的最直接手段。

GRPO组相对策略优化

一种强化学习后训练方法:对同一问题采样一组输出,用组内相对优势更新策略,比逐样本 critic 更省算力;MoRe 用它探索「角色协同」策略。

MoE混合专家

Mixture-of-Experts,模型内含多个「专家」子网络、由路由器按输入挑选激活,用更少算力获得更大容量;与 MoRe 的「角色混合」思路同源但作用层不同。

benchmark基准 / 评测集

用于公平比较不同系统能力的标准化任务集与指标,如 MMLU、ToolBench、TerminalBench;选对基准与读懂指标是评估 agent 的关键。

SOTA当前最优

State-of-the-Art,指在某个基准上当前公开可比的最高水平,常作为论文「我们比 SOTA 高 X%」的对照锚点。

多智能体与编排

agent智能体

能感知环境、调用工具、自主规划并执行多步任务的 LLM 程序单元;多篇论文把「选 agent、配 agent、验证 agent」视为系统设计对象。

MAS多智能体系统

Multi-Agent System,多个分工或竞争的 agent 通过协作完成单个 agent 难以胜任的任务;其核心设计问题是任务拆分、角色分工与结果合并。

framework框架

组织多个 LLM agent 协作的结构化方案:决定怎么拆任务、怎么并行/串行、怎么传递中间结果(如 AutoGen、LangGraph 一类思路)。

orchestration编排

对 agent 协作过程的统筹调度——谁先做、谁等谁、失败怎么办。本系列核心论点之一:模型趋同后,「编排结构」本身成为性能主战场。

DAG有向无环图

Directed Acyclic Graph,用「节点=子任务、边=依赖」描述可并行分解的任务结构;无环保证拓扑顺序可执行,是任务拆分与并行的标准建模。

planner规划器

负责把大目标拆成子步骤、决定执行顺序的模块(常由 LLM 承担);与执行器解耦后,规划可被独立检验与重试。

router路由器

按查询/状态把请求分派给合适执行者的模块——可路由到不同角色、不同模型或不同工具;路由策略好坏直接决定资源效率与效果。

verifier验证器 / 检查员

独立于生成者的评估模块,用「模型外的信号」判定结果是否合格(完整性、正确性、约束满足)。把验证与生成解耦,是多数论文确认的最有价值组件。

harness模型外围执行系统

包裹在模型外围、控制「每步看到什么、能用什么工具、何时验证、何时停止」的执行系统;同一模型换 harness 可拉开数倍性能差距。

路由、学习与效率

model routing模型路由

按任务难度/类型把请求动态分派给不同规模模型,让简单问题走小模型、难问题走大模型,以成本换质量;进阶做法是把置信度纳入路由决策。

confidence置信度

模型对自身输出可靠程度的一种估计(如 softmax 概率、自一致率)。校准后的置信度可作为路由、验证、停止决策的权重信号。

calibration校准

让「模型说 80% 可信」的样本真的约 80% 正确的过程;未校准的置信度会误导路由与验证,因此校准是置信感知系统的前置条件。

codebook角色码本

一组可学习、可组合的向量集合,每个向量代表一种潜在「角色/技能」;MoRe 用码本把多角色特化压缩进单次前向推理。

activation steering激活引导

在模型中间层表示上叠加特定方向向量(steering vector),从而在不改权重的情况下引导输出风格或能力;特化发生在激活空间而非文本空间。

scaling law缩放定律

刻画「算力/数据/参数 → 性能」定量关系的经验规律;AdaptOrch 把类似分析用于「编排拓扑」,得到「模型趋同时拓扑主导」的 Ω(1/ε²) 界。

Pareto frontier帕累托前沿

多个目标(如性能与成本)无法同时最优时的折中边界;处在前沿意味着「想再提一点质量,就必须付出更多成本」——评估系统性价比的标准视角。

在线决策与理论保证

bandit多臂老虎机

序贯决策问题:每次从若干「臂」(选项)中选一个并观察奖励,目标是总奖励最大——需要在「探索未知选项」与「利用已知最优」间权衡。agent 路由常建模为此类问题。

LinUCB线性上置信界算法

用特征线性模型估计每个臂的期望奖励并加上置信上界做选择的标准 bandit 算法;Symphony-Coord 用它按「任务+agent 状态」动态路由。

regret遗憾界

衡量在线决策算法好坏的累积指标:与「总是选最优臂」的理想收益之差。次线性 regret 意味着随轮数增长,平均损失趋近于零——即算法「学会」了。

安全、工具与接口

prompt injection提示注入

攻击者把恶意指令混入模型将处理的文本(网页、邮件、工具输出),诱导模型执行非预期操作;是 LLM 应用最典型的安全威胁之一。

ASR攻击成功率

Attack Success Rate,攻击生效(如注入成功、越狱成功)的样本比例;越低代表系统对该类攻击越有抵抗力。

schema接口描述

对工具/API 输入输出结构的形式化描述(参数名、类型、约束);传统工具调用要求模型严格按 schema 生成,是脆弱性的主要来源之一。

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录