在A2A框架下设计多智能体系统:节点、记忆与治理机制
基于A2A协议构建的多智能体系统参考架构,涵盖了智能体模块、内存类型、编排机制、安全风险以及设计检查清单。
当一家公司的在用AI智能体数量超过几个之后,面临的难题就不再仅仅是提示词相关的问题,而是转向架构设计:智能体之间如何交互、它们的状态存储在哪里、由谁来协调它们,以及如何审计它们的行为。本文以智能体间通信协议(A2A)作为核心架构,为这类系统提供了参考蓝图。读完本文后,你应该能够理解单个智能体的构成要素、将多个智能体连接起来的内存与协调层、多智能体网络所需的治理机制,以及在扩展规模之前需要权衡的各种因素。
从生成式AI到智能体AI
根本性的转变是从生成式系统向智能体系统过渡。生成式人工智能是由提示驱动的:有人提出请求,模型生成内容,交互就此结束。而智能体人工智能则是以目标为导向的:系统接收到高层次的目标后,会将其分解为更小的子目标,并在几乎无需人工干预的情况下逐步完成这些目标。对于建筑师而言,实际影响在于工作范围。生成式模型能够自动化处理单个任务,而智能体系统则可以自动化整个工作流程,使人工智能从被动响应的工具转变为主动执行的执行者。这正是实现那些过去需要专人全程监督的操作规模扩展的基础。如需更深入地了解相关术语,可参阅从语言模型到自主智能体:智能体人工智能详解。
概率引擎与形式化推理器
每个智能体的核心都包含一个决策模型,通常是大型语言模型,用于处理文本任务;或是大型图像模型,用于处理视觉任务。这类模型属于概率型系统,虽然能够生成流畅且令人信服的输出,但也可能产生幻觉,而且流畅性并不等同于正确性。而像OWL本体推理器或贝叶斯网络这样的形式化系统则表现不同:它们的结论是基于明确的规则和概率得出的,因此在相应领域内具有数学上的可靠性。合理的设计会充分利用各类系统的优势所在。
同样的务实原则也适用于推理深度。诸如思维链提示之类的技术通过让模型逐步处理中间步骤来提高准确性,但每增加一个步骤都会带来延迟和计算成本。更深入的推理并非没有代价,其合适深度取决于系统需要多快的响应速度。一旦拥有众多具备各自模型和推理风格的智能体,就需要一种让它们相互交流的共享方式。这就是A2A的作用。
A2A作为互操作层
A2A于2025年被提出,作为一种开放协议,旨在让基于不同框架、由不同供应商开发的智能体能够协同工作。其目的是防止多智能体系统陷入各供应商独立的封闭体系:使用不同框架开发或由不同供应商托管的智能体可以通过统一的接口交换上下文并协调工作。该协议的采用仍在发展中,因此在确定具体细节之前,请先查阅当前的规范。
五大设计原则
- 将智能体视为独立的智能体。该协议假定参与者能够自主思考并采取行动,而不仅仅是响应单一请求。这为朝着长期目标开展协作奠定了基础,而不仅仅是简单的请求与响应关系。
遵循这些原则可以避免两种常见的故障模式:协调失败,即智能体无法协同行动;以及智能体间目标偏差,即分散式的参与者逐渐偏离共同目标。这些原则通过模块化的感知、推理和行动循环在每个智能体内部得以体现。
单个智能体节点的内部结构
每个节点都运行着输入、处理、行动和学习的闭环系统。由于该循环会将结果反馈到智能体的内部状态,因此节点能够持续感知环境并作出调整,而非机械地执行固定脚本。
四个子系统
- 感知层。该层接收各类信号:自然语言请求、API事件流、图像等。它在这些输入进入推理层之前,通过检索增强生成技术将其与真实事实关联起来。
- 知识表示与推理层。此处通过统计方法和符号方法相结合的方式来解读用户意图。语言模型负责处理细微差别和歧义,而形式化检查则可确保生成的计划在逻辑上是一致的。
- 动作选择与执行层。通过预先定义的API调用或外部消息列表,将决策转化为具体的输出。这是智能体推理与数字世界或物理世界相连接的环节。
主要的执行模式是ReAct,即“推理加行动”的缩写。智能体会在思考下一步行动与观察该行动的结果之间交替,从而使它的推理始终基于实际发生的情况。其代价是每个思考步骤都需要再次调用模型,因此这些循环会增加计算开销和响应时间,需要提前规划。而记忆则是让智能体在各个步骤和会话之间保持连贯性的关键。
跨时间的持久记忆
语言模型是无状态的:每次调用仅知晓其上下文中的信息。对于长周期规划而言,持久化记忆才是将各个步骤串联起来的关键。没有它,智能体在多阶段任务中或会话切换时就会忘记已完成的进展,从而导致重复工作以及系统的不稳定性。
三种类型的记忆
- 情景记忆记录特定任务期间发生的一切,包括所采取的推理步骤以及失败的尝试,所有内容都保存在单次会话内。
- 语义记忆存储持久的事实以及结构化的组织知识,所有任务均可从中获取信息。
- 基于向量的记忆专为相似性搜索而设计,使智能体能够通过RAG从海量数据集中检索出相关上下文。
将它们分开处理是因为它们的生命周期和访问模式不同。情景记忆寿命较短且与特定任务相关,语义记忆则寿命较长且经过精心整理,而向量存储则是为模糊检索而非精确查找而优化的。
任务交接的共享上下文
在大规模应用中,智能体还需要共享上下文缓冲区。当一个智能体将子任务交给另一个智能体时,该缓冲区会携带完整的背景信息和当前状态,这样接收方就不必从零开始。以这种方式分发状态,则需要在各个智能体之上设置一个协调层。
编排与目标分解
随着系统规模的扩大,单一的通用模型会被由多个专用模型组成的团队所取代。通过为不同模型分配特定角色——例如负责像CEO一样进行规划的智能体、负责编写代码的智能体以及负责代码审查的智能体——通常能获得比让单个模型承担所有任务更高的准确度和更深入的分析能力。
元智能体的功能
元智能体,或称协调器,负责监督这个模型团队。它的职责包括:
- 分配每项子任务给最合适的智能体。
- 管理依赖关系,确保输出按正确顺序传递到相应位置。
- 解决冲突,当不同智能体产生矛盾结果或争夺相同资源时进行协调。
利用思维树进行规划
协调机制依赖于将目标拆解为子目标。诸如思维树这样的规划方法会探索多条推理路径,而非局限于单一路径,这有助于消除不确定性,降低单路径规划容易出现的脆弱性和幻觉问题。不过,探索多条路径也会增加模型调用的次数,从而加剧之前讨论过的延迟与效率之间的权衡。
还存在另一个风险:涌现行为。当众多自主智能体以非线性方式相互作用时,系统可能会产生无人设计或预测的结果。协调机制虽能降低这一风险,但无法完全消除它,正因如此,治理机制必须成为架构的一部分,而非事后才考虑的问题。
安全与治理
由智能体构成的网络具有较大的攻击面,一旦某个节点被攻破或出现故障,就可能在整个链条中引发一系列错误。安全的做法是将每一次智能体间的交互都视为潜在的风险源。
主要风险
- 错误级联。链条初期出现的幻觉或错误会逐级传递,最终导致决策失真。关于防止智能体图谱中幻觉效应累积的文章对这种故障模式进行了深入探讨。
- 恶意攻击。提示注入或模型污染可能会干扰智能体的正常操作。
- 偏见传播。智能体可能会放大数据中的偏差模式,从而产生系统性不公平的结果。
具备治理意识的架构
三种机制可应对大部分此类风险:
- 角色隔离可限制每个智能体的权限及其能够调用的API,从而避免被攻破的智能体造成过大破坏。
- 可追溯的决策日志记录会保存每一项推理步骤,便于对故障进行审计并明确责任归属。
- 智能体身份认证可验证工作流中每个参与者的身份。
除此之外,正式验证层还能区分表面上看似合理的内容与逻辑上真正有效的内容。这正是针对前文所提到的语言模型虽具有说服力却不可靠这一特性的架构解决方案。
发展方向:主动智能与绝对零度范式
随着模块化智能体与协同智能系统的发展,下一步便是主动智能:这类系统能够感知环境中的信号,在他人提出要求之前便自动启动相应工作流程。
与此相关的一个研究方向是绝对零度(AZR)范式。它不依赖人类标注的示例进行学习,而是通过强化自我训练不断提升性能,能够在没有外部训练数据的情况下自行生成问题并进行分析推理。让这一范式具备可行性的关键在于可验证的反馈机制,比如运行生成的代码或检查形式化证明,这些反馈取代了人类标注作为事实依据。应将其视为一项活跃的研究领域,而非可直接投入实际应用的技术。
设计检查清单
在扩展多智能体系统之前,需根据以下问题检查设计是否合理:
- 形式化验证:是否存在逻辑层来区分有说服力的模型输出与真正有效的结果?
- 内存分区:情景存储、语义存储和向量存储是否被明确分隔开?
- 协议标准:所有跨框架及跨供应商的通信是否都通过A2A进行?
- 治理控制:每个自主节点是否都具备角色隔离功能以及可追溯的决策日志记录功能?
- 延迟预算:您是否已经测量并调整了诸如思维树之类的推理深度与响应时间之间的平衡关系?
核心要点
- 多智能体系统将问题从构建能够回答问题的工具,转变为构建能够自主解决问题的生态系统,而这种转变属于架构层面的变革。
相关阅读
- 智能体 = 模型 + 支撑框架:可靠AI行为的真正来源 — 了解什么是AI智能体支撑框架,为何状态、权限和验证功能应置于模型之外,以及随着模型改进哪些支撑结构会逐渐被淘汰。
- 利用 LangGraph 和 Amazon Bedrock 设计四层代理内存 — 了解如何在 Bedrock 和 LangGraph 上为大型语言模型代理赋予工作记忆、情景记忆、语义记忆和程序记忆,并防止数据污染、个人信息泄露以及租户间信息串扰。
- 升级节点而非任务:控制大型语言模型工作流成本的六级阶梯 — 为何为每个任务选择有向无环图或代理会增加大型语言模型的成本,以及如何通过包含合同、范围和预算的节点级升级阶梯来控制成本。
- 聊天界面还是智能体循环?如何确定你的AI功能需要什么 — 了解如何区分对话式聊天机器人与目标驱动型智能体,了解智能体循环的作用,以及如何判断你的AI功能实际上需要哪种类型。
- 智能体注册表能告诉你有什么存在,但无法说明你是否仍可信任它 — 一个针对智能体能力注册表的四问题框架,涵盖存在性、适用性、可靠性及来源信息,同时还提供一项今天即可使用的简单最终验证方法。