Diseño de sistemas multiagente en A2A: nodos, memoria y gobernanza
Una arquitectura de referencia para sistemas multiagente basada en el protocolo A2A, que abarca módulos de agente, tipos de memoria, orquestación, riesgos de seguridad y una lista de verificación para el diseño.
Cuando una empresa cuenta con más de un par de agentes de IA en producción, los problemas difíciles dejan de estar relacionados con las instrucciones y pasan a centrarse en la arquitectura: cómo se comunican los agentes entre sí, dónde se almacena su estado, quién los coordina y cómo se puede auditar lo que han hecho. Este artículo presenta un modelo de referencia para dicho sistema, utilizando el protocolo Agent-to-Agent (A2A) como eje central de comunicación. Al final, deberías poder comprender los componentes básicos de un único agente, las capas de memoria y orquestación que conectan a varios agentes, los controles de gobernanza necesarios en una red multiagente y las consideraciones a tener en cuenta antes de escalar.
De la IA generativa a la IA agente
El cambio fundamental es de los sistemas generativos a los agentes. La IA generativa funciona mediante prompts: una persona hace una solicitud, el modelo genera contenido y la interacción termina. La IA agente, en cambio, está orientada a objetivos: el sistema recibe un objetivo de alto nivel, lo divide en subobjetivos más pequeños y los aborda con poca intervención humana. La consecuencia práctica para los arquitectos es el alcance de sus trabajos. Los modelos generativos automatizan tareas individuales, mientras que los sistemas agentes pueden automatizar flujos de trabajo completos, convirtiendo a la IA de una herramienta que reacciona en un delegado que actúa. Esto hace posible escalar operaciones que antes requerían que alguien supervisara cada paso. Si desea un análisis más profundo del vocabulario, consulte explicación de la IA agente, desde modelos de lenguaje hasta agentes autónomos.
Motores probabilísticos y razonadores formales
En el centro de cada agente se encuentra un modelo de toma de decisiones, generalmente un modelo de lenguaje grande o un modelo de imágenes grande para cargas de trabajo visuales. Estos modelos son probabilísticos. Generan resultados fluidos y convincentes, pero pueden generar alucinaciones, y la fluidez no es lo mismo que la corrección. Los sistemas formales como los razonadores de ontologías OWL o las redes bayesianas se comportan de manera diferente: sus conclusiones provienen de reglas y probabilidades explícitas, por lo que son matemáticamente fiables dentro de su dominio. Un diseño robusto utiliza cada uno donde sea más eficaz.
Ese mismo pragmatismo se aplica a la profundidad del razonamiento. Técnicas como las indicaciones de tipo “cadena de pensamiento” mejoran la precisión al hacer que el modelo siga pasos intermedios, pero cada paso adicional incrementa la latencia y el consumo de recursos. Un razonamiento más profundo no es gratuito, y la profundidad adecuada depende de la rapidez con la que debe responder el sistema. Una vez que se cuentan con muchos agentes de este tipo, cada uno con su propio modelo y estilo de razonamiento, se necesita una forma compartida para que se comuniquen. Ese es el papel de A2A.
A2A como capa de interoperabilidad
A2A fue propuesto en 2025 como un protocolo abierto para que agentes desarrollados con diferentes frameworks y por distintos proveedores puedan trabajar juntos. Su objetivo es evitar que los sistemas multiagente se fragmenten en silos específicos de cada proveedor: los agentes creados con frameworks diferentes o alojados por proveedores distintos pueden intercambiar información de contexto y coordinar sus tareas a través de una única interfaz común. Su adopción aún está en desarrollo, por lo que consulte la especificación actual antes de decidirse por detalles concretos.
Los cinco principios de diseño
- Tratar a los agentes como tales. El protocolo parte de la premisa de que los participantes pueden razonar y actuar por iniciativa propia, y no solo responder a una solicitud específica. Esto abre la posibilidad de colaborar hacia objetivos a largo plazo, en lugar de limitarse a solicitudes y respuestas simples.
Seguir estos principios protege contra dos modos de fallo clásicos: el fallo de coordinación, en el que los agentes no actúan de manera conjunta, y la desalineación entre agentes, en la que los participantes descentralizados se alejan gradualmente del objetivo compartido. Estos principios se concretan dentro de cada agente a través de un ciclo modular de percepción, razonamiento y acción.
Dentro de un nodo de agente único
Cada nodo ejecuta un ciclo cerrado de entrada, procesamiento, acción y aprendizaje. Dado que el ciclo devuelve resultados al estado interno del agente, el nodo permanece consciente de su entorno y se adapta, en lugar de ejecutar mecánicamente un script fijo.
Los cuatro subsistemas
- Percepción. Esta capa recibe señales de todo tipo: solicitudes en lenguaje natural, flujos de eventos de API e imágenes. Utiliza la generación reforzada por recuperación de información (RAG) para anclar esas entradas en hechos reales antes de que lleguen a la capa de razonamiento.
- Representación del conocimiento y razonamiento (KRR). Aquí se interpreta la intención mediante una combinación de métodos estadísticos y simbólicos. El modelo de lenguaje maneja las matices y ambigüedades, mientras que las verificaciones formales permiten confirmar que el plan resultante es lógicamente coherente.
- Selección y ejecución de acciones. Las decisiones se convierten en resultados concretos a través de un catálogo definido de llamadas a API o mensajes salientes. Este es el punto donde el razonamiento del agente entra en contacto con el mundo digital o físico.
El patrón de ejecución principal es ReAct, abreviatura de razonamiento más acción. El agente alterna entre pensar en el siguiente paso y observar el resultado de una acción, lo que mantiene su razonamiento basado en lo que realmente ocurrió. La desventaja es que cada paso de razonamiento implica otra llamada al modelo, por lo que estos ciclos aumentan el consumo de recursos y el tiempo de respuesta, algo que hay que planificar. Lo que mantiene su coherencia a lo largo de los pasos y sesiones es la memoria.
Memoria persistente a lo largo del tiempo
Los modelos de lenguaje son sin estado: cada llamada solo conoce lo que está en su contexto. Para la planificación a largo plazo, la memoria persistente es lo que une los pasos entre sí. Sin ella, los agentes olvidan el progreso durante tareas de múltiples etapas o cuando el trabajo pasa entre sesiones, lo que conduce a trabajos repetidos y sistemas frágiles.
Tres tipos de memoria
- Memoria episódica registra lo que ocurrió durante una tarea específica, incluidos los pasos de razonamiento seguidos y los intentos fallidos, todo dentro de una sola sesión.
- Memoria semántica almacena hechos duraderos y conocimiento organizativo estructurado del cual puede beneficiarse cualquier tarea.
- Memoria basada en vectores está diseñada para búsquedas de similitud, permitiendo a un agente recuperar contexto relevante de colecciones muy grandes mediante RAG.
Es importante mantenerlos separados porque tienen diferentes períodos de vida y patrones de acceso. La memoria episódica es de corta duración y está relacionada con tareas específicas, la memoria semántica es de larga duración y está organizada cuidadosamente, mientras que los almacenes vectoriales están optimizados para búsquedas aproximadas en lugar de búsquedas exactas.
Contexto compartido para la transferencia de tareas
A gran escala, los agentes también necesitan buffers de contexto compartidos. Cuando un agente transfiere una subtarea a otro, el buffer contiene toda la información de fondo y el estado actual, de modo que el agente receptor no tiene que empezar desde cero. Distribuir el estado de esta manera requiere, a su vez, una capa de coordinación por encima de los agentes individuales.
Orquestación y descomposición de objetivos
A medida que los sistemas crecen, un único modelo de propósito general da paso a un conjunto de especialistas. Asignar roles, por ejemplo, un agente que planifica como un CEO, otro que escribe código y uno más que lo revisa, generalmente produce una mayor precisión y profundidad que pedirle a un solo modelo que haga todo.
Qué hace un metaagente
- Asignar cada subtarea al agente más adecuado para ella.
- Gestionar las dependencias para que los resultados lleguen al lugar correcto en el orden adecuado.
- Resolver conflictos cuando los agentes generan resultados contradictorios o compiten por los mismos recursos.
Planificación con el Árbol de Pensamientos
La orquestación depende de dividir un objetivo en subobjetivos. Los enfoques de planificación como el Árbol de Pensamientos exploran varios caminos de razonamiento en lugar de adherirse a una única cadena, lo que ayuda a resolver la incertidumbre y reduce la fragilidad y las alucinaciones propias de los planes con un solo camino. Explorar varios caminos también multiplica las llamadas al modelo, por lo que agudiza el equilibrio entre latencia y rendimiento mencionado anteriormente.
Existe otro riesgo: el comportamiento emergente. Cuando muchos agentes autónomos interactúan de manera no lineal, el sistema puede generar resultados que nadie diseñó ni predijo. La orquestación reduce este riesgo pero no lo elimina, por lo que la gobernanza debe formar parte de la arquitectura y no ser algo considerado posteriormente.
Seguridad y gobernanza
Una red de agentes tiene una amplia superficie de ataque, y un nodo comprometido o confundido puede desencadenar una cascada de errores en toda la cadena. La postura segura es tratar cada interacción entre agentes como una posible fuente de riesgo.
Los principales riesgos
- Cascadas de errores. Una alucinación o error en una etapa temprana de la cadena se transmite y corrompe la decisión final. El artículo sobre cómo prevenir la acumulación de alucinaciones en grafos de agentes analiza en profundidad este modo de fallo.
- Ataques adversariales. La inyección de prompts o el envenenamiento del modelo pueden sabotear lo que un agente intenta hacer.
- Propagación de sesgos. Los agentes pueden amplificar patrones sesgados en los datos y generar resultados sistemáticamente injustos.
Arquitectura consciente de la gobernanza
Tres mecanismos abordan la mayoría de estos riesgos:
- Aislamiento de roles limita la autoridad de cada agente y las APIs que puede utilizar, de modo que un agente comprometido solo pueda causar daños limitados.
- Registro trazable de decisiones guarda cada paso del razonamiento para que los fallos puedan ser auditados y atribuidos.
- Autenticación de agentes verifica la identidad de cada participante en el flujo de trabajo.
Además de estos, una capa de verificación formal separa lo que suena correcto de lo que es lógicamente válido. Es la respuesta arquitectónica a la naturaleza persuasiva pero poco fiable de los modelos de lenguaje descritos al principio.
Hacia dónde se dirige esto: inteligencia proactiva y AZR
A medida que convergen los agentes modulares y los sistemas agenciales orquestados, el siguiente paso es la inteligencia proactiva: sistemas que detectan señales en su entorno e inician flujos de trabajo antes de que nadie lo solicite.
Una dirección de investigación relevante para esto es el paradigma del Cero Absoluto (AZR). En lugar de aprender a partir de ejemplos etiquetados por humanos, este enfoque mejora mediante el autojuego reforzado, generando sus propios problemas y razonamientos sin datos de entrenamiento externos. Lo que mantiene esto fundamentado es la retroalimentación verificable, como ejecutar código generado o verificar pruebas formales, lo cual reemplaza la anotación humana como fuente de verdad. Considérelo un área de investigación activa y no una técnica lista para su uso en producción.
Lista de verificación de diseño
Antes de escalar un sistema multiagente, revise el diseño teniendo en cuenta estas preguntas:
- Verificación formal: ¿Existe una capa lógica que distinga la salida del modelo persuasivo de los resultados que son realmente válidos?
- Particionamiento de la memoria: ¿Están claramente separados los almacenamientos episódicos, semánticos y basados en vectores?
- Estándar de protocolo: ¿Toda la comunicación entre frameworks y proveedores diferentes pasa por A2A?
- Controles de gobernanza: ¿Está habilitada la isolación de roles y el registro trazable de decisiones para cada nodo autónomo?
- Presupuesto de latencia: ¿Ha medido y ajustado el equilibrio entre la profundidad del razonamiento, como en el Árbol de Pensamientos, y el tiempo de respuesta?
Puntos clave
- Los sistemas multiagente trasladan el problema de crear herramientas que responden a preguntas a la creación de ecosistemas que resuelven problemas por sí mismos, y ese cambio es arquitectónico.
Lecturas relacionadas
- Agente = Modelo + Herramienta: De dónde proviene realmente el comportamiento fiable de la IA — Aprenda qué es una herramienta para agentes de IA, por qué el estado, la autoridad y la verificación pertenecen al exterior del modelo, y qué estructuras de apoyo desaparecerán a medida que los modelos mejoren.
- Diseñando una memoria de agente de cuatro capas con LangGraph y Amazon Bedrock — Aprenda a dotar a los agentes de LLM de memoria episódica, semántica y procedural funcional en Bedrock y LangGraph, así como a protegerla contra el envenenamiento de datos, fugas de PII y problemas relacionados con los usuarios.
- Escalar nodos, no tareas: un escalón de seis niveles para controlar los costos en los flujos de trabajo de LLM — Por qué elegir entre un DAG y un agente por tarea aumenta los costos de los LLM, y cómo un sistema de escalado por nodo con contratos, alcances y presupuestos mantiene esos costos bajo control.
- ¿Interfaz de chat o bucle de agente? Cómo decidir qué necesita su característica de IA — Aprenda a distinguir entre un chatbot conversacional y un agente orientado a objetivos, qué aporta el bucle de agente y cómo determinar cuál es realmente necesario para su característica de IA.
- Los registros de agente le indican qué existe, no si aún se puede confiar en ello — Un marco de cuatro preguntas para los registros de capacidades de agente que abarcan la existencia, idoneidad, estatus y procedencia, además de una prueba sencilla de verificación reciente que puede realizar hoy mismo.