Inicio / Artículos / Diseño de sistemas multiagente en A2A: nodos, memoria y gobernanza

Diseño de sistemas multiagente en A2A: nodos, memoria y gobernanza

Una arquitectura de referencia para sistemas multiagente basada en el protocolo A2A, que abarca módulos de agente, tipos de memoria, orquestación, riesgos de seguridad y una lista de verificación para el diseño.

2092 palabras

Cuando una empresa cuenta con más de un par de agentes de IA en producción, los problemas difíciles dejan de estar relacionados con las instrucciones y pasan a centrarse en la arquitectura: cómo se comunican los agentes entre sí, dónde se almacena su estado, quién los coordina y cómo se puede auditar lo que han hecho. Este artículo presenta un modelo de referencia para dicho sistema, utilizando el protocolo Agent-to-Agent (A2A) como eje central de comunicación. Al final, deberías poder comprender los componentes básicos de un único agente, las capas de memoria y orquestación que conectan a varios agentes, los controles de gobernanza necesarios en una red multiagente y las consideraciones a tener en cuenta antes de escalar.

De la IA generativa a la IA agente

El cambio fundamental es de los sistemas generativos a los agentes. La IA generativa funciona mediante prompts: una persona hace una solicitud, el modelo genera contenido y la interacción termina. La IA agente, en cambio, está orientada a objetivos: el sistema recibe un objetivo de alto nivel, lo divide en subobjetivos más pequeños y los aborda con poca intervención humana. La consecuencia práctica para los arquitectos es el alcance de sus trabajos. Los modelos generativos automatizan tareas individuales, mientras que los sistemas agentes pueden automatizar flujos de trabajo completos, convirtiendo a la IA de una herramienta que reacciona en un delegado que actúa. Esto hace posible escalar operaciones que antes requerían que alguien supervisara cada paso. Si desea un análisis más profundo del vocabulario, consulte explicación de la IA agente, desde modelos de lenguaje hasta agentes autónomos.

Motores probabilísticos y razonadores formales

En el centro de cada agente se encuentra un modelo de toma de decisiones, generalmente un modelo de lenguaje grande o un modelo de imágenes grande para cargas de trabajo visuales. Estos modelos son probabilísticos. Generan resultados fluidos y convincentes, pero pueden generar alucinaciones, y la fluidez no es lo mismo que la corrección. Los sistemas formales como los razonadores de ontologías OWL o las redes bayesianas se comportan de manera diferente: sus conclusiones provienen de reglas y probabilidades explícitas, por lo que son matemáticamente fiables dentro de su dominio. Un diseño robusto utiliza cada uno donde sea más eficaz.

Ese mismo pragmatismo se aplica a la profundidad del razonamiento. Técnicas como las indicaciones de tipo “cadena de pensamiento” mejoran la precisión al hacer que el modelo siga pasos intermedios, pero cada paso adicional incrementa la latencia y el consumo de recursos. Un razonamiento más profundo no es gratuito, y la profundidad adecuada depende de la rapidez con la que debe responder el sistema. Una vez que se cuentan con muchos agentes de este tipo, cada uno con su propio modelo y estilo de razonamiento, se necesita una forma compartida para que se comuniquen. Ese es el papel de A2A.

A2A como capa de interoperabilidad

A2A fue propuesto en 2025 como un protocolo abierto para que agentes desarrollados con diferentes frameworks y por distintos proveedores puedan trabajar juntos. Su objetivo es evitar que los sistemas multiagente se fragmenten en silos específicos de cada proveedor: los agentes creados con frameworks diferentes o alojados por proveedores distintos pueden intercambiar información de contexto y coordinar sus tareas a través de una única interfaz común. Su adopción aún está en desarrollo, por lo que consulte la especificación actual antes de decidirse por detalles concretos.

Los cinco principios de diseño

  • Tratar a los agentes como tales. El protocolo parte de la premisa de que los participantes pueden razonar y actuar por iniciativa propia, y no solo responder a una solicitud específica. Esto abre la posibilidad de colaborar hacia objetivos a largo plazo, en lugar de limitarse a solicitudes y respuestas simples.
  • Reutilice estándares existentes. A2A se basa en tecnologías web conocidas (HTTP, Server-Sent Events y JSON-RPC), por lo que se integra fácilmente en las soluciones empresariales actuales. Esto reduce los costos de integración y hace posible encapsular servicios heredados con una interfaz de agente.
  • Seguro por defecto. Una red de agentes presenta una superficie de ataque mayor que un servicio individual. El protocolo está diseñado para que las interacciones estén autenticadas y protegidas, lo cual disminuye el riesgo de que un atacante tome el control de un agente o sustraiga datos a través de él.
  • Soporta tareas de larga duración. Algunas tareas llevan horas o días y requieren transferencias asíncronas entre especialistas. El protocolo hace un seguimiento del estado de las tareas y de la continuidad de las sesiones para que dicho trabajo no se interrumpa a mitad de camino.
  • Manténgase ajeno a la modalidad. Los agentes pueden intercambiar texto, código o datos multimodales. Esto es especialmente importante en robótica y automatización industrial, donde los agentes combinan lecturas de diversos tipos de sensores en tiempo real.
  • Seguir estos principios protege contra dos modos de fallo clásicos: el fallo de coordinación, en el que los agentes no actúan de manera conjunta, y la desalineación entre agentes, en la que los participantes descentralizados se alejan gradualmente del objetivo compartido. Estos principios se concretan dentro de cada agente a través de un ciclo modular de percepción, razonamiento y acción.

    Dentro de un nodo de agente único

    Cada nodo ejecuta un ciclo cerrado de entrada, procesamiento, acción y aprendizaje. Dado que el ciclo devuelve resultados al estado interno del agente, el nodo permanece consciente de su entorno y se adapta, en lugar de ejecutar mecánicamente un script fijo.

    Los cuatro subsistemas

    1. Percepción. Esta capa recibe señales de todo tipo: solicitudes en lenguaje natural, flujos de eventos de API e imágenes. Utiliza la generación reforzada por recuperación de información (RAG) para anclar esas entradas en hechos reales antes de que lleguen a la capa de razonamiento.
    2. Representación del conocimiento y razonamiento (KRR). Aquí se interpreta la intención mediante una combinación de métodos estadísticos y simbólicos. El modelo de lenguaje maneja las matices y ambigüedades, mientras que las verificaciones formales permiten confirmar que el plan resultante es lógicamente coherente.
    3. Selección y ejecución de acciones. Las decisiones se convierten en resultados concretos a través de un catálogo definido de llamadas a API o mensajes salientes. Este es el punto donde el razonamiento del agente entra en contacto con el mundo digital o físico.
  • Aprendizaje y adaptación. El agente ajusta su comportamiento de forma heurística según lo que funcionó anteriormente. Al registrar qué opciones de herramienta tuvieron éxito, puede actuar de manera más eficiente la próxima vez.
  • El patrón de ejecución principal es ReAct, abreviatura de razonamiento más acción. El agente alterna entre pensar en el siguiente paso y observar el resultado de una acción, lo que mantiene su razonamiento basado en lo que realmente ocurrió. La desventaja es que cada paso de razonamiento implica otra llamada al modelo, por lo que estos ciclos aumentan el consumo de recursos y el tiempo de respuesta, algo que hay que planificar. Lo que mantiene su coherencia a lo largo de los pasos y sesiones es la memoria.

    Memoria persistente a lo largo del tiempo

    Los modelos de lenguaje son sin estado: cada llamada solo conoce lo que está en su contexto. Para la planificación a largo plazo, la memoria persistente es lo que une los pasos entre sí. Sin ella, los agentes olvidan el progreso durante tareas de múltiples etapas o cuando el trabajo pasa entre sesiones, lo que conduce a trabajos repetidos y sistemas frágiles.

    Tres tipos de memoria

    1. Memoria episódica registra lo que ocurrió durante una tarea específica, incluidos los pasos de razonamiento seguidos y los intentos fallidos, todo dentro de una sola sesión.
    2. Memoria semántica almacena hechos duraderos y conocimiento organizativo estructurado del cual puede beneficiarse cualquier tarea.
    3. Memoria basada en vectores está diseñada para búsquedas de similitud, permitiendo a un agente recuperar contexto relevante de colecciones muy grandes mediante RAG.

    Es importante mantenerlos separados porque tienen diferentes períodos de vida y patrones de acceso. La memoria episódica es de corta duración y está relacionada con tareas específicas, la memoria semántica es de larga duración y está organizada cuidadosamente, mientras que los almacenes vectoriales están optimizados para búsquedas aproximadas en lugar de búsquedas exactas.

    Contexto compartido para la transferencia de tareas

    A gran escala, los agentes también necesitan buffers de contexto compartidos. Cuando un agente transfiere una subtarea a otro, el buffer contiene toda la información de fondo y el estado actual, de modo que el agente receptor no tiene que empezar desde cero. Distribuir el estado de esta manera requiere, a su vez, una capa de coordinación por encima de los agentes individuales.

    Orquestación y descomposición de objetivos

    A medida que los sistemas crecen, un único modelo de propósito general da paso a un conjunto de especialistas. Asignar roles, por ejemplo, un agente que planifica como un CEO, otro que escribe código y uno más que lo revisa, generalmente produce una mayor precisión y profundidad que pedirle a un solo modelo que haga todo.

    Qué hace un metaagente

    • Asignar cada subtarea al agente más adecuado para ella.
    • Gestionar las dependencias para que los resultados lleguen al lugar correcto en el orden adecuado.
    • Resolver conflictos cuando los agentes generan resultados contradictorios o compiten por los mismos recursos.

    Planificación con el Árbol de Pensamientos

    La orquestación depende de dividir un objetivo en subobjetivos. Los enfoques de planificación como el Árbol de Pensamientos exploran varios caminos de razonamiento en lugar de adherirse a una única cadena, lo que ayuda a resolver la incertidumbre y reduce la fragilidad y las alucinaciones propias de los planes con un solo camino. Explorar varios caminos también multiplica las llamadas al modelo, por lo que agudiza el equilibrio entre latencia y rendimiento mencionado anteriormente.

    Existe otro riesgo: el comportamiento emergente. Cuando muchos agentes autónomos interactúan de manera no lineal, el sistema puede generar resultados que nadie diseñó ni predijo. La orquestación reduce este riesgo pero no lo elimina, por lo que la gobernanza debe formar parte de la arquitectura y no ser algo considerado posteriormente.

    Seguridad y gobernanza

    Una red de agentes tiene una amplia superficie de ataque, y un nodo comprometido o confundido puede desencadenar una cascada de errores en toda la cadena. La postura segura es tratar cada interacción entre agentes como una posible fuente de riesgo.

    Los principales riesgos

    • Cascadas de errores. Una alucinación o error en una etapa temprana de la cadena se transmite y corrompe la decisión final. El artículo sobre cómo prevenir la acumulación de alucinaciones en grafos de agentes analiza en profundidad este modo de fallo.
    • Ataques adversariales. La inyección de prompts o el envenenamiento del modelo pueden sabotear lo que un agente intenta hacer.
    • Propagación de sesgos. Los agentes pueden amplificar patrones sesgados en los datos y generar resultados sistemáticamente injustos.
  • Fallas en la rendición de cuentas. En una cadena larga y orquestada resulta difícil identificar qué nodo causó un fallo.
  • Arquitectura consciente de la gobernanza

    Tres mecanismos abordan la mayoría de estos riesgos:

    • Aislamiento de roles limita la autoridad de cada agente y las APIs que puede utilizar, de modo que un agente comprometido solo pueda causar daños limitados.
    • Registro trazable de decisiones guarda cada paso del razonamiento para que los fallos puedan ser auditados y atribuidos.
    • Autenticación de agentes verifica la identidad de cada participante en el flujo de trabajo.

    Además de estos, una capa de verificación formal separa lo que suena correcto de lo que es lógicamente válido. Es la respuesta arquitectónica a la naturaleza persuasiva pero poco fiable de los modelos de lenguaje descritos al principio.

    Hacia dónde se dirige esto: inteligencia proactiva y AZR

    A medida que convergen los agentes modulares y los sistemas agenciales orquestados, el siguiente paso es la inteligencia proactiva: sistemas que detectan señales en su entorno e inician flujos de trabajo antes de que nadie lo solicite.

    Una dirección de investigación relevante para esto es el paradigma del Cero Absoluto (AZR). En lugar de aprender a partir de ejemplos etiquetados por humanos, este enfoque mejora mediante el autojuego reforzado, generando sus propios problemas y razonamientos sin datos de entrenamiento externos. Lo que mantiene esto fundamentado es la retroalimentación verificable, como ejecutar código generado o verificar pruebas formales, lo cual reemplaza la anotación humana como fuente de verdad. Considérelo un área de investigación activa y no una técnica lista para su uso en producción.

    Lista de verificación de diseño

    Antes de escalar un sistema multiagente, revise el diseño teniendo en cuenta estas preguntas:

    • Verificación formal: ¿Existe una capa lógica que distinga la salida del modelo persuasivo de los resultados que son realmente válidos?
    • Particionamiento de la memoria: ¿Están claramente separados los almacenamientos episódicos, semánticos y basados en vectores?
    • Estándar de protocolo: ¿Toda la comunicación entre frameworks y proveedores diferentes pasa por A2A?
    • Controles de gobernanza: ¿Está habilitada la isolación de roles y el registro trazable de decisiones para cada nodo autónomo?
    • Presupuesto de latencia: ¿Ha medido y ajustado el equilibrio entre la profundidad del razonamiento, como en el Árbol de Pensamientos, y el tiempo de respuesta?

    Puntos clave

    • Los sistemas multiagente trasladan el problema de crear herramientas que responden a preguntas a la creación de ecosistemas que resuelven problemas por sí mismos, y ese cambio es arquitectónico.
  • A2A proporciona el lenguaje compartido; cada agente sigue necesitando módulos bien separados para la percepción, el razonamiento, la acción y el aprendizaje.
  • La memoria y el contexto compartido son lo que hace coherente el trabajo a largo plazo con múltiples agentes.
  • La orquestación mejora la calidad mediante la especialización, pero a costa de la latencia y del riesgo de comportamientos emergentes.
  • La gobernanza, desde el aislamiento de roles hasta la verificación formal, debe formar parte del diseño desde el primer día.
  • Lecturas relacionadas