Entwurf von Mehr-Agenten-Systemen auf A2A: Knoten, Speicher und Steuerung
Eine Referenzarchitektur für Mehr-Agentensysteme, die auf dem A2A-Protokoll basiert und Agentenmodule, Speichertypen, Orchestrierung, Sicherheitsrisiken sowie eine Checkliste für die Konzeption umfasst.
Sobald ein Unternehmen mehr als nur wenige KI-Agenten im Einsatz hat, drehen sich die schwierigen Probleme nicht mehr um Anfragen, sondern um die Architektur: wie die Agenten miteinander kommunizieren, wo ihr Zustand gespeichert ist, wer sie koordiniert und wie überprüft werden kann, was sie getan haben. Dieser Artikel stellt einen Referenzentwurf für ein solches System vor, wobei das Agent-zu-Agent (A2A)-Protokoll als Kommunikationsgrundlage dient. Am Ende sollten Sie in der Lage sein, die Bausteine eines einzelnen Agenten, die Speichermöglichkeiten sowie Orchestrierungsschichten, die mehrere Agenten miteinander verbinden, die Steuerungsmechanismen, die ein mehragentiges Netzwerk benötigt, sowie die Abwägungen zu berücksichtigen, bevor Sie skalieren.
Von generativer KI zu agenter KI
Der zugrundeliegende Wandel besteht im Übergang von generativen Systemen zu agierenden Systemen. Generatives KI ist promptgesteuert: Eine Person stellt eine Anfrage, das Modell erzeugt Inhalte und die Interaktion endet. Agierende KI hingegen ist zielgesteuert: Das System erhält ein übergeordnetes Ziel, unterteilt es in kleinere Teilziele und arbeitet daran mit nur geringer menschlicher Steuerung. Die praktische Folge für Architekten ist der Umfang der Arbeit. Generative Modelle automatisieren einzelne Aufgaben, während agierende Systeme ganze Arbeitsabläufe automatisieren können und KI so von einem Werkzeug, das reagiert, zu einem Vertreter machen, der handelt. Dadurch wird es möglich, Prozesse zu skalieren, die früher ständige Überwachung erforderten. Für eine ausführlichere Erklärung des Fachbegriffs siehe Eine Erklärung zu agierender KI – von Sprachmodellen bis hin zu autonomen Agenten.
Wahrscheinlichkeitsbasierte Engine und formale Reasoner
In der Mitte jedes Agenten befindet sich ein Entscheidungsmodell, in der Regel ein großes Sprachmodell oder ein großes Bildmodell für visuelle Aufgaben. Diese Modelle sind probabilistisch. Sie erzeugen flüssige, überzeugende Ausgaben, können jedoch Halluzinationen produzieren, und Flüssigkeit bedeutet nicht notwendigerweise Korrektheit. Formale Systeme wie OWL-Ontologierender oder bayessche Netze verhalten sich anders: Ihre Schlussfolgerungen ergeben sich aus expliziten Regeln und Wahrscheinlichkeiten, wodurch sie in ihrem Anwendungsbereich mathematisch zuverlässig sind. Ein robuster Entwurf nutzt jedes dieser Systeme dort, wo es am stärksten ist.
Derselbe Pragmatismus gilt auch für die Tiefe der Argumentation. Techniken wie Chain-of-Thought-Prompting verbessern die Genauigkeit, indem sie das Modell dazu bringen, durch Zwischenschritte zu arbeiten, doch jeder zusätzliche Schritt verursacht Verzögerungen und erhöht die Rechenlast. Tiefere Argumentationen sind nicht kostenlos, und die richtige Tiefe hängt davon ab, wie schnell das System antworten muss. Wenn man viele solcher Agenten hat, von denen jeder sein eigenes Modell und seinen eigenen Argumentationsstil besitzt, braucht man eine gemeinsame Kommunikationsmöglichkeit. Dafür ist A2A zuständig.
A2A als Interoperabilitätslayer
A2A wurde im Jahr 2025 als offenes Protokoll vorgeschlagen, damit Agenten unterschiedlicher Frameworks und Hersteller miteinander zusammenarbeiten können. Sein Zweck ist es, zu verhindern, dass mehrere Agentensysteme in herstellerspezifische Isolationen zerfallen: Agenten, die mit verschiedenen Frameworks entwickelt wurden oder von unterschiedlichen Anbietern betrieben werden, können über eine gemeinsame Schnittstelle Kontext austauschen und ihre Arbeit koordinieren. Die Adoption entwickelt sich noch, daher sollten Sie die aktuelle Spezifikation prüfen, bevor Sie sich auf Details festlegen.
Die fünf Entwurfsprinzipien
- Behandeln Sie Agenten als solche. Das Protokoll geht davon aus, dass die Teilnehmer eigenständig denken und handeln können, anstatt nur auf eine einzige Anfrage zu reagieren. Dadurch wird die Zusammenarbeit zur Erreichung langfristiger Ziele ermöglicht, anstatt nur einfacher Anfrage- und Antwortabläufe.
Durch Befolgung dieser Prinzipien wird vor zwei klassischen Versagensmustern geschützt: dem Koordinationsversagen, bei dem Agenten nicht gemeinsam handeln, und der Fehlsteuerung zwischen Agenten, bei der dezentral arbeitende Teilnehmer allmählich vom gemeinsamen Ziel abweichen. Innerhalb jedes Agenten werden diese Prinzipien durch einen modularen Perzeptions-, Schlussfolgerungs- und Handlungszyklus konkret umgesetzt.
In einem einzelnen Agentenknoten
Jeder Knoten führt einen geschlossenen Zyklus aus Eingabe, Verarbeitung, Handlung und Lernen durch. Da der Zyklus die Ergebnisse in den internen Zustand des Agenten zurückführt, bleibt der Knoten über seine Umgebung informiert und passt sich an, anstatt mechanisch einen festgelegten Ablauf zu durchlaufen.
Die vier Untersysteme
- Wahrnehmung. Diese Schicht nimmt Signale aller Art entgegen: Anfragen in natürlicher Sprache, API-Ereignisströme, Bilder. Sie verwendet retrieval-augmented generation (RAG), um diese Eingaben vor dem Erreichen der Schlussfolgerungsschicht an tatsächlichen Fakten zu verankern.
- Kenntnisrepräsentation und Schlussfolgerung (KRR). Hier wird die Absicht mithilfe einer Kombination aus statistischen und symbolischen Methoden interpretiert. Das Sprachmodell kümmert sich um Nuancen und Mehrdeutigkeiten, während formale Überprüfungen sicherstellen, dass der resultierende Plan logisch konsistent ist.
- Aktionsauswahl und Ausführung. Entscheidungen werden durch ein definiertes Verzeichnis an API-Aufrufen oder ausgehenden Nachrichten in konkrete Ausgaben umgesetzt. Dies ist die Grenze, an der die Schlussfolgerungen des Agenten auf die digitale oder physische Welt wirken.
Das Hauptausführungsmuster ist ReAct, kurz für Reasoning plus Acting. Der Agent wechselt zwischen dem Nachdenken über den nächsten Schritt und der Beobachtung des Ergebnisses einer Aktion, wodurch seine Schlussfolgerungen auf dem tatsächlich Geschehenen beruhen. Der Nachteil ist, dass jeder Denkschritt eine weitere Modellaufruf bedeutet, wodurch diese Schleifen Rechenkosten und Reaktionszeiten verursachen, die man berücksichtigen muss. Was sie über Schritte und Sitzungen hinweg kohärent hält, ist das Gedächtnis.
Persistierendes Gedächtnis über Zeit hinweg
Sprachmodelle sind zustandslos: Jeder Aufruf kennt nur das, was in seinem Kontext vorhanden ist. Für die Planung über längere Zeiträume sorgt ein persistentes Gedächtnis dafür, dass die einzelnen Schritte miteinander verbunden bleiben. Ohne dieses vergessen Agenten den Fortschritt bei mehrstufigen Aufgaben oder wenn die Arbeit zwischen Sitzungen weitergeleitet wird, was zu wiederholter Arbeit und instabilen Systemen führt.
Drei Arten von Gedächtnis
- Episodisches Gedächtnis speichert, was während einer bestimmten Aufgabe geschehen ist – einschließlich der angewandten Überlegungswege und der fehlgeschlagenen Versuche – alles innerhalb einer einzigen Sitzung.
- Semantisches Gedächtnis bewahrt dauerhafte Fakten sowie strukturiertes organisatorisches Wissen auf, das jede Aufgabe nutzen kann.
- Vektorbasiertes Gedächtnis ist für Suchvorgänge nach Ähnlichkeiten konzipiert und ermöglicht es einem Agenten, über RAG relevante Informationen aus sehr großen Datensammlungen abzurufen.
Es ist sinnvoll, diese Strukturen voneinander zu trennen, da sie unterschiedliche Lebensdauern und Zugriffsweisen aufweisen. Episodisches Gedächtnis ist kurzlebig und taskbezogen, semantisches Gedächtnis hingegen langanhaltend und sorgfältig strukturiert, während Vektordatenspeicher eher für ungenaue Suche als für präzise Abfragen optimiert sind.
Gemeinsamer Kontext für die Übertragung von Aufgaben
In großem Maßstab benötigen Agenten außerdem gemeinsame Kontextpuffer. Wenn ein Agent eine Unteraufgabe an einen anderen weitergibt, enthält der Puffer den vollständigen Hintergrund sowie den aktuellen Zustand, sodass der empfangende Agent nicht von Null an beginnen muss. Eine solche Verteilung des Zustands erfordert wiederum eine koordinierende Schicht über den einzelnen Agenten.
Orchestrierung und Zieldekomposition
Sobald Systeme wachsen, weicht ein einzelnes Allzweckmodell einem Ensemble von Spezialisten. Die Zuweisung von Rollen – beispielsweise ein Agent, der wie ein CEO plant, einer, der Code schreibt, und einer, der ihn überprüft – führt in der Regel zu höherer Genauigkeit und Tiefe als die Anweisung an ein einziges Modell, alles zu erledigen.
Was ein Meta-Agent tut
Ein Meta-Agent, auch Orchesterator genannt, überwacht das Ensemble. Zu seinen Aufgaben gehören:
- Zuweisen jeder Unteraufgabe dem am besten geeigneten Agenten.
- Verwaltung von Abhängigkeiten, sodass die Ausgaben in der richtigen Reihenfolge an den richtigen Ort gelangen.
- Lösung von Konflikten, wenn Agenten widersprüchliche Ergebnisse liefern oder um dieselben Ressourcen konkurrieren.
Planung mit Tree of Thoughts
Die Orchestrierung hängt davon ab, ein Ziel in Unterziele aufzuteilen. Planungsansätze wie der Tree of Thoughts prüfen mehrere Denkwege anstelle einer einzigen Abfolge, was dabei hilft, Unsicherheiten zu beseitigen und die Anfälligkeit für Fehler sowie Halluzinationen, die bei einpfadigen Plänen auftreten, zu verringern. Das Prüfen mehrerer Wege erhöht jedoch auch die Anzahl der Modellaufrufe, wodurch das zuvor besprochene Gleichgewicht zwischen Latenz und Leistung verschärft wird.
Es besteht außerdem ein weiteres Risiko: emergentes Verhalten. Wenn viele autonome Agenten auf nicht-lineare Weise miteinander interagieren, kann das System Ergebnisse hervorbringen, die von niemandem entworfen oder vorhergesagt wurden. Die Orchestrierung verringert dieses Risiko, beseitigt es jedoch nicht – weshalb die Governance integraler Bestandteil der Architektur sein muss und nicht erst als Nachgedanke hinzukommt.
Sicherheit und Governance
Ein Netzwerk von Agenten weist eine große Angriffsfläche auf, und ein kompromittierter oder verwirrter Knoten kann eine Kettenreaktion von Fehlern in der gesamten Kette auslösen. Die sichere Vorgehensweise besteht darin, jede Interaktion zwischen Agenten als potenzielle Risikokquelle zu betrachten.
Die Hauptrisiken
- Fehlerkettenreaktionen. Eine Halluzination oder ein Fehler zu Beginn der Kette wird weitergegeben und verfälscht die endgültige Entscheidung. Der Artikel zu der Verhinderung der Verschärfung von Halluzinationen in Agentengraphen untersucht diesen Fehlermodus ausführlich.
- Adversarische Angriffe. Prompt-Injektionen oder Modellvergiftung können das unterbinden, was ein Agent erreichen will.
- Verbreitung von Voreingenommenheiten. Agenten können verzerrte Muster in den Daten verstärken und systematisch ungerechte Ergebnisse erzeugen.
Architektur mit Berücksichtigung der Governance
Drei Mechanismen begegnen den meisten dieser Risiken:
- Rollenisolation beschränkt die Befugnisse jedes Agents sowie die APIs, auf die er zugreifen darf, sodass ein kompromittierter Agent nur begrenzten Schaden anrichten kann.
- Aufzeichnung nachvollziehbarer Entscheidungen dokumentiert jeden Überlegungsschritt, damit Fehler überprüft und zugeordnet werden können.
- Authentifizierung der Agenten überprüft die Identität jedes Teilnehmers im Workflow.
Zusätzlich trennt eine Ebene der formalen Verifikation das, was sinnvoll erscheint, vom Logisch Gültigen. Sie ist die architektonische Lösung für das überzeugende, aber unzuverlässige Wesen von Sprachmodellen, wie es zu Beginn beschrieben wurde.
Wohin es geht: Proaktive Intelligenz und AZR
Sobald modulare Agenten sowie orchestrierte agentebasierte Systeme zusammenwirken, ist der nächste Schritt die proaktive Intelligenz: Systeme, die Anzeichen in ihrer Umgebung erkennen und Workflows bereits vor einer Aufforderung starten.
Eine für dieses Thema relevante Forschungsrichtung ist das Absolute Zero (AZR)-Paradigma. Anstatt aus von Menschen gelabelten Beispielen zu lernen, verbessert es sich durch verstärktes Selbstspiel, indem es eigene Probleme erzeugt und ohne externe Trainingsdaten logisch vorgeht. Was dies realistisch hält, ist überprüfbare Rückmeldung – beispielsweise durch Ausführung des generierten Codes oder Überprüfung formaler Beweise –, die die menschliche Annotierung als Quelle der Wahrheit ersetzt. Betrachten Sie dies eher als aktives Forschungsfeld denn als für die Produktion bereite Technik.
Entwurfs-Checkliste
Vor der Skalierung eines Mehr-Agenten-Systems sollten Sie den Entwurf anhand folgender Fragen überprüfen:
- Formale Verifizierung: Gibt es eine logische Schicht, die überzeugende Modellausgaben von tatsächlich gültigen Ergebnissen unterscheidet?
- Gedächtnispartitionierung: Sind episodische, semantische und vektorbasierte Speicher klar getrennt?
- Protokollstandard: Findet alle Kommunikation zwischen verschiedenen Frameworks und Anbietern über A2A statt?
- Steuerungsmechanismen: Ist für jeden autonomen Knoten eine Rollentrennung sowie ein nachvollziehbares Protokollieren von Entscheidungen aktiviert?
- Latenzbudget: Haben Sie das Gleichgewicht zwischen der Reifegrad des Reasonings, wie zum Beispiel dem Tree of Thoughts, und der Antwortzeit gemessen und optimiert?
Kernergebnisse
- Mehre-Agenten-Systeme verschieben das Problem von der Entwicklung von Werkzeugen, die Fragen beantworten, hin zur Schaffung von Ökosystemen, die Probleme selbstständig lösen – und dieser Wandel ist architektonischer Natur.
Zusätzliche Literatur
- Agent = Modell + Harness: Woher wirklich zuverlässiges KI-Verhalten stammt — Erfahren Sie, was ein AI-Agent-Harness ist, warum Zustand, Autorität und Verifizierung außerhalb des Modells liegen sollten und welche Strukturen mit der Verbesserung der Modelle überflüssig werden.
- Design von vierstufiger Agentenmemorie mit LangGraph und Amazon Bedrock — Lernen Sie, LLM-Agenten auf Bedrock und LangGraph funktionierende episodische, semantische sowie prozedurale Erinnerungen zu verleihen und sie vor Vergiftung, Datenleckagen sowie Informationsabfluss zu schützen.
- Node-Eskalation statt Aufgaben-Eskalation: Eine sechsstufige Leiter für die Kosten von LLM-Arbeitsabläufen — Warum die Wahl zwischen einem DAG und einem Agenten pro Aufgabe die Kosten für LLMs in die Höhe treibt und wie eine nach Node strukturierte Eskalationsleiter mit Verträgen, Bereichen und Budgets diese in Schach hält.
- Chat-Interface oder Agentenloop? Wie man entscheidet, was eine KI-Funktion benötigt — Erfahren Sie, wie man einen konversationalen Chatbot von einem zielorientierten Agenten unterscheidet, was der Agentenloop beiträgt und wie man entscheidet, welches Konzept Ihre KI-Funktion tatsächlich benötigt.
- Agentenregister zeigen an, was existiert – nicht, ob man dem noch vertrauen kann — Ein vierfragebasiertes Rahmenwerk für Agentenfähigkeitsregister, das Existenz, Eignung, Status und Herkunft abdeckt, sowie ein einfacher Test zur letzten Überprüfung, den Sie noch heute durchführen können.