Startseite / Artikel / Einführung in RAG: Zugang für große Sprachmodelle zu externem Wissen

Einführung in RAG: Zugang für große Sprachmodelle zu externem Wissen

Ein für Anfänger geeigneter Leitfaden zu RAG – Chunking, Embeddings, Vektorsuche, hybride Recherche sowie die Fälle, in denen RAG dennoch Halluzinationen erzeugt – mit klaren Architekturdiagrammen.

2065 Wörter

Große Sprachmodelle antworten aus ihrem Trainingsgedächtnis. Dieses Gedächtnis ist leistungsstark, aber unvollständig: Es kann interne Handbücher, veraltete Richtlinien sowie Fakten übergehen, die nie in öffentlichen Texten erschienen sind. Retrieval-Augmented Generation (RAG) schließt diese Lücke, indem sie zunächst relevante externe Materialien abruft und das Modell anschließend bittet, auf dieser Grundlage zu antworten.

Was ist RAG?

Ohne Abruf geht eine Frage direkt an das Modell:

User Question
      ↓
     LLM
      ↓
   Answer

Mit RAG findet das System vor der Generierung relevante Informationen:

User Question
      ↓
Find Relevant Information
      ↓
Give Information to the LLM
      ↓
     LLM
      ↓
   Answer

Das Modell formuliert weiterhin den endgültigen Text; der neue Bestandteil ist ein aus einem Wissensspeicher stammender, kontextueller Bezug.

Warum brauchen wir RAG?

Trainingsstopps, private Korpora sowie schnell ändernde Richtlinien untergraben alle „nur auf Erinnerung basierenden“ Antworten. Ein am letzten Wochenende aktualisiertes Mitarbeiterhandbuch wird nicht in den Gewichten eines Frontier-Modells enthalten sein. RAG ermöglicht es dem Assistenten, zu jedem Zeitpunkt auf dieses Handbuch zuzugreifen, ohne neu trainieren zu müssen.

Ein einfaches RAG-Beispiel

Ein Mitarbeiter fragt nach der Übertragung von Urlaubstagen. Der Ablauf sieht so aus:

Employee asks a question
          ↓
Search the employee handbook
          ↓
Find the relevant section
          ↓
Give that section to the LLM
          ↓
LLM generates the answer

Der Assistent sollte das Handbuch zitieren und keine Richtlinie erfinden, die „richtig klingt“.

Wie funktioniert RAG?

Zwei Phasen sind wichtig: Das Wissen wird offline vorbereitet und anschließend online beantwortet.

1. Das Wissen vorbereiten

Dateien einlesen, sie aufteilen, Fragmente embedden und Vektoren für die Suche speichern.

2. Die Frage beantworten

Die Frage embedden, die relevantesten Fragmente abrufen, sie in einen Prompt packen und eine Antwort generieren.

Teil 1: Das Wissen vorbereiten

Typische Quellen für einen HR-Assistenten:

Employee Handbook
Vacation Policy
Benefits Guide
Leave Policy

Der Vorbereitungsprozess:

Documents
    ↓
Extract Text
    ↓
Break into Smaller Pieces
    ↓
Create Embeddings
    ↓
Store for Search

Schritt 1: Informationen beschaffen

Extrahieren Sie sauberen Text aus jeder Quelle:

Employee Handbook
        ↓
    Extract text
        ↓
"Employees receive..."
"Vacation requests..."
"Leave policy..."

Überschriften, Fußzeilen sowie das Navigationselement sollten früh entfernt werden, damit sie niemals zu „Fakten“ werden.

Schritt 2: Das Dokument in Blöcke aufteilen

Lange Handbücher überschreiten die Kontextgrenzen und verbergen den relevanten Absatz. Durch das Aufteilen in Blöcke entstehen suchbare Einheiten:

Employee Handbook
       ↓
 ┌───────────────┐
 │    Chunk 1    │
 ├───────────────┤
 │    Chunk 2    │
 ├───────────────┤
 │    Chunk 3    │
 ├───────────────┤
 │      ...      │
 └───────────────┘

Warum ist das Aufteilen in Blöcke wichtig?

Zu große Blöcke verringern die Relevanz; zu kleine Blöcke führen zum Verlust der umliegenden Regeln (insbesondere von Negationen und Ausnahmen). Überschneidungen zwischen benachbarten Blöcken bewahren den Kontext der Grenzen. Beginnen Sie einfach mit einer festen Größe und Überschneidung – passen Sie anschließend an, wenn die Bewertungen Fehlschläge zeigen.

Schritt 3: Embeddings erstellen

Embeddings ordnen Text in Vektoren ein, sodass bedeutungsgleiche Phrasen auch ohne gemeinsame Schlüsselwörter in der Nähe vorkommen.

Fragetext:

"What is my vacation allowance?"

Eine Paraphrase mit derselben Absicht:

"How many annual leave days do I get?"

Sowohl Versionen können nach dem Einbetten in der Nähe desselben Abschnitts zur Urlaubsrichtlinie landen:

"What is my vacation allowance?"
              ↓
          Embedding
              ↓
       Numerical representation

Verwenden Sie denselben Einbettungsmechanismus für Indexierung und Abfragen; das Mischen von Modellen stört heimlich die Suche nach dem nächsten Nachbarn.

Schritt 4: Die Informationen zur Suche speichern

Jeder Abschnitt zusammen mit seinem Vektor wird in einen Vektorindex (oder ein hybrides Speichersystem) aufgenommen:

Document Chunk
      ↓
   Embedding
      ↓
Vector Database

Metadaten – Quelltitel, Seite, Zugriffsstufe, Gültigkeitsdatum – sollten zusammen mit dem Abschnitt gespeichert werden, um später Filter und Zitate anwenden zu können.

Teil 2: Beantwortung der Nutzerfrage

Online-Pfad:

User Question
      ↓
Understand the question
      ↓
Search the stored information
      ↓
Find relevant chunks
      ↓
Give those chunks to the LLM
      ↓
Generate an answer

Schritt 5: Relevante Informationen abrufen

Durch das Einbetten der Frage werden die wichtigsten Abschnitte ermittelt, beispielsweise:

Chunk 147 → Vacation carryover policy
Chunk 148 → Vacation request process
Chunk 62  → Employee benefits
Chunk 300 → Security policy

Die Qualität der Auswahl bestimmt hier die Endqualität der Antwort. Eine schlechte Auswahl lässt sich nicht durch eine bessere Anfragebehandlung korrigieren.

Schritt 6: Geben Sie die Informationen an den LLM weiter

Der heruntergeladene Text wird zum Prompt-Kontext:

Context:Employees may carry over up to 5 unused
vacation days into the following year.
Question:How many vacation days can I carry over?

Die Anweisungen sollten eine Antwort auf Basis des Kontexts erfordern sowie das Fehlen von Informationen bei fehlendem Kontext erkennen.

Schritt 7: Erstellen Sie die Antwort

Retrieved Information
        +
User Question
        ↓
       LLM
        ↓
      Answer

Das Modell formuliert eine Antwort, die auf den heruntergeladenen Texten beruht und nicht auf allgemeinen HR-Grundsätzen.

Die vollständige RAG-Architektur

Label für die Offline-Vorbereitung:

KNOWLEDGE PREPARATION

Von-Anfang-bis-Ende-Diagramm:

        Documents
            ↓
      Extract Text
            ↓
         Chunking
            ↓
        Embeddings
            ↓
      Vector Database
            │
            │
            │
            ▼
        USER QUESTION
            ↓
        Query Embedding
            ↓
         Retrieval
            ↓
    Relevant Information
            ↓
     Question + Context
            ↓
            LLM
            ↓
          Answer

Vor der Frage

Documents
   ↓
Chunks
   ↓
Embeddings
   ↓
Vector Database

Wenn die Frage eintrifft

Question
   ↓
Retrieval
   ↓
Relevant Context
   ↓
LLM
   ↓
Answer

Betritt RAG nur Vektorabfragen?

Nicht unbedingt. Produktionsysteme kombinieren oft verschiedene Methoden.

Schlüsselwortabfrage

Lexikalische Abgleicher (BM25 und ähnliche) sind hervorragend bei exakten Tokenen: Richtliniencodes, SKUs, Fehlernummern, Eigennamen.

Semantische Abfrage

Die Vektorsuche erkennt Paraphrasen und Synonyme, die Schlüsselwörter übersehen.

Hybride Suche

Mischen Sie beides und fügen Sie anschließend die Ranglisten zusammen:

Keyword Search
       +
Semantic Search
       ↓
  Hybrid Search

Die hybride Methode ist eine starke Standardlösung, wenn der Traffic genaue Identifikatoren mit Anfragen in natürlicher Sprache mischt.

RAG beseitigt keine Halluzinationen

Die Informationsabrufung verringert unbegründete Erfindungen, beseitigt sie jedoch nicht. Zu den Fehlermöglichkeiten gehören:

Falscher Datenblock abgerufen:

User Question
      ↓
Wrong information retrieved
      ↓
LLM
      ↓
Wrong answer

Es wird nichts Relevantes gefunden, doch das Modell antwortet dennoch:

User Question
      ↓
No relevant information found
      ↓
LLM
      ↓
Unsupported answer

Mitigationsmaßnahmen: strengere Informationsabrufung, Neuranglistenbildung, Ablehnungsanweisungen, Zitierungen sowie Bewertung der Treue – nicht nur der Flüssigkeit.

RAG gegen Feintuning

RAG

Am besten geeignet, wenn sich das Wissen häufig ändert, zitiert werden muss oder außerhalb der Trainingsdaten privat bleibt. Aktualisierungen bedeuten Neindekxisierung, nicht Neutrainieren.

Feintuning

Am besten geeignet, wenn sich Verhalten, Stil oder Aufgabenformat ändern müssen, oder wenn das Wissen stabil und kompakt genug ist, um integriert zu werden. Der Aktualisierungsprozess ist kostspielig, wenn sich Richtlinien häufig ändern.

Viele Produkte nutzen beides: Feinabstimmung für Fähigkeiten, RAG für Fakten.

Wo ist RAG nützlich?

Kundenservice

Assistenten, die auf Produktdokumenten und Ticket-Makros basieren.

Gesundheitswesen

Aufruf von Protokollen und Richtlinien mit strengen Zitier- und Zugriffskontrollen (Gebietsregeln gelten weiterhin).

Finanzen

Richtlinien-, Offenlegungs- und Produktregelantworten, die stets auf den neuesten genehmigten Texten beruhen müssen.

Mitarbeiterentwicklung

Handbücher, Leistungen, Urlaubsregeln – genau das gleiche Muster wie bei Fragen der Mitarbeiter.

Softwareentwicklung

Interne ADRs, Runbooks und API-Referenzen neben öffentlichen Dokumenten.

Wann sollten Sie RAG verwenden?

Nutzen Sie RAG, wenn die Antworten auf ein spezifisches Korpus verweisen müssen, das größer ist als eine Anfrage, schneller ändert sich als die Feinabstimmungsschleifen oder eine Herkunftsangabe erfordert. Vermeiden Sie RAG bei reinen Fakten, die das Basismodell bereits kennt, bei reiner Kreativität oder bei Prozessen mit extrem niedriger Latenz, die keinen Abrufvorgang erlauben.

Was kann RAG schwierig machen?

Begrenzungen der Chunking-Struktur, Verschiebungen in den Embeddings, veraltete Indizes, Sicherheitslücken im Zugriffsmanagement sowie Bewertungslücken. Ein konkretes Beispiel:

Der Benutzer fragt:

User asks:
"What is the vacation carryover policy?"

Das System ruft die falsche Richtlinienfamilie ab:

             ↓System retrieves:
"Health insurance policy"             ↓LLM receives wrong context             ↓Poor answer

Dann klingt das Modell selbstsicher, wenn es Krankenversicherung wie Urlaubsübertragungen erklärt. Beheben Sie zunächst den Abrufprozess und die Metadatenfilter, bevor Sie den Generierer dafür verantwortlich machen.

Was müssen Sie lernen, um RAG zu entwickeln?

Eine praktische Lernprogression:

RAG Fundamentals
       ↓
Document Processing
       ↓
Chunking
       ↓
Embeddings
       ↓
Vector Databases
       ↓
Retrieval
       ↓
Prompt + Context
       ↓
LLM
       ↓
Evaluation

Dokumentverarbeitung, Strategien zur Aufteilung in Blöcke, Embeddings, Vektordatenspeicher, Erstellung von Prompts, Bewertung sowie Operationen (Wiederherstellung, Zugriff, Überwachung) sind alle von Bedeutung.

Das Gesamtbild

Knowledge
                 ↓
            Find relevant
            information
                 ↓
           Give it to LLM
                 ↓
             Generate
              answer

Wissen befindet sich außerhalb des Modells; das Abrufen schließt die Lücke; die Erzeugung stellt den letzten Schritt dar.

Die Wahl der Chunking-Methode wirkt sich auf die Dimensionalität des Embeddings sowie den Indextyp aus: HNSW-Systeme mit ausschließlich dichter Struktur verhalten sich anders als hybride BM25+-Vektordatenspeicher, wenn Abfragen sowohl Prosa als auch Identifikatoren enthalten. Es sollte eine schriftliche Richtlinie zu Auslösern für Neuerrichtungen geben – neue Handbuchversionen, gelöschte Seiten, Änderungen in den Berechtigungen – und überprüft werden, ob gelöschte Materialien tatsächlich aus dem Index verschwinden und nicht als „Waisenvektoren“ zurückbleiben. Die Formatierung von Zitaten gehört ebenfalls zum Erstellungsvertrag: Wenn die Benutzeroberfläche eine Quellenangabe auf Seiteebene verspricht, müssen Prompt und Nachverarbeitungsfunktion stabile Quell-IDs liefern, nicht dekorative Fußnoten, die nirgendwohin verweisen.

Auch auf dem Einstiegsweg verdient das Neuranking eine kurze Erwähnung. Eine Liste mit Hilfe eines Bi-Encoders ist kostengünstig; ein Durchlauf mit einem Cross-Encoder über die fünfzig besten Kandidaten behebt oft die Fehler „fast das richtige Dokument, falscher Abschnitt“, die dazu führen, dass Demos fehlerhaft erscheinen. Kombinieren Sie dies mit einfachen Ablehnungsregeln, wenn die Ähnlichkeitswerte unter einen kalibrierten Schwellenwert fallen. Teams, die die Bewertung überspringen, entdecken diese Probleme in der Regel erst vor den Stakeholdern und nicht in einem Notizbuch.

Zuletzt sollten Sie die wirtschaftlichen Aspekte von RAG im Hinterkopf behalten: Die Indexierungskosten entstehen kontinuierlich, je größer die Korpora werden, während die Kosten für das Feintunen in größeren Intervallen anfallen. In Bereichen mit vielen Vorschriften sind die kontinuierlichen Indexierungskosten in der Regel günstiger als wöchentliche Feintunings – außerdem bleibt dadurch die Möglichkeit erhalten, den genauen Absatz anzuführen, nach dem ein Prüfer gefragt hat. Genau diese Nachvollziehbarkeit ist oft die eigentliche Produktanforderung, die sich hinter dem Auftrag „Erstelle einen Chatbot“ verbirgt.

Wenn RAG in einen bestehenden Support-Stack integriert wird, sollte man mit einem einzigen Korpus und einer Fragefamilie beginnen, anstatt alles auf einmal umzusetzen. Messen Sie die Anzahl der Abweichungen, Eskalationen sowie Beschwerden wegen falscher Antworten in diesem Bereich, bevor Sie Confluence-Räume großflächig hinzufügen. Kleine Testphasen zeigen, welche Datensatzgrößen und hybriden Gewichtungsmethoden funktionieren; breite Einführungen zeigen meist, dass Dashboards ohne Zuverlässigkeitsmetriken Regressionen verbergen. Behalten Sie in den ersten Wochen eine Warteschlange für menschliche Überprüfungen bei umstrittenen Antworten, damit Redakteure unterscheiden können zwischen „guter Informationsbeschaffung / schlechter Generierung“ und „schlechter Informationsbeschaffung“ – schließlich erfordern diese unterschiedliche Reparaturansätze. Im Laufe der Zeit dienen diese Kennzeichnungen als Trainingsdaten für Neurangier-Algorithmen und zur Entscheidung, ob ein Thema RAG verlassen und stattdessen in einen deterministischen Arbeitsablauf übergehen sollte.

Fazit

Store external knowledge
        ↓
Find relevant information
        ↓
Give that information to an LLM
        ↓
Generate a grounded response

Speichern Sie externe Kenntnisse, finden Sie für jede Frage die relevanten Informationen und erstellen Sie anschließend die Antwort. Dieser dreistufige Prozess ist RAG – einfach zu beschreiben, anspruchsvoll in der Umsetzung und dennoch die praktischste Methode, um Assistenten dazu zu bringen, bei privaten sowie sich ändernden Fakten ehrlich zu bleiben.

Operative Disziplin unterscheidet Demo-Systeme von zuverlässigen Assistenten: Einfrieren Sie eine Fragebasis, messen Sie die Trefferquoten der Suche neben der Genauigkeit der Antworten und erstellen Sie Indexe nach einem Zeitplan, der dem Häufigkeitsgrad der Änderungen der Quellmaterialien entspricht. Bei hybriden Suchverfahren, Neubewertungen oder Metadatenfiltern sollten Sie dieselben Bewertungskriterien beibehalten, damit Verbesserungen sichtbar und nicht nur auf Einzelfällen beruhend sind. Behandeln Sie Zugriffsbezeichnungen von Anfang an als Teil der Datenpakete; das Hinzufügen von Berechtigungen später ist der Grund, warum private HR-Notizen in öffentliche Chats gelangen. Schließlich sollten Sie bei schwachen Ergebnissen lieber eine Ablehnung zusammen mit einer Anfrage nach Quellenangaben vorziehen statt einer flüssigen Vermutung – Nutzer vertrauen auf kalibriertes Schweigen mehr als auf glatt formulierte Erfindungen.

Bewahren Sie Runbooks für den Indexneuaufbau, Zugriffsüberprüfungen und bekannte Fehlermuster zusammen mit den Diagrammen der optimierten Abläufe auf, damit die Betreiber mehr als nur Präsentationsfolien erhalten.

Bewahren Sie Runbooks für den Index-Neuaufbau, Zugriffsüberprüfungen sowie bekannte Ausfallmuster neben den Diagrammen der gängigen Abläufe auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.

Bewahren Sie Runbooks für den Index-Neuaufbau, Zugriffsüberprüfungen sowie bekannte Ausfallmuster neben den Diagrammen der gängigen Abläufe auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.

Bewahren Sie Runbooks für den Index-Neuaufbau, Zugriffsüberprüfungen sowie bekannte Ausfallmuster neben den Diagrammen der gängigen Abläufe auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.

Bewahren Sie Runbooks für den Index-Neuaufbau, Zugriffsüberprüfungen sowie bekannte Ausfallmuster neben den Diagrammen der gängigen Abläufe auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.

Bewahren Sie Runbooks für den Index-Neuaufbau, Zugriffsüberprüfungen sowie bekannte Ausfallmuster neben den Diagrammen der gängigen Abläufe auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.

Bewahren Sie Runbooks für Index-Neubauten, Zugriffsüberprüfungen sowie bekannte Fehlermuster neben den Diagrammen für den optimalen Ablauf auf, damit die Operator mehr als nur eine Präsentationsfolie erhalten.