Startseite / Artikel / Sechs KI-Konzepte, die Ihnen zeigen, was Sie vor dem Vertrauen auf eine Antwort überprüfen sollten

Sechs KI-Konzepte, die Ihnen zeigen, was Sie vor dem Vertrauen auf eine Antwort überprüfen sollten

Tokens, Kontextfenster, Temperatur, Halluzinationen, RAG und Agenten werden als Überprüfungstools erläutert, damit Sie Fehler erkennen, Kosten kontrollieren und die Behauptungen von KI-Produkten beurteilen können.

2235 Wörter

Man übergibt einem KI-Assistenten einen Bericht und erhält eine überarbeitete Zusammenfassung, die eine Grafik enthält, die man im gesamten Dokument nirgends findet. Wenn man danach fragt, entschuldigt sich der Assistent und bietet eine andere Grafik an. Mangelte es an Informationen, fehlgeschlagen die Abrufung oder wurde die Zahl einfach erfunden? Sechs zentrale Konzepte, verstanden anhand der Entscheidungen, die sie beeinflussen, ermöglichen es, die Frage „Warum lügt es?“ durch eine präzise diagnostische Frage zu ersetzen, und sie helfen außerdem dabei, Kosten zu kontrollieren sowie Aussagen von Anbietern zu bewerten.

Warum Skepsis eine vernünftige Grundhaltung ist

Das Misstrauen gegenüber den Ausgaben von KI ist selbst bei Menschen, die sie täglich nutzen, weit verbreitet. In der Stack Overflow Developer Survey von 2025 gaben 46 % der Befragten zur Frage nach der Genauigkeit an, den Ausgaben von KI nicht zu vertrauen, während 33 % ihnen vertrauten – bei insgesamt 33.244 Antworten (Ergebnisse der Umfrage). Lesen Sie das sorgfältig: Es dokumentiert die Meinungen von Entwicklern, nicht eine Messung der Modellgenauigkeit, und es handelt sich um keine repräsentative Stichprobe der Bevölkerung. Es spiegelt jedoch eine reale Spannung wider – Menschen nutzen diese Tools, glauben aber dennoch nicht allem, was sie sagen.

Zuerst derselbe kritische Blick auf Schlagzeilen

Inhalt über KI verspricht oft, dass das Erlernen einiger weniger Begriffe einen „vorne bei 90 % der Menschen“ platziert. Das klingt nach einem Forschungsergebnis, doch ohne zugrundeliegende Studie handelt es sich um Marketing, das als Statistik getarnt ist. Stellen Sie die offensichtlichen Fragen: Vor wem genau, wie wird gemessen, mit welchen Teilnehmern und wo wurden die Ergebnisse veröffentlicht? Ohne Bewertung, ohne Stichprobe, ohne Daten ist der Prozentsatz unbegründet. Das macht jedoch nicht jede damit verbundene Erklärung falsch und sagt nichts über die Absichten irgendjemandes aus; es bedeutet einfach, dass diese Zahl keinerlei Gewicht hat.

Das Kennen der Definitionen ist ein Ausgangspunkt. Sie anzuwenden, auf Ausnahmen zu achten und tatsächliche Ergebnisse zu überprüfen, sind separate Fähigkeiten – und keine davon wird durch einen schmeichelhaften Prozentsatz gemessen.

Dieselbe Disziplin gilt für Behauptungen, wonach eine einzige Anfrage eine ganze Teamarbeit ersetzen kann oder dass ein bestimmtes Tool die Geschwindigkeit aller erheblich steigert. Fordern Sie die konkrete Aufgabe, den Ausgangswert, die Messmethode sowie die Einschränkungen an. Eine einzige beeindruckende Demonstration reicht nicht aus, um allgemeine Ergebnisse zu belegen. Ein starkes Schlagwort ist in Ordnung; Probleme entstehen, wenn die Behauptung präziser ist als die sie stützenden Beweise. Wenden Sie diesen Leitfaden denselben Standards an.

1. Tokens: die tatsächliche Größe einer Aufgabe

Ein Token ist die Texteinheit, die ein Sprachmodell tatsächlich verarbeitet. Je nach Tokenisierer kann ein Token ein ganzes Wort, ein Teil eines Wortes, ein Satzzeichen oder ein anderer Textabschnitt sein, wobei der Tokenisierer jeden Abschnitt auf eine numerische ID abbildet.

Es gibt keine feste Regel wie „ein Wort entspricht einem Token“. Die Übersicht zu den Tokenisierern von Hugging Face beschreibt mehrere Ansätze, darunter Byte-Pair-Encoding, WordPiece sowie methodenbezogene Ansätze zu SentencePiece. Derselbe Satz kann durch verschiedene Tokenisierer ganz unterschiedlich aufgeteilt werden. Sprachen außer Englisch, Code sowie ungewöhnliche Formatierungen verwenden oft mehr Tokens pro Wort.

Warum das wichtig ist, wird durch eine Frage wie folgende klar:

Welche drei Kundenbeschwerden kamen am häufigsten vor?

Die Frage an sich ist sehr kurz. Doch wenn ihre Beantwortung das Lesen von Tausenden von Support-Nachrichten erfordert, stellt die Frage einen Rundungsfehler im gesamten Eingangstext dar. Als grobe Illustration statt als genaue Messung: Schon 400 Nachrichten mit jeweils etwa 150 Tokens ergeben zusammen 60.000 Tokens – noch bevor Anweisungen oder weiterer Kontext hinzukommen.

Daher lautet die wichtige Frage nicht, wie lang der Prompt ist, sondern wie viel Material die Aufgabe das System zum Verarbeiten zwingt. Da Preise, Latenzzeiten und Kontextgrenzen in der Regel in Tokens ausgedrückt werden, bestimmt dies auch die Kosten. Vor einer Aufgabe mit einem großen Dokument sollten wiederholte E-Mail-Unterschriften, irrelevante Anhänge sowie doppelte Einträge, die keine Beweise liefern, entfernt werden, während alles beibehalten wird, von dem die Antwort tatsächlich abhängt.

2. Kontextfenster: Was das Modell in einer Anfrage sehen kann

Das Kontextfenster begrenzt die Menge an Material, mit der ein Modell in einer einzigen Anfrage arbeiten kann. Systemanweisungen, Konversationsgeschichte, abgerufte Abschnitte sowie alle anderen Eingaben verbrauchen diesen Rahmen; wie die Ausgabetokens darin berücksichtigt werden, hängt vom Modell und der API ab. Googles Dokumentation zu langen Kontexten zeigt, wie große Fenster es ermöglichen, mit großen Sammlungen von Texten und anderen Medien zu arbeiten.

Doch das Akzeptieren eines Dokuments ist nicht dasselbe wie die zuverlässige Nutzung aller darin enthaltenen relevanten Details. Die Studie von 2023 mit dem Titel „Lost in the Middle“ prüfte mehrdokumentbasiertes Fragebeantworten sowie Schlüssel-Wert-Auswertung und stellte fest, dass bei den getesteten Modellen die Genauigkeit oft abnahm, wenn die relevanten Informationen mitten in einem langen Eingabetext statt am Anfang oder Ende lagen. Betrachten Sie dies als historischen Beleg für diese spezifischen Experimente, nicht als Bewertung für heutige Modelle – doch die Lektion bezüglich der Überprüfung bleibt weiterhin gültig.

Chat-Produkte verhalten sich außerdem selten so, wie ihre Benutzeroberfläche nahelegt. Wenn ein Gespräch den Bildschirmbereich übersteigt, muss eine Anwendung nicht unbedingt die ältesten Nachrichten löschen; stattdessen kann sie diese zusammenfassen, auswählen oder früheres Material abrufen. Was Sie in der Chat-Geschichte sehen, gibt kein zuverlässiges Bild davon ab, was bei jedem Aufruf tatsächlich beim Modell ankommt.

In der Praxis:

  • Für lang andauernde Aufgaben sollte man eine kurze, präzise Zusammenfassung mit den aktuellen Anforderungen und Entscheidungen führen und diese bei Bedarf erneut darlegen.
  • Wenn eine Schlussfolgerung von einem bestimmten Abschnitt abhängt, sollte man den Assistenten bitten, diesen Abschnitt vor der Erstellung der Schlussfolgerung zu zitieren oder zu finden.

Ein großes Fenster gibt dem System mehr Arbeitsraum; es beweist jedoch nicht, dass das System die richtigen Beweise verwendet hat.

3. Temperatur: Kontrolle über Vielfalt, nicht über Wahrheit

In jedem Schritt der Generierung bewertet das Modell jeden möglichen nächsten Token. Die Temperatur verändert die Wahrscheinlichkeitsverteilung, aus der die Auswahl der Tokens erfolgt: niedrige Werte konzentrieren die Wahrscheinlichkeit auf die wahrscheinlichsten Kandidaten, während hohe Werte sie auf mehr Optionen verteilen. Hugging Face dokumentiert die Temperatur zusammen mit verwandten Generierungskontrollen wie top-p-Sampling und greedy Decoding.

Der verlockende Kurzweg lautet „niedrige Temperatur bedeutet präzise“. Das stimmt jedoch nicht. Wenn die wahrscheinlichste Antwort des Modells falsch ist, führt eine geringere Vielfalt nicht dazu, dass das fehlende Faktum hinzugefügt wird; sie führt lediglich dazu, dass derselbe Fehler konsequenter auftaucht. Ebenso garantiert eine höhere Temperatur keine besseren Ideen, nur mehr vielfältige.

Zwei gegensätzliche Aufgaben zeigen den Unterschied. Das Erstellen von fünf Namen für ein fiktives Café profitiert von Vielfalt. Das Extrahieren von Rechnungsnummern profitiert von einheitlichem Format, doch die Nummern müssen weiterhin mit den tatsächlichen Rechnungen übereinstimmen, und die Temperatur hat dazu keinerlei Einfluss.

Betrachten Sie die Temperatur als eine Einstellung, mit der experimentiert werden kann, und bewerten Sie sie im Vergleich zu dem, was die Aufgabe tatsächlich erfordert. Bei der Extraktion zählen Sie falsche und fehlende Felder; bei Brainstorming fragen Sie, ob die Ideen sowohl nutzbar als auch wirklich voneinander unterschiedlich sind. Vorhersehbarkeit und Korrektheit benötigen getrennte Überprüfungen.

4. Halluzination: Ausgabe, die ihren Belegen vorausgeht

Hier bedeutet Halluzination generierten Inhalt, der erfunden ist, faktisch falsch ist oder nicht durch das Material gestützt wird, das er beschreiben soll. Ein selbstsicherer Ton erschwert die Erkennung, doch Selbstsicherheit ist nicht Teil der Definition; ein vorsichtiger Satz kann genauso unbegründet sein.

Ein erfundenes Forschungspapier ist ein offensichtliches Beispiel. Ein subtileres und häufigeres Beispiel ist ein echtes Papier, das für ein Ergebnis zitiert wird, das es nie berichtet hat – dieses übersteht einen schnellen Blick gerade deshalb, weil die Zitation vorhanden ist.

Der TruthfulQA-Benchmark enthält 817 Fragen in 38 Kategorien, die auf gängigen Fehlvorstellungen basieren. In der ursprünglichen Bewertung war das am besten getestete Modell bei 58 % der Fragen ehrlich, im Vergleich zu 94 % bei Menschen. Es handelt sich um historische Ergebnisse aus Forschungen von 2021 und 2022, keine Messgröße für aktuelle Chatbots und kein universeller Wert für Halluzinationen. Die Studie zeigt vielmehr, dass Modelle falsche Überzeugungen, die in von Menschen verfasstem Text vorkommen, getreu wiedergeben können.

Falls eine Zusammenfassung eine überraschende Zahl enthält, fragen Sie explizit nach ihrer Herkunft:

Weisen Sie auf den Quelltext hin, geben Sie das Datum sowie die Bevölkerungsgruppe an, für die er erhoben wurde. Falls der Text die Zahl nicht stützt, kennzeichnen Sie sie als unbegründet.

Prüfen Sie die Referenz anschließend mit eigenen Augen. Jede Zitierung, die ein Modell erzeugt, ist lediglich eine Behauptung, solange Sie weder bestätigt haben, dass die Seite existiert, noch, dass sie tatsächlich den spezifischen Satz enthält.

5. RAG: Nachweissuche vor der Beantwortung

Retrieval-augmented Generation verbindet einen Suchschritt mit einem Erstellungs Schritt. Das System sucht relevante Materialien in einer externen Sammlung, übermittelt sie an das Modell und bittet dieses, auf der Grundlage dieser Materialien zu antworten.

Die einflussreiche RAG-Publikation von 2020 kombinierte einen vortrainierten Ersteller mit einem Suchmechanismus für einen Wikipedia-Index und erreichte bei Veröffentlichung die besten bekannten Ergebnisse in drei offenen QA-Benchmarks. Diese Ergebnisse beschreiben ein einzelnes Forschungssystem und stellen keine Qualitätsgarantie für jedes Produkt dar, das das RAG-Label trägt.

Betrachten wir den Fall, dass ein Mitarbeiter fragt, wie viele Tage er Zeit hat, um eine Ausgabenrechnung einzureichen. Ein gutes System ruft die aktuelle Richtlinie ab und gibt daraufhin eine Antwort. Wenn stattdessen die Richtlinie des Vorjahres abgerufen wird, kann gut formulierte Sprache den Fehler nicht beheben; die Antwort klingt fließend, ist aber falsch. Deshalb sind Fehlfälle bei RAG in der Regel leichter nach den einzelnen Phasen zu diagnostizieren als, wenn man sich nur auf die endgültige Antwort konzentriert – ein Ansatz, der in „RAG nach Fehlerrichtung bewerten“ erläutert wird.

Zwei Missverständnisse sind es wert, aufgeklärt zu werden:

  • RAG hängt nicht davon ab, über einen spezialisierten Vektorlagertyp zu verfügen. Der Abfrageschritt kann klassische Schlüsselwortabgleiche, Embedding-Ähnlichkeitsbetrachtungen oder eine Kombination beider Methoden umfassen. In Microsofts Übersicht zu RAG werden diese Optionen zusammen mit der Bedeutung der Vorbereitung von Inhalten, damit sie gut suchbar sind, erörtert.
  • Das Hochladen eines PDFs beweist nicht, dass eine Abfrage stattfindet. Einige Systeme fügen den Inhalt des Dokuments direkt in das Kontextfenster des Modells ein, wie in der Google-Dokumentation zu langen Kontexten beschrieben. Abfragen und direkte Verarbeitung im langen Kontext sind unterschiedliche Konzepte, wobei ein Produkt beide kombinieren kann.
  • Um einen Dokumentenassistenten zu bewerten, sollten Sie zwei separate Fragen stellen: Hat er den richtigen Abschnitt gefunden, und spiegelt seine Antwort diesen Abschnitt getreu wider?

    6. Agenten: Systeme, die ihren nächsten Schritt selbst wählen

    Der Begriff „Agent“ wird oft locker verwendet, daher hilft eine klare Unterscheidung. Anthropics Leitfaden zur Erstellung effektiver Agenten beschreibt Workflows als Systeme, die vorgefertigte Codepfade befolgen, während Agenten es dem Modell ermöglichen, seinen eigenen Prozess sowie die Nutzung von Tools dynamisch zu steuern.

    Ein fester Arbeitsablauf könnte Felder aus einer Rechnung extrahieren, sie überprüfen und eine Eintragung speichern – stets in dieser Reihenfolge. Ein Mitarbeiter, der mit einer unvollständigen Rechnung konfrontiert ist, könnte eigenmächtig beschließen, eine Anhangdatei zu öffnen, die zugehörige Bestellung aufzusuchen und um fehlende Informationen zu bitten.

    Die entscheidende Frage lautet daher: Welche Entscheidungen und Aktionen darf das System vornehmen? Ein entworfener Antworttext sowie eine erteilte Rückerstattung haben völlig unterschiedliche Folgen. Ein Mitarbeiter benötigt klar definierte Berechtigungen, nachvollziehbare Ergebnisse für jede Aktion sowie eine Möglichkeit, innezuhalten, wenn er keinen sinnvollen nächsten Schritt festlegen kann.

    Mehr Schritte bedeuten auch mehr Chancen auf Misserfolg. Als absichtlich vereinfachte Illustration: Wenn eine Aufgabe zehn Schritte erfordert und jeder Schritt unabhängig mit einer Wahrscheinlichkeit von 95 % erfolgreich ist, beträgt die Wahrscheinlichkeit, dass alle zehn Schritte erfolgreich sind, 0,95 hoch zehn – etwa 60 %. In der Praxis hängen die Schritte eines Agenten voneinander ab und Änderungen durch erneute Versuche verändern die Berechnung, sodass dies eher eine Intuition zum kumulativen Risiko ist als ein Vergleichswert. Die praktische Folge ist es, zu prüfen, ob die gesamte Aufgabe inklusive aller Nebeneffekte korrekt abgeschlossen wurde, und nicht, ob die einzelnen Schritte plausibel erschienen. Für eine ausführlichere Behandlung des Agentenzyklus selbst siehe Understanding AI Agents: Ziele, Werkzeuge, Gedächtnis und der Agentenzyklus.

    Eine Checkliste mit sechs Fragen für reale Aufgaben

    Jedes Konzept entspricht einer Frage, die man sich zu jeder realen Aufgabe stellen kann:

    • Tokens: Wie viel Material muss das System tatsächlich verarbeiten, und was kann entfernt werden, ohne Beweise zu verlieren?
    • Context window: Auf welchen Abschnitt beruhte die Antwort, und hat das System ihn tatsächlich verwendet?
    • Temperature: Geht es bei dieser Aufgabe um Vielfalt oder Konsistenz, und wurden Richtigkeit und Vorhersagbarkeit getrennt überprüft?
    • Halluzination: Wo genau liegt die Quelle für jede überraschende Behauptung, und besagt sie tatsächlich das, was die Antwort behauptet?
    • RAG: Wurde das richtige, aktuelle Dokument abgerufen, und wurde es genau dargestellt?
    • Agents: Was ist dem System gestattet zu tun, und wurde die gesamte Aufgabe einschließlich ihrer Nebeneffekte korrekt ausgeführt?

    Zusammenfassung

    Probieren Sie diese Fragen an einer echten Aufgabe aus, wie zum Beispiel der Zusammenfassung eines Dokuments, einer Codeänderung oder einer Antwort im Kundenservice, wobei das Quellmaterial direkt neben Ihnen offen liegt. Unterscheiden Sie die als Grundlage dienenden Informationen, die vom Tool selbst gezogenen Schlussfolgerungen sowie die tatsächlich ausgeführten Aktionen. Wenn Sie dies konsequent tun, erfahren Sie mehr über die Zuverlässigkeit eines Tools als durch jede Demo oder Statistik – außerdem verwandelt sich vages Misstrauen in konkrete, lösbare Probleme: übermäßig umfangreiche Eingaben, übersehene Abschnitte, falsche Dokumente, nicht unterstützte Diagramme oder Agenten mit zu viel Freiheit.