Startseite / Artikel / Diagnose von Problemen bei den Ausgaben von LLMs: Wann prompten, abrufen oder feinabstimmen

Diagnose von Problemen bei den Ausgaben von LLMs: Wann prompten, abrufen oder feinabstimmen

Ein symptomorientierter Ansatz, um zu entscheiden, ob eine schwache KI-Funktion einen besseren Prompt, eine Abrufschicht oder Feinabstimmung benötigt, und warum das Trainieren eines Modells mit Fakten kontraproduktiv ist.

1577 Wörter

Die erste Version einer beliebigen KI-Funktion liefert Ergebnisse, die nicht ganz korrekt sind. Sie haben drei Möglichkeiten, das zu beheben: Die Anweisungen ändern, dem Modell die fehlenden Dokumente zur Verfügung stellen oder es mit Ihren eigenen Beispielen neu trainieren. Diese Methoden unterscheiden sich erheblich in ihren Kosten – von einigen Minuten Arbeit bis hin zu Wochen der Datensammlung – und jede behebt eine andere Art von Fehler. Diese Anleitung zeigt Ihnen einen symptomorientierten Ansatz, um die richtige Methode auszuwählen, sodass Sie nicht wochenlang an einer Lösung arbeiten, die das Problem gar nicht erfordert.

Behandeln Sie das Modell wie einen fähigen Neuzugang

Ein nützliches Denkmodell ist es, das Modell als einen sehr talentierten Mitarbeiter an seinem ersten Arbeitstag zu betrachten. Er weiß viel über die Welt im Allgemeinen, aber nichts über Ihr Unternehmen – weder über Ihre Produkte noch über Ihre Richtlinien oder darüber, wie Ihr Team Antworten haben möchte. Er wird Fehler machen, genau wie jeder talentierte Neuzugang auch.

Man kann dem neuen Mitarbeiter auf genau drei Arten helfen. Man kann ihn besser einweisen, ihm die Referenzmaterialien geben oder ihn auf einen Schulungskurs schicken. Das entspricht den Methoden Prompting, Retrieval und Fine-Tuning und ist von der günstigsten zur teuersten Methode geordnet. Die Kunst besteht darin, die geeignete Maßnahme zum jeweiligen Problem zu finden, weshalb es sinnvoll ist, sie in dieser Reihenfolge zu betrachten.

Prompting: Schreiben Sie zunächst die Einweisung um

Beginnen Sie immer hier. Ein Prompt sind einfach die Anweisungen, die man mit der Anfrage sendet: die eigentliche Aufgabe, ein oder zwei Beispiele für eine gute Antwort, für wen die Antwort bestimmt ist und das gewünschte Format. Die Anpassung kostet nichts und dauert nur wenige Minuten. Ein großer Teil der Beschwerden, dass „die KI schlecht ist“, entpuppt sich als Beschwerden darüber, dass der Prompt unklar war.

Nehmen wir an, die Antworten Ihres Features sind langatmig und steif. Es ist kein Neutraining erforderlich. Fügen Sie eine Anweisung wie „Antworten Sie in drei Sätzen, im warmen, einfachen Ton“ hinzu, fügen Sie ein gutes Beispiel für eine Antwort ein – meistens wird das Problem bereits in einer einzigen Iteration gelöst. Die einmalig für jede Anfrage festgelegten Standardanweisungen werden als Systemprompt bezeichnet; die Beispielantworten, die Sie zur Darstellung eines Musters einbeziehen, nennt man Few-Shot-Beispiele.

Die Prompting-Methode hat jedoch eine klare Grenze: Anweisungen können kein Wissen liefern, das das Modell noch nie gesehen hat. Wenn dem neuen Mitarbeiter die Zahlen dieses Quartals noch nicht gezeigt wurden, führt das Auftragen der Anweisung, „genauer zu sein“, nicht dazu, dass er diese Zahlen erhält. Wenn das eigentliche Problem ein Informationsmangel ist, benötigen Sie das zweite Mittel.

Kurze Überprüfung, bevor wir fortfahren

Bevor Sie zu dem Schluss kommen, dass das Prompting fehlgeschlagen ist, stellen Sie sicher, dass Sie die offensichtlichen Verbesserungen ausprobiert haben: Geben Sie das Ausgabeformat explizit an, nennen Sie mindestens ein konkretes Beispiel, sagen Sie, was zu tun ist, wenn die Antwort unbekannt ist, und testen Sie mit einer kleinen, festgelegten Menge an echten Eingaben statt nur mit ein oder zwei ausgewählten Fällen. Ohne diese feste Menge ist es schwierig zu erkennen, ob eine Änderung tatsächlich geholfen hat.

Auswertung: Übergabe der Dateien

Retrieval-augmented Generation, kurz RAG genannt, ermöglicht es dem Modell, zum Zeitpunkt der Antwort auf Ihre Dokumente zuzugreifen – wie die aktuelle Preisliste, die Rückgabepolitik oder der Bestellhistorie eines bestimmten Kunden. Dadurch werden alle fehlenden, häufig ändernden oder für Ihre Organisation vertraulichen Kenntnisse abgedeckt. Wenn ein Dokument aktualisiert wird, passen sich die Antworten entsprechend an, ohne dass eine erneute Schulung erforderlich ist. Es handelt sich dabei um die richtige Wahl, wenn das Wissen Ihnen gehört, häufig wechselt oder zitiert werden muss. Die Unterscheidung zwischen dem, was sich ein Modell in seinen Gewichten eingeprägt hat, und dem, was es zum Zeitpunkt der Antwort abruft, wird ausführlicher in „Wie sich KI-Gedächtnis, Kontext, Embeddings und Modellgewichte unterscheiden“ erläutert.

In der Situation neuer Mitarbeiter gibt man ihnen nicht mehr Vorträge; stattdessen übergibt man ihnen das Handbuch und lässt sie es vor der Antwort durchsehen. Sie können nun Fragen zu Änderungen beantworten, die lange nach dem Training des Modells stattgefunden haben, und genau angeben, woher jede Antwort stammt.

Der Aufwand ist größer als bei einer einfachen Anpassung des Prompts. Man erstellt einen kleinen Workflow, der Dokumente speichert und nach Bedeutung durchsucht – was in der Regel Tage Arbeit statt Minuten bedeutet. Das ist dennoch deutlich günstiger als das Feintuning, und das System bleibt so aktuell wie die Dokumente. Zudem entstehen zusätzliche Komponenten, die gepflegt werden müssen: wie Dokumente aufgeteilt werden, wie die Suchqualität gemessen wird und was passiert, wenn nichts Relevantes gefunden wird.

Die Informationsbeschaffung hat ihre eigenen klaren Grenzen. Ein Dokument füllt Lücken in dem Wissen des Modells auf; es ändert jedoch nicht das Verhalten des Modells. Wenn man jemandem das Handbuch gibt, ändert sich weder sein Schreibstil noch sein Urteilsvermögen. Dafür muss man ihn ausbilden.

Fine-Tuning: Auf einen Schulungskurs schicken

Durch Fine-Tuning wird das Modell anhand vieler Beispiele erneut trainiert, bis ein bestimmter Stil oder eine Fähigkeit automatisch wird. Es handelt sich dabei um das Mittel, um ein konsistentes Verhalten zu erreichen – insbesondere dann, wenn Anweisungen nicht zum gewünschten Ergebnis führen, oder wenn die ursprünglichen Anweisungen bereits zu einer langen Liste von Regeln geworden sind und weiterhin unzuverlässig sind. Stellen Sie sich vor, jede Antwort müsste in einer Million Gesprächen einen sehr spezifischen Markenton sprachlich widerspiegeln, ohne dass auch nur eine Antwort davon abweicht. Das Training anhand von Tausenden von Beispielen kann dieses Verhalten zum Standard machen, ohne dass weitere Anweisungen notwendig wären.

Der Punkt, den die Leute am häufigsten falsch verstehen, ist folgender: Die Feinabstimmung verändert das Verhalten des Modells, nicht das, was es weiß. Sie ist langsam und teuer, erfordert eine umfangreiche Menge an Beispieldaten, und alles Faktische, das man einbaut, wird sofort veraltet, sobald sich diese Fakten ändern. Deshalb sollte man sie nicht zum Speichern von Fakten verwenden – dafür dient die Informationsabrufung. Unter den drei Optionen ist sie das Schulungsverfahren: mächtig, wenn das Problem tatsächlich verhaltensbezogen ist, und sinnlos für alles, was durch eine klarere Anleitung gelöst werden könnte. Für einen detaillierten Überblick über die wirtschaftlichen Aspekte dieser Entscheidung siehe Kostenvergleich eines feinabgestimmten Modells mit einem API-Aufruf.

Auswahl nach Symptomen

Fangen Sie mit einer einzigen Frage an: Was genau stimmt nicht mit der Ausgabe?

  • Die Formatierung oder der Ton ist falsch, oder das Modell ignoriert Teile Ihrer Anweisungen. Das ist ein Problem mit der Formulierung, daher sollten Sie den Prompt verbessern.
  • Eine Information fehlt oder ist veraltet, das Modell zitiert die falsche Version von etwas, oder Sie benötigen, dass es seine Quelle angeben kann. Das ist ein Wissensproblem, daher sollten Sie eine Informationsabruffunktion hinzufügen.
  • Die Fakten sind korrekt, doch das Verhalten hält unabhängig von der Formulierung Ihrer Anfrage nicht konstant, und Sie benötigen, dass es in Tausenden von Antworten zuverlässig ist. Das ist ein Verhaltensproblem, daher sollten Sie an einer Feinabstimmung arbeiten.

Das Symptom bestimmt die Lösung. Zwei weitere Punkte werden oft übersehen.

Die Hebel ergänzen sich statt miteinander zu konkurrieren

Fast jede Funktion beginnt mit einem Prompt. Viele fügen später eine Datenabfrage hinzu, wenn sie aktuelle oder private Fakten benötigen, und eine kleinere Anzahl fügt eine Feinabstimmung hinzu, um ein Verhalten zu erreichen, das der Prompt nicht gewährleisten kann. In der Regel entscheiden Sie selbst, welche Schicht als Nächstes hinzugefügt wird – es gibt keine einheitliche Methode für immer. Ein feinabgestimmtes Modell erhält weiterhin einen Prompt, und ein RAG-System ist weiterhin auf Anweisungen angewiesen, die dem Modell sagen, wie es die abgerufenen Informationen nutzen soll.

Gehen Sie nur so weit, wie das Symptom es erfordert

Weil die Optionen in dieser Reihenfolge von günstig bis teuer reichen, stoppen Sie bei der ersten Lösung für das Problem. Derselbe Ansatz gilt bereits vor dem Aufbau: Wenn die Aufgabe von sich ändernden Fakten abhängt, planen Sie eine Datenabfrage ein; wenn ein sehr hohes Volumen an präzisem Verhalten erforderlich ist, kann eine Feinabstimmung letztendlich sinnvoll sein; bei allem anderen beginnt man mit einem Prompt.

Der kostspielige Fehler: Feinabstimmung zur Vermittlung von Fakten

Der Fehler, der ausdrücklich erwähnt werden sollte, ist das Versuchen, das Modell durch Feinabstimmung etwas beizubringen. Es klingt nach einer ernsten, ingenieurtechnisch anspruchsvollen Lösung – genau deshalb wählen Teams sie zuerst. Doch eine ständig sich ändernde Tatsache gehört nicht in die Gewohnheiten des Modells, sondern in ein Dokument, das das Modell nachschlagen kann. Wenn man das falsch anstellt, kann man wochenlang damit verbringen, dem Modell eine bereits falsche Tatsache beizubringen – bis zum Start gibt es dann keine einfache Möglichkeit, anzuzeigen, woher eine Antwort stammt.

Eine weitere Falle ist die Feinabstimmung, um ein eigentlich vages Prompt zu korrigieren. Wenn Sie noch keine ausdrücklichen Formatierungsanweisungen sowie einige gute Beispiele anhand eines festen Testsets ausprobiert haben, wissen Sie noch nicht einmal, ob es überhaupt ein Verhaltensproblem gibt.

Kernpunkte

  • Diagnostizieren Sie vor dem Einsatz: Ermitteln Sie, ob das Problem bei den Anweisungen, dem Wissen oder dem Verhalten liegt.
  • Probleme mit Anweisungen, Tonfall und Format werden durch gezielte Anfragen innerhalb weniger Minuten gelöst.
  • Fehlende, sich ändernde, private oder zitierfähige Fakten erfordern eine Suche, deren Einrichtung Tage dauert und die ständig aktualisiert werden muss.
  • Nur ein hartnäckiges Verhalten, das durch keine Anfrage zuverlässig gemacht werden kann, rechtfertigt die Wochen und Daten, die eine Feinabstimmung erfordert.
  • Betrachten Sie die drei Ansätze als Schichten, die Sie in Abhängigkeit vom Kostenfaktor hinzufügen, und verwenden Sie Feinabstimmungen niemals zur Speicherung von Fakten.