Startseite / Artikel / Umgekehrte Prompting-Technik: Eine gute LLM-Sitzung in einen wiederverwendbaren Prompt umwandeln

Umgekehrte Prompting-Technik: Eine gute LLM-Sitzung in einen wiederverwendbaren Prompt umwandeln

Erfahren Sie, wie man einen einmaligen Prompt aus einem erfolgreichen mehrteiligen LLM-Gespräch extrahiert und wie die Prompt-Inversion dazu dient, Prompts wiederherzustellen, wenn man nur die Ausgaben vorliegen hat.

1367 Wörter

Der endlich funktionierende Prompt ist selten der, mit dem man angefangen hat: Er entsteht nach mehreren Runden an Korrekturen und verschwindet, wenn man das Chat-Fenster schließt. Der umgekehrte Prompting-Prozess invertiert den üblichen Ablauf – man erreicht zunächst eine Ausgabe, die einem gefällt, und lässt das Modell anschließend die Anweisungen rekonstruieren, die diese Ausgabe zuverlässig erzeugen würden. Man wird lernen, wie man diese Anweisungen aus einem Gespräch extrahiert, wie man allein anhand der Ausgaben einen ungefähren Prompt wiederherstellt und wo beide Methoden nicht mehr zuverlässig sind.

Warum der funktionierende Prompt in der Regel verloren geht

Der umgekehrte Prompting-Prozess setzt voraus, dass aktuelle Spitzentechnologiemodelle gut darin sind, über ihren eigenen Kontext nachzudenken. Er kann manuell in einem Chat-Fenster angewendet werden oder als Schritt in einer Pipeline programmiert sein und bringt vor allem bei der Codegenerierung sowie in agilen Arbeitsabläufen Vorteile, wo viele Anforderungen bestehen, die leicht übersehen werden können.

Ein typischer Verfeinerungslauf

Stellen Sie sich einen Entwickler vor, der einem Python-Dienst einen Endpunkt für die Benutzerregistrierung hinzufügt. Das Ziel sind FastAPI-Code in Produktionsqualität: validierte Eingaben, strukturierte Fehlerantworten, Logging und Tests. Die anfängliche Anfrage ist absichtlich vage – etwa „Schreiben Sie einen FastAPI-Endpunkt für die Benutzerregistrierung“ – und die erste Antwort ist vorhersehbar minimal. Daher iteriert der Entwickler:

  • Bittet um Pydantic-Modelle, die die E-Mail-Adresse validieren und die Stärke des Passworts überprüfen.
  • Bittet um angemessene HTTP-Exceptions sowie Logging-Funktionen.
  • Bittet um eine einheitliche JSON-Struktur für jeden Fehler.
  • Bittet um pytest-Fälle, die den erfolgreichen Ablauf sowie Fehler bei der Validierung abdecken.

Eine Weile später erreicht der Code die von dem Team festgelegten Kriterien, wird in das Repository kopiert, und die Unterhaltung sowie alle Einschränkungen und Korrekturen, die sie geprägt haben, werden vergessen. Der nächste Endpunkt beginnt erneut mit einer vagen, kurzen Anweisung.

Aus der Unterhaltung einen einmaligen Prompt extrahieren

Die auf der Unterhaltung basierende Variante des umgekehrten Promptings behebt dieses Problem mit einer zusätzlichen Nachricht. Sobald die Ausgabe korrekt ist, fügt man eine Meta-Anweisung hinzu, in der das Modell aufgefordert wird, den gesamten Austausch zu überprüfen und ihn in einen einzigen, selbstständigen Prompt zusammenzufassen. Die untenstehende Anweisung legt genau fest, was dieser Prompt enthalten muss: die Rolle, der angesammelte Kontext, alle vereinbarten Einschränkungen, das Ausgabeformat, die Qualitätskriterien sowie ggf. Beispiele. Beachten Sie die letzten beiden Zeilen: Dort wird nur der Prompt ohne jeglichen Kommentar gefordert, damit das Ergebnis direkt in eine neue Sitzung eingefügt werden kann.

Now that we have reached this final output, reverse-engineer
the entire conversation. Look at every correction, added constraint,
tone adjustment, format decision, and the result.
Produce one complete, standalone prompt that would generate
this exact output quality in a single shot with no follow-ups.

The prompt must explicitly state:
- Role and expertise level
- All background context and requirements established
- Every constraint and rule settled on
- Output format and structure
- Tone, style, and quality criteria
- Any examples or reference patterns used

Output only the prompt itself, ready to copy into a fresh session.
No explanation.

Was zurückgegeben wird, ist eine ausdrückliche Spezifikation aller im Dialog impliziten Elemente. Eine neue Sitzung, die diese verwendet, sollte beim ersten Versuch ein vergleichbares Ergebnis liefern; falls weiterer Aufwand erforderlich ist, wurde etwas übersehen.

Betrachten Sie das Ergebnis als technisches Asset:

  • Legen Sie es zusammen mit dem erzeugten Code im Repository ab, damit Änderungen überprüft und versioniert werden können.
  • Teilen Sie es mit Teamkollegen, damit die gleichen Standards unabhängig davon gelten, wer es ausführt.
  • Ersetzen Sie die task-spezifischen Teile durch Parameter (Entity-Name, Felder, Fehlercodes) und wenden Sie es für ähnliche Endpunkte erneut an.

Aus den Ausgaben allein einen Prompt wiederherstellen

Die konversationelle Methode funktioniert nur, solange man noch die Historie besitzt. Eine allgemeinere Technik, die als Prompt-Inversion oder Reverse Prompt Engineering (RPE) bekannt ist, rekonstruiert eine Annäherung an den Prompt ausschließlich anhand des von ihm erzeugten Textes.

Formuliert formal: Ein verborgener Prompt X erzeugte eine Ausgabe O. Man möchte einen Prompt P finden, dessen Ausgabe N semantisch und funktional O nahekommt. Man hat nur Zugang zu einer Black-Box, das heißt es gibt weder Logits noch Trainingsdaten – lediglich die Möglichkeit, Prompts zu senden und Antworten zu lesen.

Kandidaten auswählen und validieren

Der direkte Ansatz umfasst drei Schritte:

  • Geben Sie dem Modell die Ausgabe O und bitten Sie es, den dahinterliegenden Prompt zu erschließen. Eine einzige Schätzung neigt dazu, überzugepasst zu werden oder Einschränkungen zu erfinden, die nie existiert haben; daher sollten Sie dies mehrmals mit unterschiedlichen Temperaturen und Sampling-Einstellungen durchführen, um eine Sammlung von Kandidatenprompts zu sammeln.
  • Führen Sie jeden Kandidaten durch das Modell und vergleichen Sie das Erzeugte mit O mithilfe einer Überlappungsmetrik wie ROUGE-1 (der F1-Score für gemeinsame Unigramme).
  • Bewahren Sie den Kandidaten mit der höchsten Punktzahl auf.

Die Validierungsstufe macht dies zu mehr als nur einer Schätzung: Sie messen, welcher Kandidat tatsächlich das Ziel reproduziert, anstatt der Meinung des Modells zu vertrauen.

Kandidaten wie in einem genetischen Algorithmus weiterentwickeln

Auch können Sie die Kandidaten als Population betrachten und sie weiterentwickeln. Jede Generation:

  • Die Fitness wird als durchschnittliche Ähnlichkeit zwischen den von einem Kandidat erzeugten Ausgaben und der ursprünglichen O gemessen.
  • Bewahren Sie die besten Ergebnisse auf.
  • Mutieren Sie die schwächeren Kandidaten, indem Sie dem Modell den aktuellen Prompt zusammen mit den beobachteten Unterschieden geben und es dazu anleiten, die Formulierung zu ändern, Einschränkungen hinzuzufügen oder zu entfernen sowie die Struktur umzustrukturieren.
  • Wiederholen Sie den Vorgang, bis sich die Bewertungswerte nicht mehr verbessern oder das Budget aufgebraucht ist.

Der Ansatz erfordert keine Trainingsphase. Es wurde berichtet, dass bereits aus nur fünf Beispielausgaben kohärente, wiederverwendbare Prompts erzeugt werden können, und geschlossene-Quell-Modelle stellen kein Hindernis dar, da lediglich eine preiswerte Ähnlichkeitsfunktion benötigt wird.

Beschränkungen, die Sie berücksichtigen sollten

Die Rekonstruktion ist stets eine Annäherung. Der wiederhergestellte Prompt ist oft länger und ausführlicher als das ursprüngliche Eingabeteil, da er Nuancen angeben muss, die ursprünglich im Kontext enthalten waren.

Zwei weitere Einschränkungen:

  • Durch Reverse Engineering erstellte Prompts enthalten die Besonderheiten des Modells, aus dem sie abgeleitet wurden. Ein Prompt, der für ein bestimmtes Modell optimiert wurde, muss möglicherweise angepasst werden, um auch bei einem anderen Modell gut zu funktionieren – überprüfen Sie ihn daher erneut, wenn Sie wechseln.
  • Lexikalische Metriken wie ROUGE-1 belohnen gemeinsame Wörter, nicht das korrekte Verhalten. Bei Code oder strukturierten Ausgaben sollten Sie zusätzlich zu dem Ähnlichkeitswert Prüfungen hinzufügen, die für Sie wichtig sind – beispielsweise ob die generierten Tests bestehen oder ob das JSON validiert ist.

Welche Rolle spielen Programmier-Agenten?

Agentenbasierte Codierungstools wie OpenAI Codex und Claude Code sind für die Vorwärtsrichtung optimiert, verfügen über eine starke Kontextverarbeitung, lange Agentenschleifen sowie einen intensiven Einsatz von Prompt-Caching. Dennoch können beide vor dem Schreiben von Code innehalten und Ihnen mehrfach auswählbare Fragen stellen, um Anforderungen frühzeitig zutage zu fördern. Iterieren Sie mit dem Agenten, bis das Ergebnis ausreichend gut ist, und extrahieren Sie anschließend einen Master-Prompt aus dieser Sitzung für eine einmalige Wiederverwendung. Für eine ergänzende Methode zur Strukturierung der extrahierten Prompts sehen Sie unseren Leitfaden zu der Erstellung produktionstauglicher LLM-Prompts mit einem sieben Schichten umfassenden Framework.

Kernpunkte

  • Der wahre Wert einer langen Prompting-Sitzung liegt in den angesammelten Einschränkungen; erfassen Sie diese, bevor Sie das Chat-Fenster schließen.
  • Eine einzige Meta-Anweisung am Ende eines erfolgreichen Gesprächs verwandelt es in einen eigenständigen, versionierbaren Prompt.
  • Wenn nur Ausgaben vorhanden sind, erzeugt man viele mögliche Prompts und lässt eine Ähnlichkeitsmetrik – nicht das Vertrauen des Modells – den Gewinner auswählen.
  • Wiederhergestellte Prompts sind Annäherungen, die an ein bestimmtes Modell gebunden sind; daher sollten sie in einer neuen Sitzung überprüft werden sowie jedes Mal, wenn sich das Modell ändert.
  • Verwandte Artikel