Umgekehrte Prompting-Technik: Eine gute LLM-Sitzung in einen wiederverwendbaren Prompt umwandeln
Erfahren Sie, wie man einen einmaligen Prompt aus einem erfolgreichen mehrteiligen LLM-Gespräch extrahiert und wie die Prompt-Inversion dazu dient, Prompts wiederherzustellen, wenn man nur die Ausgaben vorliegen hat.
Der endlich funktionierende Prompt ist selten der, mit dem man angefangen hat: Er entsteht nach mehreren Runden an Korrekturen und verschwindet, wenn man das Chat-Fenster schließt. Der umgekehrte Prompting-Prozess invertiert den üblichen Ablauf – man erreicht zunächst eine Ausgabe, die einem gefällt, und lässt das Modell anschließend die Anweisungen rekonstruieren, die diese Ausgabe zuverlässig erzeugen würden. Man wird lernen, wie man diese Anweisungen aus einem Gespräch extrahiert, wie man allein anhand der Ausgaben einen ungefähren Prompt wiederherstellt und wo beide Methoden nicht mehr zuverlässig sind.
Warum der funktionierende Prompt in der Regel verloren geht
Der umgekehrte Prompting-Prozess setzt voraus, dass aktuelle Spitzentechnologiemodelle gut darin sind, über ihren eigenen Kontext nachzudenken. Er kann manuell in einem Chat-Fenster angewendet werden oder als Schritt in einer Pipeline programmiert sein und bringt vor allem bei der Codegenerierung sowie in agilen Arbeitsabläufen Vorteile, wo viele Anforderungen bestehen, die leicht übersehen werden können.
Ein typischer Verfeinerungslauf
Stellen Sie sich einen Entwickler vor, der einem Python-Dienst einen Endpunkt für die Benutzerregistrierung hinzufügt. Das Ziel sind FastAPI-Code in Produktionsqualität: validierte Eingaben, strukturierte Fehlerantworten, Logging und Tests. Die anfängliche Anfrage ist absichtlich vage – etwa „Schreiben Sie einen FastAPI-Endpunkt für die Benutzerregistrierung“ – und die erste Antwort ist vorhersehbar minimal. Daher iteriert der Entwickler:
- Bittet um Pydantic-Modelle, die die E-Mail-Adresse validieren und die Stärke des Passworts überprüfen.
- Bittet um angemessene HTTP-Exceptions sowie Logging-Funktionen.
- Bittet um eine einheitliche JSON-Struktur für jeden Fehler.
- Bittet um pytest-Fälle, die den erfolgreichen Ablauf sowie Fehler bei der Validierung abdecken.
Eine Weile später erreicht der Code die von dem Team festgelegten Kriterien, wird in das Repository kopiert, und die Unterhaltung sowie alle Einschränkungen und Korrekturen, die sie geprägt haben, werden vergessen. Der nächste Endpunkt beginnt erneut mit einer vagen, kurzen Anweisung.
Aus der Unterhaltung einen einmaligen Prompt extrahieren
Die auf der Unterhaltung basierende Variante des umgekehrten Promptings behebt dieses Problem mit einer zusätzlichen Nachricht. Sobald die Ausgabe korrekt ist, fügt man eine Meta-Anweisung hinzu, in der das Modell aufgefordert wird, den gesamten Austausch zu überprüfen und ihn in einen einzigen, selbstständigen Prompt zusammenzufassen. Die untenstehende Anweisung legt genau fest, was dieser Prompt enthalten muss: die Rolle, der angesammelte Kontext, alle vereinbarten Einschränkungen, das Ausgabeformat, die Qualitätskriterien sowie ggf. Beispiele. Beachten Sie die letzten beiden Zeilen: Dort wird nur der Prompt ohne jeglichen Kommentar gefordert, damit das Ergebnis direkt in eine neue Sitzung eingefügt werden kann.
Now that we have reached this final output, reverse-engineer
the entire conversation. Look at every correction, added constraint,
tone adjustment, format decision, and the result.
Produce one complete, standalone prompt that would generate
this exact output quality in a single shot with no follow-ups.
The prompt must explicitly state:
- Role and expertise level
- All background context and requirements established
- Every constraint and rule settled on
- Output format and structure
- Tone, style, and quality criteria
- Any examples or reference patterns used
Output only the prompt itself, ready to copy into a fresh session.
No explanation.
Was zurückgegeben wird, ist eine ausdrückliche Spezifikation aller im Dialog impliziten Elemente. Eine neue Sitzung, die diese verwendet, sollte beim ersten Versuch ein vergleichbares Ergebnis liefern; falls weiterer Aufwand erforderlich ist, wurde etwas übersehen.
Betrachten Sie das Ergebnis als technisches Asset:
- Legen Sie es zusammen mit dem erzeugten Code im Repository ab, damit Änderungen überprüft und versioniert werden können.
- Teilen Sie es mit Teamkollegen, damit die gleichen Standards unabhängig davon gelten, wer es ausführt.
- Ersetzen Sie die task-spezifischen Teile durch Parameter (Entity-Name, Felder, Fehlercodes) und wenden Sie es für ähnliche Endpunkte erneut an.
Aus den Ausgaben allein einen Prompt wiederherstellen
Die konversationelle Methode funktioniert nur, solange man noch die Historie besitzt. Eine allgemeinere Technik, die als Prompt-Inversion oder Reverse Prompt Engineering (RPE) bekannt ist, rekonstruiert eine Annäherung an den Prompt ausschließlich anhand des von ihm erzeugten Textes.
Formuliert formal: Ein verborgener Prompt X erzeugte eine Ausgabe O. Man möchte einen Prompt P finden, dessen Ausgabe N semantisch und funktional O nahekommt. Man hat nur Zugang zu einer Black-Box, das heißt es gibt weder Logits noch Trainingsdaten – lediglich die Möglichkeit, Prompts zu senden und Antworten zu lesen.
Kandidaten auswählen und validieren
Der direkte Ansatz umfasst drei Schritte:
- Geben Sie dem Modell die Ausgabe O und bitten Sie es, den dahinterliegenden Prompt zu erschließen. Eine einzige Schätzung neigt dazu, überzugepasst zu werden oder Einschränkungen zu erfinden, die nie existiert haben; daher sollten Sie dies mehrmals mit unterschiedlichen Temperaturen und Sampling-Einstellungen durchführen, um eine Sammlung von Kandidatenprompts zu sammeln.
- Führen Sie jeden Kandidaten durch das Modell und vergleichen Sie das Erzeugte mit O mithilfe einer Überlappungsmetrik wie ROUGE-1 (der F1-Score für gemeinsame Unigramme).
- Bewahren Sie den Kandidaten mit der höchsten Punktzahl auf.
Die Validierungsstufe macht dies zu mehr als nur einer Schätzung: Sie messen, welcher Kandidat tatsächlich das Ziel reproduziert, anstatt der Meinung des Modells zu vertrauen.
Kandidaten wie in einem genetischen Algorithmus weiterentwickeln
Auch können Sie die Kandidaten als Population betrachten und sie weiterentwickeln. Jede Generation:
- Die Fitness wird als durchschnittliche Ähnlichkeit zwischen den von einem Kandidat erzeugten Ausgaben und der ursprünglichen O gemessen.
- Bewahren Sie die besten Ergebnisse auf.
- Mutieren Sie die schwächeren Kandidaten, indem Sie dem Modell den aktuellen Prompt zusammen mit den beobachteten Unterschieden geben und es dazu anleiten, die Formulierung zu ändern, Einschränkungen hinzuzufügen oder zu entfernen sowie die Struktur umzustrukturieren.
- Wiederholen Sie den Vorgang, bis sich die Bewertungswerte nicht mehr verbessern oder das Budget aufgebraucht ist.
Der Ansatz erfordert keine Trainingsphase. Es wurde berichtet, dass bereits aus nur fünf Beispielausgaben kohärente, wiederverwendbare Prompts erzeugt werden können, und geschlossene-Quell-Modelle stellen kein Hindernis dar, da lediglich eine preiswerte Ähnlichkeitsfunktion benötigt wird.
Beschränkungen, die Sie berücksichtigen sollten
Die Rekonstruktion ist stets eine Annäherung. Der wiederhergestellte Prompt ist oft länger und ausführlicher als das ursprüngliche Eingabeteil, da er Nuancen angeben muss, die ursprünglich im Kontext enthalten waren.
Zwei weitere Einschränkungen:
- Durch Reverse Engineering erstellte Prompts enthalten die Besonderheiten des Modells, aus dem sie abgeleitet wurden. Ein Prompt, der für ein bestimmtes Modell optimiert wurde, muss möglicherweise angepasst werden, um auch bei einem anderen Modell gut zu funktionieren – überprüfen Sie ihn daher erneut, wenn Sie wechseln.
- Lexikalische Metriken wie ROUGE-1 belohnen gemeinsame Wörter, nicht das korrekte Verhalten. Bei Code oder strukturierten Ausgaben sollten Sie zusätzlich zu dem Ähnlichkeitswert Prüfungen hinzufügen, die für Sie wichtig sind – beispielsweise ob die generierten Tests bestehen oder ob das JSON validiert ist.
Welche Rolle spielen Programmier-Agenten?
Agentenbasierte Codierungstools wie OpenAI Codex und Claude Code sind für die Vorwärtsrichtung optimiert, verfügen über eine starke Kontextverarbeitung, lange Agentenschleifen sowie einen intensiven Einsatz von Prompt-Caching. Dennoch können beide vor dem Schreiben von Code innehalten und Ihnen mehrfach auswählbare Fragen stellen, um Anforderungen frühzeitig zutage zu fördern. Iterieren Sie mit dem Agenten, bis das Ergebnis ausreichend gut ist, und extrahieren Sie anschließend einen Master-Prompt aus dieser Sitzung für eine einmalige Wiederverwendung. Für eine ergänzende Methode zur Strukturierung der extrahierten Prompts sehen Sie unseren Leitfaden zu der Erstellung produktionstauglicher LLM-Prompts mit einem sieben Schichten umfassenden Framework.
Kernpunkte
- Der wahre Wert einer langen Prompting-Sitzung liegt in den angesammelten Einschränkungen; erfassen Sie diese, bevor Sie das Chat-Fenster schließen.
Verwandte Artikel
- Sicheres Austauschen von LLM-Modellen: Menschliche Etiketten, Schritt-für-Schritt-Metriken, Anstrengungs-Einstellungen – Wie man einen mehrschrittigen LLM-Pipeline auf neuere Modelle migriert, ohne vor imaginären Regressionen zurückzuschrecken: menschliche Referenzwerte, Schritt-für-Schritt-Metriken, veraltete Prompts und Aufwand beim Denken.
- Wo Claude Code-Anweisungen hingehören: CLAUDE.md, Pfadregeln oder Hooks — Erfahren Sie, warum Claude Code CLAUDE.md als Kontext behandelt, wie man es kürzt, Regeln nach Pfad begrenzt, Schritte, die ausgeführt werden müssen, in Hooks verschiebt und überprüft, was tatsächlich geladen wird.
- Evaluation-Harnesses für LLM-Apps: Datensätze, Bewertung und Regressionstests — Erfahren Sie, was ein Evaluation-Harness für LLM-Apps ist, seine vier Kernkomponenten sowie wie er Prompt-Regressionen erkennen und Modelle vor dem Erreichen der Nutzer fair vergleicht.
- Selbst gehostetes Vision LLM OCR in Go: Rasterisierung, Prompting, Parsing — Wie ein Go-Worker medizinische PDFs mithilfe von Ollama, pdftoppm, präzisen Prompts, fallback-basierendem Parsing sowie Redis Streams Consumer Groups in strukturiertes JSON umwandelt.
- Einen persönlichen Prompt-Refiner und -Generator mit Claude Artifacts erstellen — Wie man ein einzelnes Claude-Chat-Gespräch in ein wiederverwendbares Prompt-Tool umwandelt, das schwache Prompts verbessert und grobe Ideen in grundlegende, fortgeschrittene sowie expertenhafte Versionen erweitert.