Feinabstimmung oder Aufruf der API? Kosten eines Dokumentextraktions-Pipelines
Ein detailliertes Kostenmodell für einen Prozess von Prüfdokumenten zeigt, warum die Modellrouteierung im Vergleich zur Feinabstimmung hinsichtlich der Kosten vorteilhafter ist, und wann die Genauigkeit des Schemas oder die EU-Datenerhaltungspflichten eine eigene Modellentwicklung rechtfertigen.
Ingenieurleitungen stellen immer wieder dieselbe Frage – meist kurz nach Erhalt der ersten großen Rechnung von OpenAI oder Anthropic: Soll das Team sein eigenes Modell feinabstimmen oder weiterhin die API nutzen? Die übliche Antwort lautet, dass die Feinabstimmung günstiger sei. Manchmal stimmt das, doch in der Regel aus engeren Gründen, als die Leute annehmen, und für viele Teams ist das einfach falsch. Dieser Artikel analysiert ein realistisches System mit vielen Dokumenten, das auf beide Weisen kalkuliert wurde, unter Verwendung von Listenpreisen aus September 2026 – damit Sie erkennen können, wo die echten Einsparungen entstehen, wann es sinnvoll ist, ein eigenes Modell zu besitzen, und wie Sie die Entscheidung sequenziell treffen können, ohne acht Ingenieurwochen auf eine Vermutung zu setzen.
Die von den Leuten imaginierte Option existiert nicht mehr
Eine Veränderung hat still und heimlich die gesamte Debatte neu geprägt: Zum Zeitpunkt der Erstellung dieses Textes ist es nicht mehr möglich, ein aktuelles Spitzennachrichtenmodell feinabzustimmen.
Laut der Preisliste von OpenAI wird seine Feinabstimmungsplattform schrittweise eingestellt: Neue Kunden können sich nicht mehr anmelden, und o4-mini ist das einzige verbleibende modellierbare Modell, das mit 100 US-Dollar pro Stunde Training berechnet wird. Anthropics eigene API hat nie eine Feinabstimmungsfunktion bereitgestellt. Der einzige bisherige Ansatz bestand in der überwachten Feinabstimmung von Claude 3 Haiku auf Amazon Bedrock, wobei Haiku 3 seitdem überall außer auf Bedrock und Google Cloud nicht mehr verfügbar ist.
Gegen Ende des Jahres 2026 bedeutet „Feinabstimmung versus Neuansätze“ tatsächlich etwas Spezifischeres: Man nimmt ein Open-Weight-Modell wie Qwen, Llama, eine Nemotron-Variante oder gpt-oss, trainiert einen LoRA-Adapter mit eigenen Daten und stellt ihn anschließend auf der eigenen Infrastruktur oder bei Anbietern wie Fireworks oder Together bereit. Die Risiken dieser Entscheidung sind nicht die, die man sich vorstellt – es geht um die Modellauswahl, Bewertung und Bereitstellung, die normalerweise von einer gehosteten API für einen erledigt werden. Seien Sie hierzu präzise, bevor es zu einer Vorstellung vor dem Vorstand kommt.
Das Referenzsystem: Eine Plattform für Prüfungsnachweise
Das hier beschriebene System ist kein Spielzeug. Es handelt sich um eine vollständige Plattform für Prüfungsnachweise für ein mittelgroßes Unternehmen – genau die Art von Produkt, das eine Wirtschaftskanzlei im Vereinigten Königreich oder in Skandinavien tatsächlich kaufen würde. Es arbeitet in sieben Schritten:
- Eingang.** Kunden laden Dateien über ein Portal hoch, meist als gescannte PDFs. Typische Eingaben sind Rechnungen, Bestellaufträge, Empfangsnachweise, Bankauszüge, Mietverträge und Protokolle von Vorstandssitzungen.
- Klassifizierung.** Jedes Dokument erhält eine Kategorie und wird an den entsprechenden Test gesendet.
- Auswertung.** Strukturierte Felder werden in ein festes Schema eingefügt, darunter Lieferant, Datum, Nettobetrag, MwSt., Bestellnummer, Genehmiger, Währung und Kostenzentrum. Die Ausgabe muss bei jeder Aufruf ein gültiges JSON sein, das exakt dem Schema entspricht.
- Kontrollprüfung.** Die dreiseitige Abgleichsprüfung überprüft, ob die Rechnung mit dem Bestellauftrag und dem Empfangsnachweis übereinstimmt sowie ob der Genehmiger innerhalb seiner Befugnisse handelte. Der größte Teil davon besteht aus gewöhnlichem Code statt aus einem Modell.
Die Phasen 2 und 3 verbrauchen fast alle Tokens und sind zudem der repetitivste, mechanischste sowie am stärksten durch das Schema eingeschränkte Teil des Systems. In den Phasen 6 und 7 findet die eigentliche Beurteilung statt, doch ihr Anteil am Gesamtvolumen ist vernachlässigbar. Behalten Sie diese Aufteilung im Hinterkopf, denn die weitere Analyse ergibt sich daraus.
Berechnung des Tokenvolumens
Das Modell geht davon aus, dass jedes Dokument vor dem Zugriff durch das Modell mithilfe von OCR in Text umgewandelt wird. Dadurch werden Kosten für Bild-Token vermieden, und das ist ohnehin die übliche Vorgehensweise in der Praxis.
Jedes Dokument durchläuft drei Schritte (Klassifizierung, Extraktion und Selbstüberprüfung), was insgesamt etwa folgendes ergibt:
- 5.200 Eingabetoken, die den Dokumententext, das Schema sowie einige Beispiele umfassen
- 600 Ausgabetoken für das strukturierte Ergebnis
Zwei Nutzungsvolumina werden berücksichtigt:
- Pilot: 100.000 Dokumente pro Monat, was einem Unternehmen in einer Hochsaison entspricht.
- Scale: 2.000.000 Dokumente pro Monat, was dem Verkauf desselben Produkts an fünfzig Unternehmen entspricht.
Das ergibt etwa 580 Millionen Token pro Monat im Pilotvolumen und 11,6 Milliarden Token im Skalenvolumen.
Wie die Rechnung aussieht
Die untenstehenden Angaben beinhalten die Standardpreise mit globaler Routing-Logik sowie ohne Rabatte für Großbestellungen oder Caching, wie sie im September 2026 auf den Preisseiten der jeweiligen Anbieter veröffentlicht wurden. Die Preise ändern sich häufig, daher sollten sie als Momentaufnahme betrachtet werden und vor der Budgetplanung erneut überprüft werden.
Bei geringem Volumen entfällt der Anreiz für eine Feinabstimmung. Der Betrieb des gesamten Extraktionsprozesses mit Claude Sonnet 5 kostet etwa 1.640 US-Dollar pro Monat, mit Haiku 4.5 etwa 820 US-Dollar und mit einem feinabgestimmten 8B-Modell etwa 116 US-Dollar. Eine Ersparnis von rund 1.500 US-Dollar pro Monat rechtfertigt niemals die Mühe, ein solches Modell zu entwickeln. In dieser Phase sollte man lieber die API nutzen.
Bei hohem Volumen wird die Wahl wirklich entscheidend:
- Claude Opus 5: etwa 82.000 US-Dollar pro Monat
- GPT-5.6 Sol: etwa 65.600 US-Dollar pro Monat
- Claude Sonnet 5: etwa 32.800 US-Dollar pro Monat
- Claude Haiku 4.5: etwa 16.400 US-Dollar pro Monat
- GPT-5.6 Luna: etwa 3.520 US-Dollar pro Monat
Es ist verlockend, von einer Ersparnis von über 90 % durch das Feinabstimmen zu sprechen – und gegenüber den Flagship-Modellen stützt die Rechnung das: Die Kosten für das Feinabstimmen betragen etwa 7 % der Kosten für Sonnet 5 und weniger als 3 % der Kosten für Opus 5. Doch kein Team sollte ursprünglich Bulk-Invoice-Extraktionen mit einem Flagship-Modell durchführen. Den optimierten Entwurf mit einem absichtlich verschwenderischen zu vergleichen, ist Marketing – keine Analyse.
Routing statt Feinabstimmung bringt die größte Ersparnis
Vergleichen Sie die letzten beiden Zeilen dieser Liste: 3.520 US-Dollar für GPT-5.6 Luna gegenüber 2.320 US-Dollar für das feinabgestimmte 8B-Modell. Der Unterschied beträgt 1.200 US-Dollar pro Monat, also etwa 14.400 US-Dollar im Jahr.
Die ordnungsgemäße Durchführung der Feinabstimmung beinhaltet das Beschriften von Daten, das Schreiben eines Evaluationsframeworks, das Durchführen des Trainings, die Einrichtung eines Servicemoduls sowie den Aufbau einer Überwachung für Abweichungen. Eine realistische Schätzung beträgt acht Ingenieurwochen. Multipliziert man das mit dem typischen Tarif für europäische Auftragnehmer, liegt die Amortisation allein durch Kosteneinsparungen bei den Token bereits weit über achtzehn Monaten.
Die nützlichere Schlussfolgerung ist, dass die größte Einsparung durch das Routing erzielt wird. Wenn Klassifizierung und Extraktion vom teuersten auf den günstigsten Tarif verlagert werden, der dennoch Ihre Bewertungen bestehen lässt, sinkt die monatliche Kostenbelastung für das Opus-Modell von 82.000 US-Dollar auf 3.520 US-Dollar – das entspricht einer Reduzierung von etwa 96 %. Mit einem Router sowie einer soliden Bewertungsgrundlage kann diese Anpassung bereits am Nachmittag vorgenommen werden. Eine weitere Feinabstimmung spart noch etwa 34 % ein. Dasselbe Prinzip, das Modellgröße an jede Anfrage anzupassen, wird ausführlicher in right-sizing LLMs mit Routing, Retrieval und Evaluation erläutert.
Das Training an sich ist nahezu kostenlos. Fireworks bietet ein von LoRA gestütztes Feinabstimmungsverfahren für Modelle mit bis zu 16 Milliarden Parametern zum Preis von 0,50 US-Dollar pro Million Trainingstoken an. Zwanzigtausend gelabelte Beispiele à 2.500 Token, die über drei Epochen trainiert werden, ergeben 150 Millionen Trainingstoken – das sind etwa 75 US-Dollar pro Durchlauf. Acht Durchläufe während der Entwicklung summieren sich auf rund 600 US-Dollar. Die Rechenleistung war nie der teure Teil; die Datenvorbereitung und Bewertung sind es. Jede Kostenschätzung für das Feinabstimmungsverfahren, die hauptsächlich auf den Kosten für GPU-Rechenleistung beruht, stammt von jemandem, der es noch nie durchgeführt hat.
Warum überhaupt feinabstimmen?
Falls die Kosten für die Token nicht ausreichen, können zwei weitere Faktoren dies rechtfertigen.
Erster Grund: strenge Einhaltung des Schemas
Dies ist insbesondere bei Prüfungsarbeiten wichtig, erhält aber weitaus weniger Aufmerksamkeit, als es verdient.
Frontier-Modelle sind Generalisten. Wenn man sie bittet, aus 51 festgelegten Unterkategorien auszuwählen, erzeugen sie gelegentlich eine 52. Kategorie, da die Erstellung plausibel klingenden Textes genau ihr Trainingsziel ist. Für einen Chat-Assistenten spielen solche Fehler kaum eine Rolle. In einem wissenschaftlichen Paper, das eine beglaubigte Prüfungsmeinung stützt, handelt es sich jedoch um einen Mangel.
Jüngste Forschungsergebnisse deuten in dieselbe Richtung, wobei ein Großteil davon noch als Preprint vorliegt und entsprechend betrachtet werden sollte:
- Ein Preprint aus dem Jahr 2026 zur Klassifizierung von Sicherheitsdokumenten bewertete Modelle anhand von 51 vordefinierten Unterkategorien, wobei die Antworten in einem strengen JSON-Format erforderlich waren. Dabei übertraf ein lokal gehostetes, feinabgestimmtes Modell die frontier-Modelle um 15 bis 20 Prozentpunkte, und die Forscher beobachteten, dass GPT-5 Unterkategorienamen erfand, die in der Taxonomie nicht vorhanden waren. Ihre Interpretation ist der wichtige Teil: frontier-Modelle bewältigen lose formatierte Extraktionen gut, doch unter strengen Schema-Beschränkungen ist Kalibrierung wichtiger als die Fähigkeit zum logischen Denken.
Für ein Prüfungsprodukt kann eine Verbesserung der Genauigkeit bei der Datenerfassung um zwei Punkte mehr wert sein als alle Ausgaben für Inferenz zusammen, denn jeder Fehler bei der Erfassung erfordert eine manuelle Überprüfung, und die menschliche Überprüfung ist die teuerste Ressource im Unternehmen.
Zweiter Grund: Genau wissen, wo sich die Daten befinden
In Europa ist das oft der entscheidende Faktor für eine Zusammenarbeit.
Die Prüfungsdateien eines britischen oder EU-Unternehmens für Wirtschaftsprüfung enthalten die finanziellen Unterlagen der Kunden, Mitarbeiterdaten sowie manchmal personenbezogene Daten Dritter. Wo die Verarbeitung stattfindet, ist keine sekundäre Fragestellung; es handelt sich in der Regel um die zweite Frage, die bei der Beschaffung gestellt wird.
Die aktuellen Optionen Stand September 2026 überraschen viele Teams:
- Die First-Party-API von Anthropic bietet keine Option für einen EU-Sitz an. Der Parameter
inference_geoakzeptiert die Werteglobaloderus; die Verarbeitung ausschließlich in den USA kostet 1,1 Mal so viel wie der Standardpreis. Um Claude innerhalb der EU zu halten, muss man eine EU-Region von AWS Bedrock oder Google Vertex verwenden, wobei regionale Endpunkte 10 % mehr kosten als globale. Zum Zeitpunkt der Erstellung dieses Textes verfügte Claude auf Microsoft Foundry über keine EU-Datenzone. - OpenAI unterstützt die regionale Verarbeitung und erhöht den Preis für Modelle, die ab dem 5. März 2026 verfügbar sind, um 10 %.
- Fireworks wendet einen Multiplikator von 1,5 an, wenn eine dedizierte Bereitstellung auf eine bestimmte Region beschränkt ist.
Durch die Preisgestaltung nach Volumen ändert sich das Bild. Zwei dedizierte H100-GPUs, die das fein abgestimmte 8B-Modell nutzen, regionsspezifisch eingesetzt und rund um die Uhr in Betrieb sind, kosten etwa 17.520 US-Dollar pro Monat. Dasselbe Arbeitslast mit Claude Sonnet 5 auf einem EU-Bedrock-Endpunkt würde etwa 36.080 US-Dollar kosten, und mit Opus 5 rund 90.200 US-Dollar.
Das ist der eigentliche europäische Grund, warum man sich das Modell anschaffen sollte. Es liegt nicht daran, dass Tokens günstiger sind; vielmehr lässt sich die Konformitätsbegründung in einem Satz statt in einem Architekturdiagramm darlegen.
Kauft keine dedizierten GPUs zu früh
Eine feste monatliche GPU-Kostenstruktur erscheint attraktiv und überrascht viele Teams, da sie sich nur bei Mengen rentiert, die nur wenige Produkte jemals erreichen. Wenn man als Grundlage ein Paar dedizierter H100s zu den weltweiten Preisen von etwa 11.680 US-Dollar pro Monat nimmt, liegen die Übergangspunkte ungefähr bei:
- 700.000 Dokumente pro Monat für Claude Sonnet 5 – darunter ist die API günstiger
- 1,4 Millionen pro Monat für Claude Haiku 4,5
- 6,6 Millionen pro Monat für GPT-5,6 Luna
Ein typisches Audit-Produkt wird in den ersten zwei Jahren wahrscheinlich unter allen diesen Werten liegen. Die serverlose Hosting-Lösung für ein feinabgestimmtes Modell umgeht dieses Problem völlig: Man erhält angepasste Gewichte, ohne für inaktive GPUs bezahlen zu müssen, was es zum sinnvollen Ausgangspunkt macht. Der Nachteil ist eine geringere Kontrolle über Latenz und Kapazität, was erst dann relevant wird, wenn die Menge hoch und konstant ist.
Vier Fragen, die die Entscheidung klären
1. Wie hoch ist Ihr tatsächlicher monatlicher Token-Umsatz? Wenn Sie pro Monat weniger als etwa eine Milliarde Tokens verarbeiten, wählen Sie die günstigste Frontier-Ebene, die Ihre Evaluierungen bewältigt, und investieren Sie die acht Ingenieurwochen lieber an einem nützlicheren Ort. Eine Feinabstimmung bei Pilotmengen ist reine Show, keine echte Ingenieurarbeit.
2. Wie eng gefasst und eingeschränkt ist die Aufgabe? Ein festes Ausgabeformat, eine feste Setzung von Labels sowie Tausende nahezu identischer Beispiele pro Tag deuten auf eine Feinabstimmung hin. Offene Schlussfolgerungen, Urteilsentscheidungen sowie das Erstellen von Texten für die Unterschrift eines Partners gehören zu Frontier-Modellen und werden voraussichtlich auch dort bleiben.
3. Wo müssen die Daten gespeichert werden? Eine Vertragsklausel, die vorschreibt, dass die Verarbeitung innerhalb des EWR stattfinden muss, verändert bereits vor der Kostenberechnung die möglichen Optionen. Berücksichtigen Sie den Aufpreis für die Speicherung bereits in der ersten Schätzung, anstatt ihn erst während der Architekturprüfung festzustellen.
4. Können Sie mindestens 10.000 beschriftete Beispiele beschaffen? Ein Positionspapier von NVIDIA Research zu kleinen Sprachmodellen in agierenden Systemen schlägt einen Bereich zwischen zehntausend und hunderttausend Beispielen als geeigneten Rahmen für die Anpassung eines kleinen Modells vor. Falls dies nicht möglich ist, sollte das erste Projekt darauf abzielen, den Pipeline-Prozess so auszustatten, dass er seine eigenen Trainingsdaten aufzeichnet.
Dieser letzte Punkt ist das wertvollste Muster hier – und am wenigsten gefördert. Nutzen Sie die Frontier-API zur Ausführung und protokollieren Sie jeden Aufruf, einschließlich Eingaben, Ausgaben sowie Korrekturen durch Überprüfer. Nach sechs Monaten besitzen Sie ein etikettiertes Datensatz ohne zusätzliche Kosten, mit dem Sie auf Grundlage von Belegen statt auf Hoffnung feinabstimmen können. Das Protokollieren von Kundendokumenten bringt eigene Datenschutzpflichten mit sich, daher sollten Sie von Anfang an Regeln für die Aufbewahrung und den Zugriff auf diese Protokolle festlegen.
Derselbe NVIDIA-Artikel schätzte außerdem den Anteil der LLM-Aufrufe, den kleine Modelle in drei Open-Source-Agenten-Projekten übernehmen könnten: etwa 60 % für MetaGPT, 40 % für Open Operator und 70 % für Cradle. Nicht alle davon – aber auch nicht keines davon. Die richtige Antwort ist eine Mischung, und nur die Protokolle zeigen, welche Aufrufe wohin gehören.
Der stärkste Gegenargument
Daten zur Einführung in Unternehmen deuten in eine andere Richtung. Laut der Unternehmensumfrage von Menlo Ventures sank Anteil der Open-Source-Lösungen an den Unternehmensarbeitslasten von 19 % auf 11 %, während die Ausgaben für geschlossene APIs zusammenliefen: Anthropic macht 40 % der Ausgaben für Unternehmens-LLMs aus, OpenAI 27 % und Google 21 %. (Menlo ist Investor bei Anthropic – das sollte man beim Lesen dieser Zahlen berücksichtigen.)
Das steht der obigen Analyse nicht entgegen; es zeigt lediglich, wo die Herausforderungen liegen. Geschlossene APIs haben den Vorteil der Bequemlichkeit, und Bequemlichkeit siegt in der Regel. Teams, die echten Nutzen aus feinabgestimmten Open-Source-Lösungen ziehen, wählten bewusst die höhere operative Belastung aus einem klar definierten Grund. Wenn man diesen Grund nicht nennen kann, ist die Umfrage ein Signal, dem man Beachtung schenken sollte.
Kurze Anmerkung zur EU-Regulierung
Die Teams aus Großbritannien und der EU werden nach dem AI Act fragen, daher ist eine kurze Zusammenfassung nützlich. Betrachten Sie sie als Einführung und nicht als Rechtsberatung, und überprüfen Sie den aktuellen Text, bevor Sie auf irgendwelche Daten vertrauen.
Das Digital Omnibus on AI, offiziell Verordnung (EU) 2026/1744, wurde am 24. Juli 2026 im Amtsblatt veröffentlicht und trat drei Tage später, am 27. Juli, in Kraft. Dadurch wurden die hohen Risikopflichten für eigenständige Systeme nach Anhang III vom 2. August 2026 auf den 2. Dezember 2027 verschoben. Für in Produkten nach Anhang I integrierte KI-Systeme gilt das neue Datum als 2. August 2028.
Die Transparenzpflichten gemäß Artikel 50 wurden nicht verschoben und gelten seit dem 2. August 2026, wie ursprünglich geplant. Für früher auf den Markt gebrachte Systeme tritt die Kennzeichnungspflicht gemäß Artikel 50(2) am 2. Dezember 2026 in Kraft.
Tools, die Prüfer unterstützen und einen menschlichen Genehmigungsprozess vorsehen, fallen in der Regel nicht unter Anhang III – bewerten Sie jedoch Ihren eigenen Anwendungsfall: Wenn irgendein Bestandteil Entscheidungen zur Einstellung oder zur Kreditwürdigkeit beeinflusst, fällt er in den Anwendungsbereich. All dies hat keinen Einfluss auf die DSGVO, die die über das System fließenden Kundendaten regelt, unabhängig davon, wie das KI-Gesetz das System einstuft.
Die Nachfrage ist real. In einer Umfrage von Wolters Kluwer gaben 39 % der 4.214 Fachleute für interne Prüfungen an, bereits KI zu nutzen, und weitere 41 % rechneten damit, innerhalb eines Jahres damit zu beginnen.
Ein schrittweiser Plan für eine solche Entwicklung
Für ein Team, das mit der Entwicklung eines solchen Systems beginnt, ist die empfohlene Reihenfolge folgende:
- Bieten Sie zunächst die günstigste Basisversion an, die Ihren Bewertungssatz erfüllt. Dokumentieren Sie jeden Modellaufruf, lassen Sie Prüfer sie während einer tatsächlichen Hochphase nutzen und verzichten Sie vorerst auf jegliche Feinabstimmung.
Drei dieser vier Phasen kosten weniger als das, was viele Teams bereits am ersten Tag ausgeben.
Kernpunkte
- Derzeitige Frontier-Modelle lassen sich im Allgemeinen nicht feinabstimmen, wodurch die eigentliche Wahl zwischen einem Modell mit offenen Gewichten und LoRA-Adapter sowie einer gehosteten API besteht.
Die zugrundeliegende Frage war nie zwischen kleinem Modell und Spitzenmodell. Es geht darum, welche Ihrer Anfragen tatsächlich eine logische Verarbeitung erfordern. Beantworten Sie das, und die Frage nach den Kosten beantwortet sich größtenteils von selbst.
Verwandte Artikel
- Mapping RAG: Pipeline Stufen, Kernkomponenten und das Variantenlandschaft — Erfahren Sie, wie Retrieval-augmented Generation von Anfang bis Ende funktioniert, welche Komponenten ein RAG-System benötigt und wie sich die vielen verschiedenen RAG-Varianten in einem Überblick darstellen lassen.