Fachkompetenz / AI & LLM

Angewandtes AI-Engineering

LLMs eingebunden in
Systeme, die bereits laufen

Sprachmodelle in Systeme, die schon laufen — Abruf über Ihre Dokumente, Queues, die noch ein Mensch räumt, Inferenz, die Sie selbst hosten. Brief schicken. Angebot in 24 Stunden.

Was wir bauen

AI-Engineering-Leistungen

Die Modellwahl ist die kleinste Entscheidung auf der Liste. Die eigentliche Arbeit liegt in der Retrieval-Qualität, der Validierung der Ausgaben und darin, was bei einem fehlgeschlagenen Aufruf passiert.

LLM-Integration in bestehende Systeme

Modellaufrufe, eingebunden in die Software, die Sie bereits betreiben — CRM, ERP, Ticketing, interne Portale — hinter einer Servicegrenze, mit Retries, Kostenerfassung und Fallback-Pfad, wenn der Provider ausfällt.

RAG-Pipelines über Ihre eigenen Daten

Ingestion, Chunking, Embeddings und Retrieval, abgestimmt auf Ihre Dokumentstruktur. Antworten nennen ihre Quelle, und der Index lässt sich jederzeit aus den Originaldateien neu aufbauen.

Dokumenten- und Textautomatisierung

Klassifikation, Extraktion, Zusammenfassung und Normalisierung von Dokumenten, die heute durch eine manuelle Warteschlange laufen. Strukturierte Ausgaben werden gegen ein Schema validiert, bevor sie in Ihre Datenbank gelangen.

Workflow-Automatisierung

Mehrstufige Prozesse, in denen das Modell die Bewertung übernimmt und deterministischer Code alles Übrige. Jeder Schritt ist beobachtbar, wiederholbar und umkehrbar.

Prompt Engineering und Fine-tuning

Prompt-Versionierung, Evaluationssets und Regressionstests, bevor eine Änderung ausgeliefert wird. Fine-tuning nur dort, wo Prompting und Retrieval wirklich an ihre Grenzen stoßen.

Self-hosted Inferenz

Open-Weight-Modelle wie Llama und Mistral auf Ihrer eigenen Hardware oder im privaten Cluster — für Workloads, bei denen Daten den Perimeter nicht verlassen dürfen.

Technische Referenz

Modelle, Retrieval & Hosting

Provider sind bewusst austauschbar — die Integrationsschicht stammt von uns, ein Modellwechsel ist daher eine Konfigurationsänderung und kein Umbau.

Modellfamilien
GPTClaudeMistralLlama
Retrieval-Stack
Embedding pipelinesVector searchHybrid retrievalRe-rankingSource citation
Serving & Hosting
DockerKubernetesGPU schedulingOn-prem clustersQueue-backed workers
Qualitätskontrollen
Evaluation setsPrompt versioningSchema validationToken cost trackingStructured logging
Technologie

Was unter der Haube läuft

Anwendung
  • Node.js
  • TypeScript
  • React 19
  • REST / streaming APIs
Daten
  • PostgreSQL
  • Vector indexes
  • ClickHouse
  • Object storage
Laufzeitumgebung
  • Docker
  • Kubernetes
  • Worker pools
  • RabbitMQ / Kafka
Observability
  • OpenTelemetry
  • Sentry
  • Structured logging
  • Cost dashboards
Brownfield

Legacy-Modernisierung mit AI-Unterstützung

Die meisten Operator-Systeme sind kein Greenfield. Assistenten beschleunigen Inventur, Characterisation-Tests und mechanische Refactors — Cut-over, Protokollsemantik und Datenintegrität bleiben in menschlicher Verantwortung.

Der Nutzen für den Kunden ist Tempo ohne eine zweite, erfundene Architektur. Kontextpakete und Regelsets halten jede Agenten-Session im Stack, der bereits produktiv läuft.

  • Characterisation-Tests vor Verhaltensänderungen
  • Seam-first Extraktion statt Big-Bang-Rewrites
  • Protokoll- und Telemetriesemantik durch Domänen-Engineers
  • Gemeinsame AI-Regeln, damit Assistenten den lebenden Code respektieren
Rules-Pack für Ihr Repo bauen →
FAQ

KI in bestehenden Produkten

Üblich ist RAG über Ihre Daten, Dokument- und Prozessautomatisierung und Modellaufrufe in einem operativen Produkt — kein eigenständiger Chatbot als Liefergegenstand.
Beides. OpenAI und Claude, wo sie passen; selbst gehostetes Llama / Mistral, wenn Daten den Perimeter nicht verlassen dürfen. Das ist eine Constraint, keine Vorliebe.
Evaluations-Harnesses, Retrieval-Tests und ein Fallback, wenn das Modell falsch liegt. Wir sagen klar, was ein Modell übernehmen kann und was nicht.
Der Workflow, die Daten und wo er stockt. Zurück kommt ein 24-Stunden-Angebot und eine ehrliche Schnittlinie.

Brief schicken. Angebot in 24 Stunden.

Der Workflow, die Daten und wo er stockt. Innerhalb eines Werktags ein scoped Plan und eine ehrliche Schnittlinie.