Startseite / Artikel / Jev: Wie ein nicht-generatives KI-Modell Text in Entscheidungen umwandelt

Jev: Wie ein nicht-generatives KI-Modell Text in Entscheidungen umwandelt

Erfahren Sie, wie Jevs numerisches „System One“-KI-Modell funktioniert, warum es schneller und günstiger ist als LLMs sowie wo es in Produktionssystemen neben generativer KI eine Rolle spielt.

1629 Wörter

Was ist Jev eigentlich?

Falls Sie in letzter Zeit Zeit in den auf KI ausgerichteten Bereichen von Twitter oder Hacker News verbracht haben, sind Sie wahrscheinlich auf den Namen Jev gestoßen. Einige beschreiben es als „ein LLM ohne das LL“, und wenn man genauer darüber nachdenkt, ergibt diese Bezeichnung tatsächlich viel Sinn.

Hier ist eine einfache Erklärung auf Alltagssprache, was es ist und warum es wichtig ist.

Jev ist ein kürzlich veröffentlichtes KI-Modell, das im September 2026 von TypeSafe AI eingeführt wurde. Es handelt sich um ein Startup, das von Diogo Almeida gegründet wurde, der zuvor als Ingenieur bei OpenAI tätig war. Das Unternehmen arbeitete zwei Jahre lang unauffällig, bevor es Jev als sein erstes Produkt vorstellte – unterstützt durch eine Seed-Finanzierungsrunde in Höhe von 40 Millionen Dollar.

Das Interessante daran ist: Trotz des Hypes ist Jev kein großes Sprachmodell im herkömmlichen Sinne. Tools wie ChatGPT, Claude und Gemini arbeiten alle auf dieselbe grundlegende Weise – man gibt ihnen Text ein, und sie erzeugen im Gegenzug mehr Text. Jev kehrt dieses Muster völlig um. Man gibt ihm Text als Eingabe, und anstelle von Abschnitten oder Erklärungen erhält man numerische Ausgaben: Wahrscheinlichkeiten, Zuverlässigkeitswerte und Bewertungen. Es gibt keine erzählerische Antwort, kein in Sätzen dargestelltes Argumentieren – nur Zahlen.

TypeSafe hat für diesen Ansatz eine neue Bezeichnung geprägt: „System One“-Modelle. Einige Entwickler bezeichnen sie informell als „Entscheidungsmodelle“, ein Begriff, der die Funktion vermutlich klarer beschreibt.

Der Name selbst ist eine Anspielung auf die Wirtschaftswissenschaften. „Jev“ ist die Abkürzung für William Stanley Jevons, den Ökonomen des 19. Jahrhunderts, der für das Jevons-Paradoxon bekannt ist – die Idee, dass Menschen, wenn die Nutzungskosten für etwas sinken, nicht weniger davon konsumieren, sondern letztendlich viel mehr. TypeSafe setzt im Grunde darauf, dass, sobald die Kosten für künstlich intelligente „Denkfunktionen“ sinken, diese in weitaus mehr Bereichen von Software Verwendung finden werden als derzeit.

Wie funktioniert Jev eigentlich?

Ein nützliches mentales Modell ist es, sich Jev nicht als Gesprächsassistenten, sondern als hochfähige Funktionsaufruf-Funktion in Ihrem Code vorzustellen.

Zum Einsatz zu bringen, geben Sie zwei Eingaben an:

  1. Ein "Zustand" – das ist die Rohmaterialie, die aus Text oder strukturierten Daten bestehen kann, wie z. B. ein Support-Ticket, eine Produktliste, ein E-Mail-Verlauf, ein Artikel oder praktisch alles andere.
  2. Eine oder mehrere Fragen, auf die Sie bezüglich dieses Zustands eine Antwort möchten.

Anstatt in vollständigen Sätzen zu antworten, gibt Jev für jede von Ihnen gestellte Frage eine Zahl zurück. Es werden drei Frageformate unterstützt:

  • Ja/Nein-Fragen – intern als „Noul“-Fragen bezeichnet, ein Verweis auf die in der Statistik verwendete Bernoulli-Verteilung. Ein Beispiel wäre die Frage „Ist diese E-Mail Spam?“, wobei eine Wahrscheinlichkeitswertung wie 0,94 zurückgegeben wird.
  • Mehrfachauswahlfragen – Sie liefern eine Liste möglicher Antworten, und Jev weist jeder davon einen Zuverlässigkeitswert zu.
  • Skalierte oder bewertende Fragen – Sie bitten das System, etwas auf einer numerischen Skala einzuordnen, und es antwortet mit einem einzigen Wert.
  • Auch sind Sie nicht darauf beschränkt, pro Dokument nur eine Frage zu stellen. Mehrere Fragen zum selben Eingabedaten können in einer einzigen Anfrage zusammengefasst werden, und Sie erhalten alle numerischen Antworten auf einmal. Es gibt kein zu verwalterndes Hin- und Her der Kommunikation und auch keinen Prosa-Text, den man später analysieren muss – nur strukturierte Zahlen, mit denen die Logik Ihrer Anwendung sofort arbeiten kann.

    Der Reiz für Entwickler: Geschwindigkeit und Kosten

    Das ist wohl der wichtigste Grund, warum Jev Aufmerksamkeit erhält. Basierend auf von TypeSafe veröffentlichten Zahlen:

    • Die Antwortzeiten liegen zwischen 70 und 500 Millisekunden, was deutlich schneller ist als bei einer herkömmlichen Anfrage an ein Standard-LLM.
    • Bei ähnlichen Arbeitslasten gibt TypeSafe an, mit einer Geschwindigkeit zu arbeiten, die vierzig bis zweihundertmal höher ist als bei führenden LLMs, und gleichzeitig nur einen Bruchteil der Kosten zu verursachen – bei einigen Vergleichen soll der Kostendifferenz sogar bis zu 400-fach betragen.

    Auch seine Preismodelle weichen von der Konvention ab. Die meisten Anbieter von LLMs berechnen getrennt Gebühren für Eingabetoken und Ausgabetoken, wobei die Ausgabe in der Regel teurer ist. Jev kehrt das völlig um: Man zahlt nur für die Eingabe zu einem Tarif von 0,042 US-Dollar pro Million Token, während die Ausgabe keinerlei Kosten verursacht. Das macht Sinn, wenn man bedenkt, dass die Ausgabe hier lediglich eine kleine Anzahl von Zahlen ist und kein generierter Text. Berichten zufolge ist dieses Preismodell sogar kostengünstiger als leichte, preisgünstige Modelle wie GPT-5 Nano.

    Es lohnt sich, bei der Betrachtung dieser Zahlen innezuhalten und eine Einschränkung zu berücksichtigen. Die eigene technische Dokumentation von TypeSafe gibt zu, dass die zur Erstellung dieser Werte verwendeten Benchmark-Aufgaben intern von ihrem Team entwickelt wurden und dass die herausragenden Leistungsdaten vermutlich ein optimales Szenario widerspiegeln und nicht das, was bei typischen Alltagslasten zu beobachten ist. Das macht die Angaben nicht falsch, doch es gibt einen berechtigten Grund, den Begriff „200 Mal schneller“ vor einer unabhängigen Überprüfung mit Skepsis zu betrachten.

    Wo Jev tatsächlich eingesetzt wird

    Jev ist nicht als Ersatz für Chatbots oder Content-Generierungswerkzeuge konzipiert – er wird in absehbarer Zeit keine Artikel wie diesen schreiben. Stattdessen ist er für einen engeren Zweck entwickelt: die Erstellung schneller Klassifizierungsentscheidungen innerhalb von Softwaresystemen. Schon jetzt gibt es einige Anwendungsfälle:

    Spam und Inhaltsmoderation – Anstatt ein vollständiges LLM einzusetzen, um zu entscheiden, ob eine Nachricht Spam ist oder beleidigenden Inhalt enthält, kann Jev dieses Urteil fast sofort und zu minimalen Kosten fällen.

    Bessere Suchergebnisse – Ein typischer Arbeitsablauf beinhaltet die Verwendung einer kostengünstigen Methode wie BM25, um beispielsweise 100 mögliche Ergebnisse zu ermitteln, anschließend bewertet Jev jedes davon hinsichtlich seiner Relevanz für die Suchanfrage. Früher war das Durchlaufen eines vollständigen LLM auf 100 Ergebnisse in großem Umfang zu teuer, um praktikabel zu sein – doch Jevs Preismodell macht dies nun möglich.

    Taggen, Sortieren und Priorisieren – Man denke an Aufgaben wie das Rangieren von Supportanfragen nach Dringlichkeit, die Kategorisierung von Inhalten oder das Bewerten von Verkaufsleads. Dabei handelt es sich um wiederkehrende Entscheidungen, die Teams früher dazu zwangen, zwischen teuren LLM-Aufrufen oder instabiler regelbasierter Logik zu wählen.

    Überwachung anderer KI-Agenten — Da immer mehr Unternehmen autonome Agenten einsetzen, steigt der Bedarf, diese auf Fehler oder Versuche zu überwachen, Sicherheitsbeschränkungen zu umgehen. Der Einsatz eines vollständigen LLM ausschließlich für Überwachungszwecke wird schnell teuer. Da Jev sehr günstig in der Nutzung ist, ist es praktikabel, ihn kontinuierlich im Hintergrund beim Beobachten des Verhaltens der Agenten einzusetzen.

    Auswahl des zu verwendenden Modells — Bevor eine Anfrage an ein teures, leistungsstarkes Modell weitergeleitet wird, hilft es oft, zunächst eine einfache Frage zu stellen: Erfordert diese spezielle Aufgabe tatsächlich dieses Leistungsniveau? Jevs Geschwindigkeit und geringe Kosten machen ihn geeignet, diesen Triage-Schritt in Echtzeit zu bewältigen, was die Kosten im gesamten Prozess erheblich senken kann.

    Ein Entwickler, der Jev getestet hat, verglich es im Rahmen der Klassifizierung von Geschäfts-E-Mails mit Googles Gemini. Gemini erwies sich als etwas genauer, doch seine Kosten lagen 10 bis 20 Mal höher. Was den Tester beeindruckte, war nicht nur der Preisunterschied – sondern auch die Tatsache, dass Jev eine wirklich kalibrierte Wahrscheinlichkeitsbewertung liefert anstelle einer selbstsicheren Schätzung, was es erheblich einfacher macht, darauf aufbauend zuverlässige automatisierte Systeme zu entwickeln.

    Der Kompromiss, den man nicht übersehen sollte

    Hier ist der Aspekt, dem gleiche Aufmerksamkeit gewidmet werden muss: Jev ist tatsächlich schwieriger zu überprüfen als ein herkömmliches LLM – und nicht einfacher.

    Wenn Sie ChatGPT oder Claude verwenden, können Sie das Modell bitten, seine Antwort zu begründen, und erhalten im Gegenzug eine Art Schlussfolgerung – auch wenn diese nicht immer schlüssig ist. Jev bietet kein solches Feature: Man erhält lediglich eine numerische Bewertung und nichts weiter. Das ist einerseits der Grund dafür, dass es schnell und günstig ist, bedeutet aber auch, dass jegliche bei der Schulung eingebetteten Voreingenommenheiten viel schwieriger zu erkennen oder in Frage zu stellen sind. Einige Frühnutzer haben bereits Bedenken geäußert, dass versteckte Voreingenommenheiten in Jevs Bewertungen bei bestimmten Anwendungsfällen zum Tragen kommen könnten.

    Es gibt auch eine zweite Ebene der Opazität, und zwar die technische. TypeSafe hat weder Jevs Architektur noch die Gewichte des Modells sowie keine begleitenden Forschungspapiere veröffentlicht. Das öffentlich Bekannte ist begrenzt: Es handelt sich um ein auf Transformern basierendes Modell, das ausschließlich mit synthetischen Daten trainiert wurde und mithilfe eines von der Firma als Reinforcement Learning for Calibrated Decisions (RLCD) bezeichneten Ansatzes entwickelt wurde. In dieser Konfiguration werden die Wahrscheinlichkeitsausgaben des Modells an tatsächliche Ergebnisse aus der Realwelt angepasst, anstatt an die von Menschen vorgegebenen Präferenzranglisten, wie sie üblicherweise zur Feinabstimmung chatorientierter LLMs verwendet werden. Mehrere externe Beobachter vermuten, dass Jev im Hintergrund auf einem bereits vorhandenen Modell mit offenen Gewichten basieren könnte, doch TypeSafe hat dies weder bestätigt noch dementiert.

    Fazit

    Jev verfolgt einen eigenständigen Ansatz bei der Integration von KI in Softwaresysteme. Anstatt ein großes, teures Modell dazu anzuweisen, einen Textblock zu generieren und anschließend eine Antwort aus diesem Text zu extrahieren, liefert Jev direkt die Antwort als Zahl in Millisekunden – und das zu einem Bruchteil der Kosten.

    Er ist nicht dafür konzipiert, Aufgaben wie Schreiben, umfangreiches Denken oder offene Gespräche von Modellen wie ChatGPT oder Claude zu übernehmen. Doch bei den alltäglichen, häufigen Entscheidungen, die im Hintergrund moderner Anwendungen getroffen werden – ob eine Nachricht als Spam gilt, wie relevant ein Suchergebnis ist oder wie dringend ein Support-Antrag erscheint – könnte er letztendlich einen überproportional großen Anteil der tatsächlichen Arbeitslast bewältigen.

    Ob „Entscheidungsmodelle“ zu einer eigenständigen, dauerhaften Kategorie werden oder letztendlich nur als ein eng gefasstes Nischenwerkzeug bleiben, ist noch ungeklärt. Sollte sich hier jedoch etwas wie das Jevons-Paradoxon zeigen, bedeutet es nicht unbedingt, dass eine geringere Intelligenztechnologie im Alltag zum Einsatz kommt – vielmehr könnte dies bedeuten, dass KI still und heimlich Tausende kleiner Entscheidungen trifft, die man gar nicht bemerkt.