APIMaster.ai
Back to Blog
APIMaster Blog

Jev vs. LLMs: Wo ein Entscheidungsmodell das Prompting schlägt – und wo nicht

Jev liefert typisierte Wahrscheinlichkeiten; ein LLM liefert Text, den man parsen muss. Tests von Drittanbietern beziffern die Kosten pro 1.000 Dokumente auf 0,22 $ gegenüber 1,31–3,08 $, und der entscheidende Unterschied ist die Konfidenz, nicht die Genauigkeit.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Bei der Genauigkeit ist die ehrliche Antwort: Sie sind gleichauf. Der detaillierteste veröffentlichte Vergleich, den wir gefunden haben, ließ beide gegen dieselben 24 norwegischen Regierungsanhörungsdokumente antreten und stellte fest, dass Jev und DeepSeek V4.1 Flash mit den Referenzlabels mit praktisch derselben Rate übereinstimmten – 20 von 24 bei der Haltung, 0,86 gegenüber 0,89 über 192 Ja/Nein-Argumentbewertungen, innerhalb des Rauschens einer Stichprobe von 24 Dokumenten. Was sie trennte, war nicht, welches Modell recht hatte. Es war die Frage, ob das Modell einem sagt, wenn es unsicher ist.

Drei Unterschiede entscheiden die Wahl im Produktivbetrieb:

  • Kostenstruktur. Jev berechnet 42 $ pro Milliarde Input-Tokens (0,042 $ pro 1 Mio.) und nichts für Output, weil es keine Tokens ausgibt. Ein generatives Modell zahlt für beides, und ein Reasoning-Modell zahlt für viel Denkarbeit: In demselben Test schrieb DeepSeek 47.000 Reasoning-Tokens, um 24 Formulare auszufüllen.
  • Kalibrierung. Wenn Jev eine Wahrscheinlichkeit von 0,8 angab, stimmte das Referenzlabel in etwa 80 % der Fälle zu. Wenn DeepSeek mit aktiviertem Reasoning 0,8 notierte, stimmte die Referenz in etwa der Hälfte der Fälle zu. Das ist das ganze Argument für ein Entscheidungsmodell: Man kann einen Schwellenwert setzen und ihm vertrauen.
  • Ausgabevertrag. Jev liefert typisierte Antworten – Choice, Score, Noul – mit einer Wahrscheinlichkeit und einem Konfidenzwert. Ein LLM liefert Text, den man parst, und seine angegebene Konfidenz ist ein Satz, keine Zahl, auf die man verzweigen kann.

Wo ein LLM weiterhin gewinnt: alles, was Generierung, Erklärung, mehrstufiges Reasoning, Arithmetik oder Arbeit mit langen Dokumenten erfordert. In einem öffentlichen Test wurde ein textbasiertes Jev gebeten, 400 handgezeichnete Skizzen zu benennen, die in Koordinatenstrings umgewandelt worden waren; es schlug den Zufall deutlich, verlor gegen Claude Sonnet 5 und antwortete bei mehr als der Hälfte von ihnen mit „airplane".

Was man heute kaufen kann. Jev ist auf APIMaster nicht im Verkauf – es befindet sich im Onboarding, und diese Seite wird aktualisiert, sobald die Integration live ist. Die andere Hälfte dieses Vergleichs ist jetzt kaufbar: gpt-5.6-luna ab 0,022 $ Input / 0,134 $ Output pro 1 Mio. Tokens (3 Routen im Verkauf, etwa 89 % unter OpenAIs Listenpreis von 0,20 $ / 1,20 $), glm-5.3-flash ab 0,105 $ / 0,35 $ (3 Routen, etwa 30 % unter Zhipus Listenpreis) und deepseek-flash ab 0,15 $ / 0,60 $ (1 Route, zu DeepSeeks eigenem Off-Peak-Tarif). Für die Eskalationshälfte des unten beschriebenen Musters beginnt gpt-5.6-sol bei 0,297 $ / 1,781 $ über 19 Routen. Ein OpenAI-kompatibler Schlüssel deckt alle ab – siehe die Luna-Karte und den Modell-Marktplatz. Routenpreise folgen dem Kanalangebot; die Live-Karte ist die Zahl, die zählt. Geprüft am 20. September 2026.

GPT-Testguthaben(GPT-6 Astra, GPT-5.6, GPT-5.5 und GPT Image 2 verfügbar)

Registrieren und $20 GPT-Testguthaben sichern

Jetzt sichern

Es ist keine Frage von „besser oder schlechter"

Jev und ein LLM beantworten unterschiedliche Fragen. Jev beantwortet welches, wie viel oder wie wahrscheinlich; ein LLM beantwortet was geschrieben werden sollte.

Jev Ein generatives LLM
Ausgabe Typisierte Antworten mit einer Wahrscheinlichkeit pro Option und einem Konfidenzwert Text, optional auf ein JSON-Schema beschränkt
Kostenbasis Nur Input-Tokens; Output ist kostenlos Input- plus Output-Tokens
Latenzform Ein Forward-Pass; Fragen fächern sich parallel über einen Zustand auf Sequenziell generierte Tokens; Reasoning-Modelle fügen einen langen verborgenen Durchlauf hinzu
Konfidenz Eine kalibrierte Zahl, die man schwellenwertsetzen kann Meist keine, oder ein selbst berichteter Satz
Schema Passt konstruktionsbedingt Passt, bis das Modell entscheidet, dass es nicht passt
Bekannte Eingabe Nur Text und strukturierter Zustand, keine Bilder Text, und Bilder bei multimodalen Modellen
Schlägt es bei Engen, hochvolumigen Beurteilungen Generierung, Reasoning, Erklärung, Arithmetik

In dem Moment, in dem man keinen Text mehr als Ausgabe benötigt, ändert sich die Rechnung. Eine klassifikatorförmige Aufgabe, die zwanzig Tokens Prosa pro Element erzeugt, bezahlt diese Tokens für jedes einzelne Element, für immer.

Die Genauigkeitsfrage, mit echten Zahlen

Marketing-Vergleiche stellen üblicherweise den Lieblings-Benchmark des einen Anbieters dem schlechtesten des anderen gegenüber. Der nützliche veröffentlichte Test, den wir gefunden haben, ist Emil Lindfors' Early-Access-Bericht An early-access test of TypeSafe's Jev, durchgeführt an 24 Antworten auf Norwegens Anhörung von 2022 zur Ressourcenrentensteuer für die Lachszucht.

Er labelte zuerst alles mit Claude Fable 5.1 in zwei unabhängigen Durchläufen und verglich dann Jev 1.13 mit DeepSeek V4.1 Flash über OpenRouter – dieselben Fragen in einem Prompt, JSON als Ausgabe, einmal mit aktiviertem Reasoning und einmal ohne.

Aufgabe Jev 1.13 DeepSeek, Reasoning aus DeepSeek, Reasoning an
Haltung, 4 Optionen 20 von 24 20 von 24 22 von 24
Respondententyp, 6 Optionen 21 von 23 22 von 23 23 von 23
Argumente, 192 Ja/Nein 0,86 0,89 0,88
Substanz, exakte Stufe 19 von 24 14 von 24 14 von 24

Zwei Dinge lohnt es sich, aus dieser Tabelle herauszulesen. Erstens ist der Autor ausdrücklich der Ansicht, dass dies Übereinstimmung mit den Labels eines Frontier-Modells ist, nicht Korrektheit – wo die Referenz falsch und Jev richtig liegt, wird Jev als falsch gewertet. Bei 24 Dokumenten beträgt das 95%-Intervall bei einer Haltungszahl etwa ±15 Punkte, sodass die drei Spalten bei Haltung und Argumenten gleich sind. Zweitens liegt der eine klare Sieg auf der geordneten Score-Skala, 19 gegen 14: Das ist das Primitiv, das genau das tut, wofür es gebaut wurde, und es ist die Art von Ergebnis, die man aus einer Textantwort überhaupt nicht erhalten würde.

Wer auf dieser Evidenz behauptet, ein Entscheidungsmodell sei kategorisch genauer als ein LLM, überinterpretiert eine Stichprobe von 24 Dokumenten. Die interessante Behauptung ist die engere.

Die Kostenfrage

Derselbe Test bepreiste die Arbeit pro 1.000 Dokumente:

Jev 1.13 DeepSeek, Reasoning aus DeepSeek, Reasoning an
Kosten pro 1.000 Dokumente 0,22 $ 1,31 $ 3,08 $
Median-Latenz 0,32 s 2,7 s 26 s
Langsamste Anfrage 1,3 s 17,9 s 250 s

Etwa ein Sechstel und ein Vierzehntel der beiden LLM-Konfigurationen, bei etwa einem Achtel und einem Achtzigstel der Median-Latenz. Die eigene Zusammenfassung des Autors zur Ursache: Das Weglassen der Textgenerierung ist der Grund, warum der Preis so stark fällt, und die Reasoning-Tokens erkauften zwei zusätzliche Haltungs-Labels von 24 für die zehnfache Latenz.

Das ist eine Arbeitslast, eine Sprache, ein Tag. Ihre Zahlen werden abweichen – allein die Tokenizer-Effizienz verschiebt sie. Derselbe Bericht maß Jevs Tokenizer bei etwa 2,06 Zeichen pro Token auf Norwegisch, gegenüber den ~4 Zeichen pro Token, die man aus dem Englischen annehmen würde, was das nutzbare Zustandsbudget von etwa 120.000 Zeichen auf etwa 64.000 reduziert.

Kalibrierung ist der eigentliche Unterschied

Das ist der Teil, der entscheidet, ob man automatisieren kann. Ein Modell, das in 86 % der Fälle recht hat und weiß, bei welchen 14 % es falsch liegt, ist ein anderes Werkzeug als ein Modell, das in 88 % der Fälle recht hat und bei allem gleich sicher klingt.

Aus demselben Durchlauf, bei 192 Argumentbewertungen:

Von Jev angegebene Wahrscheinlichkeit Bewertungen Referenz stimmte zu
0,0 – 0,1 14 0 %
0,1 – 0,3 56 4 %
0,3 – 0,7 41 34 %
0,7 – 0,9 38 97 %
0,9 – 1,0 43 98 %

Die Richtung stimmt bei jedem Schritt, und das Modell ist an beiden Enden leicht unterkonfident – TypeSafe's eigenes Ziel ist, dass Ergebnisse, denen 0,8 zugewiesen wird, in etwa 80 % der Fälle eintreten sollten, und der mittlere Bin kam auf 34 % statt auf ~50 %.

Die praktische Version dieser Tabelle ist ein Schwellenwert. Teilt man die Auswahlfragen an der höchsten Wahrscheinlichkeit auf:

Höchste Wahrscheinlichkeit ≥ 0,9 Unter 0,9
Haltung 14 von 15 stimmen zu 6 von 9 stimmen zu
Respondententyp 20 von 20 stimmen zu 1 von 3 stimmen zu

Das ist das Betriebsmuster: die konfidente Mehrheit akzeptieren, den Rest eskalieren. TypeSafe's eigenes SEC-Filings-Cookbook berichtet 27 von 30 korrekt bei 0,9 oder höher auf Englisch; der norwegische Durchlauf erreichte 14 von 15.

Der Vergleich läuft nur in eine Richtung. Mit aktiviertem Reasoning setzte DeepSeek 84 seiner 192 Argumentantworten über 0,9 – und im Fenster 0,7–0,9 stimmten seine Labels in 48 % der Fälle mit der Referenz überein. Ein Modell, dessen Konfidenz nicht kalibriert ist, kann nicht als Gate verwendet werden, egal wie gut seine Antworten sind.

Wo ein LLM weiterhin die richtige Wahl ist

  • Generierung. Jev wird nicht die Zusammenfassung, die Antwort oder die Commit-Nachricht schreiben. TypeSafe's eigene Dokumentation verweist die Generierung an ein generatives Modell.
  • Reasoning und Multi-Hop-Fragen. TypeSafe listet Indirektion als bekannte Schwäche: Fragen mit doppelten Verneinungen oder mehreren Sprüngen kosten Genauigkeit.
  • Arithmetik, Daten und Zählen. Als unzuverlässig dokumentiert, und der Fehler wächst mit der Größe des Gezählten. Halten Sie das im Code.
  • Bilder und Audio. Jev ist textbasiert. In TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway wandelte Bartosz Mikulski 400 Skizzen in SVG-Koordinatenstrings um und bat Jev, sie zu benennen. Es schlug eine Zehn-Wege-Zufallsbasislinie deutlich, verlor gegen Claude Sonnet 5 und antwortete bei mehr als der Hälfte der Zeichnungen mit „airplane". Derselbe Inhalt als Base64 kodiert landete beim Zufall – eine nützliche Erinnerung daran, dass ein Textmodell, das Zahlen liest, sie als Text liest.
  • Alles, was eine Erklärung erfordert. „Warum hast du dieses so gelabelt" ist keine Frage, die eine Wahrscheinlichkeit beantwortet.

Der Gründer von TypeSafe vertritt ein verwandtes Argument auf der LLM-Seite, das es wert ist, gekannt zu werden, da es gegen einen verbreiteten Workaround spricht: Im Launch-Thread argumentierte er, dass constrained decoding, wie es OpenAI-artige strukturierte Ausgaben verwenden, Modelle dümmer macht, weil das Maskieren ungültiger Tokens nicht dasselbe ist wie ein Modell, das über sie nicht verwirrt ist. Betrachten Sie das als Position eines Anbieters und nicht als gesichertes Ergebnis – aber es bedeutet, dass „einfach JSON aus einem günstigen Modell erzwingen" nicht automatisch gleichwertig mit einer typisierten Antwort ist.

Das Muster, das funktioniert

Die nützlichste Schlussfolgerung im norwegischen Bericht ist, dass die Wahl kein Entweder-oder ist. Das eigene Projekt des Autors verwendete drei Modelle für drei Aufgaben:

Aufgabe Modell Warum
48 sorgfältige Referenzlabels Fable 5.1 Wenige Dokumente, Ermessensentscheidungen, Kosten spielen keine Rolle
Jedes Dokument, jede Frage Jev Kostengünstig, schnell und sagt, wenn es unsicher ist
Eine zweite Meinung zum unsicheren Drittel DeepSeek oder eine Person Langsamer und teurer, also nur wo nötig

Man kann diese Form heute mit einem einzigen OpenAI-kompatiblen Schlüssel betreiben, indem man eine kostengünstige Stufe als ersten Durchlauf verwendet und eine stärkere nur für die Fälle, die der erste Durchlauf nicht klären kann:

  1. Erster Durchlauf auf der günstigsten Stufe, die Ihre Messlatte überschreitet. gpt-5.6-luna bei 0,022 $ / 0,134 $ pro 1 Mio., oder glm-5.3-flash bei 0,105 $ / 0,35 $, oder deepseek-flash bei 0,15 $ / 0,60 $.
  2. Erzwingen Sie die Entscheidung in eine geschlossene Menge im Prompt und fordern Sie daneben einen Konfidenzwert an. Behandeln Sie den Wert als Hinweis, nicht als kalibrierte Wahrscheinlichkeit – das ist die Lücke, die ein Entscheidungsmodell füllt und Prompt-Engineering nicht.
  3. Eskalieren Sie nur, was unter Ihren Schwellenwert fällt. gpt-5.6-sol ab 0,297 $ / 1,781 $ über 19 Routen, oder gemini-3.8-flash ab 0,20 $ / 1,00 $ über 7.
  4. Halten Sie Arithmetik, Daten und Zählen in Ihrem eigenen Code, für beide Stufen. Es ist günstiger und es ist korrekt.
  5. Messen Sie Ihre eigene Übereinstimmungsrate, bevor Sie skalieren. Fünfzig handgelabelte Elemente sagen Ihnen mehr als jede Benchmark-Tabelle, einschließlich dieser.

Die Ökonomie dieses Musters ist der Grund, warum Routing als Kategorie überhaupt existiert: Der erste Durchlauf ist dort, wohin fast das gesamte Volumen geht, und die Eskalationsstufe ist dort, woher fast die gesamte Qualität kommt. Die zweite braucht man nur für die Minderheit, die man nicht klassifizieren kann.

Erstellen Sie ein APIMaster-Konto, fügen Sie Pay-as-you-go-Guthaben ab 1 $ hinzu, erstellen Sie einen Schlüssel in der Konsole und richten Sie einen OpenAI-kompatiblen Client auf https://apimaster.ai/v1 mit einer der oben genannten Modell-IDs. Ein Schlüssel deckt die Familien GPT, GLM, DeepSeek, Gemini und Claude ab, sodass der Eskalationspfad auf derselben Integration bleibt. Validieren Sie eine Route mit dem Modell-Tester, bevor Sie Produktionsverkehr verlagern.

FAQ

Ist Jev ein Sprachmodell? Nein. TypeSafe beschreibt es als strukturiertes Datenmodell, und die eigene Formulierung des Gründers im Launch-Thread lautet, dass es „technisch kein Sprachmodell ist (es generiert keine Sprache)". Es liest Text und liefert Entscheidungen.

Ist Jev genauer als ein LLM? Auf der veröffentlichten Evidenz nicht messbar. In einem norwegischen Test mit 24 Dokumenten stimmten Jev und DeepSeek V4.1 Flash bei Haltungs- und Argumentfragen mit derselben Rate mit den Referenzlabels überein. Bei einer Aufgabe mit geordneter Skala lag Jev klar vorn.

Ist Jev günstiger als ein LLM? Ja, pro Aufgabe – nicht pro Input-Token. Jevs 0,042 $ pro 1 Mio. Input-Tokens werden von gpt-5.6-luna bei 0,022 $ beim Input unterboten, aber Jev gibt überhaupt keine Output-Tokens aus, und generative Modelle werden für Output abgerechnet. In der veröffentlichten Arbeitslast ergab das 0,22 $ pro 1.000 Dokumente gegenüber 1,31 $ und 3,08 $.

Was ist „LLM as a judge" und wie unterscheidet es sich? LLM-as-a-judge bedeutet, ein generatives Modell zu bitten, etwas zu bewerten oder zu labeln, und die Antwort aus seinem Text herauszulesen. Es funktioniert, aber man bezahlt für den Text, man wartet auf die Tokens, und die zurückgegebene Konfidenz ist keine kalibrierte Wahrscheinlichkeit. Ein Entscheidungsmodell liefert dasselbe Urteil als typisierte Antwort, die man schwellenwertsetzen kann.

Kann ich stattdessen einfach JSON-Ausgabe aus einem günstigen Modell erzwingen? Das liefert Ihnen das Schema, nicht die Kalibrierung. Constrained decoding macht die Ausgabe parsebar; es sagt Ihnen nicht, welchen Antworten man misstrauen sollte, und TypeSafe argumentiert, dass es die Qualität beeinträchtigen kann, indem es Tokens maskiert, bei denen das Modell tatsächlich unsicher war.

Welches sollte ich für die Klassifikation verwenden? Wenn Sie wenige Beurteilungen treffen, bei denen Genauigkeit alles ist, und sie überprüfen können, ist ein gutes LLM in Ordnung. Wenn Sie viele Beurteilungen treffen und automatisieren müssen, verwenden Sie das, was ein nutzbares Konfidenzsignal liefert, und eskalieren Sie die unsicheren.

Verarbeitet Jev nicht-englischen Text? Ja, mit Einschränkungen. TypeSafe sagt, dass Englisch die beste Genauigkeit bietet und andere Sprachen einschließlich CJK verarbeitet werden, aber nicht gleich gut. Der obige norwegische Test stellte fest, dass es gescannte Ratsprotokolle korrekt las, und maß außerdem die Tokenizer-Effizienz bei etwa 2,06 Zeichen pro Token – es lohnt sich, das in Ihrer eigenen Sprache zu prüfen, bevor Sie um das Kontextlimit herum planen.

Kann Jev Bilder sehen? Nein. Es ist textbasiert. Ein Bild in Text umzuwandeln und Jev danach zu fragen, kann den Zufall schlagen, verliert aber deutlich gegen ein Modell, das tatsächlich sehen kann.

Ist Jev auf APIMaster verfügbar? Noch nicht im Verkauf – Jev befindet sich auf APIMaster im Onboarding, und diese Seite wird aktualisiert, sobald die Integration live ist. Die Modelle auf der anderen Seite dieses Vergleichs sind jetzt verfügbar.

Mit welchem kostengünstigen Modell sollte ich für einen ersten Durchlauf beginnen? gpt-5.6-luna ist die günstigste Stufe auf dem Marktplatz bei 0,022 $ / 0,134 $ pro 1 Mio. Tokens über 3 Routen – die niedrigste Input- und Output-Rate in der Tabelle dieses Artikels. glm-5.3-flash bei 0,105 $ / 0,35 $ und deepseek-flash bei 0,15 $ / 0,60 $ sind die nächsten Stufen nach oben. Messen Sie an Ihren eigenen Daten, bevor Sie Volumen festlegen.

Quellen und weiterführende Literatur

Testergebnisse von Drittanbietern werden so wiedergegeben, wie ihre Autoren sie veröffentlicht haben; keiner der Autoren wurde für seinen Bericht bezahlt oder hat diese Seite überprüft. APIMaster-Routenpreise wurden am 20. September 2026 ausgelesen. Jevs APIMaster-Onboarding läuft und diese Seite wird aktualisiert, sobald es voranschreitet.