Jev vs LLM's: waar een beslissingsmodel beter is dan prompten, en waar niet
Jev retourneert getypeerde waarschijnlijkheden; een LLM retourneert tekst die je moet parsen. Onafhankelijke tests zetten de kosten per 1.000 documenten op $0,22 tegen $1,31–$3,08, en het beslissende verschil is betrouwbaarheid, niet nauwkeurigheid.
Published 2026-09-20
Wat nauwkeurigheid betreft, is het eerlijke antwoord dat ze gelijk staan. De meest gedetailleerde gepubliceerde vergelijking die we vonden, testte beide tegen dezelfde 24 Noorse overheidsdocumenten uit een hoorzitting en ontdekte dat Jev en DeepSeek V4.1 Flash in vrijwel dezelfde mate overeenkwamen met de referentielabels — 20 van 24 op standpunt, 0,86 tegen 0,89 over 192 ja/nee-argumentbeoordelingen, binnen de ruis van een steekproef van 24 documenten. Wat hen scheidde, was niet welke gelijk had. Het was of het model je vertelt wanneer het onzeker is.
Drie verschillen bepalen de keuze in productie:
- Kostenstructuur. Jev rekent $42 per miljard inputtokens ($0,042 per 1M) en niets voor output, omdat het geen tokens uitvoert. Een generatief model betaalt voor beide, en een reasoning-model betaalt voor veel denkwerk: in diezelfde test schreef DeepSeek 47.000 tokens aan redenering om 24 formulieren in te vullen.
- Kalibratie. Wanneer Jev een waarschijnlijkheid van 0,8 aangaf, kwam het referentielabel ongeveer 80% van de tijd overeen. Wanneer DeepSeek met reasoning ingeschakeld 0,8 opschreef, kwam de referentie ongeveer de helft van de tijd overeen. Dat is het hele argument voor een beslissingsmodel: je kunt een drempel instellen en erop vertrouwen.
- Outputcontract. Jev retourneert getypeerde antwoorden —
Choice,Score,Noul— met een waarschijnlijkheid en een betrouwbaarheidswaarde. Een LLM retourneert tekst die je parst, en de opgegeven betrouwbaarheid is een zin, geen getal waarop je kunt vertakken.
Waar een LLM nog steeds wint: alles wat generatie, uitleg, meerstapsredenering, rekenwerk of werk met lange documenten vereist. In één openbare test werd een tekst-only Jev gevraagd om 400 met de hand getekende schetsen te benoemen die waren omgezet naar coördinaatstrings; het versloeg het toeval met een ruime marge, verloor van Claude Sonnet 5, en antwoordde "vliegtuig" voor meer dan de helft ervan.
Wat je vandaag kunt kopen. Jev is niet te koop op APIMaster — het is in onboarding, en deze pagina wordt bijgewerkt zodra de integratie live is. De andere helft van deze vergelijking is nu koopbaar: gpt-5.6-luna vanaf $0,022 in / $0,134 uit per 1M tokens (3 routes te koop, ongeveer 89% onder OpenAI's lijstprijs van $0,20 / $1,20), glm-5.3-flash vanaf $0,105 / $0,35 (3 routes, ongeveer 30% korting op Zhipu's lijstprijs), en deepseek-flash vanaf $0,15 / $0,60 (1 route, tegen DeepSeek's eigen dalurentarief). Voor de escalatiehelft van het patroon hieronder begint gpt-5.6-sol bij $0,297 / $1,781 over 19 routes. Eén OpenAI-compatibele sleutel dekt ze allemaal — zie de Luna-kaart en de modellenmarktplaats. Routeprijzen volgen het kanaalaanbod; de live kaart is het getal dat telt. Gecontroleerd op 20 september 2026.
GPT-proef(GPT-6 Astra, GPT-5.6, GPT-5.5 en GPT Image 2 beschikbaar)
Registreer en ontvang $20 GPT-tegoed
Het is geen "beter of slechter"-vraag
Jev en een LLM beantwoorden verschillende vragen. Jev antwoordt welke, hoeveel, of hoe waarschijnlijk; een LLM antwoordt wat er geschreven moet worden.
| Jev | Een generatieve LLM | |
|---|---|---|
| Output | Getypeerde antwoorden met een waarschijnlijkheid per optie en een betrouwbaarheidswaarde | Tekst, optioneel beperkt tot een JSON-schema |
| Kostenbasis | Alleen inputtokens; output is gratis | Input- plus outputtokens |
| Latentievorm | Eén forward pass; vragen waaieren parallel uit over één state | Sequentieel gegenereerde tokens; reasoning-modellen voegen een lange verborgen pass toe |
| Betrouwbaarheid | Een gekalibreerd getal dat je kunt drempelen | Meestal geen, of een zelfgerapporteerde zin |
| Schema | Komt overeen door constructie | Komt overeen tot het model besluit dat het niet zo is |
| Bekende input | Alleen tekst en gestructureerde state, geen afbeeldingen | Tekst, en afbeeldingen voor multimodale modellen |
| Verslaat het bij | Smalle, hoogvolume-oordelen | Generatie, redenering, uitleg, rekenwerk |
Op het moment dat je geen tekst meer als output nodig hebt, verandert het rekenwerk. Een classifier-vormige taak die twintig tokens proza per item produceert, betaalt voor die tokens bij elk afzonderlijk item, voor altijd.
De nauwkeurigheidsvraag, met echte cijfers
Marketingvergelijkingen vergelijken meestal de favoriete benchmark van elke leverancier met de slechtste van de ander. De bruikbare gepubliceerde test die we vonden is Emil Lindfors' early-access-artikel, An early-access test of TypeSafe's Jev, uitgevoerd op 24 reacties op Noorwegen's hoorzitting uit 2022 over de resource rent tax voor zalmkwekerijen.
Hij labelde eerst alles met Claude Fable 5.1 in twee onafhankelijke passes, en vergeleek daarna Jev 1.13 met DeepSeek V4.1 Flash via OpenRouter — dezelfde vragen in één prompt, JSON als output, één keer met reasoning aan en één keer uit.
| Taak | Jev 1.13 | DeepSeek, reasoning uit | DeepSeek, reasoning aan |
|---|---|---|---|
| Standpunt, 4 opties | 20 van 24 | 20 van 24 | 22 van 24 |
| Type respondent, 6 opties | 21 van 23 | 22 van 23 | 23 van 23 |
| Argumenten, 192 ja/nee | 0,86 | 0,89 | 0,88 |
| Substantie, exact niveau | 19 van 24 | 14 van 24 | 14 van 24 |
Twee dingen zijn het lezen waard uit die tabel. Ten eerste is de auteur expliciet dat dit overeenstemming met de labels van een frontier-model is, niet correctheid — waar de referentie fout is en Jev gelijk, scoort Jev als fout. Met 24 documenten is het 95%-interval op een standpuntgetal ongeveer ±15 punten, dus de drie kolommen zijn hetzelfde op standpunt en argumenten. Ten tweede is de enige duidelijke overwinning op de geordende Score-schaal, 19 tegen 14: dat is de primitieve die precies doet waarvoor hij is gebouwd, en het is het soort resultaat dat je helemaal niet zou krijgen uit een tekstantwoord.
Iedereen die op basis van dit bewijs beweert dat een beslissingsmodel categorisch nauwkeuriger is dan een LLM, leest een steekproef van 24 documenten te veel. De interessante bewering is de nauwere.
De kostenkwestie
Dezelfde test prijsde het werk per 1.000 documenten:
| Jev 1.13 | DeepSeek, reasoning uit | DeepSeek, reasoning aan | |
|---|---|---|---|
| Kosten per 1.000 documenten | $0,22 | $1,31 | $3,08 |
| Mediane latentie | 0,32 s | 2,7 s | 26 s |
| Traagste verzoek | 1,3 s | 17,9 s | 250 s |
Ruwweg een zesde en een veertiende van de twee LLM-configuraties, bij ruwweg een achtste en een tachtigste van de mediane latentie. De eigen samenvatting van de auteur over de oorzaak: het laten vallen van tekstgeneratie is waarom de prijs zo ver daalt, en de reasoning-tokens kochten twee extra standpuntlabels van de 24 voor tien keer de latentie.
Dat is één workload, één taal, één dag. Jouw cijfers zullen verschillen — alleen al de tokenizer-efficiëntie verandert ze. Hetzelfde artikel mat Jev's tokenizer op ongeveer 2,06 tekens per token in het Noors, tegen de ~4 tekens per token die je uit het Engels zou aannemen, wat het bruikbare state-budget terugbrengt van ruwweg 120.000 tekens naar ongeveer 64.000.
Kalibratie is het werkelijke verschil
Dit is het deel dat bepaalt of je kunt automatiseren. Een model dat 86% van de tijd gelijk heeft en weet op welke 14% het fout zit, is een ander gereedschap dan een model dat 88% van de tijd gelijk heeft en even zeker klinkt over alles.
Uit dezelfde run, op 192 argumentbeoordelingen:
| Jev's opgegeven waarschijnlijkheid | Beoordelingen | Referentie kwam overeen |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
De richting is bij elke stap juist, en het model is aan beide uiteinden licht onderconfident — TypeSafe's eigen doel is dat uitkomsten met 0,8 ongeveer 80% van de tijd zouden moeten voorkomen, en de middelste bin kwam uit op 34% in plaats van ~50%.
De praktische versie van die tabel is een drempel. De keuzevragen splitsen op de hoogste waarschijnlijkheid:
| Hoogste waarschijnlijkheid ≥ 0,9 | Onder 0,9 | |
|---|---|---|
| Standpunt | 14 van 15 komen overeen | 6 van 9 komen overeen |
| Type respondent | 20 van 20 komen overeen | 1 van 3 komen overeen |
Dat is het operationele patroon: accepteer de zelfverzekerde meerderheid, escaleer de rest. TypeSafe's eigen SEC-filings-cookbook rapporteert 27 van 30 correct bij 0,9 of hoger in het Engels; de Noorse run haalde 14 van 15.
De vergelijking werkt maar één kant op. Met reasoning ingeschakeld zette DeepSeek 84 van zijn 192 argumentantwoorden boven 0,9 — en in het venster 0,7–0,9 kwamen zijn labels 48% van de tijd overeen met de referentie. Een model waarvan de betrouwbaarheid niet gekalibreerd is, kan niet als poort worden gebruikt, hoe goed zijn antwoorden ook zijn.
Waar een LLM nog steeds de juiste keuze is
- Generatie. Jev schrijft de samenvatting, het antwoord of de commit-message niet. TypeSafe's eigen documentatie verwijst generatie naar een generatief model.
- Redenering en meerstapsvragen. TypeSafe noemt indirectheid als een bekende zwakte: vragen met dubbele ontkenningen of meerdere stappen kosten nauwkeurigheid.
- Rekenwerk, datums en tellen. Gedocumenteerd als onbetrouwbaar, en de fout groeit met de grootte van wat geteld wordt. Houd het in code.
- Afbeeldingen en audio. Jev is tekst-only. In TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway zette Bartosz Mikulski 400 schetsen om in SVG-coördinaatstrings en vroeg Jev ze te benoemen. Het versloeg een tienweg-toevalsbaseline duidelijk, verloor van Claude Sonnet 5, en antwoordde "vliegtuig" voor meer dan de helft van de tekeningen. Dezelfde inhoud gecodeerd als base64 belandde op toeval — een nuttige herinnering dat een tekstmodel dat getallen leest, ze als tekst leest.
- Alles wat een uitleg vereist. "Waarom heb je deze zo gelabeld" is geen vraag die een waarschijnlijkheid beantwoordt.
De oprichter van TypeSafe maakt een verwant argument aan de LLM-kant dat het kennen waard is, omdat het tegen een veelgebruikte workaround ingaat: in de launch-thread betoogde hij dat constrained decoding van het soort dat OpenAI-stijl structured outputs gebruiken modellen dommer maakt, omdat het maskeren van ongeldige tokens niet hetzelfde is als het model dat niet in de war is over hen. Behandel dat als een standpunt van een leverancier en niet als een beslecht resultaat — maar het betekent wel dat "forceer gewoon JSON uit een goedkoop model" niet automatisch gelijkwaardig is aan een getypeerd antwoord.
Het patroon dat werkt
De meest bruikbare conclusie in het Noorse artikel is dat de keuze niet of/of is. Het eigen project van de auteur gebruikte drie modellen voor drie taken:
| Taak | Model | Waarom |
|---|---|---|
| 48 zorgvuldige referentielabels | Fable 5.1 | Weinig documenten, beoordelingskwesties, kosten maken niet uit |
| Elk document, elke vraag | Jev | Goedkoop, snel, en zegt wanneer het onzeker is |
| Een second opinion op het onzekere derde deel | DeepSeek of een persoon | Langzamer en duurder, dus alleen waar nodig |
Je kunt die vorm vandaag draaien met één OpenAI-compatibele sleutel, met een goedkope tier als eerste pass en een sterkere alleen voor de gevallen die de eerste pass niet kan beslechten:
- Eerste pass op de goedkoopste tier die je lat haalt.
gpt-5.6-lunaop $0,022 / $0,134 per 1M, ofglm-5.3-flashop $0,105 / $0,35, ofdeepseek-flashop $0,15 / $0,60. - Forceer de beslissing in een gesloten set in de prompt, en vraag om een betrouwbaarheidsscore erbij. Behandel de score als een hint, niet als een gekalibreerde waarschijnlijkheid — dat is het gat dat een beslissingsmodel vult en prompt engineering niet.
- Escaleer alleen wat onder je drempel valt.
gpt-5.6-solvanaf $0,297 / $1,781 over 19 routes, ofgemini-3.8-flashvanaf $0,20 / $1,00 over 7. - Houd het rekenwerk, datums en tellen in je eigen code, voor beide tiers. Het is goedkoper en het is correct.
- Meet je eigen overeenstemmingspercentage voordat je opschaalt. Vijftig handmatig gelabelde items vertellen je meer dan welke benchmarktabel dan ook, inclusief deze.
De economie van dat patroon is waarom routing überhaupt als categorie bestaat: de eerste pass is waar bijna al het volume naartoe gaat, en de escalatietier is waar bijna alle kwaliteit vandaan komt. Je hebt de tweede alleen nodig voor de minderheid die je niet kunt classificeren.
Maak een APIMaster-account aan, voeg pay-as-you-go-tegoed toe vanaf $1, maak een sleutel aan in de console, en richt een OpenAI-compatibele client op https://apimaster.ai/v1 met een van de bovenstaande model-ID's. Eén sleutel dekt de GPT-, GLM-, DeepSeek-, Gemini- en Claude-families, dus het escalatiepad blijft op dezelfde integratie. Valideer een route met de model tester voordat je productieverkeer verplaatst.
FAQ
Is Jev een taalmodel? Nee. TypeSafe beschrijft het als een gestructureerd datamodel, en de eigen bewoording van de oprichter in de launch-thread is dat het "technisch gezien geen taalmodel is (het genereert geen taal)". Het leest tekst en retourneert beslissingen.
Is Jev nauwkeuriger dan een LLM? Niet meetbaar, op basis van het gepubliceerde bewijs. In een Noorse test met 24 documenten kwamen Jev en DeepSeek V4.1 Flash in dezelfde mate overeen met de referentielabels op standpunt- en argumentvragen. Jev lag duidelijk voor op één geordende-schaaltaak.
Is Jev goedkoper dan een LLM?
Ja, per taak — niet per inputtoken. Jev's $0,042 per 1M inputtokens wordt onderboden door gpt-5.6-luna op $0,022 op input, maar Jev voert helemaal geen outputtokens uit, en generatieve modellen worden gefactureerd voor output. In de gepubliceerde workload kwam dat neer op $0,22 per 1.000 documenten tegen $1,31 en $3,08.
Wat is "LLM as a judge" en hoe verschilt dat? LLM-as-a-judge betekent dat je een generatief model vraagt iets te beoordelen of te labelen en het antwoord uit zijn tekst leest. Het werkt, maar je betaalt voor de tekst, je wacht op de tokens, en de betrouwbaarheid die je terugkrijgt is geen gekalibreerde waarschijnlijkheid. Een beslissingsmodel retourneert hetzelfde oordeel als een getypeerd antwoord dat je kunt drempelen.
Kan ik gewoon JSON-output forceren uit een goedkoop model in plaats daarvan? Dat levert je het schema op, niet de kalibratie. Constrained decoding maakt de output parsebaar; het vertelt je niet welke antwoorden je moet wantrouwen, en TypeSafe betoogt dat het de kwaliteit kan verslechteren door tokens te maskeren waarover het model oprecht onzeker was.
Welke moet ik gebruiken voor classificatie? Als je een paar oordelen velt waar nauwkeurigheid alles is en je ze kunt beoordelen, is een goede LLM prima. Als je veel oordelen velt en moet automatiseren, gebruik dan wat een bruikbaar betrouwbaarheidssignaal retourneert en escaleer de onzekere.
Verwerkt Jev niet-Engelse tekst? Ja, met kanttekeningen. TypeSafe zegt dat Engels is waar de nauwkeurigheid het beste is en dat andere talen waaronder CJK worden verwerkt maar niet even goed. De Noorse test hierboven vond dat het gescande raadsnotulen correct las, en mat ook de tokenizer-efficiëntie op ongeveer 2,06 tekens per token — het waard om in je eigen taal te controleren voordat je rond de contextlimiet plant.
Kan Jev afbeeldingen zien? Nee. Het is tekst-only. Een afbeelding omzetten naar tekst en Jev erover vragen kan het toeval verslaan, maar het verliest zwaar van een model dat daadwerkelijk kan zien.
Is Jev beschikbaar op APIMaster? Nog niet te koop — Jev is in onboarding op APIMaster, en deze pagina wordt bijgewerkt zodra de integratie live is. De modellen aan de andere kant van deze vergelijking zijn nu beschikbaar.
Met welk goedkoop model moet ik beginnen voor een eerste pass?
gpt-5.6-luna is de goedkoopste tier op de marktplaats op $0,022 / $0,134 per 1M tokens over 3 routes — het laagste input- en outputtarief in de tabel van dit artikel. glm-5.3-flash op $0,105 / $0,35 en deepseek-flash op $0,15 / $0,60 zijn de volgende stappen omhoog. Meet op je eigen data voordat je volume vastlegt.
Bronnen en verder lezen
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 Noorse hoorzittingsdocumenten, Jev tegen DeepSeek V4.1 Flash met en zonder reasoning, met overeenstemming per taak, kalibratiebins, kosten en latentie
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 schetsen als coördinaatstrings, toevalsbaseline en de Sonnet 5-vergelijking
- TypeSafe — Models — model-ID, $42/Btok-prijzen, snelheidslimieten, contextbudget en taalondersteuning
- TypeSafe — Jev 1.13 jaggedness — de gepubliceerde scope-notities over letterlijk lezen, rekenwerk, datums, indirectheid en generatie
- TypeSafe — Introducing System One Models and Jev — het end-to-end cijfer van 70–500ms en de 40×–200×-vergelijking
- Hacker News launch-thread — de opmerkingen van de oprichter over wat Jev niet is, over constrained decoding en over waarom output gratis is
Resultaten van onafhankelijke tests zijn weergegeven zoals hun auteurs ze publiceerden; geen van beide auteurs werd betaald voor hun artikel of heeft deze pagina beoordeeld. APIMaster-routeprijzen zijn gelezen op 20 september 2026. Jev's APIMaster-onboarding is gaande en deze pagina wordt bijgewerkt naarmate die vordert.
