Jev vs LLM: dove un modello decisionale batte il prompting, e dove no
Jev restituisce probabilità tipizzate; un LLM restituisce testo che devi analizzare. Test di terze parti indicano un costo per 1.000 documenti di $0,22 contro $1,31–$3,08, e la differenza decisiva è la confidenza, non l'accuratezza.
Published 2026-09-20
Sull'accuratezza, la risposta onesta è che sono alla pari. Il confronto pubblicato più dettagliato che abbiamo trovato ha testato entrambi sugli stessi 24 documenti di consultazione del governo norvegese e ha rilevato che Jev e DeepSeek V4.1 Flash concordavano con le etichette di riferimento praticamente allo stesso tasso — 20 su 24 sulla posizione, 0,86 contro 0,89 su 192 giudizi sì/no sugli argomenti, all'interno del rumore di un campione di 24 documenti. Ciò che li separava non era quale dei due avesse ragione. Era se il modello ti dice quando è incerto.
Tre differenze decidono la scelta in produzione:
- Struttura dei costi. Jev costa $42 per miliardo di token in input ($0,042 per 1M) e nulla per l'output, perché non emette token. Un modello generativo paga per entrambi, e un modello di ragionamento paga molto per il pensiero: in quello stesso test, DeepSeek ha scritto 47.000 token di ragionamento per compilare 24 moduli.
- Calibrazione. Quando Jev indicava una probabilità di 0,8, l'etichetta di riferimento concordava circa l'80% delle volte. Quando DeepSeek con il ragionamento abilitato scriveva 0,8, il riferimento concordava circa la metà delle volte. Questo è l'intero argomento a favore di un modello decisionale: puoi impostare una soglia e fidarti.
- Contratto di output. Jev restituisce risposte tipizzate —
Choice,Score,Noul— con una probabilità e un valore di confidenza. Un LLM restituisce testo che devi analizzare, e la sua confidenza dichiarata è una frase, non un numero su cui puoi diramare.
Dove un LLM vince ancora: tutto ciò che richiede generazione, spiegazione, ragionamento multi-step, aritmetica o lavoro su documenti lunghi. In un test pubblico, a un Jev solo testuale è stato chiesto di nominare 400 schizzi disegnati a mano convertiti in stringhe di coordinate; ha battuto il caso con un ampio margine, ha perso contro Claude Sonnet 5 e ha risposto "airplane" per più della metà di essi.
Cosa puoi acquistare oggi. Jev non è in vendita su APIMaster — è in fase di onboarding, e questa pagina sarà aggiornata quando l'integrazione sarà attiva. L'altra metà di questo confronto è acquistabile ora: gpt-5.6-luna da $0,022 in / $0,134 out per 1M token (3 route in vendita, circa 89% sotto la lista OpenAI di $0,20 / $1,20), glm-5.3-flash da $0,105 / $0,35 (3 route, circa 30% di sconto sulla lista Zhipu) e deepseek-flash da $0,15 / $0,60 (1 route, alla tariffa off-peak di DeepSeek). Per la metà di escalation del pattern seguente, gpt-5.6-sol parte da $0,297 / $1,781 su 19 route. Una chiave compatibile con OpenAI copre tutte — vedi la scheda Luna e il marketplace dei modelli. I prezzi delle route seguono l'offerta dei canali; la scheda live è il numero che conta. Verificato il 20 settembre 2026.
Prova GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 e GPT Image 2 disponibili)
Registrati e ricevi $20 di prova GPT
Non è una questione di "meglio o peggio"
Jev e un LLM rispondono a domande diverse. Jev risponde a quale, quanto, o quanto è probabile; un LLM risponde a cosa dovrebbe essere scritto.
| Jev | Un LLM generativo | |
|---|---|---|
| Output | Risposte tipizzate con una probabilità per opzione e un valore di confidenza | Testo, opzionalmente vincolato a uno schema JSON |
| Base di costo | Solo token in input; l'output è gratuito | Token in input più output |
| Forma della latenza | Un forward pass; le domande si diramano in parallelo su uno stato | Token generati sequenzialmente; i modelli di ragionamento aggiungono un lungo passaggio nascosto |
| Confidenza | Un numero calibrato su cui puoi applicare una soglia | Di solito nessuna, o una frase auto-dichiarata |
| Schema | Corrisponde per costruzione | Corrisponde finché il modello decide che non corrisponde |
| Input noto | Solo testo e stato strutturato, nessuna immagine | Testo, e immagini per i modelli multimodali |
| Lo batte su | Giudizi ristretti ad alto volume | Generazione, ragionamento, spiegazione, aritmetica |
Nel momento in cui smetti di aver bisogno di testo in output, l'aritmetica cambia. Un compito a forma di classificatore che produce venti token di prosa per elemento paga per quei token su ogni singolo elemento, per sempre.
La questione dell'accuratezza, con numeri reali
I confronti di marketing di solito paragonano il benchmark preferito di ciascun fornitore contro il peggiore dell'altro. Il test pubblicato utile che abbiamo trovato è il resoconto di accesso anticipato di Emil Lindfors, An early-access test of TypeSafe's Jev, eseguito su 24 risposte alla consultazione norvegese del 2022 sulla tassa sulla rendita delle risorse nell'acquacoltura del salmone.
Ha etichettato tutto con Claude Fable 5.1 in due passaggi indipendenti prima, poi ha confrontato Jev 1.13 con DeepSeek V4.1 Flash tramite OpenRouter — stesse domande in un unico prompt, JSON in output, una volta con il ragionamento attivo e una con esso disattivato.
| Compito | Jev 1.13 | DeepSeek, ragionamento off | DeepSeek, ragionamento on |
|---|---|---|---|
| Posizione, 4 opzioni | 20 su 24 | 20 su 24 | 22 su 24 |
| Tipo di rispondente, 6 opzioni | 21 su 23 | 22 su 23 | 23 su 23 |
| Argomenti, 192 sì/no | 0,86 | 0,89 | 0,88 |
| Sostanza, livello esatto | 19 su 24 | 14 su 24 | 14 su 24 |
Due cose meritano di essere lette da quella tabella. Primo, l'autore è esplicito che queste sono concordanze con le etichette di un modello di frontiera, non correttezza — dove il riferimento è sbagliato e Jev ha ragione, Jev viene valutato come sbagliato. Con 24 documenti, l'intervallo al 95% su un numero di posizione è di circa ±15 punti, quindi le tre colonne sono uguali su posizione e argomenti. Secondo, l'unica vittoria chiara è sulla scala ordinata Score, 19 contro 14: è la primitiva che fa esattamente ciò per cui è stata costruita, ed è il tipo di risultato che non otterresti affatto da una risposta testuale.
Chiunque affermi su queste prove che un modello decisionale è categoricamente più accurato di un LLM sta sovrainterpretando un campione di 24 documenti. L'affermazione interessante è quella più ristretta.
La questione del costo
Lo stesso test ha prezzato il lavoro per 1.000 documenti:
| Jev 1.13 | DeepSeek, ragionamento off | DeepSeek, ragionamento on | |
|---|---|---|---|
| Costo per 1.000 documenti | $0,22 | $1,31 | $3,08 |
| Latenza mediana | 0,32 s | 2,7 s | 26 s |
| Richiesta più lenta | 1,3 s | 17,9 s | 250 s |
Circa un sesto e un quattordicesimo delle due configurazioni LLM, a circa un ottavo e un ottantesimo della latenza mediana. Il riassunto dell'autore stesso della causa: eliminare la generazione di testo è il motivo per cui il prezzo scende così tanto, e i token di ragionamento hanno comprato due etichette di posizione in più su 24 per dieci volte la latenza.
Questi sono un carico di lavoro, una lingua, un giorno. I tuoi numeri saranno diversi — la sola efficienza del tokenizer li sposta. Lo stesso resoconto ha misurato il tokenizer di Jev a circa 2,06 caratteri per token in norvegese, contro i ~4 caratteri per token che assumeresti dall'inglese, il che riduce il budget di stato utilizzabile da circa 120.000 caratteri a circa 64.000.
La calibrazione è la differenza reale
Questa è la parte che decide se puoi automatizzare. Un modello che ha ragione l'86% delle volte e sa su quale 14% sta sbagliando è uno strumento diverso da un modello che ha ragione l'88% delle volte e suona ugualmente sicuro su tutto.
Dalla stessa esecuzione, su 192 giudizi sugli argomenti:
| Probabilità dichiarata da Jev | Giudizi | Il riferimento ha concordato |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
La direzione è corretta a ogni passo, e il modello risulta leggermente sotto-confidente a entrambi gli estremi — l'obiettivo di TypeSafe stesso è che gli esiti assegnati a 0,8 dovrebbero verificarsi circa l'80% delle volte, e il bin centrale è risultato al 34% anziché a ~50%.
La versione pratica di quella tabella è una soglia. Suddividendo le domande a scelta sulla probabilità più alta:
| Probabilità più alta ≥ 0,9 | Sotto 0,9 | |
|---|---|---|
| Posizione | 14 su 15 concordano | 6 su 9 concordano |
| Tipo di rispondente | 20 su 20 concordano | 1 su 3 concordano |
Questo è il pattern operativo: accetta la maggioranza sicura, escala il resto. Il cookbook di TypeSafe stesso sui filing SEC riporta 27 su 30 corretti a 0,9 o superiore in inglese; l'esecuzione norvegese ha ottenuto 14 su 15.
Il confronto va in una sola direzione. Con il ragionamento abilitato, DeepSeek ha messo 84 delle sue 192 risposte sugli argomenti sopra 0,9 — e nella finestra 0,7–0,9 le sue etichette corrispondevano al riferimento il 48% delle volte. Un modello la cui confidenza non è calibrata non può essere usato come gate, non importa quanto siano buone le sue risposte.
Dove un LLM è ancora la scelta giusta
- Generazione. Jev non scriverà il riassunto, la risposta o il messaggio di commit. La documentazione di TypeSafe stessa indirizza la generazione a un modello generativo.
- Ragionamento e domande multi-hop. TypeSafe elenca l'indirezione come debolezza nota: le domande con doppie negazioni o più salti costano accuratezza.
- Aritmetica, date e conteggio. Documentati come inaffidabili, e l'errore cresce con la dimensione di ciò che viene contato. Tienili nel codice.
- Immagini e audio. Jev è solo testuale. In TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski ha convertito 400 schizzi in stringhe di coordinate SVG e ha chiesto a Jev di nominarli. Ha battuto chiaramente una baseline casuale a dieci vie, ha perso contro Claude Sonnet 5 e ha risposto "airplane" per più della metà dei disegni. Lo stesso contenuto codificato come base64 è finito sul caso — un utile promemoria che un modello testuale che legge numeri li sta leggendo come testo.
- Tutto ciò che richiede una spiegazione. "Perché hai etichettato questo in quel modo" non è una domanda a cui una probabilità risponde.
Il fondatore di TypeSafe fa un argomento correlato sul lato LLM che vale la pena conoscere, poiché va contro una soluzione comune: nel thread di lancio ha sostenuto che la decodifica vincolata del tipo usato dagli structured output in stile OpenAI rende i modelli più stupidi, perché mascherare i token non validi non è la stessa cosa del modello che non è confuso su di essi. Trattalo come la posizione di un fornitore piuttosto che come un risultato consolidato — ma significa che "forzare semplicemente il JSON da un modello economico" non è automaticamente equivalente a una risposta tipizzata.
Il pattern che funziona
La conclusione più utile nel resoconto norvegese è che la scelta non è aut aut. Il progetto dell'autore stesso ha usato tre modelli per tre compiti:
| Compito | Modello | Perché |
|---|---|---|
| 48 etichette di riferimento accurate | Fable 5.1 | Pochi documenti, giudizi, il costo non conta |
| Ogni documento, ogni domanda | Jev | Basso costo, veloce, e dice quando è incerto |
| Una seconda opinione sul terzo incerto | DeepSeek o una persona | Più lento e più caro, quindi solo dove serve |
Puoi eseguire quella forma oggi con una singola chiave compatibile con OpenAI, usando un tier a basso costo come primo passaggio e uno più forte solo per i casi che il primo passaggio non riesce a risolvere:
- Primo passaggio sul tier più economico che supera la tua soglia.
gpt-5.6-lunaa $0,022 / $0,134 per 1M, oppureglm-5.3-flasha $0,105 / $0,35, oppuredeepseek-flasha $0,15 / $0,60. - Forza la decisione in un insieme chiuso nel prompt, e chiedi anche un punteggio di confidenza. Tratta il punteggio come un indizio, non come una probabilità calibrata — questo è il divario che un modello decisionale colma e che l'ingegneria del prompt non colma.
- Escala solo ciò che cade sotto la tua soglia.
gpt-5.6-solda $0,297 / $1,781 su 19 route, oppuregemini-3.8-flashda $0,20 / $1,00 su 7. - Tieni aritmetica, date e conteggio nel tuo codice, per entrambi i tier. È più economico ed è corretto.
- Misura il tuo tasso di concordanza prima di scalare. Cinquanta elementi etichettati a mano ti diranno più di qualsiasi tabella di benchmark, inclusa questa.
L'economia di quel pattern è il motivo per cui il routing esiste come categoria: il primo passaggio è dove va quasi tutto il volume, e il tier di escalation è dove arriva quasi tutta la qualità. Ti serve il secondo solo per la minoranza che non riesci a classificare.
Crea un account APIMaster, aggiungi credito pay-as-you-go da $1, crea una chiave nella console e punta un client compatibile con OpenAI a https://apimaster.ai/v1 con uno qualsiasi degli ID modello sopra. Una chiave copre le famiglie GPT, GLM, DeepSeek, Gemini e Claude, così il percorso di escalation resta sulla stessa integrazione. Valida una route con il model tester prima di spostare il traffico di produzione.
FAQ
Jev è un modello linguistico? No. TypeSafe lo descrive come un modello di dati strutturati, e le parole del fondatore stesso nel thread di lancio sono che è "tecnicamente non un modello linguistico (non genera linguaggio)". Legge testo e restituisce decisioni.
Jev è più accurato di un LLM? Non in modo misurabile, sulle prove pubblicate. In un test norvegese su 24 documenti, Jev e DeepSeek V4.1 Flash concordavano con le etichette di riferimento allo stesso tasso su posizione e domande sugli argomenti. Jev era chiaramente avanti su un compito a scala ordinata.
Jev è più economico di un LLM?
Sì, per compito — non per token in input. I $0,042 per 1M token in input di Jev sono battuti da gpt-5.6-luna a $0,022 sull'input, ma Jev non emette alcun token in output, e i modelli generativi vengono fatturati per l'output. Nel carico di lavoro pubblicato, ciò equivaleva a $0,22 per 1.000 documenti contro $1,31 e $3,08.
Cos'è "LLM as a judge" e in cosa è diverso? LLM-as-a-judge significa chiedere a un modello generativo di valutare o etichettare qualcosa e leggere la risposta dal suo testo. Funziona, ma paghi per il testo, aspetti i token, e la confidenza che ottieni non è una probabilità calibrata. Un modello decisionale restituisce lo stesso giudizio come una risposta tipizzata su cui puoi applicare una soglia.
Posso semplicemente forzare l'output JSON da un modello economico invece? Ti dà lo schema, non la calibrazione. La decodifica vincolata fa sì che l'output venga analizzato; non ti dice a quali risposte non fidarti, e TypeSafe sostiene che può degradare la qualità mascherando token su cui il modello era genuinamente incerto.
Quale dovrei usare per la classificazione? Se fai pochi giudizi dove l'accuratezza è tutto e puoi rivederli, un buon LLM va bene. Se fai molti giudizi e devi automatizzare, usa qualunque cosa restituisca un segnale di confidenza utilizzabile ed escala quelli incerti.
Jev gestisce testo non inglese? Sì, con avvertenze. TypeSafe dice che l'inglese è dove l'accuratezza è migliore e che altre lingue, incluso il CJK, sono gestite ma non ugualmente bene. Il test norvegese sopra ha rilevato che leggeva correttamente verbali di consiglio scansionati, e ha anche misurato l'efficienza del tokenizer a circa 2,06 caratteri per token — vale la pena verificarlo sulla tua lingua prima di pianificare intorno al limite di contesto.
Jev può vedere le immagini? No. È solo testuale. Convertire un'immagine in testo e chiedere a Jev di essa può battere il caso, ma perde nettamente contro un modello che può effettivamente vedere.
Jev è disponibile su APIMaster? Non ancora in vendita — Jev è in onboarding su APIMaster, e questa pagina sarà aggiornata una volta che l'integrazione sarà attiva. I modelli dall'altra parte di questo confronto sono disponibili ora.
Con quale modello a basso costo dovrei iniziare per un primo passaggio?
gpt-5.6-luna è il tier più economico sul marketplace a $0,022 / $0,134 per 1M token su 3 route — la tariffa di input e output più bassa nella tabella di questo articolo. glm-5.3-flash a $0,105 / $0,35 e deepseek-flash a $0,15 / $0,60 sono i passi successivi. Misura sui tuoi dati prima di impegnare volume.
Fonti e ulteriori letture
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 documenti di consultazione norvegesi, Jev contro DeepSeek V4.1 Flash con e senza ragionamento, con concordanza per compito, bin di calibrazione, costo e latenza
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 schizzi come stringhe di coordinate, baseline casuale e il confronto con Sonnet 5
- TypeSafe — Models — ID modello, prezzo $42/Btok, limiti di velocità, budget di contesto e supporto linguistico
- TypeSafe — Jev 1.13 jaggedness — le note di ambito pubblicate su lettura letterale, aritmetica, date, indirezione e generazione
- TypeSafe — Introducing System One Models and Jev — la cifra end-to-end di 70–500ms e il confronto 40×–200×
- Thread di lancio su Hacker News — i commenti del fondatore su ciò che Jev non è, sulla decodifica vincolata e sul perché l'output è gratuito
I risultati dei test di terze parti sono riprodotti come i loro autori li hanno pubblicati; nessuno dei due autori è stato pagato per il suo resoconto né ha revisionato questa pagina. I prezzi delle route APIMaster sono stati letti il 20 settembre 2026. L'onboarding di Jev su APIMaster è in corso e questa pagina sarà aggiornata man mano che procede.
