Jev vs LLMs : là où un modèle de décision bat le prompt, et là où il ne le fait pas
Jev renvoie des probabilités typées ; un LLM renvoie du texte qu'il faut parser. Des tests tiers chiffrent le coût pour 1 000 documents à 0,22 $ contre 1,31–3,08 $, et la différence décisive est la confiance, pas la précision.
Published 2026-09-20
Sur la précision, la réponse honnête est qu'ils sont à égalité. La comparaison publiée la plus détaillée que nous ayons trouvée a confronté les deux à un même corpus de 24 documents de consultation du gouvernement norvégien et a constaté que Jev et DeepSeek V4.1 Flash s'accordaient avec les étiquettes de référence à un taux pratiquement identique — 20 sur 24 sur la position, 0,86 contre 0,89 sur 192 jugements d'arguments oui/non, dans la marge de bruit d'un échantillon de 24 documents. Ce qui les séparait n'était pas lequel avait raison. C'était si le modèle vous dit quand il n'est pas sûr.
Trois différences décident du choix en production :
- Structure de coût. Jev facture 42 $ par milliard de tokens d'entrée (0,042 $ par 1M) et rien pour la sortie, car il n'émet aucun token. Un modèle génératif paie les deux, et un modèle de raisonnement paie beaucoup de réflexion : dans ce même test, DeepSeek a écrit 47 000 tokens de raisonnement pour remplir 24 formulaires.
- Calibration. Quand Jev annonçait une probabilité de 0,8, l'étiquette de référence concordait environ 80 % du temps. Quand DeepSeek avec le raisonnement activé inscrivait 0,8, la référence concordait environ la moitié du temps. C'est tout l'argument en faveur d'un modèle de décision : vous pouvez fixer un seuil et lui faire confiance.
- Contrat de sortie. Jev renvoie des réponses typées —
Choice,Score,Noul— avec une probabilité et une valeur de confiance. Un LLM renvoie du texte que vous parsez, et sa confiance déclarée est une phrase, pas un nombre sur lequel brancher.
Là où un LLM gagne encore : tout ce qui nécessite de la génération, de l'explication, du raisonnement multi-étapes, de l'arithmétique ou du travail sur de longs documents. Dans un test public, un Jev texte seul a été chargé de nommer 400 croquis dessinés à la main convertis en chaînes de coordonnées ; il a largement battu le hasard, perdu contre Claude Sonnet 5, et répondu « avion » pour plus de la moitié d'entre eux.
Ce que vous pouvez acheter aujourd'hui. Jev n'est pas en vente sur APIMaster — il est en cours d'intégration, et cette page sera mise à jour lorsque l'intégration sera en ligne. L'autre moitié de cette comparaison est achetable dès maintenant : gpt-5.6-luna à partir de 0,022 $ en entrée / 0,134 $ en sortie par 1M de tokens (3 routes en vente, environ 89 % en dessous du tarif catalogue d'OpenAI à 0,20 $ / 1,20 $), glm-5.3-flash à partir de 0,105 $ / 0,35 $ (3 routes, environ 30 % de remise sur le tarif catalogue de Zhipu), et deepseek-flash à partir de 0,15 $ / 0,60 $ (1 route, au tarif heures creuses de DeepSeek lui-même). Pour la moitié « escalade » du schéma ci-dessous, gpt-5.6-sol démarre à 0,297 $ / 1,781 $ sur 19 routes. Une seule clé compatible OpenAI couvre tout cela — voir la fiche Luna et la place de marché des modèles. Les prix des routes suivent l'offre des canaux ; la fiche en direct est le chiffre qui compte. Vérifié le 20 septembre 2026.
Essai GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 et GPT Image 2 disponibles)
Inscrivez-vous et recevez $20 d’essai GPT
Ce n'est pas une question de « meilleur ou moins bon »
Jev et un LLM répondent à des questions différentes. Jev répond à lequel, combien, ou quelle probabilité ; un LLM répond à que faut-il écrire.
| Jev | Un LLM génératif | |
|---|---|---|
| Sortie | Réponses typées avec une probabilité par option et une valeur de confiance | Du texte, éventuellement contraint à un schéma JSON |
| Base de coût | Tokens d'entrée uniquement ; la sortie est gratuite | Tokens d'entrée plus de sortie |
| Profil de latence | Une passe avant ; les questions se déploient en parallèle sur un seul état | Tokens générés séquentiellement ; les modèles de raisonnement ajoutent une longue passe cachée |
| Confiance | Un nombre calibré que vous pouvez seuiller | Généralement aucune, ou une phrase auto-déclarée |
| Schéma | Correspond par construction | Correspond jusqu'à ce que le modèle décide que non |
| Entrée connue | Texte et état structuré uniquement, pas d'images | Texte, et images pour les modèles multimodaux |
| Meilleur que l'autre pour | Jugements étroits à fort volume | Génération, raisonnement, explication, arithmétique |
Dès que vous n'avez plus besoin de texte en sortie, l'arithmétique change. Une tâche en forme de classifieur qui produit vingt tokens de prose par élément paie pour ces tokens sur chaque élément, pour toujours.
La question de la précision, avec de vrais chiffres
Les comparaisons marketing opposent généralement le benchmark préféré de chaque fournisseur au pire de l'autre. Le test publié utile que nous avons trouvé est l'article d'accès anticipé d'Emil Lindfors, An early-access test of TypeSafe's Jev, mené sur 24 réponses à la consultation norvégienne de 2022 sur la taxe sur la rente des ressources de la salmoniculture.
Il a d'abord étiqueté le tout avec Claude Fable 5.1 en deux passes indépendantes, puis a comparé Jev 1.13 à DeepSeek V4.1 Flash via OpenRouter — mêmes questions dans un seul prompt, sortie JSON, une fois avec le raisonnement activé et une fois désactivé.
| Tâche | Jev 1.13 | DeepSeek, raisonnement désactivé | DeepSeek, raisonnement activé |
|---|---|---|---|
| Position, 4 options | 20 sur 24 | 20 sur 24 | 22 sur 24 |
| Type de répondant, 6 options | 21 sur 23 | 22 sur 23 | 23 sur 23 |
| Arguments, 192 oui/non | 0,86 | 0,89 | 0,88 |
| Substance, niveau exact | 19 sur 24 | 14 sur 24 | 14 sur 24 |
Deux choses méritent d'être lues dans ce tableau. Premièrement, l'auteur précise explicitement qu'il s'agit d'une concordance avec les étiquettes d'un modèle de pointe, pas d'une exactitude — là où la référence est fausse et Jev a raison, Jev est compté comme faux. Avec 24 documents, l'intervalle à 95 % sur un chiffre de position est d'environ ±15 points, donc les trois colonnes sont identiques sur la position et les arguments. Deuxièmement, la seule victoire claire porte sur l'échelle ordonnée Score, 19 contre 14 : c'est la primitive qui fait exactement ce pour quoi elle a été conçue, et c'est le genre de résultat que vous n'obtiendriez pas du tout avec une réponse textuelle.
Quiconque affirme sur cette base qu'un modèle de décision est catégoriquement plus précis qu'un LLM surinterprète un échantillon de 24 documents. L'affirmation intéressante est la plus étroite.
La question du coût
Le même test a chiffré le travail pour 1 000 documents :
| Jev 1.13 | DeepSeek, raisonnement désactivé | DeepSeek, raisonnement activé | |
|---|---|---|---|
| Coût pour 1 000 documents | 0,22 $ | 1,31 $ | 3,08 $ |
| Latence médiane | 0,32 s | 2,7 s | 26 s |
| Requête la plus lente | 1,3 s | 17,9 s | 250 s |
Environ un sixième et un quatorzième des deux configurations LLM, à environ un huitième et un quatre-vingtième de la latence médiane. Le résumé de la cause par l'auteur lui-même : abandonner la génération de texte est la raison pour laquelle le prix chute à ce point, et les tokens de raisonnement ont acheté deux étiquettes de position supplémentaires sur 24 pour dix fois la latence.
Ce sont une charge de travail, une langue, un jour. Vos chiffres différeront — l'efficacité du tokenizer à elle seule les déplace. Le même article a mesuré le tokenizer de Jev à environ 2,06 caractères par token en norvégien, contre les ~4 caractères par token que vous supposeriez pour l'anglais, ce qui réduit le budget d'état utilisable d'environ 120 000 caractères à environ 64 000.
La calibration est la vraie différence
C'est la partie qui décide si vous pouvez automatiser. Un modèle qui a raison 86 % du temps et sait sur quels 14 % il se trompe est un outil différent d'un modèle qui a raison 88 % du temps et semble également certain de tout.
D'après la même exécution, sur 192 jugements d'arguments :
| Probabilité déclarée par Jev | Jugements | La référence a concordé |
|---|---|---|
| 0,0 – 0,1 | 14 | 0 % |
| 0,1 – 0,3 | 56 | 4 % |
| 0,3 – 0,7 | 41 | 34 % |
| 0,7 – 0,9 | 38 | 97 % |
| 0,9 – 1,0 | 43 | 98 % |
La direction est correcte à chaque étape, et le modèle est légèrement sous-confiant aux deux extrémités — la cible de TypeSafe elle-même est que les résultats assignés à 0,8 se produisent environ 80 % du temps, et le compartiment médian est ressorti à 34 % plutôt qu'à ~50 %.
La version pratique de ce tableau est un seuil. En scindant les questions de choix sur la probabilité la plus élevée :
| Probabilité la plus élevée ≥ 0,9 | En dessous de 0,9 | |
|---|---|---|
| Position | 14 sur 15 concordent | 6 sur 9 concordent |
| Type de répondant | 20 sur 20 concordent | 1 sur 3 concordent |
C'est le schéma opérationnel : accepter la majorité confiante, escalader le reste. Le cookbook de TypeSafe sur les dépôts SEC rapporte 27 sur 30 corrects à 0,9 ou plus en anglais ; l'exécution norvégienne en a obtenu 14 sur 15.
La comparaison ne va que dans un sens. Avec le raisonnement activé, DeepSeek a placé 84 de ses 192 réponses d'arguments au-dessus de 0,9 — et dans la fenêtre 0,7–0,9, ses étiquettes correspondaient à la référence 48 % du temps. Un modèle dont la confiance n'est pas calibrée ne peut pas servir de filtre, quelle que soit la qualité de ses réponses.
Là où un LLM reste le bon choix
- La génération. Jev n'écrira pas le résumé, la réponse ou le message de commit. La documentation de TypeSafe elle-même renvoie la génération vers un modèle génératif.
- Le raisonnement et les questions multi-sauts. TypeSafe liste l'indirection comme une faiblesse connue : les questions avec des doubles négations ou plusieurs sauts coûtent en précision.
- L'arithmétique, les dates et le comptage. Documentés comme peu fiables, et l'erreur croît avec la taille de ce qui est compté. Gardez-les dans le code.
- Les images et l'audio. Jev est texte uniquement. Dans TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski a converti 400 croquis en chaînes de coordonnées SVG et a demandé à Jev de les nommer. Il a clairement battu une base de référence de hasard à dix classes, perdu contre Claude Sonnet 5, et répondu « avion » pour plus de la moitié des dessins. Le même contenu encodé en base64 est retombé au niveau du hasard — un rappel utile qu'un modèle texte qui lit des nombres les lit comme du texte.
- Tout ce qui nécessite une explication. « Pourquoi as-tu étiqueté celui-ci ainsi » n'est pas une question à laquelle une probabilité répond.
Le fondateur de TypeSafe avance un argument connexe du côté LLM qui mérite d'être connu, car il va à l'encontre d'un contournement courant : sur le fil de lancement, il a soutenu que le décodage contraint du type utilisé par les sorties structurées à la OpenAI rend les modèles plus bêtes, parce que masquer les tokens invalides n'est pas la même chose que le modèle n'étant pas confus à leur sujet. Considérez cela comme la position d'un fournisseur plutôt qu'un résultat établi — mais cela signifie que « forcer simplement du JSON en sortie d'un modèle bon marché » n'est pas automatiquement équivalent à une réponse typée.
Le schéma qui fonctionne
La conclusion la plus utile de l'article norvégien est que le choix n'est pas un ou l'autre. Le projet de l'auteur lui-même utilisait trois modèles pour trois tâches :
| Tâche | Modèle | Pourquoi |
|---|---|---|
| 48 étiquettes de référence soignées | Fable 5.1 | Peu de documents, jugements délicats, le coût n'importe pas |
| Chaque document, chaque question | Jev | Peu coûteux, rapide, et dit quand il n'est pas sûr |
| Un second avis sur le tiers incertain | DeepSeek ou une personne | Plus lent et plus cher, donc uniquement là où c'est nécessaire |
Vous pouvez exécuter ce schéma dès aujourd'hui avec une seule clé compatible OpenAI, en utilisant un palier bon marché comme première passe et un plus fort uniquement pour les cas que la première passe ne peut pas trancher :
- Première passe sur le palier le moins cher qui franchit votre seuil.
gpt-5.6-lunaà 0,022 $ / 0,134 $ par 1M, ouglm-5.3-flashà 0,105 $ / 0,35 $, oudeepseek-flashà 0,15 $ / 0,60 $. - Forcez la décision dans un ensemble fermé dans le prompt, et demandez un score de confiance en parallèle. Traitez le score comme un indice, pas comme une probabilité calibrée — c'est l'écart qu'un modèle de décision comble et que l'ingénierie de prompt ne comble pas.
- N'escaladez que ce qui passe sous votre seuil.
gpt-5.6-solà partir de 0,297 $ / 1,781 $ sur 19 routes, ougemini-3.8-flashà partir de 0,20 $ / 1,00 $ sur 7. - Gardez l'arithmétique, les dates et le comptage dans votre propre code, pour les deux paliers. C'est moins cher et c'est correct.
- Mesurez votre propre taux de concordance avant de passer à l'échelle. Cinquante éléments étiquetés à la main vous en diront plus que n'importe quel tableau de benchmark, y compris celui-ci.
L'économie de ce schéma est précisément pourquoi le routage existe en tant que catégorie : la première passe est là où va presque tout le volume, et le palier d'escalade est là d'où vient presque toute la qualité. Vous n'avez besoin du second que pour la minorité que vous ne pouvez pas classer.
Créez un compte APIMaster, ajoutez du crédit à l'usage à partir de 1 $, créez une clé dans la console, et pointez un client compatible OpenAI vers https://apimaster.ai/v1 avec n'importe lequel des identifiants de modèle ci-dessus. Une seule clé couvre les familles GPT, GLM, DeepSeek, Gemini et Claude, donc le chemin d'escalade reste sur la même intégration. Validez une route avec le testeur de modèles avant de déplacer le trafic de production.
FAQ
Jev est-il un modèle de langage ? Non. TypeSafe le décrit comme un modèle de données structurées, et les mots du fondateur lui-même sur le fil de lancement sont qu'il n'est « techniquement pas un modèle de langage (il ne génère pas de langage) ». Il lit du texte et renvoie des décisions.
Jev est-il plus précis qu'un LLM ? Pas de manière mesurable, d'après les preuves publiées. Dans un test norvégien sur 24 documents, Jev et DeepSeek V4.1 Flash concordaient avec les étiquettes de référence au même taux sur les questions de position et d'arguments. Jev était nettement en avance sur une tâche à échelle ordonnée.
Jev est-il moins cher qu'un LLM ?
Oui, par tâche — pas par token d'entrée. Les 0,042 $ par 1M de tokens d'entrée de Jev sont battus par gpt-5.6-luna à 0,022 $ en entrée, mais Jev n'émet aucun token de sortie, et les modèles génératifs sont facturés sur la sortie. Dans la charge de travail publiée, cela représentait 0,22 $ pour 1 000 documents contre 1,31 $ et 3,08 $.
Qu'est-ce que le « LLM as a judge » et en quoi est-ce différent ? Le LLM-as-a-judge consiste à demander à un modèle génératif d'évaluer ou d'étiqueter quelque chose et à lire la réponse dans son texte. Cela fonctionne, mais vous payez pour le texte, vous attendez les tokens, et la confiance que vous récupérez n'est pas une probabilité calibrée. Un modèle de décision renvoie le même jugement sous forme de réponse typée que vous pouvez seuiller.
Puis-je simplement forcer une sortie JSON d'un modèle bon marché à la place ? Cela vous donne le schéma, pas la calibration. Le décodage contraint rend la sortie parsable ; il ne vous dit pas quelles réponses méfier, et TypeSafe soutient qu'il peut dégrader la qualité en masquant des tokens sur lesquels le modèle était réellement incertain.
Lequel dois-je utiliser pour la classification ? Si vous prenez quelques décisions où la précision est primordiale et que vous pouvez les réviser, un bon LLM convient. Si vous prenez de nombreuses décisions et devez automatiser, utilisez ce qui renvoie un signal de confiance exploitable et escaladez les cas incertains.
Jev gère-t-il le texte non anglais ? Oui, avec des réserves. TypeSafe indique que l'anglais est là où la précision est la meilleure et que d'autres langues, y compris le CJK, sont gérées mais pas aussi bien. Le test norvégien ci-dessus a constaté qu'il lisait correctement des comptes rendus de conseil scannés, et a aussi mesuré l'efficacité du tokenizer à environ 2,06 caractères par token — à vérifier dans votre propre langue avant de planifier autour de la limite de contexte.
Jev peut-il voir les images ? Non. Il est texte uniquement. Convertir une image en texte et interroger Jev à son sujet peut battre le hasard, mais perd largement contre un modèle qui peut réellement voir.
Jev est-il disponible sur APIMaster ? Pas encore en vente — Jev est en cours d'intégration sur APIMaster, et cette page sera mise à jour une fois l'intégration en ligne. Les modèles de l'autre côté de cette comparaison sont disponibles dès maintenant.
Par quel modèle bon marché commencer pour une première passe ?
gpt-5.6-luna est le palier le moins cher de la place de marché à 0,022 $ / 0,134 $ par 1M de tokens sur 3 routes — le tarif d'entrée et de sortie le plus bas du tableau de cet article. glm-5.3-flash à 0,105 $ / 0,35 $ et deepseek-flash à 0,15 $ / 0,60 $ sont les échelons suivants. Mesurez sur vos propres données avant d'engager du volume.
Sources et lectures complémentaires
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 documents de consultation norvégiens, Jev contre DeepSeek V4.1 Flash avec et sans raisonnement, avec concordance par tâche, compartiments de calibration, coût et latence
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 croquis sous forme de chaînes de coordonnées, base de référence du hasard et la comparaison avec Sonnet 5
- TypeSafe — Models — identifiant de modèle, tarif de 42 $/Btok, limites de débit, budget de contexte et prise en charge des langues
- TypeSafe — Jev 1.13 jaggedness — les notes de périmètre publiées sur la lecture littérale, l'arithmétique, les dates, l'indirection et la génération
- TypeSafe — Introducing System One Models and Jev — le chiffre de 70–500 ms de bout en bout et la comparaison de 40×–200×
- Fil de lancement Hacker News — les commentaires du fondateur sur ce que Jev n'est pas, sur le décodage contraint et sur pourquoi la sortie est gratuite
Les résultats des tests tiers sont reproduits tels que leurs auteurs les ont publiés ; aucun des deux auteurs n'a été payé pour son article ni n'a relu cette page. Les prix des routes APIMaster ont été relevés le 20 septembre 2026. L'intégration de Jev sur APIMaster est en cours et cette page sera mise à jour au fur et à mesure de son avancement.
