APIMaster.ai
Back to Blog
APIMaster Blog

Jev vs LLMs: Dónde un modelo de decisión supera al prompting, y dónde no

Jev devuelve probabilidades tipadas; un LLM devuelve texto que hay que parsear. Pruebas de terceros sitúan el coste por 1.000 documentos en $0,22 frente a $1,31–$3,08, y la diferencia decisiva es la confianza, no la precisión.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

En cuanto a precisión, la respuesta honesta es que empatan. La comparación publicada más detallada que encontramos ejecutó ambos contra los mismos 24 documentos de consulta pública del gobierno noruego y encontró que Jev y DeepSeek V4.1 Flash coincidían con las etiquetas de referencia prácticamente a la misma tasa — 20 de 24 en postura, 0,86 frente a 0,89 en 192 juicios de argumentos sí/no, dentro del ruido de una muestra de 24 documentos. Lo que los separó no fue cuál acertaba. Fue si el modelo te dice cuándo no está seguro.

Tres diferencias deciden la elección en producción:

  • Estructura de costes. Jev cobra $42 por mil millones de tokens de entrada ($0,042 por 1M) y nada por la salida, porque no emite tokens. Un modelo generativo paga por ambos, y un modelo de razonamiento paga por mucho pensamiento: en esa misma prueba, DeepSeek escribió 47.000 tokens de razonamiento para rellenar 24 formularios.
  • Calibración. Cuando Jev decía una probabilidad de 0,8, la etiqueta de referencia coincidía aproximadamente el 80% de las veces. Cuando DeepSeek con razonamiento activado escribía 0,8, la referencia coincidía aproximadamente la mitad de las veces. Ese es todo el argumento a favor de un modelo de decisión: puedes fijar un umbral y confiar en él.
  • Contrato de salida. Jev devuelve respuestas tipadas — Choice, Score, Noul — con una probabilidad y un valor de confianza. Un LLM devuelve texto que parseas, y su confianza declarada es una frase, no un número sobre el que puedas ramificar.

Dónde sigue ganando un LLM: cualquier cosa que requiera generación, explicación, razonamiento de varios pasos, aritmética o trabajo con documentos largos. En una prueba pública, se pidió a un Jev solo-texto que nombrara 400 bocetos dibujados a mano que habían sido convertidos a cadenas de coordenadas; superó al azar por un amplio margen, perdió frente a Claude Sonnet 5, y respondió "avión" para más de la mitad de ellos.

Qué puedes comprar hoy. Jev no está a la venta en APIMaster — está en proceso de incorporación, y esta página se actualizará cuando la integración esté activa. La otra mitad de esta comparación sí es comprable ahora: gpt-5.6-luna desde $0,022 entrada / $0,134 salida por 1M tokens (3 rutas a la venta, aproximadamente 89% por debajo de los $0,20 / $1,20 de lista de OpenAI), glm-5.3-flash desde $0,105 / $0,35 (3 rutas, aproximadamente 30% por debajo de la lista de Zhipu), y deepseek-flash desde $0,15 / $0,60 (1 ruta, a la propia tarifa fuera de horas punta de DeepSeek). Para la mitad de escalado del patrón de abajo, gpt-5.6-sol empieza en $0,297 / $1,781 en 19 rutas. Una clave compatible con OpenAI cubre todos ellos — consulta la tarjeta de Luna y el mercado de modelos. Los precios de ruta siguen la oferta de canales; la tarjeta en vivo es el número que cuenta. Verificado el 20 de septiembre de 2026.

Prueba de GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 y GPT Image 2 disponibles)

Regístrate y recibe $20 de prueba de GPT

Reclamar ahora

No es una cuestión de "mejor o peor"

Jev y un LLM responden a preguntas diferentes. Jev responde cuál, cuánto o con qué probabilidad; un LLM responde qué debería escribirse.

Jev Un LLM generativo
Salida Respuestas tipadas con una probabilidad por opción y un valor de confianza Texto, opcionalmente restringido a un esquema JSON
Base de coste Solo tokens de entrada; la salida es gratuita Tokens de entrada más salida
Forma de latencia Una pasada hacia adelante; las preguntas se despliegan en paralelo sobre un estado Tokens generados secuencialmente; los modelos de razonamiento añaden una larga pasada oculta
Confianza Un número calibrado que puedes umbralizar Normalmente ninguna, o una frase autoinformada
Esquema Coincide por construcción Coincide hasta que el modelo decide que no
Entrada conocida Solo texto y estado estructurado, sin imágenes Texto, e imágenes para modelos multimodales
Le supera en Juicios estrechos y de alto volumen Generación, razonamiento, explicación, aritmética

En el momento en que dejas de necesitar texto de salida, la aritmética cambia. Una tarea con forma de clasificador que produce veinte tokens de prosa por elemento está pagando por esos tokens en cada elemento, para siempre.

La cuestión de la precisión, con números reales

Las comparaciones de marketing suelen enfrentar el benchmark favorito de cada proveedor contra el peor del otro. La prueba publicada útil que encontramos es el artículo de acceso anticipado de Emil Lindfors, An early-access test of TypeSafe's Jev, ejecutado sobre 24 respuestas a la consulta de Noruega de 2022 sobre el impuesto a la renta de recursos de la acuicultura del salmón.

Etiquetó todo con Claude Fable 5.1 en dos pasadas independientes primero, y luego comparó Jev 1.13 contra DeepSeek V4.1 Flash a través de OpenRouter — las mismas preguntas en un prompt, salida JSON, una vez con razonamiento activado y otra desactivado.

Tarea Jev 1.13 DeepSeek, razonamiento desactivado DeepSeek, razonamiento activado
Postura, 4 opciones 20 de 24 20 de 24 22 de 24
Tipo de encuestado, 6 opciones 21 de 23 22 de 23 23 de 23
Argumentos, 192 sí/no 0,86 0,89 0,88
Sustancia, nivel exacto 19 de 24 14 de 24 14 de 24

Hay dos cosas que merece la pena leer de esa tabla. Primero, el autor es explícito en que estas son coincidencias con las etiquetas de un modelo de frontera, no corrección — donde la referencia está equivocada y Jev tiene razón, Jev puntúa como incorrecto. Con 24 documentos, el intervalo del 95% sobre un número de postura es de aproximadamente ±15 puntos, así que las tres columnas son iguales en postura y argumentos. Segundo, la única victoria clara está en la escala ordenada Score, 19 frente a 14: esa es la primitiva haciendo exactamente aquello para lo que fue construida, y es el tipo de resultado que no obtendrías en absoluto de una respuesta de texto.

Cualquiera que afirme sobre esta evidencia que un modelo de decisión es categóricamente más preciso que un LLM está sobreinterpretando una muestra de 24 documentos. La afirmación interesante es la más estrecha.

La cuestión del coste

La misma prueba puso precio al trabajo por 1.000 documentos:

Jev 1.13 DeepSeek, razonamiento desactivado DeepSeek, razonamiento activado
Coste por 1.000 documentos $0,22 $1,31 $3,08
Latencia mediana 0,32 s 2,7 s 26 s
Petición más lenta 1,3 s 17,9 s 250 s

Aproximadamente un sexto y un catorceavo de las dos configuraciones de LLM, a aproximadamente un octavo y un ochentaavo de la latencia mediana. El propio resumen del autor sobre la causa: eliminar la generación de texto es la razón por la que el precio cae tanto, y los tokens de razonamiento compraron dos etiquetas de postura extra de 24 por diez veces la latencia.

Esos son una carga de trabajo, un idioma, un día. Tus números diferirán — solo la eficiencia del tokenizador ya los mueve. El mismo artículo midió el tokenizador de Jev en aproximadamente 2,06 caracteres por token en noruego, frente a los ~4 caracteres por token que asumirías del inglés, lo que reduce el presupuesto de estado utilizable de aproximadamente 120.000 caracteres a unos 64.000.

La calibración es la diferencia real

Esta es la parte que decide si puedes automatizar. Un modelo que acierta el 86% de las veces y sabe en qué 14% se equivoca es una herramienta distinta de un modelo que acierta el 88% de las veces y suena igual de seguro sobre todo.

De la misma ejecución, sobre 192 juicios de argumentos:

Probabilidad declarada por Jev Juicios La referencia coincidió
0,0 – 0,1 14 0%
0,1 – 0,3 56 4%
0,3 – 0,7 41 34%
0,7 – 0,9 38 97%
0,9 – 1,0 43 98%

La dirección es correcta en cada paso, y el modelo se queda ligeramente por debajo de la confianza en ambos extremos — el propio objetivo de TypeSafe es que los resultados asignados a 0,8 ocurran aproximadamente el 80% de las veces, y el intervalo central quedó en 34% en lugar de ~50%.

La versión práctica de esa tabla es un umbral. Dividiendo las preguntas de elección por la probabilidad superior:

Probabilidad superior ≥ 0,9 Por debajo de 0,9
Postura 14 de 15 coinciden 6 de 9 coinciden
Tipo de encuestado 20 de 20 coinciden 1 de 3 coinciden

Ese es el patrón operativo: acepta la mayoría confiada, escala el resto. El propio recetario de TypeSafe sobre informes SEC reporta 27 de 30 correctos en 0,9 o superior en inglés; la ejecución noruega obtuvo 14 de 15.

La comparación solo funciona en un sentido. Con el razonamiento activado, DeepSeek puso 84 de sus 192 respuestas de argumentos por encima de 0,9 — y en la ventana de 0,7–0,9 sus etiquetas coincidieron con la referencia el 48% de las veces. Un modelo cuya confianza no está calibrada no puede usarse como puerta, por buenas que sean sus respuestas.

Dónde un LLM sigue siendo la elección correcta

  • Generación. Jev no escribirá el resumen, la respuesta ni el mensaje de commit. La propia documentación de TypeSafe envía la generación a un modelo generativo.
  • Razonamiento y preguntas de varios saltos. TypeSafe enumera la indirección como una debilidad conocida: las preguntas con dobles negaciones o múltiples saltos cuestan precisión.
  • Aritmética, fechas y conteo. Documentado como poco fiable, y el error crece con el tamaño de lo que se cuenta. Mantenlo en código.
  • Imágenes y audio. Jev es solo texto. En TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski convirtió 400 bocetos en cadenas de coordenadas SVG y pidió a Jev que los nombrara. Superó claramente una línea base de azar de diez opciones, perdió frente a Claude Sonnet 5, y respondió "avión" para más de la mitad de los dibujos. El mismo contenido codificado como base64 cayó en el azar — un recordatorio útil de que un modelo de texto que lee números los está leyendo como texto.
  • Cualquier cosa que necesite una explicación. "Por qué etiquetaste este de esa manera" no es una pregunta que responda una probabilidad.

El fundador de TypeSafe plantea un argumento relacionado en el lado del LLM que merece conocerse, ya que va contra un truco común: en el hilo de lanzamiento argumentó que la decodificación restringida del tipo que usan las salidas estructuradas al estilo OpenAI hace a los modelos más tontos, porque enmascarar tokens inválidos no es lo mismo que el modelo no estar confundido sobre ellos. Trátalo como la posición de un proveedor y no como un resultado asentado — pero sí significa que "simplemente fuerza JSON de un modelo barato" no es automáticamente equivalente a una respuesta tipada.

El patrón que funciona

La conclusión más útil del artículo noruego es que la elección no es o lo uno o lo otro. El propio proyecto del autor usó tres modelos para tres trabajos:

Trabajo Modelo Por qué
48 etiquetas de referencia cuidadosas Fable 5.1 Pocos documentos, juicios de valor, el coste no importa
Cada documento, cada pregunta Jev Bajo coste, rápido, y dice cuándo no está seguro
Una segunda opinión sobre el tercio incierto DeepSeek o una persona Más lento y más caro, así que solo donde se necesita

Puedes ejecutar esa forma hoy con una sola clave compatible con OpenAI, usando un nivel de bajo coste como primera pasada y uno más fuerte solo para los casos que la primera pasada no puede resolver:

  1. Primera pasada en el nivel más barato que supere tu listón. gpt-5.6-luna a $0,022 / $0,134 por 1M, o glm-5.3-flash a $0,105 / $0,35, o deepseek-flash a $0,15 / $0,60.
  2. Fuerza la decisión a un conjunto cerrado en el prompt, y pide una puntuación de confianza junto a ella. Trata la puntuación como una pista, no como una probabilidad calibrada — esa es la brecha que llena un modelo de decisión y que la ingeniería de prompts no llena.
  3. Escala solo lo que caiga por debajo de tu umbral. gpt-5.6-sol desde $0,297 / $1,781 en 19 rutas, o gemini-3.8-flash desde $0,20 / $1,00 en 7.
  4. Mantén la aritmética, las fechas y el conteo en tu propio código, para ambos niveles. Es más barato y es correcto.
  5. Mide tu propia tasa de coincidencia antes de escalar. Cincuenta elementos etiquetados a mano te dirán más que cualquier tabla de benchmark, incluida esta.

La economía de ese patrón es la razón por la que el enrutamiento existe como categoría: la primera pasada es donde va casi todo el volumen, y el nivel de escalado es de donde viene casi toda la calidad. Solo necesitas el segundo para la minoría que no puedes clasificar.

Crea una cuenta de APIMaster, añade crédito de pago por uso desde $1, crea una clave en la consola, y apunta un cliente compatible con OpenAI a https://apimaster.ai/v1 con cualquiera de los IDs de modelo de arriba. Una clave cubre las familias GPT, GLM, DeepSeek, Gemini y Claude, así que la ruta de escalado permanece en la misma integración. Valida una ruta con el probador de modelos antes de mover tráfico de producción.

FAQ

¿Es Jev un modelo de lenguaje? No. TypeSafe lo describe como un modelo de datos estructurados, y las propias palabras del fundador en el hilo de lanzamiento son que "técnicamente no es un modelo de lenguaje (no genera lenguaje)". Lee texto y devuelve decisiones.

¿Es Jev más preciso que un LLM? No de forma medible, según la evidencia publicada. En una prueba noruega de 24 documentos, Jev y DeepSeek V4.1 Flash coincidieron con las etiquetas de referencia a la misma tasa en preguntas de postura y argumentos. Jev estuvo claramente por delante en una tarea de escala ordenada.

¿Es Jev más barato que un LLM? Sí, por tarea — no por token de entrada. Los $0,042 por 1M tokens de entrada de Jev se ven superados a la baja por gpt-5.6-luna a $0,022 en entrada, pero Jev no emite ningún token de salida, y los modelos generativos se facturan por la salida. En la carga de trabajo publicada, eso supuso $0,22 por 1.000 documentos frente a $1,31 y $3,08.

¿Qué es "LLM as a judge" y en qué se diferencia? LLM-as-a-judge significa pedir a un modelo generativo que puntúe o etiquete algo y leer la respuesta de su texto. Funciona, pero pagas por el texto, esperas por los tokens, y la confianza que recibes de vuelta no es una probabilidad calibrada. Un modelo de decisión devuelve el mismo juicio como una respuesta tipada que puedes umbralizar.

¿Puedo simplemente forzar la salida JSON de un modelo barato en su lugar? Te da el esquema, no la calibración. La decodificación restringida hace que la salida se parsee; no te dice en qué respuestas desconfiar, y TypeSafe argumenta que puede degradar la calidad al enmascarar tokens sobre los que el modelo estaba genuinamente inseguro.

¿Cuál debería usar para clasificación? Si haces unos pocos juicios donde la precisión lo es todo y puedes revisarlos, un buen LLM está bien. Si haces muchos juicios y necesitas automatizar, usa lo que devuelva una señal de confianza utilizable y escala los inciertos.

¿Maneja Jev texto en otros idiomas? Sí, con matices. TypeSafe dice que el inglés es donde la precisión es mejor y que otros idiomas, incluido el CJK, se manejan pero no igual de bien. La prueba noruega de arriba encontró que leía correctamente actas de consejos escaneadas, y también midió la eficiencia del tokenizador en aproximadamente 2,06 caracteres por token — merece la pena comprobarlo en tu propio idioma antes de planificar en torno al límite de contexto.

¿Puede Jev ver imágenes? No. Es solo texto. Convertir una imagen a texto y preguntar a Jev sobre ella puede superar al azar, pero pierde claramente frente a un modelo que puede ver de verdad.

¿Está Jev disponible en APIMaster? Todavía no a la venta — Jev está en proceso de incorporación en APIMaster, y esta página se actualizará una vez que la integración esté activa. Los modelos del otro lado de esta comparación están disponibles ahora.

¿Con qué modelo de bajo coste debería empezar para una primera pasada? gpt-5.6-luna es el nivel más barato del mercado a $0,022 / $0,134 por 1M tokens en 3 rutas — la tarifa de entrada y salida más baja en la tabla de este artículo. glm-5.3-flash a $0,105 / $0,35 y deepseek-flash a $0,15 / $0,60 son los siguientes escalones. Mide con tus propios datos antes de comprometer volumen.

Fuentes y lecturas adicionales

Los resultados de pruebas de terceros se reproducen tal como sus autores los publicaron; ninguno de los autores fue pagado por su artículo ni revisó esta página. Los precios de ruta de APIMaster se leyeron el 20 de septiembre de 2026. La incorporación de Jev en APIMaster está en curso y esta página se actualizará a medida que avance.