APIMaster.ai
Back to Blog
APIMaster Blog

Jev vs LLMs: Onde um Modelo de Decisão Supera Promptar, e Onde Não Supera

Jev retorna probabilidades tipadas; um LLM retorna texto que você precisa parsear. Testes de terceiros colocam o custo por 1.000 documentos em $0,22 contra $1,31–$3,08, e a diferença decisiva é a confiança, não a acurácia.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Em acurácia, a resposta honesta é que eles empatam. A comparação publicada mais detalhada que encontramos rodou ambos contra os mesmos 24 documentos de audiência pública do governo norueguês e descobriu que Jev e DeepSeek V4.1 Flash concordavam com os rótulos de referência praticamente na mesma taxa — 20 de 24 em posicionamento, 0,86 contra 0,89 em 192 julgamentos de argumento sim/não, dentro do ruído de uma amostra de 24 documentos. O que os separou não foi qual estava certo. Foi se o modelo te avisa quando está inseguro.

Três diferenças decidem a escolha em produção:

  • Estrutura de custo. Jev cobra $42 por bilhão de tokens de entrada ($0,042 por 1M) e nada pela saída, porque não emite tokens. Um modelo generativo paga por ambos, e um modelo de raciocínio paga por muito pensamento: nesse mesmo teste, o DeepSeek escreveu 47.000 tokens de raciocínio para preencher 24 formulários.
  • Calibração. Quando o Jev dizia uma probabilidade de 0,8, o rótulo de referência concordava cerca de 80% das vezes. Quando o DeepSeek com raciocínio habilitado escrevia 0,8, a referência concordava cerca de metade das vezes. Esse é todo o argumento a favor de um modelo de decisão: você pode definir um limiar e confiar nele.
  • Contrato de saída. Jev retorna respostas tipadas — Choice, Score, Noul — com uma probabilidade e um valor de confiança. Um LLM retorna texto que você parseia, e a confiança declarada é uma frase, não um número sobre o qual você pode ramificar.

Onde um LLM ainda ganha: qualquer coisa que precise de geração, explicação, raciocínio multi-etapas, aritmética ou trabalho com documentos longos. Em um teste público, um Jev somente texto foi solicitado a nomear 400 esboços feitos à mão que haviam sido convertidos em strings de coordenadas; ele superou o acaso por uma margem ampla, perdeu para o Claude Sonnet 5 e respondeu "avião" para mais da metade deles.

O que você pode comprar hoje. O Jev não está à venda na APIMaster — está em onboarding, e esta página será atualizada quando a integração estiver ativa. A outra metade desta comparação é comprável agora: gpt-5.6-luna a partir de $0,022 entrada / $0,134 saída por 1M tokens (3 rotas à venda, cerca de 89% abaixo da lista da OpenAI de $0,20 / $1,20), glm-5.3-flash a partir de $0,105 / $0,35 (3 rotas, cerca de 30% abaixo da lista da Zhipu) e deepseek-flash a partir de $0,15 / $0,60 (1 rota, na própria tarifa fora de pico da DeepSeek). Para a metade de escalonamento do padrão abaixo, gpt-5.6-sol começa em $0,297 / $1,781 em 19 rotas. Uma única chave compatível com OpenAI cobre todos eles — veja o card do Luna e o marketplace de modelos. Os preços das rotas seguem a oferta dos canais; o card ao vivo é o número que conta. Verificado em 20 de setembro de 2026.

Teste do GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 e GPT Image 2 disponíveis)

Cadastre-se e receba $20 de teste do GPT

Resgatar agora

Não é uma questão de "melhor ou pior"

Jev e um LLM estão respondendo a perguntas diferentes. Jev responde qual deles, quanto, ou quão provável; um LLM responde o que deve ser escrito.

Jev Um LLM generativo
Saída Respostas tipadas com uma probabilidade por opção e um valor de confiança Texto, opcionalmente restrito a um schema JSON
Base de custo Apenas tokens de entrada; saída é gratuita Tokens de entrada mais saída
Forma da latência Uma passagem direta; perguntas se ramificam em paralelo sobre um estado Tokens gerados sequencialmente; modelos de raciocínio adicionam uma longa passagem oculta
Confiança Um número calibrado que você pode usar como limiar Geralmente nenhuma, ou uma frase auto-declarada
Schema Corresponde por construção Corresponde até o modelo decidir que não corresponde
Entrada conhecida Apenas texto e estado estruturado, sem imagens Texto, e imagens para modelos multimodais
Supera no quê Julgamentos estreitos e de alto volume Geração, raciocínio, explicação, aritmética

No momento em que você deixa de precisar de texto na saída, a aritmética muda. Uma tarefa em formato de classificador que produz vinte tokens de prosa por item está pagando por esses tokens em cada item, para sempre.

A questão da acurácia, com números reais

Comparações de marketing geralmente comparam o benchmark favorito de cada fornecedor contra o pior do outro. O teste publicado útil que encontramos é o artigo de acesso antecipado de Emil Lindfors, An early-access test of TypeSafe's Jev, rodado em 24 respostas à audiência pública da Noruega de 2022 sobre o imposto sobre renda de recursos da salmonicultura.

Ele rotulou tudo com Claude Fable 5.1 em duas passagens independentes primeiro, depois comparou Jev 1.13 contra DeepSeek V4.1 Flash via OpenRouter — as mesmas perguntas em um prompt, JSON na saída, uma vez com raciocínio ativado e outra desativado.

Tarefa Jev 1.13 DeepSeek, raciocínio desativado DeepSeek, raciocínio ativado
Posicionamento, 4 opções 20 de 24 20 de 24 22 de 24
Tipo de respondente, 6 opções 21 de 23 22 de 23 23 de 23
Argumentos, 192 sim/não 0,86 0,89 0,88
Substância, nível exato 19 de 24 14 de 24 14 de 24

Duas coisas valem a pena ler nessa tabela. Primeiro, o autor é explícito que estas são concordâncias com os rótulos de um modelo de fronteira, não correção — onde a referência está errada e o Jev está certo, o Jev pontua como errado. Com 24 documentos, o intervalo de 95% em um número de posicionamento é de cerca de ±15 pontos, então as três colunas são iguais em posicionamento e argumentos. Segundo, a única vitória clara é na escala ordenada Score, 19 contra 14: essa é a primitiva fazendo exatamente o que foi construída para fazer, e é o tipo de resultado que você não obteria de uma resposta em texto.

Qualquer um que afirme, com base nessa evidência, que um modelo de decisão é categoricamente mais preciso que um LLM está superinterpretando uma amostra de 24 documentos. A afirmação interessante é a mais estreita.

A questão do custo

O mesmo teste precificou o trabalho por 1.000 documentos:

Jev 1.13 DeepSeek, raciocínio desativado DeepSeek, raciocínio ativado
Custo por 1.000 documentos $0,22 $1,31 $3,08
Latência mediana 0,32 s 2,7 s 26 s
Requisição mais lenta 1,3 s 17,9 s 250 s

Aproximadamente um sexto e um quatorze avos das duas configurações de LLM, a aproximadamente um oitavo e um octogésimo da latência mediana. O próprio resumo do autor sobre a causa: abandonar a geração de texto é o motivo pelo qual o preço cai tanto, e os tokens de raciocínio compraram dois rótulos de posicionamento extras de 24 por dez vezes a latência.

Esses são uma carga de trabalho, um idioma, um dia. Seus números serão diferentes — só a eficiência do tokenizador já os move. O mesmo artigo mediu o tokenizador do Jev em cerca de 2,06 caracteres por token em norueguês, contra os ~4 caracteres por token que você assumiria do inglês, o que reduz o orçamento de estado utilizável de aproximadamente 120.000 caracteres para cerca de 64.000.

A calibração é a diferença real

Esta é a parte que decide se você pode automatizar. Um modelo que está certo 86% das vezes e sabe em quais 14% está errado é uma ferramenta diferente de um modelo que está certo 88% das vezes e soa igualmente certo sobre tudo.

Da mesma execução, em 192 julgamentos de argumento:

Probabilidade declarada pelo Jev Julgamentos Referência concordou
0,0 – 0,1 14 0%
0,1 – 0,3 56 4%
0,3 – 0,7 41 34%
0,7 – 0,9 38 97%
0,9 – 1,0 43 98%

A direção está correta em cada passo, e o modelo fica ligeiramente subconfiante em ambas as extremidades — a própria meta da TypeSafe é que resultados atribuídos a 0,8 ocorram cerca de 80% das vezes, e a faixa do meio ficou em 34% em vez de ~50%.

A versão prática dessa tabela é um limiar. Dividindo as perguntas de escolha pela probabilidade mais alta:

Probabilidade mais alta ≥ 0,9 Abaixo de 0,9
Posicionamento 14 de 15 concordam 6 de 9 concordam
Tipo de respondente 20 de 20 concordam 1 de 3 concordam

Esse é o padrão operacional: aceite a maioria confiante, escale o resto. O próprio cookbook da TypeSafe sobre registros da SEC reporta 27 de 30 corretos em 0,9 ou acima em inglês; a execução em norueguês obteve 14 de 15.

A comparação corre em apenas uma direção. Com raciocínio ativado, o DeepSeek colocou 84 de suas 192 respostas de argumento acima de 0,9 — e na janela de 0,7–0,9 seus rótulos corresponderam à referência 48% das vezes. Um modelo cuja confiança não é calibrada não pode ser usado como gate, não importa quão boas sejam suas respostas.

Onde um LLM ainda é a escolha certa

  • Geração. O Jev não vai escrever o resumo, a resposta ou a mensagem de commit. A própria documentação da TypeSafe direciona a geração para um modelo generativo.
  • Raciocínio e perguntas multi-salto. A TypeSafe lista a indireção como uma fraqueza conhecida: perguntas com negativas duplas ou múltiplos saltos custam acurácia.
  • Aritmética, datas e contagem. Documentado como não confiável, e o erro cresce com o tamanho da coisa sendo contada. Mantenha isso no código.
  • Imagens e áudio. O Jev é somente texto. Em TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski converteu 400 esboços em strings de coordenadas SVG e pediu ao Jev para nomeá-los. Ele superou claramente uma linha de base de acaso de dez vias, perdeu para o Claude Sonnet 5 e respondeu "avião" para mais da metade dos desenhos. O mesmo conteúdo codificado como base64 caiu no acaso — um lembrete útil de que um modelo de texto lendo números os está lendo como texto.
  • Qualquer coisa que precise de uma explicação. "Por que você rotulou este assim" não é uma pergunta que uma probabilidade responde.

O fundador da TypeSafe faz um argumento relacionado do lado dos LLMs que vale a pena conhecer, já que vai contra um contorno comum: na thread de lançamento, ele argumentou que a decodificação restrita do tipo que as saídas estruturadas no estilo OpenAI usam torna os modelos mais burros, porque mascarar tokens inválidos não é o mesmo que o modelo não estar confuso sobre eles. Trate isso como a posição de um fornecedor, e não como um resultado estabelecido — mas isso significa que "apenas forçar JSON de um modelo barato" não é automaticamente equivalente a uma resposta tipada.

O padrão que funciona

A conclusão mais útil no artigo norueguês é que a escolha não é ou/ou. O próprio projeto do autor usou três modelos para três trabalhos:

Trabalho Modelo Por quê
48 rótulos de referência cuidadosos Fable 5.1 Poucos documentos, decisões de julgamento, custo não importa
Cada documento, cada pergunta Jev Baixo custo, rápido, e avisa quando está inseguro
Uma segunda opinião sobre o terço incerto DeepSeek ou uma pessoa Mais lento e mais caro, então apenas onde é necessário

Você pode executar esse formato hoje com uma única chave compatível com OpenAI, usando um nível de baixo custo como primeira passagem e um mais forte apenas para os casos que a primeira passagem não consegue resolver:

  1. Primeira passagem no nível mais barato que atende seu critério. gpt-5.6-luna a $0,022 / $0,134 por 1M, ou glm-5.3-flash a $0,105 / $0,35, ou deepseek-flash a $0,15 / $0,60.
  2. Force a decisão para um conjunto fechado no prompt, e peça uma pontuação de confiança junto. Trate a pontuação como uma dica, não como uma probabilidade calibrada — essa é a lacuna que um modelo de decisão preenche e a engenharia de prompt não.
  3. Escale apenas o que fica abaixo do seu limiar. gpt-5.6-sol a partir de $0,297 / $1,781 em 19 rotas, ou gemini-3.8-flash a partir de $0,20 / $1,00 em 7.
  4. Mantenha a aritmética, datas e contagem no seu próprio código, para ambos os níveis. É mais barato e é correto.
  5. Meça sua própria taxa de concordância antes de escalar. Cinquenta itens rotulados à mão vão te dizer mais do que qualquer tabela de benchmark, incluindo esta.

A economia desse padrão é o motivo pelo qual o roteamento existe como categoria: a primeira passagem é onde vai quase todo o volume, e o nível de escalonamento é de onde vem quase toda a qualidade. Você só precisa do segundo para a minoria que não consegue classificar.

Crie uma conta na APIMaster, adicione crédito pré-pago a partir de $1, crie uma chave no console e aponte um cliente compatível com OpenAI para https://apimaster.ai/v1 com qualquer um dos IDs de modelo acima. Uma chave cobre as famílias GPT, GLM, DeepSeek, Gemini e Claude, então o caminho de escalonamento permanece na mesma integração. Valide uma rota com o testador de modelos antes de mover o tráfego de produção.

FAQ

O Jev é um modelo de linguagem? Não. A TypeSafe o descreve como um modelo de dados estruturados, e as próprias palavras do fundador na thread de lançamento são que ele é "tecnicamente não um modelo de linguagem (ele não gera linguagem)". Ele lê texto e retorna decisões.

O Jev é mais preciso que um LLM? Não de forma mensurável, com base na evidência publicada. Em um teste norueguês de 24 documentos, Jev e DeepSeek V4.1 Flash concordaram com os rótulos de referência na mesma taxa em perguntas de posicionamento e argumento. O Jev estava claramente à frente em uma tarefa de escala ordenada.

O Jev é mais barato que um LLM? Sim, por tarefa — não por token de entrada. Os $0,042 por 1M tokens de entrada do Jev são superados pelo gpt-5.6-luna a $0,022 na entrada, mas o Jev não emite nenhum token de saída, e modelos generativos são cobrados pela saída. Na carga de trabalho publicada, isso deu $0,22 por 1.000 documentos contra $1,31 e $3,08.

O que é "LLM as a judge" e como isso é diferente? LLM-as-a-judge significa pedir a um modelo generativo para avaliar ou rotular algo e ler a resposta do seu texto. Funciona, mas você paga pelo texto, espera pelos tokens, e a confiança que você recebe de volta não é uma probabilidade calibrada. Um modelo de decisão retorna o mesmo julgamento como uma resposta tipada que você pode usar como limiar.

Posso simplesmente forçar a saída JSON de um modelo barato em vez disso? Isso te dá o schema, não a calibração. A decodificação restrita faz a saída parsear; ela não te diz em quais respostas desconfiar, e a TypeSafe argumenta que ela pode degradar a qualidade ao mascarar tokens sobre os quais o modelo estava genuinamente incerto.

Qual devo usar para classificação? Se você faz alguns julgamentos onde a acurácia é tudo e você pode revisá-los, um bom LLM serve. Se você faz muitos julgamentos e precisa automatizar, use o que retornar um sinal de confiança utilizável e escale os incertos.

O Jev lida com texto em outros idiomas além do inglês? Lida, com ressalvas. A TypeSafe diz que o inglês é onde a acurácia é melhor e outros idiomas, incluindo CJK, são tratados mas não igualmente bem. O teste norueguês acima descobriu que ele lia atas de conselho escaneadas corretamente, e também mediu a eficiência do tokenizador em cerca de 2,06 caracteres por token — vale a pena verificar no seu próprio idioma antes de planejar em torno do limite de contexto.

O Jev consegue ver imagens? Não. Ele é somente texto. Converter uma imagem em texto e perguntar ao Jev sobre ela pode superar o acaso, mas perde feio para um modelo que consegue realmente ver.

O Jev está disponível na APIMaster? Ainda não à venda — o Jev está em onboarding na APIMaster, e esta página será atualizada assim que a integração estiver ativa. Os modelos do outro lado desta comparação estão disponíveis agora.

Com qual modelo de baixo custo devo começar para uma primeira passagem? gpt-5.6-luna é o nível mais barato do marketplace a $0,022 / $0,134 por 1M tokens em 3 rotas — a menor taxa de entrada e saída na tabela deste artigo. glm-5.3-flash a $0,105 / $0,35 e deepseek-flash a $0,15 / $0,60 são os próximos passos acima. Meça com seus próprios dados antes de comprometer volume.

Fontes e leitura adicional

Os resultados de testes de terceiros são reproduzidos conforme seus autores os publicaram; nenhum dos autores foi pago por seu artigo nem revisou esta página. Os preços das rotas da APIMaster foram lidos em 20 de setembro de 2026. O onboarding do Jev na APIMaster está em andamento e esta página será atualizada conforme avançar.