Jev vs LLMs: Onde um Modelo de Decisão Supera Promptar, e Onde Não Supera
Jev retorna probabilidades tipadas; um LLM retorna texto que você precisa parsear. Testes de terceiros colocam o custo por 1.000 documentos em $0,22 contra $1,31–$3,08, e a diferença decisiva é a confiança, não a acurácia.
Published 2026-09-20
Em acurácia, a resposta honesta é que eles empatam. A comparação publicada mais detalhada que encontramos rodou ambos contra os mesmos 24 documentos de audiência pública do governo norueguês e descobriu que Jev e DeepSeek V4.1 Flash concordavam com os rótulos de referência praticamente na mesma taxa — 20 de 24 em posicionamento, 0,86 contra 0,89 em 192 julgamentos de argumento sim/não, dentro do ruído de uma amostra de 24 documentos. O que os separou não foi qual estava certo. Foi se o modelo te avisa quando está inseguro.
Três diferenças decidem a escolha em produção:
- Estrutura de custo. Jev cobra $42 por bilhão de tokens de entrada ($0,042 por 1M) e nada pela saída, porque não emite tokens. Um modelo generativo paga por ambos, e um modelo de raciocínio paga por muito pensamento: nesse mesmo teste, o DeepSeek escreveu 47.000 tokens de raciocínio para preencher 24 formulários.
- Calibração. Quando o Jev dizia uma probabilidade de 0,8, o rótulo de referência concordava cerca de 80% das vezes. Quando o DeepSeek com raciocínio habilitado escrevia 0,8, a referência concordava cerca de metade das vezes. Esse é todo o argumento a favor de um modelo de decisão: você pode definir um limiar e confiar nele.
- Contrato de saída. Jev retorna respostas tipadas —
Choice,Score,Noul— com uma probabilidade e um valor de confiança. Um LLM retorna texto que você parseia, e a confiança declarada é uma frase, não um número sobre o qual você pode ramificar.
Onde um LLM ainda ganha: qualquer coisa que precise de geração, explicação, raciocínio multi-etapas, aritmética ou trabalho com documentos longos. Em um teste público, um Jev somente texto foi solicitado a nomear 400 esboços feitos à mão que haviam sido convertidos em strings de coordenadas; ele superou o acaso por uma margem ampla, perdeu para o Claude Sonnet 5 e respondeu "avião" para mais da metade deles.
O que você pode comprar hoje. O Jev não está à venda na APIMaster — está em onboarding, e esta página será atualizada quando a integração estiver ativa. A outra metade desta comparação é comprável agora: gpt-5.6-luna a partir de $0,022 entrada / $0,134 saída por 1M tokens (3 rotas à venda, cerca de 89% abaixo da lista da OpenAI de $0,20 / $1,20), glm-5.3-flash a partir de $0,105 / $0,35 (3 rotas, cerca de 30% abaixo da lista da Zhipu) e deepseek-flash a partir de $0,15 / $0,60 (1 rota, na própria tarifa fora de pico da DeepSeek). Para a metade de escalonamento do padrão abaixo, gpt-5.6-sol começa em $0,297 / $1,781 em 19 rotas. Uma única chave compatível com OpenAI cobre todos eles — veja o card do Luna e o marketplace de modelos. Os preços das rotas seguem a oferta dos canais; o card ao vivo é o número que conta. Verificado em 20 de setembro de 2026.
Teste do GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 e GPT Image 2 disponíveis)
Cadastre-se e receba $20 de teste do GPT
Não é uma questão de "melhor ou pior"
Jev e um LLM estão respondendo a perguntas diferentes. Jev responde qual deles, quanto, ou quão provável; um LLM responde o que deve ser escrito.
| Jev | Um LLM generativo | |
|---|---|---|
| Saída | Respostas tipadas com uma probabilidade por opção e um valor de confiança | Texto, opcionalmente restrito a um schema JSON |
| Base de custo | Apenas tokens de entrada; saída é gratuita | Tokens de entrada mais saída |
| Forma da latência | Uma passagem direta; perguntas se ramificam em paralelo sobre um estado | Tokens gerados sequencialmente; modelos de raciocínio adicionam uma longa passagem oculta |
| Confiança | Um número calibrado que você pode usar como limiar | Geralmente nenhuma, ou uma frase auto-declarada |
| Schema | Corresponde por construção | Corresponde até o modelo decidir que não corresponde |
| Entrada conhecida | Apenas texto e estado estruturado, sem imagens | Texto, e imagens para modelos multimodais |
| Supera no quê | Julgamentos estreitos e de alto volume | Geração, raciocínio, explicação, aritmética |
No momento em que você deixa de precisar de texto na saída, a aritmética muda. Uma tarefa em formato de classificador que produz vinte tokens de prosa por item está pagando por esses tokens em cada item, para sempre.
A questão da acurácia, com números reais
Comparações de marketing geralmente comparam o benchmark favorito de cada fornecedor contra o pior do outro. O teste publicado útil que encontramos é o artigo de acesso antecipado de Emil Lindfors, An early-access test of TypeSafe's Jev, rodado em 24 respostas à audiência pública da Noruega de 2022 sobre o imposto sobre renda de recursos da salmonicultura.
Ele rotulou tudo com Claude Fable 5.1 em duas passagens independentes primeiro, depois comparou Jev 1.13 contra DeepSeek V4.1 Flash via OpenRouter — as mesmas perguntas em um prompt, JSON na saída, uma vez com raciocínio ativado e outra desativado.
| Tarefa | Jev 1.13 | DeepSeek, raciocínio desativado | DeepSeek, raciocínio ativado |
|---|---|---|---|
| Posicionamento, 4 opções | 20 de 24 | 20 de 24 | 22 de 24 |
| Tipo de respondente, 6 opções | 21 de 23 | 22 de 23 | 23 de 23 |
| Argumentos, 192 sim/não | 0,86 | 0,89 | 0,88 |
| Substância, nível exato | 19 de 24 | 14 de 24 | 14 de 24 |
Duas coisas valem a pena ler nessa tabela. Primeiro, o autor é explícito que estas são concordâncias com os rótulos de um modelo de fronteira, não correção — onde a referência está errada e o Jev está certo, o Jev pontua como errado. Com 24 documentos, o intervalo de 95% em um número de posicionamento é de cerca de ±15 pontos, então as três colunas são iguais em posicionamento e argumentos. Segundo, a única vitória clara é na escala ordenada Score, 19 contra 14: essa é a primitiva fazendo exatamente o que foi construída para fazer, e é o tipo de resultado que você não obteria de uma resposta em texto.
Qualquer um que afirme, com base nessa evidência, que um modelo de decisão é categoricamente mais preciso que um LLM está superinterpretando uma amostra de 24 documentos. A afirmação interessante é a mais estreita.
A questão do custo
O mesmo teste precificou o trabalho por 1.000 documentos:
| Jev 1.13 | DeepSeek, raciocínio desativado | DeepSeek, raciocínio ativado | |
|---|---|---|---|
| Custo por 1.000 documentos | $0,22 | $1,31 | $3,08 |
| Latência mediana | 0,32 s | 2,7 s | 26 s |
| Requisição mais lenta | 1,3 s | 17,9 s | 250 s |
Aproximadamente um sexto e um quatorze avos das duas configurações de LLM, a aproximadamente um oitavo e um octogésimo da latência mediana. O próprio resumo do autor sobre a causa: abandonar a geração de texto é o motivo pelo qual o preço cai tanto, e os tokens de raciocínio compraram dois rótulos de posicionamento extras de 24 por dez vezes a latência.
Esses são uma carga de trabalho, um idioma, um dia. Seus números serão diferentes — só a eficiência do tokenizador já os move. O mesmo artigo mediu o tokenizador do Jev em cerca de 2,06 caracteres por token em norueguês, contra os ~4 caracteres por token que você assumiria do inglês, o que reduz o orçamento de estado utilizável de aproximadamente 120.000 caracteres para cerca de 64.000.
A calibração é a diferença real
Esta é a parte que decide se você pode automatizar. Um modelo que está certo 86% das vezes e sabe em quais 14% está errado é uma ferramenta diferente de um modelo que está certo 88% das vezes e soa igualmente certo sobre tudo.
Da mesma execução, em 192 julgamentos de argumento:
| Probabilidade declarada pelo Jev | Julgamentos | Referência concordou |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
A direção está correta em cada passo, e o modelo fica ligeiramente subconfiante em ambas as extremidades — a própria meta da TypeSafe é que resultados atribuídos a 0,8 ocorram cerca de 80% das vezes, e a faixa do meio ficou em 34% em vez de ~50%.
A versão prática dessa tabela é um limiar. Dividindo as perguntas de escolha pela probabilidade mais alta:
| Probabilidade mais alta ≥ 0,9 | Abaixo de 0,9 | |
|---|---|---|
| Posicionamento | 14 de 15 concordam | 6 de 9 concordam |
| Tipo de respondente | 20 de 20 concordam | 1 de 3 concordam |
Esse é o padrão operacional: aceite a maioria confiante, escale o resto. O próprio cookbook da TypeSafe sobre registros da SEC reporta 27 de 30 corretos em 0,9 ou acima em inglês; a execução em norueguês obteve 14 de 15.
A comparação corre em apenas uma direção. Com raciocínio ativado, o DeepSeek colocou 84 de suas 192 respostas de argumento acima de 0,9 — e na janela de 0,7–0,9 seus rótulos corresponderam à referência 48% das vezes. Um modelo cuja confiança não é calibrada não pode ser usado como gate, não importa quão boas sejam suas respostas.
Onde um LLM ainda é a escolha certa
- Geração. O Jev não vai escrever o resumo, a resposta ou a mensagem de commit. A própria documentação da TypeSafe direciona a geração para um modelo generativo.
- Raciocínio e perguntas multi-salto. A TypeSafe lista a indireção como uma fraqueza conhecida: perguntas com negativas duplas ou múltiplos saltos custam acurácia.
- Aritmética, datas e contagem. Documentado como não confiável, e o erro cresce com o tamanho da coisa sendo contada. Mantenha isso no código.
- Imagens e áudio. O Jev é somente texto. Em TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski converteu 400 esboços em strings de coordenadas SVG e pediu ao Jev para nomeá-los. Ele superou claramente uma linha de base de acaso de dez vias, perdeu para o Claude Sonnet 5 e respondeu "avião" para mais da metade dos desenhos. O mesmo conteúdo codificado como base64 caiu no acaso — um lembrete útil de que um modelo de texto lendo números os está lendo como texto.
- Qualquer coisa que precise de uma explicação. "Por que você rotulou este assim" não é uma pergunta que uma probabilidade responde.
O fundador da TypeSafe faz um argumento relacionado do lado dos LLMs que vale a pena conhecer, já que vai contra um contorno comum: na thread de lançamento, ele argumentou que a decodificação restrita do tipo que as saídas estruturadas no estilo OpenAI usam torna os modelos mais burros, porque mascarar tokens inválidos não é o mesmo que o modelo não estar confuso sobre eles. Trate isso como a posição de um fornecedor, e não como um resultado estabelecido — mas isso significa que "apenas forçar JSON de um modelo barato" não é automaticamente equivalente a uma resposta tipada.
O padrão que funciona
A conclusão mais útil no artigo norueguês é que a escolha não é ou/ou. O próprio projeto do autor usou três modelos para três trabalhos:
| Trabalho | Modelo | Por quê |
|---|---|---|
| 48 rótulos de referência cuidadosos | Fable 5.1 | Poucos documentos, decisões de julgamento, custo não importa |
| Cada documento, cada pergunta | Jev | Baixo custo, rápido, e avisa quando está inseguro |
| Uma segunda opinião sobre o terço incerto | DeepSeek ou uma pessoa | Mais lento e mais caro, então apenas onde é necessário |
Você pode executar esse formato hoje com uma única chave compatível com OpenAI, usando um nível de baixo custo como primeira passagem e um mais forte apenas para os casos que a primeira passagem não consegue resolver:
- Primeira passagem no nível mais barato que atende seu critério.
gpt-5.6-lunaa $0,022 / $0,134 por 1M, ouglm-5.3-flasha $0,105 / $0,35, oudeepseek-flasha $0,15 / $0,60. - Force a decisão para um conjunto fechado no prompt, e peça uma pontuação de confiança junto. Trate a pontuação como uma dica, não como uma probabilidade calibrada — essa é a lacuna que um modelo de decisão preenche e a engenharia de prompt não.
- Escale apenas o que fica abaixo do seu limiar.
gpt-5.6-sola partir de $0,297 / $1,781 em 19 rotas, ougemini-3.8-flasha partir de $0,20 / $1,00 em 7. - Mantenha a aritmética, datas e contagem no seu próprio código, para ambos os níveis. É mais barato e é correto.
- Meça sua própria taxa de concordância antes de escalar. Cinquenta itens rotulados à mão vão te dizer mais do que qualquer tabela de benchmark, incluindo esta.
A economia desse padrão é o motivo pelo qual o roteamento existe como categoria: a primeira passagem é onde vai quase todo o volume, e o nível de escalonamento é de onde vem quase toda a qualidade. Você só precisa do segundo para a minoria que não consegue classificar.
Crie uma conta na APIMaster, adicione crédito pré-pago a partir de $1, crie uma chave no console e aponte um cliente compatível com OpenAI para https://apimaster.ai/v1 com qualquer um dos IDs de modelo acima. Uma chave cobre as famílias GPT, GLM, DeepSeek, Gemini e Claude, então o caminho de escalonamento permanece na mesma integração. Valide uma rota com o testador de modelos antes de mover o tráfego de produção.
FAQ
O Jev é um modelo de linguagem? Não. A TypeSafe o descreve como um modelo de dados estruturados, e as próprias palavras do fundador na thread de lançamento são que ele é "tecnicamente não um modelo de linguagem (ele não gera linguagem)". Ele lê texto e retorna decisões.
O Jev é mais preciso que um LLM? Não de forma mensurável, com base na evidência publicada. Em um teste norueguês de 24 documentos, Jev e DeepSeek V4.1 Flash concordaram com os rótulos de referência na mesma taxa em perguntas de posicionamento e argumento. O Jev estava claramente à frente em uma tarefa de escala ordenada.
O Jev é mais barato que um LLM?
Sim, por tarefa — não por token de entrada. Os $0,042 por 1M tokens de entrada do Jev são superados pelo gpt-5.6-luna a $0,022 na entrada, mas o Jev não emite nenhum token de saída, e modelos generativos são cobrados pela saída. Na carga de trabalho publicada, isso deu $0,22 por 1.000 documentos contra $1,31 e $3,08.
O que é "LLM as a judge" e como isso é diferente? LLM-as-a-judge significa pedir a um modelo generativo para avaliar ou rotular algo e ler a resposta do seu texto. Funciona, mas você paga pelo texto, espera pelos tokens, e a confiança que você recebe de volta não é uma probabilidade calibrada. Um modelo de decisão retorna o mesmo julgamento como uma resposta tipada que você pode usar como limiar.
Posso simplesmente forçar a saída JSON de um modelo barato em vez disso? Isso te dá o schema, não a calibração. A decodificação restrita faz a saída parsear; ela não te diz em quais respostas desconfiar, e a TypeSafe argumenta que ela pode degradar a qualidade ao mascarar tokens sobre os quais o modelo estava genuinamente incerto.
Qual devo usar para classificação? Se você faz alguns julgamentos onde a acurácia é tudo e você pode revisá-los, um bom LLM serve. Se você faz muitos julgamentos e precisa automatizar, use o que retornar um sinal de confiança utilizável e escale os incertos.
O Jev lida com texto em outros idiomas além do inglês? Lida, com ressalvas. A TypeSafe diz que o inglês é onde a acurácia é melhor e outros idiomas, incluindo CJK, são tratados mas não igualmente bem. O teste norueguês acima descobriu que ele lia atas de conselho escaneadas corretamente, e também mediu a eficiência do tokenizador em cerca de 2,06 caracteres por token — vale a pena verificar no seu próprio idioma antes de planejar em torno do limite de contexto.
O Jev consegue ver imagens? Não. Ele é somente texto. Converter uma imagem em texto e perguntar ao Jev sobre ela pode superar o acaso, mas perde feio para um modelo que consegue realmente ver.
O Jev está disponível na APIMaster? Ainda não à venda — o Jev está em onboarding na APIMaster, e esta página será atualizada assim que a integração estiver ativa. Os modelos do outro lado desta comparação estão disponíveis agora.
Com qual modelo de baixo custo devo começar para uma primeira passagem?
gpt-5.6-luna é o nível mais barato do marketplace a $0,022 / $0,134 por 1M tokens em 3 rotas — a menor taxa de entrada e saída na tabela deste artigo. glm-5.3-flash a $0,105 / $0,35 e deepseek-flash a $0,15 / $0,60 são os próximos passos acima. Meça com seus próprios dados antes de comprometer volume.
Fontes e leitura adicional
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 documentos de audiência noruegueses, Jev contra DeepSeek V4.1 Flash com e sem raciocínio, com concordância por tarefa, faixas de calibração, custo e latência
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 esboços como strings de coordenadas, linha de base de acaso e a comparação com o Sonnet 5
- TypeSafe — Models — ID do modelo, preço de $42/Btok, limites de taxa, orçamento de contexto e suporte a idiomas
- TypeSafe — Jev 1.13 jaggedness — as notas de escopo publicadas sobre leitura literal, aritmética, datas, indireção e geração
- TypeSafe — Introducing System One Models and Jev — o número de 70–500ms ponta a ponta e a comparação de 40×–200×
- Thread de lançamento no Hacker News — os comentários do fundador sobre o que o Jev não é, sobre decodificação restrita e sobre por que a saída é gratuita
Os resultados de testes de terceiros são reproduzidos conforme seus autores os publicaram; nenhum dos autores foi pago por seu artigo nem revisou esta página. Os preços das rotas da APIMaster foram lidos em 20 de setembro de 2026. O onboarding do Jev na APIMaster está em andamento e esta página será atualizada conforme avançar.
