APIMaster.ai
Back to Blog
APIMaster Blog

Jev vs LLM'ler: Bir Karar Modelinin Prompt'lamayı Nerede Yendiği ve Nerede Yemediği

Jev tipli olasılıklar döndürür; bir LLM ise ayrıştırmanız gereken metin döndürür. Üçüncü taraf testleri 1.000 belge başına maliyeti $1,31–$3,08'e karşı $0,22 olarak ölçüyor ve belirleyici fark doğruluk değil, güven.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Doğruluk konusunda dürüst cevap şu: berabere kalıyorlar. Bulduğumuz en ayrıntılı yayımlanmış karşılaştırma, her ikisini de aynı 24 Norveç hükümeti duruşma belgesi üzerinde çalıştırdı ve Jev ile DeepSeek V4.1 Flash'ın referans etiketlerle neredeyse aynı oranda örtüştüğünü buldu — duruş pozisyonunda 24'te 20, 192 evet/hayır argüman yargısında 0,86'ya karşı 0,89, ki bu 24 belgelik bir örneklemin gürültü aralığı içinde. Onları ayıran şey hangisinin doğru olduğu değildi. Modelin emin olmadığında size söyleyip söylememesiydi.

Üretimde seçimi belirleyen üç fark var:

  • Maliyet yapısı. Jev, milyar giriş token'ı başına $42 ($1M başına $0,042) ücretlendirir ve çıkış için hiçbir şey almaz, çünkü hiç token üretmez. Üretici bir model her ikisi için de ödeme yapar ve bir akıl yürütme modeli çok fazla düşünme için ödeme yapar: aynı testte DeepSeek, 24 formu doldurmak için 47.000 token akıl yürütme yazdı.
  • Kalibrasyon. Jev 0,8 olasılık dediğinde, referans etiketi yaklaşık %80 oranında hemfikir oldu. DeepSeek akıl yürütme etkinken 0,8 yazdığında, referans yaklaşık yarısında hemfikir oldu. Bir karar modelinin tüm argümanı budur: bir eşik belirleyebilir ve ona güvenebilirsiniz.
  • Çıkış sözleşmesi. Jev tipli yanıtlar döndürür — Choice, Score, Noul — bir olasılık ve bir güven değeriyle. Bir LLM ise ayrıştırdığınız metni döndürür ve belirttiği güven, üzerinde dallanabileceğiniz bir sayı değil, bir cümledir.

Bir LLM'in hâlâ kazandığı yer: üretim, açıklama, çok adımlı akıl yürütme, aritmetik veya uzun belge çalışması gerektiren her şey. Bir kamuya açık testte, yalnızca metinle çalışan bir Jev'den koordinat dizelerine dönüştürülmüş 400 el çizimi krokinin adını söylemesi istendi; şansın çok üzerinde bir başarı gösterdi, Claude Sonnet 5'e yenildi ve yarısından fazlası için "uçak" yanıtını verdi.

Bugün satın alabilecekleriniz. Jev, APIMaster'da satışta değil — entegrasyon aşamasında ve entegrasyon canlı olduğunda bu sayfa güncellenecek. Bu karşılaştırmanın diğer yarısı şimdi satın alınabilir: gpt-5.6-luna 1M token başına $0,022 giriş / $0,134 çıkış'tan başlayarak (3 rota satışta, OpenAI'nin $0,20 / $1,20 liste fiyatının yaklaşık %89 altında), glm-5.3-flash $0,105 / $0,35'ten (3 rota, Zhipu'nun liste fiyatından yaklaşık %30 indirimli) ve deepseek-flash $0,15 / $0,60'tan (1 rota, DeepSeek'in kendi yoğun olmayan saat ücretiyle). Aşağıdaki desenin yükseltme yarısı için gpt-5.6-sol 19 rota genelinde $0,297 / $1,781'den başlıyor. Tek bir OpenAI uyumlu anahtar hepsini kapsar — Luna kartına ve model pazar yerine bakın. Rota fiyatları kanal arzını takip eder; geçerli olan sayı canlı karttaki sayıdır. 20 Eylül 2026'da kontrol edildi.

GPT denemesi(GPT-6 Astra, GPT-5.6, GPT-5.5 ve GPT Image 2 kullanılabilir)

Kaydolun ve $20 GPT deneme kredisi alın

Hemen al

Bu bir "daha iyi ya da daha kötü" sorusu değil

Jev ve bir LLM farklı soruları yanıtlıyor. Jev hangisi, ne kadar veya ne olasılıkla sorusunu yanıtlar; bir LLM ise ne yazılmalı sorusunu.

Jev Üretici bir LLM
Çıkış Her seçenek için bir olasılık ve bir güven değeri içeren tipli yanıtlar Metin, isteğe bağlı olarak bir JSON şemasına kısıtlanmış
Maliyet temeli Yalnızca giriş token'ları; çıkış ücretsiz Giriş artı çıkış token'ları
Gecikme şekli Tek bir ileri geçiş; sorular tek bir durum üzerinde paralel olarak dağılır Sıralı üretilen token'lar; akıl yürütme modelleri uzun bir gizli geçiş ekler
Güven Eşikleyebileceğiniz kalibre edilmiş bir sayı Genellikle yok, ya da kendi bildirdiği bir cümle
Şema Yapısı gereği eşleşir Model eşleşmemeye karar verene kadar eşleşir
Bilinen girdi Yalnızca metin ve yapılandırılmış durum, görüntü yok Metin ve çok kipli modeller için görüntüler
Şunda yener Dar, yüksek hacimli yargılar Üretim, akıl yürütme, açıklama, aritmetik

Metin çıkışına ihtiyaç duymayı bıraktığınız anda aritmetik değişir. Öğe başına yirmi token düzyazı üreten sınıflandırıcı biçimli bir görev, o token'lar için her bir öğede sonsuza kadar ödeme yapıyor demektir.

Doğruluk sorusu, gerçek sayılarla

Pazarlama karşılaştırmaları genellikle her satıcının en sevdiği kıyaslama testini diğerinin en kötüsüyle karşılaştırır. Bulduğumuz faydalı yayımlanmış test, Emil Lindfors'un erken erişim yazısı An early-access test of TypeSafe's Jev olup, Norveç'in 2022 somon yetiştiriciliği kaynak kira vergisi duruşmasına verilen 24 yanıt üzerinde çalıştırılmıştır.

Önce her şeyi Claude Fable 5.1 ile iki bağımsız geçişte etiketledi, ardından Jev 1.13'ü OpenRouter üzerinden DeepSeek V4.1 Flash ile karşılaştırdı — aynı sorular tek bir prompt'ta, JSON çıkışı, bir kez akıl yürütme açık ve bir kez kapalı.

Görev Jev 1.13 DeepSeek, akıl yürütme kapalı DeepSeek, akıl yürütme açık
Duruş pozisyonu, 4 seçenek 24'te 20 24'te 20 24'te 22
Yanıtlayan türü, 6 seçenek 23'te 21 23'te 22 23'te 23
Argümanlar, 192 evet/hayır 0,86 0,89 0,88
Öz, tam düzey 24'te 19 24'te 14 24'te 14

Bu tablodan okunmaya değer iki şey var. Birincisi, yazar bu sonuçların doğruluk değil, bir sınır modelinin etiketleriyle örtüşme olduğunu açıkça belirtiyor — referansın yanlış ve Jev'in doğru olduğu yerde Jev yanlış olarak puanlanıyor. 24 belgeyle, bir duruş pozisyonu sayısı üzerindeki %95 aralığı yaklaşık ±15 puandır, yani üç sütun duruş pozisyonu ve argümanlarda aynıdır. İkincisi, tek net kazanç sıralı Score ölçeğinde, 14'e karşı 19: bu, ilkel öğenin tam olarak inşa edildiği işi yapmasıdır ve metin yanıtından hiç elde edemeyeceğiniz türden bir sonuçtur.

Bu kanıtlara dayanarak bir karar modelinin kategorik olarak bir LLM'den daha doğru olduğunu iddia eden herkes, 24 belgelik bir örneklemi fazla okumaktadır. İlginç olan iddia daha dar olanıdır.

Maliyet sorusu

Aynı test, işi 1.000 belge başına fiyatlandırdı:

Jev 1.13 DeepSeek, akıl yürütme kapalı DeepSeek, akıl yürütme açık
1.000 belge başına maliyet $0,22 $1,31 $3,08
Medyan gecikme 0,32 sn 2,7 sn 26 sn
En yavaş istek 1,3 sn 17,9 sn 250 sn

İki LLM yapılandırmasının kabaca altıda biri ve on dörtte biri, medyan gecikmenin ise kabaca sekizde biri ve seksen katı. Yazarın nedenine ilişkin kendi özeti: metin üretimini bırakmak fiyatın bu kadar düşmesinin nedenidir ve akıl yürütme token'ları, on kat gecikme karşılığında 24 duruş pozisyonundan iki ek etiket satın aldı.

Bunlar tek bir iş yükü, tek bir dil, tek bir gün. Sizin sayılarınız farklı olacaktır — yalnızca tokenizer verimliliği bile onları değiştirir. Aynı yazı, Jev'in tokenizer'ını Norveççe'de yaklaşık token başına 2,06 karakter olarak ölçtü; İngilizce'den varsayacağınız token başına ~4 karaktere karşı, bu da kullanılabilir durum bütçesini kabaca 120.000 karakterden yaklaşık 64.000'e düşürür.

Kalibrasyon asıl farktır

Otomatikleştirip otomatikleştiremeyeceğinize karar veren kısım burasıdır. Zamanın %86'sında doğru olan ve yanıldığı %14'ün hangisi olduğunu bilen bir model, zamanın %88'inde doğru olan ve her şey hakkında eşit derecede emin görünen bir modelden farklı bir araçtır.

Aynı çalıştırmadan, 192 argüman yargısı üzerinde:

Jev'in belirttiği olasılık Yargılar Referans hemfikir
0,0 – 0,1 14 %0
0,1 – 0,3 56 %4
0,3 – 0,7 41 %34
0,7 – 0,9 38 %97
0,9 – 1,0 43 %98

Yön her adımda doğru ve model her iki uçta da hafifçe az güvenli çalışıyor — TypeSafe'in kendi hedefi, 0,8 atanan sonuçların zamanın yaklaşık %80'inde gerçekleşmesi gerektiğidir ve orta kutu ~%50 yerine %34'te geldi.

Bu tablonun pratik hali bir eşiktir. Seçim sorularını en yüksek olasılığa göre ayırmak:

En yüksek olasılık ≥ 0,9 0,9'un altında
Duruş pozisyonu 15'te 14 hemfikir 9'da 6 hemfikir
Yanıtlayan türü 20'de 20 hemfikir 3'te 1 hemfikir

İşletim deseni budur: emin olan çoğunluğu kabul et, gerisini yükselt. TypeSafe'in kendi SEC dosyaları yemek kitabı İngilizce'de 0,9 ve üzerinde 30'da 27 doğru bildiriyor; Norveççe çalıştırma 15'te 14 aldı.

Karşılaştırma yalnızca tek yönde işliyor. Akıl yürütme etkinken DeepSeek, 192 argüman yanıtından 84'ünü 0,9'un üzerine koydu — ve 0,7–0,9 penceresinde etiketleri referansla zamanın %48'inde eşleşti. Güveni kalibre edilmemiş bir model, yanıtları ne kadar iyi olursa olsun bir kapı olarak kullanılamaz.

Bir LLM'in hâlâ doğru tercih olduğu yer

  • Üretim. Jev özeti, yanıtı veya commit mesajını yazmaz. TypeSafe'in kendi dokümantasyonu üretimi üretici bir modele yönlendirir.
  • Akıl yürütme ve çok atlamalı sorular. TypeSafe, dolaylılığı bilinen bir zayıflık olarak listeliyor: çift olumsuzlamalar veya birden fazla atlama içeren sorular doğruluk kaybettirir.
  • Aritmetik, tarihler ve sayma. Güvenilmez olarak belgelenmiştir ve hata, sayılan şeyin boyutuyla büyür. Bunu kodda tutun.
  • Görüntüler ve ses. Jev yalnızca metindir. TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway yazısında Bartosz Mikulski 400 krokiyi SVG koordinat dizelerine dönüştürdü ve Jev'den adlarını söylemesini istedi. On seçenekli şans temel çizgisini açıkça yendi, Claude Sonnet 5'e yenildi ve çizimlerin yarısından fazlası için "uçak" yanıtını verdi. Aynı içerik base64 olarak kodlandığında şans düzeyine indi — bir metin modelinin sayıları okurken onları metin olarak okuduğunun faydalı bir hatırlatıcısı.
  • Açıklama gerektiren her şey. "Bunu neden böyle etiketledin" bir olasılığın yanıtlayacağı bir soru değildir.

TypeSafe'in kurucusu, yaygın bir geçici çözüme karşı çıktığı için bilinmeye değer, LLM tarafında ilgili bir argüman öne sürüyor: lansman başlığında, OpenAI tarzı yapılandırılmış çıkışların kullandığı türden kısıtlı kod çözmenin modelleri aptallaştırdığını savundu, çünkü geçersiz token'ları maskelemek, modelin onlar hakkında kafasının karışmamasıyla aynı şey değildir. Bunu yerleşik bir sonuç değil, bir satıcının pozisyonu olarak değerlendirin — ama bu, "ucuz bir modelden JSON'u zorla çıkar"ın otomatik olarak tipli bir yanıta eşdeğer olmadığı anlamına gelir.

İşleyen desen

Norveççe yazıdaki en faydalı sonuç, seçimin ya/ya da olmadığıdır. Yazarın kendi projesi üç iş için üç model kullandı:

İş Model Neden
48 dikkatli referans etiketi Fable 5.1 Az belge, yargı kararları, maliyet önemli değil
Her belge, her soru Jev Düşük maliyetli, hızlı ve emin olmadığında söylüyor
Belirsiz üçte birlik kısım için ikinci görüş DeepSeek veya bir kişi Daha yavaş ve daha pahalı, bu yüzden yalnızca gereken yerde

Bu şekli bugün tek bir OpenAI uyumlu anahtarla çalıştırabilirsiniz; ilk geçiş olarak düşük maliyetli bir katman ve yalnızca ilk geçişin çözemediği durumlar için daha güçlü bir katman kullanarak:

  1. İlk geçişi, çıtanızı geçen en ucuz katmanda yapın. 1M başına $0,022 / $0,134 ile gpt-5.6-luna, ya da $0,105 / $0,35 ile glm-5.3-flash, ya da $0,15 / $0,60 ile deepseek-flash.
  2. Kararı prompt'ta kapalı bir kümeye zorlayın ve yanında bir güven puanı isteyin. Puanı kalibre edilmiş bir olasılık değil, bir ipucu olarak değerlendirin — bir karar modelinin doldurduğu ve prompt mühendisliğinin doldurmadığı boşluk budur.
  3. Yalnızca eşiğinizin altına düşenleri yükseltin. 19 rota genelinde $0,297 / $1,781'den gpt-5.6-sol, ya da 7 rota genelinde $0,20 / $1,00'dan gemini-3.8-flash.
  4. Aritmetiği, tarihleri ve saymayı kendi kodunuzda tutun, her iki katman için de. Daha ucuz ve doğru.
  5. Ölçeklemeden önce kendi örtüşme oranınızı ölçün. Elle etiketlenmiş elli öğe, size bu tablo dahil herhangi bir kıyaslama tablosundan daha fazlasını söyleyecektir.

Bu desenin ekonomisi, yönlendirmenin bir kategori olarak var olmasının nedenidir: ilk geçiş, hacmin neredeyse tamamının gittiği yerdir ve yükseltme katmanı, kalitenin neredeyse tamamının geldiği yerdir. İkincisine yalnızca sınıflandıramadığınız azınlık için ihtiyaç duyarsınız.

Bir APIMaster hesabı oluşturun, $1'dan başlayan kullandıkça öde kredisi ekleyin, konsolda bir anahtar oluşturun ve OpenAI uyumlu bir istemciyi yukarıdaki model kimliklerinden herhangi biriyle https://apimaster.ai/v1 adresine yönlendirin. Tek bir anahtar GPT, GLM, DeepSeek, Gemini ve Claude ailelerinin tümünü kapsar, böylece yükseltme yolu aynı entegrasyonda kalır. Üretim trafiğini taşımadan önce bir rotayı model test aracıyla doğrulayın.

FAQ

Jev bir dil modeli mi? Hayır. TypeSafe onu yapılandırılmış bir veri modeli olarak tanımlıyor ve kurucunun lansman başlığındaki kendi ifadesiyle "teknik olarak bir dil modeli değil (dil üretmiyor)". Metni okur ve kararlar döndürür.

Jev bir LLM'den daha mı doğru? Yayımlanmış kanıtlara göre ölçülebilir biçimde değil. 24 belgelik bir Norveççe testte Jev ve DeepSeek V4.1 Flash, duruş pozisyonu ve argüman sorularında referans etiketlerle aynı oranda örtüştü. Jev bir sıralı ölçek görevinde açıkça öndeydi.

Jev bir LLM'den daha mı ucuz? Evet, görev başına — giriş token'ı başına değil. Jev'in 1M giriş token'ı başına $0,042'si, girişte $0,022 ile gpt-5.6-luna tarafından alt ediliyor, ancak Jev hiç çıkış token'ı üretmiyor ve üretici modeller çıkış için faturalandırılıyor. Yayımlanmış iş yükünde bu, 1.000 belge başına $1,31 ve $3,08'e karşı $0,22'ye denk geldi.

"LLM as a judge" nedir ve nasıl farklıdır? LLM-as-a-judge, üretici bir modelden bir şeyi derecelendirmesini veya etiketlemesini istemek ve yanıtı metninden okumak anlamına gelir. İşe yarar, ancak metin için ödeme yaparsınız, token'ları beklersiniz ve geri aldığınız güven kalibre edilmiş bir olasılık değildir. Bir karar modeli aynı yargıyı eşikleyebileceğiniz tipli bir yanıt olarak döndürür.

Bunun yerine ucuz bir modelden JSON çıkışını zorlayamaz mıyım? Bu size şemayı verir, kalibrasyonu değil. Kısıtlı kod çözme çıkışı ayrıştırılabilir kılar; hangi yanıtlara güvenmemeniz gerektiğini söylemez ve TypeSafe, modelin gerçekten emin olmadığı token'ları maskeleyerek kaliteyi düşürebileceğini savunuyor.

Sınıflandırma için hangisini kullanmalıyım? Doğruluğun her şey olduğu ve gözden geçirebileceğiniz birkaç yargı yapıyorsanız, iyi bir LLM yeterlidir. Çok sayıda yargı yapıyorsanız ve otomatikleştirmeniz gerekiyorsa, kullanılabilir bir güven sinyali döndüren her neyse onu kullanın ve belirsiz olanları yükseltin.

Jev İngilizce dışındaki metinleri işliyor mu? İşliyor, bazı çekincelerle. TypeSafe, doğruluğun en iyi olduğu dilin İngilizce olduğunu ve CJK dahil diğer dillerin işlendiğini ancak eşit derecede iyi olmadığını söylüyor. Yukarıdaki Norveççe test, taranmış meclis tutanaklarını doğru okuduğunu buldu ve ayrıca tokenizer verimliliğini token başına yaklaşık 2,06 karakter olarak ölçtü — bağlam sınırı etrafında planlama yapmadan önce kendi dilinizde kontrol etmeye değer.

Jev görüntüleri görebiliyor mu? Hayır. Yalnızca metindir. Bir görüntüyü metne dönüştürüp Jev'e onun hakkında sormak şansı yenebilir, ancak gerçekten görebilen bir modele kötü biçimde yenilir.

Jev APIMaster'da mevcut mu? Henüz satışta değil — Jev, APIMaster'da entegrasyon aşamasında ve entegrasyon canlı olduğunda bu sayfa güncellenecek. Bu karşılaştırmanın diğer tarafındaki modeller şimdi mevcut.

İlk geçiş için hangi düşük maliyetli modelle başlamalıyım? gpt-5.6-luna, 3 rota genelinde 1M token başına $0,022 / $0,134 ile pazar yerindeki en ucuz katmandır — bu makalenin tablosundaki en düşük giriş ve çıkış ücreti. $0,105 / $0,35 ile glm-5.3-flash ve $0,15 / $0,60 ile deepseek-flash bir sonraki adımlardır. Hacim taahhüt etmeden önce kendi veriniz üzerinde ölçün.

Kaynaklar ve daha fazla okuma

Üçüncü taraf test sonuçları, yazarlarının yayımladığı biçimde çoğaltılmıştır; yazarların hiçbirine yazıları için ödeme yapılmamış veya bu sayfayı gözden geçirmemiştir. APIMaster rota fiyatları 20 Eylül 2026'da okunmuştur. Jev'in APIMaster entegrasyonu devam etmektedir ve ilerledikçe bu sayfa güncellenecektir.