APIMaster.ai
Back to Blog
APIMaster Blog

Jev vs LLM: gdzie model decyzyjny bije promptowanie, a gdzie nie

Jev zwraca typowane prawdopodobieństwa; LLM zwraca tekst, który musisz sparsować. Testy zewnętrzne podają koszt na 1000 dokumentów na poziomie 0,22 USD wobec 1,31–3,08 USD, a decydująca różnica to pewność, nie dokładność.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Jeśli chodzi o dokładność, uczciwa odpowiedź brzmi: remisują. Najbardziej szczegółowe opublikowane porównanie, jakie znaleźliśmy, uruchomiło oba podejścia na tych samych 24 norweskich dokumentach konsultacyjnych i wykazało, że Jev oraz DeepSeek V4.1 Flash zgadzały się z etykietami referencyjnymi w praktycznie tym samym stopniu — 20 z 24 dla stanowiska, 0,86 wobec 0,89 w 192 ocenach argumentów typu tak/nie, co mieści się w szumie próby 24 dokumentów. Tym, co je różniło, nie było to, który ma rację. Było to czy model mówi ci, kiedy nie jest pewien.

Trzy różnice decydują o wyborze w środowisku produkcyjnym:

  • Struktura kosztów. Jev pobiera 42 USD za miliard tokenów wejściowych (0,042 USD za 1M) i nic za wyjście, ponieważ nie emituje żadnych tokenów. Model generatywny płaci za jedno i drugie, a model rozumujący płaci za dużo myślenia: w tym samym teście DeepSeek napisał 47 000 tokenów rozumowania, aby wypełnić 24 formularze.
  • Kalibracja. Kiedy Jev podawał prawdopodobieństwo 0,8, etykieta referencyjna zgadzała się w około 80% przypadków. Kiedy DeepSeek z włączonym rozumowaniem zapisywał 0,8, referencja zgadzała się w około połowie przypadków. To jest cały argument za modelem decyzyjnym: możesz ustawić próg i mu zaufać.
  • Kontrakt wyjściowy. Jev zwraca typowane odpowiedzi — Choice, Score, Noul — z prawdopodobieństwem i wartością pewności. LLM zwraca tekst, który parsujesz, a jego deklarowana pewność to zdanie, nie liczba, na której możesz rozgałęziać logikę.

Gdzie LLM wciąż wygrywa: wszystko, co wymaga generowania, wyjaśniania, wieloetapowego rozumowania, arytmetyki lub pracy z długimi dokumentami. W jednym publicznym teście tekstowy Jev został poproszony o nazwanie 400 odręcznych szkiców przekształconych na ciągi współrzędnych; pobił losowość z dużym marginesem, przegrał z Claude Sonnet 5 i odpowiedział „samolot" dla ponad połowy z nich.

Co możesz kupić już dziś. Jev nie jest w sprzedaży na APIMaster — jest w fazie onboarding, a ta strona zostanie zaktualizowana, gdy integracja będzie gotowa. Druga połowa tego porównania jest dostępna od razu: gpt-5.6-luna od 0,022 USD wej. / 0,134 USD wyj. za 1M tokenów (3 trasy w sprzedaży, około 89% poniżej cennika OpenAI 0,20 / 1,20 USD), glm-5.3-flash od 0,105 / 0,35 USD (3 trasy, około 30% taniej niż cennik Zhipu) oraz deepseek-flash od 0,15 / 0,60 USD (1 trasa, w stawce poza szczytem samego DeepSeek). Dla części eskalującej w poniższym wzorcu gpt-5.6-sol zaczyna się od 0,297 / 1,781 USD na 19 trasach. Jeden klucz zgodny z OpenAI obsługuje je wszystkie — zobacz kartę Luna i marketplace modeli. Ceny tras zależą od podaży kanałów; liczy się liczba na aktualnej karcie. Sprawdzone 20 września 2026.

Test GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 i GPT Image 2 dostępne)

Zarejestruj się i odbierz $20 na test GPT

Odbierz teraz

To nie jest pytanie „lepszy czy gorszy"

Jev i LLM odpowiadają na różne pytania. Jev odpowiada który, ile lub jak prawdopodobnie; LLM odpowiada co należy napisać.

Jev Generatywny LLM
Wyjście Typowane odpowiedzi z prawdopodobieństwem dla każdej opcji i wartością pewności Tekst, opcjonalnie ograniczony do schematu JSON
Podstawa kosztu Tylko tokeny wejściowe; wyjście jest darmowe Tokeny wejściowe plus wyjściowe
Kształt opóźnienia Jedno przejście w przód; pytania rozgałęziają się równolegle na jednym stanie Sekwencyjnie generowane tokeny; modele rozumujące dodają długie ukryte przejście
Pewność Skalibrowana liczba, którą możesz progować Zwykle brak lub samodzielnie zgłoszone zdanie
Schemat Zgodny z założenia Zgodny, dopóki model nie zdecyduje, że nie jest
Znane wejście Tylko tekst i stan strukturalny, bez obrazów Tekst, a dla modeli multimodalnych obrazy
Wygrywa w Wąskie, wysokowolumenowe oceny Generowanie, rozumowanie, wyjaśnianie, arytmetyka

W momencie, gdy przestajesz potrzebować tekstu na wyjściu, arytmetyka się zmienia. Zadanie o kształcie klasyfikatora, które produkuje dwadzieścia tokenów prozy na element, płaci za te tokeny przy każdym elemencie, na zawsze.

Pytanie o dokładność, z prawdziwymi liczbami

Porównania marketingowe zwykle zestawiają ulubiony benchmark jednego dostawcy z najgorszym wynikiem drugiego. Użyteczny opublikowany test, jaki znaleźliśmy, to wczesnodostępny artykuł Emila Lindforsa, An early-access test of TypeSafe's Jev, przeprowadzony na 24 odpowiedziach na norweskie konsultacje z 2022 r. dotyczące podatku od renty z zasobów w hodowli łososi.

Najpierw oznaczył wszystko za pomocą Claude Fable 5.1 w dwóch niezależnych przebiegach, a następnie porównał Jev 1.13 z DeepSeek V4.1 Flash przez OpenRouter — te same pytania w jednym prompcie, wyjście JSON, raz z włączonym rozumowaniem i raz bez.

Zadanie Jev 1.13 DeepSeek, rozumowanie wył. DeepSeek, rozumowanie wł.
Stanowisko, 4 opcje 20 z 24 20 z 24 22 z 24
Typ respondenta, 6 opcji 21 z 23 22 z 23 23 z 23
Argumenty, 192 tak/nie 0,86 0,89 0,88
Istota, dokładny poziom 19 z 24 14 z 24 14 z 24

Z tej tabeli warto odczytać dwie rzeczy. Po pierwsze, autor wyraźnie zaznacza, że jest to zgodność z etykietami modelu frontier, a nie poprawność — tam, gdzie referencja się myli, a Jev ma rację, Jev jest oceniany jako błędny. Przy 24 dokumentach 95-procentowy przedział dla liczby dotyczącej stanowiska wynosi około ±15 punktów, więc trzy kolumny są takie same dla stanowiska i argumentów. Po drugie, jedyne wyraźne zwycięstwo dotyczy uporządkowanej skali Score, 19 wobec 14: to prymityw robiący dokładnie to, do czego został stworzony, i to rodzaj wyniku, którego w ogóle nie uzyskałbyś z odpowiedzi tekstowej.

Każdy, kto na podstawie tych dowodów twierdzi, że model decyzyjny jest kategorycznie dokładniejszy niż LLM, nadinterpretuje próbę 24 dokumentów. Ciekawsze jest twierdzenie węższe.

Pytanie o koszt

Ten sam test wycenił pracę na 1000 dokumentów:

Jev 1.13 DeepSeek, rozumowanie wył. DeepSeek, rozumowanie wł.
Koszt na 1000 dokumentów 0,22 USD 1,31 USD 3,08 USD
Mediana opóźnienia 0,32 s 2,7 s 26 s
Najwolniejsze żądanie 1,3 s 17,9 s 250 s

Mniej więcej jedna szósta i jedna czternasta dwóch konfiguracji LLM, przy mniej więcej jednej ósmej i jednej osiemdziesiątej mediany opóźnienia. Własne podsumowanie przyczyny przez autora: rezygnacja z generowania tekstu jest powodem, dla którego cena spada tak daleko, a tokeny rozumowania kupiły dwie dodatkowe etykiety stanowiska na 24 za dziesięciokrotność opóźnienia.

To jedno obciążenie, jeden język, jeden dzień. Twoje liczby będą inne — sama wydajność tokenizera je zmienia. Ten sam artykuł zmierzył tokenizer Jeva na około 2,06 znaku na token w języku norweskim, wobec ~4 znaków na token, które zakładałbyś dla angielskiego, co zmniejsza użyteczny budżet stanu z około 120 000 znaków do około 64 000.

Kalibracja to rzeczywista różnica

To jest część, która decyduje o tym, czy możesz zautomatyzować proces. Model, który ma rację w 86% przypadków i wie, w których 14% się myli, to inne narzędzie niż model, który ma rację w 88% przypadków i brzmi równie pewnie w każdej sprawie.

Z tego samego przebiegu, na 192 ocenach argumentów:

Deklarowane prawdopodobieństwo Jeva Oceny Referencja się zgodziła
0,0 – 0,1 14 0%
0,1 – 0,3 56 4%
0,3 – 0,7 41 34%
0,7 – 0,9 38 97%
0,9 – 1,0 43 98%

Kierunek jest właściwy na każdym kroku, a model jest nieco zbyt mało pewny siebie na obu końcach — własnym celem TypeSafe jest to, że wyniki przypisane 0,8 powinny występować w około 80% przypadków, a środkowy przedział wypadł na 34%, a nie ~50%.

Praktyczna wersja tej tabeli to próg. Dzieląc pytania wyboru według najwyższego prawdopodobieństwa:

Najwyższe prawdopodobieństwo ≥ 0,9 Poniżej 0,9
Stanowisko 14 z 15 się zgadza 6 z 9 się zgadza
Typ respondenta 20 z 20 się zgadza 1 z 3 się zgadza

To jest wzorzec operacyjny: akceptuj pewną większość, eskaluj resztę. Własny podręcznik TypeSafe dotyczący dokumentów SEC donosi o 27 z 30 poprawnych przy 0,9 lub wyżej w języku angielskim; norweski przebieg uzyskał 14 z 15.

Porównanie działa tylko w jedną stronę. Z włączonym rozumowaniem DeepSeek umieścił 84 ze swoich 192 odpowiedzi na argumenty powyżej 0,9 — a w oknie 0,7–0,9 jego etykiety zgadzały się z referencją w 48% przypadków. Model, którego pewność nie jest skalibrowana, nie może być używany jako bramka, niezależnie od tego, jak dobre są jego odpowiedzi.

Gdzie LLM wciąż jest właściwym wyborem

  • Generowanie. Jev nie napisze podsumowania, odpowiedzi ani komunikatu commita. Własna dokumentacja TypeSafe kieruje generowanie do modelu generatywnego.
  • Rozumowanie i pytania wieloetapowe. TypeSafe wymienia pośredniość jako znaną słabość: pytania z podwójnymi przeczeniami lub wieloma krokami kosztują dokładność.
  • Arytmetyka, daty i liczenie. Udokumentowane jako zawodne, a błąd rośnie wraz z rozmiarem liczonej rzeczy. Trzymaj to w kodzie.
  • Obrazy i dźwięk. Jev obsługuje tylko tekst. W TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Bartosz Mikulski przekształcił 400 szkiców w ciągi współrzędnych SVG i poprosił Jeva o ich nazwanie. Pobił wyraźnie dziesięcioklasową losową linię bazową, przegrał z Claude Sonnet 5 i odpowiedział „samolot" dla ponad połowy rysunków. Ta sama treść zakodowana jako base64 wylądowała na poziomie losowości — użyteczne przypomnienie, że model tekstowy czytający liczby czyta je jako tekst.
  • Wszystko, co wymaga wyjaśnienia. „Dlaczego oznaczyłeś to w ten sposób" nie jest pytaniem, na które odpowiada prawdopodobieństwo.

Założyciel TypeSafe przedstawia pokrewny argument po stronie LLM, który warto znać, ponieważ podważa popularny obejście: w wątku premierowym argumentował, że dekodowanie z ograniczeniami, takie jak stosowane w strukturyzowanych wyjściach w stylu OpenAI, czyni modele głupszymi, ponieważ maskowanie nieprawidłowych tokenów nie jest tym samym co brak dezorientacji modelu co do nich. Traktuj to jako stanowisko dostawcy, a nie ustalony wynik — ale oznacza to, że „po prostu wymuś JSON z taniego modelu" nie jest automatycznie równoważne typowanej odpowiedzi.

Wzorzec, który działa

Najbardziej użyteczny wniosek z norweskiego artykułu jest taki, że wybór nie jest alternatywą. Własny projekt autora używał trzech modeli do trzech zadań:

Zadanie Model Dlaczego
48 starannych etykiet referencyjnych Fable 5.1 Mało dokumentów, decyzje uznaniowe, koszt nie ma znaczenia
Każdy dokument, każde pytanie Jev Niski koszt, szybki i mówi, kiedy nie jest pewien
Druga opinia na temat niepewnej jednej trzeciej DeepSeek lub człowiek Wolniejszy i droższy, więc tylko tam, gdzie jest potrzebny

Możesz uruchomić ten wzorzec już dziś z jednym kluczem zgodnym z OpenAI, używając niskokosztowej warstwy jako pierwszego przebiegu i mocniejszej tylko dla przypadków, których pierwszy przebieg nie rozstrzygnie:

  1. Pierwszy przebieg na najtańszej warstwie, która spełnia twój próg. gpt-5.6-luna za 0,022 / 0,134 USD za 1M lub glm-5.3-flash za 0,105 / 0,35 USD, lub deepseek-flash za 0,15 / 0,60 USD.
  2. Wymuś decyzję w zamkniętym zbiorze w prompcie i poproś o wynik pewności obok niej. Traktuj wynik jako wskazówkę, a nie jako skalibrowane prawdopodobieństwo — to jest luka, którą wypełnia model decyzyjny, a inżynieria promptów nie.
  3. Eskaluj tylko to, co spada poniżej twojego progu. gpt-5.6-sol od 0,297 / 1,781 USD na 19 trasach lub gemini-3.8-flash od 0,20 / 1,00 USD na 7.
  4. Trzymaj arytmetykę, daty i liczenie we własnym kodzie, dla obu warstw. Jest taniej i jest poprawnie.
  5. Zmierz własny wskaźnik zgodności przed skalowaniem. Pięćdziesiąt ręcznie oznaczonych elementów powie ci więcej niż jakakolwiek tabela benchmarków, w tym ta.

Ekonomia tego wzorca jest powodem, dla którego routing istnieje jako kategoria: pierwszy przebieg to miejsce, do którego trafia niemal cały wolumen, a warstwa eskalacji to miejsce, z którego pochodzi niemal cała jakość. Drugiej potrzebujesz tylko dla mniejszości, której nie potrafisz sklasyfikować.

Załóż konto APIMaster, dodaj kredyt pay-as-you-go od 1 USD, utwórz klucz w konsoli i skieruj klienta zgodnego z OpenAI na https://apimaster.ai/v1 z dowolnym z powyższych identyfikatorów modeli. Jeden klucz obejmuje rodziny GPT, GLM, DeepSeek, Gemini i Claude, więc ścieżka eskalacji pozostaje w tej samej integracji. Zweryfikuj trasę za pomocą testera modeli, zanim przeniesiesz ruch produkcyjny.

FAQ

Czy Jev jest modelem językowym? Nie. TypeSafe opisuje go jako model danych strukturalnych, a własne sformułowanie założyciela w wątku premierowym jest takie, że „technicznie nie jest modelem językowym (nie generuje języka)". Czyta tekst i zwraca decyzje.

Czy Jev jest dokładniejszy niż LLM? Nie w mierzalnym stopniu, na podstawie opublikowanych dowodów. W norweskim teście na 24 dokumentach Jev i DeepSeek V4.1 Flash zgadzały się z etykietami referencyjnymi w tym samym stopniu w pytaniach o stanowisko i argumenty. Jev był wyraźnie z przodu w jednym zadaniu na skali uporządkowanej.

Czy Jev jest tańszy niż LLM? Tak, na zadanie — nie na token wejściowy. Cena Jeva 0,042 USD za 1M tokenów wejściowych jest podcinana przez gpt-5.6-luna za 0,022 USD na wejściu, ale Jev nie emituje żadnych tokenów wyjściowych, a modele generatywne są rozliczane za wyjście. W opublikowanym obciążeniu dało to 0,22 USD na 1000 dokumentów wobec 1,31 USD i 3,08 USD.

Czym jest „LLM as a judge" i czym się różni? LLM-as-a-judge oznacza poproszenie modelu generatywnego o ocenę lub oznaczenie czegoś i odczytanie odpowiedzi z jego tekstu. To działa, ale płacisz za tekst, czekasz na tokeny, a pewność, którą otrzymujesz z powrotem, nie jest skalibrowanym prawdopodobieństwem. Model decyzyjny zwraca tę samą ocenę jako typowaną odpowiedź, którą możesz progować.

Czy mogę po prostu wymusić wyjście JSON z taniego modelu? To daje ci schemat, nie kalibrację. Dekodowanie z ograniczeniami sprawia, że wyjście się parsuje; nie mówi ci, którym odpowiedziom nie ufać, a TypeSafe argumentuje, że może obniżyć jakość, maskując tokeny, co do których model był naprawdę niepewny.

Którego powinienem użyć do klasyfikacji? Jeśli podejmujesz kilka decyzji, gdzie dokładność jest wszystkim i możesz je przejrzeć, dobry LLM wystarczy. Jeśli podejmujesz wiele decyzji i musisz zautomatyzować, użyj tego, co zwraca użyteczny sygnał pewności, i eskaluj niepewne przypadki.

Czy Jev obsługuje tekst w językach innych niż angielski? Tak, z zastrzeżeniami. TypeSafe mówi, że angielski jest językiem, w którym dokładność jest najlepsza, a inne języki, w tym CJK, są obsługiwane, ale nie równie dobrze. Powyższy norweski test wykazał, że poprawnie odczytuje zeskanowane protokoły rady, a także zmierzył wydajność tokenizera na około 2,06 znaku na token — warto to sprawdzić we własnym języku, zanim zaplanujesz wokół limitu kontekstu.

Czy Jev widzi obrazy? Nie. Obsługuje tylko tekst. Przekształcenie obrazu w tekst i pytanie o niego Jeva może pobić losowość, ale przegrywa wyraźnie z modelem, który naprawdę widzi.

Czy Jev jest dostępny na APIMaster? Jeszcze nie w sprzedaży — Jev jest w fazie onboarding na APIMaster, a ta strona zostanie zaktualizowana, gdy integracja będzie gotowa. Modele po drugiej stronie tego porównania są dostępne teraz.

Od którego niskokosztowego modelu powinienem zacząć pierwszy przebieg? gpt-5.6-luna to najtańsza warstwa na marketplace za 0,022 / 0,134 USD za 1M tokenów na 3 trasach — najniższa stawka wejściowa i wyjściowa w tabeli tego artykułu. glm-5.3-flash za 0,105 / 0,35 USD i deepseek-flash za 0,15 / 0,60 USD to kolejne kroki w górę. Zmierz na własnych danych, zanim zobowiążesz wolumen.

Źródła i dalsza lektura

Wyniki testów zewnętrznych są przytoczone w formie, w jakiej opublikowali je ich autorzy; żaden z autorów nie otrzymał wynagrodzenia za swój artykuł ani nie recenzował tej strony. Ceny tras APIMaster zostały odczytane 20 września 2026. Onboarding Jeva na APIMaster jest w toku, a ta strona będzie aktualizowana wraz z jego postępem.