Jev vs LLM: gdzie model decyzyjny bije promptowanie, a gdzie nie
Jev zwraca typowane prawdopodobieństwa; LLM zwraca tekst, który musisz sparsować. Testy zewnętrzne podają koszt na 1000 dokumentów na poziomie 0,22 USD wobec 1,31–3,08 USD, a decydująca różnica to pewność, nie dokładność.
Published 2026-09-20
Jeśli chodzi o dokładność, uczciwa odpowiedź brzmi: remisują. Najbardziej szczegółowe opublikowane porównanie, jakie znaleźliśmy, uruchomiło oba podejścia na tych samych 24 norweskich dokumentach konsultacyjnych i wykazało, że Jev oraz DeepSeek V4.1 Flash zgadzały się z etykietami referencyjnymi w praktycznie tym samym stopniu — 20 z 24 dla stanowiska, 0,86 wobec 0,89 w 192 ocenach argumentów typu tak/nie, co mieści się w szumie próby 24 dokumentów. Tym, co je różniło, nie było to, który ma rację. Było to czy model mówi ci, kiedy nie jest pewien.
Trzy różnice decydują o wyborze w środowisku produkcyjnym:
- Struktura kosztów. Jev pobiera 42 USD za miliard tokenów wejściowych (0,042 USD za 1M) i nic za wyjście, ponieważ nie emituje żadnych tokenów. Model generatywny płaci za jedno i drugie, a model rozumujący płaci za dużo myślenia: w tym samym teście DeepSeek napisał 47 000 tokenów rozumowania, aby wypełnić 24 formularze.
- Kalibracja. Kiedy Jev podawał prawdopodobieństwo 0,8, etykieta referencyjna zgadzała się w około 80% przypadków. Kiedy DeepSeek z włączonym rozumowaniem zapisywał 0,8, referencja zgadzała się w około połowie przypadków. To jest cały argument za modelem decyzyjnym: możesz ustawić próg i mu zaufać.
- Kontrakt wyjściowy. Jev zwraca typowane odpowiedzi —
Choice,Score,Noul— z prawdopodobieństwem i wartością pewności. LLM zwraca tekst, który parsujesz, a jego deklarowana pewność to zdanie, nie liczba, na której możesz rozgałęziać logikę.
Gdzie LLM wciąż wygrywa: wszystko, co wymaga generowania, wyjaśniania, wieloetapowego rozumowania, arytmetyki lub pracy z długimi dokumentami. W jednym publicznym teście tekstowy Jev został poproszony o nazwanie 400 odręcznych szkiców przekształconych na ciągi współrzędnych; pobił losowość z dużym marginesem, przegrał z Claude Sonnet 5 i odpowiedział „samolot" dla ponad połowy z nich.
Co możesz kupić już dziś. Jev nie jest w sprzedaży na APIMaster — jest w fazie onboarding, a ta strona zostanie zaktualizowana, gdy integracja będzie gotowa. Druga połowa tego porównania jest dostępna od razu: gpt-5.6-luna od 0,022 USD wej. / 0,134 USD wyj. za 1M tokenów (3 trasy w sprzedaży, około 89% poniżej cennika OpenAI 0,20 / 1,20 USD), glm-5.3-flash od 0,105 / 0,35 USD (3 trasy, około 30% taniej niż cennik Zhipu) oraz deepseek-flash od 0,15 / 0,60 USD (1 trasa, w stawce poza szczytem samego DeepSeek). Dla części eskalującej w poniższym wzorcu gpt-5.6-sol zaczyna się od 0,297 / 1,781 USD na 19 trasach. Jeden klucz zgodny z OpenAI obsługuje je wszystkie — zobacz kartę Luna i marketplace modeli. Ceny tras zależą od podaży kanałów; liczy się liczba na aktualnej karcie. Sprawdzone 20 września 2026.
Test GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 i GPT Image 2 dostępne)
Zarejestruj się i odbierz $20 na test GPT
To nie jest pytanie „lepszy czy gorszy"
Jev i LLM odpowiadają na różne pytania. Jev odpowiada który, ile lub jak prawdopodobnie; LLM odpowiada co należy napisać.
| Jev | Generatywny LLM | |
|---|---|---|
| Wyjście | Typowane odpowiedzi z prawdopodobieństwem dla każdej opcji i wartością pewności | Tekst, opcjonalnie ograniczony do schematu JSON |
| Podstawa kosztu | Tylko tokeny wejściowe; wyjście jest darmowe | Tokeny wejściowe plus wyjściowe |
| Kształt opóźnienia | Jedno przejście w przód; pytania rozgałęziają się równolegle na jednym stanie | Sekwencyjnie generowane tokeny; modele rozumujące dodają długie ukryte przejście |
| Pewność | Skalibrowana liczba, którą możesz progować | Zwykle brak lub samodzielnie zgłoszone zdanie |
| Schemat | Zgodny z założenia | Zgodny, dopóki model nie zdecyduje, że nie jest |
| Znane wejście | Tylko tekst i stan strukturalny, bez obrazów | Tekst, a dla modeli multimodalnych obrazy |
| Wygrywa w | Wąskie, wysokowolumenowe oceny | Generowanie, rozumowanie, wyjaśnianie, arytmetyka |
W momencie, gdy przestajesz potrzebować tekstu na wyjściu, arytmetyka się zmienia. Zadanie o kształcie klasyfikatora, które produkuje dwadzieścia tokenów prozy na element, płaci za te tokeny przy każdym elemencie, na zawsze.
Pytanie o dokładność, z prawdziwymi liczbami
Porównania marketingowe zwykle zestawiają ulubiony benchmark jednego dostawcy z najgorszym wynikiem drugiego. Użyteczny opublikowany test, jaki znaleźliśmy, to wczesnodostępny artykuł Emila Lindforsa, An early-access test of TypeSafe's Jev, przeprowadzony na 24 odpowiedziach na norweskie konsultacje z 2022 r. dotyczące podatku od renty z zasobów w hodowli łososi.
Najpierw oznaczył wszystko za pomocą Claude Fable 5.1 w dwóch niezależnych przebiegach, a następnie porównał Jev 1.13 z DeepSeek V4.1 Flash przez OpenRouter — te same pytania w jednym prompcie, wyjście JSON, raz z włączonym rozumowaniem i raz bez.
| Zadanie | Jev 1.13 | DeepSeek, rozumowanie wył. | DeepSeek, rozumowanie wł. |
|---|---|---|---|
| Stanowisko, 4 opcje | 20 z 24 | 20 z 24 | 22 z 24 |
| Typ respondenta, 6 opcji | 21 z 23 | 22 z 23 | 23 z 23 |
| Argumenty, 192 tak/nie | 0,86 | 0,89 | 0,88 |
| Istota, dokładny poziom | 19 z 24 | 14 z 24 | 14 z 24 |
Z tej tabeli warto odczytać dwie rzeczy. Po pierwsze, autor wyraźnie zaznacza, że jest to zgodność z etykietami modelu frontier, a nie poprawność — tam, gdzie referencja się myli, a Jev ma rację, Jev jest oceniany jako błędny. Przy 24 dokumentach 95-procentowy przedział dla liczby dotyczącej stanowiska wynosi około ±15 punktów, więc trzy kolumny są takie same dla stanowiska i argumentów. Po drugie, jedyne wyraźne zwycięstwo dotyczy uporządkowanej skali Score, 19 wobec 14: to prymityw robiący dokładnie to, do czego został stworzony, i to rodzaj wyniku, którego w ogóle nie uzyskałbyś z odpowiedzi tekstowej.
Każdy, kto na podstawie tych dowodów twierdzi, że model decyzyjny jest kategorycznie dokładniejszy niż LLM, nadinterpretuje próbę 24 dokumentów. Ciekawsze jest twierdzenie węższe.
Pytanie o koszt
Ten sam test wycenił pracę na 1000 dokumentów:
| Jev 1.13 | DeepSeek, rozumowanie wył. | DeepSeek, rozumowanie wł. | |
|---|---|---|---|
| Koszt na 1000 dokumentów | 0,22 USD | 1,31 USD | 3,08 USD |
| Mediana opóźnienia | 0,32 s | 2,7 s | 26 s |
| Najwolniejsze żądanie | 1,3 s | 17,9 s | 250 s |
Mniej więcej jedna szósta i jedna czternasta dwóch konfiguracji LLM, przy mniej więcej jednej ósmej i jednej osiemdziesiątej mediany opóźnienia. Własne podsumowanie przyczyny przez autora: rezygnacja z generowania tekstu jest powodem, dla którego cena spada tak daleko, a tokeny rozumowania kupiły dwie dodatkowe etykiety stanowiska na 24 za dziesięciokrotność opóźnienia.
To jedno obciążenie, jeden język, jeden dzień. Twoje liczby będą inne — sama wydajność tokenizera je zmienia. Ten sam artykuł zmierzył tokenizer Jeva na około 2,06 znaku na token w języku norweskim, wobec ~4 znaków na token, które zakładałbyś dla angielskiego, co zmniejsza użyteczny budżet stanu z około 120 000 znaków do około 64 000.
Kalibracja to rzeczywista różnica
To jest część, która decyduje o tym, czy możesz zautomatyzować proces. Model, który ma rację w 86% przypadków i wie, w których 14% się myli, to inne narzędzie niż model, który ma rację w 88% przypadków i brzmi równie pewnie w każdej sprawie.
Z tego samego przebiegu, na 192 ocenach argumentów:
| Deklarowane prawdopodobieństwo Jeva | Oceny | Referencja się zgodziła |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
Kierunek jest właściwy na każdym kroku, a model jest nieco zbyt mało pewny siebie na obu końcach — własnym celem TypeSafe jest to, że wyniki przypisane 0,8 powinny występować w około 80% przypadków, a środkowy przedział wypadł na 34%, a nie ~50%.
Praktyczna wersja tej tabeli to próg. Dzieląc pytania wyboru według najwyższego prawdopodobieństwa:
| Najwyższe prawdopodobieństwo ≥ 0,9 | Poniżej 0,9 | |
|---|---|---|
| Stanowisko | 14 z 15 się zgadza | 6 z 9 się zgadza |
| Typ respondenta | 20 z 20 się zgadza | 1 z 3 się zgadza |
To jest wzorzec operacyjny: akceptuj pewną większość, eskaluj resztę. Własny podręcznik TypeSafe dotyczący dokumentów SEC donosi o 27 z 30 poprawnych przy 0,9 lub wyżej w języku angielskim; norweski przebieg uzyskał 14 z 15.
Porównanie działa tylko w jedną stronę. Z włączonym rozumowaniem DeepSeek umieścił 84 ze swoich 192 odpowiedzi na argumenty powyżej 0,9 — a w oknie 0,7–0,9 jego etykiety zgadzały się z referencją w 48% przypadków. Model, którego pewność nie jest skalibrowana, nie może być używany jako bramka, niezależnie od tego, jak dobre są jego odpowiedzi.
Gdzie LLM wciąż jest właściwym wyborem
- Generowanie. Jev nie napisze podsumowania, odpowiedzi ani komunikatu commita. Własna dokumentacja TypeSafe kieruje generowanie do modelu generatywnego.
- Rozumowanie i pytania wieloetapowe. TypeSafe wymienia pośredniość jako znaną słabość: pytania z podwójnymi przeczeniami lub wieloma krokami kosztują dokładność.
- Arytmetyka, daty i liczenie. Udokumentowane jako zawodne, a błąd rośnie wraz z rozmiarem liczonej rzeczy. Trzymaj to w kodzie.
- Obrazy i dźwięk. Jev obsługuje tylko tekst. W TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Bartosz Mikulski przekształcił 400 szkiców w ciągi współrzędnych SVG i poprosił Jeva o ich nazwanie. Pobił wyraźnie dziesięcioklasową losową linię bazową, przegrał z Claude Sonnet 5 i odpowiedział „samolot" dla ponad połowy rysunków. Ta sama treść zakodowana jako base64 wylądowała na poziomie losowości — użyteczne przypomnienie, że model tekstowy czytający liczby czyta je jako tekst.
- Wszystko, co wymaga wyjaśnienia. „Dlaczego oznaczyłeś to w ten sposób" nie jest pytaniem, na które odpowiada prawdopodobieństwo.
Założyciel TypeSafe przedstawia pokrewny argument po stronie LLM, który warto znać, ponieważ podważa popularny obejście: w wątku premierowym argumentował, że dekodowanie z ograniczeniami, takie jak stosowane w strukturyzowanych wyjściach w stylu OpenAI, czyni modele głupszymi, ponieważ maskowanie nieprawidłowych tokenów nie jest tym samym co brak dezorientacji modelu co do nich. Traktuj to jako stanowisko dostawcy, a nie ustalony wynik — ale oznacza to, że „po prostu wymuś JSON z taniego modelu" nie jest automatycznie równoważne typowanej odpowiedzi.
Wzorzec, który działa
Najbardziej użyteczny wniosek z norweskiego artykułu jest taki, że wybór nie jest alternatywą. Własny projekt autora używał trzech modeli do trzech zadań:
| Zadanie | Model | Dlaczego |
|---|---|---|
| 48 starannych etykiet referencyjnych | Fable 5.1 | Mało dokumentów, decyzje uznaniowe, koszt nie ma znaczenia |
| Każdy dokument, każde pytanie | Jev | Niski koszt, szybki i mówi, kiedy nie jest pewien |
| Druga opinia na temat niepewnej jednej trzeciej | DeepSeek lub człowiek | Wolniejszy i droższy, więc tylko tam, gdzie jest potrzebny |
Możesz uruchomić ten wzorzec już dziś z jednym kluczem zgodnym z OpenAI, używając niskokosztowej warstwy jako pierwszego przebiegu i mocniejszej tylko dla przypadków, których pierwszy przebieg nie rozstrzygnie:
- Pierwszy przebieg na najtańszej warstwie, która spełnia twój próg.
gpt-5.6-lunaza 0,022 / 0,134 USD za 1M lubglm-5.3-flashza 0,105 / 0,35 USD, lubdeepseek-flashza 0,15 / 0,60 USD. - Wymuś decyzję w zamkniętym zbiorze w prompcie i poproś o wynik pewności obok niej. Traktuj wynik jako wskazówkę, a nie jako skalibrowane prawdopodobieństwo — to jest luka, którą wypełnia model decyzyjny, a inżynieria promptów nie.
- Eskaluj tylko to, co spada poniżej twojego progu.
gpt-5.6-solod 0,297 / 1,781 USD na 19 trasach lubgemini-3.8-flashod 0,20 / 1,00 USD na 7. - Trzymaj arytmetykę, daty i liczenie we własnym kodzie, dla obu warstw. Jest taniej i jest poprawnie.
- Zmierz własny wskaźnik zgodności przed skalowaniem. Pięćdziesiąt ręcznie oznaczonych elementów powie ci więcej niż jakakolwiek tabela benchmarków, w tym ta.
Ekonomia tego wzorca jest powodem, dla którego routing istnieje jako kategoria: pierwszy przebieg to miejsce, do którego trafia niemal cały wolumen, a warstwa eskalacji to miejsce, z którego pochodzi niemal cała jakość. Drugiej potrzebujesz tylko dla mniejszości, której nie potrafisz sklasyfikować.
Załóż konto APIMaster, dodaj kredyt pay-as-you-go od 1 USD, utwórz klucz w konsoli i skieruj klienta zgodnego z OpenAI na https://apimaster.ai/v1 z dowolnym z powyższych identyfikatorów modeli. Jeden klucz obejmuje rodziny GPT, GLM, DeepSeek, Gemini i Claude, więc ścieżka eskalacji pozostaje w tej samej integracji. Zweryfikuj trasę za pomocą testera modeli, zanim przeniesiesz ruch produkcyjny.
FAQ
Czy Jev jest modelem językowym? Nie. TypeSafe opisuje go jako model danych strukturalnych, a własne sformułowanie założyciela w wątku premierowym jest takie, że „technicznie nie jest modelem językowym (nie generuje języka)". Czyta tekst i zwraca decyzje.
Czy Jev jest dokładniejszy niż LLM? Nie w mierzalnym stopniu, na podstawie opublikowanych dowodów. W norweskim teście na 24 dokumentach Jev i DeepSeek V4.1 Flash zgadzały się z etykietami referencyjnymi w tym samym stopniu w pytaniach o stanowisko i argumenty. Jev był wyraźnie z przodu w jednym zadaniu na skali uporządkowanej.
Czy Jev jest tańszy niż LLM?
Tak, na zadanie — nie na token wejściowy. Cena Jeva 0,042 USD za 1M tokenów wejściowych jest podcinana przez gpt-5.6-luna za 0,022 USD na wejściu, ale Jev nie emituje żadnych tokenów wyjściowych, a modele generatywne są rozliczane za wyjście. W opublikowanym obciążeniu dało to 0,22 USD na 1000 dokumentów wobec 1,31 USD i 3,08 USD.
Czym jest „LLM as a judge" i czym się różni? LLM-as-a-judge oznacza poproszenie modelu generatywnego o ocenę lub oznaczenie czegoś i odczytanie odpowiedzi z jego tekstu. To działa, ale płacisz za tekst, czekasz na tokeny, a pewność, którą otrzymujesz z powrotem, nie jest skalibrowanym prawdopodobieństwem. Model decyzyjny zwraca tę samą ocenę jako typowaną odpowiedź, którą możesz progować.
Czy mogę po prostu wymusić wyjście JSON z taniego modelu? To daje ci schemat, nie kalibrację. Dekodowanie z ograniczeniami sprawia, że wyjście się parsuje; nie mówi ci, którym odpowiedziom nie ufać, a TypeSafe argumentuje, że może obniżyć jakość, maskując tokeny, co do których model był naprawdę niepewny.
Którego powinienem użyć do klasyfikacji? Jeśli podejmujesz kilka decyzji, gdzie dokładność jest wszystkim i możesz je przejrzeć, dobry LLM wystarczy. Jeśli podejmujesz wiele decyzji i musisz zautomatyzować, użyj tego, co zwraca użyteczny sygnał pewności, i eskaluj niepewne przypadki.
Czy Jev obsługuje tekst w językach innych niż angielski? Tak, z zastrzeżeniami. TypeSafe mówi, że angielski jest językiem, w którym dokładność jest najlepsza, a inne języki, w tym CJK, są obsługiwane, ale nie równie dobrze. Powyższy norweski test wykazał, że poprawnie odczytuje zeskanowane protokoły rady, a także zmierzył wydajność tokenizera na około 2,06 znaku na token — warto to sprawdzić we własnym języku, zanim zaplanujesz wokół limitu kontekstu.
Czy Jev widzi obrazy? Nie. Obsługuje tylko tekst. Przekształcenie obrazu w tekst i pytanie o niego Jeva może pobić losowość, ale przegrywa wyraźnie z modelem, który naprawdę widzi.
Czy Jev jest dostępny na APIMaster? Jeszcze nie w sprzedaży — Jev jest w fazie onboarding na APIMaster, a ta strona zostanie zaktualizowana, gdy integracja będzie gotowa. Modele po drugiej stronie tego porównania są dostępne teraz.
Od którego niskokosztowego modelu powinienem zacząć pierwszy przebieg?
gpt-5.6-luna to najtańsza warstwa na marketplace za 0,022 / 0,134 USD za 1M tokenów na 3 trasach — najniższa stawka wejściowa i wyjściowa w tabeli tego artykułu. glm-5.3-flash za 0,105 / 0,35 USD i deepseek-flash za 0,15 / 0,60 USD to kolejne kroki w górę. Zmierz na własnych danych, zanim zobowiążesz wolumen.
Źródła i dalsza lektura
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 norweskie dokumenty konsultacyjne, Jev przeciwko DeepSeek V4.1 Flash z rozumowaniem i bez, z zgodnością na zadanie, przedziałami kalibracji, kosztem i opóźnieniem
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 szkiców jako ciągi współrzędnych, losowa linia bazowa i porównanie z Sonnet 5
- TypeSafe — Models — identyfikator modelu, cena 42 USD/Btok, limity szybkości, budżet kontekstu i obsługa języków
- TypeSafe — Jev 1.13 jaggedness — opublikowane notatki o zakresie dotyczące dosłownego czytania, arytmetyki, dat, pośredniości i generowania
- TypeSafe — Introducing System One Models and Jev — liczba 70–500 ms end-to-end i porównanie 40×–200×
- Wątek premierowy na Hacker News — komentarze założyciela o tym, czym Jev nie jest, o dekodowaniu z ograniczeniami i o tym, dlaczego wyjście jest darmowe
Wyniki testów zewnętrznych są przytoczone w formie, w jakiej opublikowali je ich autorzy; żaden z autorów nie otrzymał wynagrodzenia za swój artykuł ani nie recenzował tej strony. Ceny tras APIMaster zostały odczytane 20 września 2026. Onboarding Jeva na APIMaster jest w toku, a ta strona będzie aktualizowana wraz z jego postępem.
