Jev vs LLM:t: Missä päätösmalli voittaa kehotteistamisen, ja missä se ei voita
Jev palauttaa tyypitettyjä todennäköisyyksiä; LLM palauttaa tekstiä, joka sinun on jäsennettävä. Kolmannen osapuolen testeissä hinta 1 000 asiakirjaa kohden on 0,22 $ vastaan 1,31–3,08 $, ja ratkaiseva ero on luottamus, ei tarkkuus.
Published 2026-09-20
Tarkkuudessa rehellinen vastaus on, että ne ovat tasoissa. Yksityiskohtaisin löytämämme julkaistu vertailu ajoi molemmat samaa 24 norjalaisen hallituksen kuulemisasiakirjan aineistoa vasten ja havaitsi, että Jev ja DeepSeek V4.1 Flash olivat yhtä mieltä viiteluokitusten kanssa käytännössä samalla tasolla — 20/24 kannassa, 0,86 vastaan 0,89 kaikkiaan 192 kyllä/ei-argumenttiarvion osalta, mikä mahtuu 24 asiakirjan otoksen kohinaan. Erottava tekijä ei ollut se, kumpi oli oikeassa. Se oli se, kertooko malli sinulle, kun se on epävarma.
Kolme eroa ratkaisee valinnan tuotannossa:
- Kustannusrakenne. Jev veloittaa 42 $ miljardilta syötetokenilta (0,042 $ / 1M) eikä mitään tulosteesta, koska se ei tuota tokeneita. Generatiivinen malli maksaa molemmista, ja päättelymalli maksaa paljosta ajattelusta: samassa testissä DeepSeek kirjoitti 47 000 tokenia päättelyä täyttääkseen 24 lomaketta.
- Kalibrointi. Kun Jev ilmoitti todennäköisyyden 0,8, viiteluokitus oli samaa mieltä noin 80 % ajasta. Kun DeepSeek päättely päällä kirjasi 0,8, viite oli samaa mieltä noin puolet ajasta. Tässä on koko argumentti päätösmallin puolesta: voit asettaa kynnyksen ja luottaa siihen.
- Tulostesopimus. Jev palauttaa tyypitettyjä vastauksia —
Choice,Score,Noul— todennäköisyyden ja luottamusarvon kanssa. LLM palauttaa tekstiä, jonka jäsennät, ja sen ilmoittama luottamus on lause, ei luku, jonka perusteella voisit haarautua.
Missä LLM voittaa edelleen: kaikki, mikä vaatii tuottamista, selittämistä, monivaiheista päättelyä, laskutoimituksia tai pitkien asiakirjojen käsittelyä. Eräässä julkisessa testissä pelkästään tekstiä käsittelevää Jeviä pyydettiin nimeämään 400 käsin piirrettyä luonnosta, jotka oli muunnettu koordinaattijonoiksi; se voitti sattuman selvästi, hävisi Claude Sonnet 5:lle ja vastasi "airplane" yli puoleen niistä.
Mitä voit ostaa tänään. Jev ei ole myynnissä APIMasterissa — se on onboarding-vaiheessa, ja tämä sivu päivitetään, kun integraatio on käytössä. Tämän vertailun toinen puoli on ostettavissa nyt: gpt-5.6-luna alkaen 0,022 $ sisään / 0,134 $ ulos per 1M tokenia (3 reittiä myynnissä, noin 89 % alle OpenAI:n 0,20 $ / 1,20 $ listahinnan), glm-5.3-flash alkaen 0,105 $ / 0,35 $ (3 reittiä, noin 30 % alle Zhipun listahinnan) ja deepseek-flash alkaen 0,15 $ / 0,60 $ (1 reitti, DeepSeekin omalla off-peak-hinnalla). Alla olevan mallin eskalaatiopuolelle gpt-5.6-sol alkaa 0,297 $ / 1,781 $ 19 reitillä. Yksi OpenAI-yhteensopiva avain kattaa ne kaikki — katso Luna-kortti ja mallimarkkinapaikka. Reittien hinnat seuraavat kanavien tarjontaa; live-kortti on luku, jolla on merkitystä. Tarkistettu 20. syyskuuta 2026.
GPT-kokeilu(GPT-6 Astra, GPT-5.6, GPT-5.5 ja GPT Image 2 käytettävissä)
Rekisteröidy ja saat $20 GPT-kokeilun
Kyse ei ole "parempi vai huonompi" -kysymyksestä
Jev ja LLM vastaavat eri kysymyksiin. Jev vastaa kumpi, kuinka paljon vai kuinka todennäköisesti; LLM vastaa mitä pitäisi kirjoittaa.
| Jev | Generatiivinen LLM | |
|---|---|---|
| Tuloste | Tyypitetyt vastaukset, joissa todennäköisyys per vaihtoehto ja luottamusarvo | Teksti, valinnaisesti rajattu JSON-skeemaan |
| Kustannusperuste | Vain syötetokenit; tuloste on ilmainen | Syöte- ja tulostetokenit |
| Viiveen muoto | Yksi eteenpäin suuntautuva läpikäynti; kysymykset hajautuvat rinnakkain yhden tilan yli | Peräkkäin generoidut tokenit; päättelymallit lisäävät pitkän piilotetun vaiheen |
| Luottamus | Kalibroitu luku, jonka voi asettaa kynnykseksi | Yleensä ei mitään, tai itse ilmoitettu lause |
| Skeema | Täsmää rakenteellisesti | Täsmää, kunnes malli päättää, ettei täsmää |
| Tunnettu syöte | Vain teksti ja jäsennelty tila, ei kuvia | Teksti, ja kuvat multimodaalisille malleille |
| Voittaa tässä | Kapeat, suuren volyymin arviot | Tuottaminen, päättely, selittäminen, laskutoimitukset |
Heti kun lakkaat tarvitsemasta tekstiä ulos, aritmetiikka muuttuu. Luokittelijan muotoinen tehtävä, joka tuottaa kaksikymmentä tokenia proosaa per kohde, maksaa noista tokeneista jokaisesta yksittäisestä kohteesta, ikuisesti.
Tarkkuuskysymys, oikeilla luvuilla
Markkinointivertailut vertaavat yleensä kunkin toimittajan suosikkibenchmarkia toisen huonoimpaan. Hyödyllisin löytämämme julkaistu testi on Emil Lindforsin early access -kirjoitus, An early-access test of TypeSafe's Jev, joka ajettiin 24 vastauksella Norjan vuoden 2022 kuulemiseen lohiviljelyn resurssivuokraverosta.
Hän luokitteli kaiken ensin Claude Fable 5.1:llä kahdessa riippumattomassa kierroksessa ja vertasi sitten Jev 1.13:a DeepSeek V4.1 Flashiin OpenRouterin kautta — samat kysymykset yhdessä kehotteessa, JSON ulos, kerran päättely päällä ja kerran pois päältä.
| Tehtävä | Jev 1.13 | DeepSeek, päättely pois | DeepSeek, päättely päällä |
|---|---|---|---|
| Kanta, 4 vaihtoehtoa | 20/24 | 20/24 | 22/24 |
| Vastaajatyyppi, 6 vaihtoehtoa | 21/23 | 22/23 | 23/23 |
| Argumentit, 192 kyllä/ei | 0,86 | 0,89 | 0,88 |
| Substanssi, tarkka taso | 19/24 | 14/24 | 14/24 |
Taulukosta kannattaa lukea kaksi asiaa. Ensinnäkin kirjoittaja toteaa selvästi, että nämä ovat yhtäpitävyyttä frontier-mallin luokitusten kanssa, ei oikeellisuutta — kun viite on väärässä ja Jev oikeassa, Jev pisteytetään vääräksi. 24 asiakirjalla kannan luvun 95 %:n väli on noin ±15 pistettä, joten kolme saraketta ovat samat kannassa ja argumenteissa. Toiseksi ainoa selkeä voitto on järjestetyllä Score-asteikolla, 19 vastaan 14: se on primitiivi tekemässä täsmälleen sitä, mitä varten se rakennettiin, ja se on sellainen tulos, jota et saisi tekstivastauksesta lainkaan.
Kuka tahansa, joka väittää tämän näytön perusteella, että päätösmalli on kategorisesti tarkempi kuin LLM, ylitulkitsee 24 asiakirjan otosta. Kiinnostava väite on kapeampi.
Kustannuskysymys
Sama testi hinnoitteli työn 1 000 asiakirjaa kohden:
| Jev 1.13 | DeepSeek, päättely pois | DeepSeek, päättely päällä | |
|---|---|---|---|
| Hinta 1 000 asiakirjaa kohden | 0,22 $ | 1,31 $ | 3,08 $ |
| Mediaaniviive | 0,32 s | 2,7 s | 26 s |
| Hitain pyyntö | 1,3 s | 17,9 s | 250 s |
Karkeasti kuudesosa ja neljästoistaosa kahdesta LLM-konfiguraatiosta, ja karkeasti kahdeksasosa ja kahdeksaskymmenesosa mediaaniviiveestä. Kirjoittajan oma yhteenveto syystä: tekstintuottamisesta luopuminen on syy, miksi hinta laskee noin paljon, ja päättelytokenit ostivat kaksi ylimääräistä kantaluokitusta 24:stä kymmenkertaisella viiveellä.
Nämä ovat yksi työkuorma, yksi kieli, yksi päivä. Sinun lukusi poikkeavat — pelkkä tokenisoijan tehokkuus muuttaa niitä. Sama kirjoitus mittasi Jevin tokenisoijan noin 2,06 merkkiin per token norjaksi, vastaan noin 4 merkkiä per token, jonka olettaisit englannista, mikä leikkaa käytettävissä olevan tilabudjetin noin 120 000 merkistä noin 64 000:een.
Kalibrointi on todellinen ero
Tämä on se osa, joka ratkaisee, voitko automatisoida. Malli, joka on oikeassa 86 % ajasta ja tietää, minkä 14 % osalta se on väärässä, on eri työkalu kuin malli, joka on oikeassa 88 % ajasta ja kuulostaa yhtä varmalta kaikesta.
Samasta ajosta, 192 argumenttiarvion osalta:
| Jevin ilmoittama todennäköisyys | Arviot | Viite samaa mieltä |
|---|---|---|
| 0,0 – 0,1 | 14 | 0 % |
| 0,1 – 0,3 | 56 | 4 % |
| 0,3 – 0,7 | 41 | 34 % |
| 0,7 – 0,9 | 38 | 97 % |
| 0,9 – 1,0 | 43 | 98 % |
Suunta on oikea joka askeleella, ja malli on hieman aliluottavainen molemmissa päissä — TypeSafen oma tavoite on, että 0,8:ksi merkityt lopputulokset toteutuvat noin 80 % ajasta, ja keskimmäinen lokero tuli 34 %:iin noin 50 %:n sijaan.
Taulukon käytännöllinen versio on kynnys. Valintakysymysten jakaminen korkeimman todennäköisyyden mukaan:
| Korkein todennäköisyys ≥ 0,9 | Alle 0,9 | |
|---|---|---|
| Kanta | 14/15 samaa mieltä | 6/9 samaa mieltä |
| Vastaajatyyppi | 20/20 samaa mieltä | 1/3 samaa mieltä |
Tämä on toimintamalli: hyväksy varma enemmistö, eskaloi loput. TypeSafen oma SEC-ilmoitusten cookbook raportoi 27/30 oikein 0,9:ssä tai sen yläpuolella englanniksi; norjalainen ajo sai 14/15.
Vertailu toimii vain yhteen suuntaan. Päättely päällä DeepSeek asetti 84 sen 192 argumenttivastauksesta yli 0,9:n — ja 0,7–0,9-ikkunassa sen luokitukset täsmäsivät viitteen kanssa 48 % ajasta. Mallia, jonka luottamus ei ole kalibroitu, ei voi käyttää porttina, riippumatta siitä, kuinka hyviä sen vastaukset ovat.
Missä LLM on edelleen oikea valinta
- Tuottaminen. Jev ei kirjoita yhteenvetoa, vastausta tai commit-viestiä. TypeSafen oma dokumentaatio ohjaa tuottamisen generatiiviselle mallille.
- Päättely ja monihyppyiset kysymykset. TypeSafe listaa epäsuoruuden tunnetuksi heikkoudeksi: kysymykset, joissa on kaksoiskieltoja tai useita hyppyjä, maksavat tarkkuudessa.
- Laskutoimitukset, päivämäärät ja laskeminen. Dokumentoitu epäluotettavaksi, ja virhe kasvaa laskettavan asian koon mukana. Pidä se koodissa.
- Kuvat ja ääni. Jev on vain tekstiä. Kirjoituksessa TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Bartosz Mikulski muunsi 400 luonnosta SVG-koordinaattijonoiksi ja pyysi Jeviä nimeämään ne. Se voitti kymmenen vaihtoehdon sattumapohjan selvästi, hävisi Claude Sonnet 5:lle ja vastasi "airplane" yli puoleen piirroksista. Sama sisältö base64-koodattuna päätyi sattuman tasolle — hyödyllinen muistutus siitä, että tekstiä lukeva malli lukee numerot tekstinä.
- Kaikki, mikä vaatii selityksen. "Miksi luokittelit tämän noin" ei ole kysymys, johon todennäköisyys vastaa.
TypeSafen perustaja esittää LLM-puolelle liittyvän argumentin, joka on syytä tuntea, koska se leikkaa yleistä kiertotietä vastaan: julkaisuketjussa hän väitti, että OpenAI-tyylisten jäsenneltyjen tulosteiden käyttämä rajoitettu dekoodaus tekee malleista tyhmempiä, koska virheellisten tokenien peittäminen ei ole sama asia kuin se, ettei malli ole niistä hämmentynyt. Pidä tätä toimittajan kantana, ei vakiintuneena tuloksena — mutta se tarkoittaa, että "pakota vain JSON ulos halvasta mallista" ei automaattisesti vastaa tyypitettyä vastausta.
Toimiva malli
Hyödyllisin johtopäätös norjalaisessa kirjoituksessa on, että valinta ei ole joko-tai. Kirjoittajan oma projekti käytti kolmea mallia kolmeen tehtävään:
| Tehtävä | Malli | Miksi |
|---|---|---|
| 48 huolellista viiteluokitusta | Fable 5.1 | Vähän asiakirjoja, harkintaa vaativia päätöksiä, kustannuksella ei väliä |
| Jokainen asiakirja, jokainen kysymys | Jev | Edullinen, nopea ja kertoo, kun on epävarma |
| Toinen mielipide epävarmasta kolmanneksesta | DeepSeek tai ihminen | Hitaampi ja kalliimpi, joten vain sinne, missä tarvitaan |
Voit ajaa tuota muotoa tänään yhdellä OpenAI-yhteensopivalla avaimella käyttäen edullista tasoa ensimmäisenä kierroksena ja vahvempaa vain niissä tapauksissa, joita ensimmäinen kierros ei pysty ratkaisemaan:
- Ensimmäinen kierros halvimmalla tasolla, joka ylittää rimasi.
gpt-5.6-lunahintaan 0,022 $ / 0,134 $ per 1M, taiglm-5.3-flashhintaan 0,105 $ / 0,35 $, taideepseek-flashhintaan 0,15 $ / 0,60 $. - Pakota päätös suljettuun joukkoon kehotteessa ja pyydä luottamuspisteet sen ohella. Kohtele pistettä vihjeenä, ei kalibroituna todennäköisyytenä — se on aukko, jonka päätösmalli täyttää ja kehotesuunnittelu ei.
- Eskaloi vain se, mikä jää kynnystesi alapuolelle.
gpt-5.6-solalkaen 0,297 $ / 1,781 $ 19 reitillä, taigemini-3.8-flashalkaen 0,20 $ / 1,00 $ 7 reitillä. - Pidä laskutoimitukset, päivämäärät ja laskeminen omassa koodissasi, molemmilla tasoilla. Se on halvempaa ja se on oikein.
- Mittaa oma yhtäpitävyysasteesi ennen skaalausta. Viisikymmentä käsin luokiteltua kohdetta kertoo sinulle enemmän kuin mikään benchmark-taulukko, mukaan lukien tämä.
Tuon mallin taloustiede on syy siihen, miksi reititys on olemassa kategoriana ylipäätään: ensimmäinen kierros on sinne, minne lähes kaikki volyymi menee, ja eskalaatiotaso on sinne, mistä lähes kaikki laatu tulee. Tarvitset toista vain vähemmistölle, jota et pysty luokittelemaan.
Luo APIMaster-tili, lisää pay-as-you-go-krediittiä alkaen 1 $, luo avain konsolissa ja osoita OpenAI-yhteensopiva asiakasohjelma osoitteeseen https://apimaster.ai/v1 millä tahansa yllä olevista mallitunnuksista. Yksi avain kattaa GPT-, GLM-, DeepSeek-, Gemini- ja Claude-perheet, joten eskalaatiopolku pysyy samassa integraatiossa. Validoi reitti mallitestaajalla ennen kuin siirrät tuotantoliikennettä.
FAQ
Onko Jev kielimalli? Ei. TypeSafe kuvailee sitä jäsennellyksi datamalliksi, ja perustajan oma muotoilu julkaisuketjussa on, että se on "teknisesti ottaen ei kielimalli (se ei tuota kieltä)". Se lukee tekstiä ja palauttaa päätöksiä.
Onko Jev tarkempi kuin LLM? Ei mitattavasti julkaistun näytön perusteella. 24 asiakirjan norjalaisessa testissä Jev ja DeepSeek V4.1 Flash olivat yhtä mieltä viiteluokitusten kanssa samalla tasolla kanta- ja argumenttikysymyksissä. Jev oli selvästi edellä yhdessä järjestetyn asteikon tehtävässä.
Onko Jev halvempi kuin LLM?
Kyllä, tehtävää kohden — ei syötetokenia kohden. Jevin 0,042 $ per 1M syötetokenia alittaa gpt-5.6-luna 0,022 $:lla syötteessä, mutta Jev ei tuota lainkaan tulostetokeneita, ja generatiivisista malleista veloitetaan tulosteesta. Julkaistussa työkuormassa se teki 0,22 $ per 1 000 asiakirjaa vastaan 1,31 $ ja 3,08 $.
Mikä on "LLM as a judge" ja miten se eroaa? LLM-as-a-judge tarkoittaa, että pyydät generatiivista mallia arvioimaan tai luokittelemaan jotain ja luet vastauksen sen tekstistä. Se toimii, mutta maksat tekstistä, odotat tokeneita, ja takaisin saamasi luottamus ei ole kalibroitu todennäköisyys. Päätösmalli palauttaa saman arvion tyypitettynä vastauksena, jonka voi asettaa kynnykseksi.
Voinko vain pakottaa JSON-tulosteen halvasta mallista sen sijaan? Se antaa sinulle skeeman, ei kalibrointia. Rajoitettu dekoodaus tekee tulosteesta jäsennettävän; se ei kerro, mitä vastauksia pitäisi epäillä, ja TypeSafe väittää sen voivan heikentää laatua peittämällä tokeneita, joista malli oli aidosti epävarma.
Kumpaa minun pitäisi käyttää luokitteluun? Jos teet muutamia arvioita, joissa tarkkuus on kaikki kaikessa ja voit tarkistaa ne, hyvä LLM riittää. Jos teet monia arvioita ja sinun on automatisoitava, käytä sitä, mikä palauttaa käyttökelpoisen luottamussignaalin, ja eskaloi epävarmat.
Käsitteleekö Jev muuta kuin englanninkielistä tekstiä? Kyllä, varauksin. TypeSafe sanoo, että englanti on paras tarkkuudessa ja muut kielet, mukaan lukien CJK, käsitellään mutta ei yhtä hyvin. Yllä oleva norjalainen testi havaitsi sen lukevan skannattuja valtuuston pöytäkirjoja oikein ja mittasi myös tokenisoijan tehokkuudeksi noin 2,06 merkkiä per token — kannattaa tarkistaa omalla kielelläsi ennen kuin suunnittelet kontekstirajan varaan.
Näkeekö Jev kuvia? Ei. Se on vain tekstiä. Kuvan muuntaminen tekstiksi ja Jeviltä kysyminen voi voittaa sattuman, mutta häviää selvästi mallille, joka todella näkee.
Onko Jev saatavilla APIMasterissa? Ei vielä myynnissä — Jev on onboarding-vaiheessa APIMasterissa, ja tämä sivu päivitetään, kun integraatio on käytössä. Tämän vertailun toisella puolella olevat mallit ovat saatavilla nyt.
Millä edullisella mallilla minun kannattaa aloittaa ensimmäistä kierrosta varten?
gpt-5.6-luna on markkinapaikan halvin taso hintaan 0,022 $ / 0,134 $ per 1M tokenia 3 reitillä — tämän artikkelin taulukon alhaisin syöte- ja tulostehinta. glm-5.3-flash hintaan 0,105 $ / 0,35 $ ja deepseek-flash hintaan 0,15 $ / 0,60 $ ovat seuraavat askeleet ylöspäin. Mittaa omalla datallasi ennen kuin sitoudut volyymiin.
Lähteet ja lisälukemisto
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 norjalaista kuulemisasiakirjaa, Jev vastaan DeepSeek V4.1 Flash päättelyllä ja ilman, tehtäväkohtaisella yhtäpitävyydellä, kalibrointilokeroilla, kustannuksilla ja viiveellä
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 luonnosta koordinaattijonoina, sattumapohja ja Sonnet 5 -vertailu
- TypeSafe — Models — mallitunnus, 42 $/Btok-hinnoittelu, nopeusrajat, kontekstibudjetti ja kielituki
- TypeSafe — Jev 1.13 jaggedness — julkaistut laajuusmuistiinpanot kirjaimellisesta lukemisesta, laskutoimituksista, päivämääristä, epäsuoruudesta ja tuottamisesta
- TypeSafe — Introducing System One Models and Jev — 70–500 ms:n päästä päähän -luku ja 40×–200×-vertailu
- Hacker News -julkaisuketju — perustajan kommentit siitä, mitä Jev ei ole, rajoitetusta dekoodauksesta ja siitä, miksi tuloste on ilmainen
Kolmannen osapuolen testitulokset on toistettu sellaisina kuin niiden kirjoittajat ne julkaisivat; kumpaakaan kirjoittajaa ei maksettu kirjoituksestaan eikä kumpikaan tarkistanut tätä sivua. APIMasterin reittihinnat luettiin 20. syyskuuta 2026. Jevin APIMaster-onboarding on käynnissä ja tämä sivu päivitetään sen edetessä.
