Jev vs LLM: Di Mana Model Keputusan Mengalahkan Prompting, dan Di Mana Tidak
Jev mengembalikan probabilitas bertipe; LLM mengembalikan teks yang harus Anda parsing. Uji pihak ketiga menempatkan biaya per 1.000 dokumen pada $0,22 berbanding $1,31–$3,08, dan pembeda penentunya adalah keyakinan, bukan akurasi.
Published 2026-09-20
Soal akurasi, jawaban jujurnya adalah keduanya seri. Perbandingan terbitan paling rinci yang kami temukan menjalankan keduanya terhadap 24 dokumen dengar pendapat pemerintah Norwegia yang sama dan menemukan Jev serta DeepSeek V4.1 Flash sepakat dengan label referensi pada tingkat yang praktis sama — 20 dari 24 pada sikap, 0,86 berbanding 0,89 di seluruh 192 penilaian argumen ya/tidak, masih di dalam derau sampel 24 dokumen. Yang memisahkan keduanya bukanlah mana yang benar. Yang memisahkan adalah apakah model memberi tahu Anda saat ia tidak yakin.
Tiga perbedaan menentukan pilihan di produksi:
- Struktur biaya. Jev mengenakan $42 per miliar token input ($0,042 per 1J) dan tidak memungut biaya untuk output, karena ia tidak mengeluarkan token. Model generatif membayar keduanya, dan model penalaran membayar banyak sekali pemikiran: dalam uji yang sama, DeepSeek menulis 47.000 token penalaran untuk mengisi 24 formulir.
- Kalibrasi. Ketika Jev menyatakan probabilitas 0,8, label referensi sepakat sekitar 80% dari waktu. Ketika DeepSeek dengan penalaran aktif menuliskan 0,8, referensi sepakat sekitar setengah dari waktu. Itulah seluruh argumen untuk model keputusan: Anda dapat menetapkan ambang dan mempercayainya.
- Kontrak output. Jev mengembalikan jawaban bertipe —
Choice,Score,Noul— dengan probabilitas dan nilai keyakinan. LLM mengembalikan teks yang Anda parsing, dan keyakinan yang dinyatakannya adalah kalimat, bukan angka yang bisa Anda percabangkan.
Di mana LLM masih menang: apa pun yang membutuhkan generasi, penjelasan, penalaran multi-langkah, aritmetika, atau pekerjaan dokumen panjang. Dalam satu uji publik, Jev yang hanya teks diminta menamai 400 sketsa tangan yang telah dikonversi menjadi string koordinat; ia mengalahkan tebakan acak dengan margin lebar, kalah dari Claude Sonnet 5, dan menjawab "pesawat" untuk lebih dari separuhnya.
Apa yang bisa Anda beli hari ini. Jev tidak dijual di APIMaster — ia sedang dalam proses onboarding, dan halaman ini akan diperbarui saat integrasinya aktif. Separuh lain dari perbandingan ini bisa dibeli sekarang: gpt-5.6-luna mulai dari $0,022 masuk / $0,134 keluar per 1J token (3 rute dijual, sekitar 89% di bawah daftar OpenAI $0,20 / $1,20), glm-5.3-flash mulai dari $0,105 / $0,35 (3 rute, sekitar 30% di bawah daftar Zhipu), dan deepseek-flash mulai dari $0,15 / $0,60 (1 rute, pada tarif off-peak DeepSeek sendiri). Untuk bagian eskalasi dari pola di bawah, gpt-5.6-sol mulai dari $0,297 / $1,781 di 19 rute. Satu kunci yang kompatibel dengan OpenAI mencakup semuanya — lihat kartu Luna dan marketplace model. Harga rute mengikuti pasokan kanal; kartu langsung adalah angka yang berlaku. Diperiksa 20 September 2026.
Uji coba GPT(GPT-6 Astra, GPT-5.6, GPT-5.5, dan GPT Image 2 tersedia)
Daftar dan klaim uji coba GPT $20
Ini bukan pertanyaan "lebih baik atau lebih buruk"
Jev dan LLM menjawab pertanyaan yang berbeda. Jev menjawab yang mana, seberapa banyak, atau seberapa mungkin; LLM menjawab apa yang harus ditulis.
| Jev | LLM generatif | |
|---|---|---|
| Output | Jawaban bertipe dengan probabilitas per opsi dan nilai keyakinan | Teks, opsional dibatasi ke skema JSON |
| Basis biaya | Hanya token input; output gratis | Token input plus output |
| Bentuk latensi | Satu forward pass; pertanyaan menyebar paralel atas satu state | Token yang dihasilkan secara berurutan; model penalaran menambah pass tersembunyi yang panjang |
| Keyakinan | Angka terkalibrasi yang bisa Anda ambang | Biasanya tidak ada, atau kalimat yang dilaporkan sendiri |
| Skema | Cocok secara konstruksi | Cocok sampai model memutuskan tidak cocok |
| Input yang dikenal | Hanya teks dan state terstruktur, tanpa gambar | Teks, dan gambar untuk model multimodal |
| Mengalahkannya pada | Penilaian sempit bervolume tinggi | Generasi, penalaran, penjelasan, aritmetika |
Begitu Anda berhenti membutuhkan teks keluar, aritmetikanya berubah. Tugas berbentuk klasifikasi yang menghasilkan dua puluh token prosa per item membayar token tersebut pada setiap item, selamanya.
Pertanyaan akurasi, dengan angka nyata
Perbandingan pemasaran biasanya membandingkan benchmark favorit tiap vendor dengan yang terburuk dari vendor lain. Uji terbitan yang berguna yang kami temukan adalah tulisan akses awal Emil Lindfors, An early-access test of TypeSafe's Jev, dijalankan pada 24 tanggapan terhadap dengar pendapat Norwegia 2022 tentang pajak sewa sumber daya budidaya salmon.
Ia melabeli semuanya dengan Claude Fable 5.1 dalam dua pass independen terlebih dahulu, lalu membandingkan Jev 1.13 dengan DeepSeek V4.1 Flash melalui OpenRouter — pertanyaan yang sama dalam satu prompt, keluaran JSON, sekali dengan penalaran aktif dan sekali nonaktif.
| Tugas | Jev 1.13 | DeepSeek, penalaran nonaktif | DeepSeek, penalaran aktif |
|---|---|---|---|
| Sikap, 4 opsi | 20 dari 24 | 20 dari 24 | 22 dari 24 |
| Jenis responden, 6 opsi | 21 dari 23 | 22 dari 23 | 23 dari 23 |
| Argumen, 192 ya/tidak | 0,86 | 0,89 | 0,88 |
| Substansi, tingkat persis | 19 dari 24 | 14 dari 24 | 14 dari 24 |
Ada dua hal yang layak dibaca dari tabel itu. Pertama, penulis secara eksplisit menyatakan bahwa ini adalah kesepakatan dengan label model frontier, bukan kebenaran — di mana referensi salah dan Jev benar, Jev dinilai salah. Dengan 24 dokumen, interval 95% pada angka sikap sekitar ±15 poin, sehingga ketiga kolom itu sama pada sikap dan argumen. Kedua, satu kemenangan jelas ada pada skala Score terurut, 19 berbanding 14: itulah primitif yang melakukan persis apa yang dirancang untuknya, dan itu jenis hasil yang tidak akan Anda dapatkan dari jawaban teks sama sekali.
Siapa pun yang mengklaim berdasarkan bukti ini bahwa model keputusan secara kategoris lebih akurat daripada LLM sedang membaca berlebihan sampel 24 dokumen. Klaim yang menarik adalah yang lebih sempit.
Pertanyaan biaya
Uji yang sama menghitung biaya pekerjaan per 1.000 dokumen:
| Jev 1.13 | DeepSeek, penalaran nonaktif | DeepSeek, penalaran aktif | |
|---|---|---|---|
| Biaya per 1.000 dokumen | $0,22 | $1,31 | $3,08 |
| Latensi median | 0,32 d | 2,7 d | 26 d |
| Permintaan terlambat | 1,3 d | 17,9 d | 250 d |
Kira-kira seperenam dan seperempat belas dari dua konfigurasi LLM, pada kira-kira seperdelapan dan seperdelapan puluh dari latensi median. Ringkasan penulis sendiri tentang penyebabnya: menghilangkan generasi teks adalah alasan harga turun sejauh itu, dan token penalaran membeli dua label sikap tambahan dari 24 dengan latensi sepuluh kali lipat.
Itu satu beban kerja, satu bahasa, satu hari. Angka Anda akan berbeda — efisiensi tokenizer saja sudah menggesernya. Tulisan yang sama mengukur tokenizer Jev pada sekitar 2,06 karakter per token dalam bahasa Norwegia, berbanding ~4 karakter per token yang Anda asumsikan dari bahasa Inggris, yang memotong anggaran state yang dapat digunakan dari sekitar 120.000 karakter menjadi sekitar 64.000.
Kalibrasi adalah perbedaan sebenarnya
Inilah bagian yang menentukan apakah Anda dapat mengotomatiskan. Model yang benar 86% dari waktu dan tahu 14% mana yang salah adalah alat yang berbeda dari model yang benar 88% dari waktu dan terdengar sama yakinnya tentang segalanya.
Dari run yang sama, pada 192 penilaian argumen:
| Probabilitas yang dinyatakan Jev | Penilaian | Referensi sepakat |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
Arahnya benar di setiap langkah, dan model sedikit kurang percaya diri di kedua ujung — target TypeSafe sendiri adalah bahwa hasil yang diberi nilai 0,8 seharusnya terjadi sekitar 80% dari waktu, dan bin tengah tercatat 34% bukan ~50%.
Versi praktis dari tabel itu adalah ambang. Memisahkan pertanyaan pilihan pada probabilitas teratas:
| Probabilitas teratas ≥ 0,9 | Di bawah 0,9 | |
|---|---|---|
| Sikap | 14 dari 15 sepakat | 6 dari 9 sepakat |
| Jenis responden | 20 dari 20 sepakat | 1 dari 3 sepakat |
Itulah pola operasinya: terima mayoritas yang yakin, eskalasi sisanya. Cookbook SEC-filings TypeSafe sendiri melaporkan 27 dari 30 benar pada 0,9 atau lebih dalam bahasa Inggris; run Norwegia mendapat 14 dari 15.
Perbandingannya hanya berjalan satu arah. Dengan penalaran aktif, DeepSeek menempatkan 84 dari 192 jawaban argumennya di atas 0,9 — dan pada jendela 0,7–0,9 labelnya cocok dengan referensi 48% dari waktu. Model yang keyakinannya tidak terkalibrasi tidak dapat digunakan sebagai gerbang, tidak peduli seberapa bagus jawabannya.
Di mana LLM masih merupakan pilihan yang tepat
- Generasi. Jev tidak akan menulis ringkasan, balasan, atau pesan commit. Dokumentasi TypeSafe sendiri mengarahkan generasi ke model generatif.
- Penalaran dan pertanyaan multi-hop. TypeSafe mencantumkan indirection sebagai kelemahan yang diketahui: pertanyaan dengan negasi ganda atau banyak hop menurunkan akurasi.
- Aritmetika, tanggal, dan penghitungan. Didokumentasikan sebagai tidak andal, dan galatnya tumbuh seiring ukuran hal yang dihitung. Simpan di kode.
- Gambar dan audio. Jev hanya teks. Dalam TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski mengonversi 400 sketsa menjadi string koordinat SVG dan meminta Jev menamainya. Ia mengalahkan baseline tebakan sepuluh arah dengan jelas, kalah dari Claude Sonnet 5, dan menjawab "pesawat" untuk lebih dari separuh gambar. Konten yang sama yang dikodekan sebagai base64 jatuh ke tingkat tebakan — pengingat berguna bahwa model teks yang membaca angka membacanya sebagai teks.
- Apa pun yang membutuhkan penjelasan. "Mengapa Anda melabeli yang ini seperti itu" bukan pertanyaan yang dijawab oleh probabilitas.
Pendiri TypeSafe mengajukan argumen terkait di sisi LLM yang layak diketahui, karena argumen itu menentang solusi umum: pada thread peluncuran ia berargumen bahwa constrained decoding seperti yang digunakan structured outputs bergaya OpenAI membuat model lebih bodoh, karena menutupi token yang tidak valid tidak sama dengan model tidak bingung tentangnya. Anggap itu sebagai posisi vendor, bukan hasil yang sudah mapan — tetapi itu berarti "paksa saja JSON keluar dari model murah" tidak otomatis setara dengan jawaban bertipe.
Pola yang berhasil
Kesimpulan paling berguna dalam tulisan Norwegia adalah bahwa pilihannya bukan salah satu/atau. Proyek penulis sendiri menggunakan tiga model untuk tiga pekerjaan:
| Pekerjaan | Model | Alasan |
|---|---|---|
| 48 label referensi yang cermat | Fable 5.1 | Sedikit dokumen, keputusan penilaian, biaya tidak masalah |
| Setiap dokumen, setiap pertanyaan | Jev | Berbiaya rendah, cepat, dan memberi tahu saat tidak yakin |
| Pendapat kedua atas sepertiga yang tidak pasti | DeepSeek atau manusia | Lebih lambat dan lebih mahal, jadi hanya di tempat yang diperlukan |
Anda dapat menjalankan bentuk itu hari ini dengan satu kunci yang kompatibel dengan OpenAI, menggunakan tier berbiaya rendah sebagai pass pertama dan yang lebih kuat hanya untuk kasus yang tidak dapat diselesaikan pass pertama:
- Pass pertama pada tier termurah yang melewati standar Anda.
gpt-5.6-lunapada $0,022 / $0,134 per 1J, atauglm-5.3-flashpada $0,105 / $0,35, ataudeepseek-flashpada $0,15 / $0,60. - Paksa keputusan ke dalam himpunan tertutup di prompt, dan minta skor keyakinan bersamanya. Perlakukan skor itu sebagai petunjuk, bukan sebagai probabilitas terkalibrasi — itulah celah yang diisi model keputusan dan tidak diisi oleh prompt engineering.
- Eskalasi hanya yang jatuh di bawah ambang Anda.
gpt-5.6-solmulai dari $0,297 / $1,781 di 19 rute, ataugemini-3.8-flashmulai dari $0,20 / $1,00 di 7. - Simpan aritmetika, tanggal, dan penghitungan di kode Anda sendiri, untuk kedua tier. Lebih murah dan benar.
- Ukur tingkat kesepakatan Anda sendiri sebelum menskalakan. Lima puluh item berlabel tangan akan memberi tahu Anda lebih banyak daripada tabel benchmark mana pun, termasuk yang ini.
Ekonomi dari pola itulah alasan routing ada sebagai kategori: pass pertama adalah tempat hampir semua volume mengalir, dan tier eskalasi adalah tempat hampir semua kualitas berasal. Anda hanya membutuhkan yang kedua untuk minoritas yang tidak dapat Anda klasifikasikan.
Buat akun APIMaster, tambahkan kredit pay-as-you-go mulai dari $1, buat kunci di konsol, dan arahkan klien yang kompatibel dengan OpenAI ke https://apimaster.ai/v1 dengan salah satu ID model di atas. Satu kunci mencakup keluarga GPT, GLM, DeepSeek, Gemini, dan Claude, sehingga jalur eskalasi tetap pada integrasi yang sama. Validasi rute dengan penguji model sebelum Anda memindahkan lalu lintas produksi.
FAQ
Apakah Jev model bahasa? Bukan. TypeSafe mendeskripsikannya sebagai model data terstruktur, dan kata-kata pendirinya sendiri pada thread peluncuran adalah bahwa ia "secara teknis bukan model bahasa (ia tidak menghasilkan bahasa)". Ia membaca teks dan mengembalikan keputusan.
Apakah Jev lebih akurat daripada LLM? Tidak terukur, berdasarkan bukti terbitan. Dalam uji Norwegia 24 dokumen, Jev dan DeepSeek V4.1 Flash sepakat dengan label referensi pada tingkat yang sama pada pertanyaan sikap dan argumen. Jev jelas unggul pada satu tugas skala terurut.
Apakah Jev lebih murah daripada LLM?
Ya, per tugas — bukan per token input. $0,042 per 1J token input Jev disaingi oleh gpt-5.6-luna pada $0,022 untuk input, tetapi Jev tidak mengeluarkan token output sama sekali, dan model generatif ditagih untuk output. Dalam beban kerja terbitan, itu menjadi $0,22 per 1.000 dokumen berbanding $1,31 dan $3,08.
Apa itu "LLM as a judge" dan apa bedanya? LLM-as-a-judge berarti meminta model generatif menilai atau melabeli sesuatu dan membaca jawabannya dari teksnya. Itu berhasil, tetapi Anda membayar untuk teksnya, Anda menunggu tokennya, dan keyakinan yang Anda dapatkan kembali bukan probabilitas terkalibrasi. Model keputusan mengembalikan penilaian yang sama sebagai jawaban bertipe yang dapat Anda ambang.
Bisakah saya hanya memaksa output JSON dari model murah sebagai gantinya? Itu memberi Anda skemanya, bukan kalibrasinya. Constrained decoding membuat output dapat di-parsing; itu tidak memberi tahu Anda jawaban mana yang harus tidak dipercaya, dan TypeSafe berargumen itu dapat menurunkan kualitas dengan menutupi token yang modelnya benar-benar tidak yakini.
Mana yang harus saya gunakan untuk klasifikasi? Jika Anda membuat sedikit penilaian di mana akurasi adalah segalanya dan Anda dapat meninjaunya, LLM yang baik sudah cukup. Jika Anda membuat banyak penilaian dan perlu mengotomatiskan, gunakan apa pun yang mengembalikan sinyal keyakinan yang dapat digunakan dan eskalasi yang tidak pasti.
Apakah Jev menangani teks non-Inggris? Ya, dengan catatan. TypeSafe menyatakan bahasa Inggris adalah tempat akurasi terbaik dan bahasa lain termasuk CJK ditangani tetapi tidak sama baiknya. Uji Norwegia di atas menemukannya membaca notulen dewan hasil pindaian dengan benar, dan juga mengukur efisiensi tokenizer pada sekitar 2,06 karakter per token — layak diperiksa pada bahasa Anda sendiri sebelum merencanakan sekitar batas konteks.
Bisakah Jev melihat gambar? Tidak. Ia hanya teks. Mengonversi gambar menjadi teks dan menanyakan Jev tentangnya dapat mengalahkan tebakan acak, tetapi ia kalah telak dari model yang benar-benar dapat melihat.
Apakah Jev tersedia di APIMaster? Belum dijual — Jev sedang dalam proses onboarding di APIMaster, dan halaman ini akan diperbarui setelah integrasinya aktif. Model di sisi lain perbandingan ini tersedia sekarang.
Model berbiaya rendah mana yang harus saya mulai untuk pass pertama?
gpt-5.6-luna adalah tier termurah di marketplace pada $0,022 / $0,134 per 1J token di 3 rute — tarif input dan output terendah dalam tabel artikel ini. glm-5.3-flash pada $0,105 / $0,35 dan deepseek-flash pada $0,15 / $0,60 adalah langkah berikutnya. Ukur pada data Anda sendiri sebelum berkomitmen volume.
Sumber dan bacaan lanjutan
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 dokumen dengar pendapat Norwegia, Jev berbanding DeepSeek V4.1 Flash dengan dan tanpa penalaran, dengan kesepakatan per tugas, bin kalibrasi, biaya dan latensi
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 sketsa sebagai string koordinat, baseline tebakan dan perbandingan Sonnet 5
- TypeSafe — Models — ID model, harga $42/Btok, batas laju, anggaran konteks dan dukungan bahasa
- TypeSafe — Jev 1.13 jaggedness — catatan cakupan terbitan tentang pembacaan literal, aritmetika, tanggal, indirection dan generasi
- TypeSafe — Introducing System One Models and Jev — angka end-to-end 70–500ms dan perbandingan 40×–200×
- Thread peluncuran Hacker News — komentar pendiri tentang apa yang bukan Jev, tentang constrained decoding dan tentang mengapa output gratis
Hasil uji pihak ketiga direproduksi sebagaimana diterbitkan oleh penulisnya; tidak ada penulis yang dibayar untuk tulisannya atau meninjau halaman ini. Harga rute APIMaster dibaca pada 20 September 2026. Onboarding Jev di APIMaster sedang berlangsung dan halaman ini akan diperbarui seiring kemajuannya.
