Jev проти LLM: де модель прийняття рішень перемагає промптинг, а де ні
Jev повертає типізовані ймовірності; LLM повертає текст, який потрібно парсити. Сторонні тести показують вартість за 1 000 документів $0.22 проти $1.31–$3.08, і вирішальною відмінністю є впевненість, а не точність.
Published 2026-09-20
Щодо точності, чесна відповідь — вони рівні. Найдетальніше опубліковане порівняння, яке ми знайшли, прогнало обидві моделі на тих самих 24 документах норвезьких державних слухань і виявило, що Jev і DeepSeek V4.1 Flash узгоджуються з еталонними мітками фактично з однаковою частотою — 20 з 24 щодо позиції, 0.86 проти 0.89 за 192 судженнями «так/ні» щодо аргументів, у межах шуму вибірки з 24 документів. Що їх розділило — це не те, хто був правий. Це те, чи повідомляє модель, коли вона не впевнена.
Три відмінності визначають вибір у продакшені:
- Структура витрат. Jev стягує $42 за мільярд вхідних токенів ($0.042 за 1M) і нічого за вихідні, бо не генерує токенів. Генеративна модель платить за обидва, а модель міркування платить за багато роздумів: у тому ж тесті DeepSeek написав 47 000 токенів міркувань, щоб заповнити 24 форми.
- Калібрування. Коли Jev вказував ймовірність 0.8, еталонна мітка збігалася приблизно у 80% випадків. Коли DeepSeek із увімкненими міркуваннями записував 0.8, еталон збігався приблизно у половині випадків. Це і є весь аргумент на користь моделі прийняття рішень: ви можете встановити поріг і довіряти йому.
- Контракт виводу. Jev повертає типізовані відповіді —
Choice,Score,Noul— з ймовірністю та значенням впевненості. LLM повертає текст, який ви парсите, а його заявлена впевненість — це речення, а не число, за яким можна розгалужуватися.
Де LLM все ще перемагає: усе, що потребує генерації, пояснення, багатокрокових міркувань, арифметики або роботи з довгими документами. В одному публічному тесті в Jev, який працює лише з текстом, попросили назвати 400 намальованих від руки ескізів, перетворених на рядки координат; він перевершив випадковість із великим відривом, програв Claude Sonnet 5 і відповів «літак» для більш ніж половини з них.
Що можна купити вже сьогодні. Jev не продається на APIMaster — він на етапі онбордингу, і цю сторінку буде оновлено, коли інтеграція запрацює. Іншу половину цього порівняння можна купити вже зараз: gpt-5.6-luna від $0.022 за вхід / $0.134 за вихід за 1M токенів (3 маршрути в продажу, приблизно на 89% нижче за прайс-лист OpenAI $0.20 / $1.20), glm-5.3-flash від $0.105 / $0.35 (3 маршрути, приблизно на 30% дешевше за прайс-лист Zhipu) і deepseek-flash від $0.15 / $0.60 (1 маршрут, за власним тарифом DeepSeek у непікові години). Для ескалаційної частини схеми нижче gpt-5.6-sol стартує від $0.297 / $1.781 за 19 маршрутами. Один ключ, сумісний з OpenAI, покриває їх усі — дивіться картку Luna і маркетплейс моделей. Ціни маршрутів залежать від пропозиції каналів; актуальна картка — це число, яке має значення. Перевірено 20 вересня 2026 року.
Пробний GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 і GPT Image 2 доступні)
Зареєструйтеся та отримайте $20 на пробний GPT
Це не питання «краще чи гірше»
Jev і LLM відповідають на різні питання. Jev відповідає який саме, скільки або наскільки ймовірно; LLM відповідає що слід написати.
| Jev | Генеративна LLM | |
|---|---|---|
| Вивід | Типізовані відповіді з ймовірністю для кожного варіанта та значенням впевненості | Текст, за потреби обмежений JSON-схемою |
| Основа витрат | Лише вхідні токени; вивід безкоштовний | Вхідні плюс вихідні токени |
| Характер затримки | Один прямий прохід; питання розгалужуються паралельно над одним станом | Послідовно згенеровані токени; моделі міркування додають довгий прихований прохід |
| Впевненість | Каліброване число, за яким можна встановити поріг | Зазвичай відсутня, або самостійно заявлене речення |
| Схема | Відповідає за побудовою | Відповідає, доки модель не вирішить, що ні |
| Відомий вхід | Лише текст і структурований стан, без зображень | Текст, а для мультимодальних моделей — зображення |
| Перемагає в | Вузьких, високооб'ємних судженнях | Генерації, міркуваннях, поясненні, арифметиці |
У момент, коли вам більше не потрібен текст на виході, арифметика змінюється. Задача у формі класифікатора, яка видає двадцять токенів прози на кожен елемент, платить за ці токени на кожному елементі, назавжди.
Питання точності, з реальними числами
Маркетингові порівняння зазвичай зіставляють улюблений бенчмарк одного вендора з найгіршим результатом іншого. Корисний опублікований тест, який ми знайшли, — це ранній огляд Еміля Ліндфорса, An early-access test of TypeSafe's Jev, проведений на 24 відповідях на норвезькі слухання 2022 року щодо податку на ресурсну ренту в лососівництві.
Спочатку він розмітив усе за допомогою Claude Fable 5.1 у два незалежні проходи, а потім порівняв Jev 1.13 з DeepSeek V4.1 Flash через OpenRouter — ті самі питання в одному промпті, JSON на виході, один раз із увімкненими міркуваннями і один раз із вимкненими.
| Задача | Jev 1.13 | DeepSeek, міркування вимкнено | DeepSeek, міркування увімкнено |
|---|---|---|---|
| Позиція, 4 варіанти | 20 з 24 | 20 з 24 | 22 з 24 |
| Тип респондента, 6 варіантів | 21 з 23 | 22 з 23 | 23 з 23 |
| Аргументи, 192 так/ні | 0.86 | 0.89 | 0.88 |
| Сутність, точний рівень | 19 з 24 | 14 з 24 | 14 з 24 |
З цієї таблиці варто вичитати дві речі. По-перше, автор прямо зазначає, що це узгодженість з мітками фронтирної моделі, а не правильність — там, де еталон помиляється, а Jev правий, Jev зараховується як неправий. З 24 документами 95% інтервал для числа позиції становить близько ±15 пунктів, тож три стовпці однакові щодо позиції та аргументів. По-друге, єдина чітка перевага — на впорядкованій шкалі Score, 19 проти 14: це примітив, який робить саме те, для чого його створили, і це той тип результату, який ви взагалі не отримали б із текстової відповіді.
Будь-хто, хто на підставі цих даних стверджує, що модель прийняття рішень категорично точніша за LLM, перебільшує значення вибірки з 24 документів. Цікаве твердження — вужче.
Питання вартості
Той самий тест оцінив роботу за 1 000 документів:
| Jev 1.13 | DeepSeek, міркування вимкнено | DeepSeek, міркування увімкнено | |
|---|---|---|---|
| Вартість за 1 000 документів | $0.22 | $1.31 | $3.08 |
| Медіанна затримка | 0.32 с | 2.7 с | 26 с |
| Найповільніший запит | 1.3 с | 17.9 с | 250 с |
Приблизно одна шоста і одна чотирнадцята від двох конфігурацій LLM, за приблизно однієї восьмої та однієї восьмидесятої від медіанної затримки. Власний підсумок автора щодо причини: відмова від генерації тексту — ось чому ціна падає так сильно, а токени міркувань купили дві додаткові мітки позиції з 24 за десятикратної затримки.
Це одне навантаження, одна мова, один день. Ваші числа відрізнятимуться — сама лише ефективність токенізатора їх змінює. Той самий огляд виміряв токенізатор Jev на рівні приблизно 2.06 символів на токен для норвезької, проти ~4 символів на токен, які ви припустили б для англійської, що скорочує доступний бюджет стану з приблизно 120 000 символів до близько 64 000.
Калібрування — це і є справжня відмінність
Це та частина, яка визначає, чи можете ви автоматизувати. Модель, яка права у 86% випадків і знає, у яких 14% вона помиляється, — це інший інструмент, ніж модель, яка права у 88% випадків і звучить однаково впевнено щодо всього.
З того самого прогону, за 192 судженнями щодо аргументів:
| Заявлена ймовірність Jev | Судження | Еталон збігся |
|---|---|---|
| 0.0 – 0.1 | 14 | 0% |
| 0.1 – 0.3 | 56 | 4% |
| 0.3 – 0.7 | 41 | 34% |
| 0.7 – 0.9 | 38 | 97% |
| 0.9 – 1.0 | 43 | 98% |
Напрямок правильний на кожному кроці, і модель трохи недовпевнена на обох кінцях — власна ціль TypeSafe полягає в тому, що результати, яким присвоєно 0.8, мають траплятися приблизно у 80% випадків, а середній бін дав 34%, а не ~50%.
Практична версія цієї таблиці — це поріг. Розділивши питання вибору за найвищою ймовірністю:
| Найвища ймовірність ≥ 0.9 | Нижче 0.9 | |
|---|---|---|
| Позиція | 14 з 15 збігаються | 6 з 9 збігаються |
| Тип респондента | 20 з 20 збігаються | 1 з 3 збігаються |
Ось робоча схема: приймайте впевнену більшість, ескалуйте решту. Власний довідник TypeSafe щодо документів SEC повідомляє про 27 з 30 правильних при 0.9 або вище англійською; норвезький прогін дав 14 з 15.
Порівняння працює лише в один бік. З увімкненими міркуваннями DeepSeek поставив 84 зі своїх 192 відповідей щодо аргументів вище 0.9 — і у вікні 0.7–0.9 його мітки збігалися з еталоном у 48% випадків. Модель, чия впевненість не калібрована, не може використовуватися як шлюз, хоч би якими добрими були її відповіді.
Де LLM все ще правильний вибір
- Генерація. Jev не напише резюме, відповідь чи повідомлення коміту. Власна документація TypeSafe відправляє генерацію до генеративної моделі.
- Міркування та багатокрокові питання. TypeSafe вказує непрямість як відому слабкість: питання з подвійними запереченнями або кількома кроками коштують точності.
- Арифметика, дати та підрахунок. Задокументовано як ненадійні, і похибка зростає з розміром того, що підраховується. Тримайте це в коді.
- Зображення та аудіо. Jev працює лише з текстом. У TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Бартош Мікульський перетворив 400 ескізів на рядки координат SVG і попросив Jev назвати їх. Він чітко перевершив базову лінію випадковості з десяти варіантів, програв Claude Sonnet 5 і відповів «літак» для більш ніж половини малюнків. Той самий вміст, закодований як base64, впав до рівня випадковості — корисне нагадування, що текстова модель, читаючи числа, читає їх як текст.
- Усе, що потребує пояснення. «Чому ти позначив цей так» — це не питання, на яке відповідає ймовірність.
Засновник TypeSafe наводить пов'язаний аргумент з боку LLM, про який варто знати, оскільки він суперечить поширеному обхідному рішенню: у треді запуску він стверджував, що обмежене декодування того типу, який використовують структуровані виводи в стилі OpenAI, робить моделі дурнішими, бо маскування недійсних токенів — це не те саме, що модель не заплуталася щодо них. Ставтеся до цього як до позиції вендора, а не як до усталеного результату — але це означає, що «просто вичавити JSON із дешевої моделі» не є автоматично еквівалентом типізованої відповіді.
Схема, яка працює
Найкорисніший висновок у норвезькому огляді — це те, що вибір не є «або/або». Власний проєкт автора використовував три моделі для трьох завдань:
| Завдання | Модель | Чому |
|---|---|---|
| 48 ретельних еталонних міток | Fable 5.1 | Мало документів, судження, вартість не має значення |
| Кожен документ, кожне питання | Jev | Дешево, швидко і повідомляє, коли не впевнений |
| Друга думка щодо невпевненої третини | DeepSeek або людина | Повільніше й дорожче, тож лише там, де потрібно |
Ви можете запустити цю схему вже сьогодні з одним ключем, сумісним з OpenAI, використовуючи дешевий рівень як перший прохід і сильніший лише для випадків, які перший прохід не може вирішити:
- Перший прохід на найдешевшому рівні, що проходить ваш поріг.
gpt-5.6-lunaза $0.022 / $0.134 за 1M, абоglm-5.3-flashза $0.105 / $0.35, абоdeepseek-flashза $0.15 / $0.60. - Заженіть рішення в закриту множину в промпті і попросіть оцінку впевненості разом із ним. Ставтеся до оцінки як до підказки, а не як до каліброваної ймовірності — це той розрив, який заповнює модель прийняття рішень, а промпт-інжиніринг — ні.
- Ескалуйте лише те, що падає нижче вашого порогу.
gpt-5.6-solвід $0.297 / $1.781 за 19 маршрутами, абоgemini-3.8-flashвід $0.20 / $1.00 за 7. - Тримайте арифметику, дати та підрахунок у власному коді, для обох рівнів. Це дешевше і це правильно.
- Виміряйте власну частку узгодженості перед масштабуванням. П'ятдесят розмічених вручну елементів скажуть вам більше, ніж будь-яка таблиця бенчмарків, включно з цією.
Економіка цієї схеми — ось чому маршрутизація існує як категорія взагалі: перший прохід — це місце, куди йде майже весь обсяг, а ескалаційний рівень — це місце, звідки приходить майже вся якість. Другий потрібен вам лише для меншості, яку ви не можете класифікувати.
Створіть акаунт APIMaster, додайте кредит з оплатою за використання від $1, створіть ключ у консолі і налаштуйте клієнт, сумісний з OpenAI, на https://apimaster.ai/v1 з будь-яким із наведених вище ID моделей. Один ключ покриває родини GPT, GLM, DeepSeek, Gemini і Claude, тож шлях ескалації залишається на тій самій інтеграції. Перевірте маршрут за допомогою тестувальника моделей, перш ніж переводити продакшн-трафік.
FAQ
Jev — це мовна модель? Ні. TypeSafe описує його як модель структурованих даних, а власне формулювання засновника в треді запуску — що він «технічно не є мовною моделлю (він не генерує мову)». Він читає текст і повертає рішення.
Jev точніший за LLM? Вимірно — ні, за опублікованими даними. У норвезькому тесті на 24 документах Jev і DeepSeek V4.1 Flash узгоджувалися з еталонними мітками з однаковою частотою щодо позиції та питань аргументів. Jev явно випереджав в одній задачі з впорядкованою шкалою.
Jev дешевший за LLM?
Так, за задачу — не за вхідний токен. Ціну Jev $0.042 за 1M вхідних токенів підрізає gpt-5.6-luna за $0.022 на вході, але Jev взагалі не генерує вихідних токенів, а генеративні моделі тарифікуються за вихід. У опублікованому навантаженні це склало $0.22 за 1 000 документів проти $1.31 і $3.08.
Що таке «LLM as a judge» і чим це відрізняється? LLM-as-a-judge означає просити генеративну модель оцінити або позначити щось і вичитувати відповідь із її тексту. Це працює, але ви платите за текст, чекаєте на токени, а впевненість, яку ви отримуєте назад, не є каліброваною ймовірністю. Модель прийняття рішень повертає те саме судження як типізовану відповідь, за якою можна встановити поріг.
Чи можу я просто змусити дешеву модель видавати JSON? Це дає вам схему, а не калібрування. Обмежене декодування робить вивід придатним для парсингу; воно не каже вам, яким відповідям не довіряти, і TypeSafe стверджує, що воно може погіршити якість, маскуючи токени, щодо яких модель була щиро невпевнена.
Яку з них використовувати для класифікації? Якщо ви робите кілька суджень, де точність — це все, і ви можете їх переглядати, добра LLM підійде. Якщо ви робите багато суджень і потребуєте автоматизації, використовуйте те, що повертає придатний для використання сигнал впевненості, і ескалуйте невпевнені.
Чи обробляє Jev текст не англійською? Так, із застереженнями. TypeSafe каже, що англійська — це мова, де точність найкраща, а інші мови, включно з CJK, обробляються, але не однаково добре. Норвезький тест вище показав, що він правильно читає відскановані протоколи ради, а також виміряв ефективність токенізатора на рівні близько 2.06 символів на токен — варто перевірити на вашій власній мові, перш ніж планувати навколо ліміту контексту.
Чи бачить Jev зображення? Ні. Він працює лише з текстом. Перетворення зображення на текст і запитання до Jev про нього може перевершити випадковість, але воно сильно програє моделі, яка справді бачить.
Чи доступний Jev на APIMaster? Ще не в продажу — Jev на етапі онбордингу на APIMaster, і цю сторінку буде оновлено, щойно інтеграція запрацює. Моделі з іншого боку цього порівняння доступні вже зараз.
З якої дешевої моделі почати для першого проходу?
gpt-5.6-luna — найдешевший рівень на маркетплейсі за $0.022 / $0.134 за 1M токенів за 3 маршрутами — найнижча ставка на вхід і вихід у таблиці цієї статті. glm-5.3-flash за $0.105 / $0.35 і deepseek-flash за $0.15 / $0.60 — наступні кроки вгору. Виміряйте на власних даних, перш ніж зобов'язуватися щодо обсягу.
Джерела та подальше читання
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 норвезькі документи слухань, Jev проти DeepSeek V4.1 Flash з міркуваннями і без, з узгодженістю за задачами, бінами калібрування, вартістю та затримкою
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 ескізів як рядки координат, базова лінія випадковості та порівняння з Sonnet 5
- TypeSafe — Models — ID моделі, ціна $42/Btok, ліміти швидкості, бюджет контексту та підтримка мов
- TypeSafe — Jev 1.13 jaggedness — опубліковані нотатки про сферу застосування щодо буквального читання, арифметики, дат, непрямості та генерації
- TypeSafe — Introducing System One Models and Jev — показник 70–500 мс від початку до кінця та порівняння 40×–200×
- Hacker News launch thread — коментарі засновника про те, чим Jev не є, про обмежене декодування і про те, чому вивід безкоштовний
Результати сторонніх тестів відтворено так, як їх опублікували автори; жодному з авторів не платили за їхній огляд, і жоден із них не переглядав цю сторінку. Ціни маршрутів APIMaster було зчитано 20 вересня 2026 року. Онбординг Jev на APIMaster триває, і цю сторінку буде оновлено в міру його просування.
