APIMaster.ai
Back to Blog
APIMaster Blog

Jev проти LLM: де модель прийняття рішень перемагає промптинг, а де ні

Jev повертає типізовані ймовірності; LLM повертає текст, який потрібно парсити. Сторонні тести показують вартість за 1 000 документів $0.22 проти $1.31–$3.08, і вирішальною відмінністю є впевненість, а не точність.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Щодо точності, чесна відповідь — вони рівні. Найдетальніше опубліковане порівняння, яке ми знайшли, прогнало обидві моделі на тих самих 24 документах норвезьких державних слухань і виявило, що Jev і DeepSeek V4.1 Flash узгоджуються з еталонними мітками фактично з однаковою частотою — 20 з 24 щодо позиції, 0.86 проти 0.89 за 192 судженнями «так/ні» щодо аргументів, у межах шуму вибірки з 24 документів. Що їх розділило — це не те, хто був правий. Це те, чи повідомляє модель, коли вона не впевнена.

Три відмінності визначають вибір у продакшені:

  • Структура витрат. Jev стягує $42 за мільярд вхідних токенів ($0.042 за 1M) і нічого за вихідні, бо не генерує токенів. Генеративна модель платить за обидва, а модель міркування платить за багато роздумів: у тому ж тесті DeepSeek написав 47 000 токенів міркувань, щоб заповнити 24 форми.
  • Калібрування. Коли Jev вказував ймовірність 0.8, еталонна мітка збігалася приблизно у 80% випадків. Коли DeepSeek із увімкненими міркуваннями записував 0.8, еталон збігався приблизно у половині випадків. Це і є весь аргумент на користь моделі прийняття рішень: ви можете встановити поріг і довіряти йому.
  • Контракт виводу. Jev повертає типізовані відповіді — Choice, Score, Noul — з ймовірністю та значенням впевненості. LLM повертає текст, який ви парсите, а його заявлена впевненість — це речення, а не число, за яким можна розгалужуватися.

Де LLM все ще перемагає: усе, що потребує генерації, пояснення, багатокрокових міркувань, арифметики або роботи з довгими документами. В одному публічному тесті в Jev, який працює лише з текстом, попросили назвати 400 намальованих від руки ескізів, перетворених на рядки координат; він перевершив випадковість із великим відривом, програв Claude Sonnet 5 і відповів «літак» для більш ніж половини з них.

Що можна купити вже сьогодні. Jev не продається на APIMaster — він на етапі онбордингу, і цю сторінку буде оновлено, коли інтеграція запрацює. Іншу половину цього порівняння можна купити вже зараз: gpt-5.6-luna від $0.022 за вхід / $0.134 за вихід за 1M токенів (3 маршрути в продажу, приблизно на 89% нижче за прайс-лист OpenAI $0.20 / $1.20), glm-5.3-flash від $0.105 / $0.35 (3 маршрути, приблизно на 30% дешевше за прайс-лист Zhipu) і deepseek-flash від $0.15 / $0.60 (1 маршрут, за власним тарифом DeepSeek у непікові години). Для ескалаційної частини схеми нижче gpt-5.6-sol стартує від $0.297 / $1.781 за 19 маршрутами. Один ключ, сумісний з OpenAI, покриває їх усі — дивіться картку Luna і маркетплейс моделей. Ціни маршрутів залежать від пропозиції каналів; актуальна картка — це число, яке має значення. Перевірено 20 вересня 2026 року.

Пробний GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 і GPT Image 2 доступні)

Зареєструйтеся та отримайте $20 на пробний GPT

Отримати зараз

Це не питання «краще чи гірше»

Jev і LLM відповідають на різні питання. Jev відповідає який саме, скільки або наскільки ймовірно; LLM відповідає що слід написати.

Jev Генеративна LLM
Вивід Типізовані відповіді з ймовірністю для кожного варіанта та значенням впевненості Текст, за потреби обмежений JSON-схемою
Основа витрат Лише вхідні токени; вивід безкоштовний Вхідні плюс вихідні токени
Характер затримки Один прямий прохід; питання розгалужуються паралельно над одним станом Послідовно згенеровані токени; моделі міркування додають довгий прихований прохід
Впевненість Каліброване число, за яким можна встановити поріг Зазвичай відсутня, або самостійно заявлене речення
Схема Відповідає за побудовою Відповідає, доки модель не вирішить, що ні
Відомий вхід Лише текст і структурований стан, без зображень Текст, а для мультимодальних моделей — зображення
Перемагає в Вузьких, високооб'ємних судженнях Генерації, міркуваннях, поясненні, арифметиці

У момент, коли вам більше не потрібен текст на виході, арифметика змінюється. Задача у формі класифікатора, яка видає двадцять токенів прози на кожен елемент, платить за ці токени на кожному елементі, назавжди.

Питання точності, з реальними числами

Маркетингові порівняння зазвичай зіставляють улюблений бенчмарк одного вендора з найгіршим результатом іншого. Корисний опублікований тест, який ми знайшли, — це ранній огляд Еміля Ліндфорса, An early-access test of TypeSafe's Jev, проведений на 24 відповідях на норвезькі слухання 2022 року щодо податку на ресурсну ренту в лососівництві.

Спочатку він розмітив усе за допомогою Claude Fable 5.1 у два незалежні проходи, а потім порівняв Jev 1.13 з DeepSeek V4.1 Flash через OpenRouter — ті самі питання в одному промпті, JSON на виході, один раз із увімкненими міркуваннями і один раз із вимкненими.

Задача Jev 1.13 DeepSeek, міркування вимкнено DeepSeek, міркування увімкнено
Позиція, 4 варіанти 20 з 24 20 з 24 22 з 24
Тип респондента, 6 варіантів 21 з 23 22 з 23 23 з 23
Аргументи, 192 так/ні 0.86 0.89 0.88
Сутність, точний рівень 19 з 24 14 з 24 14 з 24

З цієї таблиці варто вичитати дві речі. По-перше, автор прямо зазначає, що це узгодженість з мітками фронтирної моделі, а не правильність — там, де еталон помиляється, а Jev правий, Jev зараховується як неправий. З 24 документами 95% інтервал для числа позиції становить близько ±15 пунктів, тож три стовпці однакові щодо позиції та аргументів. По-друге, єдина чітка перевага — на впорядкованій шкалі Score, 19 проти 14: це примітив, який робить саме те, для чого його створили, і це той тип результату, який ви взагалі не отримали б із текстової відповіді.

Будь-хто, хто на підставі цих даних стверджує, що модель прийняття рішень категорично точніша за LLM, перебільшує значення вибірки з 24 документів. Цікаве твердження — вужче.

Питання вартості

Той самий тест оцінив роботу за 1 000 документів:

Jev 1.13 DeepSeek, міркування вимкнено DeepSeek, міркування увімкнено
Вартість за 1 000 документів $0.22 $1.31 $3.08
Медіанна затримка 0.32 с 2.7 с 26 с
Найповільніший запит 1.3 с 17.9 с 250 с

Приблизно одна шоста і одна чотирнадцята від двох конфігурацій LLM, за приблизно однієї восьмої та однієї восьмидесятої від медіанної затримки. Власний підсумок автора щодо причини: відмова від генерації тексту — ось чому ціна падає так сильно, а токени міркувань купили дві додаткові мітки позиції з 24 за десятикратної затримки.

Це одне навантаження, одна мова, один день. Ваші числа відрізнятимуться — сама лише ефективність токенізатора їх змінює. Той самий огляд виміряв токенізатор Jev на рівні приблизно 2.06 символів на токен для норвезької, проти ~4 символів на токен, які ви припустили б для англійської, що скорочує доступний бюджет стану з приблизно 120 000 символів до близько 64 000.

Калібрування — це і є справжня відмінність

Це та частина, яка визначає, чи можете ви автоматизувати. Модель, яка права у 86% випадків і знає, у яких 14% вона помиляється, — це інший інструмент, ніж модель, яка права у 88% випадків і звучить однаково впевнено щодо всього.

З того самого прогону, за 192 судженнями щодо аргументів:

Заявлена ймовірність Jev Судження Еталон збігся
0.0 – 0.1 14 0%
0.1 – 0.3 56 4%
0.3 – 0.7 41 34%
0.7 – 0.9 38 97%
0.9 – 1.0 43 98%

Напрямок правильний на кожному кроці, і модель трохи недовпевнена на обох кінцях — власна ціль TypeSafe полягає в тому, що результати, яким присвоєно 0.8, мають траплятися приблизно у 80% випадків, а середній бін дав 34%, а не ~50%.

Практична версія цієї таблиці — це поріг. Розділивши питання вибору за найвищою ймовірністю:

Найвища ймовірність ≥ 0.9 Нижче 0.9
Позиція 14 з 15 збігаються 6 з 9 збігаються
Тип респондента 20 з 20 збігаються 1 з 3 збігаються

Ось робоча схема: приймайте впевнену більшість, ескалуйте решту. Власний довідник TypeSafe щодо документів SEC повідомляє про 27 з 30 правильних при 0.9 або вище англійською; норвезький прогін дав 14 з 15.

Порівняння працює лише в один бік. З увімкненими міркуваннями DeepSeek поставив 84 зі своїх 192 відповідей щодо аргументів вище 0.9 — і у вікні 0.7–0.9 його мітки збігалися з еталоном у 48% випадків. Модель, чия впевненість не калібрована, не може використовуватися як шлюз, хоч би якими добрими були її відповіді.

Де LLM все ще правильний вибір

  • Генерація. Jev не напише резюме, відповідь чи повідомлення коміту. Власна документація TypeSafe відправляє генерацію до генеративної моделі.
  • Міркування та багатокрокові питання. TypeSafe вказує непрямість як відому слабкість: питання з подвійними запереченнями або кількома кроками коштують точності.
  • Арифметика, дати та підрахунок. Задокументовано як ненадійні, і похибка зростає з розміром того, що підраховується. Тримайте це в коді.
  • Зображення та аудіо. Jev працює лише з текстом. У TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Бартош Мікульський перетворив 400 ескізів на рядки координат SVG і попросив Jev назвати їх. Він чітко перевершив базову лінію випадковості з десяти варіантів, програв Claude Sonnet 5 і відповів «літак» для більш ніж половини малюнків. Той самий вміст, закодований як base64, впав до рівня випадковості — корисне нагадування, що текстова модель, читаючи числа, читає їх як текст.
  • Усе, що потребує пояснення. «Чому ти позначив цей так» — це не питання, на яке відповідає ймовірність.

Засновник TypeSafe наводить пов'язаний аргумент з боку LLM, про який варто знати, оскільки він суперечить поширеному обхідному рішенню: у треді запуску він стверджував, що обмежене декодування того типу, який використовують структуровані виводи в стилі OpenAI, робить моделі дурнішими, бо маскування недійсних токенів — це не те саме, що модель не заплуталася щодо них. Ставтеся до цього як до позиції вендора, а не як до усталеного результату — але це означає, що «просто вичавити JSON із дешевої моделі» не є автоматично еквівалентом типізованої відповіді.

Схема, яка працює

Найкорисніший висновок у норвезькому огляді — це те, що вибір не є «або/або». Власний проєкт автора використовував три моделі для трьох завдань:

Завдання Модель Чому
48 ретельних еталонних міток Fable 5.1 Мало документів, судження, вартість не має значення
Кожен документ, кожне питання Jev Дешево, швидко і повідомляє, коли не впевнений
Друга думка щодо невпевненої третини DeepSeek або людина Повільніше й дорожче, тож лише там, де потрібно

Ви можете запустити цю схему вже сьогодні з одним ключем, сумісним з OpenAI, використовуючи дешевий рівень як перший прохід і сильніший лише для випадків, які перший прохід не може вирішити:

  1. Перший прохід на найдешевшому рівні, що проходить ваш поріг. gpt-5.6-luna за $0.022 / $0.134 за 1M, або glm-5.3-flash за $0.105 / $0.35, або deepseek-flash за $0.15 / $0.60.
  2. Заженіть рішення в закриту множину в промпті і попросіть оцінку впевненості разом із ним. Ставтеся до оцінки як до підказки, а не як до каліброваної ймовірності — це той розрив, який заповнює модель прийняття рішень, а промпт-інжиніринг — ні.
  3. Ескалуйте лише те, що падає нижче вашого порогу. gpt-5.6-sol від $0.297 / $1.781 за 19 маршрутами, або gemini-3.8-flash від $0.20 / $1.00 за 7.
  4. Тримайте арифметику, дати та підрахунок у власному коді, для обох рівнів. Це дешевше і це правильно.
  5. Виміряйте власну частку узгодженості перед масштабуванням. П'ятдесят розмічених вручну елементів скажуть вам більше, ніж будь-яка таблиця бенчмарків, включно з цією.

Економіка цієї схеми — ось чому маршрутизація існує як категорія взагалі: перший прохід — це місце, куди йде майже весь обсяг, а ескалаційний рівень — це місце, звідки приходить майже вся якість. Другий потрібен вам лише для меншості, яку ви не можете класифікувати.

Створіть акаунт APIMaster, додайте кредит з оплатою за використання від $1, створіть ключ у консолі і налаштуйте клієнт, сумісний з OpenAI, на https://apimaster.ai/v1 з будь-яким із наведених вище ID моделей. Один ключ покриває родини GPT, GLM, DeepSeek, Gemini і Claude, тож шлях ескалації залишається на тій самій інтеграції. Перевірте маршрут за допомогою тестувальника моделей, перш ніж переводити продакшн-трафік.

FAQ

Jev — це мовна модель? Ні. TypeSafe описує його як модель структурованих даних, а власне формулювання засновника в треді запуску — що він «технічно не є мовною моделлю (він не генерує мову)». Він читає текст і повертає рішення.

Jev точніший за LLM? Вимірно — ні, за опублікованими даними. У норвезькому тесті на 24 документах Jev і DeepSeek V4.1 Flash узгоджувалися з еталонними мітками з однаковою частотою щодо позиції та питань аргументів. Jev явно випереджав в одній задачі з впорядкованою шкалою.

Jev дешевший за LLM? Так, за задачу — не за вхідний токен. Ціну Jev $0.042 за 1M вхідних токенів підрізає gpt-5.6-luna за $0.022 на вході, але Jev взагалі не генерує вихідних токенів, а генеративні моделі тарифікуються за вихід. У опублікованому навантаженні це склало $0.22 за 1 000 документів проти $1.31 і $3.08.

Що таке «LLM as a judge» і чим це відрізняється? LLM-as-a-judge означає просити генеративну модель оцінити або позначити щось і вичитувати відповідь із її тексту. Це працює, але ви платите за текст, чекаєте на токени, а впевненість, яку ви отримуєте назад, не є каліброваною ймовірністю. Модель прийняття рішень повертає те саме судження як типізовану відповідь, за якою можна встановити поріг.

Чи можу я просто змусити дешеву модель видавати JSON? Це дає вам схему, а не калібрування. Обмежене декодування робить вивід придатним для парсингу; воно не каже вам, яким відповідям не довіряти, і TypeSafe стверджує, що воно може погіршити якість, маскуючи токени, щодо яких модель була щиро невпевнена.

Яку з них використовувати для класифікації? Якщо ви робите кілька суджень, де точність — це все, і ви можете їх переглядати, добра LLM підійде. Якщо ви робите багато суджень і потребуєте автоматизації, використовуйте те, що повертає придатний для використання сигнал впевненості, і ескалуйте невпевнені.

Чи обробляє Jev текст не англійською? Так, із застереженнями. TypeSafe каже, що англійська — це мова, де точність найкраща, а інші мови, включно з CJK, обробляються, але не однаково добре. Норвезький тест вище показав, що він правильно читає відскановані протоколи ради, а також виміряв ефективність токенізатора на рівні близько 2.06 символів на токен — варто перевірити на вашій власній мові, перш ніж планувати навколо ліміту контексту.

Чи бачить Jev зображення? Ні. Він працює лише з текстом. Перетворення зображення на текст і запитання до Jev про нього може перевершити випадковість, але воно сильно програє моделі, яка справді бачить.

Чи доступний Jev на APIMaster? Ще не в продажу — Jev на етапі онбордингу на APIMaster, і цю сторінку буде оновлено, щойно інтеграція запрацює. Моделі з іншого боку цього порівняння доступні вже зараз.

З якої дешевої моделі почати для першого проходу? gpt-5.6-luna — найдешевший рівень на маркетплейсі за $0.022 / $0.134 за 1M токенів за 3 маршрутами — найнижча ставка на вхід і вихід у таблиці цієї статті. glm-5.3-flash за $0.105 / $0.35 і deepseek-flash за $0.15 / $0.60 — наступні кроки вгору. Виміряйте на власних даних, перш ніж зобов'язуватися щодо обсягу.

Джерела та подальше читання

  • Emil Lindfors — An early-access test of TypeSafe's Jev — 24 норвезькі документи слухань, Jev проти DeepSeek V4.1 Flash з міркуваннями і без, з узгодженістю за задачами, бінами калібрування, вартістю та затримкою
  • Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 ескізів як рядки координат, базова лінія випадковості та порівняння з Sonnet 5
  • TypeSafe — Models — ID моделі, ціна $42/Btok, ліміти швидкості, бюджет контексту та підтримка мов
  • TypeSafe — Jev 1.13 jaggedness — опубліковані нотатки про сферу застосування щодо буквального читання, арифметики, дат, непрямості та генерації
  • TypeSafe — Introducing System One Models and Jev — показник 70–500 мс від початку до кінця та порівняння 40×–200×
  • Hacker News launch thread — коментарі засновника про те, чим Jev не є, про обмежене декодування і про те, чому вивід безкоштовний

Результати сторонніх тестів відтворено так, як їх опублікували автори; жодному з авторів не платили за їхній огляд, і жоден із них не переглядав цю сторінку. Ціни маршрутів APIMaster було зчитано 20 вересня 2026 року. Онбординг Jev на APIMaster триває, і цю сторінку буде оновлено в міру його просування.