APIMaster.ai
Back to Blog
APIMaster Blog

Jev против LLM: где модель принятия решений превосходит промптинг, а где нет

Jev возвращает типизированные вероятности; LLM возвращает текст, который нужно парсить. Сторонние тесты оценивают стоимость на 1 000 документов в $0.22 против $1.31–$3.08, и решающее различие — это уверенность, а не точность.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

Published 2026-09-20

Quick Answer

Что касается точности, честный ответ таков: они равны. Самое подробное из найденных нами опубликованных сравнений прогнало обе модели на одних и тех же 24 документах слушаний норвежского правительства и обнаружило, что Jev и DeepSeek V4.1 Flash согласуются с эталонными метками фактически с одинаковой частотой — 20 из 24 по позиции, 0.86 против 0.89 по 192 суждениям «да/нет» об аргументах, что находится в пределах шума выборки из 24 документов. Их разделяло не то, какая из них права. А то, сообщает ли модель, когда она не уверена.

Три различия определяют выбор в продакшене:

  • Структура затрат. Jev берёт $42 за миллиард входных токенов ($0.042 за 1M) и ничего за выход, потому что он не выдаёт токенов. Генеративная модель платит за оба, а reasoning-модель платит за много размышлений: в том же тесте DeepSeek написал 47 000 токенов рассуждений, чтобы заполнить 24 формы.
  • Калибровка. Когда Jev указывал вероятность 0.8, эталонная метка соглашалась примерно в 80% случаев. Когда DeepSeek с включённым reasoning записывал 0.8, эталон соглашался примерно в половине случаев. В этом весь аргумент за модель принятия решений: вы можете задать порог и доверять ему.
  • Контракт вывода. Jev возвращает типизированные ответы — Choice, Score, Noul — с вероятностью и значением уверенности. LLM возвращает текст, который вы парсите, а его заявленная уверенность — это предложение, а не число, по которому можно ветвить логику.

Где LLM всё ещё выигрывает: всё, что требует генерации, объяснения, многошаговых рассуждений, арифметики или работы с длинными документами. В одном публичном тесте текстовый Jev попросили назвать 400 нарисованных от руки эскизов, преобразованных в строки координат; он значительно превзошёл случайное угадывание, проиграл Claude Sonnet 5 и ответил «airplane» более чем для половины из них.

Что можно купить уже сегодня. Jev не продаётся на APIMaster — он находится в процессе онбординга, и эта страница будет обновлена, когда интеграция заработает. Другая половина этого сравнения доступна для покупки прямо сейчас: gpt-5.6-luna от $0.022 за вход / $0.134 за выход за 1M токенов (3 маршрута в продаже, примерно на 89% ниже прайс-листа OpenAI $0.20 / $1.20), glm-5.3-flash от $0.105 / $0.35 (3 маршрута, примерно на 30% ниже прайс-листа Zhipu) и deepseek-flash от $0.15 / $0.60 (1 маршрут, по собственной непиковой ставке DeepSeek). Для эскалационной половины паттерна ниже gpt-5.6-sol начинается от $0.297 / $1.781 по 19 маршрутам. Один ключ, совместимый с OpenAI, покрывает их все — см. карточку Luna и маркетплейс моделей. Цены маршрутов зависят от предложения каналов; живая карточка — это то число, которое имеет значение. Проверено 20 сентября 2026 года.

Проба GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 и GPT Image 2 доступны)

Зарегистрируйтесь и получите $20 на пробу GPT

Получить

Это не вопрос «лучше или хуже»

Jev и LLM отвечают на разные вопросы. Jev отвечает какой именно, сколько или насколько вероятно; LLM отвечает что следует написать.

Jev Генеративная LLM
Вывод Типизированные ответы с вероятностью для каждого варианта и значением уверенности Текст, опционально ограниченный JSON-схемой
Основа затрат Только входные токены; выход бесплатен Входные плюс выходные токены
Характер задержки Один прямой проход; вопросы распараллеливаются по одному состоянию Последовательно генерируемые токены; reasoning-модели добавляют длинный скрытый проход
Уверенность Калиброванное число, по которому можно задать порог Обычно отсутствует или представляет собой самоотчёт в виде предложения
Схема Соответствует по построению Соответствует, пока модель не решит, что не соответствует
Известный вход Только текст и структурированное состояние, без изображений Текст, а для мультимодальных моделей — изображения
Превосходит в Узких, высокообъёмных суждениях Генерации, рассуждениях, объяснении, арифметике

В тот момент, когда вам больше не нужен текст на выходе, арифметика меняется. Задача в форме классификатора, которая выдаёт двадцать токенов прозы на элемент, платит за эти токены для каждого отдельного элемента, всегда.

Вопрос точности, с реальными числами

Маркетинговые сравнения обычно сопоставляют любимый бенчмарк одного вендора с худшим у другого. Полезный опубликованный тест, который мы нашли, — это ранний обзор Emil Lindfors, An early-access test of TypeSafe's Jev, проведённый на 24 ответах на слушания в Норвегии в 2022 году о налоге на ресурсную ренту в лососеводстве.

Сначала он разметил всё с помощью Claude Fable 5.1 в два независимых прохода, затем сравнил Jev 1.13 с DeepSeek V4.1 Flash через OpenRouter — одни и те же вопросы в одном промпте, JSON на выходе, один раз с включённым reasoning и один раз с выключенным.

Задача Jev 1.13 DeepSeek, reasoning выкл. DeepSeek, reasoning вкл.
Позиция, 4 варианта 20 из 24 20 из 24 22 из 24
Тип респондента, 6 вариантов 21 из 23 22 из 23 23 из 23
Аргументы, 192 да/нет 0.86 0.89 0.88
Существенность, точный уровень 19 из 24 14 из 24 14 из 24

Из этой таблицы стоит вычитать две вещи. Во-первых, автор прямо указывает, что это согласие с метками фронтирной модели, а не корректность — там, где эталон ошибается, а Jev прав, Jev засчитывается как ошибающийся. При 24 документах 95%-й интервал для показателя позиции составляет около ±15 пунктов, так что три столбца одинаковы по позиции и аргументам. Во-вторых, единственная явная победа — на упорядоченной шкале Score, 19 против 14: это тот самый примитив, делающий именно то, для чего он был создан, и это тот тип результата, который вы вообще не получили бы из текстового ответа.

Любой, кто на основании этих данных утверждает, что модель принятия решений категорически точнее LLM, переоценивает выборку из 24 документов. Интересное утверждение — более узкое.

Вопрос стоимости

Тот же тест оценил работу на 1 000 документов:

Jev 1.13 DeepSeek, reasoning выкл. DeepSeek, reasoning вкл.
Стоимость на 1 000 документов $0.22 $1.31 $3.08
Медианная задержка 0.32 с 2.7 с 26 с
Самый медленный запрос 1.3 с 17.9 с 250 с

Примерно шестая и четырнадцатая часть от двух конфигураций LLM, при примерно восьмой и восьмидесятой части медианной задержки. Собственное резюме автора о причине: отказ от генерации текста — вот почему цена падает настолько, а токены рассуждений купили две дополнительные метки позиции из 24 за десятикратную задержку.

Это одна рабочая нагрузка, один язык, один день. Ваши числа будут отличаться — одна только эффективность токенизатора их сдвигает. Тот же обзор измерил токенизатор Jev примерно в 2.06 символа на токен на норвежском, против ~4 символов на токен, которые вы бы предположили для английского, что сокращает доступный бюджет состояния примерно с 120 000 символов до около 64 000.

Калибровка — это и есть настоящее различие

Это та часть, которая определяет, можете ли вы автоматизировать. Модель, которая права в 86% случаев и знает, в каких 14% она ошибается, — это другой инструмент по сравнению с моделью, которая права в 88% случаев и звучит одинаково уверенно обо всём.

Из того же прогона, по 192 суждениям об аргументах:

Заявленная вероятность Jev Суждения Эталон согласился
0.0 – 0.1 14 0%
0.1 – 0.3 56 4%
0.3 – 0.7 41 34%
0.7 – 0.9 38 97%
0.9 – 1.0 43 98%

Направление верно на каждом шаге, и модель немного недоуверена на обоих концах — собственная цель TypeSafe состоит в том, чтобы исходы, которым присвоено 0.8, происходили примерно в 80% случаев, а средний интервал дал 34% вместо ~50%.

Практическая версия этой таблицы — это порог. Разделив вопросы выбора по верхней вероятности:

Верхняя вероятность ≥ 0.9 Ниже 0.9
Позиция 14 из 15 согласуются 6 из 9 согласуются
Тип респондента 20 из 20 согласуются 1 из 3 согласуются

Вот рабочий паттерн: принимайте уверенное большинство, эскалируйте остальное. Собственный кукбук TypeSafe по документам SEC сообщает о 27 из 30 правильных при 0.9 или выше на английском; норвежский прогон дал 14 из 15.

Сравнение работает только в одну сторону. С включённым reasoning DeepSeek поставил 84 из своих 192 ответов об аргументах выше 0.9 — и в окне 0.7–0.9 его метки совпали с эталоном в 48% случаев. Модель, чья уверенность не калибрована, не может использоваться как шлюз, независимо от того, насколько хороши её ответы.

Где LLM всё ещё правильный выбор

  • Генерация. Jev не напишет резюме, ответ или сообщение коммита. Собственная документация TypeSafe направляет генерацию к генеративной модели.
  • Рассуждения и многошаговые вопросы. TypeSafe перечисляет косвенность как известную слабость: вопросы с двойными отрицаниями или множественными переходами снижают точность.
  • Арифметика, даты и подсчёт. Задокументированы как ненадёжные, и ошибка растёт с размером того, что подсчитывается. Держите это в коде.
  • Изображения и аудио. Jev работает только с текстом. В TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway Bartosz Mikulski преобразовал 400 эскизов в строки координат SVG и попросил Jev назвать их. Он явно превзошёл базовую линию случайного угадывания из десяти вариантов, проиграл Claude Sonnet 5 и ответил «airplane» более чем для половины рисунков. Тот же контент, закодированный в base64, скатился к случайному уровню — полезное напоминание о том, что текстовая модель, читающая числа, читает их как текст.
  • Всё, что требует объяснения. «Почему ты пометил этот так» — это не вопрос, на который отвечает вероятность.

Основатель TypeSafe приводит связанный аргумент со стороны LLM, о котором стоит знать, поскольку он идёт против распространённого обходного пути: в ветке запуска он утверждал, что constrained decoding того типа, который используют структурированные выходы в стиле OpenAI, делает модели глупее, потому что маскирование недопустимых токенов — это не то же самое, что модель не путается в них. Считайте это позицией вендора, а не устоявшимся результатом — но это означает, что «просто выжать JSON из дешёвой модели» не автоматически эквивалентно типизированному ответу.

Паттерн, который работает

Самый полезный вывод в норвежском обзоре — что выбор не является «или/или». Собственный проект автора использовал три модели для трёх задач:

Задача Модель Почему
48 тщательных эталонных меток Fable 5.1 Мало документов, оценочные суждения, стоимость не важна
Каждый документ, каждый вопрос Jev Недорого, быстро и сообщает, когда не уверен
Второе мнение по неопределённой трети DeepSeek или человек Медленнее и дороже, поэтому только там, где это нужно

Вы можете реализовать эту схему уже сегодня с одним ключом, совместимым с OpenAI, используя дешёвый уровень для первого прохода и более сильный только для случаев, которые первый проход не может разрешить:

  1. Первый проход на самом дешёвом уровне, который проходит ваш порог. gpt-5.6-luna по $0.022 / $0.134 за 1M, или glm-5.3-flash по $0.105 / $0.35, или deepseek-flash по $0.15 / $0.60.
  2. Загоните решение в закрытое множество в промпте и попросите оценку уверенности вместе с ним. Относитесь к оценке как к подсказке, а не как к калиброванной вероятности — это тот пробел, который заполняет модель принятия решений, а промпт-инжиниринг — нет.
  3. Эскалируйте только то, что падает ниже вашего порога. gpt-5.6-sol от $0.297 / $1.781 по 19 маршрутам, или gemini-3.8-flash от $0.20 / $1.00 по 7.
  4. Держите арифметику, даты и подсчёт в собственном коде, для обоих уровней. Это дешевле и это корректно.
  5. Измерьте собственную частоту согласия перед масштабированием. Пятьдесят размеченных вручную элементов скажут вам больше, чем любая таблица бенчмарков, включая эту.

Экономика этого паттерна — вот почему маршрутизация вообще существует как категория: первый проход — это то, куда уходит почти весь объём, а эскалационный уровень — это то, откуда приходит почти всё качество. Второй нужен вам только для меньшинства, которое вы не можете классифицировать.

Создайте аккаунт APIMaster, пополните кредит с оплатой по мере использования от $1, создайте ключ в консоли и направьте клиент, совместимый с OpenAI, на https://apimaster.ai/v1 с любым из указанных выше ID моделей. Один ключ покрывает семейства GPT, GLM, DeepSeek, Gemini и Claude, так что путь эскалации остаётся на той же интеграции. Проверьте маршрут с помощью тестера моделей, прежде чем переводить продакшен-трафик.

FAQ

Jev — это языковая модель? Нет. TypeSafe описывает её как модель структурированных данных, и собственная формулировка основателя в ветке запуска такова, что она «технически не языковая модель (она не генерирует язык)». Она читает текст и возвращает решения.

Jev точнее, чем LLM? Измеримо — нет, судя по опубликованным данным. В норвежском тесте на 24 документах Jev и DeepSeek V4.1 Flash согласовались с эталонными метками с одинаковой частотой по вопросам позиции и аргументов. Jev явно был впереди в одной задаче с упорядоченной шкалой.

Jev дешевле, чем LLM? Да, на задачу — не на входной токен. Входная цена Jev в $0.042 за 1M входных токенов перебивается gpt-5.6-luna по $0.022 на входе, но Jev вообще не выдаёт выходных токенов, а генеративные модели тарифицируются за выход. В опубликованной рабочей нагрузке это составило $0.22 на 1 000 документов против $1.31 и $3.08.

Что такое «LLM as a judge» и чем это отличается? LLM-as-a-judge означает просьбу к генеративной модели оценить или пометить что-либо и чтение ответа из её текста. Это работает, но вы платите за текст, вы ждёте токены, а уверенность, которую вы получаете обратно, не является калиброванной вероятностью. Модель принятия решений возвращает то же суждение в виде типизированного ответа, по которому можно задать порог.

Могу ли я просто выжать JSON-вывод из дешёвой модели вместо этого? Это даёт вам схему, но не калибровку. Constrained decoding делает вывод парсируемым; он не говорит вам, каким ответам не доверять, и TypeSafe утверждает, что он может ухудшить качество, маскируя токены, в которых модель искренне сомневалась.

Какую из них мне использовать для классификации? Если вы делаете несколько суждений, где точность — это всё, и вы можете их просмотреть, хорошая LLM подойдёт. Если вы делаете много суждений и вам нужно автоматизировать, используйте то, что возвращает пригодный для использования сигнал уверенности, и эскалируйте неопределённые.

Jev обрабатывает текст не на английском? Да, с оговорками. TypeSafe говорит, что английский — это там, где точность наилучшая, а другие языки, включая CJK, обрабатываются, но не одинаково хорошо. Норвежский тест выше показал, что он корректно читает отсканированные протоколы совета, а также измерил эффективность токенизатора примерно в 2.06 символа на токен — стоит проверить на вашем собственном языке, прежде чем планировать исходя из лимита контекста.

Jev умеет видеть изображения? Нет. Он работает только с текстом. Преобразование изображения в текст и вопрос к Jev об этом может превзойти случайный уровень, но сильно проигрывает модели, которая действительно умеет видеть.

Jev доступен на APIMaster? Пока не продаётся — Jev находится в процессе онбординга на APIMaster, и эта страница будет обновлена, как только интеграция заработает. Модели с другой стороны этого сравнения доступны уже сейчас.

С какой недорогой модели мне начать для первого прохода? gpt-5.6-luna — самый дешёвый уровень на маркетплейсе по $0.022 / $0.134 за 1M токенов по 3 маршрутам — самая низкая ставка на вход и выход в таблице этой статьи. glm-5.3-flash по $0.105 / $0.35 и deepseek-flash по $0.15 / $0.60 — следующие ступени вверх. Измеряйте на собственных данных, прежде чем брать на себя объём.

Источники и дополнительное чтение

  • Emil Lindfors — An early-access test of TypeSafe's Jev — 24 норвежских документа слушаний, Jev против DeepSeek V4.1 Flash с reasoning и без него, с согласием по задачам, интервалами калибровки, стоимостью и задержкой
  • Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 эскизов в виде строк координат, базовая линия случайного угадывания и сравнение с Sonnet 5
  • TypeSafe — Models — ID модели, цена $42/Btok, лимиты скорости, бюджет контекста и поддержка языков
  • TypeSafe — Jev 1.13 jaggedness — опубликованные заметки об области применения по буквальному чтению, арифметике, датам, косвенности и генерации
  • TypeSafe — Introducing System One Models and Jev — показатель сквозной задержки 70–500 мс и сравнение 40×–200×
  • Hacker News launch thread — комментарии основателя о том, чем Jev не является, о constrained decoding и о том, почему выход бесплатен

Результаты сторонних тестов воспроизведены в том виде, в каком их опубликовали авторы; ни одному из авторов не платили за их обзор, и они не проверяли эту страницу. Цены маршрутов APIMaster были считаны 20 сентября 2026 года. Онбординг Jev на APIMaster продолжается, и эта страница будет обновляться по мере его продвижения.