APIMaster.ai
ブログに戻る
APIMaster ブログ

Jev vs LLM: 意思決定モデルがプロンプティングに勝る場面、そしてそうでない場面

Jevは型付きの確率を返し、LLMはパースが必要なテキストを返します。第三者のテストでは、1,000ドキュメントあたりのコストは$0.22対$1.31~$3.08であり、決め手となる違いは精度ではなく信頼度です。

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

公開 2026-09-20

クイック回答

精度について、正直な答えは「互角」です。 私たちが見つけた中で最も詳細な公開比較は、同じ24件のノルウェー政府公聴会文書に対して両者を実行し、JevとDeepSeek V4.1 Flashが参照ラベルと一致した割合は実質的に同じであることを示しました — スタンスでは24件中20件、192件のyes/no論点判断では0.86対0.89で、24文書サンプルのノイズの範囲内です。両者を分けたのは、どちらが正しいかではありませんでした。モデルが不確かなときにそれを教えてくれるかどうかでした。

本番環境での選択を決める3つの違いがあります:

  • コスト構造。 Jevは10億入力トークンあたり$42(100万トークンあたり$0.042)を課金し、出力は無料です。トークンを出力しないからです。生成モデルは両方に支払い、推論モデルは大量の思考に支払います。同じテストで、DeepSeekは24件のフォームを埋めるために47,000トークンの推論を書きました。
  • キャリブレーション。 Jevが確率0.8と言ったとき、参照ラベルは約80%の割合で一致しました。推論を有効にしたDeepSeekが0.8と書いたとき、参照は約半分の割合でしか一致しませんでした。これが意思決定モデルを支持する論拠のすべてです。閾値を設定して、それを信頼できるのです。
  • 出力契約。 Jevは型付きの回答 — ChoiceScoreNoul — を確率と信頼度の値とともに返します。LLMはパースが必要なテキストを返し、その表明された信頼度は文であって、分岐に使える数値ではありません。

LLMが依然として勝つ場面: 生成、説明、多段階推論、算術、長文ドキュメントの作業が必要なものすべてです。ある公開テストでは、テキスト専用のJevに、座標文字列に変換された400点の手描きスケッチの名前を答えさせました。それは偶然の水準を大きく上回りましたが、Claude Sonnet 5には敗れ、その半数以上に対して「airplane」と答えました。

今日購入できるもの。 JevはAPIMasterでは販売されていません — オンボーディング中であり、このページは統合が稼働した時点で更新されます。この比較のもう半分は今すぐ購入できます: gpt-5.6-luna100万トークンあたり入力$0.022 / 出力$0.134から(3ルートが販売中、OpenAIのリスト価格$0.20 / $1.20より約89%安い)、glm-5.3-flashは**$0.105 / $0.35から(3ルート、Zhipuのリスト価格より約30%オフ)、deepseek-flash$0.15 / $0.60から(1ルート、DeepSeek自身のオフピーク料金)。以下のパターンのエスカレーション側には、gpt-5.6-solが19ルートにわたって$0.297 / $1.781**から利用できます。1つのOpenAI互換キーですべてをカバーできます — Lunaカードモデルマーケットプレイスをご覧ください。ルート価格はチャネルの供給に従います。実際に有効な数字はライブカードのものです。2026年9月20日確認。

GPT トライアル(GPT-6 Astra、GPT-5.6、GPT-5.5、GPT Image 2 が利用可能)

登録して $20 の GPT トライアルを受け取る

今すぐ受け取る

「より良いか悪いか」という問題ではない

JevとLLMは異なる問いに答えています。Jevはどれか、どれくらいか、どれくらいの確率かに答え、LLMは何を書くべきかに答えます。

Jev 生成LLM
出力 選択肢ごとの確率と信頼度の値を持つ型付き回答 テキスト、任意でJSONスキーマに制約可能
コスト基準 入力トークンのみ。出力は無料 入力プラス出力トークン
レイテンシの形 1回のフォワードパス。質問は1つの状態上で並列に展開 逐次生成されるトークン。推論モデルは長い隠れたパスを追加
信頼度 閾値を設定できるキャリブレーション済みの数値 通常はなし、または自己申告の文
スキーマ 構造上一致する モデルが一致しないと判断するまで一致する
既知の入力 テキストと構造化状態のみ、画像なし テキスト、およびマルチモーダルモデルでは画像
これが勝る領域 狭く大量の判断 生成、推論、説明、算術

テキスト出力が不要になった瞬間、算術が変わります。項目ごとに20トークンの散文を生成する分類器型のタスクは、すべての項目で、永遠に、そのトークンに支払い続けています。

精度の問い、実際の数値で

マーケティング上の比較は通常、各ベンダーのお気に入りのベンチマークを相手の最悪のものと比べます。私たちが見つけた有用な公開テストは、Emil Lindforsによるアーリーアクセスの記事、An early-access test of TypeSafe's Jevで、ノルウェーの2022年のサーモン養殖資源レント税に関する公聴会への24件の回答に対して実行されました。

彼はまずClaude Fable 5.1で2回の独立したパスですべてにラベルを付け、その後Jev 1.13をOpenRouter経由のDeepSeek V4.1 Flashと比較しました — 同じ質問を1つのプロンプトに入れ、JSONで出力し、推論を有効にした場合と無効にした場合の両方で。

タスク Jev 1.13 DeepSeek、推論オフ DeepSeek、推論オン
スタンス、4選択肢 24件中20件 24件中20件 24件中22件
回答者タイプ、6選択肢 23件中21件 23件中22件 23件中23件
論点、192件のyes/no 0.86 0.89 0.88
実質、正確なレベル 24件中19件 24件中14件 24件中14件

この表から読み取る価値のあることが2つあります。第一に、著者はこれらがフロンティアモデルのラベルとの一致であり、正しさではないと明言しています — 参照が間違っていてJevが正しい場合、Jevは間違いとしてスコアされます。24文書では、スタンス数値の95%区間は約±15ポイントなので、3つの列はスタンスと論点では同じです。第二に、1つの明確な勝利は順序付きのScoreスケールで、19対14です。これはプリミティブがまさにそのために作られた通りの働きであり、テキスト回答ではまったく得られない種類の結果です。

この証拠をもとに、意思決定モデルがLLMよりもカテゴリ的に正確だと主張する人は、24文書のサンプルを過大に読んでいます。興味深い主張はより狭いものです。

コストの問い

同じテストは1,000ドキュメントあたりの作業を価格設定しました:

Jev 1.13 DeepSeek、推論オフ DeepSeek、推論オン
1,000ドキュメントあたりのコスト $0.22 $1.31 $3.08
中央値レイテンシ 0.32秒 2.7秒 26秒
最遅リクエスト 1.3秒 17.9秒 250秒

2つのLLM構成のおよそ6分の1と14分の1で、中央値レイテンシはおよそ8分の1と80分の1です。著者自身の原因の要約: テキスト生成をやめたことが価格をこれほど下げる理由であり、推論トークンは24件中2件の追加スタンスラベルを10倍のレイテンシで買ったのです。

これらは1つのワークロード、1つの言語、1日です。あなたの数値は異なるでしょう — トークナイザの効率だけでも変わります。同じ記事はJevのトークナイザをノルウェー語で約2.06文字/トークンと測定しました。英語から想定する約4文字/トークンに対して、これは使用可能な状態予算をおよそ120,000文字から約64,000文字に削減します。

キャリブレーションこそが実際の違い

これが自動化できるかどうかを決める部分です。86%の確率で正しく、どの14%で間違っているかを知っているモデルは、88%の確率で正しく、すべてについて等しく確信を持って聞こえるモデルとは別のツールです。

同じ実行から、192件の論点判断について:

Jevの表明確率 判断数 参照が一致
0.0 – 0.1 14 0%
0.1 – 0.3 56 4%
0.3 – 0.7 41 34%
0.7 – 0.9 38 97%
0.9 – 1.0 43 98%

方向はすべての段階で正しく、モデルは両端でわずかに自信過剰の逆になっています — TypeSafe自身の目標は、0.8が割り当てられた結果が約80%の割合で発生することであり、中央のビンは約50%ではなく34%でした。

この表の実用的なバージョンは閾値です。選択質問を最高確率で分割すると:

最高確率 ≥ 0.9 0.9未満
スタンス 15件中14件が一致 9件中6件が一致
回答者タイプ 20件中20件が一致 3件中1件が一致

これが運用パターンです: 確信のある多数派を受け入れ、残りをエスカレーションする。 TypeSafe自身のSEC提出書類クックブックは、英語で0.9以上で30件中27件正しいと報告しています。ノルウェー語の実行では15件中14件でした。

比較は一方向にしか進みません。推論を有効にすると、DeepSeekは192件の論点回答のうち84件を0.9以上に置きました — そして0.7~0.9のウィンドウでは、そのラベルは48%の割合で参照と一致しました。信頼度がキャリブレーションされていないモデルは、その回答がどれほど良くても、ゲートとして使えません。

LLMが依然として正しい選択である場面

  • 生成。 Jevは要約、返信、コミットメッセージを書きません。TypeSafe自身のドキュメントは生成を生成モデルに送っています。
  • 推論とマルチホップの質問。 TypeSafeは間接参照を既知の弱点として挙げています: 二重否定や複数のホップを含む質問は精度を犠牲にします。
  • 算術、日付、カウント。 信頼できないと文書化されており、誤差は数える対象のサイズとともに増大します。コードに留めておきましょう。
  • 画像と音声。 Jevはテキスト専用です。TypeSafe's Jev Can't See. I Made It Guess What I Drew Anywayで、Bartosz Mikulskiは400点のスケッチをSVG座標文字列に変換し、Jevにその名前を答えさせました。それは10択の偶然のベースラインを明確に上回り、Claude Sonnet 5には敗れ、図面の半数以上に対して「airplane」と答えました。同じ内容をbase64としてエンコードすると偶然の水準に落ちました — 数値を読むテキストモデルはそれをテキストとして読んでいるという有用なリマインダーです。
  • 説明が必要なものすべて。 「なぜこれをそうラベル付けしたのか」は確率が答える問いではありません。

TypeSafeの創業者はLLM側について関連する主張をしており、一般的な回避策に反するので知っておく価値があります: ローンチスレッドで彼は、OpenAIスタイルの構造化出力が使うような制約付きデコーディングはモデルを愚かにすると主張しました。無効なトークンをマスクすることは、モデルがそれらについて混乱していないこととは同じではないからです。これは確定した結果ではなくベンダーの立場として扱うべきです — しかし「安価なモデルからJSONを無理やり出させる」だけでは、型付き回答と自動的に等価にはならないことを意味します。

機能するパターン

ノルウェー語の記事で最も有用な結論は、選択は二者択一ではないということです。著者自身のプロジェクトは3つの仕事に3つのモデルを使いました:

仕事 モデル 理由
48件の慎重な参照ラベル Fable 5.1 文書が少なく、判断が必要で、コストは問題にならない
すべての文書、すべての質問 Jev 低コスト、高速、そして不確かなときに教えてくれる
不確かな3分の1へのセカンドオピニオン DeepSeekまたは人間 遅く高価なので、必要な場所だけ

この形は今日、単一のOpenAI互換キーで実行できます。低コスト層を最初のパスとして使い、最初のパスでは決着できないケースにのみより強力なものを使います:

  1. あなたの基準をクリアする最も安価な層で最初のパス。 gpt-5.6-lunaは100万トークンあたり$0.022 / $0.134、またはglm-5.3-flashは$0.105 / $0.35、またはdeepseek-flashは$0.15 / $0.60。
  2. プロンプトで決定を閉じた集合に強制し、それとともに信頼度スコアを求めます。スコアはヒントとして扱い、キャリブレーション済みの確率としては扱わないでください — それが意思決定モデルが埋め、プロンプトエンジニアリングが埋めないギャップです。
  3. 閾値を下回るものだけをエスカレーション。 gpt-5.6-solは19ルートにわたって$0.297 / $1.781から、またはgemini-3.8-flashは7ルートにわたって$0.20 / $1.00から。
  4. 算術、日付、カウントは自分のコードに留めておく、両方の層で。より安く、そして正確です。
  5. スケールする前に自分の一致率を測定する。 手作業でラベル付けした50項目は、どんなベンチマーク表よりも、これを含めて、あなたに多くを教えてくれます。

このパターンの経済性こそが、ルーティングがカテゴリとして存在する理由です: 最初のパスはほぼすべてのボリュームが行く場所であり、エスカレーション層はほぼすべての品質が来る場所です。分類できない少数派にだけ2つ目が必要です。

APIMasterアカウントを作成し、$1から従量課金クレジットを追加し、コンソールでキーを作成し、OpenAI互換クライアントを上記のいずれかのモデルIDでhttps://apimaster.ai/v1に向けます。1つのキーでGPT、GLM、DeepSeek、Gemini、Claudeファミリーをカバーするので、エスカレーションパスは同じ統合に留まります。本番トラフィックを移す前にモデルテスターでルートを検証してください。

FAQ

Jevは言語モデルですか? いいえ。TypeSafeはそれを構造化データモデルと説明しており、創業者自身のローンチスレッドでの言葉は「技術的には言語モデルではない(言語を生成しない)」というものです。テキストを読み、決定を返します。

JevはLLMより正確ですか? 公開された証拠では、測定可能なほどではありません。24文書のノルウェー語テストでは、JevとDeepSeek V4.1 Flashはスタンスと論点の質問で参照ラベルと同じ割合で一致しました。Jevは1つの順序付きスケールのタスクで明確に優位でした。

JevはLLMより安いですか? はい、タスクあたりでは — 入力トークンあたりではありません。Jevの100万入力トークンあたり$0.042は、入力で$0.022のgpt-5.6-lunaに下回られますが、Jevは出力トークンをまったく出力せず、生成モデルは出力に課金されます。公開されたワークロードでは、1,000ドキュメントあたり$0.22対$1.31と$3.08でした。

「LLM as a judge」とは何で、どう違うのですか? LLM-as-a-judgeとは、生成モデルに何かを評価またはラベル付けさせ、そのテキストから答えを読み取ることです。機能しますが、テキストに支払い、トークンを待ち、返ってくる信頼度はキャリブレーション済みの確率ではありません。意思決定モデルは同じ判断を、閾値を設定できる型付き回答として返します。

代わりに安価なモデルからJSON出力を強制するだけではだめですか? それはスキーマを得るだけで、キャリブレーションは得られません。制約付きデコーディングは出力をパース可能にしますが、どの回答を信用しないべきかは教えてくれず、TypeSafeはモデルが本当に不確かだったトークンをマスクすることで品質を劣化させうると主張しています。

分類にはどちらを使うべきですか? 精度がすべてでレビューできる少数の判断をするなら、優れたLLMで十分です。多くの判断をして自動化する必要があるなら、使用可能な信頼度シグナルを返すものを使い、不確かなものをエスカレーションしてください。

Jevは非英語テキストを扱えますか? 扱えますが、注意点があります。TypeSafeは英語が最も精度が良く、CJKを含む他の言語も扱うが同等には良くないと述べています。上記のノルウェー語テストでは、スキャンされた議会議事録を正しく読むことがわかり、またトークナイザ効率を約2.06文字/トークンと測定しました — コンテキスト制限を計画する前に自分の言語で確認する価値があります。

Jevは画像を見られますか? いいえ。テキスト専用です。画像をテキストに変換してJevに尋ねることは偶然を上回ることがありますが、実際に見ることのできるモデルには大敗します。

JevはAPIMasterで利用できますか? まだ販売されていません — JevはAPIMasterでオンボーディング中であり、このページは統合が稼働した時点で更新されます。この比較の反対側のモデルは今すぐ利用できます。

最初のパスにはどの低コストモデルから始めるべきですか? gpt-5.6-lunaはマーケットプレイスで最も安価な層で、3ルートにわたって100万トークンあたり$0.022 / $0.134です — この記事の表で最も低い入力と出力の料金です。glm-5.3-flashは$0.105 / $0.35、deepseek-flashは$0.15 / $0.60が次のステップアップです。ボリュームをコミットする前に自分のデータで測定してください。

出典とさらなる読み物

第三者のテスト結果は著者が公開したままに再現しています。どちらの著者も記事に対して報酬を受け取っておらず、このページをレビューしていません。APIMasterのルート価格は2026年9月20日に読み取りました。JevのAPIMasterオンボーディングは進行中であり、このページは進展に応じて更新されます。