APIMaster.ai
返回部落格
APIMaster 部落格

Jev 對比 LLM:決策模型在何處勝過提示詞,又在何處不敵

Jev 回傳具型別的概率;LLM 回傳的是你得自行解析的文字。第三方測試顯示每 1,000 份文件的成本為 $0.22,對比 $1.31–$3.08,而決定性的差異在於信心,而非準確度。

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

發布於 2026-09-20

快速結論

就準確度而言,誠實的答案是兩者打成平手。 我們找到最詳盡的公開比較,將兩者跑在同一批 24 份挪威政府聽證文件上,結果發現 Jev 與 DeepSeek V4.1 Flash 與參考標籤一致的比例實際上相同——立場方面為 24 份中的 20 份,192 項是/否論點判斷中為 0.86 對 0.89,落在 24 份文件樣本的雜訊範圍內。真正區分兩者的,不是哪一個答對。而是模型是否會告訴你它不確定。

有三項差異決定了生產環境中的選擇:

  • 成本結構。 Jev 每十億輸入 token 收費 $42(每 1M 為 $0.042),輸出則不收費,因為它不產生任何 token。生成式模型兩者都要付費,而推理模型還要為大量的思考付費:在同一項測試中,DeepSeek 為了填寫 24 份表單,寫了 47,000 個 token 的推理內容。
  • 校準。 當 Jev 說概率為 0.8 時,參考標籤約有 80% 的時間與之一致。當啟用推理的 DeepSeek 寫下 0.8 時,參考標籤約有一半的時間與之一致。這就是採用決策模型的全部理由:你可以設定一個閾值並信任它。
  • 輸出契約。 Jev 回傳具型別的答案——ChoiceScoreNoul——附帶一個概率與一個信心值。LLM 回傳的是你得自行解析的文字,而它陳述的信心是一句話,不是你能據以分支的數字。

LLM 仍然勝出的地方: 任何需要生成、解釋、多步推理、算術或長文件處理的任務。在一項公開測試中,純文字的 Jev 被要求為 400 張已轉換為座標字串的手繪草圖命名;它大幅勝過隨機猜測,敗給 Claude Sonnet 5,並且對超過半數的草圖都回答「airplane」。

你今天能買到什麼。 Jev 並未在 APIMaster 上販售——它正在進行上架流程,待整合上線後本頁將會更新。這項比較的另一半現在就能買到:gpt-5.6-luna每 1M token $0.022 輸入 / $0.134 輸出起(3 條路由販售中,約比 OpenAI 的 $0.20 / $1.20 定價低約 89%)、glm-5.3-flash$0.105 / $0.35 起(3 條路由,約比智譜定價低 30%),以及 deepseek-flash$0.15 / $0.60 起(1 條路由,採 DeepSeek 自家的離峰費率)。至於下方模式的升級那一半,gpt-5.6-sol 在 19 條路由上從 $0.297 / $1.781 起。一組 OpenAI 相容金鑰即可涵蓋全部——請參閱 Luna 卡片模型市集。路由價格隨通路供給變動;實際卡片上的數字才算數。查核於 2026 年 9 月 20 日。

GPT 體驗卡(GPT-6 Astra、GPT-5.6、GPT-5.5和GPT Image 2 可用)

現在註冊,領取 $20 GPT 體驗卡

立即領取

這不是「哪個更好或更差」的問題

Jev 與 LLM 回答的是不同的問題。Jev 回答的是哪一個、多少、或可能性多高;LLM 回答的是應該寫什麼

Jev 生成式 LLM
輸出 具型別的答案,每個選項附帶一個概率與一個信心值 文字,可選擇性地約束為 JSON schema
成本基礎 僅輸入 token;輸出免費 輸入加輸出 token
延遲型態 一次前向傳遞;問題在單一狀態上平行展開 依序生成的 token;推理模型會增加一段漫長的隱藏傳遞
信心 一個可設閾值的校準數字 通常沒有,或是一句自我陳述
Schema 依建構方式即相符 相符,直到模型決定它不相符
已知輸入 僅文字與結構化狀態,不含圖像 文字,多模態模型則含圖像
勝過對方之處 狹窄、高量的判斷 生成、推理、解釋、算術

當你不再需要輸出文字的那一刻,這筆帳就算得不同了。一個每項只產生二十個 token 散文的分類型任務,等於每一項、永遠都在為那些 token 付費。

準確度問題,附上真實數字

行銷式比較通常拿每家廠商最愛的基準去比另一家最差的表現。我們找到有用的公開測試,是 Emil Lindfors 的早期存取評測,An early-access test of TypeSafe's Jev,跑在挪威 2022 年鮭魚養殖資源租金稅聽證的 24 份回應上。

他先用 Claude Fable 5.1 以兩次獨立流程標註所有內容,再透過 OpenRouter 將 Jev 1.13 與 DeepSeek V4.1 Flash 相比——同樣的問題放在同一個提示中,輸出 JSON,一次啟用推理、一次關閉。

任務 Jev 1.13 DeepSeek,關閉推理 DeepSeek,啟用推理
立場,4 個選項 24 份中的 20 份 24 份中的 20 份 24 份中的 22 份
受訪者類型,6 個選項 23 份中的 21 份 23 份中的 22 份 23 份中的 23 份
論點,192 項是/否 0.86 0.89 0.88
實質性,精確層級 24 份中的 19 份 24 份中的 14 份 24 份中的 14 份

從那張表可以讀出兩件事。第一,作者明確指出這些是與前沿模型標籤的一致程度,而非正確性——當參考標籤有誤而 Jev 正確時,Jev 會被計為錯誤。在 24 份文件下,立場數字的 95% 區間約為 ±15 個百分點,因此三個欄位在立場與論點上是一樣的。第二,唯一明顯的勝出是在有序的 Score 尺度上,19 對 14:那正是這個基本元件被打造出來要做的事,而這類結果是你從文字答案根本得不到的。

任何人若以此證據聲稱決策模型在類別上比 LLM 更準確,都是對 24 份文件樣本的過度解讀。真正有意思的主張是更狹隘的那一個。

成本問題

同一項測試也為這項工作算出每 1,000 份文件的價格:

Jev 1.13 DeepSeek,關閉推理 DeepSeek,啟用推理
每 1,000 份文件成本 $0.22 $1.31 $3.08
中位延遲 0.32 秒 2.7 秒 26 秒
最慢請求 1.3 秒 17.9 秒 250 秒

大約是兩種 LLM 配置的六分之一與十四分之一,中位延遲則約為八分之一與八十分之一。作者自己對成因的總結是:捨棄文字生成正是價格能降這麼多的原因,而那些推理 token 只換來 24 份中多兩個立場標籤,代價卻是十倍的延遲。

那只是單一工作負載、單一語言、單一天。你的數字會不同——光是分詞器效率就能改變它們。同一篇評測測得 Jev 的分詞器在挪威語上約為每 token 2.06 個字元,對比你會從英文假設的每 token 約 4 個字元,這使得可用的狀態預算從約 120,000 個字元削減到約 64,000 個。

校準才是真正的差異

這正是決定你能否自動化的部分。一個準確率 86% 且知道自己錯在哪 14% 的模型,與一個準確率 88% 且對所有事聽起來同樣確定的模型,是不同的工具。

同樣來自該次執行,在 192 項論點判斷上:

Jev 陳述的概率 判斷數 參考標籤一致
0.0 – 0.1 14 0%
0.1 – 0.3 56 4%
0.3 – 0.7 41 34%
0.7 – 0.9 38 97%
0.9 – 1.0 43 98%

方向在每一步都是對的,而模型在兩端都略微偏向低自信——TypeSafe 自家的目標是被指派 0.8 的結果應該約有 80% 的時間發生,而中間那一格落在 34%,而非約 50%。

那張表的實務版本就是一個閾值。以最高概率切分選擇題:

最高概率 ≥ 0.9 低於 0.9
立場 15 份中的 14 份一致 9 份中的 6 份一致
受訪者類型 20 份中的 20 份一致 3 份中的 1 份一致

這就是運作模式:接受有信心的多數,升級其餘的。 TypeSafe 自家的 SEC 申報文件操作指南在英文上回報 30 份中 27 份在 0.9 以上正確;挪威語那次執行則是 15 份中 14 份。

這項比較只單向成立。啟用推理時,DeepSeek 將 192 項論點答案中的 84 項放在 0.9 以上——而在 0.7–0.9 這個區間,它的標籤與參考標籤相符的時間只有 48%。一個信心未經校準的模型無法當作閘門使用,無論它的答案有多好。

LLM 仍然是正確選擇的地方

  • 生成。 Jev 不會寫摘要、回覆或提交訊息。TypeSafe 自家的文件也把生成導向生成式模型。
  • 推理與多跳問題。 TypeSafe 將間接性列為已知弱點:帶有雙重否定或多重跳躍的問題會犧牲準確度。
  • 算術、日期與計數。 已記載為不可靠,且誤差會隨被計數之物的規模而增大。把它留在程式碼裡。
  • 圖像與音訊。 Jev 是純文字的。在 TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway 中,Bartosz Mikulski 將 400 張草圖轉換為 SVG 座標字串,並要求 Jev 為它們命名。它明顯勝過十選一的隨機基準,敗給 Claude Sonnet 5,並且對超過半數的圖都回答「airplane」。同樣的內容以 base64 編碼後則落在隨機水準——這是有用的提醒:文字模型讀數字時,是把數字當文字在讀。
  • 任何需要解釋的事。 「你為什麼把這個標成那樣」不是一個概率能回答的問題。

TypeSafe 的創辦人在 LLM 那一側提出了一個相關論點,值得一知,因為它與一個常見的變通做法相牴觸:在發布討論串中,他主張 OpenAI 式結構化輸出所用的那種約束解碼會讓模型變笨,因為遮罩無效 token 並不等同於模型對它們不困惑。把那當作廠商立場,而非定論——但它確實意味著「直接從便宜模型逼出 JSON」並不自動等同於具型別的答案。

行得通的模式

挪威語那篇評測中最有用的結論是:這個選擇並非二選一。作者自己的專案用了三個模型做三件事:

工作 模型 原因
48 個審慎的參考標籤 Fable 5 文件少、屬判斷性決定、成本無所謂
每份文件、每個問題 Jev 低成本、快速,且會在不確定時說明
對不確定的三分之一取得第二意見 DeepSeek 或人工 較慢且較貴,所以只用於需要之處

你今天就能用單一 OpenAI 相容金鑰跑出這個形態,以低成本層級作為第一輪,僅對第一輪無法解決的案例使用更強的層級:

  1. 第一輪用能達到你標準的最便宜層級。 gpt-5.6-luna 每 1M 為 $0.022 / $0.134,或 glm-5.3-flash 為 $0.105 / $0.35,或 deepseek-flash 為 $0.15 / $0.60。
  2. 在提示中把決策逼進一個封閉集合,並要求附上一個信心分數。把該分數當作提示,而非校準過的概率——那正是決策模型能填補、而提示工程填補不了的落差。
  3. 只升級低於你閾值的部分。 gpt-5.6-sol 在 19 條路由上從 $0.297 / $1.781 起,或 gemini-3.8-flash 在 7 條路由上從 $0.20 / $1.00 起。
  4. 把算術、日期與計數留在你自己的程式碼裡,兩個層級皆然。它更便宜,而且它是正確的。
  5. 在擴大規模前先量測你自己的相符率。 五十筆人工標註的項目,會比任何基準表——包括這一張——告訴你更多。

這個模式的經濟邏輯,正是路由之所以成為一個品類的原因:第一輪是幾乎所有流量所在之處,而升級層級則是幾乎所有品質的來源。你只需要對你無法分類的少數使用第二個。

建立 APIMaster 帳號,從 $1 起加入隨用隨付額度,在主控台建立金鑰,並將 OpenAI 相容客戶端指向 https://apimaster.ai/v1,搭配上述任一模型 ID。一組金鑰涵蓋 GPT、GLM、DeepSeek、Gemini 與 Claude 系列,因此升級路徑維持在同一套整合上。在將生產流量移轉之前,先用模型測試器驗證路由。

FAQ

Jev 是語言模型嗎? 不是。TypeSafe 將其描述為結構化資料模型,而創辦人在發布討論串中的原話是它「技術上不是語言模型(它不生成語言)」。它讀取文字並回傳決策。

Jev 比 LLM 更準確嗎? 就公開證據而言,並未可量測地更準確。在一項 24 份文件的挪威語測試中,Jev 與 DeepSeek V4.1 Flash 在立場與論點問題上與參考標籤一致的比例相同。Jev 在一項有序尺度任務上明顯領先。

Jev 比 LLM 便宜嗎? 是的,以每項任務計——而非每個輸入 token。Jev 每 1M 輸入 token $0.042 的價格被 gpt-5.6-luna 的輸入 $0.022 壓過,但 Jev 完全不產生輸出 token,而生成式模型要為輸出計費。在該公開工作負載中,這算下來是每 1,000 份文件 $0.22,對比 $1.31 與 $3.08。

什麼是「LLM as a judge」,它有何不同? LLM-as-a-judge 是指要求生成式模型對某物評分或標註,再從它的文字中讀出答案。這行得通,但你要為文字付費、要等 token,而且你拿回來的信心不是校準過的概率。決策模型則以具型別的答案回傳同樣的判斷,讓你可以設閾值。

我可以改為直接從便宜模型逼出 JSON 輸出嗎? 那能給你 schema,但給不了校準。約束解碼讓輸出可解析;它不會告訴你哪些答案該存疑,而 TypeSafe 主張它可能因為遮罩模型真正不確定的 token 而降低品質。

分類該用哪一個? 如果你只做少數幾項判斷、準確度就是一切,而且你能審閱它們,那麼好的 LLM 就夠了。如果你要做大量判斷且需要自動化,就用任何能回傳可用信心訊號的方法,並升級不確定的那些。

Jev 能處理非英文文字嗎? 能,但有附帶條件。TypeSafe 表示英文是準確度最佳之處,其他語言包括 CJK 都能處理,但表現並非同樣好。上述挪威語測試發現它能正確讀取掃描的議會會議紀錄,同時也測得分詞器效率約為每 token 2.06 個字元——在圍繞上下文上限做規劃之前,值得先在你的語言上查核。

Jev 能看圖像嗎? 不能。它是純文字的。把圖像轉成文字再問 Jev 可以勝過隨機,但它會慘敗給真正能看見的模型。

Jev 在 APIMaster 上可用嗎? 尚未販售——Jev 正在 APIMaster 上進行上架流程,待整合上線後本頁將會更新。這項比較另一側的模型現在即可使用。

第一輪該從哪個低成本模型開始? gpt-5.6-luna 是市集上最便宜的層級,3 條路由每 1M token 為 $0.022 / $0.134——是本文表格中最低的輸入與輸出費率。glm-5.3-flash 的 $0.105 / $0.35 與 deepseek-flash 的 $0.15 / $0.60 則是再往上的下一步。在投入流量之前,先用自己的資料量測。

來源與延伸閱讀

第三方測試結果均依其作者發表原樣轉載;兩位作者皆未因撰寫評測而獲得報酬,亦未審閱本頁。APIMaster 路由價格讀取於 2026 年 9 月 20 日。Jev 的 APIMaster 上架流程正在進行中,本頁將隨進展更新。