APIMaster.ai
블로그로 돌아가기
APIMaster 블로그

Jev vs LLM: 의사결정 모델이 프롬프팅을 앞서는 지점, 그리고 그렇지 않은 지점

Jev는 타입이 지정된 확률을 반환하고, LLM은 파싱해야 하는 텍스트를 반환합니다. 제3자 테스트에서 문서 1,000건당 비용은 $0.22 대 $1.31–$3.08로 나타났으며, 결정적 차이는 정확도가 아니라 신뢰도입니다.

JevTypeSafeSystem OneLLM as a judgeAI decision modelsAI API pricingAPIMaster

게시 2026-09-20

빠른 답변

정확도에 관해 솔직히 말하면, 둘은 동등합니다. 우리가 찾은 가장 상세한 공개 비교는 동일한 24건의 노르웨이 정부 청문 문서를 두 모델에 적용한 것으로, Jev와 DeepSeek V4.1 Flash가 참조 레이블과 사실상 같은 비율로 일치했다는 결과를 보였습니다 — 입장(stance)에서 24건 중 20건, 192개의 예/아니오 논증 판단에서 0.86 대 0.89로, 이는 24건 표본의 노이즈 범위 안입니다. 두 모델을 갈라놓은 것은 어느 쪽이 맞았는지가 아니었습니다. 바로 모델이 확신이 없을 때 그것을 알려주는지 여부였습니다.

프로덕션에서 선택을 결정하는 세 가지 차이:

  • 비용 구조. Jev는 입력 토큰 10억 개당 $42(100만 개당 $0.042)를 청구하고 출력에는 아무것도 받지 않습니다. 토큰을 전혀 내보내지 않기 때문입니다. 생성 모델은 입력과 출력 모두에 비용을 지불하며, 추론 모델은 많은 사고에 비용을 지불합니다. 같은 테스트에서 DeepSeek는 24개의 양식을 채우기 위해 47,000개의 추론 토큰을 작성했습니다.
  • 캘리브레이션. Jev가 확률 0.8이라고 말했을 때 참조 레이블은 약 80%의 경우 일치했습니다. 추론을 활성화한 DeepSeek가 0.8이라고 적었을 때 참조는 약 절반의 경우 일치했습니다. 이것이 의사결정 모델을 쓰는 이유의 전부입니다: 임계값을 설정하고 그것을 신뢰할 수 있습니다.
  • 출력 계약. Jev는 확률과 신뢰도 값이 함께 있는 타입이 지정된 답변 — Choice, Score, Noul — 을 반환합니다. LLM은 파싱해야 하는 텍스트를 반환하며, 그것이 표명하는 신뢰도는 분기 조건으로 쓸 수 있는 숫자가 아니라 문장입니다.

LLM이 여전히 이기는 지점: 생성, 설명, 다단계 추론, 산술, 또는 장문 문서 작업이 필요한 모든 것. 한 공개 테스트에서 텍스트 전용 Jev에게 좌표 문자열로 변환된 400개의 손으로 그린 스케치의 이름을 대라고 요청했는데, 우연 기준을 크게 앞섰지만 Claude Sonnet 5에는 졌고, 절반 이상에 대해 "airplane"이라고 답했습니다.

오늘 구매할 수 있는 것. Jev는 APIMaster에서 판매되지 않습니다 — 온보딩 중이며, 통합이 완료되면 이 페이지가 업데이트될 것입니다. 이 비교의 나머지 절반은 지금 구매 가능합니다: gpt-5.6-luna100만 토큰당 입력 $0.022 / 출력 $0.134부터(3개 라우트 판매 중, OpenAI의 $0.20 / $1.20 정가 대비 약 89% 저렴), glm-5.3-flash$0.105 / $0.35부터(3개 라우트, Zhipu 정가 대비 약 30% 할인), deepseek-flash$0.15 / $0.60부터(1개 라우트, DeepSeek 자체의 오프피크 요금). 아래 패턴의 에스컬레이션 절반에는 gpt-5.6-sol이 19개 라우트에 걸쳐 $0.297 / $1.781부터 시작합니다. OpenAI 호환 키 하나로 이들 모두를 커버합니다 — Luna 카드모델 마켓플레이스를 참고하세요. 라우트 가격은 채널 공급에 따라 변동하며, 실시간 카드가 기준이 되는 숫자입니다. 2026년 9월 20일 확인.

GPT 체험권(GPT-6 Astra, GPT-5.6, GPT-5.5 및 GPT Image 2 사용 가능)

가입하고 $20 GPT 체험권 받기

지금 받기

"더 낫다 혹은 더 나쁘다"의 문제가 아닙니다

Jev와 LLM은 서로 다른 질문에 답합니다. Jev는 어느 것인지, 얼마나인지, 또는 얼마나 가능성 있는지에 답하고, LLM은 무엇을 써야 하는지에 답합니다.

Jev 생성형 LLM
출력 옵션별 확률과 신뢰도 값이 있는 타입 지정 답변 텍스트, 선택적으로 JSON 스키마로 제약 가능
비용 기준 입력 토큰만; 출력은 무료 입력 + 출력 토큰
지연 형태 단일 순전파; 질문들이 하나의 상태 위에서 병렬로 분기 순차적으로 생성되는 토큰; 추론 모델은 긴 은닉 패스를 추가
신뢰도 임계값을 설정할 수 있는 캘리브레이션된 숫자 보통 없음, 또는 자기 보고 문장
스키마 구조적으로 일치 모델이 일치하지 않기로 결정할 때까지 일치
알려진 입력 텍스트와 구조화된 상태만, 이미지 없음 텍스트, 그리고 멀티모달 모델의 경우 이미지
앞서는 지점 좁고 대량인 판단 생성, 추론, 설명, 산술

텍스트 출력이 더 이상 필요 없어지는 순간, 산술이 바뀝니다. 항목당 스무 개의 산문 토큰을 만들어내는 분류기 형태의 작업은 매 항목마다, 영원히 그 토큰에 비용을 지불하고 있는 것입니다.

정확도 문제, 실제 숫자와 함께

마케팅 비교는 보통 각 벤더가 가장 좋아하는 벤치마크를 상대의 최악과 비교합니다. 우리가 찾은 유용한 공개 테스트는 Emil Lindfors의 얼리 액세스 글 An early-access test of TypeSafe's Jev로, 노르웨이의 2022년 연어 양식 자원 임대료 세금 청문에 대한 24건의 응답을 대상으로 했습니다.

그는 먼저 Claude Fable 5.1로 두 번의 독립적인 패스로 모든 것에 레이블을 붙인 뒤, Jev 1.13을 OpenRouter를 통한 DeepSeek V4.1 Flash와 비교했습니다 — 같은 질문을 하나의 프롬프트에 넣고 JSON으로 출력하며, 추론을 켠 경우와 끈 경우 각각 한 번씩.

작업 Jev 1.13 DeepSeek, 추론 끔 DeepSeek, 추론 켬
입장, 4개 옵션 24건 중 20건 24건 중 20건 24건 중 22건
응답자 유형, 6개 옵션 23건 중 21건 23건 중 22건 23건 중 23건
논증, 192개 예/아니오 0.86 0.89 0.88
실질, 정확한 수준 24건 중 19건 24건 중 14건 24건 중 14건

그 표에서 읽어낼 만한 두 가지가 있습니다. 첫째, 저자는 이것이 정확성이 아니라 프런티어 모델의 레이블과의 일치임을 명확히 밝힙니다 — 참조가 틀리고 Jev가 맞은 경우, Jev는 틀린 것으로 채점됩니다. 24건의 문서로 입장 수치의 95% 구간은 약 ±15포인트이므로, 세 열은 입장과 논증에서 동일합니다. 둘째, 명확한 승리 하나는 순서형 Score 척도에서 19 대 14입니다: 이것은 그 프리미티브가 바로 그 용도로 만들어졌음을 보여주는 결과이며, 텍스트 답변에서는 전혀 얻을 수 없는 종류의 결과입니다.

이 증거를 근거로 의사결정 모델이 LLM보다 범주적으로 더 정확하다고 주장하는 사람은 24건 표본을 과대 해석하는 것입니다. 흥미로운 주장은 더 좁은 쪽입니다.

비용 문제

같은 테스트에서 문서 1,000건당 작업 비용을 산정했습니다:

Jev 1.13 DeepSeek, 추론 끔 DeepSeek, 추론 켬
문서 1,000건당 비용 $0.22 $1.31 $3.08
중앙값 지연 0.32초 2.7초 26초
가장 느린 요청 1.3초 17.9초 250초

두 LLM 구성의 약 6분의 1과 14분의 1이며, 중앙값 지연은 약 8분의 1과 80분의 1입니다. 저자 자신의 원인 요약: 텍스트 생성을 제거한 것이 가격이 그렇게까지 떨어지는 이유이며, 추론 토큰은 24건 중 2건의 추가 입장 레이블을 위해 10배의 지연을 치른 것입니다.

이것은 하나의 워크로드, 하나의 언어, 하루입니다. 여러분의 숫자는 다를 것입니다 — 토크나이저 효율만으로도 달라집니다. 같은 글에서 Jev의 토크나이저를 노르웨이어에서 토큰당 약 2.06자로 측정했는데, 영어에서 가정할 법한 토큰당 약 4자와 대비되며, 이는 사용 가능한 상태 예산을 약 120,000자에서 약 64,000자로 줄입니다.

캘리브레이션이 실제 차이입니다

이 부분이 자동화할 수 있는지를 결정합니다. 86%의 경우 맞으면서 어느 14%에서 틀렸는지 아는 모델은, 88%의 경우 맞으면서 모든 것에 똑같이 확신하는 듯 들리는 모델과는 다른 도구입니다.

같은 실행에서, 192개의 논증 판단에 대해:

Jev가 표명한 확률 판단 수 참조 일치
0.0 – 0.1 14 0%
0.1 – 0.3 56 4%
0.3 – 0.7 41 34%
0.7 – 0.9 38 97%
0.9 – 1.0 43 98%

방향은 모든 단계에서 맞으며, 모델은 양 끝에서 약간 과소확신하는 경향이 있습니다 — TypeSafe 자체의 목표는 0.8로 할당된 결과가 약 80%의 경우 발생해야 한다는 것이고, 중간 구간은 ~50%가 아니라 34%로 나왔습니다.

그 표의 실용적인 버전은 임계값입니다. 선택 질문을 최상위 확률로 나누면:

최상위 확률 ≥ 0.9 0.9 미만
입장 15건 중 14건 일치 9건 중 6건 일치
응답자 유형 20건 중 20건 일치 3건 중 1건 일치

이것이 운영 패턴입니다: 확신하는 다수는 수용하고, 나머지는 에스컬레이션하세요. TypeSafe 자체의 SEC 공시 요리책은 영어에서 0.9 이상에서 30건 중 27건 정답을 보고하며, 노르웨이어 실행은 15건 중 14건을 얻었습니다.

비교는 한 방향으로만 작동합니다. 추론을 활성화한 DeepSeek는 192개의 논증 답변 중 84개를 0.9 이상으로 놓았고, 0.7–0.9 구간에서 그 레이블은 참조와 48%의 경우 일치했습니다. 신뢰도가 캘리브레이션되지 않은 모델은 답변이 아무리 좋아도 게이트로 사용할 수 없습니다.

LLM이 여전히 올바른 선택인 지점

  • 생성. Jev는 요약, 답장, 커밋 메시지를 작성하지 않습니다. TypeSafe 자체 문서도 생성을 생성 모델로 보냅니다.
  • 추론과 다중 홉 질문. TypeSafe는 간접성(indirection)을 알려진 약점으로 나열합니다: 이중 부정이나 여러 홉이 있는 질문은 정확도를 떨어뜨립니다.
  • 산술, 날짜, 세기. 신뢰할 수 없는 것으로 문서화되어 있으며, 오류는 세는 대상의 크기에 따라 커집니다. 코드에 두세요.
  • 이미지와 오디오. Jev는 텍스트 전용입니다. TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway에서 Bartosz Mikulski는 400개의 스케치를 SVG 좌표 문자열로 변환하고 Jev에게 이름을 대라고 했습니다. 열 가지 우연 기준선을 분명히 앞섰고, Claude Sonnet 5에는 졌으며, 절반 이상의 그림에 "airplane"이라고 답했습니다. 같은 내용을 base64로 인코딩하니 우연 수준에 머물렀습니다 — 텍스트 모델이 숫자를 읽을 때 그것을 텍스트로 읽는다는 유용한 상기입니다.
  • 설명이 필요한 모든 것. "왜 이것을 그렇게 레이블했나요"는 확률이 답하는 질문이 아닙니다.

TypeSafe의 창립자는 LLM 쪽에 대해 흔한 우회책에 반하는 관련 주장을 펼치는데, 알아둘 가치가 있습니다: 출시 스레드에서 그는 OpenAI 스타일 구조화 출력이 사용하는 종류의 제약 디코딩이 모델을 더 멍청하게 만든다고 주장했습니다. 유효하지 않은 토큰을 마스킹하는 것이 모델이 그 토큰에 대해 혼란스러워하지 않는 것과 같지 않기 때문입니다. 이는 확정된 결과라기보다 벤더의 입장으로 취급하세요 — 하지만 "저렴한 모델에서 그냥 JSON을 강제로 뽑아내기"가 자동으로 타입 지정 답변과 동등하지는 않다는 것을 의미합니다.

작동하는 패턴

노르웨이어 글에서 가장 유용한 결론은 선택이 양자택일이 아니라는 것입니다. 저자 자신의 프로젝트는 세 가지 작업에 세 가지 모델을 사용했습니다:

작업 모델 이유
48개의 신중한 참조 레이블 Fable 5.1 문서가 적고, 판단이 필요하며, 비용은 중요하지 않음
모든 문서, 모든 질문 Jev 저비용, 빠름, 그리고 확신이 없을 때 알려줌
불확실한 3분의 1에 대한 제2의 의견 DeepSeek 또는 사람 더 느리고 더 비싸므로, 필요한 곳에만

이 형태는 오늘 OpenAI 호환 키 하나로 실행할 수 있습니다. 저비용 티어를 1차 패스로 쓰고, 1차 패스가 해결하지 못하는 경우에만 더 강한 티어를 사용합니다:

  1. 기준을 통과하는 가장 저렴한 티어로 1차 패스. gpt-5.6-luna는 100만 토큰당 $0.022 / $0.134, 또는 glm-5.3-flash는 $0.105 / $0.35, 또는 deepseek-flash는 $0.15 / $0.60.
  2. 프롬프트에서 결정을 닫힌 집합으로 강제하고, 그와 함께 신뢰도 점수를 요청하세요. 점수는 힌트로 취급하고 캘리브레이션된 확률로 취급하지 마세요 — 그것이 의사결정 모델이 채우고 프롬프트 엔지니어링은 채우지 못하는 간극입니다.
  3. 임계값 아래로 떨어지는 것만 에스컬레이션하세요. gpt-5.6-sol은 19개 라우트에 걸쳐 $0.297 / $1.781부터, 또는 gemini-3.8-flash는 7개 라우트에 걸쳐 $0.20 / $1.00부터.
  4. 산술, 날짜, 세기는 두 티어 모두에서 자체 코드에 두세요. 더 저렴하고 정확합니다.
  5. 확장하기 전에 자체 일치율을 측정하세요. 손으로 레이블을 붙인 50개 항목이 이 글을 포함한 어떤 벤치마크 표보다 더 많은 것을 알려줄 것입니다.

그 패턴의 경제성이 라우팅이 하나의 범주로 존재하는 이유입니다: 1차 패스는 거의 모든 볼륨이 가는 곳이고, 에스컬레이션 티어는 거의 모든 품질이 나오는 곳입니다. 분류할 수 없는 소수에만 두 번째가 필요합니다.

APIMaster 계정을 만드세요, $1부터 종량제 크레딧을 추가하고, 콘솔에서 키를 생성한 뒤, OpenAI 호환 클라이언트를 위의 모델 ID 중 하나로 https://apimaster.ai/v1에 지정하세요. 키 하나로 GPT, GLM, DeepSeek, Gemini, Claude 패밀리를 모두 커버하므로 에스컬레이션 경로가 같은 통합에 머뭅니다. 프로덕션 트래픽을 옮기기 전에 모델 테스터로 라우트를 검증하세요.

FAQ

Jev는 언어 모델인가요? 아니요. TypeSafe는 그것을 구조화 데이터 모델로 설명하며, 창립자 자신의 출시 스레드 표현은 "기술적으로 언어 모델이 아니다(언어를 생성하지 않는다)"입니다. 텍스트를 읽고 결정을 반환합니다.

Jev가 LLM보다 더 정확한가요? 공개된 증거로는 측정 가능하게 그렇지 않습니다. 24건의 노르웨이어 테스트에서 Jev와 DeepSeek V4.1 Flash는 입장과 논증 질문에서 참조 레이블과 같은 비율로 일치했습니다. Jev는 하나의 순서형 척도 작업에서 분명히 앞섰습니다.

Jev가 LLM보다 저렴한가요? 작업당으로는 그렇습니다 — 입력 토큰당으로는 아닙니다. Jev의 100만 입력 토큰당 $0.042는 입력에서 gpt-5.6-luna의 $0.022에 밀리지만, Jev는 출력 토큰을 전혀 내보내지 않으며 생성 모델은 출력에 청구됩니다. 공개된 워크로드에서 그것은 문서 1,000건당 $0.22 대 $1.31 및 $3.08이었습니다.

"LLM as a judge"란 무엇이고 어떻게 다른가요? LLM-as-a-judge는 생성 모델에게 무언가를 평가하거나 레이블하도록 요청하고 그 텍스트에서 답을 읽어내는 것을 의미합니다. 작동은 하지만, 텍스트에 비용을 지불하고, 토큰을 기다리며, 돌려받는 신뢰도는 캘리브레이션된 확률이 아닙니다. 의사결정 모델은 같은 판단을 임계값을 설정할 수 있는 타입 지정 답변으로 반환합니다.

저렴한 모델에서 그냥 JSON 출력을 강제하면 안 되나요? 그것은 스키마를 얻어줄 뿐, 캘리브레이션은 아닙니다. 제약 디코딩은 출력을 파싱 가능하게 만들지만, 어떤 답변을 불신해야 하는지 알려주지 않으며, TypeSafe는 모델이 진정으로 불확실해했던 토큰을 마스킹함으로써 품질을 저하시킬 수 있다고 주장합니다.

분류에는 어느 것을 써야 하나요? 정확도가 전부이고 검토할 수 있는 소수의 판단을 내린다면 좋은 LLM이면 충분합니다. 많은 판단을 내리고 자동화해야 한다면, 사용 가능한 신뢰도 신호를 반환하는 것을 쓰고 불확실한 것들을 에스컬레이션하세요.

Jev가 비영어 텍스트를 처리하나요? 처리합니다, 단서가 있습니다. TypeSafe는 영어가 정확도가 가장 좋은 언어이며 CJK를 포함한 다른 언어도 처리되지만 똑같이 잘 되지는 않는다고 말합니다. 위의 노르웨이어 테스트는 스캔된 의회 회의록을 올바르게 읽어냈으며, 토크나이저 효율을 토큰당 약 2.06자로 측정하기도 했습니다 — 컨텍스트 한도를 계획하기 전에 여러분의 언어에서 확인할 가치가 있습니다.

Jev가 이미지를 볼 수 있나요? 아니요. 텍스트 전용입니다. 이미지를 텍스트로 변환하고 Jev에게 묻는 것이 우연보다 나을 수 있지만, 실제로 볼 수 있는 모델에는 크게 뒤집니다.

Jev를 APIMaster에서 쓸 수 있나요? 아직 판매되지 않습니다 — Jev는 APIMaster에서 온보딩 중이며, 통합이 완료되면 이 페이지가 업데이트될 것입니다. 이 비교의 반대편에 있는 모델들은 지금 이용 가능합니다.

1차 패스로 어떤 저비용 모델부터 시작해야 하나요? gpt-5.6-luna는 3개 라우트에 걸쳐 100만 토큰당 $0.022 / $0.134로 마켓플레이스에서 가장 저렴한 티어입니다 — 이 글의 표에서 가장 낮은 입력 및 출력 요율입니다. glm-5.3-flash는 $0.105 / $0.35, deepseek-flash는 $0.15 / $0.60이 그다음 단계입니다. 볼륨을 확정하기 전에 자체 데이터로 측정하세요.

출처 및 추가 읽을거리

제3자 테스트 결과는 저자가 게시한 그대로 재현했습니다. 두 저자 모두 원고에 대한 대가를 받지 않았으며 이 페이지를 검토하지 않았습니다. APIMaster 라우트 가격은 2026년 9월 20일에 확인했습니다. Jev의 APIMaster 온보딩이 진행 중이며 진행됨에 따라 이 페이지가 업데이트될 것입니다.