Jev vs LLM: Nơi mô hình quyết định vượt trội so với gợi ý, và nơi nó không
Jev trả về xác suất có kiểu dữ liệu; một LLM trả về văn bản mà bạn phải phân tích. Các thử nghiệm của bên thứ ba đưa ra chi phí cho 1.000 tài liệu là 0,22 đô la so với 1,31–3,08 đô la, và sự khác biệt quyết định nằm ở độ tin cậy, không phải độ chính xác.
Published 2026-09-20
Về độ chính xác, câu trả lời trung thực là chúng ngang nhau. So sánh công khai chi tiết nhất mà chúng tôi tìm thấy đã chạy cả hai trên cùng 24 tài liệu tham vấn của chính phủ Na Uy và phát hiện Jev và DeepSeek V4.1 Flash đồng ý với nhãn tham chiếu ở mức hiệu quả như nhau — 20 trên 24 về lập trường, 0,86 so với 0,89 trên 192 phán đoán lập luận có/không, nằm trong nhiễu của một mẫu 24 tài liệu. Điều phân biệt chúng không phải là cái nào đúng. Mà là liệu mô hình có cho bạn biết khi nó không chắc chắn hay không.
Ba khác biệt quyết định lựa chọn trong sản xuất:
- Cấu trúc chi phí. Jev tính 42 đô la cho mỗi tỷ token đầu vào (0,042 đô la cho mỗi 1M) và không tính gì cho đầu ra, vì nó không phát ra token nào. Một mô hình sinh trả tiền cho cả hai, và một mô hình suy luận trả tiền cho rất nhiều suy nghĩ: trong cùng thử nghiệm đó, DeepSeek đã viết 47.000 token lập luận để điền vào 24 biểu mẫu.
- Hiệu chuẩn. Khi Jev nói xác suất 0,8, nhãn tham chiếu đồng ý khoảng 80% thời gian. Khi DeepSeek với tính năng suy luận được bật ghi 0,8, tham chiếu đồng ý khoảng một nửa thời gian. Đó là toàn bộ lập luận cho một mô hình quyết định: bạn có thể đặt ngưỡng và tin tưởng nó.
- Hợp đồng đầu ra. Jev trả về câu trả lời có kiểu dữ liệu —
Choice,Score,Noul— với một xác suất và một giá trị độ tin cậy. Một LLM trả về văn bản mà bạn phải phân tích, và độ tin cậy mà nó nêu là một câu, không phải một con số mà bạn có thể phân nhánh.
Nơi một LLM vẫn thắng: bất cứ thứ gì cần sinh văn bản, giải thích, lập luận nhiều bước, số học, hoặc xử lý tài liệu dài. Trong một thử nghiệm công khai, một Jev chỉ văn bản được yêu cầu đặt tên cho 400 bản phác thảo vẽ tay đã được chuyển đổi thành chuỗi tọa độ; nó vượt xa mức ngẫu nhiên, thua Claude Sonnet 5, và trả lời "airplane" cho hơn một nửa trong số đó.
Những gì bạn có thể mua ngay hôm nay. Jev chưa được bán trên APIMaster — nó đang trong quá trình tích hợp, và trang này sẽ được cập nhật khi tích hợp hoàn tất. Nửa còn lại của so sánh này có thể mua được ngay: gpt-5.6-luna từ 0,022 đô la vào / 0,134 đô la ra mỗi 1M token (3 tuyến đang bán, khoảng 89% dưới giá niêm yết 0,20 / 1,20 đô la của OpenAI), glm-5.3-flash từ 0,105 / 0,35 (3 tuyến, khoảng 30% dưới giá niêm yết của Zhipu), và deepseek-flash từ 0,15 / 0,60 (1 tuyến, ở mức giá ngoài giờ cao điểm của chính DeepSeek). Đối với nửa leo thang của mô hình bên dưới, gpt-5.6-sol bắt đầu từ 0,297 / 1,781 trên 19 tuyến. Một khóa tương thích OpenAI bao phủ tất cả chúng — xem thẻ Luna và chợ mô hình. Giá tuyến theo nguồn cung kênh; thẻ trực tiếp là con số đáng tin. Đã kiểm tra ngày 20 tháng 9 năm 2026.
Dùng thử GPT(GPT-6 Astra, GPT-5.6, GPT-5.5 và GPT Image 2 khả dụng)
Đăng ký và nhận $20 dùng thử GPT
Đây không phải là câu hỏi "tốt hơn hay tệ hơn"
Jev và một LLM đang trả lời những câu hỏi khác nhau. Jev trả lời cái nào, bao nhiêu, hoặc khả năng bao nhiêu; một LLM trả lời nên viết gì.
| Jev | Một LLM sinh | |
|---|---|---|
| Đầu ra | Câu trả lời có kiểu dữ liệu với xác suất cho mỗi lựa chọn và giá trị độ tin cậy | Văn bản, tùy chọn bị ràng buộc vào một lược đồ JSON |
| Cơ sở chi phí | Chỉ token đầu vào; đầu ra miễn phí | Token đầu vào cộng đầu ra |
| Hình dạng độ trễ | Một lượt truyền xuôi; các câu hỏi tỏa ra song song trên một trạng thái | Token được sinh tuần tự; mô hình suy luận thêm một lượt ẩn dài |
| Độ tin cậy | Một con số đã hiệu chuẩn mà bạn có thể đặt ngưỡng | Thường không có, hoặc một câu tự báo cáo |
| Lược đồ | Khớp theo cấu trúc | Khớp cho đến khi mô hình quyết định là không |
| Đầu vào đã biết | Chỉ văn bản và trạng thái có cấu trúc, không có hình ảnh | Văn bản, và hình ảnh cho các mô hình đa phương thức |
| Vượt trội ở | Các phán đoán hẹp, khối lượng lớn | Sinh văn bản, lập luận, giải thích, số học |
Khoảnh khắc bạn ngừng cần đầu ra văn bản, phép tính thay đổi. Một tác vụ có dạng phân loại tạo ra hai mươi token văn xuôi cho mỗi mục đang trả tiền cho những token đó trên từng mục, mãi mãi.
Câu hỏi về độ chính xác, với số liệu thực
Các so sánh tiếp thị thường so sánh điểm chuẩn yêu thích của mỗi nhà cung cấp với điểm tệ nhất của nhà kia. Thử nghiệm công khai hữu ích mà chúng tôi tìm thấy là bài viết truy cập sớm của Emil Lindfors, An early-access test of TypeSafe's Jev, chạy trên 24 phản hồi cho phiên điều trần năm 2022 của Na Uy về thuế tiền thuê tài nguyên nuôi cá hồi.
Ông đã gán nhãn mọi thứ bằng Claude Fable 5.1 trong hai lượt độc lập trước, sau đó so sánh Jev 1.13 với DeepSeek V4.1 Flash qua OpenRouter — cùng câu hỏi trong một gợi ý, đầu ra JSON, một lần với suy luận được bật và một lần tắt.
| Tác vụ | Jev 1.13 | DeepSeek, tắt suy luận | DeepSeek, bật suy luận |
|---|---|---|---|
| Lập trường, 4 lựa chọn | 20 trên 24 | 20 trên 24 | 22 trên 24 |
| Loại người trả lời, 6 lựa chọn | 21 trên 23 | 22 trên 23 | 23 trên 23 |
| Lập luận, 192 có/không | 0,86 | 0,89 | 0,88 |
| Nội dung, mức chính xác | 19 trên 24 | 14 trên 24 | 14 trên 24 |
Có hai điều đáng đọc ra từ bảng đó. Thứ nhất, tác giả nói rõ rằng đây là sự đồng ý với nhãn của một mô hình tiên tiến, không phải tính đúng đắn — nơi tham chiếu sai và Jev đúng, Jev bị tính là sai. Với 24 tài liệu, khoảng tin cậy 95% trên một con số lập trường là khoảng ±15 điểm, vì vậy ba cột là như nhau về lập trường và lập luận. Thứ hai, một thắng lợi rõ ràng là trên thang Score có thứ tự, 19 so với 14: đó là nguyên thủy đang làm chính xác những gì nó được xây dựng để làm, và đó là loại kết quả mà bạn sẽ không nhận được từ một câu trả lời văn bản.
Bất kỳ ai tuyên bố dựa trên bằng chứng này rằng một mô hình quyết định có độ chính xác phân loại cao hơn một LLM đang đọc quá mức một mẫu 24 tài liệu. Tuyên bố thú vị là tuyên bố hẹp hơn.
Câu hỏi về chi phí
Cùng thử nghiệm đó định giá công việc cho mỗi 1.000 tài liệu:
| Jev 1.13 | DeepSeek, tắt suy luận | DeepSeek, bật suy luận | |
|---|---|---|---|
| Chi phí cho 1.000 tài liệu | 0,22 đô la | 1,31 đô la | 3,08 đô la |
| Độ trễ trung vị | 0,32 giây | 2,7 giây | 26 giây |
| Yêu cầu chậm nhất | 1,3 giây | 17,9 giây | 250 giây |
Khoảng một phần sáu và một phần mười bốn của hai cấu hình LLM, ở khoảng một phần tám và một phần tám mươi của độ trễ trung vị. Tóm tắt của chính tác giả về nguyên nhân: bỏ sinh văn bản là lý do giá giảm đến vậy, và các token lập luận mua thêm hai nhãn lập trường trong số 24 với độ trễ gấp mười lần.
Đó là một khối lượng công việc, một ngôn ngữ, một ngày. Con số của bạn sẽ khác — chỉ hiệu quả tokenizer thôi cũng làm chúng thay đổi. Cùng bài viết đó đo tokenizer của Jev ở khoảng 2,06 ký tự mỗi token trên tiếng Na Uy, so với ~4 ký tự mỗi token mà bạn sẽ giả định từ tiếng Anh, điều này cắt ngân sách trạng thái khả dụng từ khoảng 120.000 ký tự xuống khoảng 64.000.
Hiệu chuẩn là sự khác biệt thực sự
Đây là phần quyết định liệu bạn có thể tự động hóa hay không. Một mô hình đúng 86% thời gian và biết mình sai ở 14% nào là một công cụ khác với một mô hình đúng 88% thời gian và nghe có vẻ chắc chắn như nhau về mọi thứ.
Từ cùng lần chạy đó, trên 192 phán đoán lập luận:
| Xác suất Jev nêu | Phán đoán | Tham chiếu đồng ý |
|---|---|---|
| 0,0 – 0,1 | 14 | 0% |
| 0,1 – 0,3 | 56 | 4% |
| 0,3 – 0,7 | 41 | 34% |
| 0,7 – 0,9 | 38 | 97% |
| 0,9 – 1,0 | 43 | 98% |
Hướng đúng ở mọi bước, và mô hình hơi thiếu tự tin ở cả hai đầu — mục tiêu của chính TypeSafe là các kết quả được gán 0,8 nên xảy ra khoảng 80% thời gian, và ngăn giữa đạt 34% thay vì ~50%.
Phiên bản thực tế của bảng đó là một ngưỡng. Chia các câu hỏi lựa chọn theo xác suất cao nhất:
| Xác suất cao nhất ≥ 0,9 | Dưới 0,9 | |
|---|---|---|
| Lập trường | 14 trên 15 đồng ý | 6 trên 9 đồng ý |
| Loại người trả lời | 20 trên 20 đồng ý | 1 trên 3 đồng ý |
Đó là mô hình vận hành: chấp nhận đa số tự tin, leo thang phần còn lại. Sách công thức về hồ sơ SEC của chính TypeSafe báo cáo 27 trên 30 đúng ở mức 0,9 trở lên bằng tiếng Anh; lần chạy tiếng Na Uy đạt 14 trên 15.
So sánh chỉ chạy một chiều. Với suy luận được bật, DeepSeek đặt 84 trong số 192 câu trả lời lập luận của nó trên 0,9 — và trong cửa sổ 0,7–0,9, nhãn của nó khớp với tham chiếu 48% thời gian. Một mô hình có độ tin cậy không được hiệu chuẩn không thể được dùng làm cổng, bất kể câu trả lời của nó tốt đến đâu.
Nơi một LLM vẫn là lựa chọn đúng
- Sinh văn bản. Jev sẽ không viết bản tóm tắt, câu trả lời, hay thông điệp commit. Tài liệu của chính TypeSafe chuyển việc sinh văn bản sang một mô hình sinh.
- Lập luận và câu hỏi nhiều bước. TypeSafe liệt kê sự gián tiếp là một điểm yếu đã biết: các câu hỏi có phủ định kép hoặc nhiều bước tốn độ chính xác.
- Số học, ngày tháng, và đếm. Được ghi nhận là không đáng tin cậy, và lỗi tăng theo kích thước của thứ được đếm. Hãy giữ nó trong mã.
- Hình ảnh và âm thanh. Jev chỉ văn bản. Trong TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway, Bartosz Mikulski đã chuyển đổi 400 bản phác thảo thành chuỗi tọa độ SVG và yêu cầu Jev đặt tên cho chúng. Nó vượt rõ ràng mức cơ sở ngẫu nhiên mười lựa chọn, thua Claude Sonnet 5, và trả lời "airplane" cho hơn một nửa số bản vẽ. Cùng nội dung được mã hóa dưới dạng base64 rơi vào mức ngẫu nhiên — một lời nhắc hữu ích rằng một mô hình văn bản đọc các con số đang đọc chúng như văn bản.
- Bất cứ thứ gì cần giải thích. "Tại sao bạn gán nhãn cái này như vậy" không phải là câu hỏi mà một xác suất trả lời được.
Người sáng lập TypeSafe đưa ra một lập luận liên quan về phía LLM đáng để biết, vì nó chống lại một cách giải quyết phổ biến: trên luồng ra mắt, ông lập luận rằng giải mã bị ràng buộc kiểu mà đầu ra có cấu trúc theo phong cách OpenAI sử dụng làm cho các mô hình kém thông minh hơn, vì việc che các token không hợp lệ không giống như việc mô hình không bị nhầm lẫn về chúng. Hãy coi đó là quan điểm của một nhà cung cấp hơn là một kết quả đã được giải quyết — nhưng điều đó có nghĩa là "chỉ cần ép JSON ra khỏi một mô hình rẻ" không tự động tương đương với một câu trả lời có kiểu dữ liệu.
Mô hình hiệu quả
Kết luận hữu ích nhất trong bài viết tiếng Na Uy là lựa chọn không phải là hoặc/hoặc. Dự án của chính tác giả đã sử dụng ba mô hình cho ba công việc:
| Công việc | Mô hình | Lý do |
|---|---|---|
| 48 nhãn tham chiếu cẩn thận | Fable 5.1 | Ít tài liệu, các quyết định phán đoán, chi phí không quan trọng |
| Mọi tài liệu, mọi câu hỏi | Jev | Chi phí thấp, nhanh, và nói khi nó không chắc chắn |
| Ý kiến thứ hai về một phần ba không chắc chắn | DeepSeek hoặc một người | Chậm hơn và đắt hơn, nên chỉ ở nơi cần thiết |
Bạn có thể chạy hình dạng đó ngay hôm nay với một khóa tương thích OpenAI duy nhất, sử dụng một tầng chi phí thấp làm lượt đầu tiên và một tầng mạnh hơn chỉ cho các trường hợp mà lượt đầu tiên không thể giải quyết:
- Lượt đầu tiên trên tầng rẻ nhất đáp ứng tiêu chuẩn của bạn.
gpt-5.6-lunaở 0,022 / 0,134 mỗi 1M, hoặcglm-5.3-flashở 0,105 / 0,35, hoặcdeepseek-flashở 0,15 / 0,60. - Ép quyết định vào một tập đóng trong gợi ý, và yêu cầu một điểm độ tin cậy đi kèm. Coi điểm đó là một gợi ý, không phải một xác suất đã hiệu chuẩn — đó là khoảng trống mà một mô hình quyết định lấp đầy và kỹ thuật gợi ý không lấp được.
- Chỉ leo thang những gì rơi dưới ngưỡng của bạn.
gpt-5.6-soltừ 0,297 / 1,781 trên 19 tuyến, hoặcgemini-3.8-flashtừ 0,20 / 1,00 trên 7. - Giữ số học, ngày tháng và đếm trong mã của riêng bạn, cho cả hai tầng. Nó rẻ hơn và nó đúng.
- Đo tỷ lệ đồng ý của riêng bạn trước khi mở rộng quy mô. Năm mươi mục được gán nhãn thủ công sẽ cho bạn biết nhiều hơn bất kỳ bảng điểm chuẩn nào, kể cả bảng này.
Kinh tế học của mô hình đó là lý do định tuyến tồn tại như một hạng mục: lượt đầu tiên là nơi gần như toàn bộ khối lượng đi qua, và tầng leo thang là nơi gần như toàn bộ chất lượng đến từ. Bạn chỉ cần cái thứ hai cho thiểu số mà bạn không thể phân loại.
Tạo tài khoản APIMaster, thêm tín dụng trả theo mức sử dụng từ 1 đô la, tạo một khóa trong bảng điều khiển, và trỏ một ứng dụng khách tương thích OpenAI vào https://apimaster.ai/v1 với bất kỳ ID mô hình nào ở trên. Một khóa bao phủ các họ GPT, GLM, DeepSeek, Gemini và Claude, vì vậy đường leo thang vẫn nằm trên cùng một tích hợp. Xác thực một tuyến với trình kiểm tra mô hình trước khi bạn chuyển lưu lượng sản xuất.
FAQ
Jev có phải là một mô hình ngôn ngữ không? Không. TypeSafe mô tả nó như một mô hình dữ liệu có cấu trúc, và cách diễn đạt của chính người sáng lập trên luồng ra mắt là nó "về mặt kỹ thuật không phải là một mô hình ngôn ngữ (nó không sinh ngôn ngữ)". Nó đọc văn bản và trả về các quyết định.
Jev có chính xác hơn một LLM không? Không đo lường được, dựa trên bằng chứng công khai. Trong một thử nghiệm tiếng Na Uy 24 tài liệu, Jev và DeepSeek V4.1 Flash đồng ý với nhãn tham chiếu ở cùng tỷ lệ về các câu hỏi lập trường và lập luận. Jev rõ ràng dẫn trước ở một tác vụ thang có thứ tự.
Jev có rẻ hơn một LLM không?
Có, trên mỗi tác vụ — không phải trên mỗi token đầu vào. Mức 0,042 đô la mỗi 1M token đầu vào của Jev bị gpt-5.6-luna cắt dưới ở mức 0,022 trên đầu vào, nhưng Jev không phát ra token đầu ra nào cả, và các mô hình sinh được tính phí cho đầu ra. Trong khối lượng công việc đã công bố, con số đó là 0,22 đô la cho 1.000 tài liệu so với 1,31 và 3,08 đô la.
"LLM as a judge" là gì và nó khác như thế nào? LLM-as-a-judge nghĩa là yêu cầu một mô hình sinh đánh giá hoặc gán nhãn một thứ gì đó và đọc câu trả lời ra từ văn bản của nó. Nó hoạt động, nhưng bạn trả tiền cho văn bản, bạn chờ các token, và độ tin cậy bạn nhận lại không phải là một xác suất đã hiệu chuẩn. Một mô hình quyết định trả về cùng phán đoán đó dưới dạng một câu trả lời có kiểu dữ liệu mà bạn có thể đặt ngưỡng.
Tôi có thể chỉ ép đầu ra JSON từ một mô hình rẻ thay vào đó không? Nó cho bạn lược đồ, không phải sự hiệu chuẩn. Giải mã bị ràng buộc làm cho đầu ra phân tích được; nó không cho bạn biết câu trả lời nào nên nghi ngờ, và TypeSafe lập luận nó có thể làm giảm chất lượng bằng cách che các token mà mô hình thực sự không chắc chắn.
Tôi nên dùng cái nào cho phân loại? Nếu bạn đưa ra một vài phán đoán nơi độ chính xác là tất cả và bạn có thể xem xét chúng, một LLM tốt là ổn. Nếu bạn đưa ra nhiều phán đoán và cần tự động hóa, hãy dùng bất cứ thứ gì trả về một tín hiệu độ tin cậy dùng được và leo thang những cái không chắc chắn.
Jev có xử lý văn bản không phải tiếng Anh không? Có, với một số lưu ý. TypeSafe nói tiếng Anh là nơi độ chính xác tốt nhất và các ngôn ngữ khác bao gồm CJK được xử lý nhưng không tốt bằng. Thử nghiệm tiếng Na Uy ở trên phát hiện nó đọc đúng biên bản hội đồng được quét, và cũng đo hiệu quả tokenizer ở khoảng 2,06 ký tự mỗi token — đáng để kiểm tra trên ngôn ngữ của riêng bạn trước khi lập kế hoạch quanh giới hạn ngữ cảnh.
Jev có nhìn thấy hình ảnh không? Không. Nó chỉ văn bản. Chuyển đổi một hình ảnh thành văn bản và hỏi Jev về nó có thể vượt mức ngẫu nhiên, nhưng nó thua kém rõ rệt so với một mô hình thực sự có thể nhìn thấy.
Jev có sẵn trên APIMaster không? Chưa được bán — Jev đang trong quá trình tích hợp trên APIMaster, và trang này sẽ được cập nhật khi tích hợp hoàn tất. Các mô hình ở phía bên kia của so sánh này hiện có sẵn.
Tôi nên bắt đầu với mô hình chi phí thấp nào cho lượt đầu tiên?
gpt-5.6-luna là tầng rẻ nhất trên chợ ở mức 0,022 / 0,134 mỗi 1M token trên 3 tuyến — mức giá đầu vào và đầu ra thấp nhất trong bảng của bài viết này. glm-5.3-flash ở 0,105 / 0,35 và deepseek-flash ở 0,15 / 0,60 là các bước tiếp theo. Hãy đo trên dữ liệu của riêng bạn trước khi cam kết khối lượng.
Nguồn và đọc thêm
- Emil Lindfors — An early-access test of TypeSafe's Jev — 24 tài liệu điều trần Na Uy, Jev so với DeepSeek V4.1 Flash có và không có suy luận, với tỷ lệ đồng ý theo tác vụ, các ngăn hiệu chuẩn, chi phí và độ trễ
- Bartosz Mikulski — TypeSafe's Jev Can't See. I Made It Guess What I Drew Anyway — 400 bản phác thảo dưới dạng chuỗi tọa độ, mức cơ sở ngẫu nhiên và so sánh với Sonnet 5
- TypeSafe — Models — ID mô hình, giá 42 đô la/Btok, giới hạn tốc độ, ngân sách ngữ cảnh và hỗ trợ ngôn ngữ
- TypeSafe — Jev 1.13 jaggedness — các ghi chú phạm vi đã công bố về đọc theo nghĩa đen, số học, ngày tháng, gián tiếp và sinh văn bản
- TypeSafe — Introducing System One Models and Jev — con số 70–500ms đầu-cuối và so sánh 40×–200×
- Luồng ra mắt trên Hacker News — các bình luận của người sáng lập về những gì Jev không phải, về giải mã bị ràng buộc và về lý do đầu ra miễn phí
Kết quả thử nghiệm của bên thứ ba được tái bản như các tác giả đã công bố; không tác giả nào được trả tiền cho bài viết của họ hoặc xem xét trang này. Giá tuyến APIMaster được đọc vào ngày 20 tháng 9 năm 2026. Quá trình tích hợp Jev trên APIMaster đang tiến hành và trang này sẽ được cập nhật khi nó tiến triển.
