GLM-5.3-FlashX: Nó Là Gì, Chạy Nhanh Đến Đâu và Chi Phí Bao Nhiêu
GLM-5.3-FlashX là tầng phục vụ tốc độ cao của GLM-5.3-Flash do Zhipu phát triển, ra mắt ngày 18 tháng 9 năm 2026 với tốc độ lên đến 200 token/giây. Dưới đây là model ID đã được xác nhận, giá cả, cửa sổ ngữ cảnh, các benchmark và cách gọi nó.
Published 2026-09-18
GLM-5.3-FlashX là tầng phục vụ tốc độ cao của GLM-5.3-Flash do Zhipu phát triển, ra mắt ngày 18 tháng 9 năm 2026 với tốc độ suy luận đỉnh được công bố là 200 token/giây. Đây không phải là một model mới: nó chính là hệ thống GLM-5.3-Flash — tổng cộng 320B tham số với 18B được kích hoạt, cửa sổ ngữ cảnh 1M token, tối đa 128.000 token đầu ra, và hỗ trợ đầu vào hình ảnh, video, tệp và văn bản gốc — được phục vụ thông qua một cấu hình suy luận nhanh hơn.
Model ID của API là glm-5.3-flashx và nó nằm cạnh glm-5.3-flash. Sự đánh đổi rất rõ ràng: FlashX có giá cao hơn trên mỗi token so với Flash (Zhipu niêm yết $0.37 đầu vào / $1.25 đầu ra trên mỗi 1M token so với $0.15 / $0.50 cho Flash) và trả về phản hồi nhanh hơn. Flash cũng là tầng có trọng số mở và là tầng được bao gồm trong GLM Coding Plan, nơi Flash nhận được hạn mức gấp 3 lần so với GLM-5.3.
Nếu bạn cần thông lượng, độ trễ tương tác, hoặc một vòng lặp agent chạy nhiều lượt ngắn, FlashX là tầng được thiết kế cho việc đó. Nếu bạn đang tối ưu chi phí trên mỗi tác vụ hoàn thành và có thể chờ đợi, Flash rẻ hơn cho cùng một khối lượng công việc.
GLM-5.3-FlashX là gì?
GLM-5.3-FlashX là endpoint được tối ưu tốc độ của dòng GLM-5.3-Flash. Zhipu công bố nó vào ngày 18 tháng 9 năm 2026, mô tả nó nhanh hơn và mượt mà hơn cho các doanh nghiệp và nhà phát triển, với API và trung tâm trải nghiệm chính thức đều mở ngay khi ra mắt.
Có hai điều đáng tách biệt:
- Model — GLM-5.3-Flash, một model đa phương thức gốc 320B-A18B mà Zhipu đã mã nguồn mở vào ngày 26 tháng 8 năm 2026. Kiến trúc, trọng số, độ dài ngữ cảnh và khả năng đều được chia sẻ.
- Tầng phục vụ — FlashX, một cấu hình suy luận được tinh chỉnh cho thông lượng. Zhipu báo cáo tốc độ lên đến 200 token/giây và cho rằng lợi ích đến từ công việc hạ tầng chứ không phải từ một checkpoint khác.
Sự phân biệt đó rất quan trọng khi bạn đánh giá nó. Các benchmark, giới hạn ngữ cảnh và hành vi đa phương thức được mô tả cho GLM-5.3-Flash đều áp dụng cho FlashX vì chúng là cùng một model. Độ trễ và giá thì không: những thứ đó thay đổi theo tầng phục vụ.
Thông số kỹ thuật của model trong nháy mắt
| Thông số | GLM-5.3-FlashX |
|---|---|
| Model ID của API | glm-5.3-flashx |
| Model ID anh em | glm-5.3-flash |
| Ngày ra mắt | 18 tháng 9 năm 2026 |
| Tổng / tham số được kích hoạt | 320B / 18B |
| Số lớp | 45 |
| Cửa sổ ngữ cảnh | 1M token |
| Số token đầu ra tối đa | 128K |
| Phương thức đầu vào | Video, hình ảnh, văn bản, tệp |
| Phương thức đầu ra | Văn bản |
| Tốc độ đỉnh được công bố | 200 token/giây |
| Chế độ suy nghĩ | Chỉ thinking.type: enabled; không thể tắt |
| Tính năng API cốt lõi | Streaming, function calling, context caching, structured output, tool streaming |
Zhipu khuyến nghị temperature: 1, top_p: 0.95 và reasoning_effort: max. Đối với công việc nhiều lượt, họ khuyến nghị giữ lại lịch sử suy nghĩ thay vì xóa nó (clear_thinking: false), và đối với các yêu cầu streaming, họ khuyến nghị bật cả stream: true và tool_stream: true.
GLM-5.3-FlashX so với GLM-5.3-Flash
| Khía cạnh | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| Model nền tảng | GLM-5.3-Flash | GLM-5.3-Flash |
| Tốc độ đỉnh được công bố | Tầng tiêu chuẩn | Lên đến 200 token/giây |
| Giá đầu vào niêm yết / 1M | $0.15 | $0.37 |
| Giá đầu ra niêm yết / 1M | $0.50 | $1.25 |
| Giới hạn ngữ cảnh và đầu ra | 1M / 128K | 1M / 128K |
| Đầu vào đa phương thức | Có | Có |
| Trọng số mở | Có, từ ngày 26 tháng 8 năm 2026 | Cùng model nền tảng |
| GLM Coding Plan | Được bao gồm, với hạn mức gấp 3 lần GLM-5.3 | Không được bao gồm khi ra mắt |
Định dạng yêu cầu là giống hệt nhau. Chuyển từ tầng này sang tầng kia là thay đổi trường model, không phải viết lại tích hợp của bạn — điều này khiến FlashX trở thành một ứng viên A/B hợp lý cho các khối lượng công việc mà thời gian mỗi lượt là nút thắt cổ chai.
"200 token/giây" cho bạn biết và không cho bạn biết điều gì
Zhipu công bố 200 token/giây như một mức tối đa. Hãy đọc nó như một giới hạn trên về tốc độ sinh token, không phải một lời hứa về khối lượng công việc của bạn:
- Đây là một con số đỉnh. Thông lượng thực tế phụ thuộc vào độ dài prompt, số lần cache hit, mức đồng thời và nhà cung cấp được chọn.
- Đây không phải là thời gian đến token đầu tiên. Tốc độ giải mã nhanh vẫn có thể cảm thấy chậm nếu model suy nghĩ vài giây trước khi phát ra bất cứ thứ gì. Đối với các sản phẩm tương tác, hãy đo cả hai.
- Đây không phải là tổng độ trễ của tác vụ. Một lượt agent gọi ba công cụ bị giới hạn bởi việc thực thi công cụ, không phải bởi tốc độ token.
- Ngữ cảnh dài thay đổi bức tranh. Ở 1M token, hành vi prefill và KV-cache chiếm ưu thế. Đó chính xác là những gì kiến trúc Flash nhắm đến.
Nguyên tắc thực tế: đánh giá Flash và FlashX trên chính các prompt của bạn, và so sánh thời gian đến token đầu tiên, số token đầu ra mỗi giây, và chi phí trên mỗi tác vụ hoàn thành thay vì một con số tốc độ duy nhất.
Tốc độ đến từ đâu
Zhipu cho rằng sự tăng tốc của FlashX đến từ đầu tư hạ tầng chứ không phải một kiến trúc mới, được xây dựng trên nền tảng 100.000 bộ tăng tốc AI nội địa đã phục vụ lưu lượng GLM-5.3-Flash.
- Một engine suy luận chuyên dụng trên SGLang, được viết cho kiến trúc này thay vì được chuyển thể từ một stack đa dụng.
- Tối ưu bộ nhớ cho ngữ cảnh 1M token, bao gồm ReplaySSM, lượng tử hóa W8A8, lượng tử hóa cache hỗn hợp INT8/FP8/BF16, và Layer Split.
- Kiến trúc phục vụ phân tách Encode–Prefill–Decode (EPD) chia tách việc mã hóa đa phương thức, prefill prompt và giải mã từng token thành các nhóm worker được lập lịch độc lập, để mỗi giai đoạn tự mở rộng quy mô.
- Cải thiện phục vụ end-to-end gấp 3 lần so với đường cơ sở ban đầu trên cùng phần cứng, mà Zhipu nói rằng đưa chi phí mỗi token đến mức tương đương với các GPU NVIDIA phổ thông.
Một chi tiết từ công việc đó đáng được lưu ý riêng: Zhipu nói rằng một agent hạ tầng được hỗ trợ bởi GLM-5.3 đã giúp các kỹ sư tối ưu kernel, chẩn đoán nút thắt cổ chai và cải thiện stack phục vụ — model tham gia vào chính hệ thống phục vụ nó.
Benchmark: những gì Zhipu báo cáo cho model nền tảng
Tất cả các con số sau đây được Zhipu công bố cho GLM-5.3-Flash và áp dụng cho FlashX vì model là cùng một model. Đây là kết quả do nhà cung cấp báo cáo, không phải tái tạo độc lập.
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0, nỗ lực tối đa | 29.0 | Claude Opus 4.8: 29.5 |
Zhipu cũng báo cáo rằng GLM-5.3-Flash đạt 57 điểm trên Artificial Analysis Intelligence Index v4.1.1 với $0.045 mỗi tác vụ theo mức giá chiết khấu của họ — một mức mà họ nói trước đây chỉ có thể đạt được với chi phí cao hơn khoảng 10 lần — và rằng hiệu suất lập trình của nó tương đương với Claude Opus 4.8 trên Z.ai Code Bench nội bộ của công ty.
Hãy coi những điều này như định hướng, không phải bảo đảm. Các benchmark của nhà cung cấp thường được chạy trên các phiên bản harness có lợi cho nhà cung cấp; dòng Z.ai Code Bench ở trên được đo trên Claude Code 2.1.207. Hãy chạy lại đánh giá của riêng bạn trước khi chuyển lưu lượng sản xuất.
Kiến trúc: tại sao tầng Flash có chi phí vận hành thấp
FlashX kế thừa thiết kế đã khiến Flash có chi phí phục vụ thấp, đó là lý do một tầng nhanh hơn có thể tồn tại mà không có bước nhảy giá lên mức flagship.
- Attention thưa và tuyến tính kết hợp. Zhipu mô tả nó là model biên giới mã nguồn mở đầu tiên kết hợp cả hai. Attention tuyến tính nắm bắt các phụ thuộc cục bộ thông qua mô hình hóa trạng thái; attention thưa truy xuất ngữ cảnh toàn cục liên quan thông qua một indexer nhẹ.
- IndexPool. Bốn vector khóa indexer được nén thành một bằng weighted pooling, cắt giảm độ trễ và chi phí bộ nhớ của indexer ở ngữ cảnh 1M token.
- Manifold-Constrained Hyper-Connections (mHC) để có hiệu quả mở rộng quy mô tốt hơn.
- Chi phí mỗi token thấp hơn GLM-5.3. Zhipu báo cáo ít hơn 3.01 lần tính toán attention và KV cache nhỏ hơn 4.44 lần so với GLM-5.3. So với GLM-5.3, số tham số được kích hoạt giảm từ 32B xuống 18B và số lớp từ 92 xuống 45.
- Một kho ngữ liệu tiền huấn luyện đa phương thức 30 nghìn tỷ token.
Zhipu thẳng thắn rằng KV cache vẫn hơi lớn hơn của Kimi-K3 và DeepSeek-V4-Flash và gọi đó là một hướng cho công việc tương lai — một lời nhắc hữu ích rằng so sánh kiến trúc là theo từng khía cạnh, không phải một bảng xếp hạng duy nhất.
Ox-Alpha: model ẩn danh đã được thử nghiệm công khai
Trước khi Flash ra mắt, Zhipu đã chạy GLM-5.3-Flash một cách ẩn danh với tên Ox-Alpha trên OpenCode và OpenRouter. Theo Zhipu, nó đã trở thành model phổ biến nhất trong tuần và lập kỷ lục sử dụng trên cả hai nền tảng, với toàn bộ lưu lượng đó được phục vụ trên chip AI Trung Quốc.
Đối với các nhà phát triển, phần thú vị không phải là vị trí trên bảng xếp hạng mà là phương pháp xác thực: lưu lượng thực, agent lập trình thực, một tên model không ai biết, và không có sức hút thương hiệu. Đó là một tín hiệu mạnh hơn một bảng benchmark, mặc dù vẫn là một đợt triển khai do nhà cung cấp kiểm soát mà không có phương pháp luận được công bố.
Đa phương thức gốc và lập trình trực quan
GLM-5.3-Flash là model đầu tiên trong dòng GLM-5 được xây dựng như một model đa phương thức ngay từ đầu, và FlashX giữ nguyên điều đó. Hình ảnh được truyền dưới dạng một content block với type: image_url bên trong messages[].content[], sử dụng URL hoặc Base64 data URL, và nhiều block có thể được kết hợp trong một message. Đầu vào video và tệp được ghi tài liệu cùng với hình ảnh và văn bản.
Khả năng quan trọng nhất trong thực tế là lập trình trực quan: model kiểm tra một giao diện đã được render, so sánh nó với mục tiêu, và lặp lại. Zhipu ghi tài liệu các quy trình làm việc để xây dựng lại một ứng dụng từ ảnh chụp màn hình hoặc bản ghi, xây dựng cảnh Blender, tạo nguyên mẫu game Godot, chạy các agent trình duyệt và sử dụng máy tính, và tái tạo các chi tiết CAD — mỗi quy trình đều có model tự kiểm tra đầu ra đã render của chính nó thay vì chỉ sinh mã.
Vòng lặp tương tự mở rộng sang công việc tài liệu. Zhipu trình diễn các sản phẩm PPTX, PDF, DOCX và XLSX, nghiên cứu tài chính với nguồn có thể truy vết, xem xét hợp đồng với chú thích được theo dõi, và soạn thảo pháp lý, với model render và kiểm tra trực quan đầu ra của chính nó để phát hiện tràn, lệch và kiểu dáng không nhất quán.
Một ví dụ Zhipu đưa ra rất cụ thể: không có tài nguyên bên ngoài, GLM-5.3-Flash đã chạy tự động trong 16 giờ để xây dựng một dinh thự đầu bếp khoảng 400 m² và bếp thử nghiệm như một cảnh Blender.
Giá cả: FlashX tốn bao nhiêu
Giá niêm yết chính thức trên mỗi 1M token, từ các trang giá của Zhipu (đã kiểm tra ngày 18 tháng 9 năm 2026):
| Loại token | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Đầu vào (USD) | $0.37 | $0.15 | $1.40 |
| Đầu vào được cache (USD) | $0.075 | $0.03 | $0.26 |
| Đầu ra (USD) | $1.25 | $0.50 | $4.40 |
Lưu trữ đầu vào được cache được niêm yết là miễn phí có thời hạn trên cả ba tầng.
Ví dụ về chi phí. Đối với 10M token đầu vào không được cache và 1M token đầu ra, giá niêm yết cho:
| Khối lượng công việc | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M đầu vào + 1M đầu ra | $4.95 | $2.00 | $18.40 |
| Cùng khối lượng, toàn bộ đầu vào từ cache | $2.00 | $0.80 | $6.60 |
FlashX đắt hơn Flash khoảng 2.5 lần về đầu vào và đầu ra, và vẫn thấp hơn nhiều so với GLM-5.3. Liệu điều đó có đáng hay không hoàn toàn phụ thuộc vào việc một lượt chậm tốn của bạn bao nhiêu — đối với một pipeline theo lô thì hiếm khi đáng, và đối với một agent tương tác thì thường đáng.
Cách gọi GLM-5.3-FlashX
FlashX sử dụng cùng giao diện chat-completions như Flash, nên việc di chuyển chỉ là thay đổi một dòng.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
Đối với streaming, thêm stream: true và tool_stream: true như Zhipu khuyến nghị. Lưu ý rằng suy nghĩ không thể bị tắt trên model này, vì vậy hãy dự trù token suy luận trong ước tính chi phí và trong thời gian chờ của client.
Một lộ trình di chuyển thực tế: giữ model ID có thể cấu hình, gửi một phần đại diện của lưu lượng sản xuất đến cả glm-5.3-flash và glm-5.3-flashx, và so sánh tỷ lệ hoàn thành, thời gian đến token đầu tiên, và chi phí trên mỗi tác vụ hoàn thành trước khi chuyển một khối lượng công việc sang.
Chọn giữa FlashX, Flash và GLM-5.3
- Chọn FlashX cho các sản phẩm tương tác, hoàn thành bên phía IDE, và các vòng lặp agent với nhiều lượt ngắn, nơi thời gian đồng hồ thực mỗi lượt là ràng buộc và khối lượng công việc vẫn nằm trong khả năng của tầng Flash.
- Chọn Flash cho xử lý theo lô, sinh ngoại tuyến, và các pipeline khối lượng lớn nơi chi phí mỗi tác vụ quan trọng hơn độ trễ — và cho các triển khai trọng số mở hoặc tự lưu trữ, vì Flash là tầng có trọng số được công bố.
- Chọn GLM-5.3 khi bạn cần mức trần của flagship thay vì hồ sơ chi phí của tầng Flash.
- Đừng cho rằng lợi ích tốc độ áp dụng đồng đều. Các yêu cầu nặng prefill, ngữ cảnh dài và các lượt agent bị ràng buộc bởi công cụ có thể thấy ít lợi ích hơn nhiều so với các tác vụ sinh ngắn. Hãy đo khối lượng công việc bạn thực sự chạy.
Bắt đầu với dòng GLM trên APIMaster.ai
APIMaster cung cấp cho bạn một khóa tương thích OpenAI duy nhất cho dòng GLM cùng với Claude, GPT, DeepSeek, Qwen, Gemini, Kimi và các model khác — với giá trả theo mức sử dụng từ $1 và giảm tới 70% so với giá chính thức trên các tuyến được chọn.
Vì FlashX giữ nguyên định dạng yêu cầu như Flash, các nhóm đã gọi GLM qua APIMaster có thể đánh giá tầng nhanh hơn mà không cần chạm vào tích hợp của họ ngoài model ID.
- Tạo tài khoản APIMaster.
- Nạp tín dụng trả theo mức sử dụng, bắt đầu từ $1.
- Tạo khóa API trong bảng điều khiển APIMaster.
- Trỏ client tương thích OpenAI của bạn đến
https://apimaster.ai/v1và đặt model ID bạn muốn đánh giá.
Đăng ký APIMaster · Khám phá chợ model · Kiểm tra danh tính model
FAQ
GLM-5.3-FlashX có phải là một model mới không? Không. Đây là tầng phục vụ tốc độ cao của GLM-5.3-Flash. Cùng model, cùng cửa sổ ngữ cảnh, cùng đầu vào đa phương thức — một cấu hình suy luận nhanh hơn và một mức giá khác.
Model ID của GLM-5.3-FlashX là gì?
glm-5.3-flashx. Tầng tiêu chuẩn là glm-5.3-flash.
GLM-5.3-FlashX nhanh đến đâu? Zhipu công bố tối đa 200 token/giây. Đó là một con số đỉnh; hãy đo thời gian đến token đầu tiên và thông lượng duy trì trên chính các prompt của bạn.
GLM-5.3-FlashX tốn bao nhiêu? Zhipu niêm yết $0.37 mỗi 1M token đầu vào, $1.25 mỗi 1M token đầu ra, và $0.075 mỗi 1M token đầu vào được cache — khoảng 2.5 lần giá của GLM-5.3-Flash về đầu vào và đầu ra.
Cửa sổ ngữ cảnh là bao nhiêu? 1M token, với tối đa 128.000 token đầu ra, giống như GLM-5.3-Flash.
GLM-5.3-FlashX có thể nhận hình ảnh và video không?
Có. Nó nhận đầu vào video, hình ảnh, văn bản và tệp và trả về văn bản. Hình ảnh được gửi dưới dạng một content block image_url, bằng URL hoặc Base64 data URL.
GLM-5.3-FlashX có trong GLM Coding Plan không? Không phải khi ra mắt. GLM-5.3-Flash có sẵn đầy đủ trên gói với hạn mức gấp 3 lần GLM-5.3, và các cuộc gọi ngoài giờ cao điểm bao gồm cả toàn bộ cuối tuần tiêu thụ 50% điểm tiêu chuẩn.
Tôi có thể tắt suy nghĩ để tiết kiệm token không?
Không. thinking.type chỉ hỗ trợ enabled. Zhipu khuyến nghị giữ lại lịch sử suy nghĩ (clear_thinking: false) cho công việc nhiều lượt.
Các con số benchmark có độc lập không? Không. Chúng được Zhipu công bố. Hãy coi chúng như định hướng và chạy lại đánh giá của riêng bạn trước khi cam kết lưu lượng sản xuất.
Nguồn và đọc thêm
- Z.ai — Tài liệu model GLM-5.3-Flash/FlashX — model ID, tham số, khả năng, cài đặt khuyến nghị, benchmark và chi tiết phục vụ
- Z.ai — Giá cả — giá niêm yết chính thức trên mỗi 1M token
- Z.ai — Blog kỹ thuật GLM-5.3-Flash — kiến trúc, so sánh hiệu quả và bảng đánh giá
- Hugging Face — zai-org/GLM-5.3-Flash — trọng số mở cho model nền tảng
- PANews — Zhipu ra mắt GLM-5.3-FlashX — báo cáo ra mắt và bối cảnh Ox-Alpha
Tất cả các nguồn đã được kiểm tra vào ngày 18 tháng 9 năm 2026. Giá cả và tính khả dụng thay đổi; hãy xác minh các điều khoản hiện tại trước khi cam kết một khối lượng công việc lớn.