Hướng dẫn API GLM: GLM-5.2, GLM-5.3 và GLM-5.3-Flash
Gọi GLM-5.2, GLM-5.3 và GLM-5.3-Flash qua APIMaster bằng Python hoặc curl. Đã kiểm thử Chat, Responses, Messages, streaming, JSON và tool calls.
Sử dụng glm-5.2, glm-5.3 hoặc glm-5.3-flash với khóa API của APIMaster và base URL https://apimaster.ai/v1. Đối với các ứng dụng tương thích với OpenAI, hãy bắt đầu với Chat Completions. Codex sử dụng Responses; Claude Code sử dụng giao diện Messages.
Đây là kết quả tích hợp cổng kết nối (gateway) của APIMaster, không phải khẳng định rằng mọi upstream GLM đều triển khai nguyên sinh (native) mọi giao thức. GLM là dòng mô hình; SDK của OpenAI và Anthropic cung cấp các giao diện phía client.
Khả năng tương thích đã được kiểm thử
Quá trình xác thực bắt đầu vào 2026-09-15 UTC, sử dụng endpoint công khai của APIMaster và định tuyến bình thường. Mỗi mô hình đã hoàn thành các bước kiểm tra sau:
| Kiểm tra | glm-5.2 |
glm-5.3 |
glm-5.3-flash |
|---|---|---|---|
| Chat Completions: thường và streaming | Đạt | Đạt | Đạt |
| Responses: thường và streaming | Đạt | Đạt | Đạt |
| Messages: thường và streaming | Đạt | Đạt | Đạt |
| Function/tool call và vòng lặp tool-result, trên cả ba giao thức | Đạt | Đạt | Đạt |
| Chat đầu ra JSON object | Đạt | Đạt | Đạt |
Các kiểm tra văn bản đã xác minh câu trả lời thực tế và sự kiện kết thúc stream, không chỉ dựa vào HTTP 200. Kiểm tra tool gọi một hàm thời tiết rồi trả về mã xác minh chỉ được cung cấp trong tool result. Đây là các kiểm tra tích hợp chức năng, không phải benchmark thông lượng hay cam kết SLA về tính khả dụng. Các phiên dài, ngữ cảnh tối đa, video và mọi tham số nâng cao nằm ngoài phạm vi kiểm thử này.
1. Lấy khóa API
Tạo một khóa API APIMaster, bật mô hình mong muốn và nạp tiền vào tài khoản. Sử dụng chính xác các model ID ở trên. Khóa từ BigModel, OpenAI hoặc Anthropic không thể xác thực với APIMaster.
macOS / Linux:
export APIMASTER_API_KEY='YOUR_APIMASTER_API_KEY'
Windows PowerShell:
$env:APIMASTER_API_KEY = 'YOUR_APIMASTER_API_KEY'
2. Gọi Chat Completions bằng curl
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/chat/completions' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"Reply with exactly GLM_API_OK."}],"max_tokens":2048}'
Đọc kết quả tại choices[0].message.content. Thay đổi model thành glm-5.2 hoặc glm-5.3 để chuyển đổi mô hình. Các mô hình reasoning có thể tiêu tốn một phần ngân sách đầu ra trước khi phát ra câu trả lời cuối cùng.
3. Sử dụng Python OpenAI SDK
python -m pip install -U openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["APIMASTER_API_KEY"],
base_url="https://apimaster.ai/v1",
timeout=120.0,
)
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Reply with exactly GLM_API_OK."}],
max_tokens=2048,
)
print(response.choices[0].message.content)
Đối với streaming, đặt stream=True. Kiểm tra trường hợp choices rỗng: chunk cuối cùng chứa usage có thể chỉ chứa usage mà không có delta văn bản.
stream = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Explain binary search briefly."}],
max_tokens=4096,
stream=True,
stream_options={"include_usage": True},
)
for chunk in stream:
if chunk.choices:
text = chunk.choices[0].delta.content
if text:
print(text, end="", flush=True)
if chunk.usage:
print("\nUsage:", chunk.usage)
Sự kiện đầu tiên có thể chứa phần suy luận (reasoning) thay vì văn bản câu trả lời hiển thị. Hãy giữ lại reasoning_content khi chuyển tiếp tin nhắn assistant vào một hội thoại có tool trên các tuyến trả về trường này; không tái tạo lại tin nhắn assistant chỉ từ văn bản cuối cùng.
4. Chọn endpoint phù hợp
| Ứng dụng | Base URL | Endpoint yêu cầu |
|---|---|---|
| Python OpenAI SDK / Chat | https://apimaster.ai/v1 |
/v1/chat/completions |
| Responses API / Codex | https://apimaster.ai/v1 |
/v1/responses |
| Claude Code | https://apimaster.ai |
/v1/messages |
Yêu cầu Responses tối thiểu:
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/responses' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3","input":"Reply with exactly GLM_API_OK.","max_output_tokens":2048}'
Đọc văn bản từ các message item có kiểu nội dung là output_text; giữ các reasoning item riêng biệt. Đối với streaming, sử dụng stream: true và kiểm tra sự kiện response.completed hoặc sự kiện lỗi.
Tham số và xử lý sự cố
| Tình huống | Hành động đề xuất |
|---|---|
| 401 | Kiểm tra khóa APIMaster và tài khoản đã cấp khóa đó. |
| 404 | Sử dụng base URL mà client của bạn mong đợi; không trùng lặp /v1. |
| Câu trả lời trống hoặc giới hạn đầu ra | Kiểm tra finish reason và mức sử dụng reasoning; tăng ngân sách đầu ra. |
| Đầu ra JSON | Chat response_format: {"type":"json_object"} đã vượt qua kiểm tra JSON cơ bản. Hãy xác thực JSON trả về trong ứng dụng của bạn. |
reasoning.summary bị từ chối |
Hỗ trợ phụ thuộc vào upstream được chọn. Hãy bỏ qua nó đối với cấu hình cơ sở. Một kiểm tra gateway thành công không chứng minh hỗ trợ nguyên sinh từ BigModel. |
thinking.type: disabled bị từ chối |
Hướng dẫn chính thức của mô hình GLM-5.3-Flash chỉ cho phép enabled; đừng yêu cầu tắt thinking. |
| 429 / 5xx / stream bị gián đoạn | Ghi lại request ID, mô hình, thời gian UTC và lỗi. Sử dụng retry có giới hạn khi an toàn; không lặp lại mù quáng các tool đã được thực thi. |
Câu hỏi thường gặp
GLM-5.3-Flash có miễn phí trên APIMaster không?
Chữ Flash là một phần của tên mô hình, không phải cam kết sử dụng miễn phí. Hãy kiểm tra marketplace mô hình để xem giá tuyến hiện tại và ví để biết các khoản phí thực tế.
Tỷ lệ cache hit cao có áp dụng cho mọi yêu cầu không?
Không. Việc tái sử dụng cache phụ thuộc vào việc khớp tiền tố đầu vào và upstream. Hãy kiểm tra usage trả về và nhật ký sử dụng của bạn. Tỷ lệ cache hit của một workload trước đó không phải là bảo đảm cho một ứng dụng mới.
Điều này có chứng minh khả năng tương thích đầy đủ với OpenAI hoặc Anthropic không?
Nó xác lập các luồng công việc văn bản, streaming, JSON và tool đã được kiểm thử. Các trường riêng của nhà cung cấp, trạng thái Responses được lưu trữ, tìm kiếm web tích hợp và đa phương tiện yêu cầu xác thực riêng.