Guida API GLM: GLM-5.2, GLM-5.3 e GLM-5.3-Flash
Chiama GLM-5.2, GLM-5.3 e GLM-5.3-Flash tramite APIMaster con Python o curl. Testati Chat, Responses, Messages, streaming, JSON e tool call.
Usa glm-5.2, glm-5.3 o glm-5.3-flash con una chiave API APIMaster e l'URL di base https://apimaster.ai/v1. Per applicazioni compatibili con OpenAI, inizia con Chat Completions. Codex usa Responses; Claude Code usa l'interfaccia Messages.
Questi sono risultati di integrazione del gateway APIMaster, non un'affermazione che ogni upstream GLM implementi nativamente ogni protocollo. GLM è la famiglia di modelli; gli SDK di OpenAI e Anthropic forniscono le interfacce client.
Compatibilità testata
La validazione è iniziata il 2026-09-15 UTC, utilizzando l'endpoint pubblico di APIMaster e il routing normale. Ogni modello ha superato i seguenti controlli:
| Controllo | glm-5.2 |
glm-5.3 |
glm-5.3-flash |
|---|---|---|---|
| Chat Completions: normale e streaming | Superato | Superato | Superato |
| Responses: normale e streaming | Superato | Superato | Superato |
| Messages: normale e streaming | Superato | Superato | Superato |
| Function/tool call e round trip del risultato del tool, tutti e tre i protocolli | Superato | Superato | Superato |
| Output a oggetto JSON in Chat | Superato | Superato | Superato |
I test sul testo hanno verificato la risposta effettiva e l'evento di terminazione dello stream, non soltanto l'HTTP 200. I test sui tool hanno richiesto una funzione meteo e poi restituito un codice di verifica fornito solo nel risultato del tool. Si tratta di controlli funzionali di integrazione, non di benchmark di throughput o di uno SLA di disponibilità. Sessioni lunghe, contesto massimo, video e ogni parametro avanzato non rientrano in questa matrice di test.
1. Ottieni una chiave API
Crea una chiave API APIMaster, abilita il modello desiderato e ricarica l'account. Usa gli ID dei modelli esatti indicati sopra. Una chiave di BigModel, OpenAI o Anthropic non può autenticarsi su APIMaster.
macOS / Linux:
export APIMASTER_API_KEY='YOUR_APIMASTER_API_KEY'
Windows PowerShell:
$env:APIMASTER_API_KEY = 'YOUR_APIMASTER_API_KEY'
2. Chiama Chat Completions con curl
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/chat/completions' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"Reply with exactly GLM_API_OK."}],"max_tokens":2048}'
Leggi choices[0].message.content. Modifica model in glm-5.2 o glm-5.3 per cambiare modello. I modelli di reasoning possono consumare parte del budget di output prima di emettere la risposta finale.
3. Usa l'SDK OpenAI per Python
python -m pip install -U openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["APIMASTER_API_KEY"],
base_url="https://apimaster.ai/v1",
timeout=120.0,
)
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Reply with exactly GLM_API_OK."}],
max_tokens=2048,
)
print(response.choices[0].message.content)
Per lo streaming, imposta stream=True. Controlla la presenza di choices vuote: l'ultimo chunk di usage può contenere l'usage senza un delta di testo.
stream = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Explain binary search briefly."}],
max_tokens=4096,
stream=True,
stream_options={"include_usage": True},
)
for chunk in stream:
if chunk.choices:
text = chunk.choices[0].delta.content
if text:
print(text, end="", flush=True)
if chunk.usage:
print("\nUsage:", chunk.usage)
Il primo evento può contenere reasoning anziché il testo visibile della risposta. Conserva reasoning_content quando riporti i messaggi dell'assistente in una conversazione con tool sulle route che lo restituiscono; non ricostruire il messaggio dell'assistente dal solo testo finale.
4. Scegli l'endpoint corretto
| Applicazione | URL di base | Endpoint della richiesta |
|---|---|---|
| SDK OpenAI per Python / Chat | https://apimaster.ai/v1 |
/v1/chat/completions |
| API Responses / Codex | https://apimaster.ai/v1 |
/v1/responses |
| Claude Code | https://apimaster.ai |
/v1/messages |
Richiesta Responses minima:
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/responses' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3","input":"Reply with exactly GLM_API_OK.","max_output_tokens":2048}'
Leggi il testo dagli elementi message il cui tipo di contenuto è output_text; tieni separati gli elementi di reasoning. Per lo streaming, usa stream: true e verifica la presenza di response.completed o di un evento di errore.
Parametri e risoluzione dei problemi
| Situazione | Azione consigliata |
|---|---|
| 401 | Controlla la chiave APIMaster e l'account che l'ha emessa. |
| 404 | Usa l'URL di base previsto dal tuo client; non duplicare /v1. |
| Risposta vuota o limite di output raggiunto | Analizza il motivo di completamento e l'usage del reasoning; aumenta il budget di output. |
| Output JSON | Chat response_format: {"type":"json_object"} ha superato un test JSON di base. Valida il JSON restituito nella tua applicazione. |
reasoning.summary rifiutato |
Il supporto dipende dall'upstream selezionato. Omettilo per la configurazione di base. Un test riuscito sul gateway non dimostra il supporto nativo di BigModel. |
thinking.type: disabled rifiutato |
La guida ufficiale del modello GLM-5.3-Flash consente solo enabled; non richiedere che il thinking sia disabilitato. |
| 429 / 5xx / stream interrotto | Registra l'ID della richiesta, il modello, l'ora UTC e l'errore. Usa tentativi limitati dove è sicuro; non ripetere alla cieca tool già eseguiti. |
Domande frequenti
GLM-5.3-Flash è gratuito su APIMaster?
La parola Flash fa parte del nome del modello, non è una promessa di utilizzo gratuito. Consulta il marketplace dei modelli per i prezzi attuali delle route e il portafoglio per gli addebiti effettivi.
Un alto tasso di hit della cache si applica a ogni richiesta?
No. Il riutilizzo della cache dipende dalla corrispondenza dei prefissi di input e dall'upstream. Analizza l'usage restituito e i tuoi log di utilizzo. Il tasso di hit della cache di un carico di lavoro precedente non è una garanzia per una nuova applicazione.
Questo dimostra la piena compatibilità con OpenAI o Anthropic?
Stabilisce i flussi di lavoro testati su testo, streaming, JSON e tool. I campi specifici del provider, lo stato memorizzato di Responses, la ricerca web integrata e i contenuti multimediali richiedono una validazione separata.