APIMaster.ai

Guida API GLM: GLM-5.2, GLM-5.3 e GLM-5.3-Flash

Chiama GLM-5.2, GLM-5.3 e GLM-5.3-Flash tramite APIMaster con Python o curl. Testati Chat, Responses, Messages, streaming, JSON e tool call.

Usa glm-5.2, glm-5.3 o glm-5.3-flash con una chiave API APIMaster e l'URL di base https://apimaster.ai/v1. Per applicazioni compatibili con OpenAI, inizia con Chat Completions. Codex usa Responses; Claude Code usa l'interfaccia Messages.

Questi sono risultati di integrazione del gateway APIMaster, non un'affermazione che ogni upstream GLM implementi nativamente ogni protocollo. GLM è la famiglia di modelli; gli SDK di OpenAI e Anthropic forniscono le interfacce client.

Compatibilità testata

La validazione è iniziata il 2026-09-15 UTC, utilizzando l'endpoint pubblico di APIMaster e il routing normale. Ogni modello ha superato i seguenti controlli:

Controllo glm-5.2 glm-5.3 glm-5.3-flash
Chat Completions: normale e streaming Superato Superato Superato
Responses: normale e streaming Superato Superato Superato
Messages: normale e streaming Superato Superato Superato
Function/tool call e round trip del risultato del tool, tutti e tre i protocolli Superato Superato Superato
Output a oggetto JSON in Chat Superato Superato Superato

I test sul testo hanno verificato la risposta effettiva e l'evento di terminazione dello stream, non soltanto l'HTTP 200. I test sui tool hanno richiesto una funzione meteo e poi restituito un codice di verifica fornito solo nel risultato del tool. Si tratta di controlli funzionali di integrazione, non di benchmark di throughput o di uno SLA di disponibilità. Sessioni lunghe, contesto massimo, video e ogni parametro avanzato non rientrano in questa matrice di test.

1. Ottieni una chiave API

Crea una chiave API APIMaster, abilita il modello desiderato e ricarica l'account. Usa gli ID dei modelli esatti indicati sopra. Una chiave di BigModel, OpenAI o Anthropic non può autenticarsi su APIMaster.

macOS / Linux:

export APIMASTER_API_KEY='YOUR_APIMASTER_API_KEY'

Windows PowerShell:

$env:APIMASTER_API_KEY = 'YOUR_APIMASTER_API_KEY'

2. Chiama Chat Completions con curl

curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/chat/completions' \
  -H "Authorization: Bearer $APIMASTER_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"Reply with exactly GLM_API_OK."}],"max_tokens":2048}'

Leggi choices[0].message.content. Modifica model in glm-5.2 o glm-5.3 per cambiare modello. I modelli di reasoning possono consumare parte del budget di output prima di emettere la risposta finale.

3. Usa l'SDK OpenAI per Python

python -m pip install -U openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["APIMASTER_API_KEY"],
    base_url="https://apimaster.ai/v1",
    timeout=120.0,
)

response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Reply with exactly GLM_API_OK."}],
    max_tokens=2048,
)
print(response.choices[0].message.content)

Per lo streaming, imposta stream=True. Controlla la presenza di choices vuote: l'ultimo chunk di usage può contenere l'usage senza un delta di testo.

stream = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Explain binary search briefly."}],
    max_tokens=4096,
    stream=True,
    stream_options={"include_usage": True},
)
for chunk in stream:
    if chunk.choices:
        text = chunk.choices[0].delta.content
        if text:
            print(text, end="", flush=True)
    if chunk.usage:
        print("\nUsage:", chunk.usage)

Il primo evento può contenere reasoning anziché il testo visibile della risposta. Conserva reasoning_content quando riporti i messaggi dell'assistente in una conversazione con tool sulle route che lo restituiscono; non ricostruire il messaggio dell'assistente dal solo testo finale.

4. Scegli l'endpoint corretto

Applicazione URL di base Endpoint della richiesta
SDK OpenAI per Python / Chat https://apimaster.ai/v1 /v1/chat/completions
API Responses / Codex https://apimaster.ai/v1 /v1/responses
Claude Code https://apimaster.ai /v1/messages

Richiesta Responses minima:

curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/responses' \
  -H "Authorization: Bearer $APIMASTER_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"glm-5.3","input":"Reply with exactly GLM_API_OK.","max_output_tokens":2048}'

Leggi il testo dagli elementi message il cui tipo di contenuto è output_text; tieni separati gli elementi di reasoning. Per lo streaming, usa stream: true e verifica la presenza di response.completed o di un evento di errore.

Parametri e risoluzione dei problemi

Situazione Azione consigliata
401 Controlla la chiave APIMaster e l'account che l'ha emessa.
404 Usa l'URL di base previsto dal tuo client; non duplicare /v1.
Risposta vuota o limite di output raggiunto Analizza il motivo di completamento e l'usage del reasoning; aumenta il budget di output.
Output JSON Chat response_format: {"type":"json_object"} ha superato un test JSON di base. Valida il JSON restituito nella tua applicazione.
reasoning.summary rifiutato Il supporto dipende dall'upstream selezionato. Omettilo per la configurazione di base. Un test riuscito sul gateway non dimostra il supporto nativo di BigModel.
thinking.type: disabled rifiutato La guida ufficiale del modello GLM-5.3-Flash consente solo enabled; non richiedere che il thinking sia disabilitato.
429 / 5xx / stream interrotto Registra l'ID della richiesta, il modello, l'ora UTC e l'errore. Usa tentativi limitati dove è sicuro; non ripetere alla cieca tool già eseguiti.

Domande frequenti

GLM-5.3-Flash è gratuito su APIMaster?

La parola Flash fa parte del nome del modello, non è una promessa di utilizzo gratuito. Consulta il marketplace dei modelli per i prezzi attuali delle route e il portafoglio per gli addebiti effettivi.

Un alto tasso di hit della cache si applica a ogni richiesta?

No. Il riutilizzo della cache dipende dalla corrispondenza dei prefissi di input e dall'upstream. Analizza l'usage restituito e i tuoi log di utilizzo. Il tasso di hit della cache di un carico di lavoro precedente non è una garanzia per una nuova applicazione.

Questo dimostra la piena compatibilità con OpenAI o Anthropic?

Stabilisce i flussi di lavoro testati su testo, streaming, JSON e tool. I campi specifici del provider, lo stato memorizzato di Responses, la ricerca web integrata e i contenuti multimediali richiedono una validazione separata.

Guide correlate e fonti