GLM-API-Leitfaden: GLM-5.2, GLM-5.3 und GLM-5.3-Flash
GLM-5.2, GLM-5.3 und GLM-5.3-Flash über APIMaster mit Python oder curl aufrufen. Getestet: Chat, Responses, Messages, Streaming, JSON und Tool-Aufrufe.
Verwenden Sie glm-5.2, glm-5.3 oder glm-5.3-flash mit einem APIMaster-API-Schlüssel und der Basis-URL https://apimaster.ai/v1. Für OpenAI-kompatible Anwendungen beginnen Sie mit Chat Completions. Codex verwendet Responses; Claude Code verwendet die Messages-Schnittstelle.
Dies sind Ergebnisse der APIMaster-Gateway-Integration, keine Behauptung, dass jedes GLM-Upstream-Modell jedes Protokoll nativ implementiert. GLM ist die Modellfamilie; die OpenAI- und Anthropic-SDKs stellen die Client-Schnittstellen bereit.
Getestete Kompatibilität
Die Validierung begann am 2026-09-15 UTC und nutzte den öffentlichen APIMaster-Endpunkt sowie normales Routing. Jedes Modell bestand die folgenden Prüfungen:
| Prüfung | glm-5.2 |
glm-5.3 |
glm-5.3-flash |
|---|---|---|---|
| Chat Completions: regulär und Streaming | Bestanden | Bestanden | Bestanden |
| Responses: regulär und Streaming | Bestanden | Bestanden | Bestanden |
| Messages: regulär und Streaming | Bestanden | Bestanden | Bestanden |
| Funktions-/Tool-Aufruf und Tool-Ergebnis-Roundtrip, alle drei Protokolle | Bestanden | Bestanden | Bestanden |
| Chat-JSON-Objektausgabe | Bestanden | Bestanden | Bestanden |
Bei den Texttests wurden die tatsächliche Antwort und das Stream-Terminierungsereignis geprüft, nicht nur HTTP 200. Bei den Tool-Tests wurde eine Wetterfunktion angefordert und anschließend ein Verifizierungscode zurückgegeben, der ausschließlich im Tool-Ergebnis bereitgestellt wurde. Dies sind funktionale Integrationsprüfungen, keine Durchsatz-Benchmarks oder eine Verfügbarkeits-SLA. Lange Sitzungen, maximaler Kontext, Video und sämtliche erweiterten Parameter liegen außerhalb dieser Testmatrix.
1. API-Schlüssel anlegen
Erstellen Sie einen APIMaster-API-Schlüssel, aktivieren Sie das gewünschte Modell und richten Sie das Konto auf. Verwenden Sie die oben genannten exakten Modell-IDs. Ein Schlüssel von BigModel, OpenAI oder Anthropic kann sich nicht bei APIMaster authentifizieren.
macOS / Linux:
export APIMASTER_API_KEY='YOUR_APIMASTER_API_KEY'
Windows PowerShell:
$env:APIMASTER_API_KEY = 'YOUR_APIMASTER_API_KEY'
2. Chat Completions mit curl aufrufen
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/chat/completions' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"Reply with exactly GLM_API_OK."}],"max_tokens":2048}'
Lesen Sie choices[0].message.content. Ändern Sie model zu glm-5.2 oder glm-5.3, um das Modell zu wechseln. Reasoning-Modelle können einen Teil des Ausgabebudgets verbrauchen, bevor sie die finale Antwort ausgeben.
3. Das Python OpenAI SDK verwenden
python -m pip install -U openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["APIMASTER_API_KEY"],
base_url="https://apimaster.ai/v1",
timeout=120.0,
)
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Reply with exactly GLM_API_OK."}],
max_tokens=2048,
)
print(response.choices[0].message.content)
Setzen Sie für Streaming stream=True. Prüfen Sie auf leere Choices: Der letzte Usage-Chunk kann Nutzungsdaten ohne Text-Delta enthalten.
stream = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "Explain binary search briefly."}],
max_tokens=4096,
stream=True,
stream_options={"include_usage": True},
)
for chunk in stream:
if chunk.choices:
text = chunk.choices[0].delta.content
if text:
print(text, end="", flush=True)
if chunk.usage:
print("\nUsage:", chunk.usage)
Das erste Ereignis kann Reasoning anstelle von sichtbarem Antworttext enthalten. Bewahren Sie reasoning_content auf, wenn Sie Assistant-Nachrichten in eine Tool-Konversation übertragen, auf Routen, die es zurückgeben; rekonstruieren Sie die Assistant-Nachricht nicht allein aus dem finalen Text.
4. Den richtigen Endpunkt wählen
| Anwendung | Basis-URL | Anfrage-Endpunkt |
|---|---|---|
| Python OpenAI SDK / Chat | https://apimaster.ai/v1 |
/v1/chat/completions |
| Responses-API / Codex | https://apimaster.ai/v1 |
/v1/responses |
| Claude Code | https://apimaster.ai |
/v1/messages |
Minimale Responses-Anfrage:
curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/responses' \
-H "Authorization: Bearer $APIMASTER_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"glm-5.3","input":"Reply with exactly GLM_API_OK.","max_output_tokens":2048}'
Lesen Sie den Text aus Message-Items, deren Content-Typ output_text ist; halten Sie Reasoning-Items getrennt. Verwenden Sie für Streaming stream: true und prüfen Sie auf response.completed oder ein Fehlerereignis.
Parameter und Fehlerbehebung
| Situation | Empfohlene Maßnahme |
|---|---|
| 401 | Prüfen Sie den APIMaster-Schlüssel und das Konto, das ihn ausgestellt hat. |
| 404 | Verwenden Sie die von Ihrem Client erwartete Basis-URL; duplizieren Sie /v1 nicht. |
| Leere Antwort oder Ausgabelimit | Prüfen Sie den Finish-Grund und die Reasoning-Nutzung; erhöhen Sie das Ausgabebudget. |
| JSON-Ausgabe | Chat response_format: {"type":"json_object"} bestand einen grundlegenden JSON-Test. Validieren Sie das zurückgegebene JSON in Ihrer Anwendung. |
reasoning.summary abgelehnt |
Die Unterstützung hängt vom gewählten Upstream ab. Lassen Sie es in der Basiskonfiguration weg. Ein erfolgreicher Gateway-Test belegt keine native BigModel-Unterstützung. |
thinking.type: disabled abgelehnt |
Der offizielle GLM-5.3-Flash-Modellleitfaden erlaubt nur enabled; verlangen Sie nicht, dass Thinking deaktiviert wird. |
| 429 / 5xx / unterbrochener Stream | Notieren Sie die Request-ID, das Modell, die UTC-Zeit und den Fehler. Verwenden Sie begrenzte Wiederholungsversuche, wo sicher; wiederholen Sie bereits ausgeführte Tools nicht blindlings. |
Häufig gestellte Fragen
Ist GLM-5.3-Flash auf APIMaster kostenlos?
Das Wort Flash ist Teil des Modellnamens, kein Versprechen kostenloser Nutzung. Prüfen Sie den Modell-Marktplatz für aktuelle Routenpreise und das Wallet für tatsächliche Abbuchungen.
Gilt eine hohe Cache-Trefferquote für jede Anfrage?
Nein. Die Wiederverwendung des Caches hängt von übereinstimmenden Eingabe-Präfixen und dem Upstream ab. Prüfen Sie die zurückgegebenen Nutzungsdaten und Ihre Nutzungsprotokolle. Die Cache-Trefferquote einer früheren Workload ist keine Garantie für eine neue Anwendung.
Beweist dies die vollständige OpenAI- oder Anthropic-Kompatibilität?
Es belegt die getesteten Text-, Streaming-, JSON- und Tool-Workflows. Anbieterspezifische Felder, gespeicherte Responses-Zustände, integrierte Websuche und Multimedia erfordern eine separate Validierung.