APIMaster.ai

GLM-API-Leitfaden: GLM-5.2, GLM-5.3 und GLM-5.3-Flash

GLM-5.2, GLM-5.3 und GLM-5.3-Flash über APIMaster mit Python oder curl aufrufen. Getestet: Chat, Responses, Messages, Streaming, JSON und Tool-Aufrufe.

Verwenden Sie glm-5.2, glm-5.3 oder glm-5.3-flash mit einem APIMaster-API-Schlüssel und der Basis-URL https://apimaster.ai/v1. Für OpenAI-kompatible Anwendungen beginnen Sie mit Chat Completions. Codex verwendet Responses; Claude Code verwendet die Messages-Schnittstelle.

Dies sind Ergebnisse der APIMaster-Gateway-Integration, keine Behauptung, dass jedes GLM-Upstream-Modell jedes Protokoll nativ implementiert. GLM ist die Modellfamilie; die OpenAI- und Anthropic-SDKs stellen die Client-Schnittstellen bereit.

Getestete Kompatibilität

Die Validierung begann am 2026-09-15 UTC und nutzte den öffentlichen APIMaster-Endpunkt sowie normales Routing. Jedes Modell bestand die folgenden Prüfungen:

Prüfung glm-5.2 glm-5.3 glm-5.3-flash
Chat Completions: regulär und Streaming Bestanden Bestanden Bestanden
Responses: regulär und Streaming Bestanden Bestanden Bestanden
Messages: regulär und Streaming Bestanden Bestanden Bestanden
Funktions-/Tool-Aufruf und Tool-Ergebnis-Roundtrip, alle drei Protokolle Bestanden Bestanden Bestanden
Chat-JSON-Objektausgabe Bestanden Bestanden Bestanden

Bei den Texttests wurden die tatsächliche Antwort und das Stream-Terminierungsereignis geprüft, nicht nur HTTP 200. Bei den Tool-Tests wurde eine Wetterfunktion angefordert und anschließend ein Verifizierungscode zurückgegeben, der ausschließlich im Tool-Ergebnis bereitgestellt wurde. Dies sind funktionale Integrationsprüfungen, keine Durchsatz-Benchmarks oder eine Verfügbarkeits-SLA. Lange Sitzungen, maximaler Kontext, Video und sämtliche erweiterten Parameter liegen außerhalb dieser Testmatrix.

1. API-Schlüssel anlegen

Erstellen Sie einen APIMaster-API-Schlüssel, aktivieren Sie das gewünschte Modell und richten Sie das Konto auf. Verwenden Sie die oben genannten exakten Modell-IDs. Ein Schlüssel von BigModel, OpenAI oder Anthropic kann sich nicht bei APIMaster authentifizieren.

macOS / Linux:

export APIMASTER_API_KEY='YOUR_APIMASTER_API_KEY'

Windows PowerShell:

$env:APIMASTER_API_KEY = 'YOUR_APIMASTER_API_KEY'

2. Chat Completions mit curl aufrufen

curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/chat/completions' \
  -H "Authorization: Bearer $APIMASTER_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"glm-5.3-flash","messages":[{"role":"user","content":"Reply with exactly GLM_API_OK."}],"max_tokens":2048}'

Lesen Sie choices[0].message.content. Ändern Sie model zu glm-5.2 oder glm-5.3, um das Modell zu wechseln. Reasoning-Modelle können einen Teil des Ausgabebudgets verbrauchen, bevor sie die finale Antwort ausgeben.

3. Das Python OpenAI SDK verwenden

python -m pip install -U openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["APIMASTER_API_KEY"],
    base_url="https://apimaster.ai/v1",
    timeout=120.0,
)

response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Reply with exactly GLM_API_OK."}],
    max_tokens=2048,
)
print(response.choices[0].message.content)

Setzen Sie für Streaming stream=True. Prüfen Sie auf leere Choices: Der letzte Usage-Chunk kann Nutzungsdaten ohne Text-Delta enthalten.

stream = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Explain binary search briefly."}],
    max_tokens=4096,
    stream=True,
    stream_options={"include_usage": True},
)
for chunk in stream:
    if chunk.choices:
        text = chunk.choices[0].delta.content
        if text:
            print(text, end="", flush=True)
    if chunk.usage:
        print("\nUsage:", chunk.usage)

Das erste Ereignis kann Reasoning anstelle von sichtbarem Antworttext enthalten. Bewahren Sie reasoning_content auf, wenn Sie Assistant-Nachrichten in eine Tool-Konversation übertragen, auf Routen, die es zurückgeben; rekonstruieren Sie die Assistant-Nachricht nicht allein aus dem finalen Text.

4. Den richtigen Endpunkt wählen

Anwendung Basis-URL Anfrage-Endpunkt
Python OpenAI SDK / Chat https://apimaster.ai/v1 /v1/chat/completions
Responses-API / Codex https://apimaster.ai/v1 /v1/responses
Claude Code https://apimaster.ai /v1/messages

Minimale Responses-Anfrage:

curl --fail-with-body --max-time 120 'https://apimaster.ai/v1/responses' \
  -H "Authorization: Bearer $APIMASTER_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"glm-5.3","input":"Reply with exactly GLM_API_OK.","max_output_tokens":2048}'

Lesen Sie den Text aus Message-Items, deren Content-Typ output_text ist; halten Sie Reasoning-Items getrennt. Verwenden Sie für Streaming stream: true und prüfen Sie auf response.completed oder ein Fehlerereignis.

Parameter und Fehlerbehebung

Situation Empfohlene Maßnahme
401 Prüfen Sie den APIMaster-Schlüssel und das Konto, das ihn ausgestellt hat.
404 Verwenden Sie die von Ihrem Client erwartete Basis-URL; duplizieren Sie /v1 nicht.
Leere Antwort oder Ausgabelimit Prüfen Sie den Finish-Grund und die Reasoning-Nutzung; erhöhen Sie das Ausgabebudget.
JSON-Ausgabe Chat response_format: {"type":"json_object"} bestand einen grundlegenden JSON-Test. Validieren Sie das zurückgegebene JSON in Ihrer Anwendung.
reasoning.summary abgelehnt Die Unterstützung hängt vom gewählten Upstream ab. Lassen Sie es in der Basiskonfiguration weg. Ein erfolgreicher Gateway-Test belegt keine native BigModel-Unterstützung.
thinking.type: disabled abgelehnt Der offizielle GLM-5.3-Flash-Modellleitfaden erlaubt nur enabled; verlangen Sie nicht, dass Thinking deaktiviert wird.
429 / 5xx / unterbrochener Stream Notieren Sie die Request-ID, das Modell, die UTC-Zeit und den Fehler. Verwenden Sie begrenzte Wiederholungsversuche, wo sicher; wiederholen Sie bereits ausgeführte Tools nicht blindlings.

Häufig gestellte Fragen

Ist GLM-5.3-Flash auf APIMaster kostenlos?

Das Wort Flash ist Teil des Modellnamens, kein Versprechen kostenloser Nutzung. Prüfen Sie den Modell-Marktplatz für aktuelle Routenpreise und das Wallet für tatsächliche Abbuchungen.

Gilt eine hohe Cache-Trefferquote für jede Anfrage?

Nein. Die Wiederverwendung des Caches hängt von übereinstimmenden Eingabe-Präfixen und dem Upstream ab. Prüfen Sie die zurückgegebenen Nutzungsdaten und Ihre Nutzungsprotokolle. Die Cache-Trefferquote einer früheren Workload ist keine Garantie für eine neue Anwendung.

Beweist dies die vollständige OpenAI- oder Anthropic-Kompatibilität?

Es belegt die getesteten Text-, Streaming-, JSON- und Tool-Workflows. Anbieterspezifische Felder, gespeicherte Responses-Zustände, integrierte Websuche und Multimedia erfordern eine separate Validierung.

Verwandte Leitfäden und Quellen