GLM-5.3-FlashX: Was es ist, wie schnell es läuft und was es kostet
GLM-5.3-FlashX ist Zhipus Hochgeschwindigkeits-Serving-Tier von GLM-5.3-Flash, gestartet am 18. September 2026 mit bis zu 200 Tokens/s. Hier sind die bestätigte Modell-ID, die Preisgestaltung, das Kontextfenster, die Benchmarks und wie man es aufruft.
Published 2026-09-18
GLM-5.3-FlashX ist Zhipus Hochgeschwindigkeits-Serving-Tier von GLM-5.3-Flash, veröffentlicht am 18. September 2026 mit einer angegebenen Spitzen-Inferenzgeschwindigkeit von 200 Tokens/s. Es ist kein neues Modell: Es ist dasselbe GLM-5.3-Flash-System — 320B Gesamtparameter mit 18B aktivierten, ein Kontextfenster von 1M Tokens, bis zu 128.000 Ausgabe-Tokens und native Bild-, Video-, Datei- und Texteingabe — bereitgestellt über eine schnellere Inferenzkonfiguration.
Die API-Modell-ID lautet glm-5.3-flashx und steht neben glm-5.3-flash. Der Tausch ist unkompliziert: FlashX kostet mehr pro Token als Flash (Zhipu listet $0,37 Eingabe / $1,25 Ausgabe pro 1M Tokens gegenüber $0,15 / $0,50 für Flash) und liefert schnellere Antworten. Flash ist zudem das Tier mit offenen Gewichten und dasjenige, das im GLM Coding Plan enthalten ist, wo Flash das 3-fache Kontingent von GLM-5.3 erhält.
Wenn Sie Durchsatz, interaktive Latenz oder eine Agent-Schleife benötigen, die viele kurze Turns ausführt, ist FlashX das dafür konzipierte Tier. Wenn Sie die Kosten pro abgeschlossener Aufgabe optimieren und warten können, ist Flash für identische Arbeit günstiger.
Was ist GLM-5.3-FlashX?
GLM-5.3-FlashX ist der geschwindigkeitsoptimierte Endpunkt der GLM-5.3-Flash-Familie. Zhipu kündigte es am 18. September 2026 an und beschrieb es als schneller und reibungsloser für Unternehmen und Entwickler, wobei sowohl die API als auch das offizielle Experience Center zum Start verfügbar waren.
Zwei Dinge sind es wert, getrennt zu werden:
- Das Modell — GLM-5.3-Flash, ein natives multimodales 320B-A18B-Modell, das Zhipu am 26. August 2026 als Open Source veröffentlichte. Architektur, Gewichte, Kontextlänge und Fähigkeiten werden geteilt.
- Das Serving-Tier — FlashX, eine auf Durchsatz abgestimmte Inferenzkonfiguration. Zhipu meldet Geschwindigkeiten von bis zu 200 Tokens/s und führt den Gewinn auf Infrastrukturarbeit zurück, nicht auf einen anderen Checkpoint.
Diese Unterscheidung ist wichtig, wenn Sie es bewerten. Benchmarks, Kontextgrenzen und multimodales Verhalten, die für GLM-5.3-Flash beschrieben werden, gelten für FlashX, weil es dasselbe Modell ist. Latenz und Preis nicht: Diese ändern sich mit dem Serving-Tier.
Modellspezifikationen auf einen Blick
| Spezifikation | GLM-5.3-FlashX |
|---|---|
| API-Modell-ID | glm-5.3-flashx |
| Schwester-Modell-ID | glm-5.3-flash |
| Veröffentlicht | 18. September 2026 |
| Gesamt- / aktivierte Parameter | 320B / 18B |
| Layer | 45 |
| Kontextfenster | 1M Tokens |
| Maximale Ausgabe-Tokens | 128K |
| Eingabemodalitäten | Video, Bild, Text, Datei |
| Ausgabemodalität | Text |
| Angegebene Spitzengeschwindigkeit | 200 Tokens/s |
| Thinking-Modus | Nur thinking.type: enabled; er kann nicht deaktiviert werden |
| Kern-API-Funktionen | Streaming, Function Calling, Context Caching, strukturierte Ausgabe, Tool-Streaming |
Zhipu empfiehlt temperature: 1, top_p: 0.95 und reasoning_effort: max. Für Multi-Turn-Arbeit empfiehlt es, den Thinking-Verlauf beizubehalten statt ihn zu löschen (clear_thinking: false), und für Streaming-Anfragen empfiehlt es, sowohl stream: true als auch tool_stream: true zu aktivieren.
GLM-5.3-FlashX vs. GLM-5.3-Flash
| Dimension | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| Zugrunde liegendes Modell | GLM-5.3-Flash | GLM-5.3-Flash |
| Angegebene Spitzengeschwindigkeit | Standard-Tier | Bis zu 200 Tokens/s |
| Listen-Eingabepreis / 1M | $0,15 | $0,37 |
| Listen-Ausgabepreis / 1M | $0,50 | $1,25 |
| Kontext- und Ausgabegrenzen | 1M / 128K | 1M / 128K |
| Multimodale Eingabe | Ja | Ja |
| Offene Gewichte | Ja, seit 26. August 2026 | Dasselbe Basismodell |
| GLM Coding Plan | Enthalten, mit 3-fachem GLM-5.3-Kontingent | Zum Start nicht enthalten |
Das Anfrageformat ist identisch. Der Wechsel von einem Tier zum anderen ist eine Änderung des model-Feldes, kein Neuschreiben Ihrer Integration — was FlashX zu einem vernünftigen A/B-Kandidaten für Workloads macht, bei denen die Zeit pro Turn der Engpass ist.
Was „200 Tokens/s" aussagt und was nicht
Zhipu gibt 200 Tokens/s als Maximum an. Lesen Sie es als Obergrenze für die Generierungsgeschwindigkeit, nicht als Versprechen für Ihren Workload:
- Es ist ein Spitzenwert. Der tatsächliche Durchsatz hängt von Prompt-Länge, Cache-Treffern, Nebenläufigkeit und dem gewählten Anbieter ab.
- Es ist nicht die Zeit bis zum ersten Token. Eine schnelle Decode-Rate fühlt sich immer noch langsam an, wenn das Modell mehrere Sekunden nachdenkt, bevor es etwas ausgibt. Messen Sie für interaktive Produkte beides.
- Es ist nicht die Gesamtaufgabenlatenz. Ein Agent-Turn, der drei Tools aufruft, wird durch die Tool-Ausführung begrenzt, nicht durch die Token-Rate.
- Langer Kontext verändert das Bild. Bei 1M Tokens dominieren Prefill- und KV-Cache-Verhalten. Genau darauf zielt die Flash-Architektur ab.
Die praktische Regel: Benchmarken Sie Flash und FlashX mit Ihren eigenen Prompts und vergleichen Sie Zeit bis zum ersten Token, Ausgabe-Tokens pro Sekunde und Kosten pro abgeschlossener Aufgabe statt einer einzelnen Geschwindigkeitszahl.
Woher die Geschwindigkeit kommt
Zhipu führt die FlashX-Beschleunigung auf Infrastrukturinvestitionen zurück, nicht auf eine neue Architektur, aufgebaut auf den 100.000 inländischen KI-Beschleunigern, die bereits GLM-5.3-Flash-Traffic bedienen.
- Eine dedizierte Inferenz-Engine auf SGLang, geschrieben für diese Architektur statt angepasst aus einem Allzweck-Stack.
- Speicheroptimierung für 1M-Token-Kontexte, einschließlich ReplaySSM, W8A8-Quantisierung, hybrider INT8/FP8/BF16-Cache-Quantisierung und Layer Split.
- Eine Encode–Prefill–Decode (EPD) disaggregierte Serving-Architektur, die multimodale Kodierung, Prompt-Prefill und Token-für-Token-Decoding in unabhängig geplante Worker-Pools trennt, sodass jede Stufe eigenständig skaliert.
- Eine 3-fache End-to-End-Serving-Verbesserung gegenüber der ursprünglichen Baseline auf derselben Hardware, was laut Zhipu die Kosten pro Token auf ein Niveau bringt, das mit gängigen NVIDIA-GPUs vergleichbar ist.
Ein Detail aus dieser Arbeit ist es wert, gesondert erwähnt zu werden: Zhipu sagt, dass ein GLM-5.3-basierter Infrastruktur-Agent Ingenieuren half, Kernel zu optimieren, Engpässe zu diagnostizieren und den Serving-Stack zu verbessern — das Modell partizipiert am System, das es bedient.
Benchmarks: Was Zhipu für das Basismodell meldet
Alle folgenden Zahlen werden von Zhipu für GLM-5.3-Flash veröffentlicht und gelten für FlashX, weil das Modell dasselbe ist. Es sind anbieterberichtete Ergebnisse, keine unabhängigen Reproduktionen.
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63,4 | 46,2 |
| AutomationBench | 48,8 | 26,2 |
| Z.ai Code Bench v1.0, max effort | 29,0 | Claude Opus 4.8: 29,5 |
Zhipu meldet außerdem, dass GLM-5.3-Flash 57 im Artificial Analysis Intelligence Index v4.1.1 bei $0,045 pro Aufgabe unter seiner rabattierten Preisgestaltung erreicht — ein Niveau, das laut Zhipu zuvor nur zu etwa 10-fachen Kosten verfügbar war — und dass seine Coding-Leistung auf dem internen Z.ai Code Bench des Unternehmens mit Claude Opus 4.8 vergleichbar ist.
Behandeln Sie diese als Richtung, nicht als Gewährleistung. Anbieter-Benchmarks werden üblicherweise auf anbieterfreundlichen Harness-Versionen ausgeführt; die obige Z.ai Code Bench-Zeile wurde auf Claude Code 2.1.207 gemessen. Führen Sie Ihre eigene Evaluierung erneut durch, bevor Sie Produktions-Traffic umstellen.
Architektur: Warum das Flash-Tier günstig zu betreiben ist
FlashX erbt das Design, das Flash kostengünstig zu bedienen machte, was der Grund dafür ist, dass ein schnelleres Tier existieren kann, ohne dass der Preis auf Flaggschiff-Niveau springt.
- Hybride sparse und lineare Attention. Zhipu beschreibt es als das erste Open-Source-Frontier-Modell, das beide kombiniert. Lineare Attention erfasst lokale Abhängigkeiten durch Zustandsmodellierung; sparse Attention ruft relevanten globalen Kontext über einen leichtgewichtigen Indexer ab.
- IndexPool. Vier Indexer-Key-Vektoren werden durch gewichtetes Pooling zu einem komprimiert, was Latenz und Speicheraufwand des Indexers bei einem 1M-Token-Kontext reduziert.
- Manifold-Constrained Hyper-Connections (mHC) für bessere Skalierungseffizienz.
- Geringere Kosten pro Token als GLM-5.3. Zhipu meldet 3,01× weniger Attention-Compute und einen 4,44× kleineren KV-Cache als GLM-5.3. Gegenüber GLM-5.3 sinkt die Anzahl aktivierter Parameter von 32B auf 18B und die Layer von 92 auf 45.
- Ein multimodaler Pre-Training-Korpus mit 30 Billionen Tokens.
Zhipu ist offen damit, dass der KV-Cache immer noch etwas größer ist als der von Kimi-K3 und DeepSeek-V4-Flash, und nennt das eine Richtung für zukünftige Arbeit — eine nützliche Erinnerung daran, dass Architekturvergleiche pro Dimension erfolgen, nicht als einzelnes Ranking.
Ox-Alpha: Das anonyme Modell, das öffentlich getestet wurde
Vor dem Flash-Launch betrieb Zhipu GLM-5.3-Flash anonym als Ox-Alpha auf OpenCode und OpenRouter. Laut Zhipu wurde es das beliebteste Modell der Woche und stellte auf beiden Plattformen Nutzungsrekorde auf, wobei der gesamte Traffic auf chinesischen KI-Chips bedient wurde.
Für Entwickler ist der interessante Teil nicht die Leaderboard-Position, sondern die Validierungsmethode: echter Traffic, echte Coding-Agents, ein unbekannter Modellname und keine Marken-Anziehungskraft. Es ist ein stärkeres Signal als eine Benchmark-Tabelle, wenngleich immer noch ein anbietergesteuerter Rollout ohne veröffentlichte Methodik.
Native Multimodalität und visuelles Coding
GLM-5.3-Flash ist das erste Modell der GLM-5-Serie, das von Anfang an multimodal gebaut wurde, und FlashX behält das bei. Bilder werden als Content-Block mit type: image_url innerhalb von messages[].content[] übergeben, entweder über eine URL oder eine Base64-Daten-URL, und mehrere Blöcke können in einer Nachricht kombiniert werden. Video- und Dateieingabe sind neben Bild und Text dokumentiert.
Die Fähigkeit, die in der Praxis am wichtigsten ist, ist visuelles Coding: Das Modell inspiziert eine gerenderte Oberfläche, vergleicht sie mit dem Ziel und iteriert. Zhipu dokumentiert Workflows zum Neuaufbau einer Anwendung aus Screenshots oder Aufzeichnungen, zum Erstellen von Blender-Szenen, zum Produzieren von Godot-Spielprototypen, zum Betreiben von Browser- und Computer-Use-Agents und zum Reproduzieren von CAD-Teilen — jeweils mit dem Modell, das seine eigene gerenderte Ausgabe prüft, statt nur Code zu generieren.
Dieselbe Schleife erstreckt sich auf Dokumentenarbeit. Zhipu demonstriert PPTX-, PDF-, DOCX- und XLSX-Deliverables, Finanzrecherche mit nachverfolgbarer Quellenangabe, Vertragsprüfung mit verfolgten Anmerkungen und juristische Textgestaltung, wobei das Modell seine eigene Ausgabe rendert und visuell auf Überlauf, Fehlausrichtung und inkonsistentes Styling inspiziert.
Ein Beispiel, das Zhipu gibt, ist ungewöhnlich konkret: Ohne externe Assets lief GLM-5.3-Flash 16 Stunden autonom, um eine etwa 400 m² große Chef-Residenz und Testküche als Blender-Szene zu bauen.
Preisgestaltung: Was FlashX kostet
Offizielle Listenpreise pro 1M Tokens, von Zhipus Preisseiten (geprüft am 18. September 2026):
| Token-Typ | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Eingabe (USD) | $0,37 | $0,15 | $1,40 |
| Gecachte Eingabe (USD) | $0,075 | $0,03 | $0,26 |
| Ausgabe (USD) | $1,25 | $0,50 | $4,40 |
Die Speicherung gecachter Eingaben ist über die drei Tiers hinweg als zeitlich begrenzt kostenlos angegeben.
Kostenbeispiel. Für 10M ungecachte Eingabe-Tokens und 1M Ausgabe-Tokens ergeben die Listenpreise:
| Workload | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M Eingabe + 1M Ausgabe | $4,95 | $2,00 | $18,40 |
| Gleiches Volumen, gesamte Eingabe aus dem Cache | $2,00 | $0,80 | $6,60 |
FlashX liegt bei Eingabe und Ausgabe etwa beim 2,5-fachen von Flash und immer noch deutlich unter GLM-5.3. Ob sich das lohnt, hängt vollständig davon ab, was ein langsamer Turn Sie kostet — für eine Batch-Pipeline selten, für einen interaktiven Agent oft.
Wie man GLM-5.3-FlashX aufruft
FlashX verwendet dieselbe Chat-Completions-Schnittstelle wie Flash, sodass die Migration eine einzeilige Änderung ist.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
Für Streaming fügen Sie stream: true und tool_stream: true hinzu, wie von Zhipu empfohlen. Beachten Sie, dass Thinking bei diesem Modell nicht abgeschaltet werden kann, also kalkulieren Sie Reasoning-Tokens in Ihrer Kostenschätzung und in Ihren Client-Timeouts ein.
Ein praktischer Migrationspfad: Halten Sie die Modell-ID konfigurierbar, senden Sie einen repräsentativen Ausschnitt des Produktions-Traffics an sowohl glm-5.3-flash als auch glm-5.3-flashx und vergleichen Sie Abschlussrate, Zeit bis zum ersten Token und Kosten pro abgeschlossener Aufgabe, bevor Sie einen Workload umstellen.
Wahl zwischen FlashX, Flash und GLM-5.3
- Wählen Sie FlashX für interaktive Produkte, IDE-seitige Vervollständigungen und Agent-Schleifen mit vielen kurzen Turns, wo die Wall-Clock-Zeit pro Turn die Einschränkung ist und der Workload noch in die Flash-Klasse-Fähigkeit passt.
- Wählen Sie Flash für Batch-Verarbeitung, Offline-Generierung und High-Volume-Pipelines, wo die Kosten pro Aufgabe wichtiger sind als die Latenz — und für Open-Weight- oder selbstgehostete Deployments, da Flash das Tier mit veröffentlichten Gewichten ist.
- Wählen Sie GLM-5.3, wenn Sie die Obergrenze des Flaggschiffs statt des Kostenprofils des Flash-Tiers benötigen.
- Gehen Sie nicht davon aus, dass der Geschwindigkeitsgewinn gleichmäßig gilt. Prefill-lastige Anfragen mit langem Kontext und tool-gebundene Agent-Turns können deutlich weniger profitieren als kurze Generierungsaufgaben. Messen Sie den Workload, den Sie tatsächlich ausführen.
Erste Schritte mit der GLM-Familie auf APIMaster.ai
APIMaster bietet Ihnen einen OpenAI-kompatiblen Schlüssel für die GLM-Familie neben Claude, GPT, DeepSeek, Qwen, Gemini, Kimi und anderen Modellen — mit Pay-as-you-go-Preisen ab $1 und bis zu 70 % Rabatt auf offizielle Tarife bei ausgewählten Routen.
Da FlashX dasselbe Anfrageformat wie Flash beibehält, können Teams, die GLM bereits über APIMaster aufrufen, das schnellere Tier evaluieren, ohne ihre Integration über die Modell-ID hinaus anzupassen.
- Erstellen Sie ein APIMaster-Konto.
- Fügen Sie Pay-as-you-go-Guthaben hinzu, ab $1.
- Erstellen Sie einen API-Schlüssel in der APIMaster-Konsole.
- Richten Sie Ihren OpenAI-kompatiblen Client auf
https://apimaster.ai/v1und setzen Sie die Modell-ID, die Sie evaluieren möchten.
Registrieren Sie sich für APIMaster · Erkunden Sie den Modell-Marktplatz · Testen Sie die Modellidentität
FAQ
Ist GLM-5.3-FlashX ein neues Modell? Nein. Es ist das Hochgeschwindigkeits-Serving-Tier von GLM-5.3-Flash. Dasselbe Modell, dasselbe Kontextfenster, dieselbe multimodale Eingabe — eine schnellere Inferenzkonfiguration und ein anderer Preis.
Was ist die GLM-5.3-FlashX-Modell-ID?
glm-5.3-flashx. Das Standard-Tier ist glm-5.3-flash.
Wie schnell ist GLM-5.3-FlashX? Zhipu gibt ein Maximum von 200 Tokens/s an. Das ist ein Spitzenwert; messen Sie Zeit bis zum ersten Token und nachhaltigen Durchsatz mit Ihren eigenen Prompts.
Wie viel kostet GLM-5.3-FlashX? Zhipu listet $0,37 pro 1M Eingabe-Tokens, $1,25 pro 1M Ausgabe-Tokens und $0,075 pro 1M gecachte Eingabe-Tokens — etwa das 2,5-fache des Preises von GLM-5.3-Flash bei Eingabe und Ausgabe.
Was ist das Kontextfenster? 1M Tokens, mit bis zu 128.000 Ausgabe-Tokens, dasselbe wie GLM-5.3-Flash.
Kann GLM-5.3-FlashX Bilder und Videos akzeptieren?
Ja. Es akzeptiert Video-, Bild-, Text- und Dateieingabe und gibt Text zurück. Bilder werden als image_url-Content-Block gesendet, per URL oder Base64-Daten-URL.
Ist GLM-5.3-FlashX im GLM Coding Plan? Zum Start nicht. GLM-5.3-Flash ist im Plan vollständig verfügbar mit 3-fachem GLM-5.3-Kontingent, und Off-Peak-Aufrufe einschließlich des gesamten Wochenendes verbrauchen 50 % der Standardpunkte.
Kann ich Thinking abschalten, um Tokens zu sparen?
Nein. thinking.type unterstützt nur enabled. Zhipu empfiehlt, den Thinking-Verlauf für Multi-Turn-Arbeit beizubehalten (clear_thinking: false).
Sind die Benchmark-Zahlen unabhängig? Nein. Sie werden von Zhipu veröffentlicht. Behandeln Sie sie als richtungsweisend und führen Sie Ihre eigene Evaluierung erneut durch, bevor Sie Produktions-Traffic festschreiben.
Quellen und weiterführende Literatur
- Z.ai — GLM-5.3-Flash/FlashX-Modell-Dokumentation — Modell-IDs, Parameter, Fähigkeiten, empfohlene Einstellungen, Benchmarks und Serving-Details
- Z.ai — Preisgestaltung — offizielle Listenpreise pro 1M Tokens
- Z.ai — GLM-5.3-Flash technischer Blog — Architektur, Effizienzvergleiche und Evaluierungstabellen
- Hugging Face — zai-org/GLM-5.3-Flash — offene Gewichte für das Basismodell
- PANews — Zhipu launches GLM-5.3-FlashX — Launch-Bericht und Ox-Alpha-Hintergrund
Alle Quellen geprüft am 18. September 2026. Preise und Verfügbarkeit ändern sich; verifizieren Sie die aktuellen Bedingungen, bevor Sie einen großen Workload festschreiben.