APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: wat het is, hoe snel het draait en wat het kost

GLM-5.3-FlashX is de snelle serveerlaag van GLM-5.3-Flash van Zhipu, gelanceerd op 18 september 2026 met maximaal 200 tokens/s. Hier vind je de bevestigde model-ID, prijzen, contextvenster, benchmarks en hoe je het aanroept.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX is de snelle serveerlaag van GLM-5.3-Flash van Zhipu, uitgebracht op 18 september 2026 met een gepubliceerde pieksnelheid van 200 tokens/s. Het is geen nieuw model: het is hetzelfde GLM-5.3-Flash-systeem — 320B totale parameters met 18B geactiveerd, een contextvenster van 1M tokens, tot 128.000 outputtokens en native invoer van beeld, video, bestanden en tekst — dat via een snellere inference-configuratie wordt geserveerd.

De API-model-ID is glm-5.3-flashx en staat naast glm-5.3-flash. De afweging is eenvoudig: FlashX kost meer per token dan Flash (Zhipu vermeldt $0,37 input / $1,25 output per 1M tokens tegenover $0,15 / $0,50 voor Flash) en levert snellere reacties. Flash is ook de laag met open gewichten en degene die is opgenomen in het GLM Coding Plan, waar Flash 3× het quotum van GLM-5.3 krijgt.

Als je doorvoer, interactieve latentie of een agent-loop met veel korte beurten nodig hebt, is FlashX de laag die daarvoor is ontworpen. Als je de kosten per voltooide taak optimaliseert en kunt wachten, is Flash goedkoper voor identiek werk.

Wat is GLM-5.3-FlashX?

GLM-5.3-FlashX is het op snelheid geoptimaliseerde endpoint van de GLM-5.3-Flash-familie. Zhipu kondigde het aan op 18 september 2026 en beschreef het als sneller en soepeler voor bedrijven en ontwikkelaars, met zowel de API als het officiële experience center open bij de lancering.

Twee dingen zijn het waard om te scheiden:

  • Het model — GLM-5.3-Flash, een 320B-A18B native multimodaal model dat Zhipu op 26 augustus 2026 open-source maakte. Architectuur, gewichten, contextlengte en mogelijkheden worden gedeeld.
  • De serveerlaag — FlashX, een inference-configuratie die is afgestemd op doorvoer. Zhipu rapporteert snelheden tot 200 tokens/s en schrijft de winst toe aan infrastructuurwerk in plaats van aan een ander checkpoint.

Dat onderscheid is belangrijk wanneer je het beoordeelt. Benchmarks, contextlimieten en multimodaal gedrag die voor GLM-5.3-Flash worden beschreven, gelden voor FlashX omdat het hetzelfde model is. Latentie en prijs niet: die veranderen met de serveerlaag.

Modelspecificaties in één oogopslag

Specificatie GLM-5.3-FlashX
API-model-ID glm-5.3-flashx
Zuster-model-ID glm-5.3-flash
Uitgebracht 18 september 2026
Totale / geactiveerde parameters 320B / 18B
Lagen 45
Contextvenster 1M tokens
Maximale outputtokens 128K
Invoermodaliteiten Video, beeld, tekst, bestand
Uitvoermodaliteit Tekst
Gepubliceerde pieksnelheid 200 tokens/s
Thinking-modus Alleen thinking.type: enabled; kan niet worden uitgeschakeld
Kern-API-functies Streaming, function calling, context caching, structured output, tool streaming

Zhipu adviseert temperature: 1, top_p: 0.95 en reasoning_effort: max. Voor multi-turn werk adviseert het de thinking-geschiedenis te bewaren in plaats van te wissen (clear_thinking: false), en voor streaming-verzoeken adviseert het zowel stream: true als tool_stream: true in te schakelen.

GLM-5.3-FlashX vs GLM-5.3-Flash

Dimensie GLM-5.3-Flash GLM-5.3-FlashX
Onderliggend model GLM-5.3-Flash GLM-5.3-Flash
Gepubliceerde pieksnelheid Standaardlaag Tot 200 tokens/s
Lijstprijs input / 1M $0,15 $0,37
Lijstprijs output / 1M $0,50 $1,25
Context- en outputlimieten 1M / 128K 1M / 128K
Multimodale invoer Ja Ja
Open gewichten Ja, sinds 26 augustus 2026 Hetzelfde basismodel
GLM Coding Plan Inbegrepen, met 3× het GLM-5.3-quotum Niet inbegrepen bij de lancering

Het verzoekformaat is identiek. Overstappen van de ene laag naar de andere is een wijziging van het model-veld, niet een herschrijving van je integratie — wat FlashX een redelijke A/B-kandidaat maakt voor workloads waarbij tijd per beurt de bottleneck is.

Wat "200 tokens/s" je wel en niet vertelt

Zhipu publiceert 200 tokens/s als maximum. Lees het als een plafond op generatiesnelheid, niet als een belofte over jouw workload:

  • Het is een piekcijfer. De werkelijke doorvoer hangt af van promptlengte, cache-hits, gelijktijdigheid en de gekozen provider.
  • Het is niet de tijd tot het eerste token. Een snelle decodeersnelheid voelt nog steeds traag als het model meerdere seconden nadenkt voordat het iets uitvoert. Meet voor interactieve producten beide.
  • Het is niet de totale taaklatentie. Een agent-beurt die drie tools aanroept, wordt begrensd door de uitvoering van de tools, niet door de tokensnelheid.
  • Lange context verandert het beeld. Bij 1M tokens domineren prefill en KV-cache-gedrag. Dat is precies waar de Flash-architectuur op is gericht.

De praktische regel: benchmark Flash en FlashX op je eigen prompts en vergelijk tijd tot het eerste token, outputtokens per seconde en kosten per voltooide taak in plaats van één enkel snelheidscijfer.

Waar de snelheid vandaan komt

Zhipu schrijft de FlashX-versnelling toe aan infrastructuurinvesteringen in plaats van aan een nieuwe architectuur, bovenop de 100.000 binnenlandse AI-versnellers die al GLM-5.3-Flash-verkeer bedienen.

  • Een speciale inference-engine op SGLang, geschreven voor deze architectuur in plaats van aangepast vanuit een general-purpose stack.
  • Geheugenoptimalisatie voor 1M-token-contexten, waaronder ReplaySSM, W8A8-kwantisatie, hybride INT8/FP8/BF16-cache-kwantisatie en Layer Split.
  • Een Encode–Prefill–Decode (EPD) gedisaggregeerde serveerarchitectuur die multimodale encoding, prompt-prefill en token-voor-token-decoding scheidt in onafhankelijk geplande worker-pools, zodat elke fase op zichzelf schaalt.
  • Een 3× end-to-end serveerverbetering ten opzichte van de initiële baseline op dezelfde hardware, wat volgens Zhipu de kosten per token op een niveau brengt dat vergelijkbaar is met mainstream NVIDIA-GPU's.

Eén detail uit dat werk is op zichzelf het vermelden waard: Zhipu zegt dat een door GLM-5.3 aangedreven infrastructuur-agent ingenieurs hielp kernels te optimaliseren, bottlenecks te diagnosticeren en de serveerstack te verbeteren — het model dat deelneemt aan het systeem dat het bedient.

Benchmarks: wat Zhipu voor het basismodel rapporteert

Alle volgende cijfers zijn door Zhipu gepubliceerd voor GLM-5.3-Flash en gelden voor FlashX omdat het model hetzelfde is. Het zijn door de leverancier gerapporteerde resultaten, geen onafhankelijke reproducties.

Benchmark GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63,4 46,2
AutomationBench 48,8 26,2
Z.ai Code Bench v1.0, max effort 29,0 Claude Opus 4.8: 29,5

Zhipu rapporteert ook dat GLM-5.3-Flash 57 scoort op de Artificial Analysis Intelligence Index v4.1.1 tegen $0,045 per taak onder zijn kortingsprijzen — een niveau dat volgens het bedrijf voorheen alleen beschikbaar was tegen ongeveer 10× de kosten — en dat de codeerprestaties vergelijkbaar zijn met Claude Opus 4.8 op de interne Z.ai Code Bench van het bedrijf.

Behandel deze als richting, niet als garantie. Leveranciersbenchmarks worden meestal uitgevoerd op voor de leverancier gunstige harness-versies; de Z.ai Code Bench-regel hierboven is gemeten op Claude Code 2.1.207. Voer je eigen evaluatie opnieuw uit voordat je productieverkeer verplaatst.

Architectuur: waarom de Flash-laag goedkoop te draaien is

FlashX erft het ontwerp dat Flash goedkoop te serveren maakte, wat de reden is dat een snellere laag kan bestaan zonder een prijssprong naar flagship-niveaus.

  • Hybride sparse en lineaire attention. Zhipu beschrijft het als het eerste open-source frontiermodel dat de twee combineert. Lineaire attention legt lokale afhankelijkheden vast via state modeling; sparse attention haalt relevante globale context op via een lichtgewicht indexer.
  • IndexPool. Vier indexer-sleutelvectoren worden gecomprimeerd tot één door gewogen pooling, wat de latentie en geheugenoverhead van de indexer bij een 1M-token-context vermindert.
  • Manifold-Constrained Hyper-Connections (mHC) voor betere schaalefficiëntie.
  • Lagere kosten per token dan GLM-5.3. Zhipu rapporteert 3,01× minder attention-compute en een 4,44× kleinere KV-cache dan GLM-5.3. Ten opzichte van GLM-5.3 daalt het aantal geactiveerde parameters van 32B naar 18B en het aantal lagen van 92 naar 45.
  • Een multimodaal pre-training-corpus van 30 biljoen tokens.

Zhipu is openhartig dat de KV-cache nog steeds iets groter is dan die van Kimi-K3 en DeepSeek-V4-Flash en noemt dat een richting voor toekomstig werk — een nuttige herinnering dat architectuurvergelijkingen per dimensie zijn, niet één enkele ranglijst.

Ox-Alpha: het anonieme model dat in het openbaar testte

Vóór de Flash-lancering liet Zhipu GLM-5.3-Flash anoniem draaien als Ox-Alpha op OpenCode en OpenRouter. Volgens Zhipu werd het het populairste model van de week en vestigde het gebruiksrecords op beide platforms, waarbij al dat verkeer op Chinese AI-chips werd bediend.

Voor ontwikkelaars is het interessante deel niet de positie op de ranglijst, maar de validatiemethode: echt verkeer, echte codeer-agents, een onbekende modelnaam en geen merkkracht. Het is een sterker signaal dan een benchmarktabel, zij het nog steeds een door de leverancier gecontroleerde uitrol zonder gepubliceerde methodologie.

Native multimodaal en visueel coderen

GLM-5.3-Flash is het eerste model uit de GLM-5-serie dat vanaf het begin multimodaal is gebouwd, en FlashX behoudt dat. Afbeeldingen worden doorgegeven als een content-blok met type: image_url binnen messages[].content[], met een URL of een Base64 data-URL, en meerdere blokken kunnen in één bericht worden gecombineerd. Video- en bestandsinvoer worden gedocumenteerd naast beeld en tekst.

De mogelijkheid die in de praktijk het meest uitmaakt, is visueel coderen: het model inspecteert een gerenderde interface, vergelijkt die met het doel en itereert. Zhipu documenteert workflows voor het herbouwen van een applicatie op basis van screenshots of opnames, het bouwen van Blender-scènes, het produceren van Godot-gameprototypes, het draaien van browser- en computer-use-agents en het reproduceren van CAD-onderdelen — elk waarbij het model zijn eigen gerenderde output controleert in plaats van alleen code te genereren.

Dezelfde loop strekt zich uit tot documentwerk. Zhipu demonstreert PPTX-, PDF-, DOCX- en XLSX-deliverables, financieel onderzoek met traceerbare bronvermelding, contractbeoordeling met bijgehouden annotaties en juridisch opstellen, waarbij het model zijn eigen output rendert en visueel inspecteert op overflow, verkeerde uitlijning en inconsistente styling.

Eén voorbeeld dat Zhipu geeft is ongewoon concreet: zonder externe assets draaide GLM-5.3-Flash 16 uur autonoom om een chefswoning met testkeuken van ongeveer 400 m² als Blender-scène te bouwen.

Prijzen: wat FlashX kost

Officiële lijstprijzen per 1M tokens, uit de prijspagina's van Zhipu (gecontroleerd op 18 september 2026):

Tokentype GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Input (USD) $0,37 $0,15 $1,40
Cached input (USD) $0,075 $0,03 $0,26
Output (USD) $1,25 $0,50 $4,40

Opslag van cached input staat voor alle drie de lagen als tijdelijk gratis vermeld.

Kostenvoorbeeld. Voor 10M niet-gecachte inputtokens en 1M outputtokens geven de lijstprijzen:

Workload GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M input + 1M output $4,95 $2,00 $18,40
Zelfde volume, alle input uit cache $2,00 $0,80 $6,60

FlashX is ongeveer 2,5× Flash op input en output, en nog steeds ruim onder GLM-5.3. Of dat het waard is, hangt volledig af van wat een trage beurt je kost — voor een batch-pipeline zelden, en voor een interactieve agent vaak wel.

Hoe je GLM-5.3-FlashX aanroept

FlashX gebruikt dezelfde chat-completions-interface als Flash, dus migreren is een wijziging van één regel.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Voeg voor streaming stream: true en tool_stream: true toe zoals Zhipu adviseert. Let op dat thinking op dit model niet kan worden uitgeschakeld, dus reserveer ruimte voor reasoning-tokens in je kostenraming en in je client-timeouts.

Een praktisch migratiepad: houd de model-ID configureerbaar, stuur een representatief deel van het productieverkeer naar zowel glm-5.3-flash als glm-5.3-flashx, en vergelijk de voltooiingsratio, tijd tot het eerste token en kosten per afgeronde taak voordat je een workload overzet.

Kiezen tussen FlashX, Flash en GLM-5.3

  • Kies FlashX voor interactieve producten, completions aan de IDE-zijde en agent-loops met veel korte beurten, waar wall-clock-tijd per beurt de beperking is en de workload nog binnen Flash-klasse mogelijkheden past.
  • Kies Flash voor batchverwerking, offline generatie en pipelines met hoog volume waar kosten per taak belangrijker zijn dan latentie — en voor open-weight- of self-hosted-implementaties, aangezien Flash de laag met gepubliceerde gewichten is.
  • Kies GLM-5.3 wanneer je het plafond van het flagship nodig hebt in plaats van het kostenprofiel van de Flash-laag.
  • Ga er niet van uit dat de snelheidswinst gelijkmatig geldt. Prefill-zware, lange-context-verzoeken en tool-gebonden agent-beurten kunnen veel minder profiteren dan korte generatietaken. Meet de workload die je daadwerkelijk draait.

Aan de slag met de GLM-familie op APIMaster.ai

APIMaster geeft je één OpenAI-compatibele sleutel voor de GLM-familie naast Claude, GPT, DeepSeek, Qwen, Gemini, Kimi en andere modellen — met pay-as-you-go-prijzen vanaf $1 en tot 70% korting op officiële tarieven op geselecteerde routes.

Omdat FlashX hetzelfde verzoekformaat als Flash behoudt, kunnen teams die GLM al via APIMaster aanroepen de snellere laag evalueren zonder hun integratie aan te passen, afgezien van de model-ID.

  1. Maak een APIMaster-account aan.
  2. Voeg pay-as-you-go-tegoed toe, vanaf $1.
  3. Maak een API-sleutel aan in de APIMaster-console.
  4. Richt je OpenAI-compatibele client op https://apimaster.ai/v1 en stel de model-ID in die je wilt evalueren.

Registreer voor APIMaster · Verken de modelmarktplaats · Test modelidentiteit

FAQ

Is GLM-5.3-FlashX een nieuw model? Nee. Het is de snelle serveerlaag van GLM-5.3-Flash. Hetzelfde model, hetzelfde contextvenster, dezelfde multimodale invoer — een snellere inference-configuratie en een andere prijs.

Wat is de model-ID van GLM-5.3-FlashX? glm-5.3-flashx. De standaardlaag is glm-5.3-flash.

Hoe snel is GLM-5.3-FlashX? Zhipu publiceert een maximum van 200 tokens/s. Dat is een piekcijfer; meet de tijd tot het eerste token en de aanhoudende doorvoer op je eigen prompts.

Hoeveel kost GLM-5.3-FlashX? Zhipu vermeldt $0,37 per 1M inputtokens, $1,25 per 1M outputtokens en $0,075 per 1M cached inputtokens — ongeveer 2,5× de prijs van GLM-5.3-Flash op input en output.

Wat is het contextvenster? 1M tokens, met tot 128.000 outputtokens, hetzelfde als GLM-5.3-Flash.

Kan GLM-5.3-FlashX afbeeldingen en video accepteren? Ja. Het accepteert video-, beeld-, tekst- en bestandsinvoer en retourneert tekst. Afbeeldingen worden verzonden als een image_url-content-blok, via URL of Base64 data-URL.

Zit GLM-5.3-FlashX in het GLM Coding Plan? Niet bij de lancering. GLM-5.3-Flash is volledig beschikbaar op het plan met 3× het GLM-5.3-quotum, en off-peak-aanroepen waaronder alle weekenden verbruiken 50% van de standaardpunten.

Kan ik thinking uitschakelen om tokens te besparen? Nee. thinking.type ondersteunt alleen enabled. Zhipu adviseert de thinking-geschiedenis te bewaren (clear_thinking: false) voor multi-turn werk.

Zijn de benchmarkcijfers onafhankelijk? Nee. Ze zijn gepubliceerd door Zhipu. Behandel ze als indicatief en voer je eigen evaluatie opnieuw uit voordat je productieverkeer vastlegt.

Bronnen en verder lezen

Alle bronnen gecontroleerd op 18 september 2026. Prijzen en beschikbaarheid veranderen; verifieer de actuele voorwaarden voordat je een grote workload vastlegt.