APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: cos'è, quanto è veloce e quanto costa

GLM-5.3-FlashX è il tier di serving ad alta velocità di GLM-5.3-Flash di Zhipu, lanciato il 18 settembre 2026 con velocità fino a 200 token/s. Ecco l'ID del modello confermato, i prezzi, la finestra di contesto, i benchmark e come chiamarlo.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX è il tier di serving ad alta velocità di GLM-5.3-Flash di Zhipu, rilasciato il 18 settembre 2026 con una velocità di inferenza di picco dichiarata di 200 token/s. Non è un nuovo modello: è lo stesso sistema GLM-5.3-Flash — 320B parametri totali con 18B attivati, una finestra di contesto di 1M token, fino a 128.000 token di output e input nativo di immagini, video, file e testo — servito attraverso una configurazione di inferenza più veloce.

L'ID del modello API è glm-5.3-flashx e si affianca a glm-5.3-flash. Il compromesso è semplice: FlashX costa di più per token rispetto a Flash (Zhipu indica $0,37 input / $1,25 output per 1M token contro $0,15 / $0,50 per Flash) e restituisce risposte più rapide. Flash è anche il tier con pesi aperti e quello incluso nel GLM Coding Plan, dove Flash ottiene 3× la quota di GLM-5.3.

Se hai bisogno di throughput, latenza interattiva o di un loop agentico che esegue molti turni brevi, FlashX è il tier progettato per questo. Se stai ottimizzando il costo per attività completata e puoi aspettare, Flash è più economico per lo stesso lavoro.

Cos'è GLM-5.3-FlashX?

GLM-5.3-FlashX è l'endpoint ottimizzato per la velocità della famiglia GLM-5.3-Flash. Zhipu lo ha annunciato il 18 settembre 2026, descrivendolo come più veloce e fluido per aziende e sviluppatori, con l'API e il centro esperienza ufficiale entrambi aperti al lancio.

Due cose meritano di essere distinte:

  • Il modello — GLM-5.3-Flash, un modello multimodale nativo 320B-A18B che Zhipu ha reso open source il 26 agosto 2026. Architettura, pesi, lunghezza del contesto e capacità sono condivisi.
  • Il tier di serving — FlashX, una configurazione di inferenza ottimizzata per il throughput. Zhipu riporta velocità fino a 200 token/s e attribuisce il guadagno al lavoro sull'infrastruttura piuttosto che a un checkpoint diverso.

Questa distinzione conta quando lo valuti. I benchmark, i limiti di contesto e il comportamento multimodale descritti per GLM-5.3-Flash si applicano a FlashX perché sono lo stesso modello. Latenza e prezzo no: quelli cambiano con il tier di serving.

Specifiche del modello in sintesi

Specifica GLM-5.3-FlashX
ID del modello API glm-5.3-flashx
ID del modello gemello glm-5.3-flash
Rilasciato 18 settembre 2026
Parametri totali / attivati 320B / 18B
Layer 45
Finestra di contesto 1M token
Token di output massimi 128K
Modalità di input Video, immagine, testo, file
Modalità di output Testo
Velocità di picco dichiarata 200 token/s
Modalità thinking Solo thinking.type: enabled; non può essere disattivata
Funzionalità API principali Streaming, function calling, context caching, structured output, tool streaming

Zhipu consiglia temperature: 1, top_p: 0.95 e reasoning_effort: max. Per il lavoro multi-turno consiglia di mantenere la cronologia di thinking invece di cancellarla (clear_thinking: false), e per le richieste in streaming consiglia di abilitare sia stream: true sia tool_stream: true.

GLM-5.3-FlashX vs GLM-5.3-Flash

Dimensione GLM-5.3-Flash GLM-5.3-FlashX
Modello sottostante GLM-5.3-Flash GLM-5.3-Flash
Velocità di picco dichiarata Tier standard Fino a 200 token/s
Prezzo di listino input / 1M $0,15 $0,37
Prezzo di listino output / 1M $0,50 $1,25
Limiti di contesto e output 1M / 128K 1M / 128K
Input multimodale
Pesi aperti Sì, dal 26 agosto 2026 Stesso modello base
GLM Coding Plan Incluso, con 3× la quota di GLM-5.3 Non incluso al lancio

Il formato della richiesta è identico. Passare da un tier all'altro è una modifica al campo model, non una riscrittura della tua integrazione — il che rende FlashX un candidato ragionevole per l'A/B testing su workload in cui il tempo per turno è il collo di bottiglia.

Cosa ti dice e cosa non ti dice "200 token/s"

Zhipu pubblica 200 token/s come massimo. Leggilo come un tetto alla velocità di generazione, non come una promessa sul tuo workload:

  • È un valore di picco. Il throughput reale dipende dalla lunghezza del prompt, dagli hit della cache, dalla concorrenza e dal provider selezionato.
  • Non è il time to first token. Una velocità di decodifica elevata sembra comunque lenta se il modello pensa per diversi secondi prima di emettere qualsiasi cosa. Per i prodotti interattivi, misura entrambi.
  • Non è la latenza totale dell'attività. Un turno agentico che chiama tre tool è limitato dall'esecuzione dei tool, non dalla velocità dei token.
  • Il contesto lungo cambia il quadro. A 1M token, il prefill e il comportamento della KV-cache dominano. È esattamente ciò su cui punta l'architettura Flash.

La regola pratica: fai il benchmark di Flash e FlashX sui tuoi prompt e confronta time to first token, token di output al secondo e costo per attività completata invece di un singolo numero di velocità.

Da dove viene la velocità

Zhipu attribuisce l'accelerazione di FlashX all'investimento in infrastruttura piuttosto che a una nuova architettura, costruita sopra i 100.000 acceleratori AI nazionali già al servizio del traffico di GLM-5.3-Flash.

  • Un motore di inferenza dedicato su SGLang, scritto per questa architettura invece che adattato da uno stack generico.
  • Ottimizzazione della memoria per contesti da 1M token, tra cui ReplaySSM, quantizzazione W8A8, quantizzazione ibrida della cache INT8/FP8/BF16 e Layer Split.
  • Un'architettura di serving disaggregata Encode–Prefill–Decode (EPD) che separa la codifica multimodale, il prefill del prompt e la decodifica token per token in pool di worker pianificati in modo indipendente, così ogni fase scala da sola.
  • Un miglioramento del serving end-to-end di 3× rispetto al baseline iniziale sullo stesso hardware, che secondo Zhipu porta il costo per token a un livello comparabile con le GPU NVIDIA mainstream.

Un dettaglio di quel lavoro merita di essere notato di per sé: Zhipu afferma che un agente infrastrutturale basato su GLM-5.3 ha aiutato gli ingegneri a ottimizzare i kernel, diagnosticare i colli di bottiglia e migliorare lo stack di serving — il modello che partecipa al sistema che lo serve.

Benchmark: cosa riporta Zhipu per il modello base

Tutti i numeri seguenti sono pubblicati da Zhipu per GLM-5.3-Flash e si applicano a FlashX perché il modello è lo stesso. Sono risultati dichiarati dal fornitore, non riproduzioni indipendenti.

Benchmark GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63,4 46,2
AutomationBench 48,8 26,2
Z.ai Code Bench v1.0, max effort 29,0 Claude Opus 4.8: 29,5

Zhipu riporta inoltre che GLM-5.3-Flash ottiene 57 sull'Artificial Analysis Intelligence Index v4.1.1 a $0,045 per attività con il suo prezzo scontato — un livello che, secondo l'azienda, era precedentemente disponibile solo a circa 10× il costo — e che le sue prestazioni di coding sono comparabili a Claude Opus 4.8 sul Z.ai Code Bench interno dell'azienda.

Trattali come indicazioni, non come garanzia. I benchmark dei fornitori sono di solito eseguiti su versioni di harness favorevoli al fornitore; la riga Z.ai Code Bench sopra è stata misurata su Claude Code 2.1.207. Riesegui la tua valutazione prima di spostare il traffico di produzione.

Architettura: perché il tier Flash è economico da eseguire

FlashX eredita il design che ha reso Flash economico da servire, ed è la ragione per cui un tier più veloce può esistere senza un salto di prezzo ai livelli flagship.

  • Attenzione ibrida sparsa e lineare. Zhipu la descrive come il primo modello frontier open source a combinare le due. L'attenzione lineare cattura le dipendenze locali attraverso la modellazione dello stato; l'attenzione sparsa recupera il contesto globale rilevante attraverso un indexer leggero.
  • IndexPool. Quattro vettori chiave dell'indexer vengono compressi in uno tramite pooling pesato, riducendo la latenza e l'overhead di memoria dell'indexer a un contesto di 1M token.
  • Manifold-Constrained Hyper-Connections (mHC) per una migliore efficienza di scaling.
  • Costo per token inferiore rispetto a GLM-5.3. Zhipu riporta il 3,01× in meno di calcolo di attenzione e una KV cache 4,44× più piccola rispetto a GLM-5.3. Rispetto a GLM-5.3, il numero di parametri attivati scende da 32B a 18B e i layer da 92 a 45.
  • Un corpus di pre-training multimodale da 30 trilioni di token.

Zhipu è schietta sul fatto che la KV cache è ancora leggermente più grande di quella di Kimi-K3 e DeepSeek-V4-Flash e indica questa come una direzione per il lavoro futuro — un promemoria utile che i confronti architetturali sono per dimensione, non una singola classifica.

Ox-Alpha: il modello anonimo testato in pubblico

Prima del lancio di Flash, Zhipu ha eseguito GLM-5.3-Flash in forma anonima come Ox-Alpha su OpenCode e OpenRouter. Secondo Zhipu, è diventato il modello più popolare della settimana e ha stabilito record di utilizzo su entrambe le piattaforme, con tutto quel traffico servito su chip AI cinesi.

Per gli sviluppatori, la parte interessante non è la posizione in classifica ma il metodo di validazione: traffico reale, agenti di coding reali, un nome di modello sconosciuto e nessina spinta di brand. È un segnale più forte di una tabella di benchmark, anche se resta un rollout controllato dal fornitore senza metodologia pubblicata.

Multimodale nativo e coding visivo

GLM-5.3-Flash è il primo modello della serie GLM-5 costruito come multimodale fin dall'inizio, e FlashX lo mantiene. Le immagini vengono passate come blocco di contenuto con type: image_url all'interno di messages[].content[], usando un URL o un data URL Base64, e più blocchi possono essere combinati in un singolo messaggio. L'input video e file è documentato insieme a immagine e testo.

La capacità che conta di più in pratica è il coding visivo: il modello ispeziona un'interfaccia renderizzata, la confronta con l'obiettivo e itera. Zhipu documenta workflow per ricostruire un'applicazione da screenshot o registrazioni, costruire scene Blender, produrre prototipi di giochi Godot, eseguire agenti browser e computer-use e riprodurre parti CAD — ciascuno con il modello che verifica il proprio output renderizzato invece di generare solo codice.

Lo stesso loop si estende al lavoro sui documenti. Zhipu dimostra deliverable PPTX, PDF, DOCX e XLSX, ricerca finanziaria con fonti tracciabili, revisione di contratti con annotazioni tracciate e redazione legale, con il modello che renderizza e ispeziona visivamente il proprio output per overflow, disallineamenti e stili incoerenti.

Un esempio che Zhipu fornisce è insolitamente concreto: senza asset esterni, GLM-5.3-Flash ha funzionato in autonomia per 16 ore per costruire una residenza di uno chef di circa 400 m² con cucina di prova come scena Blender.

Prezzi: quanto costa FlashX

Prezzi di listino ufficiali per 1M token, dalle pagine prezzi di Zhipu (verificati il 18 settembre 2026):

Tipo di token GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Input (USD) $0,37 $0,15 $1,40
Input in cache (USD) $0,075 $0,03 $0,26
Output (USD) $1,25 $0,50 $4,40

Lo storage dell'input in cache è indicato come gratuito a tempo limitato su tutti e tre i tier.

Esempio di costo. Per 10M token di input non in cache e 1M token di output, i prezzi di listino danno:

Workload GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M input + 1M output $4,95 $2,00 $18,40
Stesso volume, tutto l'input dalla cache $2,00 $0,80 $6,60

FlashX è circa 2,5× Flash su input e output, e comunque ben al di sotto di GLM-5.3. Se ne valga la pena dipende interamente da quanto ti costa un turno lento — per una pipeline batch raramente lo è, e per un agente interattivo spesso lo è.

Come chiamare GLM-5.3-FlashX

FlashX usa la stessa interfaccia chat-completions di Flash, quindi la migrazione è una modifica di una riga.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Per lo streaming, aggiungi stream: true e tool_stream: true come consiglia Zhipu. Nota che il thinking non può essere disattivato su questo modello, quindi prevedi i token di reasoning nella tua stima dei costi e nei timeout del client.

Un percorso di migrazione pratico: mantieni configurabile l'ID del modello, invia una fetta rappresentativa del traffico di produzione sia a glm-5.3-flash sia a glm-5.3-flashx, e confronta tasso di completamento, time to first token e costo per attività completata prima di spostare un workload.

Scegliere tra FlashX, Flash e GLM-5.3

  • Scegli FlashX per prodotti interattivi, completamenti lato IDE e loop agentici con molti turni brevi, dove il tempo reale per turno è il vincolo e il workload rientra ancora nelle capacità della classe Flash.
  • Scegli Flash per elaborazione batch, generazione offline e pipeline ad alto volume dove il costo per attività conta più della latenza — e per deployment con pesi aperti o self-hosted, poiché Flash è il tier con pesi pubblicati.
  • Scegli GLM-5.3 quando ti serve il tetto del flagship piuttosto che il profilo di costo del tier Flash.
  • Non dare per scontato che il guadagno di velocità si applichi uniformemente. Richieste pesanti di prefill con contesto lungo e turni agentici vincolati dai tool possono vedere molti meno benefici rispetto a compiti di generazione brevi. Misura il workload che esegui effettivamente.

Inizia con la famiglia GLM su APIMaster.ai

APIMaster ti offre una chiave compatibile con OpenAI per la famiglia GLM insieme a Claude, GPT, DeepSeek, Qwen, Gemini, Kimi e altri modelli — con prezzi pay-as-you-go a partire da $1 e fino al 70% di sconto sulle tariffe ufficiali su rotte selezionate.

Poiché FlashX mantiene lo stesso formato di richiesta di Flash, i team che già chiamano GLM tramite APIMaster possono valutare il tier più veloce senza toccare la loro integrazione oltre all'ID del modello.

  1. Crea un account APIMaster.
  2. Aggiungi credito pay-as-you-go, a partire da $1.
  3. Crea una chiave API nella console APIMaster.
  4. Punta il tuo client compatibile con OpenAI su https://apimaster.ai/v1 e imposta l'ID del modello che vuoi valutare.

Registrati su APIMaster · Esplora il marketplace dei modelli · Testa l'identità del modello

FAQ

GLM-5.3-FlashX è un nuovo modello? No. È il tier di serving ad alta velocità di GLM-5.3-Flash. Stesso modello, stessa finestra di contesto, stesso input multimodale — una configurazione di inferenza più veloce e un prezzo diverso.

Qual è l'ID del modello GLM-5.3-FlashX? glm-5.3-flashx. Il tier standard è glm-5.3-flash.

Quanto è veloce GLM-5.3-FlashX? Zhipu pubblica un massimo di 200 token/s. È un valore di picco; misura il time to first token e il throughput sostenuto sui tuoi prompt.

Quanto costa GLM-5.3-FlashX? Zhipu indica $0,37 per 1M token di input, $1,25 per 1M token di output e $0,075 per 1M token di input in cache — circa 2,5× il prezzo di GLM-5.3-Flash su input e output.

Qual è la finestra di contesto? 1M token, con fino a 128.000 token di output, come GLM-5.3-Flash.

GLM-5.3-FlashX può accettare immagini e video? Sì. Accetta input video, immagine, testo e file e restituisce testo. Le immagini vengono inviate come blocco di contenuto image_url, tramite URL o data URL Base64.

GLM-5.3-FlashX è nel GLM Coding Plan? Non al lancio. GLM-5.3-Flash è pienamente disponibile sul piano con 3× la quota di GLM-5.3, e le chiamate off-peak inclusi tutti i weekend consumano il 50% dei punti standard.

Posso disattivare il thinking per risparmiare token? No. thinking.type supporta solo enabled. Zhipu consiglia di mantenere la cronologia di thinking (clear_thinking: false) per il lavoro multi-turno.

I numeri dei benchmark sono indipendenti? No. Sono pubblicati da Zhipu. Trattali come indicativi e riesegui la tua valutazione prima di impegnare traffico di produzione.

Fonti e approfondimenti

Tutte le fonti verificate il 18 settembre 2026. Prezzi e disponibilità cambiano; verifica i termini attuali prima di impegnare un workload di grandi dimensioni.