GLM-5.3-FlashX: cos'è, quanto è veloce e quanto costa
GLM-5.3-FlashX è il tier di serving ad alta velocità di GLM-5.3-Flash di Zhipu, lanciato il 18 settembre 2026 con velocità fino a 200 token/s. Ecco l'ID del modello confermato, i prezzi, la finestra di contesto, i benchmark e come chiamarlo.
Published 2026-09-18
GLM-5.3-FlashX è il tier di serving ad alta velocità di GLM-5.3-Flash di Zhipu, rilasciato il 18 settembre 2026 con una velocità di inferenza di picco dichiarata di 200 token/s. Non è un nuovo modello: è lo stesso sistema GLM-5.3-Flash — 320B parametri totali con 18B attivati, una finestra di contesto di 1M token, fino a 128.000 token di output e input nativo di immagini, video, file e testo — servito attraverso una configurazione di inferenza più veloce.
L'ID del modello API è glm-5.3-flashx e si affianca a glm-5.3-flash. Il compromesso è semplice: FlashX costa di più per token rispetto a Flash (Zhipu indica $0,37 input / $1,25 output per 1M token contro $0,15 / $0,50 per Flash) e restituisce risposte più rapide. Flash è anche il tier con pesi aperti e quello incluso nel GLM Coding Plan, dove Flash ottiene 3× la quota di GLM-5.3.
Se hai bisogno di throughput, latenza interattiva o di un loop agentico che esegue molti turni brevi, FlashX è il tier progettato per questo. Se stai ottimizzando il costo per attività completata e puoi aspettare, Flash è più economico per lo stesso lavoro.
Cos'è GLM-5.3-FlashX?
GLM-5.3-FlashX è l'endpoint ottimizzato per la velocità della famiglia GLM-5.3-Flash. Zhipu lo ha annunciato il 18 settembre 2026, descrivendolo come più veloce e fluido per aziende e sviluppatori, con l'API e il centro esperienza ufficiale entrambi aperti al lancio.
Due cose meritano di essere distinte:
- Il modello — GLM-5.3-Flash, un modello multimodale nativo 320B-A18B che Zhipu ha reso open source il 26 agosto 2026. Architettura, pesi, lunghezza del contesto e capacità sono condivisi.
- Il tier di serving — FlashX, una configurazione di inferenza ottimizzata per il throughput. Zhipu riporta velocità fino a 200 token/s e attribuisce il guadagno al lavoro sull'infrastruttura piuttosto che a un checkpoint diverso.
Questa distinzione conta quando lo valuti. I benchmark, i limiti di contesto e il comportamento multimodale descritti per GLM-5.3-Flash si applicano a FlashX perché sono lo stesso modello. Latenza e prezzo no: quelli cambiano con il tier di serving.
Specifiche del modello in sintesi
| Specifica | GLM-5.3-FlashX |
|---|---|
| ID del modello API | glm-5.3-flashx |
| ID del modello gemello | glm-5.3-flash |
| Rilasciato | 18 settembre 2026 |
| Parametri totali / attivati | 320B / 18B |
| Layer | 45 |
| Finestra di contesto | 1M token |
| Token di output massimi | 128K |
| Modalità di input | Video, immagine, testo, file |
| Modalità di output | Testo |
| Velocità di picco dichiarata | 200 token/s |
| Modalità thinking | Solo thinking.type: enabled; non può essere disattivata |
| Funzionalità API principali | Streaming, function calling, context caching, structured output, tool streaming |
Zhipu consiglia temperature: 1, top_p: 0.95 e reasoning_effort: max. Per il lavoro multi-turno consiglia di mantenere la cronologia di thinking invece di cancellarla (clear_thinking: false), e per le richieste in streaming consiglia di abilitare sia stream: true sia tool_stream: true.
GLM-5.3-FlashX vs GLM-5.3-Flash
| Dimensione | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| Modello sottostante | GLM-5.3-Flash | GLM-5.3-Flash |
| Velocità di picco dichiarata | Tier standard | Fino a 200 token/s |
| Prezzo di listino input / 1M | $0,15 | $0,37 |
| Prezzo di listino output / 1M | $0,50 | $1,25 |
| Limiti di contesto e output | 1M / 128K | 1M / 128K |
| Input multimodale | Sì | Sì |
| Pesi aperti | Sì, dal 26 agosto 2026 | Stesso modello base |
| GLM Coding Plan | Incluso, con 3× la quota di GLM-5.3 | Non incluso al lancio |
Il formato della richiesta è identico. Passare da un tier all'altro è una modifica al campo model, non una riscrittura della tua integrazione — il che rende FlashX un candidato ragionevole per l'A/B testing su workload in cui il tempo per turno è il collo di bottiglia.
Cosa ti dice e cosa non ti dice "200 token/s"
Zhipu pubblica 200 token/s come massimo. Leggilo come un tetto alla velocità di generazione, non come una promessa sul tuo workload:
- È un valore di picco. Il throughput reale dipende dalla lunghezza del prompt, dagli hit della cache, dalla concorrenza e dal provider selezionato.
- Non è il time to first token. Una velocità di decodifica elevata sembra comunque lenta se il modello pensa per diversi secondi prima di emettere qualsiasi cosa. Per i prodotti interattivi, misura entrambi.
- Non è la latenza totale dell'attività. Un turno agentico che chiama tre tool è limitato dall'esecuzione dei tool, non dalla velocità dei token.
- Il contesto lungo cambia il quadro. A 1M token, il prefill e il comportamento della KV-cache dominano. È esattamente ciò su cui punta l'architettura Flash.
La regola pratica: fai il benchmark di Flash e FlashX sui tuoi prompt e confronta time to first token, token di output al secondo e costo per attività completata invece di un singolo numero di velocità.
Da dove viene la velocità
Zhipu attribuisce l'accelerazione di FlashX all'investimento in infrastruttura piuttosto che a una nuova architettura, costruita sopra i 100.000 acceleratori AI nazionali già al servizio del traffico di GLM-5.3-Flash.
- Un motore di inferenza dedicato su SGLang, scritto per questa architettura invece che adattato da uno stack generico.
- Ottimizzazione della memoria per contesti da 1M token, tra cui ReplaySSM, quantizzazione W8A8, quantizzazione ibrida della cache INT8/FP8/BF16 e Layer Split.
- Un'architettura di serving disaggregata Encode–Prefill–Decode (EPD) che separa la codifica multimodale, il prefill del prompt e la decodifica token per token in pool di worker pianificati in modo indipendente, così ogni fase scala da sola.
- Un miglioramento del serving end-to-end di 3× rispetto al baseline iniziale sullo stesso hardware, che secondo Zhipu porta il costo per token a un livello comparabile con le GPU NVIDIA mainstream.
Un dettaglio di quel lavoro merita di essere notato di per sé: Zhipu afferma che un agente infrastrutturale basato su GLM-5.3 ha aiutato gli ingegneri a ottimizzare i kernel, diagnosticare i colli di bottiglia e migliorare lo stack di serving — il modello che partecipa al sistema che lo serve.
Benchmark: cosa riporta Zhipu per il modello base
Tutti i numeri seguenti sono pubblicati da Zhipu per GLM-5.3-Flash e si applicano a FlashX perché il modello è lo stesso. Sono risultati dichiarati dal fornitore, non riproduzioni indipendenti.
| Benchmark | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63,4 | 46,2 |
| AutomationBench | 48,8 | 26,2 |
| Z.ai Code Bench v1.0, max effort | 29,0 | Claude Opus 4.8: 29,5 |
Zhipu riporta inoltre che GLM-5.3-Flash ottiene 57 sull'Artificial Analysis Intelligence Index v4.1.1 a $0,045 per attività con il suo prezzo scontato — un livello che, secondo l'azienda, era precedentemente disponibile solo a circa 10× il costo — e che le sue prestazioni di coding sono comparabili a Claude Opus 4.8 sul Z.ai Code Bench interno dell'azienda.
Trattali come indicazioni, non come garanzia. I benchmark dei fornitori sono di solito eseguiti su versioni di harness favorevoli al fornitore; la riga Z.ai Code Bench sopra è stata misurata su Claude Code 2.1.207. Riesegui la tua valutazione prima di spostare il traffico di produzione.
Architettura: perché il tier Flash è economico da eseguire
FlashX eredita il design che ha reso Flash economico da servire, ed è la ragione per cui un tier più veloce può esistere senza un salto di prezzo ai livelli flagship.
- Attenzione ibrida sparsa e lineare. Zhipu la descrive come il primo modello frontier open source a combinare le due. L'attenzione lineare cattura le dipendenze locali attraverso la modellazione dello stato; l'attenzione sparsa recupera il contesto globale rilevante attraverso un indexer leggero.
- IndexPool. Quattro vettori chiave dell'indexer vengono compressi in uno tramite pooling pesato, riducendo la latenza e l'overhead di memoria dell'indexer a un contesto di 1M token.
- Manifold-Constrained Hyper-Connections (mHC) per una migliore efficienza di scaling.
- Costo per token inferiore rispetto a GLM-5.3. Zhipu riporta il 3,01× in meno di calcolo di attenzione e una KV cache 4,44× più piccola rispetto a GLM-5.3. Rispetto a GLM-5.3, il numero di parametri attivati scende da 32B a 18B e i layer da 92 a 45.
- Un corpus di pre-training multimodale da 30 trilioni di token.
Zhipu è schietta sul fatto che la KV cache è ancora leggermente più grande di quella di Kimi-K3 e DeepSeek-V4-Flash e indica questa come una direzione per il lavoro futuro — un promemoria utile che i confronti architetturali sono per dimensione, non una singola classifica.
Ox-Alpha: il modello anonimo testato in pubblico
Prima del lancio di Flash, Zhipu ha eseguito GLM-5.3-Flash in forma anonima come Ox-Alpha su OpenCode e OpenRouter. Secondo Zhipu, è diventato il modello più popolare della settimana e ha stabilito record di utilizzo su entrambe le piattaforme, con tutto quel traffico servito su chip AI cinesi.
Per gli sviluppatori, la parte interessante non è la posizione in classifica ma il metodo di validazione: traffico reale, agenti di coding reali, un nome di modello sconosciuto e nessina spinta di brand. È un segnale più forte di una tabella di benchmark, anche se resta un rollout controllato dal fornitore senza metodologia pubblicata.
Multimodale nativo e coding visivo
GLM-5.3-Flash è il primo modello della serie GLM-5 costruito come multimodale fin dall'inizio, e FlashX lo mantiene. Le immagini vengono passate come blocco di contenuto con type: image_url all'interno di messages[].content[], usando un URL o un data URL Base64, e più blocchi possono essere combinati in un singolo messaggio. L'input video e file è documentato insieme a immagine e testo.
La capacità che conta di più in pratica è il coding visivo: il modello ispeziona un'interfaccia renderizzata, la confronta con l'obiettivo e itera. Zhipu documenta workflow per ricostruire un'applicazione da screenshot o registrazioni, costruire scene Blender, produrre prototipi di giochi Godot, eseguire agenti browser e computer-use e riprodurre parti CAD — ciascuno con il modello che verifica il proprio output renderizzato invece di generare solo codice.
Lo stesso loop si estende al lavoro sui documenti. Zhipu dimostra deliverable PPTX, PDF, DOCX e XLSX, ricerca finanziaria con fonti tracciabili, revisione di contratti con annotazioni tracciate e redazione legale, con il modello che renderizza e ispeziona visivamente il proprio output per overflow, disallineamenti e stili incoerenti.
Un esempio che Zhipu fornisce è insolitamente concreto: senza asset esterni, GLM-5.3-Flash ha funzionato in autonomia per 16 ore per costruire una residenza di uno chef di circa 400 m² con cucina di prova come scena Blender.
Prezzi: quanto costa FlashX
Prezzi di listino ufficiali per 1M token, dalle pagine prezzi di Zhipu (verificati il 18 settembre 2026):
| Tipo di token | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Input (USD) | $0,37 | $0,15 | $1,40 |
| Input in cache (USD) | $0,075 | $0,03 | $0,26 |
| Output (USD) | $1,25 | $0,50 | $4,40 |
Lo storage dell'input in cache è indicato come gratuito a tempo limitato su tutti e tre i tier.
Esempio di costo. Per 10M token di input non in cache e 1M token di output, i prezzi di listino danno:
| Workload | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M input + 1M output | $4,95 | $2,00 | $18,40 |
| Stesso volume, tutto l'input dalla cache | $2,00 | $0,80 | $6,60 |
FlashX è circa 2,5× Flash su input e output, e comunque ben al di sotto di GLM-5.3. Se ne valga la pena dipende interamente da quanto ti costa un turno lento — per una pipeline batch raramente lo è, e per un agente interattivo spesso lo è.
Come chiamare GLM-5.3-FlashX
FlashX usa la stessa interfaccia chat-completions di Flash, quindi la migrazione è una modifica di una riga.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
Per lo streaming, aggiungi stream: true e tool_stream: true come consiglia Zhipu. Nota che il thinking non può essere disattivato su questo modello, quindi prevedi i token di reasoning nella tua stima dei costi e nei timeout del client.
Un percorso di migrazione pratico: mantieni configurabile l'ID del modello, invia una fetta rappresentativa del traffico di produzione sia a glm-5.3-flash sia a glm-5.3-flashx, e confronta tasso di completamento, time to first token e costo per attività completata prima di spostare un workload.
Scegliere tra FlashX, Flash e GLM-5.3
- Scegli FlashX per prodotti interattivi, completamenti lato IDE e loop agentici con molti turni brevi, dove il tempo reale per turno è il vincolo e il workload rientra ancora nelle capacità della classe Flash.
- Scegli Flash per elaborazione batch, generazione offline e pipeline ad alto volume dove il costo per attività conta più della latenza — e per deployment con pesi aperti o self-hosted, poiché Flash è il tier con pesi pubblicati.
- Scegli GLM-5.3 quando ti serve il tetto del flagship piuttosto che il profilo di costo del tier Flash.
- Non dare per scontato che il guadagno di velocità si applichi uniformemente. Richieste pesanti di prefill con contesto lungo e turni agentici vincolati dai tool possono vedere molti meno benefici rispetto a compiti di generazione brevi. Misura il workload che esegui effettivamente.
Inizia con la famiglia GLM su APIMaster.ai
APIMaster ti offre una chiave compatibile con OpenAI per la famiglia GLM insieme a Claude, GPT, DeepSeek, Qwen, Gemini, Kimi e altri modelli — con prezzi pay-as-you-go a partire da $1 e fino al 70% di sconto sulle tariffe ufficiali su rotte selezionate.
Poiché FlashX mantiene lo stesso formato di richiesta di Flash, i team che già chiamano GLM tramite APIMaster possono valutare il tier più veloce senza toccare la loro integrazione oltre all'ID del modello.
- Crea un account APIMaster.
- Aggiungi credito pay-as-you-go, a partire da $1.
- Crea una chiave API nella console APIMaster.
- Punta il tuo client compatibile con OpenAI su
https://apimaster.ai/v1e imposta l'ID del modello che vuoi valutare.
Registrati su APIMaster · Esplora il marketplace dei modelli · Testa l'identità del modello
FAQ
GLM-5.3-FlashX è un nuovo modello? No. È il tier di serving ad alta velocità di GLM-5.3-Flash. Stesso modello, stessa finestra di contesto, stesso input multimodale — una configurazione di inferenza più veloce e un prezzo diverso.
Qual è l'ID del modello GLM-5.3-FlashX?
glm-5.3-flashx. Il tier standard è glm-5.3-flash.
Quanto è veloce GLM-5.3-FlashX? Zhipu pubblica un massimo di 200 token/s. È un valore di picco; misura il time to first token e il throughput sostenuto sui tuoi prompt.
Quanto costa GLM-5.3-FlashX? Zhipu indica $0,37 per 1M token di input, $1,25 per 1M token di output e $0,075 per 1M token di input in cache — circa 2,5× il prezzo di GLM-5.3-Flash su input e output.
Qual è la finestra di contesto? 1M token, con fino a 128.000 token di output, come GLM-5.3-Flash.
GLM-5.3-FlashX può accettare immagini e video?
Sì. Accetta input video, immagine, testo e file e restituisce testo. Le immagini vengono inviate come blocco di contenuto image_url, tramite URL o data URL Base64.
GLM-5.3-FlashX è nel GLM Coding Plan? Non al lancio. GLM-5.3-Flash è pienamente disponibile sul piano con 3× la quota di GLM-5.3, e le chiamate off-peak inclusi tutti i weekend consumano il 50% dei punti standard.
Posso disattivare il thinking per risparmiare token?
No. thinking.type supporta solo enabled. Zhipu consiglia di mantenere la cronologia di thinking (clear_thinking: false) per il lavoro multi-turno.
I numeri dei benchmark sono indipendenti? No. Sono pubblicati da Zhipu. Trattali come indicativi e riesegui la tua valutazione prima di impegnare traffico di produzione.
Fonti e approfondimenti
- Z.ai — Documentazione dei modelli GLM-5.3-Flash/FlashX — ID dei modelli, parametri, capacità, impostazioni consigliate, benchmark e dettagli di serving
- Z.ai — Prezzi — prezzi di listino ufficiali per 1M token
- Z.ai — Blog tecnico GLM-5.3-Flash — architettura, confronti di efficienza e tabelle di valutazione
- Hugging Face — zai-org/GLM-5.3-Flash — pesi aperti per il modello base
- PANews — Zhipu launches GLM-5.3-FlashX — resoconto del lancio e contesto su Ox-Alpha
Tutte le fonti verificate il 18 settembre 2026. Prezzi e disponibilità cambiano; verifica i termini attuali prima di impegnare un workload di grandi dimensioni.