APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: O Que É, Quão Rápido Ele Roda e Quanto Custa

GLM-5.3-FlashX é o nível de serviço de alta velocidade do GLM-5.3-Flash da Zhipu, lançado em 18 de setembro de 2026 com até 200 tokens/s. Aqui estão o ID do modelo confirmado, preços, janela de contexto, benchmarks e como chamá-lo.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX é o nível de serviço de alta velocidade do GLM-5.3-Flash da Zhipu, lançado em 18 de setembro de 2026 com uma velocidade de inferência de pico publicada de 200 tokens/s. Não é um novo modelo: é o mesmo sistema GLM-5.3-Flash — 320B de parâmetros totais com 18B ativados, uma janela de contexto de 1M de tokens, até 128.000 tokens de saída e entrada nativa de imagem, vídeo, arquivo e texto — servido através de uma configuração de inferência mais rápida.

O ID do modelo da API é glm-5.3-flashx e ele fica ao lado de glm-5.3-flash. A troca é direta: o FlashX custa mais por token do que o Flash (a Zhipu lista $0,37 de entrada / $1,25 de saída por 1M de tokens contra $0,15 / $0,50 do Flash) e retorna respostas mais rápidas. O Flash também é o nível com pesos abertos e o que está incluído no GLM Coding Plan, onde o Flash recebe 3× a cota do GLM-5.3.

Se você precisa de throughput, latência interativa ou um loop de agente que executa muitos turnos curtos, o FlashX é o nível projetado para isso. Se você está otimizando o custo por tarefa concluída e pode esperar, o Flash é mais barato para trabalho idêntico.

O que é o GLM-5.3-FlashX?

GLM-5.3-FlashX é o endpoint otimizado para velocidade da família GLM-5.3-Flash. A Zhipu o anunciou em 18 de setembro de 2026, descrevendo-o como mais rápido e mais fluido para empresas e desenvolvedores, com a API e o centro de experiência oficial ambos abertos no lançamento.

Vale separar duas coisas:

  • O modelo — GLM-5.3-Flash, um modelo multimodal nativo 320B-A18B que a Zhipu tornou open-source em 26 de agosto de 2026. Arquitetura, pesos, comprimento de contexto e capacidades são compartilhados.
  • O nível de serviço — FlashX, uma configuração de inferência ajustada para throughput. A Zhipu relata velocidades de até 200 tokens/s e atribui o ganho ao trabalho de infraestrutura, e não a um checkpoint diferente.

Essa distinção importa quando você o avalia. Benchmarks, limites de contexto e comportamento multimodal descritos para o GLM-5.3-Flash se aplicam ao FlashX porque são o mesmo modelo. Latência e preço não: esses mudam com o nível de serviço.

Especificações do modelo em resumo

Especificação GLM-5.3-FlashX
ID do modelo da API glm-5.3-flashx
ID do modelo irmão glm-5.3-flash
Lançado 18 de setembro de 2026
Parâmetros totais / ativados 320B / 18B
Camadas 45
Janela de contexto 1M de tokens
Máximo de tokens de saída 128K
Modalidades de entrada Vídeo, imagem, texto, arquivo
Modalidade de saída Texto
Velocidade de pico publicada 200 tokens/s
Modo de raciocínio Apenas thinking.type: enabled; não pode ser desativado
Recursos principais da API Streaming, chamada de funções, cache de contexto, saída estruturada, streaming de ferramentas

A Zhipu recomenda temperature: 1, top_p: 0.95 e reasoning_effort: max. Para trabalho multi-turno, recomenda manter o histórico de raciocínio em vez de limpá-lo (clear_thinking: false), e para requisições de streaming recomenda habilitar tanto stream: true quanto tool_stream: true.

GLM-5.3-FlashX vs GLM-5.3-Flash

Dimensão GLM-5.3-Flash GLM-5.3-FlashX
Modelo subjacente GLM-5.3-Flash GLM-5.3-Flash
Velocidade de pico publicada Nível padrão Até 200 tokens/s
Preço de tabela de entrada / 1M $0,15 $0,37
Preço de tabela de saída / 1M $0,50 $1,25
Limites de contexto e saída 1M / 128K 1M / 128K
Entrada multimodal Sim Sim
Pesos abertos Sim, desde 26 de agosto de 2026 Mesmo modelo base
GLM Coding Plan Incluído, com 3× a cota do GLM-5.3 Não incluído no lançamento

O formato da requisição é idêntico. Migrar de um nível para o outro é uma mudança no campo model, não uma reescrita da sua integração — o que torna o FlashX um candidato razoável para testes A/B em cargas de trabalho onde o tempo por turno é o gargalo.

O que "200 tokens/s" diz e o que não diz

A Zhipu publica 200 tokens/s como um máximo. Leia isso como um teto na velocidade de geração, não como uma promessa sobre a sua carga de trabalho:

  • É um número de pico. O throughput real depende do comprimento do prompt, dos acertos de cache, da concorrência e do provedor selecionado.
  • Não é o tempo até o primeiro token. Uma taxa de decodificação rápida ainda parece lenta se o modelo raciocina por vários segundos antes de emitir qualquer coisa. Para produtos interativos, meça ambos.
  • Não é a latência total da tarefa. Um turno de agente que chama três ferramentas é limitado pela execução das ferramentas, não pela taxa de tokens.
  • Contexto longo muda o cenário. Com 1M de tokens, o prefill e o comportamento do KV-cache dominam. É exatamente para isso que a arquitetura do Flash foi projetada.

A regra prática: faça benchmark do Flash e do FlashX com os seus próprios prompts e compare tempo até o primeiro token, tokens de saída por segundo e custo por tarefa concluída em vez de um único número de velocidade.

De onde vem a velocidade

A Zhipu atribui o ganho de velocidade do FlashX ao investimento em infraestrutura, e não a uma nova arquitetura, construída sobre os 100.000 aceleradores de IA domésticos que já atendem o tráfego do GLM-5.3-Flash.

  • Um motor de inferência dedicado em SGLang, escrito para esta arquitetura em vez de adaptado de uma pilha de uso geral.
  • Otimização de memória para contextos de 1M de tokens, incluindo ReplaySSM, quantização W8A8, quantização de cache híbrida INT8/FP8/BF16 e Layer Split.
  • Uma arquitetura de serviço desagregada Encode–Prefill–Decode (EPD) que separa a codificação multimodal, o prefill do prompt e a decodificação token a token em pools de workers agendados de forma independente, para que cada estágio escale por conta própria.
  • Uma melhoria de 3× no serviço ponta a ponta em relação à linha de base inicial no mesmo hardware, o que, segundo a Zhipu, traz o custo por token a um nível comparável ao das GPUs NVIDIA convencionais.

Um detalhe desse trabalho merece destaque por si só: a Zhipu afirma que um agente de infraestrutura alimentado pelo GLM-5.3 ajudou os engenheiros a otimizar kernels, diagnosticar gargalos e melhorar a pilha de serviço — o modelo participando do sistema que o serve.

Benchmarks: o que a Zhipu relata para o modelo base

Todos os números a seguir são publicados pela Zhipu para o GLM-5.3-Flash e se aplicam ao FlashX porque o modelo é o mesmo. São resultados relatados pelo fornecedor, não reproduções independentes.

Benchmark GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63,4 46,2
AutomationBench 48,8 26,2
Z.ai Code Bench v1.0, esforço máximo 29,0 Claude Opus 4.8: 29,5

A Zhipu também relata que o GLM-5.3-Flash pontua 57 no Artificial Analysis Intelligence Index v4.1.1 a $0,045 por tarefa sob seu preço com desconto — um nível que, segundo ela, antes só estava disponível a aproximadamente 10× o custo — e que seu desempenho de codificação é comparável ao Claude Opus 4.8 no Z.ai Code Bench interno da empresa.

Trate isso como direção, não como garantia. Benchmarks de fornecedores geralmente são executados em versões de harness favoráveis ao fornecedor; a linha do Z.ai Code Bench acima foi medida no Claude Code 2.1.207. Refaça sua própria avaliação antes de migrar o tráfego de produção.

Arquitetura: por que o nível Flash é barato de rodar

O FlashX herda o design que tornou o Flash barato de servir, que é a razão pela qual um nível mais rápido pode existir sem um salto de preço para níveis de flagship.

  • Atenção híbrida esparsa e linear. A Zhipu o descreve como o primeiro modelo de fronteira open-source a combinar as duas. A atenção linear captura dependências locais através de modelagem de estado; a atenção esparsa recupera contexto global relevante através de um indexador leve.
  • IndexPool. Quatro vetores de chave do indexador são comprimidos em um por pooling ponderado, reduzindo a latência e a sobrecarga de memória do indexador em um contexto de 1M de tokens.
  • Manifold-Constrained Hyper-Connections (mHC) para melhor eficiência de escalonamento.
  • Custo por token menor que o GLM-5.3. A Zhipu relata 3,01× menos computação de atenção e um KV cache 4,44× menor que o GLM-5.3. Em comparação com o GLM-5.3, a contagem de parâmetros ativados cai de 32B para 18B e as camadas de 92 para 45.
  • Um corpus de pré-treinamento multimodal de 30 trilhões de tokens.

A Zhipu é franca ao dizer que o KV cache ainda é ligeiramente maior que o do Kimi-K3 e o do DeepSeek-V4-Flash e chama isso de uma direção para trabalho futuro — um lembrete útil de que comparações de arquitetura são por dimensão, não um único ranking.

Ox-Alpha: o modelo anônimo que foi testado em público

Antes do lançamento do Flash, a Zhipu rodou o GLM-5.3-Flash anonimamente como Ox-Alpha no OpenCode e no OpenRouter. Segundo a Zhipu, ele se tornou o modelo mais popular da semana e estabeleceu recordes de uso em ambas as plataformas, com todo esse tráfego servido em chips de IA chineses.

Para os desenvolvedores, a parte interessante não é a posição no leaderboard, mas o método de validação: tráfego real, agentes de codificação reais, um nome de modelo desconhecido e nenhum apelo de marca. É um sinal mais forte do que uma tabela de benchmark, embora ainda seja um lançamento controlado pelo fornecedor, sem metodologia publicada.

Multimodal nativo e codificação visual

O GLM-5.3-Flash é o primeiro modelo da série GLM-5 construído como multimodal desde o início, e o FlashX mantém isso. As imagens são passadas como um bloco de conteúdo com type: image_url dentro de messages[].content[], usando uma URL ou uma data URL Base64, e vários blocos podem ser combinados em uma única mensagem. A entrada de vídeo e arquivo é documentada junto com imagem e texto.

A capacidade que mais importa na prática é a codificação visual: o modelo inspeciona uma interface renderizada, compara-a com o alvo e itera. A Zhipu documenta fluxos de trabalho para reconstruir uma aplicação a partir de capturas de tela ou gravações, construir cenas no Blender, produzir protótipos de jogos em Godot, executar agentes de navegador e de uso de computador e reproduzir peças de CAD — cada um com o modelo verificando sua própria saída renderizada em vez de apenas gerar código.

O mesmo loop se estende ao trabalho com documentos. A Zhipu demonstra entregáveis em PPTX, PDF, DOCX e XLSX, pesquisa financeira com fontes rastreáveis, revisão de contratos com anotações rastreadas e redação jurídica, com o modelo renderizando e inspecionando visualmente sua própria saída em busca de overflow, desalinhamento e estilos inconsistentes.

Um exemplo que a Zhipu dá é incomumente concreto: sem nenhum recurso externo, o GLM-5.3-Flash rodou de forma autônoma por 16 horas para construir uma residência de chef e cozinha de teste de aproximadamente 400 m² como uma cena no Blender.

Preços: quanto custa o FlashX

Preços de tabela oficiais por 1M de tokens, das páginas de preços da Zhipu (verificados em 18 de setembro de 2026):

Tipo de token GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Entrada (USD) $0,37 $0,15 $1,40
Entrada em cache (USD) $0,075 $0,03 $0,26
Saída (USD) $1,25 $0,50 $4,40

O armazenamento de entrada em cache está listado como gratuito por tempo limitado nos três níveis.

Exemplo de custo. Para 10M de tokens de entrada sem cache e 1M de tokens de saída, os preços de tabela dão:

Carga de trabalho GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M de entrada + 1M de saída $4,95 $2,00 $18,40
Mesmo volume, toda a entrada vinda do cache $2,00 $0,80 $6,60

O FlashX é aproximadamente 2,5× o Flash na entrada e na saída, e ainda bem abaixo do GLM-5.3. Se isso vale a pena depende inteiramente do que um turno lento custa para você — para um pipeline em lote raramente vale, e para um agente interativo frequentemente vale.

Como chamar o GLM-5.3-FlashX

O FlashX usa a mesma interface de chat-completions que o Flash, então migrar é uma mudança de uma linha.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Para streaming, adicione stream: true e tool_stream: true conforme a Zhipu recomenda. Observe que o raciocínio não pode ser desativado neste modelo, então reserve orçamento para tokens de raciocínio na sua estimativa de custo e nos timeouts do seu cliente.

Um caminho prático de migração: mantenha o ID do modelo configurável, envie uma fatia representativa do tráfego de produção tanto para glm-5.3-flash quanto para glm-5.3-flashx, e compare taxa de conclusão, tempo até o primeiro token e custo por tarefa finalizada antes de migrar uma carga de trabalho.

Escolhendo entre FlashX, Flash e GLM-5.3

  • Escolha o FlashX para produtos interativos, completações no lado da IDE e loops de agente com muitos turnos curtos, onde o tempo de relógio por turno é a restrição e a carga de trabalho ainda se encaixa na capacidade da classe Flash.
  • Escolha o Flash para processamento em lote, geração offline e pipelines de alto volume onde o custo por tarefa importa mais que a latência — e para implantações com pesos abertos ou auto-hospedadas, já que o Flash é o nível com pesos publicados.
  • Escolha o GLM-5.3 quando você precisa do teto do flagship em vez do perfil de custo do nível Flash.
  • Não presuma que o ganho de velocidade se aplica de forma uniforme. Requisições com muito prefill e contexto longo e turnos de agente limitados por ferramentas podem ver muito menos benefício do que tarefas curtas de geração. Meça a carga de trabalho que você realmente executa.

Comece com a família GLM no APIMaster.ai

O APIMaster oferece a você uma chave compatível com OpenAI para a família GLM junto com Claude, GPT, DeepSeek, Qwen, Gemini, Kimi e outros modelos — com preços pay-as-you-go a partir de $1 e até 70% de desconto sobre as tarifas oficiais em rotas selecionadas.

Como o FlashX mantém o mesmo formato de requisição que o Flash, equipes que já chamam o GLM através do APIMaster podem avaliar o nível mais rápido sem tocar na sua integração além do ID do modelo.

  1. Crie uma conta no APIMaster.
  2. Adicione crédito pay-as-you-go, a partir de $1.
  3. Crie uma chave de API no console do APIMaster.
  4. Aponte seu cliente compatível com OpenAI para https://apimaster.ai/v1 e defina o ID do modelo que você quer avaliar.

Registre-se no APIMaster · Explore o marketplace de modelos · Teste a identidade do modelo

FAQ

O GLM-5.3-FlashX é um novo modelo? Não. É o nível de serviço de alta velocidade do GLM-5.3-Flash. Mesmo modelo, mesma janela de contexto, mesma entrada multimodal — uma configuração de inferência mais rápida e um preço diferente.

Qual é o ID do modelo do GLM-5.3-FlashX? glm-5.3-flashx. O nível padrão é glm-5.3-flash.

Quão rápido é o GLM-5.3-FlashX? A Zhipu publica um máximo de 200 tokens/s. Esse é um número de pico; meça o tempo até o primeiro token e o throughput sustentado com os seus próprios prompts.

Quanto custa o GLM-5.3-FlashX? A Zhipu lista $0,37 por 1M de tokens de entrada, $1,25 por 1M de tokens de saída e $0,075 por 1M de tokens de entrada em cache — cerca de 2,5× o preço do GLM-5.3-Flash na entrada e na saída.

Qual é a janela de contexto? 1M de tokens, com até 128.000 tokens de saída, o mesmo que o GLM-5.3-Flash.

O GLM-5.3-FlashX aceita imagens e vídeo? Sim. Ele aceita entrada de vídeo, imagem, texto e arquivo e retorna texto. As imagens são enviadas como um bloco de conteúdo image_url, por URL ou data URL Base64.

O GLM-5.3-FlashX está no GLM Coding Plan? Não no lançamento. O GLM-5.3-Flash está totalmente disponível no plano com 3× a cota do GLM-5.3, e chamadas fora de pico, incluindo todo o fim de semana, consomem 50% dos pontos padrão.

Posso desativar o raciocínio para economizar tokens? Não. thinking.type só suporta enabled. A Zhipu recomenda manter o histórico de raciocínio (clear_thinking: false) para trabalho multi-turno.

Os números de benchmark são independentes? Não. Eles são publicados pela Zhipu. Trate-os como direcionais e refaça sua própria avaliação antes de comprometer tráfego de produção.

Fontes e leitura adicional

Todas as fontes verificadas em 18 de setembro de 2026. Preços e disponibilidade mudam; verifique os termos atuais antes de comprometer uma carga de trabalho grande.