APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: qué es, qué tan rápido se ejecuta y cuánto cuesta

GLM-5.3-FlashX es el nivel de servicio de alta velocidad de GLM-5.3-Flash de Zhipu, lanzado el 18 de septiembre de 2026 con hasta 200 tokens/s. Aquí están el ID de modelo confirmado, los precios, la ventana de contexto, los benchmarks y cómo invocarlo.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX es el nivel de servicio de alta velocidad de GLM-5.3-Flash de Zhipu, lanzado el 18 de septiembre de 2026 con una velocidad máxima de inferencia publicada de 200 tokens/s. No es un modelo nuevo: es el mismo sistema GLM-5.3-Flash — 320B de parámetros totales con 18B activados, una ventana de contexto de 1M de tokens, hasta 128.000 tokens de salida y entrada nativa de imagen, vídeo, archivo y texto — servido a través de una configuración de inferencia más rápida.

El ID de modelo de la API es glm-5.3-flashx y se sitúa junto a glm-5.3-flash. El intercambio es sencillo: FlashX cuesta más por token que Flash (Zhipu indica $0,37 de entrada / $1,25 de salida por 1M de tokens frente a $0,15 / $0,50 para Flash) y devuelve respuestas más rápidas. Flash es también el nivel con pesos abiertos y el que se incluye en el GLM Coding Plan, donde Flash obtiene 3× la cuota de GLM-5.3.

Si necesitas rendimiento, latencia interactiva o un bucle de agente que ejecute muchos turnos cortos, FlashX es el nivel diseñado para eso. Si estás optimizando el coste por tarea completada y puedes esperar, Flash es más barato para un trabajo idéntico.

¿Qué es GLM-5.3-FlashX?

GLM-5.3-FlashX es el endpoint optimizado para velocidad de la familia GLM-5.3-Flash. Zhipu lo anunció el 18 de septiembre de 2026, describiéndolo como más rápido y fluido para empresas y desarrolladores, con la API y el centro de experiencia oficial abiertos ambos en el lanzamiento.

Merece la pena separar dos cosas:

  • El modelo — GLM-5.3-Flash, un modelo multimodal nativo 320B-A18B que Zhipu publicó como código abierto el 26 de agosto de 2026. La arquitectura, los pesos, la longitud de contexto y las capacidades son compartidos.
  • El nivel de servicio — FlashX, una configuración de inferencia ajustada para el rendimiento. Zhipu reporta velocidades de hasta 200 tokens/s y atribuye la mejora al trabajo de infraestructura en lugar de a un checkpoint diferente.

Esa distinción importa cuando lo evalúas. Los benchmarks, los límites de contexto y el comportamiento multimodal descritos para GLM-5.3-Flash se aplican a FlashX porque son el mismo modelo. La latencia y el precio no: esos cambian con el nivel de servicio.

Especificaciones del modelo de un vistazo

Especificación GLM-5.3-FlashX
ID de modelo de la API glm-5.3-flashx
ID de modelo hermano glm-5.3-flash
Lanzamiento 18 de septiembre de 2026
Parámetros totales / activados 320B / 18B
Capas 45
Ventana de contexto 1M de tokens
Tokens máximos de salida 128K
Modalidades de entrada Vídeo, imagen, texto, archivo
Modalidad de salida Texto
Velocidad máxima publicada 200 tokens/s
Modo de pensamiento Solo thinking.type: enabled; no se puede desactivar
Funciones principales de la API Streaming, function calling, context caching, structured output, tool streaming

Zhipu recomienda temperature: 1, top_p: 0.95 y reasoning_effort: max. Para trabajo multiturno recomienda conservar el historial de pensamiento en lugar de borrarlo (clear_thinking: false), y para solicitudes de streaming recomienda habilitar tanto stream: true como tool_stream: true.

GLM-5.3-FlashX vs GLM-5.3-Flash

Dimensión GLM-5.3-Flash GLM-5.3-FlashX
Modelo subyacente GLM-5.3-Flash GLM-5.3-Flash
Velocidad máxima publicada Nivel estándar Hasta 200 tokens/s
Precio de entrada de lista / 1M $0,15 $0,37
Precio de salida de lista / 1M $0,50 $1,25
Límites de contexto y salida 1M / 128K 1M / 128K
Entrada multimodal
Pesos abiertos Sí, desde el 26 de agosto de 2026 Mismo modelo base
GLM Coding Plan Incluido, con 3× la cuota de GLM-5.3 No incluido en el lanzamiento

El formato de solicitud es idéntico. Pasar de un nivel a otro es un cambio en el campo model, no una reescritura de tu integración — lo que convierte a FlashX en un candidato razonable para A/B en cargas de trabajo donde el tiempo por turno es el cuello de botella.

Qué te dice y qué no te dice "200 tokens/s"

Zhipu publica 200 tokens/s como máximo. Léelo como un techo de velocidad de generación, no como una promesa sobre tu carga de trabajo:

  • Es una cifra máxima. El rendimiento real depende de la longitud del prompt, los aciertos de caché, la concurrencia y el proveedor seleccionado.
  • No es el tiempo hasta el primer token. Una tasa de decodificación rápida sigue pareciendo lenta si el modelo piensa durante varios segundos antes de emitir algo. Para productos interactivos, mide ambas cosas.
  • No es la latencia total de la tarea. Un turno de agente que llama a tres herramientas está limitado por la ejecución de las herramientas, no por la tasa de tokens.
  • El contexto largo cambia el panorama. A 1M de tokens, el prefill y el comportamiento de la caché KV dominan. Eso es exactamente lo que apunta la arquitectura Flash.

La regla práctica: haz benchmark de Flash y FlashX con tus propios prompts, y compara tiempo hasta el primer token, tokens de salida por segundo y coste por tarea completada en lugar de una única cifra de velocidad.

De dónde viene la velocidad

Zhipu atribuye la aceleración de FlashX a la inversión en infraestructura en lugar de a una nueva arquitectura, construida sobre los 100.000 aceleradores de IA nacionales que ya sirven el tráfico de GLM-5.3-Flash.

  • Un motor de inferencia dedicado sobre SGLang, escrito para esta arquitectura en lugar de adaptado de un stack de propósito general.
  • Optimización de memoria para contextos de 1M de tokens, incluyendo ReplaySSM, cuantización W8A8, cuantización de caché híbrida INT8/FP8/BF16 y Layer Split.
  • Una arquitectura de servicio desagregada Encode–Prefill–Decode (EPD) que separa la codificación multimodal, el prefill del prompt y la decodificación token a token en pools de workers programados de forma independiente, de modo que cada etapa escala por su cuenta.
  • Una mejora del 3× en el servicio de extremo a extremo frente a la línea base inicial en el mismo hardware, que según Zhipu lleva el coste por token a un nivel comparable con las GPUs NVIDIA convencionales.

Un detalle de ese trabajo merece mención por sí solo: Zhipu dice que un agente de infraestructura impulsado por GLM-5.3 ayudó a los ingenieros a optimizar kernels, diagnosticar cuellos de botella y mejorar el stack de servicio — el modelo participando en el sistema que lo sirve.

Benchmarks: lo que Zhipu reporta para el modelo base

Todas las cifras siguientes están publicadas por Zhipu para GLM-5.3-Flash y se aplican a FlashX porque el modelo es el mismo. Son resultados reportados por el proveedor, no reproducciones independientes.

Benchmark GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63,4 46,2
AutomationBench 48,8 26,2
Z.ai Code Bench v1.0, esfuerzo máximo 29,0 Claude Opus 4.8: 29,5

Zhipu también reporta que GLM-5.3-Flash obtiene 57 en el Artificial Analysis Intelligence Index v4.1.1 a $0,045 por tarea bajo su precio con descuento — un nivel que, según dice, antes solo estaba disponible a aproximadamente 10× el coste — y que su rendimiento en programación es comparable a Claude Opus 4.8 en el Z.ai Code Bench interno de la compañía.

Trata esto como orientación, no como garantía. Los benchmarks de proveedor suelen ejecutarse en versiones de harness favorables al proveedor; la línea del Z.ai Code Bench anterior se midió en Claude Code 2.1.207. Vuelve a ejecutar tu propia evaluación antes de mover tráfico de producción.

Arquitectura: por qué el nivel Flash es barato de ejecutar

FlashX hereda el diseño que hizo que Flash fuera económico de servir, que es la razón por la que puede existir un nivel más rápido sin un salto de precio a niveles de gama alta.

  • Atención híbrida dispersa y lineal. Zhipu lo describe como el primer modelo frontera de código abierto que combina ambas. La atención lineal captura dependencias locales mediante modelado de estado; la atención dispersa recupera contexto global relevante mediante un indexador ligero.
  • IndexPool. Cuatro vectores clave del indexador se comprimen en uno mediante pooling ponderado, reduciendo la latencia y la sobrecarga de memoria del indexador en un contexto de 1M de tokens.
  • Manifold-Constrained Hyper-Connections (mHC) para una mejor eficiencia de escalado.
  • Menor coste por token que GLM-5.3. Zhipu reporta 3,01× menos cómputo de atención y una caché KV 4,44× más pequeña que GLM-5.3. Frente a GLM-5.3, el número de parámetros activados baja de 32B a 18B y las capas de 92 a 45.
  • Un corpus de preentrenamiento multimodal de 30 billones de tokens.

Zhipu es sincero al señalar que la caché KV sigue siendo ligeramente mayor que la de Kimi-K3 y DeepSeek-V4-Flash y lo califica como una dirección para trabajo futuro — un recordatorio útil de que las comparaciones de arquitectura son por dimensión, no una única clasificación.

Ox-Alpha: el modelo anónimo que se probó en público

Antes del lanzamiento de Flash, Zhipu ejecutó GLM-5.3-Flash de forma anónima como Ox-Alpha en OpenCode y OpenRouter. Según Zhipu, se convirtió en el modelo más popular de la semana y estableció récords de uso en ambas plataformas, con todo ese tráfico servido en chips de IA chinos.

Para los desarrolladores, la parte interesante no es la posición en la clasificación sino el método de validación: tráfico real, agentes de programación reales, un nombre de modelo desconocido y sin tirón de marca. Es una señal más fuerte que una tabla de benchmarks, aunque sigue siendo un despliegue controlado por el proveedor sin metodología publicada.

Multimodal nativo y programación visual

GLM-5.3-Flash es el primer modelo de la serie GLM-5 construido como multimodal desde el principio, y FlashX lo mantiene. Las imágenes se pasan como un bloque de contenido con type: image_url dentro de messages[].content[], usando una URL o una URL de datos Base64, y se pueden combinar varios bloques en un solo mensaje. La entrada de vídeo y archivo está documentada junto a la de imagen y texto.

La capacidad que más importa en la práctica es la programación visual: el modelo inspecciona una interfaz renderizada, la compara con el objetivo e itera. Zhipu documenta flujos de trabajo para reconstruir una aplicación a partir de capturas de pantalla o grabaciones, construir escenas de Blender, producir prototipos de juegos en Godot, ejecutar agentes de navegador y de uso de ordenador, y reproducir piezas de CAD — cada uno con el modelo comprobando su propia salida renderizada en lugar de solo generar código.

El mismo bucle se extiende al trabajo con documentos. Zhipu demuestra entregables en PPTX, PDF, DOCX y XLSX, investigación financiera con fuentes trazables, revisión de contratos con anotaciones registradas y redacción legal, con el modelo renderizando e inspeccionando visualmente su propia salida en busca de desbordamiento, desalineación y estilos inconsistentes.

Un ejemplo que da Zhipu es inusualmente concreto: sin activos externos, GLM-5.3-Flash se ejecutó de forma autónoma durante 16 horas para construir una residencia de chef y cocina de pruebas de aproximadamente 400 m² como escena de Blender.

Precios: cuánto cuesta FlashX

Precios de lista oficiales por 1M de tokens, de las páginas de precios de Zhipu (consultadas el 18 de septiembre de 2026):

Tipo de token GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Entrada (USD) $0,37 $0,15 $1,40
Entrada en caché (USD) $0,075 $0,03 $0,26
Salida (USD) $1,25 $0,50 $4,40

El almacenamiento de entrada en caché figura como gratuito por tiempo limitado en los tres niveles.

Ejemplo de coste. Para 10M de tokens de entrada sin caché y 1M de tokens de salida, los precios de lista dan:

Carga de trabajo GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M de entrada + 1M de salida $4,95 $2,00 $18,40
Mismo volumen, toda la entrada desde caché $2,00 $0,80 $6,60

FlashX es aproximadamente 2,5× Flash en entrada y salida, y sigue muy por debajo de GLM-5.3. Si merece la pena depende enteramente de lo que te cueste un turno lento — para un pipeline por lotes rara vez lo es, y para un agente interactivo a menudo sí.

Cómo invocar GLM-5.3-FlashX

FlashX usa la misma interfaz de chat-completions que Flash, así que migrar es un cambio de una línea.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Para streaming, añade stream: true y tool_stream: true como recomienda Zhipu. Ten en cuenta que el pensamiento no se puede desactivar en este modelo, así que presupuesta tokens de razonamiento en tu estimación de coste y en los timeouts de tu cliente.

Una ruta de migración práctica: mantén configurable el ID del modelo, envía una porción representativa del tráfico de producción tanto a glm-5.3-flash como a glm-5.3-flashx, y compara la tasa de finalización, el tiempo hasta el primer token y el coste por tarea terminada antes de cambiar una carga de trabajo.

Elegir entre FlashX, Flash y GLM-5.3

  • Elige FlashX para productos interactivos, completados en el IDE y bucles de agente con muchos turnos cortos, donde el tiempo de reloj por turno es la restricción y la carga de trabajo aún encaja en la capacidad de la clase Flash.
  • Elige Flash para procesamiento por lotes, generación offline y pipelines de alto volumen donde el coste por tarea importa más que la latencia — y para despliegues con pesos abiertos o autoalojados, ya que Flash es el nivel con pesos publicados.
  • Elige GLM-5.3 cuando necesites el techo del buque insignia en lugar del perfil de coste del nivel Flash.
  • No asumas que la ganancia de velocidad se aplica de forma uniforme. Las solicitudes con mucho prefill y contexto largo y los turnos de agente limitados por herramientas pueden ver mucho menos beneficio que las tareas de generación cortas. Mide la carga de trabajo que realmente ejecutas.

Empieza con la familia GLM en APIMaster.ai

APIMaster te da una única clave compatible con OpenAI para la familia GLM junto a Claude, GPT, DeepSeek, Qwen, Gemini, Kimi y otros modelos — con precios de pago por uso desde $1 y hasta un 70% de descuento sobre las tarifas oficiales en rutas seleccionadas.

Como FlashX mantiene el mismo formato de solicitud que Flash, los equipos que ya llaman a GLM a través de APIMaster pueden evaluar el nivel más rápido sin tocar su integración más allá del ID del modelo.

  1. Crea una cuenta de APIMaster.
  2. Añade crédito de pago por uso, desde $1.
  3. Crea una clave de API en la consola de APIMaster.
  4. Apunta tu cliente compatible con OpenAI a https://apimaster.ai/v1 y establece el ID de modelo que quieras evaluar.

Regístrate en APIMaster · Explora el marketplace de modelos · Prueba la identidad del modelo

FAQ

¿Es GLM-5.3-FlashX un modelo nuevo? No. Es el nivel de servicio de alta velocidad de GLM-5.3-Flash. Mismo modelo, misma ventana de contexto, misma entrada multimodal — una configuración de inferencia más rápida y un precio diferente.

¿Cuál es el ID de modelo de GLM-5.3-FlashX? glm-5.3-flashx. El nivel estándar es glm-5.3-flash.

¿Qué tan rápido es GLM-5.3-FlashX? Zhipu publica un máximo de 200 tokens/s. Es una cifra máxima; mide el tiempo hasta el primer token y el rendimiento sostenido con tus propios prompts.

¿Cuánto cuesta GLM-5.3-FlashX? Zhipu indica $0,37 por 1M de tokens de entrada, $1,25 por 1M de tokens de salida y $0,075 por 1M de tokens de entrada en caché — aproximadamente 2,5× el precio de GLM-5.3-Flash en entrada y salida.

¿Cuál es la ventana de contexto? 1M de tokens, con hasta 128.000 tokens de salida, lo mismo que GLM-5.3-Flash.

¿Puede GLM-5.3-FlashX aceptar imágenes y vídeo? Sí. Acepta entrada de vídeo, imagen, texto y archivo y devuelve texto. Las imágenes se envían como un bloque de contenido image_url, por URL o URL de datos Base64.

¿Está GLM-5.3-FlashX en el GLM Coding Plan? No en el lanzamiento. GLM-5.3-Flash está totalmente disponible en el plan con 3× la cuota de GLM-5.3, y las llamadas fuera de horas punta, incluido todo el fin de semana, consumen el 50% de los puntos estándar.

¿Puedo desactivar el pensamiento para ahorrar tokens? No. thinking.type solo admite enabled. Zhipu recomienda conservar el historial de pensamiento (clear_thinking: false) para trabajo multiturno.

¿Son independientes las cifras de los benchmarks? No. Están publicadas por Zhipu. Trátalas como orientativas y vuelve a ejecutar tu propia evaluación antes de comprometer tráfico de producción.

Fuentes y lecturas adicionales

Todas las fuentes consultadas el 18 de septiembre de 2026. Los precios y la disponibilidad cambian; verifica los términos actuales antes de comprometer una carga de trabajo grande.