APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: что это, как быстро он работает и сколько стоит

GLM-5.3-FlashX — это высокоскоростной уровень обслуживания GLM-5.3-Flash от Zhipu, запущенный 18 сентября 2026 года со скоростью до 200 токенов/с. Здесь приведены подтверждённый ID модели, цены, размер контекстного окна, бенчмарки и способы вызова.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX — это высокоскоростной уровень обслуживания GLM-5.3-Flash от Zhipu, выпущенный 18 сентября 2026 года с заявленной пиковой скоростью инференса 200 токенов/с. Это не новая модель: это та же система GLM-5.3-Flash — 320B общих параметров при 18B активируемых, контекстное окно 1M токенов, до 128 000 выходных токенов и нативный ввод изображений, видео, файлов и текста — обслуживаемая через более быструю конфигурацию инференса.

ID модели в API — glm-5.3-flashx, и он стоит рядом с glm-5.3-flash. Компромисс прост: FlashX стоит дороже за токен, чем Flash (Zhipu указывает $0.37 за ввод / $1.25 за вывод за 1M токенов против $0.15 / $0.50 для Flash), но возвращает ответы быстрее. Flash — это также уровень с открытыми весами и тот, что включён в GLM Coding Plan, где Flash получает 3× квоту GLM-5.3.

Если вам нужна пропускная способность, интерактивная задержка или агентный цикл с множеством коротких ходов, FlashX — это уровень, созданный для этого. Если вы оптимизируете стоимость за выполненную задачу и можете подождать, Flash дешевле для идентичной работы.

Что такое GLM-5.3-FlashX?

GLM-5.3-FlashX — это оптимизированная по скорости конечная точка семейства GLM-5.3-Flash. Zhipu анонсировала её 18 сентября 2026 года, описав как более быструю и плавную для предприятий и разработчиков, при этом API и официальный центр опыта были открыты при запуске.

Стоит разделить две вещи:

  • Модель — GLM-5.3-Flash, нативная мультимодальная модель 320B-A18B, которую Zhipu открыла 26 августа 2026 года. Архитектура, веса, длина контекста и возможности общие.
  • Уровень обслуживания — FlashX, конфигурация инференса, настроенная на пропускную способность. Zhipu сообщает о скоростях до 200 токенов/с и объясняет прирост инфраструктурной работой, а не другим чекпоинтом.

Это различие важно при оценке. Бенчмарки, ограничения контекста и мультимодальное поведение, описанные для GLM-5.3-Flash, применимы к FlashX, потому что это одна и та же модель. Задержка и цена — нет: они меняются в зависимости от уровня обслуживания.

Характеристики модели

Характеристика GLM-5.3-FlashX
ID модели в API glm-5.3-flashx
ID родственной модели glm-5.3-flash
Дата выпуска 18 сентября 2026 года
Общие / активируемые параметры 320B / 18B
Слои 45
Контекстное окно 1M токенов
Максимум выходных токенов 128K
Входные модальности Видео, изображение, текст, файл
Выходная модальность Текст
Заявленная пиковая скорость 200 токенов/с
Режим мышления Только thinking.type: enabled; его нельзя отключить
Ключевые возможности API Стриминг, вызов функций, кэширование контекста, структурированный вывод, стриминг инструментов

Zhipu рекомендует temperature: 1, top_p: 0.95 и reasoning_effort: max. Для многоходовой работы рекомендуется сохранять историю мышления, а не очищать её (clear_thinking: false), а для стриминговых запросов — включать одновременно stream: true и tool_stream: true.

GLM-5.3-FlashX против GLM-5.3-Flash

Измерение GLM-5.3-Flash GLM-5.3-FlashX
Базовая модель GLM-5.3-Flash GLM-5.3-Flash
Заявленная пиковая скорость Стандартный уровень До 200 токенов/с
Прайс-лист за ввод / 1M $0.15 $0.37
Прайс-лист за вывод / 1M $0.50 $1.25
Ограничения контекста и вывода 1M / 128K 1M / 128K
Мультимодальный ввод Да Да
Открытые веса Да, с 26 августа 2026 года Та же базовая модель
GLM Coding Plan Включён, с 3× квотой GLM-5.3 Не включён при запуске

Формат запроса идентичен. Переход с одного уровня на другой — это изменение поля model, а не переписывание интеграции, что делает FlashX разумным кандидатом для A/B-тестирования рабочих нагрузок, где время на ход является узким местом.

Что «200 токенов/с» говорит и чего не говорит

Zhipu публикует 200 токенов/с как максимум. Читайте это как потолок скорости генерации, а не как обещание о вашей рабочей нагрузке:

  • Это пиковое значение. Реальная пропускная способность зависит от длины промпта, попаданий в кэш, параллелизма и выбранного провайдера.
  • Это не время до первого токена. Быстрая скорость декодирования всё равно ощущается медленной, если модель думает несколько секунд, прежде чем что-то выдать. Для интерактивных продуктов измеряйте оба показателя.
  • Это не общая задержка задачи. Агентный ход, вызывающий три инструмента, ограничен выполнением инструментов, а не скоростью токенов.
  • Длинный контекст меняет картину. При 1M токенов доминируют префилл и поведение KV-кэша. Именно на это нацелена архитектура Flash.

Практическое правило: тестируйте Flash и FlashX на своих промптах и сравнивайте время до первого токена, выходные токены в секунду и стоимость за выполненную задачу, а не одно число скорости.

Откуда берётся скорость

Zhipu объясняет ускорение FlashX инфраструктурными инвестициями, а не новой архитектурой, построенными поверх 100 000 отечественных AI-ускорителей, уже обслуживающих трафик GLM-5.3-Flash.

  • Выделенный движок инференса на SGLang, написанный для этой архитектуры, а не адаптированный из универсального стека.
  • Оптимизация памяти для контекстов в 1M токенов, включая ReplaySSM, квантизацию W8A8, гибридную квантизацию кэша INT8/FP8/BF16 и Layer Split.
  • Дезагрегированная архитектура обслуживания Encode–Prefill–Decode (EPD), которая разделяет мультимодальное кодирование, префилл промпта и пошаговое декодирование на независимо планируемые пулы воркеров, так что каждая стадия масштабируется самостоятельно.
  • 3-кратное улучшение сквозного обслуживания по сравнению с исходным базовым уровнем на том же оборудовании, что, по словам Zhipu, доводит стоимость за токен до уровня, сопоставимого с мейнстримными GPU NVIDIA.

Одна деталь из этой работы заслуживает отдельного упоминания: Zhipu говорит, что инфраструктурный агент на базе GLM-5.3 помог инженерам оптимизировать ядра, диагностировать узкие места и улучшить стек обслуживания — модель участвовала в системе, которая её обслуживает.

Бенчмарки: что Zhipu сообщает для базовой модели

Все следующие числа опубликованы Zhipu для GLM-5.3-Flash и применимы к FlashX, поскольку модель одна и та же. Это результаты, заявленные вендором, а не независимые воспроизведения.

Бенчмарк GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63.4 46.2
AutomationBench 48.8 26.2
Z.ai Code Bench v1.0, max effort 29.0 Claude Opus 4.8: 29.5

Zhipu также сообщает, что GLM-5.3-Flash набирает 57 в Artificial Analysis Intelligence Index v4.1.1 при $0.045 за задачу по своей дисконтированной цене — уровень, который, по её словам, ранее был доступен только примерно за 10× стоимость — и что его производительность в кодинге сопоставима с Claude Opus 4.8 на внутреннем Z.ai Code Bench компании.

Относитесь к этому как к ориентиру, а не гарантии. Вендорские бенчмарки обычно прогоняются на выгодных вендору версиях харнесса; строка Z.ai Code Bench выше была измерена на Claude Code 2.1.207. Перезапустите собственную оценку, прежде чем переводить продакшн-трафик.

Архитектура: почему уровень Flash дёшев в эксплуатации

FlashX наследует дизайн, который сделал Flash недорогим в обслуживании, — именно поэтому более быстрый уровень может существовать без скачка цены до флагманских значений.

  • Гибридное разреженное и линейное внимание. Zhipu описывает это как первую открытую фронтирную модель, объединяющую оба подхода. Линейное внимание улавливает локальные зависимости через моделирование состояния; разреженное внимание извлекает релевантный глобальный контекст через лёгкий индексатор.
  • IndexPool. Четыре ключевых вектора индексатора сжимаются в один с помощью взвешенного пулинга, что снижает задержку и накладные расходы памяти индексатора при контексте в 1M токенов.
  • Manifold-Constrained Hyper-Connections (mHC) для лучшей эффективности масштабирования.
  • Более низкая стоимость за токен, чем у GLM-5.3. Zhipu сообщает о в 3.01× меньших вычислениях внимания и в 4.44× меньшем KV-кэше, чем у GLM-5.3. По сравнению с GLM-5.3 количество активируемых параметров падает с 32B до 18B, а слоёв — с 92 до 45.
  • Мультимодальный корпус предобучения на 30 триллионов токенов.

Zhipu откровенно признаёт, что KV-кэш всё ещё немного больше, чем у Kimi-K3 и DeepSeek-V4-Flash, и называет это направлением для будущей работы — полезное напоминание о том, что сравнения архитектур ведутся по измерениям, а не по единому рейтингу.

Ox-Alpha: анонимная модель, тестировавшаяся публично

Перед запуском Flash Zhipu запустила GLM-5.3-Flash анонимно как Ox-Alpha на OpenCode и OpenRouter. По словам Zhipu, она стала самой популярной моделью недели и установила рекорды использования на обеих платформах, причём весь этот трафик обслуживался на китайских AI-чипах.

Для разработчиков интересна не позиция в таблице лидеров, а метод валидации: реальный трафик, реальные кодинг-агенты, неизвестное имя модели и никакого притяжения бренда. Это более сильный сигнал, чем таблица бенчмарков, хотя всё же это контролируемый вендором запуск без опубликованной методологии.

Нативная мультимодальность и визуальное кодирование

GLM-5.3-Flash — первая модель серии GLM-5, изначально построенная как мультимодальная, и FlashX это сохраняет. Изображения передаются как блок содержимого с type: image_url внутри messages[].content[], используя либо URL, либо Base64 data URL, и несколько блоков можно объединить в одном сообщении. Ввод видео и файлов документирован наряду с изображением и текстом.

Возможность, которая важнее всего на практике, — визуальное кодирование: модель изучает отрендеренный интерфейс, сравнивает его с целевым и итерирует. Zhipu документирует рабочие процессы для воссоздания приложения по скриншотам или записям, построения сцен Blender, создания прототипов игр на Godot, запуска браузерных агентов и агентов компьютерного использования, а также воспроизведения CAD-деталей — каждый с проверкой моделью собственного отрендеренного вывода, а не только генерацией кода.

Тот же цикл распространяется на работу с документами. Zhipu демонстрирует результаты в PPTX, PDF, DOCX и XLSX, финансовые исследования с прослеживаемыми источниками, проверку контрактов с отслеживаемыми аннотациями и юридическое drafting, при этом модель рендерит и визуально проверяет собственный вывод на переполнение, смещение и несогласованность стилей.

Один пример Zhipu необычно конкретен: без внешних ресурсов GLM-5.3-Flash автономно работала 16 часов, чтобы построить в виде сцены Blender резиденцию шеф-повара площадью примерно 400 м² с тестовой кухней.

Цены: сколько стоит FlashX

Официальные прайс-листы за 1M токенов, со страниц цен Zhipu (проверено 18 сентября 2026 года):

Тип токенов GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Ввод (USD) $0.37 $0.15 $1.40
Кэшированный ввод (USD) $0.075 $0.03 $0.26
Вывод (USD) $1.25 $0.50 $4.40

Хранение кэшированного ввода указано как бесплатное на ограниченное время для всех трёх уровней.

Пример стоимости. Для 10M некэшированных входных токенов и 1M выходных токенов прайс-листы дают:

Рабочая нагрузка GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M ввод + 1M вывод $4.95 $2.00 $18.40
Тот же объём, весь ввод из кэша $2.00 $0.80 $6.60

FlashX примерно в 2.5× дороже Flash по вводу и выводу и всё ещё значительно ниже GLM-5.3. Стоит ли это того, полностью зависит от того, сколько вам стоит медленный ход — для пакетного конвейера это редко так, а для интерактивного агента часто так.

Как вызывать GLM-5.3-FlashX

FlashX использует тот же интерфейс chat-completions, что и Flash, поэтому миграция — это изменение одной строки.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Для стриминга добавьте stream: true и tool_stream: true, как рекомендует Zhipu. Учтите, что мышление на этой модели нельзя отключить, поэтому закладывайте токены рассуждений в оценку стоимости и в таймауты клиента.

Практический путь миграции: держите ID модели настраиваемым, отправьте репрезентативный срез продакшн-трафика и в glm-5.3-flash, и в glm-5.3-flashx, и сравните долю завершений, время до первого токена и стоимость за завершённую задачу, прежде чем переключать рабочую нагрузку.

Выбор между FlashX, Flash и GLM-5.3

  • Выбирайте FlashX для интерактивных продуктов, дополнений в IDE и агентных циклов с множеством коротких ходов, где ограничением является реальное время на ход, а рабочая нагрузка всё ещё укладывается в возможности класса Flash.
  • Выбирайте Flash для пакетной обработки, офлайн-генерации и высокообъёмных конвейеров, где стоимость за задачу важнее задержки — а также для развёртываний с открытыми весами или самостоятельно размещённых, поскольку Flash — это уровень с опубликованными весами.
  • Выбирайте GLM-5.3, когда вам нужен потолок флагмана, а не ценовой профиль уровня Flash.
  • Не предполагайте, что выигрыш в скорости применяется равномерно. Запросы с тяжёлым префиллом и длинным контекстом, а также агентные ходы, ограниченные инструментами, могут получить гораздо меньше выгоды, чем короткие задачи генерации. Измеряйте ту рабочую нагрузку, которую вы действительно запускаете.

Начните работу с семейством GLM на APIMaster.ai

APIMaster даёт вам один ключ, совместимый с OpenAI, для семейства GLM наряду с Claude, GPT, DeepSeek, Qwen, Gemini, Kimi и другими моделями — с оплатой по мере использования от $1 и скидками до 70% от официальных тарифов на отдельных маршрутах.

Поскольку FlashX сохраняет тот же формат запроса, что и Flash, команды, уже вызывающие GLM через APIMaster, могут оценить более быстрый уровень, не трогая свою интеграцию дальше ID модели.

  1. Создайте аккаунт APIMaster.
  2. Пополните баланс для оплаты по мере использования, начиная с $1.
  3. Создайте API-ключ в консоли APIMaster.
  4. Направьте ваш OpenAI-совместимый клиент на https://apimaster.ai/v1 и задайте ID модели, которую хотите оценить.

Зарегистрируйтесь в APIMaster · Изучите маркетплейс моделей · Проверьте идентичность модели

FAQ

Является ли GLM-5.3-FlashX новой моделью? Нет. Это высокоскоростной уровень обслуживания GLM-5.3-Flash. Та же модель, то же контекстное окно, тот же мультимодальный ввод — более быстрая конфигурация инференса и другая цена.

Каков ID модели GLM-5.3-FlashX? glm-5.3-flashx. Стандартный уровень — glm-5.3-flash.

Насколько быстр GLM-5.3-FlashX? Zhipu публикует максимум 200 токенов/с. Это пиковое значение; измеряйте время до первого токена и устойчивую пропускную способность на своих промптах.

Сколько стоит GLM-5.3-FlashX? Zhipu указывает $0.37 за 1M входных токенов, $1.25 за 1M выходных токенов и $0.075 за 1M кэшированных входных токенов — примерно в 2.5× дороже GLM-5.3-Flash по вводу и выводу.

Каково контекстное окно? 1M токенов, с до 128 000 выходных токенов — столько же, сколько у GLM-5.3-Flash.

Может ли GLM-5.3-FlashX принимать изображения и видео? Да. Он принимает ввод видео, изображений, текста и файлов и возвращает текст. Изображения отправляются как блок содержимого image_url, по URL или Base64 data URL.

Входит ли GLM-5.3-FlashX в GLM Coding Plan? При запуске — нет. GLM-5.3-Flash полностью доступна в плане с 3× квотой GLM-5.3, а вызовы в непиковые часы, включая все выходные, потребляют 50% стандартных баллов.

Можно ли отключить мышление, чтобы сэкономить токены? Нет. thinking.type поддерживает только enabled. Zhipu рекомендует сохранять историю мышления (clear_thinking: false) для многоходовой работы.

Являются ли числа бенчмарков независимыми? Нет. Они опубликованы Zhipu. Относитесь к ним как к ориентиру и перезапустите собственную оценку, прежде чем направлять продакшн-трафик.

Источники и дополнительное чтение

Все источники проверены 18 сентября 2026 года. Цены и доступность меняются; проверяйте текущие условия, прежде чем брать на себя большую рабочую нагрузку.