GLM-5.3-FlashX: что это, как быстро он работает и сколько стоит
GLM-5.3-FlashX — это высокоскоростной уровень обслуживания GLM-5.3-Flash от Zhipu, запущенный 18 сентября 2026 года со скоростью до 200 токенов/с. Здесь приведены подтверждённый ID модели, цены, размер контекстного окна, бенчмарки и способы вызова.
Published 2026-09-18
GLM-5.3-FlashX — это высокоскоростной уровень обслуживания GLM-5.3-Flash от Zhipu, выпущенный 18 сентября 2026 года с заявленной пиковой скоростью инференса 200 токенов/с. Это не новая модель: это та же система GLM-5.3-Flash — 320B общих параметров при 18B активируемых, контекстное окно 1M токенов, до 128 000 выходных токенов и нативный ввод изображений, видео, файлов и текста — обслуживаемая через более быструю конфигурацию инференса.
ID модели в API — glm-5.3-flashx, и он стоит рядом с glm-5.3-flash. Компромисс прост: FlashX стоит дороже за токен, чем Flash (Zhipu указывает $0.37 за ввод / $1.25 за вывод за 1M токенов против $0.15 / $0.50 для Flash), но возвращает ответы быстрее. Flash — это также уровень с открытыми весами и тот, что включён в GLM Coding Plan, где Flash получает 3× квоту GLM-5.3.
Если вам нужна пропускная способность, интерактивная задержка или агентный цикл с множеством коротких ходов, FlashX — это уровень, созданный для этого. Если вы оптимизируете стоимость за выполненную задачу и можете подождать, Flash дешевле для идентичной работы.
Что такое GLM-5.3-FlashX?
GLM-5.3-FlashX — это оптимизированная по скорости конечная точка семейства GLM-5.3-Flash. Zhipu анонсировала её 18 сентября 2026 года, описав как более быструю и плавную для предприятий и разработчиков, при этом API и официальный центр опыта были открыты при запуске.
Стоит разделить две вещи:
- Модель — GLM-5.3-Flash, нативная мультимодальная модель 320B-A18B, которую Zhipu открыла 26 августа 2026 года. Архитектура, веса, длина контекста и возможности общие.
- Уровень обслуживания — FlashX, конфигурация инференса, настроенная на пропускную способность. Zhipu сообщает о скоростях до 200 токенов/с и объясняет прирост инфраструктурной работой, а не другим чекпоинтом.
Это различие важно при оценке. Бенчмарки, ограничения контекста и мультимодальное поведение, описанные для GLM-5.3-Flash, применимы к FlashX, потому что это одна и та же модель. Задержка и цена — нет: они меняются в зависимости от уровня обслуживания.
Характеристики модели
| Характеристика | GLM-5.3-FlashX |
|---|---|
| ID модели в API | glm-5.3-flashx |
| ID родственной модели | glm-5.3-flash |
| Дата выпуска | 18 сентября 2026 года |
| Общие / активируемые параметры | 320B / 18B |
| Слои | 45 |
| Контекстное окно | 1M токенов |
| Максимум выходных токенов | 128K |
| Входные модальности | Видео, изображение, текст, файл |
| Выходная модальность | Текст |
| Заявленная пиковая скорость | 200 токенов/с |
| Режим мышления | Только thinking.type: enabled; его нельзя отключить |
| Ключевые возможности API | Стриминг, вызов функций, кэширование контекста, структурированный вывод, стриминг инструментов |
Zhipu рекомендует temperature: 1, top_p: 0.95 и reasoning_effort: max. Для многоходовой работы рекомендуется сохранять историю мышления, а не очищать её (clear_thinking: false), а для стриминговых запросов — включать одновременно stream: true и tool_stream: true.
GLM-5.3-FlashX против GLM-5.3-Flash
| Измерение | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| Базовая модель | GLM-5.3-Flash | GLM-5.3-Flash |
| Заявленная пиковая скорость | Стандартный уровень | До 200 токенов/с |
| Прайс-лист за ввод / 1M | $0.15 | $0.37 |
| Прайс-лист за вывод / 1M | $0.50 | $1.25 |
| Ограничения контекста и вывода | 1M / 128K | 1M / 128K |
| Мультимодальный ввод | Да | Да |
| Открытые веса | Да, с 26 августа 2026 года | Та же базовая модель |
| GLM Coding Plan | Включён, с 3× квотой GLM-5.3 | Не включён при запуске |
Формат запроса идентичен. Переход с одного уровня на другой — это изменение поля model, а не переписывание интеграции, что делает FlashX разумным кандидатом для A/B-тестирования рабочих нагрузок, где время на ход является узким местом.
Что «200 токенов/с» говорит и чего не говорит
Zhipu публикует 200 токенов/с как максимум. Читайте это как потолок скорости генерации, а не как обещание о вашей рабочей нагрузке:
- Это пиковое значение. Реальная пропускная способность зависит от длины промпта, попаданий в кэш, параллелизма и выбранного провайдера.
- Это не время до первого токена. Быстрая скорость декодирования всё равно ощущается медленной, если модель думает несколько секунд, прежде чем что-то выдать. Для интерактивных продуктов измеряйте оба показателя.
- Это не общая задержка задачи. Агентный ход, вызывающий три инструмента, ограничен выполнением инструментов, а не скоростью токенов.
- Длинный контекст меняет картину. При 1M токенов доминируют префилл и поведение KV-кэша. Именно на это нацелена архитектура Flash.
Практическое правило: тестируйте Flash и FlashX на своих промптах и сравнивайте время до первого токена, выходные токены в секунду и стоимость за выполненную задачу, а не одно число скорости.
Откуда берётся скорость
Zhipu объясняет ускорение FlashX инфраструктурными инвестициями, а не новой архитектурой, построенными поверх 100 000 отечественных AI-ускорителей, уже обслуживающих трафик GLM-5.3-Flash.
- Выделенный движок инференса на SGLang, написанный для этой архитектуры, а не адаптированный из универсального стека.
- Оптимизация памяти для контекстов в 1M токенов, включая ReplaySSM, квантизацию W8A8, гибридную квантизацию кэша INT8/FP8/BF16 и Layer Split.
- Дезагрегированная архитектура обслуживания Encode–Prefill–Decode (EPD), которая разделяет мультимодальное кодирование, префилл промпта и пошаговое декодирование на независимо планируемые пулы воркеров, так что каждая стадия масштабируется самостоятельно.
- 3-кратное улучшение сквозного обслуживания по сравнению с исходным базовым уровнем на том же оборудовании, что, по словам Zhipu, доводит стоимость за токен до уровня, сопоставимого с мейнстримными GPU NVIDIA.
Одна деталь из этой работы заслуживает отдельного упоминания: Zhipu говорит, что инфраструктурный агент на базе GLM-5.3 помог инженерам оптимизировать ядра, диагностировать узкие места и улучшить стек обслуживания — модель участвовала в системе, которая её обслуживает.
Бенчмарки: что Zhipu сообщает для базовой модели
Все следующие числа опубликованы Zhipu для GLM-5.3-Flash и применимы к FlashX, поскольку модель одна и та же. Это результаты, заявленные вендором, а не независимые воспроизведения.
| Бенчмарк | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0, max effort | 29.0 | Claude Opus 4.8: 29.5 |
Zhipu также сообщает, что GLM-5.3-Flash набирает 57 в Artificial Analysis Intelligence Index v4.1.1 при $0.045 за задачу по своей дисконтированной цене — уровень, который, по её словам, ранее был доступен только примерно за 10× стоимость — и что его производительность в кодинге сопоставима с Claude Opus 4.8 на внутреннем Z.ai Code Bench компании.
Относитесь к этому как к ориентиру, а не гарантии. Вендорские бенчмарки обычно прогоняются на выгодных вендору версиях харнесса; строка Z.ai Code Bench выше была измерена на Claude Code 2.1.207. Перезапустите собственную оценку, прежде чем переводить продакшн-трафик.
Архитектура: почему уровень Flash дёшев в эксплуатации
FlashX наследует дизайн, который сделал Flash недорогим в обслуживании, — именно поэтому более быстрый уровень может существовать без скачка цены до флагманских значений.
- Гибридное разреженное и линейное внимание. Zhipu описывает это как первую открытую фронтирную модель, объединяющую оба подхода. Линейное внимание улавливает локальные зависимости через моделирование состояния; разреженное внимание извлекает релевантный глобальный контекст через лёгкий индексатор.
- IndexPool. Четыре ключевых вектора индексатора сжимаются в один с помощью взвешенного пулинга, что снижает задержку и накладные расходы памяти индексатора при контексте в 1M токенов.
- Manifold-Constrained Hyper-Connections (mHC) для лучшей эффективности масштабирования.
- Более низкая стоимость за токен, чем у GLM-5.3. Zhipu сообщает о в 3.01× меньших вычислениях внимания и в 4.44× меньшем KV-кэше, чем у GLM-5.3. По сравнению с GLM-5.3 количество активируемых параметров падает с 32B до 18B, а слоёв — с 92 до 45.
- Мультимодальный корпус предобучения на 30 триллионов токенов.
Zhipu откровенно признаёт, что KV-кэш всё ещё немного больше, чем у Kimi-K3 и DeepSeek-V4-Flash, и называет это направлением для будущей работы — полезное напоминание о том, что сравнения архитектур ведутся по измерениям, а не по единому рейтингу.
Ox-Alpha: анонимная модель, тестировавшаяся публично
Перед запуском Flash Zhipu запустила GLM-5.3-Flash анонимно как Ox-Alpha на OpenCode и OpenRouter. По словам Zhipu, она стала самой популярной моделью недели и установила рекорды использования на обеих платформах, причём весь этот трафик обслуживался на китайских AI-чипах.
Для разработчиков интересна не позиция в таблице лидеров, а метод валидации: реальный трафик, реальные кодинг-агенты, неизвестное имя модели и никакого притяжения бренда. Это более сильный сигнал, чем таблица бенчмарков, хотя всё же это контролируемый вендором запуск без опубликованной методологии.
Нативная мультимодальность и визуальное кодирование
GLM-5.3-Flash — первая модель серии GLM-5, изначально построенная как мультимодальная, и FlashX это сохраняет. Изображения передаются как блок содержимого с type: image_url внутри messages[].content[], используя либо URL, либо Base64 data URL, и несколько блоков можно объединить в одном сообщении. Ввод видео и файлов документирован наряду с изображением и текстом.
Возможность, которая важнее всего на практике, — визуальное кодирование: модель изучает отрендеренный интерфейс, сравнивает его с целевым и итерирует. Zhipu документирует рабочие процессы для воссоздания приложения по скриншотам или записям, построения сцен Blender, создания прототипов игр на Godot, запуска браузерных агентов и агентов компьютерного использования, а также воспроизведения CAD-деталей — каждый с проверкой моделью собственного отрендеренного вывода, а не только генерацией кода.
Тот же цикл распространяется на работу с документами. Zhipu демонстрирует результаты в PPTX, PDF, DOCX и XLSX, финансовые исследования с прослеживаемыми источниками, проверку контрактов с отслеживаемыми аннотациями и юридическое drafting, при этом модель рендерит и визуально проверяет собственный вывод на переполнение, смещение и несогласованность стилей.
Один пример Zhipu необычно конкретен: без внешних ресурсов GLM-5.3-Flash автономно работала 16 часов, чтобы построить в виде сцены Blender резиденцию шеф-повара площадью примерно 400 м² с тестовой кухней.
Цены: сколько стоит FlashX
Официальные прайс-листы за 1M токенов, со страниц цен Zhipu (проверено 18 сентября 2026 года):
| Тип токенов | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Ввод (USD) | $0.37 | $0.15 | $1.40 |
| Кэшированный ввод (USD) | $0.075 | $0.03 | $0.26 |
| Вывод (USD) | $1.25 | $0.50 | $4.40 |
Хранение кэшированного ввода указано как бесплатное на ограниченное время для всех трёх уровней.
Пример стоимости. Для 10M некэшированных входных токенов и 1M выходных токенов прайс-листы дают:
| Рабочая нагрузка | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M ввод + 1M вывод | $4.95 | $2.00 | $18.40 |
| Тот же объём, весь ввод из кэша | $2.00 | $0.80 | $6.60 |
FlashX примерно в 2.5× дороже Flash по вводу и выводу и всё ещё значительно ниже GLM-5.3. Стоит ли это того, полностью зависит от того, сколько вам стоит медленный ход — для пакетного конвейера это редко так, а для интерактивного агента часто так.
Как вызывать GLM-5.3-FlashX
FlashX использует тот же интерфейс chat-completions, что и Flash, поэтому миграция — это изменение одной строки.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
Для стриминга добавьте stream: true и tool_stream: true, как рекомендует Zhipu. Учтите, что мышление на этой модели нельзя отключить, поэтому закладывайте токены рассуждений в оценку стоимости и в таймауты клиента.
Практический путь миграции: держите ID модели настраиваемым, отправьте репрезентативный срез продакшн-трафика и в glm-5.3-flash, и в glm-5.3-flashx, и сравните долю завершений, время до первого токена и стоимость за завершённую задачу, прежде чем переключать рабочую нагрузку.
Выбор между FlashX, Flash и GLM-5.3
- Выбирайте FlashX для интерактивных продуктов, дополнений в IDE и агентных циклов с множеством коротких ходов, где ограничением является реальное время на ход, а рабочая нагрузка всё ещё укладывается в возможности класса Flash.
- Выбирайте Flash для пакетной обработки, офлайн-генерации и высокообъёмных конвейеров, где стоимость за задачу важнее задержки — а также для развёртываний с открытыми весами или самостоятельно размещённых, поскольку Flash — это уровень с опубликованными весами.
- Выбирайте GLM-5.3, когда вам нужен потолок флагмана, а не ценовой профиль уровня Flash.
- Не предполагайте, что выигрыш в скорости применяется равномерно. Запросы с тяжёлым префиллом и длинным контекстом, а также агентные ходы, ограниченные инструментами, могут получить гораздо меньше выгоды, чем короткие задачи генерации. Измеряйте ту рабочую нагрузку, которую вы действительно запускаете.
Начните работу с семейством GLM на APIMaster.ai
APIMaster даёт вам один ключ, совместимый с OpenAI, для семейства GLM наряду с Claude, GPT, DeepSeek, Qwen, Gemini, Kimi и другими моделями — с оплатой по мере использования от $1 и скидками до 70% от официальных тарифов на отдельных маршрутах.
Поскольку FlashX сохраняет тот же формат запроса, что и Flash, команды, уже вызывающие GLM через APIMaster, могут оценить более быстрый уровень, не трогая свою интеграцию дальше ID модели.
- Создайте аккаунт APIMaster.
- Пополните баланс для оплаты по мере использования, начиная с $1.
- Создайте API-ключ в консоли APIMaster.
- Направьте ваш OpenAI-совместимый клиент на
https://apimaster.ai/v1и задайте ID модели, которую хотите оценить.
Зарегистрируйтесь в APIMaster · Изучите маркетплейс моделей · Проверьте идентичность модели
FAQ
Является ли GLM-5.3-FlashX новой моделью? Нет. Это высокоскоростной уровень обслуживания GLM-5.3-Flash. Та же модель, то же контекстное окно, тот же мультимодальный ввод — более быстрая конфигурация инференса и другая цена.
Каков ID модели GLM-5.3-FlashX?
glm-5.3-flashx. Стандартный уровень — glm-5.3-flash.
Насколько быстр GLM-5.3-FlashX? Zhipu публикует максимум 200 токенов/с. Это пиковое значение; измеряйте время до первого токена и устойчивую пропускную способность на своих промптах.
Сколько стоит GLM-5.3-FlashX? Zhipu указывает $0.37 за 1M входных токенов, $1.25 за 1M выходных токенов и $0.075 за 1M кэшированных входных токенов — примерно в 2.5× дороже GLM-5.3-Flash по вводу и выводу.
Каково контекстное окно? 1M токенов, с до 128 000 выходных токенов — столько же, сколько у GLM-5.3-Flash.
Может ли GLM-5.3-FlashX принимать изображения и видео?
Да. Он принимает ввод видео, изображений, текста и файлов и возвращает текст. Изображения отправляются как блок содержимого image_url, по URL или Base64 data URL.
Входит ли GLM-5.3-FlashX в GLM Coding Plan? При запуске — нет. GLM-5.3-Flash полностью доступна в плане с 3× квотой GLM-5.3, а вызовы в непиковые часы, включая все выходные, потребляют 50% стандартных баллов.
Можно ли отключить мышление, чтобы сэкономить токены?
Нет. thinking.type поддерживает только enabled. Zhipu рекомендует сохранять историю мышления (clear_thinking: false) для многоходовой работы.
Являются ли числа бенчмарков независимыми? Нет. Они опубликованы Zhipu. Относитесь к ним как к ориентиру и перезапустите собственную оценку, прежде чем направлять продакшн-трафик.
Источники и дополнительное чтение
- Z.ai — документация моделей GLM-5.3-Flash/FlashX — ID моделей, параметры, возможности, рекомендуемые настройки, бенчмарки и детали обслуживания
- Z.ai — Цены — официальные прайс-листы за 1M токенов
- Z.ai — технический блог GLM-5.3-Flash — архитектура, сравнения эффективности и таблицы оценки
- Hugging Face — zai-org/GLM-5.3-Flash — открытые веса базовой модели
- PANews — Zhipu запускает GLM-5.3-FlashX — отчёт о запуске и предыстория Ox-Alpha
Все источники проверены 18 сентября 2026 года. Цены и доступность меняются; проверяйте текущие условия, прежде чем брать на себя большую рабочую нагрузку.