GLM-5.3-FlashX: що це таке, як швидко він працює та скільки коштує
GLM-5.3-FlashX — це високошвидкісний рівень обслуговування GLM-5.3-Flash від Zhipu, запущений 18 вересня 2026 року зі швидкістю до 200 токенів/с. Ось підтверджений ID моделі, ціни, вікно контексту, бенчмарки та способи виклику.
Published 2026-09-18
GLM-5.3-FlashX — це високошвидкісний рівень обслуговування GLM-5.3-Flash від Zhipu, випущений 18 вересня 2026 року з опублікованою піковою швидкістю інференсу 200 токенів/с. Це не нова модель: це та сама система GLM-5.3-Flash — 320B загальних параметрів з 18B активованих, вікно контексту на 1M токенів, до 128 000 вихідних токенів і нативний ввід зображень, відео, файлів та тексту — що обслуговується через швидшу конфігурацію інференсу.
ID моделі API — glm-5.3-flashx, і він стоїть поруч із glm-5.3-flash. Компроміс прямолінійний: FlashX коштує більше за токен, ніж Flash (Zhipu вказує $0.37 за ввід / $1.25 за вивід за 1M токенів проти $0.15 / $0.50 для Flash) і повертає швидші відповіді. Flash також є рівнем із відкритими вагами та тим, що входить до GLM Coding Plan, де Flash отримує 3× квоту GLM-5.3.
Якщо вам потрібна пропускна здатність, інтерактивна затримка або агентний цикл, що виконує багато коротких ходів, FlashX — це рівень, призначений для цього. Якщо ви оптимізуєте вартість за завершене завдання і можете зачекати, Flash дешевший для ідентичної роботи.
Що таке GLM-5.3-FlashX?
GLM-5.3-FlashX — це оптимізована за швидкістю кінцева точка сімейства GLM-5.3-Flash. Zhipu анонсувала його 18 вересня 2026 року, описавши як швидший і плавніший для підприємств і розробників, з API та офіційним центром досвіду, відкритими на момент запуску.
Варто розділяти дві речі:
- Модель — GLM-5.3-Flash, нативна мультимодальна модель 320B-A18B, яку Zhipu відкрила 26 серпня 2026 року. Архітектура, ваги, довжина контексту та можливості спільні.
- Рівень обслуговування — FlashX, конфігурація інференсу, налаштована на пропускну здатність. Zhipu повідомляє про швидкість до 200 токенів/с і приписує приріст інфраструктурній роботі, а не іншому чекпойнту.
Це розрізнення важливе під час оцінювання. Бенчмарки, обмеження контексту та мультимодальна поведінка, описані для GLM-5.3-Flash, застосовуються до FlashX, оскільки це та сама модель. Затримка та ціна — ні: вони змінюються залежно від рівня обслуговування.
Специфікації моделі з першого погляду
| Специфікація | GLM-5.3-FlashX |
|---|---|
| ID моделі API | glm-5.3-flashx |
| ID сусідньої моделі | glm-5.3-flash |
| Випущено | 18 вересня 2026 року |
| Загальні / активовані параметри | 320B / 18B |
| Шари | 45 |
| Вікно контексту | 1M токенів |
| Максимум вихідних токенів | 128K |
| Модальності вводу | Відео, зображення, текст, файл |
| Модальність виводу | Текст |
| Опублікована пікова швидкість | 200 токенів/с |
| Режим мислення | Лише thinking.type: enabled; його не можна вимкнути |
| Ключові функції API | Стрімінг, виклик функцій, кешування контексту, структурований вивід, стрімінг інструментів |
Zhipu рекомендує temperature: 1, top_p: 0.95 та reasoning_effort: max. Для багатоходової роботи вона рекомендує зберігати історію мислення, а не очищати її (clear_thinking: false), а для стрімінгових запитів — увімкнути як stream: true, так і tool_stream: true.
GLM-5.3-FlashX проти GLM-5.3-Flash
| Вимір | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| Базова модель | GLM-5.3-Flash | GLM-5.3-Flash |
| Опублікована пікова швидкість | Стандартний рівень | До 200 токенів/с |
| Прайс-лист за ввід / 1M | $0.15 | $0.37 |
| Прайс-лист за вивід / 1M | $0.50 | $1.25 |
| Обмеження контексту та виводу | 1M / 128K | 1M / 128K |
| Мультимодальний ввід | Так | Так |
| Відкриті ваги | Так, з 26 серпня 2026 року | Та сама базова модель |
| GLM Coding Plan | Включено, з 3× квотою GLM-5.3 | Не включено на момент запуску |
Формат запиту ідентичний. Перехід з одного рівня на інший — це зміна поля model, а не переписування вашої інтеграції — що робить FlashX розумним кандидатом для A/B-тестування робочих навантажень, де час на хід є вузьким місцем.
Що «200 токенів/с» говорить і не говорить вам
Zhipu публікує 200 токенів/с як максимум. Сприймайте це як стелю швидкості генерації, а не як обіцянку щодо вашого робочого навантаження:
- Це піковий показник. Реальна пропускна здатність залежить від довжини промпту, влучань у кеш, паралелізму та обраного провайдера.
- Це не час до першого токена. Швидка швидкість декодування все одно відчувається повільною, якщо модель думає кілька секунд, перш ніж щось видати. Для інтерактивних продуктів вимірюйте обидва показники.
- Це не загальна затримка завдання. Хід агента, який викликає три інструменти, обмежений виконанням інструментів, а не швидкістю токенів.
- Довгий контекст змінює картину. На 1M токенів домінують префіл і поведінка KV-кешу. Саме на це націлена архітектура Flash.
Практичне правило: тестуйте Flash і FlashX на власних промптах і порівнюйте час до першого токена, вихідні токени за секунду та вартість за завершене завдання, а не одне число швидкості.
Звідки береться швидкість
Zhipu приписує прискорення FlashX інфраструктурним інвестиціям, а не новій архітектурі, побудованим на основі 100 000 вітчизняних AI-прискорювачів, які вже обслуговують трафік GLM-5.3-Flash.
- Виділений рушій інференсу на SGLang, написаний для цієї архітектури, а не адаптований із загального стеку.
- Оптимізація пам'яті для контекстів на 1M токенів, включаючи ReplaySSM, квантизацію W8A8, гібридну квантизацію кешу INT8/FP8/BF16 та Layer Split.
- Розділена архітектура обслуговування Encode–Prefill–Decode (EPD), яка відокремлює мультимодальне кодування, префіл промпту та по-токенне декодування в незалежно керовані пули воркерів, тож кожен етап масштабується самостійно.
- 3× покращення наскрізного обслуговування порівняно з початковим базовим рівнем на тому самому обладнанні, що, за словами Zhipu, доводить вартість за токен до рівня, порівнянного з мейнстрімними GPU NVIDIA.
Одна деталь із цієї роботи варта окремої уваги: Zhipu каже, що інфраструктурний агент на базі GLM-5.3 допоміг інженерам оптимізувати ядра, діагностувати вузькі місця та покращити стек обслуговування — модель бере участь у системі, яка її обслуговує.
Бенчмарки: що Zhipu повідомляє для базової моделі
Усі наведені нижче числа опубліковані Zhipu для GLM-5.3-Flash і застосовуються до FlashX, оскільки модель та сама. Це результати, про які повідомляє постачальник, а не незалежні відтворення.
| Бенчмарк | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0, максимальні зусилля | 29.0 | Claude Opus 4.8: 29.5 |
Zhipu також повідомляє, що GLM-5.3-Flash набирає 57 в Artificial Analysis Intelligence Index v4.1.1 за $0.045 за завдання за її дисконтною ціною — рівень, який, за її словами, раніше був доступний лише приблизно за 10× вартості — і що його продуктивність у кодуванні порівнянна з Claude Opus 4.8 на внутрішньому Z.ai Code Bench компанії.
Сприймайте це як напрямок, а не гарантію. Бенчмарки постачальників зазвичай запускаються на сприятливих для постачальника версіях харнесу; рядок Z.ai Code Bench вище був виміряний на Claude Code 2.1.207. Повторно проведіть власне оцінювання, перш ніж переводити продакшн-трафік.
Архітектура: чому рівень Flash дешевий в експлуатації
FlashX успадковує дизайн, який зробив Flash недорогим в обслуговуванні, і саме тому швидший рівень може існувати без стрибка ціни до рівня флагмана.
- Гібридна розріджена та лінійна увага. Zhipu описує це як першу відкриту фронтирну модель, що поєднує обидві. Лінійна увага вловлює локальні залежності через моделювання стану; розріджена увага витягує релевантний глобальний контекст через легкий індексатор.
- IndexPool. Чотири ключові вектори індексатора стискаються в один зваженим пулінгом, скорочуючи затримку та накладні витрати пам'яті індексатора на контексті 1M токенів.
- Manifold-Constrained Hyper-Connections (mHC) для кращої ефективності масштабування.
- Нижча вартість за токен, ніж GLM-5.3. Zhipu повідомляє про 3.01× менше обчислень уваги та 4.44× менший KV-кеш, ніж GLM-5.3. Порівняно з GLM-5.3 кількість активованих параметрів падає з 32B до 18B, а шарів — з 92 до 45.
- Мультимодальний корпус попереднього навчання на 30 трильйонів токенів.
Zhipu відверто визнає, що KV-кеш все ще трохи більший, ніж у Kimi-K3 та DeepSeek-V4-Flash, і називає це напрямком для майбутньої роботи — корисне нагадування, що порівняння архітектур ведуться за вимірами, а не за єдиним рейтингом.
Ox-Alpha: анонімна модель, що тестувалася публічно
Перед запуском Flash Zhipu запустила GLM-5.3-Flash анонімно як Ox-Alpha на OpenCode та OpenRouter. За словами Zhipu, вона стала найпопулярнішою моделлю тижня та встановила рекорди використання на обох платформах, причому весь цей трафік обслуговувався на китайських AI-чіпах.
Для розробників цікава не позиція в рейтингу, а метод валідації: реальний трафік, реальні агенти кодування, невідома назва моделі та жодного впливу бренду. Це сильніший сигнал, ніж таблиця бенчмарків, хоча все ще контрольований постачальником запуск без опублікованої методології.
Нативна мультимодальність і візуальне кодування
GLM-5.3-Flash — перша модель серії GLM-5, побудована як мультимодальна від початку, і FlashX це зберігає. Зображення передаються як блок вмісту з type: image_url всередині messages[].content[], використовуючи або URL, або Base64 data URL, і кілька блоків можна поєднати в одному повідомленні. Ввід відео та файлів задокументовано поряд із зображеннями та текстом.
Можливість, яка найбільше важлива на практиці, — це візуальне кодування: модель оглядає відрендерений інтерфейс, порівнює його з цільовим і ітерує. Zhipu документує робочі процеси для відтворення застосунку зі скриншотів або записів, побудови сцен Blender, створення прототипів ігор Godot, запуску браузерних агентів і агентів комп'ютерного використання та відтворення CAD-деталей — кожен із перевіркою моделлю власного відрендереного виводу, а не лише генерацією коду.
Той самий цикл поширюється на роботу з документами. Zhipu демонструє результати у PPTX, PDF, DOCX та XLSX, фінансові дослідження з відстежуваними джерелами, перевірку контрактів із відстежуваними анотаціями та юридичне складання документів, де модель рендерить і візуально перевіряє власний вивід на переповнення, невирівняність і неузгоджене стилізування.
Один приклад від Zhipu особливо конкретний: без зовнішніх ресурсів GLM-5.3-Flash працювала автономно 16 годин, щоб побудувати як сцену Blender резиденцію шеф-кухаря та тестову кухню площею приблизно 400 м².
Ціни: скільки коштує FlashX
Офіційні прайс-листи за 1M токенів, зі сторінок цін Zhipu (перевірено 18 вересня 2026 року):
| Тип токенів | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| Ввід (USD) | $0.37 | $0.15 | $1.40 |
| Кешований ввід (USD) | $0.075 | $0.03 | $0.26 |
| Вивід (USD) | $1.25 | $0.50 | $4.40 |
Зберігання кешованого вводу вказано як безкоштовне на обмежений час для всіх трьох рівнів.
Приклад вартості. Для 10M некешованих вхідних токенів і 1M вихідних токенів прайс-листи дають:
| Робоче навантаження | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M ввід + 1M вивід | $4.95 | $2.00 | $18.40 |
| Той самий обсяг, весь ввід з кешу | $2.00 | $0.80 | $6.60 |
FlashX приблизно 2.5× Flash за вводом і виводом, і все ще значно нижче GLM-5.3. Чи варто це, повністю залежить від того, скільки вам коштує повільний хід — для пакетного конвеєра це рідко так, а для інтерактивного агента часто так.
Як викликати GLM-5.3-FlashX
FlashX використовує той самий інтерфейс chat-completions, що й Flash, тож міграція — це зміна одного рядка.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
Для стрімінгу додайте stream: true та tool_stream: true, як рекомендує Zhipu. Зверніть увагу, що мислення не можна вимкнути в цій моделі, тож закладайте токени міркування у свою оцінку вартості та в тайм-аути клієнта.
Практичний шлях міграції: тримайте ID моделі конфігурованим, надішліть репрезентативний зріз продакшн-трафіку як до glm-5.3-flash, так і до glm-5.3-flashx, і порівняйте частку завершень, час до першого токена та вартість за завершене завдання, перш ніж переводити робоче навантаження.
Вибір між FlashX, Flash і GLM-5.3
- Обирайте FlashX для інтерактивних продуктів, доповнень у IDE та агентних циклів із багатьма короткими ходами, де обмеженням є реальний час на хід, а робоче навантаження все ще відповідає можливостям класу Flash.
- Обирайте Flash для пакетної обробки, офлайн-генерації та високооб'ємних конвеєрів, де вартість за завдання важливіша за затримку — а також для розгортань із відкритими вагами або самостійним хостингом, оскільки Flash — це рівень з опублікованими вагами.
- Обирайте GLM-5.3, коли вам потрібна стеля флагмана, а не профіль витрат рівня Flash.
- Не припускайте, що приріст швидкості застосовується рівномірно. Запити з важким префілом і довгим контекстом та ходи агента, обмежені інструментами, можуть отримати значно менше переваг, ніж короткі завдання генерації. Вимірюйте робоче навантаження, яке ви насправді запускаєте.
Почніть роботу з сімейством GLM на APIMaster.ai
APIMaster дає вам один сумісний з OpenAI ключ для сімейства GLM поряд із Claude, GPT, DeepSeek, Qwen, Gemini, Kimi та іншими моделями — з оплатою за використанням від $1 та до 70% знижки від офіційних тарифів на окремих маршрутах.
Оскільки FlashX зберігає той самий формат запиту, що й Flash, команди, які вже викликають GLM через APIMaster, можуть оцінити швидший рівень, не змінюючи свою інтеграцію, крім ID моделі.
- Створіть акаунт APIMaster.
- Додайте кредит з оплатою за використанням, починаючи від $1.
- Створіть API-ключ у консолі APIMaster.
- Спрямуйте свій сумісний з OpenAI клієнт на
https://apimaster.ai/v1і встановіть ID моделі, яку хочете оцінити.
Зареєструватися в APIMaster · Дослідити маркетплейс моделей · Перевірити ідентичність моделі
FAQ
Чи GLM-5.3-FlashX — це нова модель? Ні. Це високошвидкісний рівень обслуговування GLM-5.3-Flash. Та сама модель, те саме вікно контексту, той самий мультимодальний ввід — швидша конфігурація інференсу та інша ціна.
Який ID моделі GLM-5.3-FlashX?
glm-5.3-flashx. Стандартний рівень — glm-5.3-flash.
Наскільки швидкий GLM-5.3-FlashX? Zhipu публікує максимум 200 токенів/с. Це піковий показник; вимірюйте час до першого токена та стійку пропускну здатність на власних промптах.
Скільки коштує GLM-5.3-FlashX? Zhipu вказує $0.37 за 1M вхідних токенів, $1.25 за 1M вихідних токенів і $0.075 за 1M кешованих вхідних токенів — приблизно 2.5× ціни GLM-5.3-Flash за вводом і виводом.
Яке вікно контексту? 1M токенів, з до 128 000 вихідних токенів, те саме, що й у GLM-5.3-Flash.
Чи може GLM-5.3-FlashX приймати зображення та відео?
Так. Він приймає ввід відео, зображень, тексту та файлів і повертає текст. Зображення надсилаються як блок вмісту image_url, за URL або Base64 data URL.
Чи GLM-5.3-FlashX входить до GLM Coding Plan? Не на момент запуску. GLM-5.3-Flash повністю доступний у плані з 3× квотою GLM-5.3, а виклики в непіковий час, включаючи всі вихідні, споживають 50% стандартних балів.
Чи можу я вимкнути мислення, щоб заощадити токени?
Ні. thinking.type підтримує лише enabled. Zhipu рекомендує зберігати історію мислення (clear_thinking: false) для багатоходової роботи.
Чи числа бенчмарків незалежні? Ні. Вони опубліковані Zhipu. Сприймайте їх як орієнтовні та повторно проведіть власне оцінювання, перш ніж спрямовувати продакшн-трафік.
Джерела та додаткове читання
- Z.ai — документація моделей GLM-5.3-Flash/FlashX — ID моделей, параметри, можливості, рекомендовані налаштування, бенчмарки та деталі обслуговування
- Z.ai — Ціни — офіційні прайс-листи за 1M токенів
- Z.ai — технічний блог GLM-5.3-Flash — архітектура, порівняння ефективності та таблиці оцінювання
- Hugging Face — zai-org/GLM-5.3-Flash — відкриті ваги для базової моделі
- PANews — Zhipu запускає GLM-5.3-FlashX — звіт про запуск і передісторія Ox-Alpha
Усі джерела перевірено 18 вересня 2026 року. Ціни та доступність змінюються; перевіряйте поточні умови, перш ніж братися за велике робоче навантаження.