APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: що це таке, як швидко він працює та скільки коштує

GLM-5.3-FlashX — це високошвидкісний рівень обслуговування GLM-5.3-Flash від Zhipu, запущений 18 вересня 2026 року зі швидкістю до 200 токенів/с. Ось підтверджений ID моделі, ціни, вікно контексту, бенчмарки та способи виклику.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX — це високошвидкісний рівень обслуговування GLM-5.3-Flash від Zhipu, випущений 18 вересня 2026 року з опублікованою піковою швидкістю інференсу 200 токенів/с. Це не нова модель: це та сама система GLM-5.3-Flash — 320B загальних параметрів з 18B активованих, вікно контексту на 1M токенів, до 128 000 вихідних токенів і нативний ввід зображень, відео, файлів та тексту — що обслуговується через швидшу конфігурацію інференсу.

ID моделі API — glm-5.3-flashx, і він стоїть поруч із glm-5.3-flash. Компроміс прямолінійний: FlashX коштує більше за токен, ніж Flash (Zhipu вказує $0.37 за ввід / $1.25 за вивід за 1M токенів проти $0.15 / $0.50 для Flash) і повертає швидші відповіді. Flash також є рівнем із відкритими вагами та тим, що входить до GLM Coding Plan, де Flash отримує 3× квоту GLM-5.3.

Якщо вам потрібна пропускна здатність, інтерактивна затримка або агентний цикл, що виконує багато коротких ходів, FlashX — це рівень, призначений для цього. Якщо ви оптимізуєте вартість за завершене завдання і можете зачекати, Flash дешевший для ідентичної роботи.

Що таке GLM-5.3-FlashX?

GLM-5.3-FlashX — це оптимізована за швидкістю кінцева точка сімейства GLM-5.3-Flash. Zhipu анонсувала його 18 вересня 2026 року, описавши як швидший і плавніший для підприємств і розробників, з API та офіційним центром досвіду, відкритими на момент запуску.

Варто розділяти дві речі:

  • Модель — GLM-5.3-Flash, нативна мультимодальна модель 320B-A18B, яку Zhipu відкрила 26 серпня 2026 року. Архітектура, ваги, довжина контексту та можливості спільні.
  • Рівень обслуговування — FlashX, конфігурація інференсу, налаштована на пропускну здатність. Zhipu повідомляє про швидкість до 200 токенів/с і приписує приріст інфраструктурній роботі, а не іншому чекпойнту.

Це розрізнення важливе під час оцінювання. Бенчмарки, обмеження контексту та мультимодальна поведінка, описані для GLM-5.3-Flash, застосовуються до FlashX, оскільки це та сама модель. Затримка та ціна — ні: вони змінюються залежно від рівня обслуговування.

Специфікації моделі з першого погляду

Специфікація GLM-5.3-FlashX
ID моделі API glm-5.3-flashx
ID сусідньої моделі glm-5.3-flash
Випущено 18 вересня 2026 року
Загальні / активовані параметри 320B / 18B
Шари 45
Вікно контексту 1M токенів
Максимум вихідних токенів 128K
Модальності вводу Відео, зображення, текст, файл
Модальність виводу Текст
Опублікована пікова швидкість 200 токенів/с
Режим мислення Лише thinking.type: enabled; його не можна вимкнути
Ключові функції API Стрімінг, виклик функцій, кешування контексту, структурований вивід, стрімінг інструментів

Zhipu рекомендує temperature: 1, top_p: 0.95 та reasoning_effort: max. Для багатоходової роботи вона рекомендує зберігати історію мислення, а не очищати її (clear_thinking: false), а для стрімінгових запитів — увімкнути як stream: true, так і tool_stream: true.

GLM-5.3-FlashX проти GLM-5.3-Flash

Вимір GLM-5.3-Flash GLM-5.3-FlashX
Базова модель GLM-5.3-Flash GLM-5.3-Flash
Опублікована пікова швидкість Стандартний рівень До 200 токенів/с
Прайс-лист за ввід / 1M $0.15 $0.37
Прайс-лист за вивід / 1M $0.50 $1.25
Обмеження контексту та виводу 1M / 128K 1M / 128K
Мультимодальний ввід Так Так
Відкриті ваги Так, з 26 серпня 2026 року Та сама базова модель
GLM Coding Plan Включено, з 3× квотою GLM-5.3 Не включено на момент запуску

Формат запиту ідентичний. Перехід з одного рівня на інший — це зміна поля model, а не переписування вашої інтеграції — що робить FlashX розумним кандидатом для A/B-тестування робочих навантажень, де час на хід є вузьким місцем.

Що «200 токенів/с» говорить і не говорить вам

Zhipu публікує 200 токенів/с як максимум. Сприймайте це як стелю швидкості генерації, а не як обіцянку щодо вашого робочого навантаження:

  • Це піковий показник. Реальна пропускна здатність залежить від довжини промпту, влучань у кеш, паралелізму та обраного провайдера.
  • Це не час до першого токена. Швидка швидкість декодування все одно відчувається повільною, якщо модель думає кілька секунд, перш ніж щось видати. Для інтерактивних продуктів вимірюйте обидва показники.
  • Це не загальна затримка завдання. Хід агента, який викликає три інструменти, обмежений виконанням інструментів, а не швидкістю токенів.
  • Довгий контекст змінює картину. На 1M токенів домінують префіл і поведінка KV-кешу. Саме на це націлена архітектура Flash.

Практичне правило: тестуйте Flash і FlashX на власних промптах і порівнюйте час до першого токена, вихідні токени за секунду та вартість за завершене завдання, а не одне число швидкості.

Звідки береться швидкість

Zhipu приписує прискорення FlashX інфраструктурним інвестиціям, а не новій архітектурі, побудованим на основі 100 000 вітчизняних AI-прискорювачів, які вже обслуговують трафік GLM-5.3-Flash.

  • Виділений рушій інференсу на SGLang, написаний для цієї архітектури, а не адаптований із загального стеку.
  • Оптимізація пам'яті для контекстів на 1M токенів, включаючи ReplaySSM, квантизацію W8A8, гібридну квантизацію кешу INT8/FP8/BF16 та Layer Split.
  • Розділена архітектура обслуговування Encode–Prefill–Decode (EPD), яка відокремлює мультимодальне кодування, префіл промпту та по-токенне декодування в незалежно керовані пули воркерів, тож кожен етап масштабується самостійно.
  • 3× покращення наскрізного обслуговування порівняно з початковим базовим рівнем на тому самому обладнанні, що, за словами Zhipu, доводить вартість за токен до рівня, порівнянного з мейнстрімними GPU NVIDIA.

Одна деталь із цієї роботи варта окремої уваги: Zhipu каже, що інфраструктурний агент на базі GLM-5.3 допоміг інженерам оптимізувати ядра, діагностувати вузькі місця та покращити стек обслуговування — модель бере участь у системі, яка її обслуговує.

Бенчмарки: що Zhipu повідомляє для базової моделі

Усі наведені нижче числа опубліковані Zhipu для GLM-5.3-Flash і застосовуються до FlashX, оскільки модель та сама. Це результати, про які повідомляє постачальник, а не незалежні відтворення.

Бенчмарк GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63.4 46.2
AutomationBench 48.8 26.2
Z.ai Code Bench v1.0, максимальні зусилля 29.0 Claude Opus 4.8: 29.5

Zhipu також повідомляє, що GLM-5.3-Flash набирає 57 в Artificial Analysis Intelligence Index v4.1.1 за $0.045 за завдання за її дисконтною ціною — рівень, який, за її словами, раніше був доступний лише приблизно за 10× вартості — і що його продуктивність у кодуванні порівнянна з Claude Opus 4.8 на внутрішньому Z.ai Code Bench компанії.

Сприймайте це як напрямок, а не гарантію. Бенчмарки постачальників зазвичай запускаються на сприятливих для постачальника версіях харнесу; рядок Z.ai Code Bench вище був виміряний на Claude Code 2.1.207. Повторно проведіть власне оцінювання, перш ніж переводити продакшн-трафік.

Архітектура: чому рівень Flash дешевий в експлуатації

FlashX успадковує дизайн, який зробив Flash недорогим в обслуговуванні, і саме тому швидший рівень може існувати без стрибка ціни до рівня флагмана.

  • Гібридна розріджена та лінійна увага. Zhipu описує це як першу відкриту фронтирну модель, що поєднує обидві. Лінійна увага вловлює локальні залежності через моделювання стану; розріджена увага витягує релевантний глобальний контекст через легкий індексатор.
  • IndexPool. Чотири ключові вектори індексатора стискаються в один зваженим пулінгом, скорочуючи затримку та накладні витрати пам'яті індексатора на контексті 1M токенів.
  • Manifold-Constrained Hyper-Connections (mHC) для кращої ефективності масштабування.
  • Нижча вартість за токен, ніж GLM-5.3. Zhipu повідомляє про 3.01× менше обчислень уваги та 4.44× менший KV-кеш, ніж GLM-5.3. Порівняно з GLM-5.3 кількість активованих параметрів падає з 32B до 18B, а шарів — з 92 до 45.
  • Мультимодальний корпус попереднього навчання на 30 трильйонів токенів.

Zhipu відверто визнає, що KV-кеш все ще трохи більший, ніж у Kimi-K3 та DeepSeek-V4-Flash, і називає це напрямком для майбутньої роботи — корисне нагадування, що порівняння архітектур ведуться за вимірами, а не за єдиним рейтингом.

Ox-Alpha: анонімна модель, що тестувалася публічно

Перед запуском Flash Zhipu запустила GLM-5.3-Flash анонімно як Ox-Alpha на OpenCode та OpenRouter. За словами Zhipu, вона стала найпопулярнішою моделлю тижня та встановила рекорди використання на обох платформах, причому весь цей трафік обслуговувався на китайських AI-чіпах.

Для розробників цікава не позиція в рейтингу, а метод валідації: реальний трафік, реальні агенти кодування, невідома назва моделі та жодного впливу бренду. Це сильніший сигнал, ніж таблиця бенчмарків, хоча все ще контрольований постачальником запуск без опублікованої методології.

Нативна мультимодальність і візуальне кодування

GLM-5.3-Flash — перша модель серії GLM-5, побудована як мультимодальна від початку, і FlashX це зберігає. Зображення передаються як блок вмісту з type: image_url всередині messages[].content[], використовуючи або URL, або Base64 data URL, і кілька блоків можна поєднати в одному повідомленні. Ввід відео та файлів задокументовано поряд із зображеннями та текстом.

Можливість, яка найбільше важлива на практиці, — це візуальне кодування: модель оглядає відрендерений інтерфейс, порівнює його з цільовим і ітерує. Zhipu документує робочі процеси для відтворення застосунку зі скриншотів або записів, побудови сцен Blender, створення прототипів ігор Godot, запуску браузерних агентів і агентів комп'ютерного використання та відтворення CAD-деталей — кожен із перевіркою моделлю власного відрендереного виводу, а не лише генерацією коду.

Той самий цикл поширюється на роботу з документами. Zhipu демонструє результати у PPTX, PDF, DOCX та XLSX, фінансові дослідження з відстежуваними джерелами, перевірку контрактів із відстежуваними анотаціями та юридичне складання документів, де модель рендерить і візуально перевіряє власний вивід на переповнення, невирівняність і неузгоджене стилізування.

Один приклад від Zhipu особливо конкретний: без зовнішніх ресурсів GLM-5.3-Flash працювала автономно 16 годин, щоб побудувати як сцену Blender резиденцію шеф-кухаря та тестову кухню площею приблизно 400 м².

Ціни: скільки коштує FlashX

Офіційні прайс-листи за 1M токенів, зі сторінок цін Zhipu (перевірено 18 вересня 2026 року):

Тип токенів GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Ввід (USD) $0.37 $0.15 $1.40
Кешований ввід (USD) $0.075 $0.03 $0.26
Вивід (USD) $1.25 $0.50 $4.40

Зберігання кешованого вводу вказано як безкоштовне на обмежений час для всіх трьох рівнів.

Приклад вартості. Для 10M некешованих вхідних токенів і 1M вихідних токенів прайс-листи дають:

Робоче навантаження GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M ввід + 1M вивід $4.95 $2.00 $18.40
Той самий обсяг, весь ввід з кешу $2.00 $0.80 $6.60

FlashX приблизно 2.5× Flash за вводом і виводом, і все ще значно нижче GLM-5.3. Чи варто це, повністю залежить від того, скільки вам коштує повільний хід — для пакетного конвеєра це рідко так, а для інтерактивного агента часто так.

Як викликати GLM-5.3-FlashX

FlashX використовує той самий інтерфейс chat-completions, що й Flash, тож міграція — це зміна одного рядка.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Для стрімінгу додайте stream: true та tool_stream: true, як рекомендує Zhipu. Зверніть увагу, що мислення не можна вимкнути в цій моделі, тож закладайте токени міркування у свою оцінку вартості та в тайм-аути клієнта.

Практичний шлях міграції: тримайте ID моделі конфігурованим, надішліть репрезентативний зріз продакшн-трафіку як до glm-5.3-flash, так і до glm-5.3-flashx, і порівняйте частку завершень, час до першого токена та вартість за завершене завдання, перш ніж переводити робоче навантаження.

Вибір між FlashX, Flash і GLM-5.3

  • Обирайте FlashX для інтерактивних продуктів, доповнень у IDE та агентних циклів із багатьма короткими ходами, де обмеженням є реальний час на хід, а робоче навантаження все ще відповідає можливостям класу Flash.
  • Обирайте Flash для пакетної обробки, офлайн-генерації та високооб'ємних конвеєрів, де вартість за завдання важливіша за затримку — а також для розгортань із відкритими вагами або самостійним хостингом, оскільки Flash — це рівень з опублікованими вагами.
  • Обирайте GLM-5.3, коли вам потрібна стеля флагмана, а не профіль витрат рівня Flash.
  • Не припускайте, що приріст швидкості застосовується рівномірно. Запити з важким префілом і довгим контекстом та ходи агента, обмежені інструментами, можуть отримати значно менше переваг, ніж короткі завдання генерації. Вимірюйте робоче навантаження, яке ви насправді запускаєте.

Почніть роботу з сімейством GLM на APIMaster.ai

APIMaster дає вам один сумісний з OpenAI ключ для сімейства GLM поряд із Claude, GPT, DeepSeek, Qwen, Gemini, Kimi та іншими моделями — з оплатою за використанням від $1 та до 70% знижки від офіційних тарифів на окремих маршрутах.

Оскільки FlashX зберігає той самий формат запиту, що й Flash, команди, які вже викликають GLM через APIMaster, можуть оцінити швидший рівень, не змінюючи свою інтеграцію, крім ID моделі.

  1. Створіть акаунт APIMaster.
  2. Додайте кредит з оплатою за використанням, починаючи від $1.
  3. Створіть API-ключ у консолі APIMaster.
  4. Спрямуйте свій сумісний з OpenAI клієнт на https://apimaster.ai/v1 і встановіть ID моделі, яку хочете оцінити.

Зареєструватися в APIMaster · Дослідити маркетплейс моделей · Перевірити ідентичність моделі

FAQ

Чи GLM-5.3-FlashX — це нова модель? Ні. Це високошвидкісний рівень обслуговування GLM-5.3-Flash. Та сама модель, те саме вікно контексту, той самий мультимодальний ввід — швидша конфігурація інференсу та інша ціна.

Який ID моделі GLM-5.3-FlashX? glm-5.3-flashx. Стандартний рівень — glm-5.3-flash.

Наскільки швидкий GLM-5.3-FlashX? Zhipu публікує максимум 200 токенів/с. Це піковий показник; вимірюйте час до першого токена та стійку пропускну здатність на власних промптах.

Скільки коштує GLM-5.3-FlashX? Zhipu вказує $0.37 за 1M вхідних токенів, $1.25 за 1M вихідних токенів і $0.075 за 1M кешованих вхідних токенів — приблизно 2.5× ціни GLM-5.3-Flash за вводом і виводом.

Яке вікно контексту? 1M токенів, з до 128 000 вихідних токенів, те саме, що й у GLM-5.3-Flash.

Чи може GLM-5.3-FlashX приймати зображення та відео? Так. Він приймає ввід відео, зображень, тексту та файлів і повертає текст. Зображення надсилаються як блок вмісту image_url, за URL або Base64 data URL.

Чи GLM-5.3-FlashX входить до GLM Coding Plan? Не на момент запуску. GLM-5.3-Flash повністю доступний у плані з 3× квотою GLM-5.3, а виклики в непіковий час, включаючи всі вихідні, споживають 50% стандартних балів.

Чи можу я вимкнути мислення, щоб заощадити токени? Ні. thinking.type підтримує лише enabled. Zhipu рекомендує зберігати історію мислення (clear_thinking: false) для багатоходової роботи.

Чи числа бенчмарків незалежні? Ні. Вони опубліковані Zhipu. Сприймайте їх як орієнтовні та повторно проведіть власне оцінювання, перш ніж спрямовувати продакшн-трафік.

Джерела та додаткове читання

Усі джерела перевірено 18 вересня 2026 року. Ціни та доступність змінюються; перевіряйте поточні умови, перш ніж братися за велике робоче навантаження.