GLM-5.3-FlashX: その正体、実行速度、そしてコスト
GLM-5.3-FlashXは、ZhipuによるGLM-5.3-Flashの高速サービングティアで、2026年9月18日に最大200トークン/秒でリリースされました。確認済みのモデルID、料金、コンテキストウィンドウ、ベンチマーク、そして呼び出し方法をまとめます。
公開 2026-09-18
GLM-5.3-FlashXは、ZhipuによるGLM-5.3-Flashの高速サービングティアで、2026年9月18日にリリースされ、公表されているピーク推論速度は200トークン/秒です。 これは新しいモデルではありません。同じGLM-5.3-Flashシステム — 総パラメータ320B、活性化18B、100万トークンのコンテキストウィンドウ、最大128,000出力トークン、ネイティブの画像・動画・ファイル・テキスト入力 — を、より高速な推論構成で提供するものです。
APIモデルIDは**glm-5.3-flashxで、glm-5.3-flashの隣に位置します。トレードオフは明快です。FlashXはFlashよりもトークンあたりのコストが高く(Zhipuの表示では100万トークンあたり入力$0.37 / 出力$1.25**、Flashは**$0.15 / $0.50**)、その代わりに応答が速くなります。またFlashは、オープンウェイトを持つティアであり、GLM Coding Planに含まれるティアでもあり、そこではFlashがGLM-5.3の3倍のクォータを取得します。
スループット、対話型のレイテンシ、あるいは多数の短いターンを回すエージェントループが必要なら、FlashXはそのために設計されたティアです。完了したタスクあたりのコストを最適化していて、待つことができるなら、同一の作業に対してFlashのほうが安価です。
GLM-5.3-FlashXとは何か
GLM-5.3-FlashXは、GLM-5.3-Flashファミリーの速度最適化エンドポイントです。Zhipuは2026年9月18日にこれを発表し、企業と開発者にとってより高速でスムーズであると説明し、APIと公式の体験センターの両方がローンチ時に公開されました。
分けて考えるべき点が2つあります。
- モデル — GLM-5.3-Flash。Zhipuが2026年8月26日にオープンソース化した、320B-A18Bのネイティブマルチモーダルモデルです。アーキテクチャ、ウェイト、コンテキスト長、機能は共通です。
- サービングティア — FlashX。スループットにチューニングされた推論構成です。Zhipuは最大200トークン/秒の速度を報告しており、その向上は別のチェックポイントではなくインフラストラクチャの取り組みによるものだとしています。
この区別は、評価するときに重要になります。GLM-5.3-Flashについて説明されているベンチマーク、コンテキスト上限、マルチモーダルな挙動は、同じモデルであるためFlashXにも当てはまります。レイテンシと価格は当てはまりません。それらはサービングティアによって変わります。
モデル仕様の概要
| 仕様 | GLM-5.3-FlashX |
|---|---|
| APIモデルID | glm-5.3-flashx |
| 姉妹モデルID | glm-5.3-flash |
| リリース | 2026年9月18日 |
| 総パラメータ / 活性化パラメータ | 320B / 18B |
| レイヤー数 | 45 |
| コンテキストウィンドウ | 100万トークン |
| 最大出力トークン | 128K |
| 入力モダリティ | 動画、画像、テキスト、ファイル |
| 出力モダリティ | テキスト |
| 公表ピーク速度 | 200トークン/秒 |
| 思考モード | thinking.type: enabledのみ。無効化はできません |
| 主要API機能 | ストリーミング、関数呼び出し、コンテキストキャッシュ、構造化出力、ツールストリーミング |
Zhipuはtemperature: 1、top_p: 0.95、reasoning_effort: maxを推奨しています。マルチターンの作業では、思考履歴をクリアせずに保持すること(clear_thinking: false)を推奨し、ストリーミングリクエストではstream: trueとtool_stream: trueの両方を有効にすることを推奨しています。
GLM-5.3-FlashX vs GLM-5.3-Flash
| 項目 | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| 基盤モデル | GLM-5.3-Flash | GLM-5.3-Flash |
| 公表ピーク速度 | 標準ティア | 最大200トークン/秒 |
| 入力リスト価格 / 100万 | $0.15 | $0.37 |
| 出力リスト価格 / 100万 | $0.50 | $1.25 |
| コンテキストと出力の上限 | 100万 / 128K | 100万 / 128K |
| マルチモーダル入力 | あり | あり |
| オープンウェイト | あり(2026年8月26日以降) | 同一のベースモデル |
| GLM Coding Plan | 含まれる。GLM-5.3の3倍のクォータ | ローンチ時点では含まれない |
リクエスト形式は同一です。一方のティアから他方への移行はmodelフィールドの変更であり、統合の書き直しではありません。このためFlashXは、ターンあたりの時間がボトルネックとなるワークロードにとって、妥当なA/B候補になります。
「200トークン/秒」が教えてくれること、教えてくれないこと
Zhipuは200トークン/秒を最大値として公表しています。これは生成速度の上限として読み取るべきであり、あなたのワークロードに関する約束ではありません。
- これはピーク値です。 実際のスループットは、プロンプト長、キャッシュヒット、同時実行数、選択したプロバイダーに依存します。
- これは初回トークンまでの時間ではありません。 デコード速度が速くても、モデルが何も出力する前に数秒間思考すれば、遅く感じられます。対話型プロダクトでは両方を測定してください。
- これはタスク全体のレイテンシではありません。 3つのツールを呼び出すエージェントのターンは、トークン速度ではなくツール実行によって制約されます。
- 長いコンテキストは状況を変えます。 100万トークンでは、プリフィルとKVキャッシュの挙動が支配的になります。まさにそれがFlashアーキテクチャが狙うところです。
実践的なルールはこうです。FlashとFlashXを自分のプロンプトでベンチマークし、単一の速度数値ではなく、初回トークンまでの時間、毎秒の出力トークン数、完了したタスクあたりのコストを比較してください。
速度はどこから来るのか
Zhipuは、FlashXの高速化を、新しいアーキテクチャではなくインフラストラクチャへの投資によるものだとし、すでにGLM-5.3-Flashのトラフィックを処理している10万台の国内AIアクセラレータの上に構築されているとしています。
- SGLang上の専用推論エンジン。汎用スタックから適応させたものではなく、このアーキテクチャのために書かれたものです。
- 100万トークンコンテキストのためのメモリ最適化。ReplaySSM、W8A8量子化、INT8/FP8/BF16のハイブリッドキャッシュ量子化、Layer Splitを含みます。
- Encode–Prefill–Decode(EPD)分離サービングアーキテクチャ。マルチモーダルエンコーディング、プロンプトのプリフィル、トークンごとのデコードを独立してスケジュールされるワーカープールに分離し、各ステージが独自にスケールできるようにします。
- 同一ハードウェア上の初期ベースラインに対する3倍のエンドツーエンドサービング改善。これにより、Zhipuによればトークンあたりのコストが主流のNVIDIA GPUに匹敵する水準になります。
この取り組みから1つの詳細が単独で注目に値します。Zhipuによれば、GLM-5.3を搭載したインフラストラクチャエージェントが、エンジニアによるカーネルの最適化、ボトルネックの診断、サービングスタックの改善を支援したといいます — モデルが、自身を提供するシステムに参加しているのです。
ベンチマーク: Zhipuがベースモデルについて報告している内容
以下の数値はすべて、ZhipuがGLM-5.3-Flashについて公表したものであり、モデルが同一であるためFlashXにも当てはまります。これらはベンダー報告の結果であり、独立した再現ではありません。
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0、max effort | 29.0 | Claude Opus 4.8: 29.5 |
Zhipuはまた、GLM-5.3-Flashが割引価格のもとでArtificial Analysis Intelligence Index v4.1.1においてタスクあたり$0.045で57を記録したと報告しています — これは以前はおよそ10倍のコストでしか得られなかった水準だとしています — そして、そのコーディング性能は同社の内部Z.ai Code BenchにおいてClaude Opus 4.8に匹敵するとしています。
これらは方向性として扱い、保証とはしないでください。ベンダーのベンチマークは通常、ベンダーに有利なハーネスのバージョンで実行されます。上記のZ.ai Code Benchの行はClaude Code 2.1.207で測定されました。本番トラフィックを移行する前に、独自の評価を再実行してください。
アーキテクチャ: Flashティアの実行コストが低い理由
FlashXは、Flashを安価に提供できるようにした設計を継承しており、それがフラッグシップ級への価格跳ね上がりなしに高速ティアが存在できる理由です。
- ハイブリッドなスパースアテンションと線形アテンション。 Zhipuはこれを、両者を組み合わせた初のオープンソースフロンティアモデルだと説明しています。線形アテンションは状態モデリングを通じて局所的な依存関係を捉え、スパースアテンションは軽量なインデクサーを通じて関連するグローバルコンテキストを取得します。
- IndexPool。 4つのインデクサーキーベクトルが重み付きプーリングによって1つに圧縮され、100万トークンのコンテキストにおいてインデクサーのレイテンシとメモリオーバーヘッドを削減します。
- **Manifold-Constrained Hyper-Connections(mHC)**によるスケーリング効率の向上。
- GLM-5.3よりも低いトークンあたりコスト。 Zhipuは、GLM-5.3と比較してアテンション計算量が3.01倍少なく、KVキャッシュが4.44倍小さいと報告しています。GLM-5.3に対して、活性化パラメータ数は32Bから18Bに、レイヤー数は92から45に減少します。
- 30兆トークンのマルチモーダル事前学習コーパス。
Zhipuは、KVキャッシュが依然としてKimi-K3やDeepSeek-V4-Flashよりもわずかに大きいことを率直に認め、これを今後の課題の方向性と呼んでいます — アーキテクチャの比較は単一のランキングではなく次元ごとである、という有用なリマインダーです。
Ox-Alpha: 公開の場でテストされた匿名モデル
Flashのローンチ前に、ZhipuはGLM-5.3-FlashをOx-AlphaとしてOpenCodeとOpenRouter上で匿名で運用しました。Zhipuによれば、それはその週で最も人気のあるモデルとなり、両プラットフォームで利用記録を樹立し、そのトラフィックはすべて中国のAIチップ上で処理されたといいます。
開発者にとって興味深いのは、リーダーボード上の順位ではなく検証手法です。実際のトラフィック、実際のコーディングエージェント、未知のモデル名、そしてブランドの牽引力なし。これはベンチマーク表よりも強いシグナルですが、それでも公表された方法論のないベンダー管理のロールアウトです。
ネイティブマルチモーダルとビジュアルコーディング
GLM-5.3-Flashは、最初からマルチモーダルとして構築された初のGLM-5シリーズモデルであり、FlashXもそれを維持しています。画像はmessages[].content[]内のtype: image_urlを持つコンテンツブロックとして渡され、URLまたはBase64データURLのいずれかを使用し、複数のブロックを1つのメッセージに組み合わせることができます。動画とファイル入力は、画像とテキストとともに文書化されています。
実践で最も重要な機能はビジュアルコーディングです。モデルはレンダリングされたインターフェースを検査し、目標と比較し、反復します。Zhipuは、スクリーンショットや録画からアプリケーションを再構築するワークフロー、Blenderシーンの構築、Godotゲームプロトタイプの制作、ブラウザおよびコンピュータ使用エージェントの実行、CAD部品の再現を文書化しており、いずれもコードを生成するだけでなく、モデルが自身のレンダリング出力を確認します。
同じループはドキュメント作業にも広がります。ZhipuはPPTX、PDF、DOCX、XLSXの成果物、追跡可能な出典を伴う財務リサーチ、追跡された注釈を伴う契約レビュー、法務ドラフトを実演しており、モデルは自身の出力をレンダリングして視覚的に検査し、オーバーフロー、位置ずれ、一貫性のないスタイリングを確認します。
Zhipuが挙げる一例は際立って具体的です。外部アセットなしで、GLM-5.3-Flashは約400 m²のシェフの住居とテストキッチンをBlenderシーンとして構築するために、16時間自律的に稼働しました。
料金: FlashXのコスト
Zhipuの料金ページ(2026年9月18日確認)による、100万トークンあたりの公式リスト価格:
| トークン種別 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 入力(USD) | $0.37 | $0.15 | $1.40 |
| キャッシュ入力(USD) | $0.075 | $0.03 | $0.26 |
| 出力(USD) | $1.25 | $0.50 | $4.40 |
キャッシュ入力の保存は、3つのティアすべてで期間限定無料と記載されています。
コスト例。 1000万の非キャッシュ入力トークンと100万の出力トークンの場合、リスト価格では次のようになります。
| ワークロード | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 1000万入力 + 100万出力 | $4.95 | $2.00 | $18.40 |
| 同じ量、入力はすべてキャッシュから | $2.00 | $0.80 | $6.60 |
FlashXは入力と出力でFlashのおよそ2.5倍であり、それでもGLM-5.3を大きく下回ります。それが価値があるかどうかは、遅いターンがあなたにいくらのコストをもたらすかに完全に依存します — バッチパイプラインではめったに価値はなく、対話型エージェントではしばしば価値があります。
GLM-5.3-FlashXの呼び出し方法
FlashXはFlashと同じチャット補完インターフェースを使用するため、移行は1行の変更です。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
ストリーミングでは、Zhipuの推奨に従ってstream: trueとtool_stream: trueを追加してください。このモデルでは思考をオフにできないため、コスト見積もりとクライアントのタイムアウトにおいて推論トークン分を考慮に入れてください。
実践的な移行パス: モデルIDを設定可能に保ち、本番トラフィックの代表的なスライスをglm-5.3-flashとglm-5.3-flashxの両方に送り、ワークロードを切り替える前に完了率、初回トークンまでの時間、完了したタスクあたりのコストを比較してください。
FlashX、Flash、GLM-5.3の選択
- FlashXを選ぶのは、対話型プロダクト、IDE側の補完、多数の短いターンを持つエージェントループで、ターンあたりの実時間が制約であり、ワークロードが依然としてFlashクラスの能力に収まる場合です。
- Flashを選ぶのは、バッチ処理、オフライン生成、タスクあたりのコストがレイテンシよりも重要な大量パイプライン、そしてオープンウェイトまたはセルフホストのデプロイの場合です。Flashは公開されたウェイトを持つティアだからです。
- GLM-5.3を選ぶのは、Flashティアのコストプロファイルではなく、フラッグシップの上限が必要な場合です。
- 速度向上が均等に適用されると仮定しないでください。 プリフィルが重い長コンテキストのリクエストやツールに制約されたエージェントのターンは、短い生成タスクよりもはるかに恩恵が少ない可能性があります。実際に実行するワークロードを測定してください。
APIMaster.aiでGLMファミリーを始める
APIMasterは、GLMファミリーをClaude、GPT、DeepSeek、Qwen、Gemini、Kimi、その他のモデルとともに、1つのOpenAI互換キーで提供します — 従量課金の料金は**$1から、選択されたルートでは公式料金から最大70%オフ**です。
FlashXはFlashと同じリクエスト形式を維持するため、すでにAPIMaster経由でGLMを呼び出しているチームは、モデルID以外の統合に触れることなく、より高速なティアを評価できます。
- APIMasterアカウントを作成。
- $1から始まる従量課金のクレジットを追加。
- **APIMasterコンソール**でAPIキーを作成。
- OpenAI互換クライアントを
https://apimaster.ai/v1に向け、評価したいモデルIDを設定。
APIMasterに登録 · モデルマーケットプレイスを探索 · モデル識別をテスト
FAQ
GLM-5.3-FlashXは新しいモデルですか? いいえ。GLM-5.3-Flashの高速サービングティアです。同じモデル、同じコンテキストウィンドウ、同じマルチモーダル入力 — より高速な推論構成と異なる価格です。
GLM-5.3-FlashXのモデルIDは何ですか?
glm-5.3-flashxです。標準ティアはglm-5.3-flashです。
GLM-5.3-FlashXはどのくらい速いですか? Zhipuは最大200トークン/秒を公表しています。これはピーク値です。自分のプロンプトで初回トークンまでの時間と持続スループットを測定してください。
GLM-5.3-FlashXの料金はいくらですか? Zhipuの表示では、100万入力トークンあたり$0.37、100万出力トークンあたり$1.25、100万キャッシュ入力トークンあたり$0.075 — 入力と出力でGLM-5.3-Flashのおよそ2.5倍の価格です。
コンテキストウィンドウはどのくらいですか? 100万トークンで、最大128,000出力トークン、GLM-5.3-Flashと同じです。
GLM-5.3-FlashXは画像と動画を受け付けますか?
はい。動画、画像、テキスト、ファイル入力を受け付け、テキストを返します。画像はimage_urlコンテンツブロックとして、URLまたはBase64データURLで送信されます。
GLM-5.3-FlashXはGLM Coding Planに含まれますか? ローンチ時点では含まれません。GLM-5.3-FlashはGLM-5.3の3倍のクォータでプランに完全に含まれており、週末を含むオフピークの呼び出しは標準ポイントの50%を消費します。
トークンを節約するために思考をオフにできますか?
いいえ。thinking.typeはenabledのみをサポートします。Zhipuはマルチターンの作業では思考履歴を保持すること(clear_thinking: false)を推奨しています。
ベンチマークの数値は独立していますか? いいえ。それらはZhipuによって公表されています。方向性として扱い、本番トラフィックを投入する前に独自の評価を再実行してください。
出典と参考資料
- Z.ai — GLM-5.3-Flash/FlashX モデルドキュメント — モデルID、パラメータ、機能、推奨設定、ベンチマーク、サービングの詳細
- Z.ai — 料金 — 公式の100万トークンあたりリスト価格
- Z.ai — GLM-5.3-Flash 技術ブログ — アーキテクチャ、効率比較、評価表
- Hugging Face — zai-org/GLM-5.3-Flash — ベースモデルのオープンウェイト
- PANews — Zhipu launches GLM-5.3-FlashX — ローンチレポートとOx-Alphaの背景
すべての出典は2026年9月18日に確認済みです。価格と可用性は変わります。大規模なワークロードを投入する前に、現在の条件を確認してください。