GLM-5.3-FlashX:它是什麼、跑得多快,以及要花多少錢
GLM-5.3-FlashX 是智譜為 GLM-5.3-Flash 推出的高速服務層級,於 2026 年 9 月 18 日發布,速度最高可達 200 tokens/s。以下是已確認的模型 ID、定價、上下文視窗、基準測試,以及如何呼叫它。
發布於 2026-09-18
GLM-5.3-FlashX 是智譜為 GLM-5.3-Flash 推出的高速服務層級,於 2026 年 9 月 18 日發布,公布的最高推論速度為 200 tokens/s。 它不是一個新模型:它是同一個 GLM-5.3-Flash 系統——總參數 320B、啟用參數 18B、1M token 上下文視窗、最高 128,000 輸出 token,並原生支援圖像、影片、檔案與文字輸入——透過更快的推論配置來提供服務。
API 模型 ID 是 glm-5.3-flashx,與 glm-5.3-flash 並列。取捨很直接:FlashX 每 token 的成本高於 Flash(智譜列出 每 1M token 輸入 $0.37 / 輸出 $1.25,而 Flash 為 $0.15 / $0.50),換來更快的回應。Flash 同時也是開放權重、以及納入 GLM Coding Plan 的層級,其中 Flash 可獲得 GLM-5.3 的 3 倍配額。
如果你需要吞吐量、互動式延遲,或是一個會執行大量短回合的 agent 迴圈,FlashX 就是為此設計的層級。如果你正在最佳化每個完成任務的成本,而且可以等待,那麼對於完全相同的工作,Flash 更便宜。
什麼是 GLM-5.3-FlashX?
GLM-5.3-FlashX 是 GLM-5.3-Flash 系列中針對速度最佳化的端點。智譜於 2026 年 9 月 18 日發布,將其描述為對企業與開發者而言更快、更順暢,API 與官方體驗中心都在發布時同步開放。
有兩件事值得分開來看:
- 模型——GLM-5.3-Flash,一個 320B-A18B 的原生多模態模型,智譜於 2026 年 8 月 26 日開源。架構、權重、上下文長度與能力都是共用的。
- 服務層級——FlashX,一種針對吞吐量調校的推論配置。智譜回報速度最高可達 200 tokens/s,並將此提升歸因於基礎設施工作,而非不同的檢查點。
當你評估它時,這個區別很重要。為 GLM-5.3-Flash 描述的基準測試、上下文限制與多模態行為都適用於 FlashX,因為它們是同一個模型。延遲與價格則不然:這些會隨服務層級而改變。
模型規格一覽
| 規格 | GLM-5.3-FlashX |
|---|---|
| API 模型 ID | glm-5.3-flashx |
| 同系列模型 ID | glm-5.3-flash |
| 發布日期 | 2026 年 9 月 18 日 |
| 總參數 / 啟用參數 | 320B / 18B |
| 層數 | 45 |
| 上下文視窗 | 1M tokens |
| 最大輸出 token 數 | 128K |
| 輸入模態 | 影片、圖像、文字、檔案 |
| 輸出模態 | 文字 |
| 公布的最高速度 | 200 tokens/s |
| 思考模式 | 僅 thinking.type: enabled;無法停用 |
| 核心 API 功能 | 串流、函式呼叫、上下文快取、結構化輸出、工具串流 |
智譜建議使用 temperature: 1、top_p: 0.95 與 reasoning_effort: max。對於多輪工作,它建議保留思考歷史而非清除它(clear_thinking: false),而對於串流請求,它建議同時啟用 stream: true 與 tool_stream: true。
GLM-5.3-FlashX 與 GLM-5.3-Flash 的比較
| 面向 | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| 底層模型 | GLM-5.3-Flash | GLM-5.3-Flash |
| 公布的最高速度 | 標準層級 | 最高 200 tokens/s |
| 列表輸入價格 / 1M | $0.15 | $0.37 |
| 列表輸出價格 / 1M | $0.50 | $1.25 |
| 上下文與輸出限制 | 1M / 128K | 1M / 128K |
| 多模態輸入 | 是 | 是 |
| 開放權重 | 是,自 2026 年 8 月 26 日起 | 相同基礎模型 |
| GLM Coding Plan | 包含,並有 GLM-5.3 配額的 3 倍 | 發布時未包含 |
請求格式完全相同。從一個層級切換到另一個層級,只是變更 model 欄位,而不是重寫你的整合——這讓 FlashX 成為在每回合時間是瓶頸的工作負載上,一個合理的 A/B 候選。
「200 tokens/s」能告訴你什麼、不能告訴你什麼
智譜公布 200 tokens/s 為最大值。請把它解讀為生成速度的上限,而不是對你的工作負載的承諾:
- 這是峰值數字。 實際吞吐量取決於提示長度、快取命中、並行度與所選的供應商。
- 這不是首 token 時間。 如果模型在輸出任何內容前思考了好幾秒,再快的解碼速率仍會讓人覺得慢。對於互動式產品,兩者都要測量。
- 這不是總任務延遲。 一個呼叫三個工具的 agent 回合,其上限取決於工具執行,而非 token 速率。
- 長上下文會改變情況。 在 1M tokens 時,prefill 與 KV-cache 行為會主導一切。這正是 Flash 架構所針對的目標。
實用原則:在你自己的提示上對 Flash 與 FlashX 進行基準測試,並比較 首 token 時間、每秒輸出 token 數,以及每個完成任務的成本,而不是單一的速度數字。
速度從何而來
智譜將 FlashX 的加速歸因於基礎設施投資,而非新架構,並建立在已服務 GLM-5.3-Flash 流量的 100,000 個國產 AI 加速器之上。
- 在 SGLang 上的專用推論引擎,為此架構而寫,而非從通用堆疊改編而來。
- 針對 1M token 上下文的記憶體最佳化,包括 ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 快取量化,以及 Layer Split。
- Encode–Prefill–Decode(EPD)分離式服務架構,將多模態編碼、提示 prefill 與逐 token 解碼分離到可獨立排程的工作池中,讓每個階段各自擴展。
- 相較於同一硬體上的初始基準,端到端服務提升 3 倍,智譜表示這使每 token 成本達到與主流 NVIDIA GPU 相當的水準。
這項工作中有一個細節本身就值得注意:智譜表示,一個由 GLM-5.3 驅動的基礎設施 agent 協助工程師最佳化核心、診斷瓶頸並改進服務堆疊——模型參與了服務它自身的系統。
基準測試:智譜為基礎模型回報的結果
以下所有數字皆由智譜為 GLM-5.3-Flash 公布,並適用於 FlashX,因為模型相同。它們是供應商回報的結果,而非獨立重現。
| 基準測試 | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0,最大 effort | 29.0 | Claude Opus 4.8:29.5 |
智譜也回報,GLM-5.3-Flash 在其折扣定價下,於 Artificial Analysis Intelligence Index v4.1.1 獲得 57 分,每任務 $0.045——它表示這個水準過去只能以約 10 倍的成本取得——並且其程式編寫表現在該公司內部的 Z.ai Code Bench 上與 Claude Opus 4.8 相當。
請將這些視為方向,而非保證。供應商基準測試通常是在對供應商有利的測試框架版本上執行;上述 Z.ai Code Bench 那一行是在 Claude Code 2.1.207 上測量的。在將生產流量轉移過去之前,請重新執行你自己的評估。
架構:為何 Flash 層級的執行成本很低
FlashX 繼承了讓 Flash 服務成本很低的設計,這正是更快的層級得以存在、而不會讓價格跳到旗艦級水準的原因。
- 混合稀疏與線性注意力。 智譜將其描述為首個結合兩者的開源前沿模型。線性注意力透過狀態建模捕捉局部依賴;稀疏注意力透過輕量索引器檢索相關的全局上下文。
- IndexPool。 四個索引器鍵向量透過加權池化壓縮為一個,在 1M token 上下文下降低索引器的延遲與記憶體開銷。
- 流形約束超連接(mHC),以獲得更好的擴展效率。
- 每 token 成本低於 GLM-5.3。 智譜回報其注意力運算比 GLM-5.3 少 3.01 倍,KV cache 小 4.44 倍。相較於 GLM-5.3,啟用參數數量從 32B 降至 18B,層數從 92 降至 45。
- 一個 30 兆 token 的多模態預訓練語料庫。
智譜坦承 KV cache 仍略大於 Kimi-K3 與 DeepSeek-V4-Flash 的,並稱這是未來工作的方向——這是一個有用的提醒:架構比較是逐維度進行的,而非單一排名。
Ox-Alpha:那個公開測試的匿名模型
在 Flash 發布之前,智譜以 Ox-Alpha 之名在 OpenCode 與 OpenRouter 上匿名運行 GLM-5.3-Flash。根據智譜的說法,它成為當週最受歡迎的模型,並在兩個平台上創下使用紀錄,而所有這些流量都由中國 AI 晶片服務。
對開發者而言,有趣的部分不是排行榜位置,而是驗證方法:真實流量、真實程式編寫 agent、未知的模型名稱,且沒有品牌拉力。這是比基準測試表更強烈的訊號,儘管它仍是一次由供應商控制的推出,且未公布方法論。
原生多模態與視覺程式編寫
GLM-5.3-Flash 是首個從一開始就建構為多模態的 GLM-5 系列模型,而 FlashX 保留了這一點。圖像以 messages[].content[] 內 type: image_url 的內容區塊傳入,可使用 URL 或 Base64 data URL,且多個區塊可合併在單一訊息中。影片與檔案輸入與圖像和文字一併記錄於文件中。
在實務上最重要的能力是視覺程式編寫:模型檢視渲染後的介面,與目標比較,然後迭代。智譜記錄了從截圖或錄影重建應用程式、建構 Blender 場景、製作 Godot 遊戲原型、運行瀏覽器與電腦使用 agent,以及重現 CAD 零件等工作流程——每一項都讓模型檢查自己渲染的輸出,而不只是生成程式碼。
同樣的迴圈延伸到文件工作。智譜展示了 PPTX、PDF、DOCX 與 XLSX 交付物、可追溯來源的財務研究、附帶追蹤註解的合約審查,以及法律起草,並讓模型渲染並目視檢查自己的輸出,以找出溢出、錯位與不一致的樣式。
智譜給出的一個例子格外具體:在沒有外部素材的情況下,GLM-5.3-Flash 自主運行了 16 小時,以 Blender 場景建構出約 400 平方公尺的主廚住宅與測試廚房。
定價:FlashX 要花多少錢
來自智譜定價頁面的官方每 1M token 列表價格(查核於 2026 年 9 月 18 日):
| Token 類型 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 輸入(USD) | $0.37 | $0.15 | $1.40 |
| 快取輸入(USD) | $0.075 | $0.03 | $0.26 |
| 輸出(USD) | $1.25 | $0.50 | $4.40 |
快取輸入儲存在三個層級中皆列為限時免費。
成本範例。 對於 10M 未快取輸入 token 與 1M 輸出 token,列表價格為:
| 工作負載 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 10M 輸入 + 1M 輸出 | $4.95 | $2.00 | $18.40 |
| 相同量,全部輸入來自快取 | $2.00 | $0.80 | $6.60 |
FlashX 在輸入與輸出上大約是 Flash 的 2.5 倍,且仍遠低於 GLM-5.3。這是否值得,完全取決於一個慢回合對你造成多少成本——對於批次管線,通常不值得;對於互動式 agent,則往往值得。
如何呼叫 GLM-5.3-FlashX
FlashX 使用與 Flash 相同的 chat-completions 介面,因此遷移只需改一行。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
對於串流,依智譜的建議加入 stream: true 與 tool_stream: true。請注意,此模型無法關閉思考,因此請在你的成本估算與客戶端逾時中為推理 token 編列預算。
一個實用的遷移路徑:讓模型 ID 保持可配置,將具代表性的生產流量切片同時送往 glm-5.3-flash 與 glm-5.3-flashx,並在切換工作負載之前比較完成率、首 token 時間與每個完成任務的成本。
在 FlashX、Flash 與 GLM-5.3 之間做選擇
- 選擇 FlashX,適用於互動式產品、IDE 端的補全,以及有大量短回合的 agent 迴圈,其中每回合的實際耗時是限制條件,且工作負載仍符合 Flash 級能力。
- 選擇 Flash,適用於批次處理、離線生成,以及每任務成本比延遲更重要的高流量管線——也適用於開放權重或自架部署,因為 Flash 是公布權重的層級。
- 選擇 GLM-5.3,當你需要旗艦級的上限,而非 Flash 層級的成本結構時。
- 不要假設速度提升會平均適用。 偏重 prefill 的長上下文請求,以及受工具限制的 agent 回合,可能獲得的效益遠低於短生成任務。請測量你實際運行的工作負載。
在 APIMaster.ai 上開始使用 GLM 系列
APIMaster 為你提供一把與 OpenAI 相容的金鑰,可用於 GLM 系列以及 Claude、GPT、DeepSeek、Qwen、Gemini、Kimi 與其他模型——採用按用量付費定價,從 $1 起,且在部分路由上可享官方費率最高 70% 折扣。
由於 FlashX 與 Flash 保持相同的請求格式,已透過 APIMaster 呼叫 GLM 的團隊,除了模型 ID 之外無需更動整合,即可評估更快的層級。
- 建立 APIMaster 帳號。
- 加入按用量付費額度,從 $1 起。
- 在 APIMaster 主控台 建立 API 金鑰。
- 將你的 OpenAI 相容客戶端指向
https://apimaster.ai/v1,並設定你想評估的模型 ID。
註冊 APIMaster · 探索模型市集 · 測試模型身分
FAQ
GLM-5.3-FlashX 是新模型嗎? 不是。它是 GLM-5.3-Flash 的高速服務層級。相同模型、相同上下文視窗、相同多模態輸入——更快的推論配置與不同的價格。
GLM-5.3-FlashX 的模型 ID 是什麼?
glm-5.3-flashx。標準層級是 glm-5.3-flash。
GLM-5.3-FlashX 有多快? 智譜公布最大值為 200 tokens/s。那是峰值數字;請在你自己的提示上測量首 token 時間與持續吞吐量。
GLM-5.3-FlashX 要花多少錢? 智譜列出每 1M 輸入 token $0.37、每 1M 輸出 token $1.25,以及每 1M 快取輸入 token $0.075——在輸入與輸出上約為 GLM-5.3-Flash 價格的 2.5 倍。
上下文視窗是多少? 1M tokens,最高 128,000 輸出 token,與 GLM-5.3-Flash 相同。
GLM-5.3-FlashX 能接受圖像與影片嗎?
可以。它接受影片、圖像、文字與檔案輸入,並回傳文字。圖像以 image_url 內容區塊傳送,可透過 URL 或 Base64 data URL。
GLM-5.3-FlashX 在 GLM Coding Plan 中嗎? 發布時不在。GLM-5.3-Flash 在該方案中完全可用,並有 GLM-5.3 配額的 3 倍,且離峰呼叫(包括整個週末)僅消耗標準點數的 50%。
我可以關閉思考以節省 token 嗎?
不行。thinking.type 僅支援 enabled。智譜建議在多輪工作中保留思考歷史(clear_thinking: false)。
基準測試數字是獨立的嗎? 不是。它們由智譜公布。請將其視為方向性參考,並在投入生產流量之前重新執行你自己的評估。
來源與延伸閱讀
- Z.ai — GLM-5.3-Flash/FlashX 模型文件 — 模型 ID、參數、能力、建議設定、基準測試與服務細節
- Z.ai — 定價 — 官方每 1M token 列表價格
- Z.ai — GLM-5.3-Flash 技術部落格 — 架構、效率比較與評估表
- Hugging Face — zai-org/GLM-5.3-Flash — 基礎模型的開放權重
- PANews — Zhipu launches GLM-5.3-FlashX — 發布報導與 Ox-Alpha 背景
所有來源查核於 2026 年 9 月 18 日。價格與供應情況會變動;在投入大型工作負載之前,請確認當前條款。