APIMaster.ai
返回部落格
APIMaster 部落格

GLM-5.3-FlashX:它是什麼、跑得多快,以及要花多少錢

GLM-5.3-FlashX 是智譜為 GLM-5.3-Flash 推出的高速服務層級,於 2026 年 9 月 18 日發布,速度最高可達 200 tokens/s。以下是已確認的模型 ID、定價、上下文視窗、基準測試,以及如何呼叫它。

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

發布於 2026-09-18

快速結論

GLM-5.3-FlashX 是智譜為 GLM-5.3-Flash 推出的高速服務層級,於 2026 年 9 月 18 日發布,公布的最高推論速度為 200 tokens/s。 它不是一個新模型:它是同一個 GLM-5.3-Flash 系統——總參數 320B、啟用參數 18B、1M token 上下文視窗、最高 128,000 輸出 token,並原生支援圖像、影片、檔案與文字輸入——透過更快的推論配置來提供服務。

API 模型 ID 是 glm-5.3-flashx,與 glm-5.3-flash 並列。取捨很直接:FlashX 每 token 的成本高於 Flash(智譜列出 每 1M token 輸入 $0.37 / 輸出 $1.25,而 Flash 為 $0.15 / $0.50),換來更快的回應。Flash 同時也是開放權重、以及納入 GLM Coding Plan 的層級,其中 Flash 可獲得 GLM-5.3 的 3 倍配額。

如果你需要吞吐量、互動式延遲,或是一個會執行大量短回合的 agent 迴圈,FlashX 就是為此設計的層級。如果你正在最佳化每個完成任務的成本,而且可以等待,那麼對於完全相同的工作,Flash 更便宜。

什麼是 GLM-5.3-FlashX?

GLM-5.3-FlashX 是 GLM-5.3-Flash 系列中針對速度最佳化的端點。智譜於 2026 年 9 月 18 日發布,將其描述為對企業與開發者而言更快、更順暢,API 與官方體驗中心都在發布時同步開放。

有兩件事值得分開來看:

  • 模型——GLM-5.3-Flash,一個 320B-A18B 的原生多模態模型,智譜於 2026 年 8 月 26 日開源。架構、權重、上下文長度與能力都是共用的。
  • 服務層級——FlashX,一種針對吞吐量調校的推論配置。智譜回報速度最高可達 200 tokens/s,並將此提升歸因於基礎設施工作,而非不同的檢查點。

當你評估它時,這個區別很重要。為 GLM-5.3-Flash 描述的基準測試、上下文限制與多模態行為都適用於 FlashX,因為它們是同一個模型。延遲與價格則不然:這些會隨服務層級而改變。

模型規格一覽

規格 GLM-5.3-FlashX
API 模型 ID glm-5.3-flashx
同系列模型 ID glm-5.3-flash
發布日期 2026 年 9 月 18 日
總參數 / 啟用參數 320B / 18B
層數 45
上下文視窗 1M tokens
最大輸出 token 數 128K
輸入模態 影片、圖像、文字、檔案
輸出模態 文字
公布的最高速度 200 tokens/s
思考模式 thinking.type: enabled;無法停用
核心 API 功能 串流、函式呼叫、上下文快取、結構化輸出、工具串流

智譜建議使用 temperature: 1top_p: 0.95reasoning_effort: max。對於多輪工作,它建議保留思考歷史而非清除它(clear_thinking: false),而對於串流請求,它建議同時啟用 stream: truetool_stream: true

GLM-5.3-FlashX 與 GLM-5.3-Flash 的比較

面向 GLM-5.3-Flash GLM-5.3-FlashX
底層模型 GLM-5.3-Flash GLM-5.3-Flash
公布的最高速度 標準層級 最高 200 tokens/s
列表輸入價格 / 1M $0.15 $0.37
列表輸出價格 / 1M $0.50 $1.25
上下文與輸出限制 1M / 128K 1M / 128K
多模態輸入
開放權重 是,自 2026 年 8 月 26 日起 相同基礎模型
GLM Coding Plan 包含,並有 GLM-5.3 配額的 3 倍 發布時未包含

請求格式完全相同。從一個層級切換到另一個層級,只是變更 model 欄位,而不是重寫你的整合——這讓 FlashX 成為在每回合時間是瓶頸的工作負載上,一個合理的 A/B 候選。

「200 tokens/s」能告訴你什麼、不能告訴你什麼

智譜公布 200 tokens/s 為最大值。請把它解讀為生成速度的上限,而不是對你的工作負載的承諾:

  • 這是峰值數字。 實際吞吐量取決於提示長度、快取命中、並行度與所選的供應商。
  • 這不是首 token 時間。 如果模型在輸出任何內容前思考了好幾秒,再快的解碼速率仍會讓人覺得慢。對於互動式產品,兩者都要測量。
  • 這不是總任務延遲。 一個呼叫三個工具的 agent 回合,其上限取決於工具執行,而非 token 速率。
  • 長上下文會改變情況。 在 1M tokens 時,prefill 與 KV-cache 行為會主導一切。這正是 Flash 架構所針對的目標。

實用原則:在你自己的提示上對 Flash 與 FlashX 進行基準測試,並比較 首 token 時間、每秒輸出 token 數,以及每個完成任務的成本,而不是單一的速度數字。

速度從何而來

智譜將 FlashX 的加速歸因於基礎設施投資,而非新架構,並建立在已服務 GLM-5.3-Flash 流量的 100,000 個國產 AI 加速器之上。

  • 在 SGLang 上的專用推論引擎,為此架構而寫,而非從通用堆疊改編而來。
  • 針對 1M token 上下文的記憶體最佳化,包括 ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 快取量化,以及 Layer Split。
  • Encode–Prefill–Decode(EPD)分離式服務架構,將多模態編碼、提示 prefill 與逐 token 解碼分離到可獨立排程的工作池中,讓每個階段各自擴展。
  • 相較於同一硬體上的初始基準,端到端服務提升 3 倍,智譜表示這使每 token 成本達到與主流 NVIDIA GPU 相當的水準。

這項工作中有一個細節本身就值得注意:智譜表示,一個由 GLM-5.3 驅動的基礎設施 agent 協助工程師最佳化核心、診斷瓶頸並改進服務堆疊——模型參與了服務它自身的系統。

基準測試:智譜為基礎模型回報的結果

以下所有數字皆由智譜為 GLM-5.3-Flash 公布,並適用於 FlashX,因為模型相同。它們是供應商回報的結果,而非獨立重現。

基準測試 GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63.4 46.2
AutomationBench 48.8 26.2
Z.ai Code Bench v1.0,最大 effort 29.0 Claude Opus 4.8:29.5

智譜也回報,GLM-5.3-Flash 在其折扣定價下,於 Artificial Analysis Intelligence Index v4.1.1 獲得 57 分,每任務 $0.045——它表示這個水準過去只能以約 10 倍的成本取得——並且其程式編寫表現在該公司內部的 Z.ai Code Bench 上與 Claude Opus 4.8 相當。

請將這些視為方向,而非保證。供應商基準測試通常是在對供應商有利的測試框架版本上執行;上述 Z.ai Code Bench 那一行是在 Claude Code 2.1.207 上測量的。在將生產流量轉移過去之前,請重新執行你自己的評估。

架構:為何 Flash 層級的執行成本很低

FlashX 繼承了讓 Flash 服務成本很低的設計,這正是更快的層級得以存在、而不會讓價格跳到旗艦級水準的原因。

  • 混合稀疏與線性注意力。 智譜將其描述為首個結合兩者的開源前沿模型。線性注意力透過狀態建模捕捉局部依賴;稀疏注意力透過輕量索引器檢索相關的全局上下文。
  • IndexPool。 四個索引器鍵向量透過加權池化壓縮為一個,在 1M token 上下文下降低索引器的延遲與記憶體開銷。
  • 流形約束超連接(mHC),以獲得更好的擴展效率。
  • 每 token 成本低於 GLM-5.3。 智譜回報其注意力運算比 GLM-5.3 少 3.01 倍,KV cache 小 4.44 倍。相較於 GLM-5.3,啟用參數數量從 32B 降至 18B,層數從 92 降至 45。
  • 一個 30 兆 token 的多模態預訓練語料庫。

智譜坦承 KV cache 仍略大於 Kimi-K3 與 DeepSeek-V4-Flash 的,並稱這是未來工作的方向——這是一個有用的提醒:架構比較是逐維度進行的,而非單一排名。

Ox-Alpha:那個公開測試的匿名模型

在 Flash 發布之前,智譜以 Ox-Alpha 之名在 OpenCode 與 OpenRouter 上匿名運行 GLM-5.3-Flash。根據智譜的說法,它成為當週最受歡迎的模型,並在兩個平台上創下使用紀錄,而所有這些流量都由中國 AI 晶片服務。

對開發者而言,有趣的部分不是排行榜位置,而是驗證方法:真實流量、真實程式編寫 agent、未知的模型名稱,且沒有品牌拉力。這是比基準測試表更強烈的訊號,儘管它仍是一次由供應商控制的推出,且未公布方法論。

原生多模態與視覺程式編寫

GLM-5.3-Flash 是首個從一開始就建構為多模態的 GLM-5 系列模型,而 FlashX 保留了這一點。圖像以 messages[].content[]type: image_url 的內容區塊傳入,可使用 URL 或 Base64 data URL,且多個區塊可合併在單一訊息中。影片與檔案輸入與圖像和文字一併記錄於文件中。

在實務上最重要的能力是視覺程式編寫:模型檢視渲染後的介面,與目標比較,然後迭代。智譜記錄了從截圖或錄影重建應用程式、建構 Blender 場景、製作 Godot 遊戲原型、運行瀏覽器與電腦使用 agent,以及重現 CAD 零件等工作流程——每一項都讓模型檢查自己渲染的輸出,而不只是生成程式碼。

同樣的迴圈延伸到文件工作。智譜展示了 PPTX、PDF、DOCX 與 XLSX 交付物、可追溯來源的財務研究、附帶追蹤註解的合約審查,以及法律起草,並讓模型渲染並目視檢查自己的輸出,以找出溢出、錯位與不一致的樣式。

智譜給出的一個例子格外具體:在沒有外部素材的情況下,GLM-5.3-Flash 自主運行了 16 小時,以 Blender 場景建構出約 400 平方公尺的主廚住宅與測試廚房。

定價:FlashX 要花多少錢

來自智譜定價頁面的官方每 1M token 列表價格(查核於 2026 年 9 月 18 日):

Token 類型 GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
輸入(USD) $0.37 $0.15 $1.40
快取輸入(USD) $0.075 $0.03 $0.26
輸出(USD) $1.25 $0.50 $4.40

快取輸入儲存在三個層級中皆列為限時免費。

成本範例。 對於 10M 未快取輸入 token 與 1M 輸出 token,列表價格為:

工作負載 GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M 輸入 + 1M 輸出 $4.95 $2.00 $18.40
相同量,全部輸入來自快取 $2.00 $0.80 $6.60

FlashX 在輸入與輸出上大約是 Flash 的 2.5 倍,且仍遠低於 GLM-5.3。這是否值得,完全取決於一個慢回合對你造成多少成本——對於批次管線,通常不值得;對於互動式 agent,則往往值得。

如何呼叫 GLM-5.3-FlashX

FlashX 使用與 Flash 相同的 chat-completions 介面,因此遷移只需改一行。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

對於串流,依智譜的建議加入 stream: truetool_stream: true。請注意,此模型無法關閉思考,因此請在你的成本估算與客戶端逾時中為推理 token 編列預算。

一個實用的遷移路徑:讓模型 ID 保持可配置,將具代表性的生產流量切片同時送往 glm-5.3-flashglm-5.3-flashx,並在切換工作負載之前比較完成率、首 token 時間與每個完成任務的成本。

在 FlashX、Flash 與 GLM-5.3 之間做選擇

  • 選擇 FlashX,適用於互動式產品、IDE 端的補全,以及有大量短回合的 agent 迴圈,其中每回合的實際耗時是限制條件,且工作負載仍符合 Flash 級能力。
  • 選擇 Flash,適用於批次處理、離線生成,以及每任務成本比延遲更重要的高流量管線——也適用於開放權重或自架部署,因為 Flash 是公布權重的層級。
  • 選擇 GLM-5.3,當你需要旗艦級的上限,而非 Flash 層級的成本結構時。
  • 不要假設速度提升會平均適用。 偏重 prefill 的長上下文請求,以及受工具限制的 agent 回合,可能獲得的效益遠低於短生成任務。請測量你實際運行的工作負載。

在 APIMaster.ai 上開始使用 GLM 系列

APIMaster 為你提供一把與 OpenAI 相容的金鑰,可用於 GLM 系列以及 Claude、GPT、DeepSeek、Qwen、Gemini、Kimi 與其他模型——採用按用量付費定價,從 $1 起,且在部分路由上可享官方費率最高 70% 折扣

由於 FlashX 與 Flash 保持相同的請求格式,已透過 APIMaster 呼叫 GLM 的團隊,除了模型 ID 之外無需更動整合,即可評估更快的層級。

  1. 建立 APIMaster 帳號
  2. 加入按用量付費額度,從 $1 起。
  3. APIMaster 主控台 建立 API 金鑰。
  4. 將你的 OpenAI 相容客戶端指向 https://apimaster.ai/v1,並設定你想評估的模型 ID。

註冊 APIMaster · 探索模型市集 · 測試模型身分

FAQ

GLM-5.3-FlashX 是新模型嗎? 不是。它是 GLM-5.3-Flash 的高速服務層級。相同模型、相同上下文視窗、相同多模態輸入——更快的推論配置與不同的價格。

GLM-5.3-FlashX 的模型 ID 是什麼? glm-5.3-flashx。標準層級是 glm-5.3-flash

GLM-5.3-FlashX 有多快? 智譜公布最大值為 200 tokens/s。那是峰值數字;請在你自己的提示上測量首 token 時間與持續吞吐量。

GLM-5.3-FlashX 要花多少錢? 智譜列出每 1M 輸入 token $0.37、每 1M 輸出 token $1.25,以及每 1M 快取輸入 token $0.075——在輸入與輸出上約為 GLM-5.3-Flash 價格的 2.5 倍。

上下文視窗是多少? 1M tokens,最高 128,000 輸出 token,與 GLM-5.3-Flash 相同。

GLM-5.3-FlashX 能接受圖像與影片嗎? 可以。它接受影片、圖像、文字與檔案輸入,並回傳文字。圖像以 image_url 內容區塊傳送,可透過 URL 或 Base64 data URL。

GLM-5.3-FlashX 在 GLM Coding Plan 中嗎? 發布時不在。GLM-5.3-Flash 在該方案中完全可用,並有 GLM-5.3 配額的 3 倍,且離峰呼叫(包括整個週末)僅消耗標準點數的 50%。

我可以關閉思考以節省 token 嗎? 不行。thinking.type 僅支援 enabled。智譜建議在多輪工作中保留思考歷史(clear_thinking: false)。

基準測試數字是獨立的嗎? 不是。它們由智譜公布。請將其視為方向性參考,並在投入生產流量之前重新執行你自己的評估。

來源與延伸閱讀

所有來源查核於 2026 年 9 月 18 日。價格與供應情況會變動;在投入大型工作負載之前,請確認當前條款。