APIMaster.ai
返回博客
APIMaster 博客

GLM-5.3-FlashX:它是什么、运行有多快、成本是多少

GLM-5.3-FlashX 是智谱为 GLM-5.3-Flash 推出的高速服务层级,于 2026 年 9 月 18 日发布,最高可达 200 tokens/s。以下是已确认的模型 ID、定价、上下文窗口、基准测试,以及如何调用它。

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

发布于 2026-09-18

快速结论

GLM-5.3-FlashX 是智谱为 GLM-5.3-Flash 推出的高速服务层级,于 2026 年 9 月 18 日发布,公布的峰值推理速度为 200 tokens/s。 它并非新模型:它是同一个 GLM-5.3-Flash 系统——320B 总参数、18B 激活参数、1M token 上下文窗口、最高 128,000 输出 token,并原生支持图像、视频、文件和文本输入——通过更快的推理配置提供服务。

API 模型 ID 为 glm-5.3-flashx,与 glm-5.3-flash 并列。取舍很直接:FlashX 每 token 成本高于 Flash(智谱列出 每 1M token 输入 $0.37 / 输出 $1.25,而 Flash 为 $0.15 / $0.50),但响应更快。Flash 也是拥有开放权重、并被纳入 GLM Coding Plan 的层级,其中 Flash 获得 GLM-5.3 的 3 倍配额。

如果你需要吞吐量、交互式延迟,或运行大量短轮次的 agent 循环,FlashX 就是为此设计的层级。如果你在优化每个已完成任务的成本且可以等待,那么对于相同的工作,Flash 更便宜。

什么是 GLM-5.3-FlashX?

GLM-5.3-FlashX 是 GLM-5.3-Flash 家族中速度优化的端点。智谱于 2026 年 9 月 18 日发布它,称其对企业与开发者而言更快、更流畅,API 和官方体验中心均在发布时开放。

有两点值得区分:

  • 模型——GLM-5.3-Flash,一个 320B-A18B 原生多模态模型,智谱于 2026 年 8 月 26 日开源。架构、权重、上下文长度和能力均相同。
  • 服务层级——FlashX,一种为吞吐量调优的推理配置。智谱报告速度最高可达 200 tokens/s,并将这一提升归因于基础设施工作,而非不同的检查点。

这一区分在你评估它时很重要。为 GLM-5.3-Flash 描述的基准测试、上下文限制和多模态行为同样适用于 FlashX,因为它们是同一个模型。延迟和价格则不然:这些会随服务层级而变化。

模型规格一览

规格 GLM-5.3-FlashX
API 模型 ID glm-5.3-flashx
同级模型 ID glm-5.3-flash
发布日期 2026 年 9 月 18 日
总参数 / 激活参数 320B / 18B
层数 45
上下文窗口 1M tokens
最大输出 token 128K
输入模态 视频、图像、文本、文件
输出模态 文本
公布的峰值速度 200 tokens/s
思考模式 thinking.type: enabled;无法禁用
核心 API 功能 流式传输、函数调用、上下文缓存、结构化输出、工具流式传输

智谱推荐 temperature: 1top_p: 0.95reasoning_effort: max。对于多轮工作,它建议保留思考历史而非清除(clear_thinking: false),对于流式请求,它建议同时启用 stream: truetool_stream: true

GLM-5.3-FlashX 与 GLM-5.3-Flash 对比

维度 GLM-5.3-Flash GLM-5.3-FlashX
底层模型 GLM-5.3-Flash GLM-5.3-Flash
公布的峰值速度 标准层级 最高 200 tokens/s
标价输入价格 / 1M $0.15 $0.37
标价输出价格 / 1M $0.50 $1.25
上下文与输出限制 1M / 128K 1M / 128K
多模态输入
开放权重 是,自 2026 年 8 月 26 日起 相同基础模型
GLM Coding Plan 包含,享有 GLM-5.3 配额的 3 倍 发布时未包含

请求格式完全相同。从一个层级切换到另一个层级只需更改 model 字段,而无需重写你的集成——这使得 FlashX 成为时间每轮次为瓶颈的工作负载的合理 A/B 候选。

“200 tokens/s”能告诉你什么、不能告诉你什么

智谱将 200 tokens/s 作为最大值公布。请将其理解为生成速度的上限,而非对你工作负载的承诺:

  • 这是峰值数字。 实际吞吐量取决于提示长度、缓存命中、并发和所选提供商。
  • 它不是首 token 时间。 如果模型在输出任何内容前思考数秒,即使解码速率很快,仍会感觉缓慢。对于交互式产品,两者都要测量。
  • 它不是总任务延迟。 一个调用三个工具的 agent 轮次受工具执行限制,而非 token 速率。
  • 长上下文会改变情况。 在 1M token 时,预填充和 KV 缓存行为占主导。这正是 Flash 架构所针对的。

实用规则:在你自己的提示上对 Flash 和 FlashX 进行基准测试,并比较 首 token 时间、每秒输出 token 数和每个已完成任务的成本,而非单一速度数字。

速度从何而来

智谱将 FlashX 的加速归因于基础设施投入,而非新架构,建立在已为 GLM-5.3-Flash 流量提供服务的 100,000 个国产 AI 加速器之上。

  • 基于 SGLang 的专用推理引擎,为该架构编写,而非从通用技术栈改编。
  • 针对 1M token 上下文的内存优化,包括 ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化以及 Layer Split。
  • 编码–预填充–解码(EPD)分离式服务架构,将多模态编码、提示预填充和逐 token 解码分离到独立调度的 worker 池中,使每个阶段可独立扩展。
  • 在相同硬件上端到端服务性能提升 3 倍,相比初始基线,智谱称这将每 token 成本降至与主流 NVIDIA GPU 相当的水平。

这项工作中的一个细节值得单独注意:智谱称,一个由 GLM-5.3 驱动的基础设施 agent 帮助工程师优化内核、诊断瓶颈并改进服务栈——模型参与了为它提供服务的系统。

基准测试:智谱为基础模型报告的结果

以下所有数字均由智谱为 GLM-5.3-Flash 公布,并适用于 FlashX,因为模型相同。它们是厂商报告的结果,而非独立复现。

基准测试 GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63.4 46.2
AutomationBench 48.8 26.2
Z.ai Code Bench v1.0,最大努力 29.0 Claude Opus 4.8:29.5

智谱还报告称,GLM-5.3-Flash 在其折扣定价下于 Artificial Analysis Intelligence Index v4.1.1 上得分 57,每任务成本 $0.045——它称这一水平此前只能以约 10 倍成本获得——并且其编码性能在公司内部的 Z.ai Code Bench 上与 Claude Opus 4.8 相当。

请将这些视为方向,而非保证。厂商基准测试通常在有利于厂商的测试框架版本上运行;上述 Z.ai Code Bench 一行是在 Claude Code 2.1.207 上测量的。在将生产流量迁移之前,请重新运行你自己的评估。

架构:为什么 Flash 层级运行成本低

FlashX 继承了使 Flash 服务成本很低的设计,这正是更快的层级能够存在而价格不跃升至旗舰水平的原因。

  • 混合稀疏与线性注意力。 智谱称其为首个将两者结合的开源前沿模型。线性注意力通过状态建模捕捉局部依赖;稀疏注意力通过轻量级索引器检索相关的全局上下文。
  • IndexPool。 四个索引器键向量通过加权池化压缩为一个,在 1M token 上下文下削减索引器的延迟和内存开销。
  • 流形约束超连接(mHC),以实现更好的扩展效率。
  • 每 token 成本低于 GLM-5.3。 智谱报告注意力计算减少 3.01 倍,KV 缓存比 GLM-5.3 小 4.44 倍。与 GLM-5.3 相比,激活参数数量从 32B 降至 18B,层数从 92 降至 45。
  • 一个 30 万亿 token 的多模态预训练语料库。

智谱坦承 KV 缓存仍略大于 Kimi-K3 和 DeepSeek-V4-Flash 的,并将其称为未来工作的方向——这提醒我们,架构比较是按维度进行的,而非单一排名。

Ox-Alpha:在公开环境中测试的匿名模型

在 Flash 发布之前,智谱在 OpenCode 和 OpenRouter 上以 Ox-Alpha 的名义匿名运行 GLM-5.3-Flash。据智谱称,它成为当周最受欢迎的模型,并在两个平台上创下使用记录,所有这些流量均在中国 AI 芯片上提供服务。

对开发者而言,有趣的部分不是排行榜位置,而是验证方法:真实流量、真实编码 agent、未知模型名称、无品牌拉动。这比基准测试表更强的信号,尽管仍是厂商控制的发布,且未公布方法论。

原生多模态与视觉编码

GLM-5.3-Flash 是首个从一开始就构建为多模态的 GLM-5 系列模型,FlashX 保留了这一点。图像作为 messages[].content[]type: image_url 的内容块传递,使用 URL 或 Base64 数据 URL,且可在一条消息中组合多个块。视频和文件输入与图像和文本一同记录在文档中。

在实践中最重要的能力是视觉编码:模型检查渲染后的界面,将其与目标比较,并迭代。智谱记录了从截图或录屏重建应用、构建 Blender 场景、制作 Godot 游戏原型、运行浏览器和计算机使用 agent,以及复现 CAD 零件的工作流——每一项都由模型检查自己的渲染输出,而不仅仅是生成代码。

同样的循环延伸到文档工作。智谱演示了 PPTX、PDF、DOCX 和 XLSX 交付物、可追溯来源的金融研究、带跟踪批注的合同审查,以及法律起草,模型渲染并目视检查自己的输出是否存在溢出、错位和样式不一致。

智谱给出的一个例子异常具体:在没有任何外部资源的情况下,GLM-5.3-Flash 自主运行 16 小时,构建了一个约 400 平方米的厨师住宅和测试厨房的 Blender 场景。

定价:FlashX 的成本

来自智谱定价页面的官方标价,每 1M token(2026 年 9 月 18 日查询):

Token 类型 GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
输入(USD) $0.37 $0.15 $1.40
缓存输入(USD) $0.075 $0.03 $0.26
输出(USD) $1.25 $0.50 $4.40

缓存输入存储在三个层级中均列为限时免费。

成本示例。 对于 10M 未缓存输入 token 和 1M 输出 token,标价给出:

工作负载 GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M 输入 + 1M 输出 $4.95 $2.00 $18.40
相同量,全部输入来自缓存 $2.00 $0.80 $6.60

FlashX 在输入和输出上约为 Flash 的 2.5 倍,且仍远低于 GLM-5.3。这是否值得完全取决于一个缓慢轮次对你意味着什么成本——对于批处理管道,通常不值得;对于交互式 agent,通常值得。

如何调用 GLM-5.3-FlashX

FlashX 使用与 Flash 相同的 chat-completions 接口,因此迁移只需更改一行。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

对于流式传输,按智谱的建议添加 stream: truetool_stream: true。请注意,此模型无法关闭思考,因此请在成本估算和客户端超时中为推理 token 预留预算。

实用的迁移路径:保持模型 ID 可配置,将生产流量的代表性切片同时发送到 glm-5.3-flashglm-5.3-flashx,并在切换工作负载之前比较完成率、首 token 时间和每个已完成任务的成本。

在 FlashX、Flash 和 GLM-5.3 之间选择

  • 选择 FlashX 用于交互式产品、IDE 侧补全,以及包含大量短轮次的 agent 循环,其中每轮次的墙钟时间是约束,且工作负载仍符合 Flash 级能力。
  • 选择 Flash 用于批处理、离线生成和高吞吐量管道,其中每任务成本比延迟更重要——也用于开放权重或自托管部署,因为 Flash 是拥有已发布权重的层级。
  • 选择 GLM-5.3 当你需要旗舰的上限而非 Flash 层级的成本特征时。
  • 不要假设速度提升会均匀适用。 预填充密集、长上下文的请求和受工具约束的 agent 轮次,其收益可能远低于短生成任务。测量你实际运行的工作负载。

在 APIMaster.ai 上开始使用 GLM 家族

APIMaster 为你提供一个 OpenAI 兼容密钥,可访问 GLM 家族以及 Claude、GPT、DeepSeek、Qwen、Gemini、Kimi 和其他模型——按量付费定价低至 $1 起,部分路由最高可享官方费率 70% 折扣

由于 FlashX 保持与 Flash 相同的请求格式,已通过 APIMaster 调用 GLM 的团队可以在除模型 ID 外无需改动集成的情况下评估更快的层级。

  1. 创建 APIMaster 账户
  2. 添加按量付费额度,低至 $1 起。
  3. APIMaster 控制台 中创建 API 密钥。
  4. 将你的 OpenAI 兼容客户端指向 https://apimaster.ai/v1,并设置你想评估的模型 ID。

注册 APIMaster · 探索模型市场 · 测试模型身份

FAQ

GLM-5.3-FlashX 是新模型吗? 不是。它是 GLM-5.3-Flash 的高速服务层级。相同模型、相同上下文窗口、相同多模态输入——更快的推理配置和不同的价格。

GLM-5.3-FlashX 的模型 ID 是什么? glm-5.3-flashx。标准层级为 glm-5.3-flash

GLM-5.3-FlashX 有多快? 智谱公布的最大值为 200 tokens/s。这是峰值数字;请在你自己的提示上测量首 token 时间和持续吞吐量。

GLM-5.3-FlashX 的成本是多少? 智谱列出每 1M 输入 token $0.37、每 1M 输出 token $1.25,以及每 1M 缓存输入 token $0.075——在输入和输出上约为 GLM-5.3-Flash 价格的 2.5 倍。

上下文窗口是多少? 1M tokens,最高 128,000 输出 token,与 GLM-5.3-Flash 相同。

GLM-5.3-FlashX 能接受图像和视频吗? 能。它接受视频、图像、文本和文件输入并返回文本。图像作为 image_url 内容块发送,通过 URL 或 Base64 数据 URL。

GLM-5.3-FlashX 在 GLM Coding Plan 中吗? 发布时不在。GLM-5.3-Flash 在该计划中完全可用,享有 GLM-5.3 配额的 3 倍,且包括整个周末在内的非高峰调用消耗标准积分的 50%。

我能关闭思考以节省 token 吗? 不能。thinking.type 仅支持 enabled。智谱建议在多轮工作中保留思考历史(clear_thinking: false)。

基准测试数字是独立的吗? 不是。它们由智谱公布。请将其视为方向性的,并在投入生产流量之前重新运行你自己的评估。

来源与延伸阅读

所有来源均于 2026 年 9 月 18 日查询。价格和可用性会变化;在投入大量工作负载之前,请核实当前条款。