GLM-5.3-FlashX: 무엇인지, 얼마나 빠른지, 그리고 비용은 얼마인지
GLM-5.3-FlashX는 GLM-5.3-Flash의 Zhipu 고속 서빙 티어로, 2026년 9월 18일 출시되었으며 최대 200 tokens/s를 제공합니다. 확인된 모델 ID, 가격, 컨텍스트 윈도우, 벤치마크, 그리고 호출 방법을 정리했습니다.
게시 2026-09-18
GLM-5.3-FlashX는 GLM-5.3-Flash의 Zhipu 고속 서빙 티어로, 2026년 9월 18일 출시되었으며 공표된 최대 추론 속도는 200 tokens/s입니다. 새로운 모델이 아닙니다. 동일한 GLM-5.3-Flash 시스템 — 총 320B 파라미터에 18B 활성화, 1M 토큰 컨텍스트 윈도우, 최대 128,000 출력 토큰, 그리고 네이티브 이미지·비디오·파일·텍스트 입력 — 을 더 빠른 추론 구성으로 서빙하는 것입니다.
API 모델 ID는 glm-5.3-flashx 이며 glm-5.3-flash 옆에 위치합니다. 트레이드오프는 명확합니다. FlashX는 Flash보다 토큰당 비용이 더 높고(Zhipu 기준 1M 토큰당 입력 $0.37 / 출력 $1.25 대 Flash의 $0.15 / $0.50) 더 빠른 응답을 제공합니다. 또한 Flash는 오픈 웨이트를 제공하는 티어이자 GLM Coding Plan에 포함되는 티어로, Flash는 GLM-5.3의 3배 할당량을 받습니다.
처리량, 대화형 지연 시간, 또는 짧은 턴을 많이 실행하는 에이전트 루프가 필요하다면 FlashX가 그 용도로 설계된 티어입니다. 완료된 작업당 비용을 최적화하고 기다릴 수 있다면, 동일한 작업에 대해 Flash가 더 저렴합니다.
GLM-5.3-FlashX란 무엇인가?
GLM-5.3-FlashX는 GLM-5.3-Flash 패밀리의 속도 최적화 엔드포인트입니다. Zhipu는 2026년 9월 18일 이를 발표하며 기업과 개발자를 위해 더 빠르고 매끄럽다고 설명했고, 출시 시점에 API와 공식 체험 센터가 모두 열렸습니다.
두 가지를 구분할 필요가 있습니다.
- 모델 — GLM-5.3-Flash, Zhipu가 2026년 8월 26일 오픈소스로 공개한 320B-A18B 네이티브 멀티모달 모델입니다. 아키텍처, 웨이트, 컨텍스트 길이, 기능이 공유됩니다.
- 서빙 티어 — FlashX, 처리량에 맞춰 튜닝된 추론 구성입니다. Zhipu는 최대 200 tokens/s의 속도를 보고하며, 이 향상이 다른 체크포인트가 아닌 인프라 작업에서 비롯된다고 설명합니다.
이 구분은 평가할 때 중요합니다. GLM-5.3-Flash에 대해 설명된 벤치마크, 컨텍스트 한도, 멀티모달 동작은 동일한 모델이므로 FlashX에도 적용됩니다. 지연 시간과 가격은 그렇지 않습니다. 이들은 서빙 티어에 따라 달라집니다.
한눈에 보는 모델 사양
| 사양 | GLM-5.3-FlashX |
|---|---|
| API 모델 ID | glm-5.3-flashx |
| 형제 모델 ID | glm-5.3-flash |
| 출시일 | 2026년 9월 18일 |
| 총 / 활성화 파라미터 | 320B / 18B |
| 레이어 | 45 |
| 컨텍스트 윈도우 | 1M 토큰 |
| 최대 출력 토큰 | 128K |
| 입력 모달리티 | 비디오, 이미지, 텍스트, 파일 |
| 출력 모달리티 | 텍스트 |
| 공표된 최대 속도 | 200 tokens/s |
| 사고 모드 | thinking.type: enabled만 지원하며 비활성화할 수 없음 |
| 핵심 API 기능 | 스트리밍, 함수 호출, 컨텍스트 캐싱, 구조화된 출력, 도구 스트리밍 |
Zhipu는 temperature: 1, top_p: 0.95, reasoning_effort: max를 권장합니다. 멀티턴 작업에는 사고 기록을 지우지 않고 유지할 것(clear_thinking: false)을, 스트리밍 요청에는 stream: true와 tool_stream: true를 모두 활성화할 것을 권장합니다.
GLM-5.3-FlashX vs GLM-5.3-Flash
| 항목 | GLM-5.3-Flash | GLM-5.3-FlashX |
|---|---|---|
| 기반 모델 | GLM-5.3-Flash | GLM-5.3-Flash |
| 공표된 최대 속도 | 표준 티어 | 최대 200 tokens/s |
| 정가 입력 가격 / 1M | $0.15 | $0.37 |
| 정가 출력 가격 / 1M | $0.50 | $1.25 |
| 컨텍스트 및 출력 한도 | 1M / 128K | 1M / 128K |
| 멀티모달 입력 | 지원 | 지원 |
| 오픈 웨이트 | 지원, 2026년 8월 26일부터 | 동일 기반 모델 |
| GLM Coding Plan | 포함, GLM-5.3 할당량의 3배 | 출시 시점 미포함 |
요청 형식은 동일합니다. 한 티어에서 다른 티어로 이동하는 것은 model 필드를 바꾸는 일이지 통합을 다시 작성하는 일이 아닙니다. 따라서 FlashX는 턴당 시간이 병목인 워크로드에 합리적인 A/B 후보가 됩니다.
"200 tokens/s"가 알려주는 것과 알려주지 않는 것
Zhipu는 200 tokens/s를 최대로 공표합니다. 이는 생성 속도의 상한으로 읽어야 하며, 여러분의 워크로드에 대한 약속이 아닙니다.
- 최대치 수치입니다. 실제 처리량은 프롬프트 길이, 캐시 적중, 동시성, 선택한 제공자에 따라 달라집니다.
- 첫 토큰까지의 시간이 아닙니다. 모델이 아무것도 출력하기 전에 몇 초간 사고한다면 빠른 디코드 속도도 여전히 느리게 느껴집니다. 대화형 제품에서는 둘 다 측정하세요.
- 총 작업 지연 시간이 아닙니다. 세 개의 도구를 호출하는 에이전트 턴은 토큰 속도가 아니라 도구 실행에 의해 제한됩니다.
- 긴 컨텍스트는 그림을 바꿉니다. 1M 토큰에서는 프리필과 KV 캐시 동작이 지배적입니다. 바로 이것이 Flash 아키텍처가 겨냥하는 부분입니다.
실용적인 원칙: Flash와 FlashX를 여러분의 프롬프트로 벤치마크하고, 단일 속도 수치가 아니라 첫 토큰까지의 시간, 초당 출력 토큰, 완료된 작업당 비용을 비교하세요.
속도는 어디에서 오는가
Zhipu는 FlashX의 속도 향상을 새로운 아키텍처가 아닌 인프라 투자에서 비롯된 것으로 설명하며, 이미 GLM-5.3-Flash 트래픽을 처리하는 10만 개의 국산 AI 가속기 위에 구축했습니다.
- SGLang 기반의 전용 추론 엔진으로, 범용 스택을 개조한 것이 아니라 이 아키텍처를 위해 작성되었습니다.
- 1M 토큰 컨텍스트를 위한 메모리 최적화로, ReplaySSM, W8A8 양자화, 하이브리드 INT8/FP8/BF16 캐시 양자화, Layer Split을 포함합니다.
- Encode–Prefill–Decode (EPD) 분리형 서빙 아키텍처로, 멀티모달 인코딩, 프롬프트 프리필, 토큰별 디코딩을 독립적으로 스케줄링되는 워커 풀로 분리하여 각 단계가 자체적으로 확장됩니다.
- 동일 하드웨어에서 초기 베이스라인 대비 3배의 엔드투엔드 서빙 개선으로, Zhipu는 이를 통해 토큰당 비용이 주류 NVIDIA GPU와 비슷한 수준에 이르렀다고 밝힙니다.
이 작업에서 나온 한 가지 세부 사항은 그 자체로 주목할 만합니다. Zhipu는 GLM-5.3 기반 인프라 에이전트가 엔지니어의 커널 최적화, 병목 진단, 서빙 스택 개선을 도왔다고 밝혔습니다. 즉, 모델이 자신을 서빙하는 시스템에 참여한 것입니다.
벤치마크: Zhipu가 기반 모델에 대해 보고한 수치
다음 수치는 모두 Zhipu가 GLM-5.3-Flash에 대해 공표한 것이며, 모델이 동일하므로 FlashX에도 적용됩니다. 이는 벤더가 보고한 결과이지 독립적인 재현이 아닙니다.
| 벤치마크 | GLM-5.3-Flash | GLM-5.2 |
|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 |
| AutomationBench | 48.8 | 26.2 |
| Z.ai Code Bench v1.0, max effort | 29.0 | Claude Opus 4.8: 29.5 |
Zhipu는 또한 GLM-5.3-Flash가 할인 가격 기준 Artificial Analysis Intelligence Index v4.1.1에서 작업당 $0.045로 57점을 기록했다고 보고하며, 이는 이전에는 약 10배의 비용에서만 가능했던 수준이라고 밝힙니다. 또한 자사의 내부 Z.ai Code Bench에서 코딩 성능이 Claude Opus 4.8에 필적한다고 합니다.
이를 보증이 아닌 방향성으로 받아들이세요. 벤더 벤치마크는 대개 벤더에 유리한 하네스 버전에서 실행됩니다. 위의 Z.ai Code Bench 수치는 Claude Code 2.1.207에서 측정되었습니다. 프로덕션 트래픽을 옮기기 전에 자체 평가를 다시 실행하세요.
아키텍처: Flash 티어가 저렴하게 운영되는 이유
FlashX는 Flash를 저렴하게 서빙할 수 있게 만든 설계를 물려받았으며, 이것이 더 빠른 티어가 플래그십 수준으로 가격이 뛰지 않고 존재할 수 있는 이유입니다.
- 하이브리드 희소 및 선형 어텐션. Zhipu는 이를 두 가지를 결합한 최초의 오픈소스 프런티어 모델이라고 설명합니다. 선형 어텐션은 상태 모델링을 통해 국소 의존성을 포착하고, 희소 어텐션은 경량 인덱서를 통해 관련 전역 컨텍스트를 검색합니다.
- IndexPool. 네 개의 인덱서 키 벡터를 가중 풀링으로 하나로 압축하여, 1M 토큰 컨텍스트에서 인덱서의 지연 시간과 메모리 오버헤드를 줄입니다.
- Manifold-Constrained Hyper-Connections (mHC) 로 확장 효율을 개선합니다.
- GLM-5.3보다 낮은 토큰당 비용. Zhipu는 GLM-5.3 대비 어텐션 연산이 3.01배 적고 KV 캐시가 4.44배 작다고 보고합니다. GLM-5.3과 비교해 활성화 파라미터 수는 32B에서 18B로, 레이어는 92에서 45로 줄어듭니다.
- 30조 토큰 규모의 멀티모달 사전 학습 코퍼스.
Zhipu는 KV 캐시가 여전히 Kimi-K3와 DeepSeek-V4-Flash보다 약간 크다고 솔직히 인정하며 이를 향후 작업 방향으로 제시합니다. 이는 아키텍처 비교가 단일 순위가 아니라 차원별로 이루어진다는 유용한 상기입니다.
Ox-Alpha: 공개적으로 테스트된 익명 모델
Flash 출시 전에 Zhipu는 GLM-5.3-Flash를 Ox-Alpha라는 이름으로 OpenCode와 OpenRouter에서 익명으로 운영했습니다. Zhipu에 따르면 이는 그 주 가장 인기 있는 모델이 되어 두 플랫폼에서 사용 기록을 세웠으며, 그 모든 트래픽이 중국산 AI 칩에서 처리되었습니다.
개발자에게 흥미로운 점은 리더보드 순위가 아니라 검증 방법입니다. 실제 트래픽, 실제 코딩 에이전트, 알려지지 않은 모델 이름, 브랜드 영향력 없음. 이는 벤치마크 표보다 강한 신호이지만, 여전히 공개된 방법론이 없는 벤더 주도의 롤아웃입니다.
네이티브 멀티모달과 비주얼 코딩
GLM-5.3-Flash는 처음부터 멀티모달로 구축된 최초의 GLM-5 시리즈 모델이며, FlashX도 이를 유지합니다. 이미지는 messages[].content[] 내부에 type: image_url 콘텐츠 블록으로 전달되며, URL 또는 Base64 데이터 URL을 사용하고 여러 블록을 하나의 메시지에 결합할 수 있습니다. 비디오와 파일 입력은 이미지 및 텍스트와 함께 문서화되어 있습니다.
실무에서 가장 중요한 기능은 비주얼 코딩입니다. 모델이 렌더링된 인터페이스를 검사하고, 목표와 비교하고, 반복합니다. Zhipu는 스크린샷이나 녹화본으로 애플리케이션을 재구축하고, Blender 장면을 만들고, Godot 게임 프로토타입을 제작하고, 브라우저 및 컴퓨터 사용 에이전트를 실행하고, CAD 부품을 재현하는 워크플로를 문서화합니다. 각각에서 모델은 코드를 생성할 뿐만 아니라 자체 렌더링 출력을 확인합니다.
동일한 루프가 문서 작업으로 확장됩니다. Zhipu는 PPTX, PDF, DOCX, XLSX 산출물, 출처를 추적할 수 있는 금융 리서치, 변경 사항이 추적되는 계약 검토, 법률 초안 작성을 시연하며, 모델이 오버플로, 정렬 불량, 일관성 없는 스타일링을 확인하기 위해 자체 출력을 렌더링하고 시각적으로 검사합니다.
Zhipu가 제시한 한 예시는 유난히 구체적입니다. 외부 자산 없이 GLM-5.3-Flash가 16시간 동안 자율적으로 실행되어 약 400m² 규모의 셰프 레지던스와 테스트 키친을 Blender 장면으로 구축했습니다.
가격: FlashX의 비용
Zhipu 가격 페이지 기준 1M 토큰당 공식 정가 (2026년 9월 18일 확인):
| 토큰 유형 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 입력 (USD) | $0.37 | $0.15 | $1.40 |
| 캐시된 입력 (USD) | $0.075 | $0.03 | $0.26 |
| 출력 (USD) | $1.25 | $0.50 | $4.40 |
캐시된 입력 저장은 세 티어 모두 기간 한정 무료로 표시되어 있습니다.
비용 예시. 캐시되지 않은 입력 10M 토큰과 출력 1M 토큰의 경우, 정가 기준은 다음과 같습니다.
| 워크로드 | GLM-5.3-FlashX | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|---|
| 입력 10M + 출력 1M | $4.95 | $2.00 | $18.40 |
| 동일 볼륨, 모든 입력 캐시 사용 | $2.00 | $0.80 | $6.60 |
FlashX는 입력과 출력에서 Flash의 약 2.5배이며, 여전히 GLM-5.3보다 훨씬 낮습니다. 이것이 가치가 있는지는 전적으로 느린 턴이 여러분에게 얼마의 비용을 초래하는지에 달려 있습니다. 배치 파이프라인에서는 드물게 그렇고, 대화형 에이전트에서는 자주 그렇습니다.
GLM-5.3-FlashX 호출 방법
FlashX는 Flash와 동일한 채팅 완성 인터페이스를 사용하므로 마이그레이션은 한 줄 변경입니다.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="glm-5.3-flashx",
messages=[
{
"role": "user",
"content": "Refactor this module for testability and show the diff.",
}
],
temperature=1,
top_p=0.95,
extra_body={
"reasoning_effort": "max",
"thinking": {"type": "enabled", "clear_thinking": False},
},
)
print(response.choices[0].message.content)
스트리밍의 경우 Zhipu가 권장하는 대로 stream: true와 tool_stream: true를 추가하세요. 이 모델에서는 사고를 끌 수 없으므로 비용 추정과 클라이언트 타임아웃에 추론 토큰을 반영해야 합니다.
실용적인 마이그레이션 경로: 모델 ID를 구성 가능하게 유지하고, 프로덕션 트래픽의 대표적인 일부를 glm-5.3-flash와 glm-5.3-flashx 모두로 보내고, 워크로드를 전환하기 전에 완료율, 첫 토큰까지의 시간, 완료된 작업당 비용을 비교하세요.
FlashX, Flash, GLM-5.3 중 선택하기
- FlashX를 선택하세요 — 대화형 제품, IDE 측 완성, 짧은 턴이 많은 에이전트 루프에서 턴당 실제 시간이 제약이고 워크로드가 여전히 Flash급 기능에 맞는 경우.
- Flash를 선택하세요 — 배치 처리, 오프라인 생성, 작업당 비용이 지연 시간보다 중요한 대용량 파이프라인, 그리고 오픈 웨이트 또는 자체 호스팅 배포의 경우. Flash가 공개된 웨이트를 가진 티어이기 때문입니다.
- GLM-5.3을 선택하세요 — Flash 티어의 비용 프로필이 아니라 플래그십의 상한이 필요할 때.
- 속도 향상이 균등하게 적용된다고 가정하지 마세요. 프리필이 많은 긴 컨텍스트 요청과 도구에 묶인 에이전트 턴은 짧은 생성 작업보다 혜택이 훨씬 적을 수 있습니다. 실제로 실행하는 워크로드를 측정하세요.
APIMaster.ai에서 GLM 패밀리 시작하기
APIMaster는 Claude, GPT, DeepSeek, Qwen, Gemini, Kimi 및 기타 모델과 함께 GLM 패밀리를 위한 하나의 OpenAI 호환 키를 제공하며, $1부터 시작하는 종량제 가격과 선택된 경로에서 공식 요금 대비 최대 70% 할인을 제공합니다.
FlashX는 Flash와 동일한 요청 형식을 유지하므로, 이미 APIMaster를 통해 GLM을 호출하는 팀은 모델 ID 외에 통합을 건드리지 않고 더 빠른 티어를 평가할 수 있습니다.
- APIMaster 계정을 생성하세요.
- $1부터 시작하는 종량제 크레딧을 추가하세요.
- APIMaster 콘솔 에서 API 키를 생성하세요.
- OpenAI 호환 클라이언트를
https://apimaster.ai/v1로 지정하고 평가하려는 모델 ID를 설정하세요.
APIMaster에 등록하기 · 모델 마켓플레이스 살펴보기 · 모델 신원 테스트
FAQ
GLM-5.3-FlashX는 새로운 모델인가요? 아니요. GLM-5.3-Flash의 고속 서빙 티어입니다. 동일한 모델, 동일한 컨텍스트 윈도우, 동일한 멀티모달 입력에 더 빠른 추론 구성과 다른 가격이 적용됩니다.
GLM-5.3-FlashX의 모델 ID는 무엇인가요?
glm-5.3-flashx입니다. 표준 티어는 glm-5.3-flash입니다.
GLM-5.3-FlashX는 얼마나 빠른가요? Zhipu는 최대 200 tokens/s를 공표합니다. 이는 최대치 수치이므로, 여러분의 프롬프트로 첫 토큰까지의 시간과 지속 처리량을 측정하세요.
GLM-5.3-FlashX의 비용은 얼마인가요? Zhipu는 1M 입력 토큰당 $0.37, 1M 출력 토큰당 $1.25, 1M 캐시된 입력 토큰당 $0.075를 제시합니다. 이는 입력과 출력에서 GLM-5.3-Flash 가격의 약 2.5배입니다.
컨텍스트 윈도우는 얼마인가요? 1M 토큰이며 최대 128,000 출력 토큰으로, GLM-5.3-Flash와 동일합니다.
GLM-5.3-FlashX는 이미지와 비디오를 받을 수 있나요?
네. 비디오, 이미지, 텍스트, 파일 입력을 받고 텍스트를 반환합니다. 이미지는 URL 또는 Base64 데이터 URL을 사용하여 image_url 콘텐츠 블록으로 전송됩니다.
GLM-5.3-FlashX는 GLM Coding Plan에 포함되나요? 출시 시점에는 아닙니다. GLM-5.3-Flash는 GLM-5.3 할당량의 3배로 플랜에서 완전히 사용할 수 있으며, 주말 전체를 포함한 비피크 시간대 호출은 표준 포인트의 50%를 소비합니다.
토큰을 절약하기 위해 사고를 끌 수 있나요?
아니요. thinking.type은 enabled만 지원합니다. Zhipu는 멀티턴 작업에서 사고 기록을 유지할 것(clear_thinking: false)을 권장합니다.
벤치마크 수치는 독립적인가요? 아니요. Zhipu가 공표한 것입니다. 방향성으로 받아들이고, 프로덕션 트래픽을 확정하기 전에 자체 평가를 다시 실행하세요.
출처 및 추가 자료
- Z.ai — GLM-5.3-Flash/FlashX 모델 문서 — 모델 ID, 파라미터, 기능, 권장 설정, 벤치마크 및 서빙 세부 사항
- Z.ai — 가격 — 공식 1M 토큰당 정가
- Z.ai — GLM-5.3-Flash 기술 블로그 — 아키텍처, 효율 비교 및 평가 표
- Hugging Face — zai-org/GLM-5.3-Flash — 기반 모델의 오픈 웨이트
- PANews — Zhipu launches GLM-5.3-FlashX — 출시 보도 및 Ox-Alpha 배경
모든 출처는 2026년 9월 18일에 확인했습니다. 가격과 가용성은 변경되므로, 대규모 워크로드를 확정하기 전에 현재 조건을 확인하세요.