APIMaster.ai
Back to Blog
APIMaster Blog

GLM-5.3-FlashX: Apa Itu, Seberapa Cepat, dan Berapa Biayanya

GLM-5.3-FlashX adalah tier penyajian berkecepatan tinggi dari GLM-5.3-Flash milik Zhipu, diluncurkan 18 September 2026 dengan kecepatan hingga 200 token/detik. Berikut ID model yang dikonfirmasi, harga, jendela konteks, benchmark, dan cara memanggilnya.

GLM-5.3-FlashXGLM-5.3-FlashGLM APIZ.aiZhipuinference speedAI pricingAPIMaster

Published 2026-09-18

Quick Answer

GLM-5.3-FlashX adalah tier penyajian berkecepatan tinggi dari GLM-5.3-Flash milik Zhipu, dirilis pada 18 September 2026 dengan kecepatan inferensi puncak yang dipublikasikan sebesar 200 token/detik. Ini bukan model baru: ini adalah sistem GLM-5.3-Flash yang sama — 320B parameter total dengan 18B yang diaktifkan, jendela konteks 1M token, hingga 128.000 token keluaran, serta input native berupa gambar, video, file, dan teks — yang disajikan melalui konfigurasi inferensi yang lebih cepat.

ID model API-nya adalah glm-5.3-flashx dan berada di samping glm-5.3-flash. Pertukarannya lugas: FlashX lebih mahal per token dibandingkan Flash (Zhipu mencantumkan $0,37 input / $1,25 output per 1M token versus $0,15 / $0,50 untuk Flash) dan menghasilkan respons yang lebih cepat. Flash juga merupakan tier dengan bobot terbuka dan tier yang disertakan dalam GLM Coding Plan, di mana Flash mendapat kuota 3× lipat dari GLM-5.3.

Jika Anda membutuhkan throughput, latensi interaktif, atau loop agen yang menjalankan banyak giliran singkat, FlashX adalah tier yang dirancang untuk itu. Jika Anda mengoptimalkan biaya per tugas yang diselesaikan dan bisa menunggu, Flash lebih murah untuk pekerjaan yang identik.

Apa itu GLM-5.3-FlashX?

GLM-5.3-FlashX adalah endpoint yang dioptimalkan untuk kecepatan dari keluarga GLM-5.3-Flash. Zhipu mengumumkannya pada 18 September 2026, menggambarkannya sebagai lebih cepat dan lebih mulus bagi perusahaan dan pengembang, dengan API dan pusat pengalaman resmi keduanya dibuka saat peluncuran.

Ada dua hal yang perlu dipisahkan:

  • Modelnya — GLM-5.3-Flash, model multimodal native 320B-A18B yang di-open-source-kan Zhipu pada 26 Agustus 2026. Arsitektur, bobot, panjang konteks, dan kemampuannya sama.
  • Tier penyajiannya — FlashX, konfigurasi inferensi yang disetel untuk throughput. Zhipu melaporkan kecepatan hingga 200 token/detik dan mengaitkan peningkatan tersebut dengan pekerjaan infrastruktur, bukan checkpoint yang berbeda.

Perbedaan itu penting saat Anda mengevaluasinya. Benchmark, batas konteks, dan perilaku multimodal yang dijelaskan untuk GLM-5.3-Flash berlaku untuk FlashX karena keduanya adalah model yang sama. Latensi dan harga tidak: keduanya berubah sesuai tier penyajian.

Spesifikasi model sekilas

Spesifikasi GLM-5.3-FlashX
ID model API glm-5.3-flashx
ID model saudara glm-5.3-flash
Dirilis 18 September 2026
Parameter total / diaktifkan 320B / 18B
Layer 45
Jendela konteks 1M token
Token keluaran maksimum 128K
Modalitas input Video, gambar, teks, file
Modalitas output Teks
Kecepatan puncak yang dipublikasikan 200 token/detik
Mode thinking Hanya thinking.type: enabled; tidak dapat dinonaktifkan
Fitur API inti Streaming, function calling, context caching, structured output, tool streaming

Zhipu merekomendasikan temperature: 1, top_p: 0.95, dan reasoning_effort: max. Untuk pekerjaan multi-giliran, Zhipu merekomendasikan mempertahankan riwayat thinking alih-alih menghapusnya (clear_thinking: false), dan untuk permintaan streaming, Zhipu merekomendasikan mengaktifkan stream: true dan tool_stream: true sekaligus.

GLM-5.3-FlashX vs GLM-5.3-Flash

Dimensi GLM-5.3-Flash GLM-5.3-FlashX
Model yang mendasari GLM-5.3-Flash GLM-5.3-Flash
Kecepatan puncak yang dipublikasikan Tier standar Hingga 200 token/detik
Harga input daftar / 1M $0,15 $0,37
Harga output daftar / 1M $0,50 $1,25
Batas konteks dan output 1M / 128K 1M / 128K
Input multimodal Ya Ya
Bobot terbuka Ya, sejak 26 Agustus 2026 Model dasar yang sama
GLM Coding Plan Disertakan, dengan kuota 3× lipat dari GLM-5.3 Tidak disertakan saat peluncuran

Format permintaannya identik. Berpindah dari satu tier ke tier lainnya adalah perubahan pada field model, bukan penulisan ulang integrasi Anda — yang menjadikan FlashX kandidat A/B yang wajar untuk beban kerja di mana waktu per giliran menjadi hambatan.

Apa yang diberitahukan dan tidak diberitahukan oleh "200 token/detik"

Zhipu mempublikasikan 200 token/detik sebagai angka maksimum. Bacalah sebagai batas atas kecepatan generasi, bukan janji tentang beban kerja Anda:

  • Ini angka puncak. Throughput nyata bergantung pada panjang prompt, cache hit, konkurensi, dan penyedia yang dipilih.
  • Ini bukan waktu ke token pertama. Laju dekode yang cepat tetap terasa lambat jika model berpikir selama beberapa detik sebelum mengeluarkan apa pun. Untuk produk interaktif, ukur keduanya.
  • Ini bukan latensi tugas total. Giliran agen yang memanggil tiga tool dibatasi oleh eksekusi tool, bukan oleh laju token.
  • Konteks panjang mengubah gambaran. Pada 1M token, perilaku prefill dan KV-cache mendominasi. Itulah tepatnya yang menjadi target arsitektur Flash.

Aturan praktisnya: benchmark Flash dan FlashX pada prompt Anda sendiri, dan bandingkan waktu ke token pertama, token keluaran per detik, dan biaya per tugas yang diselesaikan alih-alih satu angka kecepatan saja.

Dari mana kecepatannya berasal

Zhipu mengaitkan percepatan FlashX dengan investasi infrastruktur, bukan arsitektur baru, yang dibangun di atas 100.000 akselerator AI domestik yang sudah melayani lalu lintas GLM-5.3-Flash.

  • Mesin inferensi khusus di atas SGLang, yang ditulis untuk arsitektur ini alih-alih diadaptasi dari stack serbaguna.
  • Optimasi memori untuk konteks 1M token, termasuk ReplaySSM, kuantisasi W8A8, kuantisasi cache hybrid INT8/FP8/BF16, dan Layer Split.
  • Arsitektur penyajian terdisagregasi Encode–Prefill–Decode (EPD) yang memisahkan encoding multimodal, prefill prompt, dan dekode token-demi-token ke dalam kumpulan worker yang dijadwalkan secara independen, sehingga setiap tahap dapat diskalakan sendiri.
  • Peningkatan penyajian end-to-end 3× lipat dibandingkan baseline awal pada perangkat keras yang sama, yang menurut Zhipu membawa biaya per token ke tingkat yang sebanding dengan GPU NVIDIA mainstream.

Satu detail dari pekerjaan itu layak dicatat tersendiri: Zhipu menyatakan bahwa agen infrastruktur yang ditenagai GLM-5.3 membantu para engineer mengoptimalkan kernel, mendiagnosis hambatan, dan meningkatkan stack penyajian — model tersebut berpartisipasi dalam sistem yang menyajikannya.

Benchmark: apa yang dilaporkan Zhipu untuk model dasar

Semua angka berikut dipublikasikan oleh Zhipu untuk GLM-5.3-Flash dan berlaku untuk FlashX karena modelnya sama. Ini adalah hasil yang dilaporkan vendor, bukan reproduksi independen.

Benchmark GLM-5.3-Flash GLM-5.2
DeepSWE v1.1 63,4 46,2
AutomationBench 48,8 26,2
Z.ai Code Bench v1.0, max effort 29,0 Claude Opus 4.8: 29,5

Zhipu juga melaporkan bahwa GLM-5.3-Flash mencetak 57 pada Artificial Analysis Intelligence Index v4.1.1 dengan biaya $0,045 per tugas di bawah harga diskonnya — tingkat yang menurut Zhipu sebelumnya hanya tersedia pada sekitar 10× biaya tersebut — dan bahwa performa coding-nya sebanding dengan Claude Opus 4.8 pada Z.ai Code Bench internal perusahaan.

Perlakukan ini sebagai arah, bukan jaminan. Benchmark vendor biasanya dijalankan pada versi harness yang menguntungkan vendor; baris Z.ai Code Bench di atas diukur pada Claude Code 2.1.207. Jalankan kembali evaluasi Anda sendiri sebelum memindahkan lalu lintas produksi.

Arsitektur: mengapa tier Flash murah untuk dijalankan

FlashX mewarisi desain yang membuat Flash murah untuk disajikan, yang merupakan alasan mengapa tier yang lebih cepat dapat ada tanpa lonjakan harga ke tingkat flagship.

  • Attention hybrid sparse dan linear. Zhipu menggambarkannya sebagai model frontier open-source pertama yang menggabungkan keduanya. Attention linear menangkap dependensi lokal melalui pemodelan state; attention sparse mengambil konteks global yang relevan melalui indexer ringan.
  • IndexPool. Empat vektor kunci indexer dikompresi menjadi satu melalui weighted pooling, memangkas latensi dan overhead memori indexer pada konteks 1M token.
  • Manifold-Constrained Hyper-Connections (mHC) untuk efisiensi penskalaan yang lebih baik.
  • Biaya per token lebih rendah daripada GLM-5.3. Zhipu melaporkan komputasi attention 3,01× lebih sedikit dan KV cache 4,44× lebih kecil dibandingkan GLM-5.3. Dibandingkan GLM-5.3, jumlah parameter yang diaktifkan turun dari 32B menjadi 18B dan layer dari 92 menjadi 45.
  • Korpus pra-pelatihan multimodal 30 triliun token.

Zhipu jujur bahwa KV cache-nya masih sedikit lebih besar daripada milik Kimi-K3 dan DeepSeek-V4-Flash dan menyebut itu sebagai arah untuk pekerjaan mendatang — pengingat berguna bahwa perbandingan arsitektur bersifat per dimensi, bukan satu peringkat tunggal.

Ox-Alpha: model anonim yang diuji di depan publik

Sebelum peluncuran Flash, Zhipu menjalankan GLM-5.3-Flash secara anonim sebagai Ox-Alpha di OpenCode dan OpenRouter. Menurut Zhipu, model ini menjadi model paling populer minggu itu dan mencetak rekor penggunaan di kedua platform, dengan seluruh lalu lintas tersebut dilayani pada chip AI Tiongkok.

Bagi para pengembang, bagian yang menarik bukanlah posisi di papan peringkat melainkan metode validasinya: lalu lintas nyata, agen coding nyata, nama model yang tidak dikenal, dan tanpa tarikan merek. Ini sinyal yang lebih kuat daripada tabel benchmark, meskipun tetap merupakan peluncuran yang dikendalikan vendor tanpa metodologi yang dipublikasikan.

Multimodal native dan visual coding

GLM-5.3-Flash adalah model seri GLM-5 pertama yang dibangun sebagai multimodal sejak awal, dan FlashX mempertahankannya. Gambar dikirim sebagai blok konten dengan type: image_url di dalam messages[].content[], menggunakan URL atau data URL Base64, dan beberapa blok dapat digabungkan dalam satu pesan. Input video dan file didokumentasikan bersama gambar dan teks.

Kemampuan yang paling penting dalam praktik adalah visual coding: model memeriksa antarmuka yang dirender, membandingkannya dengan target, dan melakukan iterasi. Zhipu mendokumentasikan alur kerja untuk membangun ulang aplikasi dari tangkapan layar atau rekaman, membangun scene Blender, menghasilkan prototipe game Godot, menjalankan agen browser dan computer-use, serta mereproduksi part CAD — masing-masing dengan model yang memeriksa output yang dirender sendiri alih-alih hanya menghasilkan kode.

Loop yang sama meluas ke pekerjaan dokumen. Zhipu mendemonstrasikan deliverable PPTX, PDF, DOCX, dan XLSX, riset keuangan dengan sumber yang dapat dilacak, tinjauan kontrak dengan anotasi yang dilacak, dan penyusunan dokumen hukum, dengan model yang merender dan memeriksa output-nya sendiri secara visual untuk overflow, ketidaksejajaran, dan gaya yang tidak konsisten.

Salah satu contoh yang diberikan Zhipu sangat konkret: tanpa aset eksternal, GLM-5.3-Flash berjalan secara otonom selama 16 jam untuk membangun kediaman chef dan dapur uji seluas sekitar 400 m² sebagai scene Blender.

Harga: berapa biaya FlashX

Harga daftar resmi per 1M token, dari halaman harga Zhipu (diperiksa 18 September 2026):

Jenis token GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
Input (USD) $0,37 $0,15 $1,40
Input cache (USD) $0,075 $0,03 $0,26
Output (USD) $1,25 $0,50 $4,40

Penyimpanan input cache dicantumkan sebagai gratis untuk waktu terbatas di ketiga tier.

Contoh biaya. Untuk 10M token input tanpa cache dan 1M token output, harga daftar menghasilkan:

Beban kerja GLM-5.3-FlashX GLM-5.3-Flash GLM-5.3
10M input + 1M output $4,95 $2,00 $18,40
Volume sama, semua input dari cache $2,00 $0,80 $6,60

FlashX sekitar 2,5× Flash pada input dan output, dan masih jauh di bawah GLM-5.3. Apakah itu sepadan sepenuhnya bergantung pada berapa biaya giliran yang lambat bagi Anda — untuk pipeline batch jarang sepadan, dan untuk agen interaktif sering sepadan.

Cara memanggil GLM-5.3-FlashX

FlashX menggunakan antarmuka chat-completions yang sama dengan Flash, jadi migrasinya hanya perubahan satu baris.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="glm-5.3-flashx",
    messages=[
        {
            "role": "user",
            "content": "Refactor this module for testability and show the diff.",
        }
    ],
    temperature=1,
    top_p=0.95,
    extra_body={
        "reasoning_effort": "max",
        "thinking": {"type": "enabled", "clear_thinking": False},
    },
)

print(response.choices[0].message.content)

Untuk streaming, tambahkan stream: true dan tool_stream: true seperti yang direkomendasikan Zhipu. Perhatikan bahwa thinking tidak dapat dimatikan pada model ini, jadi anggarkan token penalaran dalam estimasi biaya dan timeout klien Anda.

Jalur migrasi yang praktis: pertahankan ID model agar dapat dikonfigurasi, kirim sebagian representatif dari lalu lintas produksi ke glm-5.3-flash dan glm-5.3-flashx, dan bandingkan tingkat penyelesaian, waktu ke token pertama, dan biaya per tugas yang diselesaikan sebelum mengalihkan beban kerja.

Memilih antara FlashX, Flash, dan GLM-5.3

  • Pilih FlashX untuk produk interaktif, penyelesaian di sisi IDE, dan loop agen dengan banyak giliran singkat, di mana waktu wall-clock per giliran menjadi kendala dan beban kerja masih sesuai dengan kemampuan kelas Flash.
  • Pilih Flash untuk pemrosesan batch, generasi offline, dan pipeline bervolume tinggi di mana biaya per tugas lebih penting daripada latensi — dan untuk deployment bobot terbuka atau self-hosted, karena Flash adalah tier dengan bobot yang dipublikasikan.
  • Pilih GLM-5.3 ketika Anda membutuhkan batas atas flagship alih-alih profil biaya tier Flash.
  • Jangan berasumsi keuntungan kecepatan berlaku merata. Permintaan berat prefill dengan konteks panjang dan giliran agen yang terikat tool mungkin melihat manfaat yang jauh lebih kecil daripada tugas generasi singkat. Ukur beban kerja yang benar-benar Anda jalankan.

Mulai dengan keluarga GLM di APIMaster.ai

APIMaster memberi Anda satu kunci yang kompatibel dengan OpenAI untuk keluarga GLM bersama Claude, GPT, DeepSeek, Qwen, Gemini, Kimi, dan model lainnya — dengan harga pay-as-you-go mulai dari $1 dan diskon hingga 70% dari tarif resmi pada rute terpilih.

Karena FlashX mempertahankan format permintaan yang sama dengan Flash, tim yang sudah memanggil GLM melalui APIMaster dapat mengevaluasi tier yang lebih cepat tanpa menyentuh integrasi mereka selain ID model.

  1. Buat akun APIMaster.
  2. Tambahkan kredit pay-as-you-go, mulai dari $1.
  3. Buat kunci API di konsol APIMaster.
  4. Arahkan klien yang kompatibel dengan OpenAI Anda ke https://apimaster.ai/v1 dan tetapkan ID model yang ingin Anda evaluasi.

Daftar APIMaster · Jelajahi marketplace model · Uji identitas model

FAQ

Apakah GLM-5.3-FlashX model baru? Bukan. Ini adalah tier penyajian berkecepatan tinggi dari GLM-5.3-Flash. Model yang sama, jendela konteks yang sama, input multimodal yang sama — konfigurasi inferensi yang lebih cepat dan harga yang berbeda.

Apa ID model GLM-5.3-FlashX? glm-5.3-flashx. Tier standarnya adalah glm-5.3-flash.

Seberapa cepat GLM-5.3-FlashX? Zhipu mempublikasikan maksimum 200 token/detik. Itu angka puncak; ukur waktu ke token pertama dan throughput berkelanjutan pada prompt Anda sendiri.

Berapa biaya GLM-5.3-FlashX? Zhipu mencantumkan $0,37 per 1M token input, $1,25 per 1M token output, dan $0,075 per 1M token input cache — sekitar 2,5× harga GLM-5.3-Flash pada input dan output.

Apa jendela konteksnya? 1M token, dengan hingga 128.000 token output, sama seperti GLM-5.3-Flash.

Bisakah GLM-5.3-FlashX menerima gambar dan video? Ya. Model ini menerima input video, gambar, teks, dan file serta mengembalikan teks. Gambar dikirim sebagai blok konten image_url, melalui URL atau data URL Base64.

Apakah GLM-5.3-FlashX ada di GLM Coding Plan? Tidak saat peluncuran. GLM-5.3-Flash tersedia penuh pada paket tersebut dengan kuota 3× lipat dari GLM-5.3, dan panggilan off-peak termasuk seluruh akhir pekan mengonsumsi 50% dari poin standar.

Bisakah saya mematikan thinking untuk menghemat token? Tidak. thinking.type hanya mendukung enabled. Zhipu merekomendasikan mempertahankan riwayat thinking (clear_thinking: false) untuk pekerjaan multi-giliran.

Apakah angka benchmark-nya independen? Tidak. Angka-angka itu dipublikasikan oleh Zhipu. Perlakukan sebagai indikasi arah dan jalankan kembali evaluasi Anda sendiri sebelum mengalihkan lalu lintas produksi.

Sumber dan bacaan lanjutan

Semua sumber diperiksa pada 18 September 2026. Harga dan ketersediaan berubah; verifikasi ketentuan terkini sebelum mengalihkan beban kerja besar.