APIMaster.ai
Back to Blog
APIMaster Blog

Bobot Terbuka Kimi K3: Penerapan, Biaya, dan Siapa yang Menyediakan Hosting

Bobot 2.8T Kimi K3 sudah terbuka. Perhitungan VRAM nyata untuk hosting sendiri, siapa yang memiliki hosting langsung hari-0, dan rute API yang melewati cluster GPU.

Kimi K3Moonshot AIopen weightsself-hostingAPIMaster

Published 2026-07-28

Quick Answer

Moonshot AI merilis bobot Kimi K3 di Hugging Face pada 27 Juli 2026. Model ini adalah Mixture-of-Experts dengan 2,8 triliun parameter — 16 dari 896 ahli aktif per token, sekitar 104B parameter aktif — dengan jendela konteks 1.048.576 token dan visi native. Repositori Hugging Face dikirimkan sebagai 96 pecahan safetensors, sekitar 1,56TB di disk.

Menjalankannya sendiri membutuhkan cluster GPU sungguhan, bukan workstation. Minimum vLLM sendiri adalah 8× NVIDIA B300 atau 8× AMD MI355X; rekomendasi produksi Moonshot adalah 64+ akselerator. Tidak ada jalur single-GPU atau single-node untuk konsumen — memori terpadu 512GB Mac Studio hanya sekitar sepertiga dari batas VRAM, dan bahkan workstation 18-kartu RTX PRO 6000 Blackwell hampir tidak mencapai batas tanpa topologi yang layak untuk dijalankan.

Bagi hampir semua orang, opsi praktis adalah API. APIMaster.ai sudah merutekan kimi-k3 melalui endpoint yang kompatibel dengan OpenAI, termasuk kapasitas di infrastruktur GPU cloud luar bersama API Moonshot sendiri — sehingga Anda mendapatkan model tanpa harus menyediakan atau membayar cluster yang menganggur hampir sepanjang waktu.

Apa yang sebenarnya dirilis Moonshot?

Kartu model Kimi K3 dan pengumuman Moonshot sendiri menjelaskan arsitekturnya:

Spesifikasi Nilai
Total parameter 2,8T (2,7799T per metadata repositori)
Parameter aktif per token ~104B (16 dari 896 ahli yang dirutekan)
Lapisan 93 total — 1 dense, 69 Kimi Delta Attention (KDA), 24 Gated MLA
Jendela konteks 1.048.576 token
Encoder visi MoonViT-V2, 401M param, input gambar/video native
Kuantisasi native Bobot MXFP4, aktivasi MXFP8 (pelatihan sadar kuantisasi)
Format bobot Safetensors, 96 pecahan, ~1,56TB / ~1,42TiB
Lisensi "Lisensi Kimi K3" kustom — baca file lisensi sebelum penggunaan komersial

Dua bagian arsitektur yang disorot Moonshot — Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes) — adalah desain perhatian linear hibrida yang dimaksudkan untuk membuat jendela konteks 1M-token lebih murah untuk dilayani daripada perhatian penuh standar pada skala ini.

Mesin penyajian yang direkomendasikan secara resmi adalah vLLM, SGLang, dan TokenSpeed. Tidak ada dukungan resmi untuk Ollama, llama.cpp, atau LM Studio — sebuah poin yang telah disorot oleh setiap tulisan penyebaran K3, karena alat-alat tersebut dibangun di sekitar inferensi single-node, perangkat keras konsumen yang tidak sesuai dengan arsitektur model ini.

Bagaimana cara menerapkan Kimi K3?

Jika Anda memiliki perangkat keras, posting dukungan vLLM hari-0 dan kartu model memberikan jalur yang nyata. Inilah versi jujur dari "cara menerapkannya" — sebagian besar hanya berlaku setelah Anda memiliki node multi-GPU:

Perangkat keras minimum. vLLM mencantumkan setidaknya satu node 8× B300 (atau GB300 NVL72), dengan 16× B200 juga didukung. Jalur ROCm AMD mendukung 8× MI355X. Panduan produksi Moonshot sendiri adalah "supernode" dengan 64 atau lebih akselerator — minimum 8-GPU hanya membuat model berjalan, bukan berjalan dengan throughput produksi.

Perintah quickstart, langsung dari kartu model:

pip install vllm
vllm serve "moonshotai/Kimi-K3"

atau melalui SGLang:

python -m sglang.launch_server --model-path moonshotai/Kimi-K3

Moonshot juga mendokumentasikan jalur Docker: docker model run hf.co/moonshotai/Kimi-K3.

Detail konfigurasi yang tidak opsional. Caching prefix dinonaktifkan secara default untuk K3 di vLLM — Anda harus memberikan flag secara eksplisit atau Anda kehilangan sebagian besar manfaat dari konteks 1M-token pada beban kerja multi-percakapan. Pilihan backend MoE tergantung pada pengaturan Anda (deep_gemm_mega_moe untuk disaggregated/expert-parallel, flashinfer_trtllm untuk tensor-parallel >1), dan backend all-to-all tergantung pada interkoneksi Anda (flashinfer_nvlink_one_sided untuk NVLink, deepep_v2 untuk RDMA). Encoder visi membutuhkan data parallelism secara default, karena head_size=12 tidak dapat dibagi secara merata di TP=8.

Seperti apa throughput sebenarnya. vLLM melaporkan baseline 111 token/detik per pengguna pada TP8 dan 118 tok/dtk pada TP16 dengan ukuran batch 1. Dengan decoding spekulatif (DSpark) naik menjadi 331–370 tok/dtk per pengguna — peningkatan 3,14x, tetapi hanya setelah Anda menyetel jalur decoding spekulatif di atas cluster yang sudah disediakan.

Biaya nyata dari hosting sendiri

Di sinilah "dapatkah saya menerapkannya" dan "haruskah saya menerapkannya" terpisah. Perhitungannya, dirujuk silang dari blog vLLM dan analisis perangkat keras/biaya independen:

  • Batas VRAM: ~1.680GB. Minimum teoritis dari 2,8T parameter pada 4-bit sekitar 1,4TB; jejak penyajian nyata (bobot + cache KV + overhead) lebih tinggi.
  • Penyimpanan: 1,56TB bobot, jadi rencanakan 4TB NVMe cepat hanya untuk menyimpan checkpoint plus ruang sementara. Mengunduhnya memakan waktu mulai dari ~2 menit pada jalur 100Gbps hingga hampir 35 jam pada koneksi 100Mbps.
  • Konfigurasi GPU yang mencapai batas: 8× B300/MI355X (2.304GB agregat), 16× H200 (2.256GB), 16× B200 (2.880GB), atau 32× H100 (2.560GB). Tidak ada yang lebih kecil yang berfungsi.
  • Sewa cloud, satu perkiraan per Juli 2026: node 8× B300 berjalan sekitar $59–$142/jam tergantung penyedia, yaitu $43.000–$104.000/bulan jika berjalan terus menerus. Node 16× H200 berjalan $46.600–$116.800/bulan.
  • Titik impas terhadap API resmi (dengan harga Moonshot $0,30/$3,00/$15,00 per juta untuk input cache-hit, input cache-miss, dan output): perkiraan node termurah di atas hanya membayar sendiri melewati sekitar 8 miliar token/bulan tanpa caching, atau 12,5 miliar token/bulan pada tingkat cache-hit 90%.

Jika penggunaan aktual Anda tidak mendekati 8B token per bulan — dan hampir tidak ada yang mencapainya — cluster sewaan adalah cara untuk menghabiskan puluhan ribu dolar per bulan untuk mendapatkan kesepakatan yang lebih buruk daripada API.

Siapa yang sudah menjalankannya?

Bobot K3 baru berusia beberapa jam pada saat penulisan ini, tetapi dukungan hari-0 bergerak cepat karena Moonshot mengoordinasikan rilis dengan vendor inferensi sebelumnya:

  • vLLM mengirimkan dukungan resmi hari-0 dengan angka throughput di atas, mencakup NVIDIA (Hopper dan Blackwell) dan AMD (MI355X) dengan dukungan ROCm saat peluncuran.
  • Fireworks AI menempatkan K3 di platformnya saat peluncuran, memposisikannya sebagai inferensi yang dapat dimiliki dan dihosting daripada cluster yang dikelola sendiri.
  • Baseten menerbitkan panduan pembuatan API hari-0 yang memandu pengaturan hosting mereka sendiri.
  • AMD menerbitkan tulisan penyebaran GPU Instinct sendiri, yang merupakan praktik normal ketika model open-weight perbatasan baru diluncurkan dengan dukungan hari-0 dari vendor perangkat keras.
  • Beberapa blog infrastruktur — Northflank, Hyperstack — menerbitkan analisis penyebaran dan biaya dalam hari pertama, yang menunjukkan seberapa besar permintaan yang diharapkan vendor untuk panduan hosting sendiri meskipun hampir tidak ada audiens yang akan benar-benar menjalankan cluster sebenarnya.

Pola ini cocok dengan setiap rilis open-weight besar: beberapa platform inferensi dan vendor perangkat keras mengirimkan dukungan pada hari ke-0, gelombang tulisan perangkat keras/biaya menyusul dalam 24–48 jam, dan sebagian besar penggunaan aktual masih berakhir melalui API daripada penyebaran yang dikelola sendiri.

Bagaimana cara menggunakan Kimi K3 melalui API?

Mengingat batas perangkat keras di atas, hosting sendiri K3 masuk akal dalam kasus yang sempit: Anda sudah menjalankan armada GPU besar yang sebagian besar menganggur, Anda memiliki penggunaan berkelanjutan yang jauh melewati titik impas multi-miliar token, atau Anda memiliki alasan kepatuhan khusus bahwa data tidak dapat meninggalkan infrastruktur Anda. Di luar kasus tersebut, matematika cluster di atas bekerja melawan Anda.

APIMaster.ai sudah memiliki kimi-k3 yang aktif di pasar modelnya, dirutekan melalui API yang kompatibel dengan OpenAI. Rute ini menarik dari API Moonshot sendiri serta infrastruktur GPU cloud luar yang menjalankan bobot terbuka, sehingga harga dan ketersediaan mencerminkan lebih dari satu jalur ke model yang sama — periksa kartu rute langsung sebelum memindahkan volume produksi, karena saluran pasokan dan harga dapat berubah.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": "Buat ringkasan tentang tradeoff hosting sendiri model MoE 2.8T."}
    ],
)

print(response.choices[0].message.content)

Untuk memulai:

  1. Daftar akun APIMaster.
  2. Tambahkan kredit dompet dengan metode pembayaran yang didukung.
  3. Hasilkan kunci API dari konsol APIMaster.
  4. Setel model ke kimi-k3 dan URL dasar ke https://apimaster.ai/v1 di integrasi OpenAI SDK Anda yang sudah ada.

Kimi K3 juga merupakan bagian dari diskon 40% saat ini untuk DeepSeek, Kimi K3, MiniMax M3, dan GLM-5.2 APIMaster, dan setiap rute dapat diperiksa dengan penguji sidik jari model AI gratis sebelum Anda mengandalkannya dalam produksi.

FAQ

Dapatkah saya menjalankan Kimi K3 pada satu GPU atau workstation biasa?

Tidak. Batas VRAM realistis sekitar 1.680GB. Bahkan workstation RTX PRO 6000 Blackwell 18-kartu (96GB per kartu) hanya sedikit melebihi angka tersebut di atas kertas, tanpa topologi praktis untuk benar-benar menyajikan model dengan cara itu. Memori terpadu maksimum 512GB Mac Studio hanya sekitar sepertiga dari yang dibutuhkan.

Apa cara termurah untuk hosting sendiri Kimi K3 secara sah?

Menyewa node cloud 8× B300 atau 8× MI355X adalah titik masuk, dengan biaya sekitar $43.000–$104.000/bulan tergantung pada penyedia dan harga instans. Itu hanya menjadi kompetitif biaya dengan API resmi setelah beberapa miliar token penggunaan bulanan.

Apakah Ollama atau LM Studio mendukung Kimi K3?

Tidak secara resmi. Mesin penyajian yang direkomendasikan Moonshot adalah vLLM, SGLang, dan TokenSpeed — semuanya dibangun untuk penyebaran multi-GPU, pusat data, bukan inferensi konsumen satu mesin.

Apakah Kimi K3 tersedia melalui APIMaster?

Ya. Ini sudah aktif di pasar APIMaster sebagai kimi-k3 di belakang endpoint yang kompatibel dengan OpenAI, menarik dari API Moonshot sendiri dan kapasitas GPU cloud luar yang menjalankan bobot terbuka.

Bagaimana perbandingan jendela konteks K3 saat menjalankannya secara lokal vs melalui API?

Jendela 1M-token identik di kedua cara — itu adalah properti model, bukan jalur penyajian. Yang berubah adalah perilaku caching prefix dan biaya: rute APIMaster dan API Moonshot sendiri mendukung harga cache-hit pada prefix panjang yang berulang, sementara penyebaran vLLM yang dihosting sendiri memerlukan pengaktifan caching prefix secara eksplisit (dinonaktifkan secara default untuk K3) untuk mendapatkan manfaat yang sama.

Sumber

Bobot Kimi K3 sudah terbuka, tetapi bagi hampir semua orang, jalur tercepat untuk menggunakan model ini masih berupa panggilan API, bukan cluster GPU. Daftar di APIMaster untuk mendapatkan kunci yang kompatibel dengan OpenAI untuk kimi-k3 tanpa menyediakan perangkat keras apa pun.