APIMaster.ai
Back to Blog
APIMaster Blog

Kimi K3 Açık Ağırlıklar: Dağıtım, Maliyet ve Kim Barındırıyor

Kimi K3'ün 2.8T ağırlıkları açık. Kendi kendine barındırma için gerçek VRAM hesabı, 0. günde canlı barındıranlar ve GPU kümesini atlayan API yolu.

Kimi K3Moonshot AIaçık ağırlıklarkendi kendine barındırmaAPIMaster

Published 2026-07-28

Quick Answer

Moonshot AI, Kimi K3'ün ağırlıklarını 27 Temmuz 2026'da Hugging Face'de yayınladı. Bu, 2.8 trilyon parametreli bir Uzman Karışımı (MoE) modelidir — token başına 896 uzmandan 16'sı aktif, yaklaşık 104B aktif parametre — 1.048.576 token bağlam penceresi ve yerel görüntü işleme ile birlikte gelir. Hugging Face deposu, yaklaşık 1.56TB disk alanı kaplayan 96 safetensors parçası olarak sunulur.

Kendiniz çalıştırmak, bir iş istasyonu değil, gerçek bir GPU kümesi gerektirir. vLLM'nin kendi minimumu 8× NVIDIA B300 veya 8× AMD MI355X'tir; Moonshot'ın üretim önerisi ise 64+ hızlandırıcıdır. Tek GPU'lu veya tek düğümlü tüketici yolu yoktur — bir Mac Studio'nun 512GB birleşik belleği, VRAM tabanının kabaca üçte biri kadardır ve 18 kartlı bir RTX PRO 6000 Blackwell iş istasyonu bile kağıt üzerinde zar zor yeterli olsa da, üzerinde çalıştırılabilecek uygun bir topoloji yoktur.

Neredeyse herkes için pratik seçenek bir API'dir. APIMaster.ai halihazırda kimi-k3'ü OpenAI uyumlu bir uç nokta arkasında yönlendiriyor; buna Moonshot'ın kendi API'sinin yanı sıra harici bulut GPU altyapısındaki kapasite de dahildir — böylece çoğu zaman boşta bekleyen bir kümeyi tedarik etmeden veya parasını ödemeden modele erişirsiniz.

Moonshot aslında neyi yayınladı?

Kimi K3'ün model kartı ve Moonshot'ın kendi duyurusu mimariyi şöyle özetliyor:

Özellik Değer
Toplam parametreler 2.8T (repo meta verilerine göre 2.7799T)
Token başına aktif parametre ~104B (896 yönlendirilmiş uzmandan 16'sı)
Katmanlar Toplam 93 — 1 yoğun, 69 Kimi Delta Dikkat (KDA), 24 Geçitli MLA
Bağlam penceresi 1.048.576 token
Görüntü kodlayıcı MoonViT-V2, 401M parametre, yerel görüntü/video girişi
Yerel niceleme MXFP4 ağırlıklar, MXFP8 aktivasyonlar (niceleme farkındalıklı eğitim)
Ağırlık formatı Safetensors, 96 parça, ~1.56TB / ~1.42TiB
Lisans Özel "Kimi K3 Lisansı" — ticari kullanımdan önce lisans dosyasını okuyun

Moonshot'ın vurguladığı iki mimari parça — Kimi Delta Dikkat (KDA) ve Dikkat Artıkları (AttnRes) —, 1M token bağlam penceresini bu ölçekte standart tam dikkatten daha ucuza sunmayı amaçlayan hibrit bir doğrusal dikkat tasarımıdır.

Resmi olarak önerilen sunum motorları vLLM, SGLang ve TokenSpeed'dir. Ollama, llama.cpp veya LM Studio için resmi bir destek yoktur — bu, K3 ile ilgili her dağıtım yazısında belirtilen bir noktadır, çünkü bu araçlar, bu modelin mimarisine uymayan tek düğümlü, tüketici donanım çıkarımı etrafında inşa edilmiştir.

Kimi K3'ü gerçekten nasıl dağıtırsınız?

Donanıma sahipseniz, vLLM'nin 0. gün destek yazısı ve model kartı gerçek bir yol sunar. "Nasıl dağıtılır" sorusunun dürüst versiyonu budur — çoğu, yalnızca zaten çoklu GPU'lu bir düğümünüz varsa geçerlidir:

Minimum donanım. vLLM, en az bir adet 8× B300 (veya GB300 NVL72) düğümü listeler; 16× B200 de desteklenir. AMD'nin ROCm yolu, 8× MI355X'i destekler. Moonshot'ın kendi üretim rehberliği, 64 veya daha fazla hızlandırıcıdan oluşan bir "süper düğüm"dür — 8 GPU minimumu modeli çalıştırır, ancak üretim veriminde çalıştırmaz.

Hızlı başlangıç komutları, doğrudan model kartından:

pip install vllm
vllm serve "moonshotai/Kimi-K3"

veya SGLang aracılığıyla:

python -m sglang.launch_server --model-path moonshotai/Kimi-K3

Moonshot ayrıca bir Docker yolu da belgeler: docker model run hf.co/moonshotai/Kimi-K3.

İsteğe bağlı olmayan yapılandırma ayrıntıları. vLLM'de K3 için önbellek ön belleğe alma varsayılan olarak devre dışıdır — bayrağı açıkça iletmeniz gerekir, aksi takdirde çok turlu iş yüklerinde 1M token bağlamının avantajının çoğunu kaybedersiniz. MoE arka uç seçimi kurulumunuza bağlıdır (deep_gemm_mega_moe ayrıştırılmış/uzman paralel için, flashinfer_trtllm tensör paralel >1 için) ve herkese herkese arka uç, ara bağlantınıza bağlıdır (flashinfer_nvlink_one_sided NVLink için, deepep_v2 RDMA için). Görüntü kodlayıcı varsayılan olarak veri paralelliğine ihtiyaç duyar, çünkü head_size=12 TP=8 boyunca eşit şekilde parçalanamaz.

Gerçek verim neye benziyor. vLLM, parti boyutu 1'de TP8'de kullanıcı başına 111 token/sn ve TP16'da 118 tok/sn'lik bir taban çizgisi bildiriyor. Spekülatif kod çözme (DSpark) ile bu, kullanıcı başına 331–370 tok/sn'ye yükselir — 3.14 kat hızlanma, ancak yalnızca zaten tedarik edilmiş bir kümenin üzerinde spekülatif kod çözme yolunu ayarladıktan sonra.

Kendi kendine barındırmanın gerçek maliyeti

"Dağıtabilir miyim" ile "dağıtmalı mıyım" arasındaki ayrım burada başlıyor. vLLM'nin blogundan ve bağımsız donanım/maliyet dökümlerinden çapraz referans alınan hesaplar:

  • VRAM tabanı: ~1.680GB. 2.8T parametrenin 4 bitteki teorik minimumu yaklaşık 1.4TB'dir; gerçek sunum alanı (ağırlıklar + KV önbelleği + ek yük) daha yüksektir.
  • Depolama: 1.56TB ağırlık, bu nedenle kontrol noktasını ve geçici alanı tutmak için yalnızca 4TB hızlı NVMe planlayın. İndirme işlemi, 100Gbps hatta ~2 dakikadan 100Mbps bağlantıda neredeyse 35 saate kadar sürebilir.
  • Tabanı karşılayan GPU yapılandırmaları: 8× B300/MI355X (2.304GB toplam), 16× H200 (2.256GB), 16× B200 (2.880GB) veya 32× H100 (2.560GB). Daha küçüğü çalışmaz.
  • Bulut kiralama, Temmuz 2026 itibarıyla bir tahmin: 8× B300 düğümü, sağlayıcıya bağlı olarak kabaca $59–$142/saat arasındadır ve bu, sürekli çalıştırmada ayda $43.000–$104.000'dir. 16× H200 düğümü ayda $46.600–$116.800 arasındadır.
  • Resmi API'ye karşı başabaş noktası (Moonshot'ın milyon başına $0,30/$3,00/$15,00 önbellek isabetli giriş, önbellek ıskalı giriş ve çıkış fiyatlandırmasında): yukarıdaki en ucuz düğüm tahmini, önbellekleme olmadan kabaca ayda 8 milyar token veya %90 önbellek isabet oranında ayda 12,5 milyar token sonrasında kendini amorti eder.

Gerçek kullanımınız ayda 8B token'a yakın değilse — ve neredeyse hiç kimsenin değil — kiralık bir küme, ayda on binlerce dolar harcayarak API'den daha kötü bir anlaşma yapmanın bir yoludur.

Kim zaten çalıştırıyor?

K3'ün ağırlıkları bu yazı itibarıyla saatler önce yayınlandı, ancak 0. gün desteği hızlı ilerledi çünkü Moonshot sürümü önceden çıkarım satıcılarıyla koordine etti:

  • vLLM, yukarıdaki verim rakamlarıyla resmi 0. gün desteğini yayınladı ve NVIDIA (Hopper ve Blackwell) ile AMD'yi (MI355X) ROCm desteğiyle kapsadı.
  • Fireworks AI, K3'ü lansmanda platformuna koydu ve onu kendi kendine yönetilen bir küme yerine sahiplenilebilir, barındırılan çıkarım olarak konumlandırdı.
  • Baseten, kendi barındırma kurulumlarını anlatan bir 0. gün API oluşturma kılavuzu yayınladı.
  • AMD, kendi Instinct GPU dağıtım yazısını yayınladı; bu, yeni bir sınır açık ağırlıklı model donanım satıcısının 0. gün desteğiyle piyasaya sürüldüğünde normal bir uygulamadır.
  • Birden fazla altyapı blogu — Northflank, Hyperstack — ilk gün içinde dağıtım ve maliyet dökümleri yayınladı; bu, satıcıların, bu kitlenin neredeyse hiçbiri gerçek kümeyi çalıştırmayacak olsa bile, kendi kendine barındırma rehberliği için ne kadar talep beklediğini gösteriyor.

Bu model, her büyük açık ağırlıklı sürümle eşleşir: bir avuç çıkarım platformu ve donanım satıcısı sıfırıncı günde destek gönderir, 24-48 saat içinde bir donanım/maliyet yazısı dalgası gelir ve gerçek kullanımın büyük çoğunluğu yine de kendi kendine yönetilen bir dağıtım yerine bir API aracılığıyla gider.

Daha basit yol: Kimi K3'ü bir API aracılığıyla kullanın

Yukarıdaki donanım tabanı göz önüne alındığında, K3'ü kendi kendine barındırmak dar bir durum kümesinde anlamlıdır: halihazırda büyük, çoğunlukla boşta bir GPU filosu işletiyorsunuzdur, çok milyarlık token başabaş noktasının çok ötesinde sürekli kullanımınız vardır veya verilerinizin altyapınızdan çıkamaması için belirli bir uyumluluk nedeniniz vardır. Bu durumların dışında, yukarıdaki küme hesapları size karşı çalışır.

APIMaster.ai halihazırda kimi-k3 model pazar yerinde, OpenAI uyumlu bir API aracılığıyla yönlendiriyor. Rota, Moonshot'ın kendi API'sinin yanı sıra açık ağırlıkları çalıştıran harici bulut GPU altyapısından da yararlanır; bu nedenle fiyatlandırma ve kullanılabilirlik, aynı modele giden birden fazla yolu yansıtır — üretim hacmini taşımadan önce canlı rota kartını kontrol edin, çünkü kanal arzı ve fiyatlandırması değişebilir.

from openai import OpenAI

client = OpenAI(
    api_key="APIMASTER_ANAHTARINIZ",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": "2.8T MoE modelini kendi kendine barındırmanın ödünleşimlerini özetle."}
    ],
)

print(response.choices[0].message.content)

Başlamak için:

  1. Bir APIMaster hesabına kaydolun.
  2. Desteklenen bir ödeme yöntemiyle cüzdan bakiyesi ekleyin.
  3. APIMaster konsolundan bir API anahtarı oluşturun.
  4. Mevcut OpenAI SDK entegrasyonunuzda model'i kimi-k3 ve temel URL'yi https://apimaster.ai/v1 olarak ayarlayın.

Kimi K3 ayrıca APIMaster'ın DeepSeek, Kimi K3, MiniMax M3 ve GLM-5.2'de mevcut %40 indirimli fiyatlandırmasının bir parçasıdır ve her rota, üretimde ona güvenmeden önce ücretsiz AI model parmak izi test cihazı ile kontrol edilebilir.

FAQ

Kimi K3'ü tek bir GPU'da veya normal bir iş istasyonunda çalıştırabilir miyim?

Hayır. Gerçekçi VRAM tabanı yaklaşık 1.680GB'dir. 18 kartlı bir RTX PRO 6000 Blackwell iş istasyonu (kart başına 96GB) bile kağıt üzerinde bu sayıyı zar zor karşılar ve modeli bu şekilde sunmak için pratik bir topoloji yoktur. Bir Mac Studio'nun maksimum 512GB birleşik belleği, gerekenin yaklaşık üçte biri kadardır.

Kimi K3'ü meşru bir şekilde kendi kendine barındırmanın en ucuz yolu nedir?

8× B300 veya 8× MI355X bulut düğümü kiralamak, sağlayıcıya ve örnek fiyatlandırmasına bağlı olarak kabaca ayda $43.000–$104.000 arasında değişen giriş noktasıdır. Bu, yalnızca aylık birkaç milyar token kullanımının ötesinde resmi API ile maliyet açısından rekabetçi hale gelir.

Ollama veya LM Studio, Kimi K3'ü destekliyor mu?

Resmi olarak hayır. Moonshot'ın önerilen sunum motorları vLLM, SGLang ve TokenSpeed'dir — bunların tümü çoklu GPU'lu, veri merkezi dağıtımı için oluşturulmuştur, tek makineli tüketici çıkarımı için değil.

Kimi K3, APIMaster aracılığıyla kullanılabilir mi?

Evet. APIMaster pazar yerinde kimi-k3 olarak, OpenAI uyumlu bir uç nokta arkasında, hem Moonshot'ın kendi API'sinden hem de açık ağırlıkları çalıştıran harici bulut GPU kapasitesinden yararlanarak canlıdır.

K3'ün bağlam penceresi, yerel olarak çalıştırmaya kıyasla bir API aracılığıyla nasıldır?

1M token penceresi her iki şekilde de aynıdır — bu, modelin bir özelliğidir, sunum yolunun değil. Değişen şey, önbellek ön belleğe alma davranışı ve maliyetidir: APIMaster'ın rotası ve Moonshot'ın kendi API'si, tekrarlanan uzun ön eklerde önbellek isabetli fiyatlandırmayı desteklerken, kendi kendine barındırılan bir vLLM dağıtımı, aynı faydayı elde etmek için önbellek ön belleğe almayı açıkça etkinleştirmeyi gerektirir (K3 için varsayılan olarak kapalıdır).

Kaynaklar

Kimi K3'ün ağırlıkları açık, ancak neredeyse herkes için modeli kullanmanın en hızlı yolu hala bir GPU kümesi değil, bir API çağrısıdır. Herhangi bir donanım tedarik etmeden kimi-k3 için OpenAI uyumlu bir anahtar almak üzere APIMaster'a kaydolun.