APIMaster.ai
Back to Blog
APIMaster Blog

Poids ouverts de Kimi K3 : Déploiement, coût et qui l'héberge

Les poids de 2,8T de Kimi K3 sont ouverts. Les vrais calculs de VRAM pour l'auto-hébergement, qui propose un hébergement dès le jour 0, et la route API qui évite le cluster GPU.

Kimi K3Moonshot AIopen weightsself-hostingAPIMaster

Published 2026-07-28

Quick Answer

Moonshot AI a publié les poids de Kimi K3 sur Hugging Face le 27 juillet 2026. Il s'agit d'un modèle Mixture-of-Experts de 2,8 billions de paramètres — 16 experts actifs sur 896 par jeton, soit environ 104B de paramètres actifs — avec une fenêtre de contexte de 1 048 576 jetons et une vision native. Le dépôt Hugging Face est livré sous forme de 96 fragments safetensors, soit environ 1,56 To sur disque.

Pour l'exécuter vous-même, il faut un véritable cluster GPU, pas une station de travail. Le minimum requis par vLLM est de 8× NVIDIA B300 ou 8× AMD MI355X ; la recommandation de production de Moonshot est de 64+ accélérateurs. Il n'existe pas de voie grand public avec un seul GPU ou un seul nœud — la mémoire unifiée de 512 Go d'un Mac Studio représente environ un tiers du plancher VRAM, et même une station de travail RTX PRO 6000 Blackwell à 18 cartes le dépasse à peine sans topologie viable pour l'exécuter.

Pour presque tout le monde, l'option pratique est une API. APIMaster.ai achemine déjà kimi-k3 via un point de terminaison compatible OpenAI, y compris la capacité sur l'infrastructure cloud GPU externe en plus de l'API propre de Moonshot — vous obtenez ainsi le modèle sans provisionner ni payer pour un cluster qui reste inactif la plupart du temps.

Qu'a réellement publié Moonshot ?

La fiche modèle de Kimi K3 et l'annonce de Moonshot décrivent l'architecture :

Spécification Valeur
Paramètres totaux 2,8T (2,7799T selon les métadonnées du dépôt)
Paramètres actifs par jeton ~104B (16 experts routés sur 896)
Couches 93 au total — 1 dense, 69 Kimi Delta Attention (KDA), 24 Gated MLA
Fenêtre de contexte 1 048 576 jetons
Encodeur visuel MoonViT-V2, 401M paramètres, entrée image/vidéo native
Quantification native Poids MXFP4, activations MXFP8 (entraînement conscient de la quantification)
Format des poids Safetensors, 96 fragments, ~1,56 To / ~1,42 Tio
Licence Licence personnalisée « Kimi K3 License » — lisez le fichier de licence avant toute utilisation commerciale

Les deux éléments architecturaux mis en avant par Moonshot — Kimi Delta Attention (KDA) et Attention Residuals (AttnRes) — sont une conception d'attention linéaire hybride destinée à rendre la fenêtre de contexte d'un million de jetons moins coûteuse à servir que ne le serait une attention standard à cette échelle.

Les moteurs de service officiellement recommandés sont vLLM, SGLang et TokenSpeed. Il n'y a pas de support officiel pour Ollama, llama.cpp ou LM Studio — un point que tous les articles de déploiement sur K3 ont souligné, car ces outils sont conçus pour l'inférence sur un seul nœud avec du matériel grand public, ce que l'architecture de ce modèle ne permet pas.

Comment déployer réellement Kimi K3 ?

Si vous disposez du matériel, le post de support jour 0 de vLLM et la fiche modèle donnent une voie réelle. Voici la version honnête du « comment le déployer » — la plupart ne s'applique qu'une fois que vous avez déjà un nœud multi-GPU :

Matériel minimum. vLLM liste au moins un nœud 8× B300 (ou GB300 NVL72), avec 16× B200 également supporté. Le chemin ROCm d'AMD supporte 8× MI355X. Les recommandations de production de Moonshot sont un « supernœud » de 64 accélérateurs ou plus — le minimum de 8 GPU permet de faire fonctionner le modèle, pas d'atteindre un débit de production.

Commandes de démarrage rapide, directement issues de la fiche modèle :

pip install vllm
vllm serve "moonshotai/Kimi-K3"

ou via SGLang :

python -m sglang.launch_server --model-path moonshotai/Kimi-K3

Moonshot documente également un chemin Docker : docker model run hf.co/moonshotai/Kimi-K3.

Détails de configuration non optionnels. La mise en cache des préfixes est désactivée par défaut pour K3 dans vLLM — vous devez passer explicitement le drapeau, sinon vous perdez la majeure partie de l'avantage de la fenêtre de contexte d'un million de jetons sur les charges de travail multi-tours. Le choix du backend MoE dépend de votre configuration (deep_gemm_mega_moe pour le parallélisme désagrégé/expert, flashinfer_trtllm pour le parallélisme tensoriel >1), et le backend all-to-all dépend de votre interconnexion (flashinfer_nvlink_one_sided pour NVLink, deepep_v2 pour RDMA). L'encodeur visuel nécessite par défaut un parallélisme de données, car son head_size=12 ne peut pas être réparti uniformément sur TP=8.

À quoi ressemble le débit réel. vLLM rapporte une base de 111 tokens/seconde par utilisateur sur TP8 et 118 tok/s sur TP16 avec une taille de lot de 1. Avec le décodage spéculatif (DSpark), cela monte à 331–370 tok/s par utilisateur — un gain de 3,14x, mais seulement après avoir optimisé le chemin de décodage spéculatif sur un cluster déjà provisionné.

Le coût réel de l'auto-hébergement

C'est là que « puis-je le déployer » et « devrais-je le déployer » divergent. Les calculs, recoupés à partir du blog de vLLM et des analyses indépendantes matériel/coût :

  • Plancher VRAM : ~1 680 Go. Le minimum théorique pour 2,8T paramètres en 4 bits est d'environ 1,4 To ; l'empreinte réelle de service (poids + cache KV + surcharge) est plus élevée.
  • Stockage : 1,56 To de poids, donc prévoyez 4 To de NVMe rapide juste pour contenir le point de contrôle plus l'espace de travail. Le téléchargement prend de ~2 minutes sur une ligne 100 Gbps à près de 35 heures sur une connexion 100 Mbps.
  • Configurations GPU qui dépassent le plancher : 8× B300/MI355X (2 304 Go agrégés), 16× H200 (2 256 Go), 16× B200 (2 880 Go), ou 32× H100 (2 560 Go). Rien de plus petit ne fonctionne.
  • Location cloud, une estimation en juillet 2026 : un nœud 8× B300 coûte environ 59 à 142 $/heure selon le fournisseur, soit 43 000 à 104 000 $/mois en fonctionnement continu. Un nœud 16× H200 coûte 46 600 à 116 800 $/mois.
  • Seuil de rentabilité par rapport à l'API officielle (au tarif de Moonshot de 0,30 $/3,00 $/15,00 $ par million pour l'entrée avec cache hit, l'entrée sans cache et la sortie) : l'estimation du nœud le moins cher ci-dessus ne s'amortit qu'à partir d'environ 8 milliards de jetons/mois sans mise en cache, ou 12,5 milliards de jetons/mois avec un taux de cache hit de 90 %.

Si votre utilisation réelle est loin de 8 milliards de jetons par mois — et ce n'est presque jamais le cas — un cluster loué est un moyen de dépenser des dizaines de milliers de dollars par mois pour obtenir une moins bonne affaire que l'API.

Qui l'exécute déjà ?

Les poids de K3 n'ont que quelques heures au moment où j'écris, mais le support jour 0 a été rapide car Moonshot a coordonné la sortie avec les fournisseurs d'inférence à l'avance :

  • vLLM a fourni un support officiel jour 0 avec les chiffres de débit ci-dessus, couvrant NVIDIA (Hopper et Blackwell) et AMD (MI355X) avec le support ROCm au lancement.
  • Fireworks AI a mis K3 sur sa plateforme dès le lancement, le positionnant comme une inférence hébergée et propriétaire plutôt qu'un cluster auto-géré.
  • Baseten a publié un guide de construction d'API jour zéro détaillant leur propre configuration d'hébergement.
  • AMD a publié son propre article de déploiement sur GPU Instinct, ce qui est une pratique courante lorsqu'un nouveau modèle frontal open-weight est lancé avec le soutien d'un fournisseur de matériel dès le jour 0.
  • Plusieurs blogs d'infrastructure — Northflank, Hyperstack — ont publié des analyses de déploiement et de coût dans les premières 24 heures, ce qui montre à quel point les fournisseurs s'attendent à une demande de conseils pour l'auto-hébergement, même si presque aucun de ces lecteurs n'exécutera réellement le cluster.

Le schéma est le même que pour chaque grande sortie open-weight : quelques plateformes d'inférence et le fournisseur de matériel offrent un support dès le jour zéro, une vague d'articles sur le matériel et les coûts suit dans les 24 à 48 heures, et la grande majorité de l'utilisation réelle passe encore par une API plutôt que par un déploiement auto-géré.

La voie plus simple : utiliser Kimi K3 via une API

Compte tenu du plancher matériel ci-dessus, l'auto-hébergement de K3 a du sens dans un ensemble restreint de cas : vous gérez déjà une grande flotte de GPU principalement inactifs, vous avez une utilisation soutenue bien au-delà du seuil de rentabilité de plusieurs milliards de jetons, ou vous avez une raison de conformité spécifique qui empêche les données de quitter votre infrastructure. En dehors de ces cas, les calculs de cluster ci-dessus jouent contre vous.

APIMaster.ai a déjà kimi-k3 en ligne dans son marché de modèles, acheminé via une API compatible OpenAI. La route s'appuie à la fois sur l'API propre de Moonshot et sur l'infrastructure cloud GPU externe exécutant les poids ouverts, de sorte que les prix et la disponibilité reflètent plus d'un chemin vers le même modèle — vérifiez la carte de route en direct avant de déplacer le volume de production, car l'offre et les prix des canaux peuvent changer.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": "Résumez les compromis de l'auto-hébergement d'un modèle MoE de 2,8T."}
    ],
)

print(response.choices[0].message.content)

Pour commencer :

  1. Créez un compte APIMaster.
  2. Ajoutez du crédit au portefeuille avec un mode de paiement accepté.
  3. Générez une clé API depuis la console APIMaster.
  4. Définissez model sur kimi-k3 et l'URL de base sur https://apimaster.ai/v1 dans votre intégration SDK OpenAI existante.

Kimi K3 fait également partie de l'offre actuelle d'APIMaster de 40 % de réduction sur DeepSeek, Kimi K3, MiniMax M3 et GLM-5.2, et chaque route peut être vérifiée avec le testeur gratuit d'empreinte de modèle IA avant de vous y fier en production.

FAQ

Puis-je exécuter Kimi K3 sur un seul GPU ou une station de travail normale ?

Non. Le plancher VRAM réaliste est d'environ 1 680 Go. Même une station de travail RTX PRO 6000 Blackwell à 18 cartes (96 Go par carte) dépasse à peine ce chiffre sur le papier, sans topologie pratique pour servir le modèle de cette façon. La mémoire unifiée maximale de 512 Go d'un Mac Studio représente environ un tiers de ce qui est nécessaire.

Quel est le moyen le moins cher d'auto-héberger légitimement Kimi K3 ?

La location d'un nœud cloud 8× B300 ou 8× MI355X est le point d'entrée, à environ 43 000 à 104 000 $/mois selon le fournisseur et le prix de l'instance. Cela ne devient compétitif par rapport à l'API officielle qu'à partir de plusieurs milliards de jetons d'utilisation mensuelle.

Ollama ou LM Studio supportent-ils Kimi K3 ?

Pas officiellement. Les moteurs de service recommandés par Moonshot sont vLLM, SGLang et TokenSpeed — tous conçus pour un déploiement multi-GPU en centre de données, pas pour l'inférence grand public sur une seule machine.

Kimi K3 est-il disponible via APIMaster ?

Oui. Il est en ligne dans le marché APIMaster sous le nom kimi-k3 derrière un point de terminaison compatible OpenAI, s'appuyant à la fois sur l'API propre de Moonshot et sur la capacité GPU cloud externe exécutant les poids ouverts.

Comment la fenêtre de contexte de K3 se compare-t-elle entre une exécution locale et via une API ?

La fenêtre d'un million de jetons est identique dans les deux cas — c'est une propriété du modèle, pas du chemin de service. Ce qui change, c'est le comportement de mise en cache des préfixes et le coût : la route d'APIMaster et l'API propre de Moonshot supportent toutes deux une tarification avec cache hit sur les longs préfixes répétés, tandis qu'un déploiement vLLM auto-hébergé nécessite d'activer explicitement la mise en cache des préfixes (elle est désactivée par défaut pour K3) pour obtenir le même avantage.

Sources

Les poids de Kimi K3 sont ouverts, mais pour presque tout le monde, le chemin le plus rapide pour utiliser le modèle reste un appel API, pas un cluster GPU. Inscrivez-vous sur APIMaster pour obtenir une clé compatible OpenAI pour kimi-k3 sans provisionner de matériel.