Kimi K3 Pesos Abiertos: Implementación, Costo y Quién lo Aloja
Los pesos de Kimi K3 de 2.8T están abiertos. El cálculo real de VRAM para autoalojamiento, quién tiene alojamiento desde el día 0, y la ruta API que evita el clúster de GPU.
Published 2026-07-28
Moonshot AI lanzó los pesos de Kimi K3 en Hugging Face el 27 de julio de 2026. Es un modelo Mixture-of-Experts de 2.8 billones de parámetros — 16 de 896 expertos activos por token, aproximadamente 104 mil millones de parámetros activos — con una ventana de contexto de 1,048,576 tokens y visión nativa. El repositorio de Hugging Face se entrega como 96 fragmentos safetensors, aproximadamente 1.56 TB en disco.
Ejecutarlo usted mismo necesita un clúster de GPU real, no una estación de trabajo. El mínimo de vLLM es 8× NVIDIA B300 o 8× AMD MI355X; la recomendación de producción de Moonshot es de 64+ aceleradores. No hay ruta de consumidor con una sola GPU o un solo nodo — los 512 GB de memoria unificada de una Mac Studio son aproximadamente un tercio del mínimo de VRAM, e incluso una estación de trabajo RTX PRO 6000 Blackwell de 18 tarjetas apenas lo supera en papel, sin una topología viable para ejecutarlo.
Para casi todos, la opción práctica es una API. APIMaster.ai ya enruta kimi-k3 detrás de un endpoint compatible con OpenAI, incluyendo capacidad en infraestructura de GPU en la nube externa junto con la propia API de Moonshot — así que obtienes el modelo sin aprovisionar ni pagar por un clúster que permanece inactivo la mayor parte del tiempo.
¿Qué lanzó realmente Moonshot?
La tarjeta del modelo de Kimi K3 y el propio anuncio de Moonshot describen la arquitectura:
| Especificación | Valor |
|---|---|
| Parámetros totales | 2.8T (2.7799T según metadatos del repositorio) |
| Parámetros activos por token | ~104B (16 de 896 expertos enrutados) |
| Capas | 93 en total — 1 densa, 69 Kimi Delta Attention (KDA), 24 Gated MLA |
| Ventana de contexto | 1,048,576 tokens |
| Codificador de visión | MoonViT-V2, 401M parámetros, entrada nativa de imagen/video |
| Cuantización nativa | Pesos MXFP4, activaciones MXFP8 (entrenamiento con conciencia de cuantización) |
| Formato de pesos | Safetensors, 96 fragmentos, ~1.56 TB / ~1.42 TiB |
| Licencia | Licencia personalizada "Kimi K3 License" — lea el archivo de licencia antes de uso comercial |
Las dos piezas arquitectónicas que Moonshot destaca — Kimi Delta Attention (KDA) y Attention Residuals (AttnRes) — son un diseño híbrido de atención lineal destinado a hacer que la ventana de contexto de 1M tokens sea más barata de servir que la atención completa estándar a esta escala.
Los motores de servicio recomendados oficialmente son vLLM, SGLang y TokenSpeed. No hay soporte oficial para Ollama, llama.cpp o LM Studio — un punto que todos los artículos de implementación sobre K3 han señalado, porque esas herramientas están construidas para inferencia en un solo nodo con hardware de consumo, que la arquitectura de este modelo no admite.
¿Cómo implementar realmente Kimi K3?
Si tiene el hardware, la publicación de soporte del día 0 de vLLM y la tarjeta del modelo ofrecen una ruta real. Esta es la versión honesta de "cómo implementarlo" — la mayor parte solo se aplica una vez que ya tiene un nodo multi-GPU:
Hardware mínimo. vLLM enumera al menos un nodo 8× B300 (o GB300 NVL72), con soporte también para 16× B200. La ruta ROCm de AMD soporta 8× MI355X. La guía de producción propia de Moonshot es un "supernodo" de 64 o más aceleradores — el mínimo de 8 GPU hace que el modelo se ejecute, no que funcione con rendimiento de producción.
Comandos de inicio rápido, directamente de la tarjeta del modelo:
pip install vllm
vllm serve "moonshotai/Kimi-K3"
o mediante SGLang:
python -m sglang.launch_server --model-path moonshotai/Kimi-K3
Moonshot también documenta una ruta Docker: docker model run hf.co/moonshotai/Kimi-K3.
Detalles de configuración que no son opcionales. El almacenamiento en caché de prefijos está deshabilitado por defecto para K3 en vLLM — debe pasar la bandera explícitamente o perderá la mayor parte del beneficio de la ventana de contexto de 1M tokens en cargas de trabajo de múltiples turnos. La elección del backend MoE depende de su configuración (deep_gemm_mega_moe para paralelismo de expertos desagregado, flashinfer_trtllm para paralelismo tensorial >1), y el backend all-to-all depende de su interconexión (flashinfer_nvlink_one_sided para NVLink, deepep_v2 para RDMA). El codificador de visión necesita paralelismo de datos por defecto, porque su head_size=12 no se puede dividir uniformemente en TP=8.
Cómo es el rendimiento real. vLLM informa una línea base de 111 tokens/segundo por usuario en TP8 y 118 tok/s en TP16 con tamaño de lote 1. Con decodificación especulativa (DSpark) aumenta a 331–370 tok/s por usuario — una aceleración de 3.14x, pero solo después de haber ajustado la ruta de decodificación especulativa sobre un clúster ya aprovisionado.
El costo real del autoalojamiento
Aquí es donde "puedo implementarlo" y "debería implementarlo" se separan. Las matemáticas, contrastadas con el blog de vLLM y desgloses independientes de hardware/costo:
- Mínimo de VRAM: ~1,680 GB. El mínimo teórico de 2.8T parámetros a 4 bits es aproximadamente 1.4 TB; la huella real de servicio (pesos + caché KV + gastos generales) es mayor.
- Almacenamiento: 1.56 TB de pesos, así que planifique 4 TB de NVMe rápido solo para mantener el checkpoint más espacio de trabajo. Descargarlo toma desde aproximadamente 2 minutos en una línea de 100 Gbps hasta casi 35 horas en una conexión de 100 Mbps.
- Configuraciones de GPU que superan el mínimo: 8× B300/MI355X (2,304 GB agregados), 16× H200 (2,256 GB), 16× B200 (2,880 GB) o 32× H100 (2,560 GB). Nada más pequeño funciona.
- Alquiler en la nube, una estimación a julio de 2026: un nodo 8× B300 cuesta aproximadamente $59–$142/hora según el proveedor, lo que equivale a $43,000–$104,000/mes funcionando continuamente. Un nodo 16× H200 cuesta $46,600–$116,800/mes.
- Punto de equilibrio frente a la API oficial (a los precios de Moonshot de $0.30/$3.00/$15.00 por millón para entrada con acierto de caché, entrada sin acierto de caché y salida): la estimación de nodo más barata anterior solo se amortiza después de aproximadamente 8 mil millones de tokens/mes sin caché, o 12.5 mil millones de tokens/mes con una tasa de acierto de caché del 90%.
Si su uso real está lejos de 8 mil millones de tokens al mes — y casi nadie lo está — un clúster alquilado es una forma de gastar decenas de miles de dólares al mes para obtener un peor trato que la API.
¿Quién ya lo está ejecutando?
Los pesos de K3 tienen solo horas de antigüedad al momento de escribir esto, pero el soporte del día 0 se movió rápido porque Moonshot coordinó el lanzamiento con proveedores de inferencia con anticipación:
- vLLM envió soporte oficial del día 0 con los números de rendimiento anteriores, abarcando NVIDIA (Hopper y Blackwell) y AMD (MI355X) con soporte ROCm en el lanzamiento.
- Fireworks AI puso K3 en su plataforma en el lanzamiento, posicionándolo como inferencia alojada y propia en lugar de un clúster autogestionado.
- Baseten publicó una guía de construcción de API del día cero detallando su propia configuración de alojamiento.
- AMD publicó su propio artículo de implementación en GPU Instinct, que es práctica normal cuando un nuevo modelo de pesos abiertos de frontera se lanza con respaldo del día 0 del proveedor de hardware.
- Múltiples blogs de infraestructura — Northflank, Hyperstack — publicaron guías de implementación y desgloses de costos dentro del primer día, lo que indica cuánta demanda esperan los proveedores de orientación sobre autoalojamiento, aunque casi nadie de esa audiencia terminará ejecutando el clúster real.
El patrón coincide con cada lanzamiento grande de pesos abiertos: un puñado de plataformas de inferencia y el proveedor de hardware envían soporte el día cero, una ola de artículos sobre hardware/costo sigue dentro de 24–48 horas, y la gran mayoría del uso real aún termina yendo a través de una API en lugar de una implementación autogestionada.
El camino más simple: usar Kimi K3 a través de una API
Dado el mínimo de hardware anterior, el autoalojamiento de K3 tiene sentido en un conjunto reducido de casos: ya está ejecutando una flota de GPU grande y mayormente inactiva, tiene un uso sostenido muy por encima del punto de equilibrio de varios miles de millones de tokens, o tiene una razón de cumplimiento específica por la que los datos no pueden salir de su infraestructura. Fuera de esos casos, las matemáticas del clúster juegan en su contra.
APIMaster.ai ya tiene kimi-k3 activo en su mercado de modelos, enrutado a través de una API compatible con OpenAI. La ruta utiliza tanto la propia API de Moonshot como infraestructura de GPU en la nube externa que ejecuta los pesos abiertos, por lo que el precio y la disponibilidad reflejan más de un camino hacia el mismo modelo — verifique la tarjeta de ruta en vivo antes de mover volumen de producción, ya que el suministro del canal y el precio pueden cambiar.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[
{"role": "user", "content": "Resume las ventajas y desventajas de autoalojar un modelo MoE de 2.8T."}
],
)
print(response.choices[0].message.content)
)
Para empezar:
1. **[Regístrese para una cuenta de APIMaster](https://apimaster.ai/register)**.
2. Agregue crédito a la billetera con un método de pago compatible.
3. Genere una clave API desde la **[consola de APIMaster](https://apimaster.ai/console/dashboard)**.
4. Establezca `model` en **`kimi-k3`** y la URL base en **`https://apimaster.ai/v1`** en su integración existente del SDK de OpenAI.
Kimi K3 también es parte de la oferta actual de APIMaster de [40% de descuento en DeepSeek, Kimi K3, MiniMax M3 y GLM-5.2](https://apimaster.ai/blog/deepseek-kimi-minimax-glm-40-off-apimaster-2026), y cada ruta se puede verificar con el **[probador de huellas digitales de modelos de IA](https://apimaster.ai/ai-api-model-tester)** gratuito antes de confiar en ella en producción.
## FAQ
### ¿Puedo ejecutar Kimi K3 en una sola GPU o en una estación de trabajo normal?
No. El mínimo realista de VRAM es de alrededor de 1,680 GB. Incluso una estación de trabajo RTX PRO 6000 Blackwell de 18 tarjetas (96 GB por tarjeta) apenas supera esa cifra en papel, sin una topología práctica para servir el modelo de esa manera. El máximo de 512 GB de memoria unificada de una Mac Studio es aproximadamente un tercio de lo necesario.
### ¿Cuál es la forma más económica de autoalojar Kimi K3 de manera legítima?
Alquilar un nodo en la nube 8× B300 o 8× MI355X es el punto de entrada, con un costo de aproximadamente $43,000–$104,000/mes según el proveedor y el precio de la instancia. Eso solo se vuelve competitivo en costos con la API oficial más allá de varios miles de millones de tokens de uso mensual.
### ¿Ollama o LM Studio admiten Kimi K3?
No oficialmente. Los motores de servicio recomendados por Moonshot son vLLM, SGLang y TokenSpeed, todos construidos para implementación multi-GPU en centros de datos, no para inferencia de consumo en una sola máquina.
### ¿Está Kimi K3 disponible a través de APIMaster?
Sí. Está activo en el [mercado de APIMaster](https://apimaster.ai/) como `kimi-k3` detrás de un endpoint compatible con OpenAI, utilizando tanto la propia API de Moonshot como capacidad de GPU en la nube externa que ejecuta los pesos abiertos.
### ¿Cómo se compara la ventana de contexto de K3 al ejecutarlo localmente frente a través de una API?
La ventana de 1M tokens es idéntica en ambos casos — es una propiedad del modelo, no de la ruta de servicio. Lo que cambia es el comportamiento del almacenamiento en caché de prefijos y el costo: la ruta de APIMaster y la propia API de Moonshot admiten precios con acierto de caché en prefijos largos repetidos, mientras que una implementación de vLLM autoalojada requiere habilitar explícitamente el almacenamiento en caché de prefijos (está desactivado por defecto para K3) para obtener el mismo beneficio.
## Fuentes
- [Tarjeta del modelo Kimi K3, Hugging Face](https://huggingface.co/moonshotai/Kimi-K3)
- [Moonshot AI, publicación de lanzamiento "Open Frontier Intelligence"](https://www.kimi.com/blog/kimi-k3)
- [vLLM, "Kimi K3 Is Here: Efficient Day-0 Support on vLLM"](https://vllm.ai/blog/2026-07-27-k3)
- [Fireworks AI, publicación de lanzamiento de Kimi K3](https://fireworks.ai/blog/kimik3-on-fireworks)
- [Baseten, guía de construcción de API del día cero](https://www.baseten.co/blog/how-to-build-a-day-zero-api-for-kimi-k3/)
- [AMD, Kimi K3 en GPU AMD Instinct](https://www.amd.com/en/developer/resources/technical-articles/2026/kimi-k3-on-amd-instinct-gpus.html)
- [Kingy.ai, desglose de hardware/VRAM/costo](https://kingy.ai/ai/ai-guides/run-kimi-k3-locally-hardware-vram-cost/)
- [Northflank, descripción general de benchmarks/precios/autoalojamiento](https://northflank.com/blog/what-is-kimi-k3-self-hosting)
- [Precios oficiales de Kimi K3](https://platform.kimi.ai/docs/pricing/chat-k3)
Los pesos de Kimi K3 están abiertos, pero para casi todos, el camino más rápido para usar el modelo sigue siendo una llamada a la API, no un clúster de GPU. **[Regístrese en APIMaster](https://apimaster.ai/register)** para obtener una clave compatible con OpenAI para `kimi-k3` sin aprovisionar ningún hardware.