Kimi K3 с открытыми весами: развертывание, стоимость и кто уже хостит
Веса Kimi K3 на 2,8 трлн параметров открыты. Реальный расчет VRAM для самостоятельного хостинга, кто предоставляет хостинг с первого дня и API-маршрут, который обходит кластер GPU.
Published 2026-07-28
Компания Moonshot AI выпустила веса Kimi K3 на Hugging Face 27 июля 2026 года. Это модель смеси экспертов (MoE) с 2,8 триллионами параметров — 16 из 896 экспертов активны на каждый токен, около 104 млрд активных параметров — с контекстным окном в 1 048 576 токенов и нативным зрением. Репозиторий на Hugging Face поставляется в виде 96 шардов safetensors, занимая примерно 1,56 ТБ на диске.
Для самостоятельного запуска нужен настоящий кластер GPU, а не рабочая станция. Минимальные требования самого vLLM — 8× NVIDIA B300 или 8× AMD MI355X; рекомендация Moonshot для продакшена — 64+ ускорителя. Не существует пути для одного GPU или одного узла потребительского класса — 512 ГБ унифицированной памяти Mac Studio — это примерно треть минимального объема VRAM, а даже рабочая станция с 18 картами RTX PRO 6000 Blackwell едва достигает порога, не имея жизнеспособной топологии для работы.
Для почти всех практичный вариант — это API. APIMaster.ai уже маршрутизирует kimi-k3 через совместимый с OpenAI эндпоинт, включая мощности на внешней облачной GPU-инфраструктуре наряду с собственным API Moonshot — так что вы получаете модель без необходимости выделения ресурсов или оплаты кластера, который большую часть времени простаивает.
Что именно выпустила Moonshot?
Карточка модели Kimi K3 и собственное объявление Moonshot описывают архитектуру:
| Спецификация | Значение |
|---|---|
| Всего параметров | 2,8 трлн (2,7799 трлн по метаданным репозитория) |
| Активных параметров на токен | ~104 млрд (16 из 896 маршрутизируемых экспертов) |
| Слоев | 93 всего — 1 плотный, 69 Kimi Delta Attention (KDA), 24 Gated MLA |
| Контекстное окно | 1 048 576 токенов |
| Кодировщик зрения | MoonViT-V2, 401 млн параметров, нативный ввод изображений/видео |
| Нативная квантизация | Веса MXFP4, активации MXFP8 (обучение с учетом квантизации) |
| Формат весов | Safetensors, 96 шардов, ~1,56 ТБ / ~1,42 ТиБ |
| Лицензия | Пользовательская "Kimi K3 License" — прочитайте файл лицензии перед коммерческим использованием |
Два архитектурных элемента, которые Moonshot выделяет — Kimi Delta Attention (KDA) и Attention Residuals (AttnRes) — представляют собой гибридный дизайн линейного внимания, призванный сделать обслуживание контекстного окна в 1 млн токенов дешевле, чем стандартное полное внимание при таком масштабе.
Официально рекомендуемые движки для обслуживания: vLLM, SGLang и TokenSpeed. Официальной поддержки Ollama, llama.cpp или LM Studio нет — этот момент отмечается в каждой статье о развертывании K3, поскольку эти инструменты созданы для инференса на одном узле с потребительским оборудованием, под который архитектура этой модели не подходит.
Как на самом деле развернуть Kimi K3?
Если у вас есть оборудование, пост о поддержке vLLM с первого дня и карточка модели дают реальный путь. Это честная версия "как развернуть" — большая часть применима только после того, как у вас уже есть много-GPU узел:
Минимальное оборудование. vLLM указывает как минимум один узел 8× B300 (или GB300 NVL72), также поддерживается 16× B200. Путь AMD ROCm поддерживает 8× MI355X. Собственные рекомендации Moonshot для продакшена — "суперузел" из 64 или более ускорителей — минимум из 8 GPU позволяет запустить модель, но не обеспечивает производственную пропускную способность.
Команды быстрого старта прямо из карточки модели:
pip install vllm
vllm serve "moonshotai/Kimi-K3"
или через SGLang:
python -m sglang.launch_server --model-path moonshotai/Kimi-K3
Moonshot также документирует путь через Docker: docker model run hf.co/moonshotai/Kimi-K3.
Детали конфигурации, которые не являются опциональными. Кэширование префиксов по умолчанию отключено для K3 в vLLM — вы должны явно передать флаг, иначе потеряете большую часть преимущества контекста в 1 млн токенов для многосессионных рабочих нагрузок. Выбор бэкенда MoE зависит от вашей настройки (deep_gemm_mega_moe для разобщенного/экспертно-параллельного, flashinfer_trtllm для тензорно-параллельного >1), а бэкенд all-to-all зависит от вашего интерконнекта (flashinfer_nvlink_one_sided для NVLink, deepep_v2 для RDMA). Кодировщику зрения по умолчанию требуется параллелизм данных, поскольку его head_size=12 не может быть равномерно разделен между TP=8.
Какова реальная пропускная способность. vLLM сообщает о базовой производительности 111 токенов/сек на пользователя при TP8 и 118 ток/сек при TP16 с размером пакета 1. При спекулятивном декодировании (DSpark) это возрастает до 331–370 ток/сек на пользователя — ускорение в 3,14 раза, но только после настройки пути спекулятивного декодирования поверх уже выделенного кластера.
Реальная стоимость самостоятельного хостинга
Здесь расходятся пути "могу ли я развернуть" и "стоит ли мне развертывать". Математика, сверенная с блогом vLLM и независимыми разборами оборудования/стоимости:
- Минимальный VRAM: ~1680 ГБ. Теоретический минимум для 2,8 трлн параметров при 4-битной точности составляет около 1,4 ТБ; реальный объем обслуживания (веса + KV-кэш + накладные расходы) выше.
- Хранилище: 1,56 ТБ весов, поэтому планируйте 4 ТБ быстрого NVMe только для хранения контрольной точки плюс дополнительное пространство. Загрузка занимает от ~2 минут на линии 100 Гбит/с до почти 35 часов на соединении 100 Мбит/с.
- Конфигурации GPU, которые достигают порога: 8× B300/MI355X (в сумме 2304 ГБ), 16× H200 (2256 ГБ), 16× B200 (2880 ГБ) или 32× H100 (2560 ГБ). Ничего меньшего не работает.
- Аренда в облаке, одна оценка на июль 2026 года: узел 8× B300 стоит примерно $59–$142/час в зависимости от провайдера, что составляет $43 000–$104 000/месяц при непрерывной работе. Узел 16× H200 стоит $46 600–$116 800/месяц.
- Точка безубыточности по сравнению с официальным API (по ценам Moonshot $0,30/$3,00/$15,00 за миллион для ввода с попаданием в кэш, ввода с промахом кэша и вывода): самая дешевая оценка узла выше окупается только при примерно 8 миллиардах токенов в месяц без кэширования или 12,5 миллиардах токенов в месяц при 90% попаданий в кэш.
Если ваше фактическое использование далеко не 8 млрд токенов в месяц — а у почти никого его нет — арендованный кластер — это способ тратить десятки тысяч долларов в месяц, чтобы получить худшую сделку, чем API.
Кто уже запускает модель?
Весам K3 всего несколько часов на момент написания, но поддержка с первого дня развивалась быстро, потому что Moonshot координировал выпуск с вендорами инференса заранее:
- vLLM выпустил официальную поддержку с первого дня с указанными выше показателями пропускной способности, охватывая NVIDIA (Hopper и Blackwell) и AMD (MI355X) с поддержкой ROCm при запуске.
- Fireworks AI разместил K3 на своей платформе при запуске, позиционируя его как собственный, хостируемый инференс, а не самоуправляемый кластер.
- Baseten опубликовал руководство по созданию API с нулевого дня, описывающее их собственную настройку хостинга.
- AMD опубликовала собственное руководство по развертыванию на GPU Instinct, что является обычной практикой, когда новая前沿 модель с открытыми весами запускается с поддержкой вендора оборудования с первого дня.
- Множество инфраструктурных блогов — Northflank, Hyperstack — опубликовали разборы развертывания и стоимости в течение первого дня, что говорит о том, насколько высок спрос на руководства по самостоятельному хостингу, хотя почти никто из этой аудитории в итоге не будет запускать реальный кластер.
Эта модель повторяется при каждом крупном выпуске с открытыми весами: несколько платформ инференса и вендор оборудования выпускают поддержку в нулевой день, волна статей об оборудовании и стоимости следует в течение 24–48 часов, и подавляющее большинство фактического использования все равно идет через API, а не через самоуправляемое развертывание.
Более простой путь: используйте Kimi K3 через API
Учитывая указанный выше порог оборудования, самостоятельный хостинг K3 имеет смысл в узком наборе случаев: у вас уже есть большой, в основном простаивающий парк GPU, у вас есть устойчивое использование, значительно превышающее точку безубыточности в несколько миллиардов токенов, или у вас есть особая причина соответствия требованиям, по которой данные не могут покинуть вашу инфраструктуру. Вне этих случаев математика кластера работает против вас.
APIMaster.ai уже имеет kimi-k3 в работе на своем маркетплейсе моделей, маршрутизируемый через совместимый с OpenAI API. Маршрут использует как собственный API Moonshot, так и внешнюю облачную GPU-инфраструктуру, работающую с открытыми весами, поэтому цены и доступность отражают более чем один путь к одной и той же модели — проверьте карточку маршрута в реальном времени перед перемещением производственного объема, поскольку канальное предложение и цены могут меняться.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[
{"role": "user", "content": "Обобщите компромиссы самостоятельного хостинга модели MoE на 2,8 трлн параметров."}
],
)
print(response.choices[0].message.content)
Чтобы начать:
- Зарегистрируйте аккаунт APIMaster.
- Пополните кошелек с помощью поддерживаемого способа оплаты.
- Сгенерируйте API-ключ в консоли APIMaster.
- Установите
modelнаkimi-k3и базовый URL наhttps://apimaster.ai/v1в вашей существующей интеграции с OpenAI SDK.
Kimi K3 также является частью текущей скидки 40% на DeepSeek, Kimi K3, MiniMax M3 и GLM-5.2 от APIMaster, и каждый маршрут можно проверить с помощью бесплатного тестера отпечатков AI-моделей, прежде чем полагаться на него в продакшене.
FAQ
Могу ли я запустить Kimi K3 на одном GPU или обычной рабочей станции?
Нет. Реалистичный минимальный объем VRAM составляет около 1680 ГБ. Даже рабочая станция с 18 картами RTX PRO 6000 Blackwell (96 ГБ на карту) лишь едва достигает этого числа на бумаге, не имея практической топологии для обслуживания модели таким образом. Максимальные 512 ГБ унифицированной памяти Mac Studio — это примерно треть необходимого.
Какой самый дешевый способ легально самостоятельно хостить Kimi K3?
Аренда облачного узла 8× B300 или 8× MI355X является отправной точкой, стоимостью примерно $43 000–$104 000/месяц в зависимости от провайдера и цен на инстансы. Это становится конкурентоспособным по стоимости с официальным API только после нескольких миллиардов токенов ежемесячного использования.
Поддерживает ли Ollama или LM Studio Kimi K3?
Не официально. Рекомендуемые Moonshot движки для обслуживания: vLLM, SGLang и TokenSpeed — все они созданы для много-GPU развертывания в центрах обработки данных, а не для инференса на одной машине потребительского класса.
Доступен ли Kimi K3 через APIMaster?
Да. Он работает в маркетплейсе APIMaster как kimi-k3 через совместимый с OpenAI эндпоинт, используя как собственный API Moonshot, так и внешнюю облачную GPU-мощность, работающую с открытыми весами.
Как сравнивается контекстное окно K3 при локальном запуске и через API?
Окно в 1 млн токенов идентично в обоих случаях — это свойство модели, а не пути обслуживания. Меняется поведение кэширования префиксов и стоимость: маршрут APIMaster и собственный API Moonshot поддерживают цены с попаданием в кэш для повторяющихся длинных префиксов, в то время как самоуправляемое развертывание vLLM требует явного включения кэширования префиксов (оно отключено по умолчанию для K3) для получения того же преимущества.
Источники
- Карточка модели Kimi K3, Hugging Face
- Moonshot AI, пост о запуске "Open Frontier Intelligence"
- vLLM, "Kimi K3 Is Here: Efficient Day-0 Support on vLLM"
- Fireworks AI, пост о запуске Kimi K3
- Baseten, руководство по созданию API с нулевого дня
- AMD, Kimi K3 на GPU AMD Instinct
- Kingy.ai, разбор оборудования/VRAM/стоимости
- Northflank, обзор бенчмарков/цен/самостоятельного хостинга
- Официальные цены Kimi K3
Веса Kimi K3 открыты, но для почти всех самый быстрый путь к использованию модели — это все еще вызов API, а не кластер GPU. Зарегистрируйтесь на APIMaster, чтобы получить совместимый с OpenAI ключ для kimi-k3 без выделения какого-либо оборудования.