Kimi K3 開放權重:部署、成本與誰在託管
Kimi K3 的 2.8T 權重已開放。自託管的真實 VRAM 計算、誰已提供首日託管服務,以及繞過 GPU 叢集的 API 路線。
發布於 2026-07-28
Moonshot AI 已於 2026 年 7 月 27 日在 Hugging Face 上發布 Kimi K3 的權重。 這是一個 2.8 兆參數的混合專家模型 — 每個 token 啟動 896 個專家中的 16 個,約 104B 活躍參數 — 擁有 1,048,576 個 token 的上下文視窗和原生視覺能力。Hugging Face 儲存庫 以 96 個 safetensors 分片形式提供,磁碟空間約 1.56TB。
自行運行需要一個真正的 GPU 叢集,而非工作站。 vLLM 自身的最低要求是 8× NVIDIA B300 或 8× AMD MI355X;Moonshot 的生產環境建議是 64 個以上的加速器。沒有單 GPU 或單節點的消費級路徑 — Mac Studio 的 512GB 統一記憶體大約僅為 VRAM 下限的三分之一,即使是 18 張 RTX PRO 6000 Blackwell 工作站,在紙面上也僅勉強達標,且沒有可行的拓撲結構來運行。
對幾乎所有人來說,實際的選擇是 API。 APIMaster.ai 已經將 kimi-k3 路由到一個兼容 OpenAI 的端點,除了 Moonshot 自身的 API 之外,還包括外部雲端 GPU 基礎設施的容量 — 這樣你無需配置或支付一個大部分時間閒置的叢集即可使用該模型。
Moonshot 實際上發布了什麼?
Kimi K3 的模型卡和 Moonshot 自己的公告 說明了其架構:
| 規格 | 數值 |
|---|---|
| 總參數 | 2.8T(根據儲存庫元數據為 2.7799T) |
| 每個 token 的活躍參數 | ~104B(16 個已路由專家,共 896 個) |
| 層數 | 總共 93 層 — 1 層密集層、69 層 Kimi Delta Attention (KDA)、24 層 Gated MLA |
| 上下文視窗 | 1,048,576 個 token |
| 視覺編碼器 | MoonViT-V2,401M 參數,原生圖像/影片輸入 |
| 原生量化 | MXFP4 權重,MXFP8 激活(量化感知訓練) |
| 權重格式 | Safetensors,96 個分片,~1.56TB / ~1.42TiB |
| 許可證 | 自定義「Kimi K3 許可證」— 商業使用前請閱讀許可證文件 |
Moonshot 強調的兩個架構部分 — Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) — 是一種混合線性注意力設計,旨在使 100 萬 token 的上下文視窗在這種規模下比標準的全注意力更便宜地提供服務。
官方推薦的服務引擎是 vLLM、SGLang 和 TokenSpeed。沒有官方的 Ollama、llama.cpp 或 LM Studio 支援 — 每個關於 K3 的部署文章都指出了這一點,因為這些工具是圍繞單節點、消費級硬體推理構建的,而該模型的架構並不適合。
如何實際部署 Kimi K3?
如果你有硬體,vLLM 的首日支援文章和模型卡提供了一條真實路徑。這是「如何部署它」的誠實版本 — 大部分內容僅在你已經擁有多 GPU 節點時才適用:
最低硬體要求。 vLLM 列出至少一個 8× B300(或 GB300 NVL72)節點,同時也支援 16× B200。AMD 的 ROCm 路徑支援 8× MI355X。Moonshot 自己的生產環境指導是使用一個由 64 個或更多加速器組成的「超級節點」— 8 GPU 的最低配置只能讓模型運行,無法達到生產吞吐量。
快速啟動命令,直接來自模型卡:
pip install vllm
vllm serve "moonshotai/Kimi-K3"
或通過 SGLang:
python -m sglang.launch_server --model-path moonshotai/Kimi-K3
Moonshot 也記錄了一個 Docker 路徑:docker model run hf.co/moonshotai/Kimi-K3。
不可省略的配置細節。 在 vLLM 中,K3 默認禁用前綴快取 — 你必須明確傳遞該標誌,否則在多輪工作負載中,你將失去 100 萬 token 上下文的大部分優勢。MoE 後端的選擇取決於你的設置(deep_gemm_mega_moe 用於分離式/專家並行,flashinfer_trtllm 用於張量並行 >1),而 all-to-all 後端取決於你的互連(flashinfer_nvlink_one_sided 用於 NVLink,deepep_v2 用於 RDMA)。視覺編碼器默認需要數據並行,因為其 head_size=12 無法在 TP=8 時均勻分片。
實際吞吐量是多少。 vLLM 報告在 TP8 上每個用戶的基準線為 111 tokens/秒,在 TP16 上為 118 tok/s(批次大小為 1)。使用推測解碼(DSpark)時,每個用戶的吞吐量提升至 331–370 tok/s — 加速 3.14 倍,但這僅在你已在已配置的叢集之上調整了推測解碼路徑之後才能實現。
自託管的真實成本
這就是「我能部署它嗎」和「我應該部署它嗎」的分歧點。根據 vLLM 的部落格和獨立的硬體/成本分析交叉驗證的計算:
- VRAM 下限:約 1,680GB。 2.8T 參數在 4-bit 下的理論最小值約為 1.4TB;實際的服務佔用(權重 + KV 快取 + 開銷)更高。
- 儲存空間:1.56TB 的權重,因此需要計劃使用 4TB 的快速 NVMe 來存放檢查點和暫存空間。下載它所需的時間從 100Gbps 線路上的約 2 分鐘到 100Mbps 連接上的近 35 小時不等。
- 能滿足下限的 GPU 配置:8× B300/MI355X(總計 2,304GB)、16× H200(2,256GB)、16× B200(2,880GB)或 32× H100(2,560GB)。更小的配置都無法工作。
- 截至 2026 年 7 月的雲端租賃估算:一個 8× B300 節點根據供應商不同,每小時約需 $59–$142 美元,連續運行相當於 每月 $43,000–$104,000 美元。一個 16× H200 節點每月運行成本為 $46,600–$116,800 美元。
- 與官方 API 的盈虧平衡點(根據 Moonshot 對快取命中輸入、快取未命中輸入和輸出的每百萬 token 定價 $0.30/$3.00/$15.00):上述最便宜的節點估算,在無快取情況下,僅在每月處理約 80 億個 token 時才能回本;在 90% 快取命中率下,則需要每月處理 125 億個 token。
如果你的實際使用量遠低於每月 80 億個 token — 而且幾乎沒有人能達到 — 那麼租用叢集就是一種每月花費數萬美元卻得到比 API 更差方案的方式。
誰已經在運行了?
截至本文撰寫時,K3 的權重才發布幾個小時,但首日支援進展迅速,因為 Moonshot 提前與推理供應商協調了發布:
- vLLM 發布了官方首日支援,並提供了上述吞吐量數據,涵蓋 NVIDIA(Hopper 和 Blackwell)和 AMD(MI355X),並在發布時支援 ROCm。
- Fireworks AI 在發布時將 K3 置於其平台,將其定位為可擁有的託管推理,而非自行管理的叢集。
- Baseten 發布了一份首日 API 構建指南,詳細介紹了他們自己的託管設置。
- AMD 發布了自己的 Instinct GPU 部署文章,這在一個新的前沿開放權重模型獲得硬體供應商首日支援時是常見做法。
- 多個基礎設施部落格 — Northflank、Hyperstack — 在第一天內發布了部署和成本分析,這說明了供應商對自託管指導的需求有多大,儘管該受眾群中幾乎沒有人最終會運行實際的叢集。
這種模式與每一次大型開放權重發布相符:少數推理平台和硬體供應商在第一天提供支援,隨後在 24-48 小時內出現一波硬體/成本文章,而絕大多數實際使用仍然通過 API 而非自行管理的部署進行。
更簡單的路徑:通過 API 使用 Kimi K3
考慮到上述硬體下限,自託管 K3 僅在少數情況下有意義:你已經在運行一個大型且大部分時間閒置的 GPU 機群、你的持續使用量遠超數十億 token 的盈虧平衡點,或者你有特定的合規原因導致數據不能離開你的基礎設施。在這些情況之外,上述的叢集計算對你不利。
APIMaster.ai 已經上線了 kimi-k3,在其模型市場中通過兼容 OpenAI 的 API 提供路由。該路線同時利用 Moonshot 自身的 API 以及運行開放權重的外部雲端 GPU 基礎設施,因此定價和可用性反映了通往同一模型的多條路徑 — 在將生產流量遷移之前,請檢查實時路線卡,因為渠道供應和定價可能會發生變化。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[
{"role": "user", "content": "總結自託管一個 2.8T MoE 模型的權衡取捨。"}
],
)
print(response.choices[0].message.content)
開始使用:
- 註冊一個 APIMaster 帳戶。
- 使用支援的付款方式添加錢包餘額。
- 從 APIMaster 控制台 生成一個 API 金鑰。
- 在你現有的 OpenAI SDK 整合中,將
model設置為kimi-k3,並將基礎 URL 設置為https://apimaster.ai/v1。
Kimi K3 也包含在 APIMaster 當前的 DeepSeek、Kimi K3、MiniMax M3 和 GLM-5.2 的 40% 折扣定價中。在生產環境中依賴任何路線之前,都可以使用免費的 AI 模型指紋測試器 進行檢查。
FAQ
我可以在單個 GPU 或普通工作站上運行 Kimi K3 嗎?
不行。實際的 VRAM 下限約為 1,680GB。即使是 18 張 RTX PRO 6000 Blackwell 工作站(每張 96GB)在紙面上也僅勉強達標,但沒有實際的拓撲結構可以這樣提供模型服務。Mac Studio 最大 512GB 的統一記憶體大約是所需容量的三分之一。
合法自託管 Kimi K3 最便宜的方式是什麼?
租用一個 8× B300 或 8× MI355X 雲端節點是入門選擇,根據供應商和實例定價,每月大約需要 $43,000–$104,000 美元。這只有在每月使用量達到數十億 token 時,才能在成本上與官方 API 競爭。
Ollama 或 LM Studio 支援 Kimi K3 嗎?
沒有官方支援。Moonshot 推薦的服務引擎是 vLLM、SGLang 和 TokenSpeed — 這些都是為多 GPU、數據中心部署而構建的,而非單機消費級推理。
Kimi K3 可以通過 APIMaster 使用嗎?
可以。它已在 APIMaster 市場 中以 kimi-k3 的形式上線,提供兼容 OpenAI 的端點,同時利用 Moonshot 自身的 API 和運行開放權重的外部雲端 GPU 容量。
K3 的上下文視窗在本地運行和通過 API 運行相比如何?
100 萬 token 的視窗無論哪種方式都是相同的 — 這是模型本身的屬性,而非服務路徑。改變的是前綴快取行為和成本:APIMaster 的路線和 Moonshot 自身的 API 都支援對重複長前綴的快取命中定價,而自託管的 vLLM 部署則需要明確啟用前綴快取(對於 K3 默認是關閉的)才能獲得相同的好處。
來源
- Kimi K3 模型卡,Hugging Face
- Moonshot AI,「開放前沿智慧」發布文章
- vLLM,「Kimi K3 來了:在 vLLM 上高效的首日支援」
- Fireworks AI,Kimi K3 發布文章
- Baseten,首日 API 構建指南
- AMD,Kimi K3 在 AMD Instinct GPU 上
- Kingy.ai,硬體/VRAM/成本分析
- Northflank,基準測試/定價/自託管概述
- Kimi K3 官方定價
Kimi K3 的權重是開放的,但對幾乎所有人來說,使用該模型最快的方式仍然是 API 調用,而非 GPU 叢集。在 APIMaster 註冊 以獲取一個兼容 OpenAI 的 kimi-k3 金鑰,無需配置任何硬體。