Kimi K3 Trọng số Mở: Triển khai, Chi phí và Ai đang Lưu trữ
Trọng số 2.8T của Kimi K3 đã được mở. Tính toán VRAM thực tế cho tự lưu trữ, ai có lưu trữ ngày 0 trực tiếp, và đường dẫn API bỏ qua cụm GPU.
Published 2026-07-28
Moonshot AI đã phát hành trọng số của Kimi K3 trên Hugging Face vào ngày 27 tháng 7 năm 2026. Đây là mô hình Mixture-of-Experts với 2,8 nghìn tỷ tham số — 16 trong số 896 chuyên gia hoạt động trên mỗi token, khoảng 104B tham số hoạt động — với cửa sổ ngữ cảnh 1.048.576 token và khả năng thị giác gốc. Kho lưu trữ Hugging Face cung cấp dưới dạng 96 mảnh safetensors, khoảng 1,56TB trên đĩa.
Tự chạy mô hình này cần một cụm GPU thực sự, không phải máy trạm. Mức tối thiểu của vLLM là 8× NVIDIA B300 hoặc 8× AMD MI355X; khuyến nghị sản xuất của Moonshot là 64+ bộ tăng tốc. Không có đường dẫn nào dành cho người tiêu dùng với một GPU hoặc một nút duy nhất — bộ nhớ thống nhất 512GB của Mac Studio chỉ bằng khoảng một phần ba mức VRAM tối thiểu, và ngay cả một máy trạm 18-card RTX PRO 6000 Blackwell cũng chỉ vượt qua mức đó trên lý thuyết mà không có cấu trúc liên kết khả thi để chạy.
Đối với hầu hết mọi người, lựa chọn thực tế là một API. APIMaster.ai đã định tuyến kimi-k3 thông qua điểm cuối tương thích OpenAI, bao gồm cả dung lượng trên cơ sở hạ tầng GPU đám mây bên ngoài cùng với API riêng của Moonshot — do đó bạn có được mô hình mà không cần chuẩn bị hoặc trả tiền cho một cụm GPU thường xuyên nhàn rỗi.
Moonshot thực sự đã phát hành những gì?
Thẻ mô hình của Kimi K3 và thông báo của Moonshot trình bày kiến trúc:
| Thông số | Giá trị |
|---|---|
| Tổng tham số | 2.8T (2.7799T theo metadata repo) |
| Tham số hoạt động trên mỗi token | ~104B (16 trên 896 chuyên gia được định tuyến) |
| Số lớp | 93 tổng cộng — 1 lớp dense, 69 lớp Kimi Delta Attention (KDA), 24 lớp Gated MLA |
| Cửa sổ ngữ cảnh | 1.048.576 token |
| Bộ mã hóa thị giác | MoonViT-V2, 401M tham số, hỗ trợ hình ảnh/video gốc |
| Lượng tử hóa gốc | MXFP4 trọng số, MXFP8 kích hoạt (huấn luyện nhận thức lượng tử hóa) |
| Định dạng trọng số | Safetensors, 96 mảnh, ~1,56TB / ~1,42TiB |
| Giấy phép | "Giấy phép Kimi K3" tùy chỉnh — đọc file giấy phép trước khi sử dụng thương mại |
Hai thành phần kiến trúc mà Moonshot đang đề cập — Kimi Delta Attention (KDA) và Attention Residuals (AttnRes) — là một thiết kế chú ý tuyến tính lai nhằm làm cho cửa sổ ngữ cảnh 1M token rẻ hơn khi phục vụ so với chú ý đầy đủ tiêu chuẩn ở quy mô này.
Các công cụ phục vụ được khuyến nghị chính thức là vLLM, SGLang và TokenSpeed. Không có hỗ trợ chính thức cho Ollama, llama.cpp hoặc LM Studio — một điểm mà mọi bài viết triển khai về K3 đều chỉ ra, bởi vì những công cụ đó được xây dựng cho suy luận trên một nút duy nhất, phần cứng người tiêu dùng mà kiến trúc của mô hình này không phù hợp.
Làm thế nào để thực sự triển khai Kimi K3?
Nếu bạn có phần cứng, bài đăng hỗ trợ ngày 0 của vLLM và thẻ mô hình cung cấp một lộ trình thực tế. Đây là phiên bản trung thực của "cách triển khai nó" — hầu hết chỉ áp dụng khi bạn đã có một nút nhiều GPU:
Phần cứng tối thiểu. vLLM liệt kê ít nhất một nút 8× B300 (hoặc GB300 NVL72), với 16× B200 cũng được hỗ trợ. Đường dẫn ROCm của AMD hỗ trợ 8× MI355X. Hướng dẫn sản xuất của Moonshot là một "siêu nút" với 64 bộ tăng tốc trở lên — mức tối thiểu 8 GPU chỉ giúp mô hình chạy, chứ không phải ở thông lượng sản xuất.
Các lệnh khởi chạy nhanh, trực tiếp từ thẻ mô hình:
pip install vllm
vllm serve "moonshotai/Kimi-K3"
hoặc qua SGLang:
python -m sglang.launch_server --model-path moonshotai/Kimi-K3
Moonshot cũng tài liệu hóa một đường dẫn Docker: docker model run hf.co/moonshotai/Kimi-K3.
Chi tiết cấu hình không thể bỏ qua. Bộ nhớ đệm tiền tố bị tắt theo mặc định cho K3 trong vLLM — bạn phải truyền cờ một cách rõ ràng nếu không bạn sẽ mất hầu hết lợi ích của cửa sổ ngữ cảnh 1M token trên các khối lượng công việc nhiều lượt. Lựa chọn backend MoE phụ thuộc vào thiết lập của bạn (deep_gemm_mega_moe cho phân tách/song song chuyên gia, flashinfer_trtllm cho tensor-parallel >1), và backend all-to-all phụ thuộc vào kết nối liên kết (flashinfer_nvlink_one_sided cho NVLink, deepep_v2 cho RDMA). Bộ mã hóa thị giác cần song song dữ liệu theo mặc định, vì head_size=12 của nó không thể phân chia đều trên TP=8.
Thông lượng thực tế trông như thế nào. vLLM báo cáo đường cơ sở 111 token/giây cho mỗi người dùng trên TP8 và 118 tok/s trên TP16 ở kích thước batch 1. Với giải mã suy đoán (DSpark), con số này tăng lên 331–370 tok/s cho mỗi người dùng — tăng tốc 3,14 lần, nhưng chỉ sau khi bạn đã tinh chỉnh đường dẫn giải mã suy đoán trên một cụm đã được chuẩn bị sẵn.
Chi phí thực tế của việc tự lưu trữ
Đây là nơi "có thể triển khai" và "có nên triển khai" tách rời nhau. Các tính toán, được tham chiếu chéo từ blog của vLLM và các phân tích độc lập về phần cứng/chi phí:
- Mức VRAM tối thiểu: ~1.680GB. Mức lý thuyết tối thiểu từ 2.8T tham số ở 4-bit là khoảng 1.4TB; dấu chân phục vụ thực tế (trọng số + bộ nhớ đệm KV + chi phí) cao hơn.
- Lưu trữ: 1.56TB trọng số, vì vậy hãy lên kế hoạch cho 4TB NVMe nhanh chỉ để giữ checkpoint cộng với không gian tạm thời. Tải xuống mất từ ~2 phút trên đường truyền 100Gbps đến gần 35 giờ trên kết nối 100Mbps.
- Cấu hình GPU vượt qua mức tối thiểu: 8× B300/MI355X (2.304GB tổng cộng), 16× H200 (2.256GB), 16× B200 (2.880GB), hoặc 32× H100 (2.560GB). Không có gì nhỏ hơn hoạt động.
- Thuê đám mây, một ước tính tính đến tháng 7 năm 2026: một nút 8× B300 chạy khoảng $59–$142/giờ tùy thuộc vào nhà cung cấp, tương đương $43.000–$104.000/tháng nếu chạy liên tục. Một nút 16× H200 chạy $46.600–$116.800/tháng.
- Điểm hòa vốn so với API chính thức (theo định giá $0,30/$3,00/$15,00 mỗi triệu của Moonshot cho đầu vào cache-hit, đầu vào cache-miss và đầu ra): ước tính nút rẻ nhất ở trên chỉ tự trả sau khoảng 8 tỷ token/tháng mà không có bộ nhớ đệm, hoặc 12,5 tỷ token/tháng với tỷ lệ cache-hit 90%.
Nếu mức sử dụng thực tế của bạn không ở gần 8B token một tháng — và hầu như không ai có — thì một cụm thuê là một cách để chi hàng chục nghìn đô la mỗi tháng để nhận được một thỏa thuận tồi hơn so với API.
Ai đã đang chạy nó?
Trọng số của K3 mới chỉ vài giờ tuổi tính đến thời điểm viết bài này, nhưng hỗ trợ ngày 0 đã diễn ra nhanh chóng vì Moonshot đã phối hợp phát hành với các nhà cung cấp suy luận trước:
- vLLM đã ra mắt hỗ trợ ngày 0 chính thức với các số liệu thông lượng ở trên, bao gồm NVIDIA (Hopper và Blackwell) và AMD (MI355X) với hỗ trợ ROCm khi ra mắt.
- Fireworks AI đã đưa K3 lên nền tảng của họ khi ra mắt, định vị nó như suy luận được lưu trữ, có thể sở hữu thay vì một cụm tự quản lý.
- Baseten đã xuất bản hướng dẫn xây dựng API ngày 0 đi qua thiết lập lưu trữ của riêng họ.
- AMD đã xuất bản bài viết triển khai trên GPU Instinct của riêng mình, đó là thông lệ bình thường khi một mô hình trọng số mở biên giới mới ra mắt với sự hỗ trợ ngày 0 từ nhà cung cấp phần cứng.
- Nhiều blog cơ sở hạ tầng — Northflank, Hyperstack — đã xuất bản các phân tích triển khai và chi phí trong ngày đầu tiên, điều này cho bạn biết các nhà cung cấp kỳ vọng bao nhiêu nhu cầu về hướng dẫn tự lưu trữ mặc dù hầu như không ai trong số đối tượng đó sẽ thực sự chạy cụm.
Mô hình này khớp với mọi bản phát hành trọng số mở lớn: một số ít nền tảng suy luận và nhà cung cấp phần cứng gửi hỗ trợ vào ngày 0, một làn sóng các bài viết về phần cứng/chi phí theo sau trong vòng 24–48 giờ, và phần lớn mức sử dụng thực tế vẫn đi qua một API thay vì triển khai tự quản lý.
Con đường đơn giản hơn: sử dụng Kimi K3 qua một API
Với mức phần cứng tối thiểu ở trên, việc tự lưu trữ K3 có ý nghĩa trong một số trường hợp hẹp: bạn đã đang chạy một đội tàu GPU lớn, phần lớn nhàn rỗi; bạn có mức sử dụng liên tục vượt xa điểm hòa vốn nhiều tỷ token; hoặc bạn có một lý do tuân thủ cụ thể khiến dữ liệu không thể rời khỏi cơ sở hạ tầng của bạn. Bên ngoài những trường hợp đó, các tính toán cụm ở trên sẽ chống lại bạn.
APIMaster.ai đã có kimi-k3 trực tiếp trong thị trường mô hình của mình, được định tuyến qua một API tương thích OpenAI. Tuyến đường này sử dụng API riêng của Moonshot cũng như cơ sở hạ tầng GPU đám mây bên ngoài chạy các trọng số mở, do đó giá cả và tính khả dụng phản ánh nhiều hơn một con đường đến cùng một mô hình — hãy kiểm tra thẻ tuyến đường trực tiếp trước khi chuyển khối lượng sản xuất, vì nguồn cung kênh và giá cả có thể thay đổi.
from openai import OpenAI
client = OpenAI(
api_key="YOUR_APIMASTER_KEY",
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[
{"role": "user", "content": "Tóm tắt các đánh đổi của việc tự lưu trữ một mô hình MoE 2.8T."}
],
)
print(response.choices[0].message.content)
Để bắt đầu:
- Đăng ký tài khoản APIMaster.
- Thêm tín dụng ví với một phương thức thanh toán được hỗ trợ.
- Tạo một khóa API từ bảng điều khiển APIMaster.
- Đặt
modelthànhkimi-k3và base URL thànhhttps://apimaster.ai/v1trong tích hợp SDK OpenAI hiện tại của bạn.
Kimi K3 cũng là một phần của chương trình giảm giá 40% hiện tại của APIMaster trên DeepSeek, Kimi K3, MiniMax M3 và GLM-5.2, và mọi tuyến đường có thể được kiểm tra với công cụ kiểm tra dấu vân tay mô hình AI miễn phí trước khi bạn dựa vào nó trong sản xuất.
FAQ
Tôi có thể chạy Kimi K3 trên một GPU duy nhất hoặc một máy trạm thông thường không?
Không. Mức VRAM tối thiểu thực tế là khoảng 1.680GB. Ngay cả một máy trạm 18-card RTX PRO 6000 Blackwell (96GB mỗi card) cũng chỉ vượt qua con số đó trên lý thuyết, mà không có cấu trúc liên kết thực tế để thực sự phục vụ mô hình theo cách đó. Bộ nhớ thống nhất tối đa 512GB của Mac Studio chỉ bằng khoảng một phần ba những gì cần.
Cách rẻ nhất để tự lưu trữ Kimi K3 hợp pháp là gì?
Thuê một nút đám mây 8× B300 hoặc 8× MI355X là điểm khởi đầu, với chi phí khoảng $43.000–$104.000/tháng tùy thuộc vào nhà cung cấp và giá instance. Điều đó chỉ trở nên cạnh tranh về chi phí so với API chính thức khi vượt qua vài tỷ token sử dụng hàng tháng.
Ollama hoặc LM Studio có hỗ trợ Kimi K3 không?
Không chính thức. Các công cụ phục vụ được khuyến nghị của Moonshot là vLLM, SGLang và TokenSpeed — tất cả đều được xây dựng cho triển khai nhiều GPU, trung tâm dữ liệu, không phải suy luận người tiêu dùng trên một máy duy nhất.
Kimi K3 có sẵn qua APIMaster không?
Có. Nó đang trực tiếp trong thị trường APIMaster dưới dạng kimi-k3 sau một điểm cuối tương thích OpenAI, sử dụng cả API riêng của Moonshot và dung lượng GPU đám mây bên ngoài chạy các trọng số mở.
Cửa sổ ngữ cảnh của K3 so sánh thế nào khi chạy cục bộ so với qua API?
Cửa sổ 1M token là giống hệt nhau trong cả hai trường hợp — đó là một thuộc tính của mô hình, không phải đường dẫn phục vụ. Điều thay đổi là hành vi bộ nhớ đệm tiền tố và chi phí: tuyến đường của APIMaster và API riêng của Moonshot đều hỗ trợ định giá cache-hit trên các tiền tố dài lặp lại, trong khi triển khai vLLM tự lưu trữ yêu cầu bật bộ nhớ đệm tiền tố một cách rõ ràng (nó bị tắt theo mặc định cho K3) để có được cùng lợi ích.
Nguồn
- Thẻ mô hình Kimi K3, Hugging Face
- Moonshot AI, bài đăng ra mắt "Open Frontier Intelligence"
- vLLM, "Kimi K3 Is Here: Efficient Day-0 Support on vLLM"
- Fireworks AI, bài đăng ra mắt Kimi K3
- Baseten, hướng dẫn xây dựng API ngày 0
- AMD, Kimi K3 trên AMD Instinct GPUs
- Kingy.ai, phân tích phần cứng/VRAM/chi phí
- Northflank, tổng quan điểm chuẩn/giá/tự lưu trữ
- Định giá chính thức của Kimi K3
Trọng số của Kimi K3 đã được mở, nhưng đối với hầu hết mọi người, con đường nhanh nhất để sử dụng mô hình vẫn là một cuộc gọi API, không phải một cụm GPU. Đăng ký trên APIMaster để nhận khóa tương thích OpenAI cho kimi-k3 mà không cần chuẩn bị bất kỳ phần cứng nào.