APIMaster.ai
블로그로 돌아가기
APIMaster 블로그

Kimi K3 오픈 웨이트: 배포, 비용 및 호스팅 제공 업체

Kimi K3의 2.8T 웨이트가 공개되었습니다. 자체 호스팅을 위한 실제 VRAM 계산, 출시 당일 호스팅을 제공하는 업체, GPU 클러스터를 건너뛰는 API 경로를 알아보세요.

Kimi K3Moonshot AI오픈 웨이트자체 호스팅APIMaster

게시 2026-07-28

빠른 답변

Moonshot AI가 2026년 7월 27일 Hugging Face에 Kimi K3의 웨이트를 공개했습니다. 2.8조 개 파라미터의 Mixture-of-Experts 모델로, 토큰당 896개 전문가 중 16개가 활성화되어 약 104B의 활성 파라미터를 가지며, 1,048,576 토큰 컨텍스트 윈도우와 네이티브 비전 기능을 갖추고 있습니다. Hugging Face 저장소는 96개의 safetensors 샤드로 제공되며, 디스크 용량은 약 1.56TB입니다.

직접 실행하려면 워크스테이션이 아닌 실제 GPU 클러스터가 필요합니다. vLLM의 최소 사양은 8× NVIDIA B300 또는 8× AMD MI355X이며, Moonshot의 프로덕션 권장 사항은 64개 이상의 가속기입니다. 단일 GPU 또는 단일 노드 컨슈머 경로는 존재하지 않습니다. Mac Studio의 512GB 통합 메모리는 VRAM 최소 요구량의 약 1/3 수준이며, 18개의 RTX PRO 6000 Blackwell 워크스테이션조차도 실행 가능한 토폴로지가 없어 간신히 기준을 충족할 뿐입니다.

거의 모든 사용자에게 실용적인 선택은 API입니다. APIMaster.ai는 이미 kimi-k3를 OpenAI 호환 엔드포인트 뒤에서 라우팅하고 있으며, Moonshot 자체 API와 함께 외부 클라우드 GPU 인프라의 용량도 포함하므로, 대부분 유휴 상태로 있는 클러스터를 프로비저닝하거나 비용을 지불하지 않고 모델을 사용할 수 있습니다.

Moonshot이 실제로 공개한 것은 무엇인가요?

Kimi K3의 모델 카드Moonshot의 자체 발표는 아키텍처를 다음과 같이 설명합니다:

사양
총 파라미터 2.8T (저장소 메타데이터 기준 2.7799T)
토큰당 활성 파라미터 ~104B (896개 라우팅 전문가 중 16개)
레이어 총 93개 — 1 Dense, 69 Kimi Delta Attention (KDA), 24 Gated MLA
컨텍스트 윈도우 1,048,576 토큰
비전 인코더 MoonViT-V2, 401M 파라미터, 네이티브 이미지/비디오 입력
네이티브 양자화 MXFP4 웨이트, MXFP8 활성화 (양자화 인식 학습)
웨이트 형식 Safetensors, 96개 샤드, ~1.56TB / ~1.42TiB
라이선스 맞춤형 "Kimi K3 라이선스" — 상업적 사용 전 라이선스 파일 필독

Moonshot이 강조하는 두 가지 아키텍처 요소인 **Kimi Delta Attention (KDA)**와 **Attention Residuals (AttnRes)**는 하이브리드 선형 어텐션 설계로, 이 규모에서 표준 전체 어텐션보다 100만 토큰 컨텍스트 윈도우를 더 저렴하게 제공하기 위한 것입니다.

공식 권장 서빙 엔진은 vLLM, SGLang, TokenSpeed입니다. 공식적인 Ollama, llama.cpp 또는 LM Studio 지원은 없습니다. 이는 K3에 대한 모든 배포 관련 글에서 지적된 사항인데, 이러한 도구들은 이 모델의 아키텍처에 맞지 않는 단일 노드, 컨슈머 하드웨어 추론을 위해 설계되었기 때문입니다.

Kimi K3를 실제로 어떻게 배포하나요?

하드웨어가 있다면, vLLM 출시 당일 지원 게시글과 모델 카드가 실제 경로를 제시합니다. 이것은 "배포 방법"에 대한 정직한 버전입니다. 대부분은 이미 멀티 GPU 노드를 보유하고 있을 때만 적용됩니다:

최소 하드웨어. vLLM은 최소 1개의 8× B300 (또는 GB300 NVL72) 노드를 권장하며, 16× B200도 지원됩니다. AMD의 ROCm 경로는 8× MI355X를 지원합니다. Moonshot의 자체 프로덕션 가이드라인은 64개 이상의 가속기로 구성된 "슈퍼노드"입니다. 8-GPU 최소 사양은 모델을 실행할 수 있게 해주지만, 프로덕션 처리량으로 실행되지는 않습니다.

빠른 시작 명령어, 모델 카드에서 직접 가져왔습니다:

pip install vllm
vllm serve "moonshotai/Kimi-K3"

또는 SGLang을 통해:

python -m sglang.launch_server --model-path moonshotai/Kimi-K3

Moonshot은 또한 Docker 경로를 문서화합니다: docker model run hf.co/moonshotai/Kimi-K3.

선택 사항이 아닌 구성 세부 정보. vLLM에서 K3의 프리픽스 캐싱은 기본적으로 비활성화되어 있습니다. 다중 턴 워크로드에서 100만 토큰 컨텍스트의 이점을 대부분 얻으려면 명시적으로 플래그를 전달해야 합니다. MoE 백엔드 선택은 설정에 따라 다르며(deep_gemm_mega_moe는 분리/전문가 병렬, flashinfer_trtllm은 텐서 병렬 >1), 올투올 백엔드는 상호 연결에 따라 다릅니다(flashinfer_nvlink_one_sided는 NVLink, deepep_v2는 RDMA). 비전 인코더는 기본적으로 데이터 병렬 처리가 필요합니다. head_size=12TP=8에 걸쳐 균등하게 샤딩할 수 없기 때문입니다.

실제 처리량은 어떻게 되나요? vLLM은 배치 크기 1에서 TP8 기준 사용자당 초당 111토큰, TP16 기준 초당 118토큰의 기준 성능을 보고합니다. 추측 디코딩(DSpark)을 사용하면 사용자당 초당 331~370토큰으로 증가하여 3.14배 속도 향상을 보이지만, 이는 이미 프로비저닝된 클러스터 위에 추측 디코딩 경로를 튜닝한 후에만 가능합니다.

자체 호스팅의 실제 비용

여기서 "배포할 수 있는가"와 "배포해야 하는가"가 갈라집니다. vLLM의 블로그와 독립적인 하드웨어/비용 분석에서 상호 참조된 계산 결과입니다:

  • VRAM 최소 요구량: ~1,680GB. 4비트에서 2.8T 파라미터의 이론적 최소값은 약 1.4TB입니다. 실제 서빙 풋프린트(웨이트 + KV 캐시 + 오버헤드)는 더 높습니다.
  • 스토리지: 1.56TB의 웨이트. 체크포인트와 스크래치 공간을 보관하려면 최소 4TB의 빠른 NVMe를 계획해야 합니다. 다운로드는 100Gbps 회선에서 약 2분이 걸리는 반면, 100Mbps 연결에서는 거의 35시간이 소요됩니다.
  • 최소 요구량을 충족하는 GPU 구성: 8× B300/MI355X (집계 2,304GB), 16× H200 (2,256GB), 16× B200 (2,880GB) 또는 32× H100 (2,560GB). 이보다 작은 구성은 작동하지 않습니다.
  • 2026년 7월 기준 클라우드 임대료 추정: 8× B300 노드는 공급업체에 따라 시간당 약 $59~$142이며, 지속적으로 실행할 경우 월 $43,000~$104,000입니다. 16× H200 노드는 월 $46,600~$116,800입니다.
  • 공식 API 대비 손익분기점 (Moonshot의 캐시 히트 입력, 캐시 미스 입력, 출력 각각 백만 개당 $0.30/$3.00/$15.00 기준): 위의 가장 저렴한 노드 추정치는 캐싱이 없는 경우 월 약 80억 토큰 이상, 또는 90% 캐시 히트율에서 월 125억 토큰 이상 사용해야 자체 비용을 충당합니다.

실제 사용량이 월 80억 토큰에 한참 못 미친다면 — 그리고 거의 모든 사람이 그렇습니다 — 임대 클러스터는 API보다 더 나쁜 조건을 얻기 위해 한 달에 수만 달러를 지출하는 방법입니다.

누가 이미 실행하고 있나요?

K3의 웨이트는 이 글을 쓰는 시점에서 불과 몇 시간 전에 공개되었지만, Moonshot이 사전에 추론 벤더들과 출시를 조율했기 때문에 출시 당일 지원이 빠르게 이루어졌습니다:

  • vLLM은 위의 처리량 수치와 함께 공식 출시 당일 지원을 제공했으며, NVIDIA (Hopper 및 Blackwell)와 AMD (MI355X)를 ROCm 지원과 함께 출시 시점에 지원했습니다.
  • Fireworks AI출시와 동시에 K3를 플랫폼에 탑재하여, 자체 관리 클러스터가 아닌 소유 가능한 호스팅 추론으로 포지셔닝했습니다.
  • Baseten은 자체 호스팅 설정을 설명하는 출시 당일 API 빌드 가이드를 게시했습니다.
  • AMD는 자체 Instinct GPU 배포 관련 글을 게시했는데, 이는 새로운 프론티어 오픈 웨이트 모델이 하드웨어 벤더의 출시 당일 지원을 받아 출시될 때 일반적인 관행입니다.
  • 여러 인프라 블로그 — Northflank, Hyperstack — 는 첫날 이내에 배포 및 비용 분석을 게시했으며, 이는 거의 모든 대상 독자가 실제 클러스터를 실행하지 않을 것임에도 불구하고 벤더들이 자체 호스팅 가이드에 대해 얼마나 많은 수요를 예상하는지 보여줍니다.

이 패턴은 모든 대규모 오픈 웨이트 출시와 일치합니다. 소수의 추론 플랫폼과 하드웨어 벤더가 출시 당일 지원을 제공하고, 24~48시간 이내에 하드웨어/비용 관련 글의 물결이 뒤따르며, 실제 사용량의 대부분은 여전히 자체 관리 배포가 아닌 API를 통해 이루어집니다.

더 간단한 경로: API를 통해 Kimi K3 사용하기

위의 하드웨어 최소 요구량을 고려할 때, K3 자체 호스팅은 다음과 같은 좁은 범위의 경우에만 의미가 있습니다: 이미 대부분 유휴 상태인 대규모 GPU 플릿을 운영 중이거나, 수십억 토큰 손익분기점을 훨씬 넘는 지속적인 사용량이 있거나, 데이터가 인프라를 벗어날 수 없는 특정 규정 준수 사유가 있는 경우입니다. 이러한 경우가 아니라면, 위의 클러스터 계산은 불리하게 작용합니다.

APIMaster.ai는 이미 kimi-k3를 라이브로 제공하며, OpenAI 호환 API를 통해 모델 마켓플레이스에서 라우팅됩니다. 이 경로는 Moonshot 자체 API는 물론 오픈 웨이트를 실행하는 외부 클라우드 GPU 인프라의 용량을 활용하므로, 가격 및 가용성은 동일한 모델에 대한 둘 이상의 경로를 반영합니다. 프로덕션 볼륨으로 이동하기 전에 라이브 경로 카드를 확인하세요. 채널 공급 및 가격이 변동될 수 있기 때문입니다.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APIMASTER_KEY",
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="max",
    messages=[
        {"role": "user", "content": "2.8T MoE 모델을 자체 호스팅할 때의 장단점을 요약해줘."}
    ],
)

print(response.choices[0].message.content)

시작하는 방법:

  1. APIMaster 계정 등록.
  2. 지원되는 결제 수단으로 지갑에 크레딧을 추가합니다.
  3. **APIMaster 콘솔**에서 API 키를 생성합니다.
  4. 기존 OpenAI SDK 통합에서 model을 **kimi-k3**로, 기본 URL을 **https://apimaster.ai/v1**로 설정합니다.

Kimi K3는 또한 APIMaster의 현재 DeepSeek, Kimi K3, MiniMax M3, GLM-5.2 40% 할인 프로모션에 포함되어 있으며, 모든 경로는 프로덕션에서 사용하기 전에 무료 **AI 모델 지문 테스터**로 확인할 수 있습니다.

FAQ

단일 GPU나 일반 워크스테이션에서 Kimi K3를 실행할 수 있나요?

아니요. 현실적인 VRAM 최소 요구량은 약 1,680GB입니다. 18개의 RTX PRO 6000 Blackwell 워크스테이션(카드당 96GB)조차도 서류상으로는 간신히 그 수치를 넘지만, 실제로 그 방식으로 모델을 서비스할 실행 가능한 토폴로지는 없습니다. Mac Studio의 최대 512GB 통합 메모리는 필요한 용량의 약 1/3입니다.

Kimi K3를 합법적으로 자체 호스팅하는 가장 저렴한 방법은 무엇인가요?

8× B300 또는 8× MI355X 클라우드 노드를 임대하는 것이 진입점이며, 공급업체 및 인스턴스 가격에 따라 월 약 $43,000~$104,000입니다. 이는 월간 수십억 토큰의 사용량이 있어야 공식 API와 비용 경쟁력을 갖출 수 있습니다.

Ollama나 LM Studio가 Kimi K3를 지원하나요?

공식적으로는 아닙니다. Moonshot의 권장 서빙 엔진은 vLLM, SGLang, TokenSpeed입니다. 이들은 모두 단일 머신 컨슈머 추론이 아닌 멀티 GPU, 데이터 센터 배포를 위해 구축되었습니다.

Kimi K3를 APIMaster를 통해 사용할 수 있나요?

네. APIMaster 마켓플레이스에서 kimi-k3로 OpenAI 호환 엔드포인트 뒤에서 라이브로 제공되며, Moonshot 자체 API와 오픈 웨이트를 실행하는 외부 클라우드 GPU 용량을 모두 활용합니다.

K3의 컨텍스트 윈도우를 로컬에서 실행할 때와 API를 통해 실행할 때 어떻게 비교되나요?

100만 토큰 윈도우는 두 경우 모두 동일합니다. 이는 서빙 경로가 아닌 모델 자체의 속성입니다. 변경되는 것은 프리픽스 캐싱 동작과 비용입니다. APIMaster의 경로와 Moonshot 자체 API는 모두 반복되는 긴 프리픽스에 대한 캐시 히트 가격을 지원하는 반면, 자체 호스팅 vLLM 배포는 동일한 이점을 얻기 위해 프리픽스 캐싱을 명시적으로 활성화해야 합니다(K3에서는 기본적으로 꺼져 있습니다).

출처

Kimi K3의 웨이트는 공개되었지만, 거의 모든 사람에게 모델을 사용하는 가장 빠른 경로는 여전히 GPU 클러스터가 아닌 API 호출입니다. **APIMaster에 등록**하여 하드웨어를 프로비저닝하지 않고 kimi-k3용 OpenAI 호환 키를 받으세요.