AIREITER
API 문서가격
템플릿
  • AIReiter
  • 블로그
  • Kimi K3 오픈 웨이트 공개: 1.56TB, 누가 직접 돌릴 수 있나

Kimi K3 오픈 웨이트 공개: 1.56TB, 누가 직접 돌릴 수 있나

마지막 업데이트: 2026-07-28 08:17:15

다운로드는 누구나 할 수 있다. 하지만 1.56TB에 이르는 Kimi K3를 실제로 띄우는 일은 전혀 다른 문제다. Moonshot은 API 출시 11일 뒤인 2026년 7월 27일 Kimi K3 오픈 웨이트를 공개했다. 파일은 공개 저장소에서 받을 수 있지만, 96개 safetensors 샤드로 구성된 이 모델은 ‘오픈’과 ‘내 환경에서 실행 가능’이 같은 말이 아니라는 점을 빠르게 보여준다. 이번 공개에 무엇이 포함됐는지, 라이선스는 어디까지 허용하는지, 서빙에는 무엇이 필요한지 정리했다.

Moonshot이 공개한 Kimi K3 구성

전체 체크포인트는 Hugging Face의 moonshotai/Kimi-K3에서 받을 수 있으며, 중국 사용자를 위해 ModelScope 미러도 제공된다. 저장소 전체 용량은 1.56TB다. 96개 safetensors 샤드에 더해 config.json, 모델 및 토크나이저 코드인 modeling_kimi_k3.py와 encoding_k3.py, 160K 어휘 규모의 tiktoken 모델, 비전 전처리 코드, LICENSE 파일이 담겼다. 기술 보고서도 MoonshotAI GitHub 저장소에 함께 올라왔다.

1.56TB 저장소 용량, kimi-k3 라이선스 태그, 좋아요 6.6k를 보여주는 moonshotai/Kimi-K3 Hugging Face 파일 목록

모델 카드에서 파라미터 총량보다 더 중요하게 봐야 할 지점은 세 가지다.

  • 토큰당 활성 파라미터는 104B다. 전체 2.8T 파라미터 중 토큰마다 896개 라우팅 전문가 가운데 16개와 공유 전문가 2개가 활성화된다. 모델은 93개 레이어로 구성되며, 이 활성 파라미터 수는 웨이트 공개 전에는 알려지지 않았다.
  • 웨이트는 처음부터 MXFP4 형식이다. Moonshot은 SFT 단계부터 양자화 인지 학습을 적용했고, 활성값에는 MXFP8을 사용했다. BF16 체크포인트를 나중에 양자화한 파일이 아니다. 이번에 공개된 4비트 웨이트 자체가 원본 릴리스다.
  • 어텐션 구조는 69 대 24로 나뉜다. 1,048,576토큰 컨텍스트 윈도우에서 Kimi Delta Attention 레이어 69개와 Gated MLA 레이어 24개를 조합한다.

초기 반응도 빨랐다. 커밋 히스토리상 첫 커밋이 올라온 다음 날인 2026년 7월 28일, 저장소는 좋아요 6.6k를 기록했다. 커뮤니티 변환본도 곧바로 등장했다. unsloth/Kimi-K3-GGUF는 같은 날 저녁 생성됐고, 다음 날 아침에는 GrEarl/Kimi-K3-GGUF에 완전한 Q2_K 변환본이 업로드됐다.

MIT가 아닌 Kimi K3 License

이전 Kimi 플래그십 모델은 Modified MIT 라이선스로 배포됐다. K3는 다르다. K3에는 Kimi K3 License라는 별도 라이선스가 적용된다. 사용, 복사, 수정, 병합, 공개, 배포, 서브라이선스, 판매, 파인튜닝, 파생물 생성 등 본문은 MIT 계열에 가깝지만, 실제 도입 전 반드시 읽어야 할 조건이 두 가지 추가됐다.

Model-as-a-Service 조항. 핵심 문구는 다음과 같다. “If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose.” 라이선스에서 MaaS는 제3자가 입력값, 파라미터 또는 학습 데이터를 제어할 수 있는 방식으로 추론이나 파인튜닝 접근을 제공하는 사업으로 정의된다. 반면 모델 기능을 특정 기능에 내장한 최종 사용자 제품, 또는 타사가 호스팅하는 모델로 요청을 단순 전달하는 행위는 MaaS가 아니라고 명시한다.

표시 의무 조항. K3 기반 상용 제품이 월간 활성 사용자 1억 명 또는 월 매출 2,000만 USD를 넘으면, 해당 제품 UI에 “Kimi K3”를 눈에 띄게 표시해야 한다.

두 조항 모두 순수 내부 사용에는 적용되지 않는다. 여기서 내부 사용은 모델이나 그 출력, 기능을 제3자에게 노출하지 않는 경우를 뜻한다. Moonshot 공식 제품이나 인증 추론 파트너를 통한 접근도 면제 대상이다. 면제 조항을 문언대로 해석하면, 내부 데이터로 K3를 파인튜닝하는 일은 Section 4(a)의 내부 사용 예외에 포함되며, 제품 기능으로 임베드하는 방식은 Section 2에서 MaaS가 아니라고 명시한 사례다. 반대로 K3 추론을 서비스로 재판매하는 사업이 추가 조항이 겨냥하는 경우이며, 12개월 기준 2,000만 USD를 넘는 시점부터는 단순 라이선스 검토가 아니라 Moonshot과의 계약 협상 문제가 된다. 제품 로드맵에 반영하기 전에는 LICENSE 원문을 직접 읽어야 한다. 여기 내용은 라이선스 문구에 대한 해석일 뿐 법률 자문이 아니다.

1.56TB 모델을 돌리는 하드웨어 현실

Kimi K3 오픈 웨이트는 누구나 내려받을 수 있다. 서빙은 그렇지 않다.

vLLM의 공식 K3 레시피는 최소 요구사항을 명확히 적고 있다. 최소 8× GB300이며, 실제 프로덕션 트래픽을 처리하려면 멀티 노드 구성이 필요하다. AMD 환경에서는 ROCm 이미지와 함께 최소 8× MI355X 또는 MI350X를 요구한다. SGLang도 비슷한 급의 장비를 전제로 한 K3 cookbook을 공개했다.

실제로 인프라를 구성한다면 레시피의 운영 주의사항을 특히 꼼꼼히 봐야 한다. 서빙은 기본 vLLM이 아니라 전용 vllm/vllm-openai:kimi-k3 이미지(AMD는 vllm/vllm-openai_rocm:kimi-k3)에서 동작한다. 노드 간 통신에는 RDMA 기반 --all2all-backend deepep_v2 또는 NVLink 기반 flashinfer_nvlink_one_sided를 사용하며, KV 캐시 전송이 RDMA를 타도록 UCX_TLS="rc,cuda_copy"도 설정해야 한다. 권장 MoE 백엔드는 토폴로지에 따라 달라진다. expert-parallel 배포에는 deep_gemm_mega_moe, TP>1에는 flashinfer_trtllm이 권장된다. 레시피는 K3가 가끔 자체 파서도 처리하지 못하는 툴 호출 포맷을 출력한다고도 지적한다. 따라서 서빙 레이어에는 처음부터 스키마 검증과 재시도 로직을 넣는 편이 좋다.

대형 모델에서 흔한 탈출구인 추가 양자화도 여기서는 효과가 제한적이다. MXFP4 자체가 이미 파라미터당 약 4.25비트이기 때문이다. 워크스테이션에서 1T급 모델을 다룰 수 있게 해주던 압축 여지는 다운로드 전에 이미 상당 부분 소진됐다. 최초로 등장한 커뮤니티 2비트 GGUF 변환본도 94개 샤드, 928GB다. 40%를 줄인 수치지만, 애초에 저장 공간이 진짜 병목은 아니었다.

로드하는 항목용량
공식 MXFP4 safetensors1,561 GB
커뮤니티 Q2_K GGUF929 GB
토큰당 활성 파라미터104B

1M토큰 컨텍스트에 가까워질수록 KV 캐시까지 더해져 실제 작업 세트는 계속 커진다. 공개 첫날 나온 자체 호스팅 사례 가운데 가장 눈길을 끈 것은 일반 Ethernet 환경에서 RTX 5090 80개로 공식 MXFP4 웨이트를 구동했다는 한 팀의 주장이다. HBM도 없고 재양자화도 하지 않은 상태에서, 튜닝 전 단일 스트림 성능이 대략 초당 20토큰이었다고 한다. 단일 게시물에 담긴 검증되지 않은 첫날 주장일 뿐 벤치마크는 아니며, 이 한 구성이 최소 사양을 뜻하지도 않는다. 다만 방향성은 분명하다. 소비자용 실리콘에서 K3를 돌렸다고 보고된 가장 저렴한 경로조차 최상위 GPU 80개가 필요했고, 속도도 대부분의 사람이 느리다고 평가할 수준이었다.

Ollama는 특히 짚고 넘어갈 필요가 있다. 대개 가장 먼저 시도하는 경로지만, 라이브러리 항목은 존재해도 실제로는 로컬 다운로드가 아닌 Ollama 호스팅 라우팅인 kimi-k3:cloud로 연결된다. 현재 이 모델을 노트북이나 단일 워크스테이션에서 돌릴 방법은 없다. MXFP4가 편의상 만든 양자화본이 아니라 네이티브 형식이므로, K2 계열에서 통하던 공격적인 재양자화 방식도 활용 여지가 더 적다. llama.cpp 지원은 아직 진행 중이므로 어느 쪽이든 단정하지 말고 최신 상태를 확인해야 한다.

지금 Kimi K3를 사용할 수 있는 곳

대부분의 사용자에게 현실적인 답은 호스팅 엔드포인트다. 오픈 웨이트가 공개되자마자 서드파티 호스트도 하루 안에 서비스를 켰다. 아래 가격은 2026년 7월 28일 기준, 입출력 각각 토큰 100만 개당 표시 가격이다.

호스트양자화컨텍스트가격
Moonshot AIMXFP4 (네이티브)1M$3 / $15
BasetenFP81M$3 / $15
Fireworks미공개1M$3 / $15 ($4.50 / $22.50 티어도 있음)
NebiusFP48K$3 / $15

선택 전 확인할 점은 두 가지다. 첫째, 컨텍스트 윈도우 차이가 매우 크다. Nebius는 같은 표시 가격이지만 8K 윈도우로 제공한다. K3를 선택하는 가장 큰 이유 하나가 사라지는 셈이다. 둘째, 양자화 정밀도가 제각각이다. Moonshot은 네이티브 MXFP4를 제공하고 Baseten은 FP8을 사용하며, 일부 호스트는 정밀도를 아예 공개하지 않는다. 장기 에이전트 작업에서는 보통 가격 차이보다 기준 정밀도와 전체 1M 윈도우를 맞추는 편이 중요하다. 반대로 짧은 프롬프트를 대량 처리한다면 지연 시간과 리전 가용성이 두 요소보다 더 중요한 기준이 될 수 있다.

직접 엔드포인트 외에도 OpenRouter는 하나의 키로 이들 서비스를 묶어 제공한다. 멀티 모델 게이트웨이에서는 K3를 다른 중국 오픈 프런티어 모델과 함께 라우팅할 수 있다. 이미 해당 프로토콜을 쓰는 도구가 있다면 AIReiter는 Anthropic-compatible API로 같은 급의 모델을 제공한다. Moonshot 자체 엔드포인트는 OpenAI 및 Anthropic 호환 인터페이스를 모두 지원한다. 전체 요금과 티어 정보는 Kimi K3 가격 분석에서 확인할 수 있다.

직접 호스팅할까, API를 쓸까

먼저 숫자부터 계산해보자. 토큰 100만 개당 입력 $3, 출력 $15라면 출력 토큰 10억 개 비용은 $15,000이고 입력 토큰 10억 개 비용은 $3,000이다. 이를 최소한의 자체 호스팅 구성과 비교해야 한다. 8× GB300급 노드는 데이터센터 장비를 직접 구매하거나 가속기 시간 단위로 임대해야 하며, 인터커넥트와 전력, 냉각, 그리고 --all2all-backend를 숙지한 엔지니어도 필요하다. NVIDIA와 주요 클라우드 사업자는 이 구성의 정가를 공개하지 않으므로, 통념적인 추정치가 아니라 실제 견적을 바탕으로 비교해야 한다. 하드웨어 비용은 고정이고 API 비용은 실제 사용량에 따라 늘어난다는 점도 잊으면 안 된다.

Kimi K3 오픈 웨이트를 직접 호스팅할 이유는 세 가지로 좁혀진다.

  1. 에어갭 또는 데이터 레지던시 요구사항. 어떤 서드파티 엔드포인트도 충족할 수 없는 조건이라면 가장 강력한 근거가 된다. 이 경우 비용은 결정 요인이 아니다.
  2. 독점 데이터 기반 파인튜닝. 라이선스는 이를 명시적으로 허용하며, 호스팅 엔드포인트로는 얻을 수 없는 기능이다. 다만 학습 비용은 서빙 비용과 별개이며 더 크다.
  3. 포화 상태의 지속적인 트래픽. 멀티 노드 클러스터를 24시간 계속 가동할 정도라면 직접 보유한 하드웨어가 토큰당 가격보다 저렴해질 수 있다. 간헐적인 트래픽 급증은 여기에 해당하지 않는다.

이 세 조건 중 어느 것도 해당하지 않는다면 엔드포인트를 쓰고, 웨이트는 계획이 아니라 선택지로 보자. 대부분의 팀에게 오픈 웨이트 프런티어 모델의 가치는 직접 운영할 수 있다는 데 있지 않다. 호스팅 버전의 가격이 이제 ‘직접 운영할 수도 있다’는 가능성과 경쟁해야 한다는 데 있다.

FAQ

Kimi K3는 오픈소스인가?

Kimi K3는 오픈 웨이트 모델이다. 전체 2.8T 체크포인트를 다운로드할 수 있고, Kimi K3 License는 사용, 수정, 배포, 파인튜닝을 허용한다. 다만 학습 데이터와 전체 학습 파이프라인은 공개되지 않았으며, Model-as-a-Service 사업자에는 매출 기준 조항도 추가돼 있다. 따라서 OSI식 오픈소스라고 보기는 어렵다.

Ollama에서 Kimi K3를 로컬로 실행할 수 있나?

아니다. Ollama의 kimi-k3 항목은 호스팅 엔드포인트로 연결되는 kimi-k3:cloud다. 네이티브 MXFP4 웨이트는 1.56TB이고 커뮤니티 2비트 GGUF도 928GB이므로, 소비자 하드웨어에서 로컬로 실행할 경로는 없다.

Kimi K3 웨이트에는 어떤 라이선스가 적용되나?

Kimi K3 License다. MIT 계열이지만, Model-as-a-Service 사업을 운영하면서 연속된 12개월 동안 매출이 $20M을 넘으면 상업적 목적으로 소프트웨어나 파생물을 사용하기 전에 Moonshot과 별도 계약을 맺어야 한다. 월간 활성 사용자 100M 또는 월 매출 $20M 이상이면 UI 표시 의무도 적용된다. 내부 사용은 두 조건 모두 면제된다.

다운로드 없이 Kimi K3를 어디서 쓸 수 있나?

Moonshot 자체 API와 Kimi 앱, Baseten, Fireworks, Nebius에서 이용할 수 있다. 네 곳 모두 2026년 7월 28일 기준 기본 요금으로 토큰 100만 개당 $3/$15를 제시했지만, 비교에는 조건이 있다. Fireworks에는 $4.50/$22.50 티어도 있고, Nebius는 1M이 아닌 8K 컨텍스트 윈도우에 기본 요금을 적용한다. 모델의 특징과 벤치마크는 Kimi K3 개요에서 확인할 수 있다.

>_AIReiter 모델 디렉터리

이 가이드와 관련된 모델로 빠르게 API 접근

Kimi K3

Chat

코딩, 글쓰기, 분석 및 에이전트 워크플로를 위한 장문 맥락 추론 모델입니다.

MoonshotAPI Key 생성 >

GLM-5.3 Flash

Chat

대량 채팅, 이미지 이해, 추출을 위한 멀티모달 1M 컨텍스트 모델.

ZhipuAPI Key 생성 >

Claude Fable 5

Chat

심층 추론과 복잡한 장문 작업을 위한 프리미엄 Claude 모델입니다.

AnthropicAPI Key 생성 >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI Key 생성 >

Claude Opus 4.8

Chat

까다로운 추론과 전문적인 작업을 위한 고성능 Claude 모델입니다.

AnthropicAPI Key 생성 >

최근 게시글

Janitor AI에서 DeepSeek 사용하는 법 (2026 설정 가이드)

2026-09-08

무료 LLM API 할당량 비교: 11개 제공업체(2026)

2026-09-08

Muse Spark 1.3 API 가격: Standard와 Contributor 비교

2026-09-08

GPT-6 Astra API 리뷰(2026): 에이전트용이지, 무조건 교체용은 아니다

2026-09-07
AIREITER

문의가 있으신가요? 연락처
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI 비디오

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI 이미지

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

블로그

모두 보기 →

회사

개인정보 처리방침서비스 약관환불 정책

© 2026 AIReiter. All rights reserved.