AIREITER
DOCS APIPRECIOS
PLANTILLAS
  • AIReiter
  • Blog
  • Ya están disponibles los pesos abiertos de Kimi K3: 1,56 TB y quién puede ejecutarlo

Ya están disponibles los pesos abiertos de Kimi K3: 1,56 TB y quién puede ejecutarlo

Última actualización: 2026-07-28 08:15:41

Moonshot publicó los pesos abiertos de Kimi K3 el 27 de julio de 2026, once días después de estrenar el modelo mediante API. La descarga es pública y totalmente real, pero sus 1,56 TB repartidos en 96 fragmentos safetensors dejan clara una distinción importante: que un modelo sea abierto no significa que sea viable ejecutarlo. Esto es lo que se ha liberado, qué permite la licencia y qué infraestructura hace falta para servirlo.

Qué incluye la publicación de Moonshot

El checkpoint completo está disponible en Hugging Face, en moonshotai/Kimi-K3, y cuenta con un mirror en ModelScope para usuarios de China. El repositorio ocupa 1,56 TB e incluye 96 fragmentos safetensors, además de config.json, el código del modelo y del tokenizador (modeling_kimi_k3.py, encoding_k3.py y un modelo tiktoken con vocabulario de 160K), preprocesado de visión y el archivo LICENSE. El informe técnico se publicó al mismo tiempo en el repositorio de MoonshotAI en GitHub.

Listado de archivos de Hugging Face para moonshotai/Kimi-K3, con un repositorio de 1,56 TB, la etiqueta de licencia kimi-k3 y 6,6k me gusta

Más allá de la cifra total de parámetros, hay tres datos de la model card especialmente relevantes:

  • Son 104B de parámetros activos de un total de 2,8T. El modelo enruta 16 de 896 expertos por token, más 2 expertos compartidos, a lo largo de 93 capas. Esa cifra de parámetros activos no se había hecho pública antes de la liberación de los pesos.
  • Los pesos se publican de forma nativa en MXFP4. Moonshot aplicó entrenamiento consciente de cuantización desde la fase SFT, con activaciones MXFP8. No es una cuantización posterior de un checkpoint BF16: los pesos de 4 bits son la versión publicada.
  • La atención se reparte 69/24 entre capas Kimi Delta Attention y Gated MLA, con una ventana de contexto de 1.048.576 tokens.

La adopción reaccionó rápido. El repositorio alcanzó 6,6k me gusta el 28 de julio de 2026, un día después del primer commit en su historial de commits, y ya habían aparecido conversiones de la comunidad: unsloth/Kimi-K3-GGUF se creó esa misma noche, mientras que GrEarl/Kimi-K3-GGUF subió una conversión completa Q2_K a la mañana siguiente.

La Kimi K3 License no es MIT

Los anteriores modelos insignia de Kimi se distribuyeron bajo una licencia MIT modificada. K3 no. Llega con un documento denominado Kimi K3 License. Su texto parte de MIT —permite usar, copiar, modificar, fusionar, publicar, distribuir, sublicenciar, vender, hacer fine-tuning y crear derivados—, pero añade dos condiciones que conviene revisar antes de construir un producto sobre él.

La cláusula de Model-as-a-Service. El texto operativo dice: "If the Licensee or any of its affiliates operates a Model as a Service business, and the aggregate revenue of the Licensee and its affiliates exceeds 20 million US dollars ... in total over any consecutive 12 months, the Licensee must enter into a separate agreement with Moonshot AI before using the Software or its derivative works for any commercial purpose." La licencia define MaaS como dar a un tercero acceso de inferencia o fine-tuning de modo que pueda controlar las entradas, los parámetros o los datos de entrenamiento. También excluye expresamente dos casos que no son MaaS: productos de usuario final donde las capacidades del modelo están integradas en funciones concretas, y el simple reenvío de solicitudes a modelos alojados por terceros.

La cláusula de atribución. Si un producto comercial construido sobre K3 supera los 100 millones de usuarios activos mensuales o los 20 millones USD de ingresos mensuales, deberá mostrar "Kimi K3" de forma destacada en su interfaz.

Ambas cláusulas quedan exentas en el uso exclusivamente interno, es decir, cuando el modelo, sus salidas o sus capacidades no se exponen a terceros, y también para el acceso mediante los productos oficiales de Moonshot o socios certificados de inferencia. Interpretando literalmente las exenciones: el fine-tuning de K3 con datos internos está cubierto por la excepción de uso interno de la Sección 4(a), y su integración como función de un producto figura en la Sección 2 como una actividad que no constituye MaaS. Revender inferencia de K3 como servicio es justamente el supuesto para el que se redactaron las cláusulas adicionales, y el umbral de $20M marca el punto en que deja de ser una cuestión de licencia y pasa a requerir una negociación contractual. Lee la LICENSE directamente antes de comprometer una hoja de ruta: este resumen interpreta el texto y no constituye asesoramiento legal.

La realidad del hardware para 1,56 TB

Cualquiera puede descargar los pesos abiertos de Kimi K3. Servirlos es otra historia.

La receta oficial para K3 de vLLM lo resume sin rodeos: como mínimo 8× GB300, y varios nodos para tráfico de producción real. En AMD, indica al menos 8× MI355X o MI350X con la imagen ROCm. SGLang también publica un cookbook para K3 dirigido al mismo tipo de infraestructura.

Si de verdad vas a aprovisionar este modelo, las notas operativas de la receta merecen una segunda lectura. El servicio se ejecuta con la imagen específica vllm/vllm-openai:kimi-k3 —o vllm/vllm-openai_rocm:kimi-k3 en AMD—, no con vLLM estándar. Para tráfico entre nodos recomienda --all2all-backend deepep_v2 sobre RDMA o flashinfer_nvlink_one_sided sobre NVLink, con UCX_TLS="rc,cuda_copy" configurado para que la transferencia de caché KV permanezca en RDMA. La recomendación para el backend MoE depende de la topología: deep_gemm_mega_moe en despliegues con paralelismo de expertos y flashinfer_trtllm para TP>1. La receta también advierte de que K3 genera ocasionalmente un formato de llamada a herramientas que su propio parser rechaza, así que la validación de esquema y los reintentos deberían formar parte de la capa de serving desde el primer día.

La salida habitual, cuantizar todavía más el modelo, apenas funciona aquí porque MXFP4 ya equivale a unos 4,25 bits por parámetro. El margen de compresión que volvía manejables en una workstation los modelos de clase 1T ya se consumió antes de descargar nada. La primera conversión comunitaria GGUF de 2 bits que apareció ocupa 928 GB repartidos en 94 fragmentos: un ahorro del 40% sobre una cifra que nunca fue el cuello de botella principal.

Qué se cargaTamaño
safetensors MXFP4 oficiales1.561 GB
GGUF Q2_K de la comunidad929 GB
Parámetros activados por token104B

Si se añade caché KV para acercarse siquiera al contexto de 1M tokens, el conjunto de trabajo crece aún más. El informe de autoalojamiento más llamativo del primer día fue el de un equipo que afirma ejecutar los pesos oficiales MXFP4 en 80× RTX 5090 conectadas por Ethernet convencional, sin HBM ni recuantización, a aproximadamente 20 tokens/segundo en un único flujo y sin optimizar. Es una afirmación no auditada, publicada el primer día y procedente de un único post; no es un benchmark, y una configuración no establece un mínimo. Solo merece citarse por lo que indica: la ruta más barata reportada para ejecutar K3 en silicio de consumo requirió ochenta GPU de gama alta y ofreció una velocidad que la mayoría consideraría lenta.

Conviene mencionar Ollama específicamente, porque suele ser lo primero que prueba la gente. La entrada existe en la biblioteca, pero resuelve a kimi-k3:cloud, el enrutamiento alojado de Ollama en lugar de una descarga local. Hoy no hay una vía para ejecutar este modelo en un portátil ni en una única workstation; y como MXFP4 es el formato nativo, no una cuantización de conveniencia, la vía habitual de la comunidad —recuantizar de forma agresiva— tiene menos margen que con la línea K2. El soporte en llama.cpp todavía está en desarrollo, así que conviene comprobar el estado actual en lugar de darlo por hecho en un sentido u otro.

Dónde ejecutar Kimi K3 hoy

Para casi todo el mundo, la respuesta práctica es un endpoint alojado. Y la publicación de los pesos abiertos tuvo el efecto habitual: los proveedores externos se activaron en menos de un día. Los precios siguientes son por millón de tokens, entrada/salida, tal como figuraban el 28 de julio de 2026.

ProveedorCuantizaciónContextoPrecio
Moonshot AIMXFP4 (nativa)1M$3 / $15
BasetenFP81M$3 / $15
Fireworksno indicado1M$3 / $15 (también ofrece un nivel de $4.50 / $22.50)
NebiusFP48K$3 / $15

Hay dos puntos que revisar antes de elegir. Primero, la ventana de contexto cambia radicalmente. Nebius ofrece el mismo precio de lista con una ventana de 8K, lo que elimina el principal motivo para usar K3. Segundo, la cuantización tampoco es uniforme: Moonshot sirve MXFP4 nativo, Baseten utiliza FP8 y varios proveedores ni siquiera especifican la precisión. Para trabajo agéntico de largo recorrido, igualar la precisión de referencia y disponer de la ventana completa de 1M suele importar más que la diferencia de precio; para prompts cortos con mucho volumen, la latencia y la disponibilidad regional pueden pesar más que ambas cosas.

Además de los endpoints directos, OpenRouter los agrega detrás de una única clave, y los gateways multimodelo enrutan K3 junto a otros modelos chinos abiertos de frontera; AIReiter expone modelos de la misma clase mediante una API compatible con Anthropic si tu tooling ya habla ese protocolo. El propio endpoint de Moonshot ofrece interfaces compatibles tanto con OpenAI como con Anthropic. Los detalles completos de tarifas y niveles están en el desglose de precios de Kimi K3.

¿Autoalojarlo o usar un endpoint?

Primero, haz las cuentas. A $3/$15 por millón de tokens, mil millones de tokens de salida cuestan $15.000 y mil millones de tokens de entrada cuestan $3.000. Compáralo con el mínimo viable para autoalojamiento: un nodo de clase 8× GB300, una compra de capital para centro de datos o un alquiler facturado por hora de acelerador, además de interconexión, electricidad, refrigeración y un ingeniero que conozca --all2all-backend de memoria. Ni NVIDIA ni los principales proveedores cloud publican un precio de lista para esa configuración, así que la comparación debe partir de una cotización actual, no de una regla aproximada. Y recuerda que el coste del hardware es fijo, mientras que el de la API escala con el uso real.

Autoalojar los pesos abiertos de Kimi K3 tiene sentido en tres situaciones, y son más limitadas de lo que parecen:

  1. Requisitos de entorno aislado o residencia de datos que ningún endpoint de terceros pueda cubrir. Es el caso más sólido, y el coste no es el factor decisivo.
  2. Fine-tuning con datos propietarios. La licencia lo permite expresamente, y es algo que ningún endpoint alojado ofrece. Ten en cuenta que el coste de entrenamiento es independiente y mayor que el de serving.
  3. Volumen sostenido a plena carga. Si mantienes ocupado un clúster multinodo las 24 horas, el hardware propio puede bajar del precio por token. Los picos ocasionales no cuentan.

Si no encajas en ninguno de esos casos, usa un endpoint y trata los pesos como una opción, no como un plan. Para la mayoría de equipos, el valor de un modelo de frontera con pesos abiertos no está en que vayan a ejecutarlo. Está en que el precio de su versión alojada ahora debe competir con la posibilidad de que pudieran hacerlo.

Preguntas frecuentes

¿Kimi K3 es open source?

Es un modelo de pesos abiertos. El checkpoint completo de 2,8T se puede descargar, y la Kimi K3 License permite usarlo, modificarlo, distribuirlo y hacer fine-tuning. No se han publicado los datos de entrenamiento ni el pipeline completo de entrenamiento, y la licencia añade una cláusula activada por ingresos para operadores de Model-as-a-Service, por lo que no es open source al estilo OSI.

¿Puedo ejecutar Kimi K3 localmente con Ollama?

No. La entrada kimi-k3 de Ollama corresponde a kimi-k3:cloud, que enruta a un endpoint alojado. Los pesos MXFP4 nativos ocupan 1,56 TB y un GGUF comunitario de 2 bits sigue ocupando 928 GB, así que no existe una vía local en hardware de consumo.

¿Bajo qué licencia se distribuyen los pesos de Kimi K3?

Bajo la Kimi K3 License: deriva de MIT, pero exige un acuerdo independiente con Moonshot si operas un negocio Model-as-a-Service que supera $20M de ingresos durante cualquier período de 12 meses, además de atribución en la interfaz por encima de 100M MAU o $20M de ingresos mensuales. El uso interno queda exento de ambas condiciones.

¿Dónde puedo usar Kimi K3 sin descargarlo?

En la API de Moonshot y la app Kimi, además de Baseten, Fireworks y Nebius. Los cuatro muestran una tarifa base de $3/$15 por millón de tokens a 28 de julio de 2026, aunque la comparación tiene matices: Fireworks también ofrece un nivel de $4.50/$22.50, y Nebius aplica la tarifa base con una ventana de contexto de 8K en vez de 1M. Para conocer el modelo y sus benchmarks, consulta la visión general de Kimi K3.

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Kimi K3

Chat

Un modelo de razonamiento de contexto largo para programación, escritura, análisis y flujos de trabajo de agentes.

MoonshotCrear API Key >

Claude Fable 5

Chat

Un modelo premium de Claude para razonamiento profundo y trabajo complejo de formato largo.

AnthropicCrear API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrear API Key >

Claude Opus 4.8

Chat

Un modelo Claude de alta capacidad para tareas que exigen razonamiento y trabajo profesional.

AnthropicCrear API Key >

Claude Opus 5

Chat

Un modelo premium de Claude para razonamiento complejo, programación y trabajo profesional con contexto largo.

AnthropicCrear API Key >

Publicaciones recientes

Cómo usar DeepSeek en Janitor AI (configuración 2026)

2026-09-08

Comparativa de API LLM gratis: cuotas de 11 proveedores (2026)

2026-09-08

Precios de la API de Muse Spark 1.3: Standard frente a Contributor

2026-09-08

Análisis de la API de GPT-6 Astra (2026): creada para agentes, no para sustituir sin más

2026-09-07
AIREITER

¿Preguntas? Contáctanos en
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagen IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.