Kimi K3 es de pesos abiertos, pero todavía no puedes descargarlo. Moonshot se ha comprometido a publicar los pesos completos el 27 de julio de 2026 en Hugging Face; hasta entonces, puedes acceder a K3 solo a través de la app y la API. Esta guía cubre cuándo llegarán los pesos, dónde estarán alojados, quién hospeda K3 ahora y la realidad de hardware de ejecutar tú mismo un modelo de 2,8 billones de parámetros.
¿Kimi K3 es de código abierto?
Sí, se está lanzando como un modelo de pesos abiertos, y con 2.8 billones de parámetros se lo está llamando el modelo de pesos abiertos más grande publicado hasta la fecha. "Open-weight" significa que Moonshot publica los pesos entrenados para que los descargues, los ejecutes y los ajustes, como hizo con los anteriores modelos insignia de Kimi. No es lo mismo que código abierto completo: obtienes los pesos, no necesariamente los datos de entrenamiento ni el pipeline.
El compromiso se confirma a nivel del personal, no solo en marketing. Cuando se le preguntó en X si el open sourcing de K3 sería "another DeepSeek moment" para el sector, Xinyu Zhou de Moonshot (@zxytim) respondió simplemente: "Will do."
La salvedad importante hoy es el momento. Al momento de escribir esto, los pesos no están en la organización de Hugging Face de Moonshot, que sigue teniendo como tope Kimi K2.7 Code. Así que K3 se anuncia como open-weight, pero actualmente solo es utilizable como un modelo alojado.
¿Cuándo se publican los pesos de Kimi K3?
El propio blog técnico de Moonshot indica que los pesos completos se publicarán el 27 de julio de 2026, junto con un informe técnico con la arquitectura y los detalles de entrenamiento. Espérelos bajo la organización de Moonshot en Hugging Face, siguiendo la licencia Modified MIT que ha utilizado para los lanzamientos recientes de Kimi; la licencia final se incluye con los archivos.
Hasta entonces, la tarjeta del modelo, los formatos exactos de distribución y el recuento oficial de parámetros activos no son públicos, así que cualquier enlace de "descargar Kimi K3" antes de esa fecha no es el auténtico.
Dónde ejecutar Kimi K3 hoy
No tienes que esperar a las weights para usar K3, simplemente aún no puedes autoalojarlo.
Ya está disponible hoy es la propia pila de Kimi: la aplicación en kimi.com, Kimi Code y la API (ID del modelo kimi-k3 en https://api.moonshot.ai/v1), facturada a $3/$15 por millón de tokens. Consulta el desglose completo de precios.
Se espera una vez que se publiquen los weights: los hosts de terceros deberían activarse rápidamente. Fireworks es un probable host de día cero, su página de socio Kimi ofreció K2.5, K2.6 y K2.7 en el lanzamiento, y Baseten ha abierto una lista de espera para K3 en lugar de un endpoint en vivo. Considere ambos como próximamente disponibles, no como disponibles ahora. Los agregadores de múltiples modelos también suelen seguir; plataformas como AIReiter ya enrutan modelos abiertos chinos como DeepSeek V4 y GLM 5.2 a través de una Anthropic-compatible API.
Para el autoalojamiento, espera la pila local habitual, Ollama, vLLM y las cuantizaciones GGUF, para añadir compatibilidad con K3 después de que se publiquen los pesos, como hicieron con la línea K2.
La realidad de hardware de un MoE de 2.8T
Kimi K3 es un modelo Mixture-of-Experts con 2.8 billones de parámetros totales (16 de 896 expertos activos por token), y Moonshot recomienda ejecutarlo en supernodos con al menos 64 aceleradores. Alojarlo en autoalojamiento no es un pasatiempo de una sola GPU.
Para tener una idea concreta de la escala, la generación anterior Kimi K2.7 Code, con 1 billón de parámetros, necesita aproximadamente estos recursos (K3, con 2,8 veces la cantidad de parámetros, necesitará bastante más):
| Precisión | VRAM aprox. (K2.7 Code, 1T) |
|---|---|
| FP16 (completo) | ~2,308 GB |
| INT4 | ~577 GB |
| 2 bits agresivo (Unsloth dinámico) | ~325 GB |
Dos cosas lo facilitan. Moonshot distribuye pesos MoE en INT4 nativo con atención BF16, así que una cuantización de 4 bits está cerca de la precisión de entrenamiento, no es una ocurrencia tardía con pérdida; y Kimi Delta Attention ofrece hasta 6.3x más velocidad de decodificación en contextos de un millón de tokens, lo que ayuda en sesiones agentic largas. Aun así, un K3 autohospedado realista implica un servidor multi-GPU o una compilación cuantizada en hardware serio, no una computadora de escritorio.
¿Deberías autoalojarlo o usar un modelo alojado?
Para casi todo el mundo, hosted es la opción correcta. A $3/$15 por millón de tokens en la API, necesitarías un volumen muy alto y sostenido antes de que el coste de un equipo multi-GPU (o un supernode alquilado) se amortice frente a un endpoint gestionado. Self-hosting merece la pena en tres casos: requisitos estrictos de residencia de datos o entornos air-gapped, fine-tuning K3 con tus propios datos, o ejecutar a una escala en la que el hardware propio realmente rebaje el precio por token.
Si ninguna de esas opciones aplica, usa la API o un proveedor como Fireworks, y trata los open weights como un seguro, la opción de moverlo a interno más adelante, en lugar de un plan desde el primer día.
Preguntas frecuentes
¿Kimi K3 es de código abierto?
Es de peso abierto: Moonshot publicará los pesos descargables, previstos bajo una licencia MIT modificada. Eso no es lo mismo que liberar los datos de entrenamiento, pero sí permite el autoalojamiento y el ajuste fino.
¿Cuándo se publican los pesos de Kimi K3?
Para el 27 de julio de 2026, según el blog técnico de Moonshot, en su organización de Hugging Face, junto con un informe técnico. No se pueden descargar antes de esa fecha.
¿Puedo ejecutar Kimi K3 en Ollama?
Aún no, porque los pesos no son públicos. Una vez que se publiquen, es de esperar que las compilaciones de Ollama, vLLM y GGUF añadan compatibilidad, como hicieron para la serie K2.
¿Qué hardware necesito para ejecutar Kimi K3?
Mucho. Moonshot recomienda al menos 64 aceleradores para el servicio. Como referencia, el 1T K2.7 Code necesita aproximadamente 577 GB de VRAM a INT4; K3, con 2,8 billones de parámetros, necesita considerablemente más, así que planifica un servidor multi-GPU o una compilación cuantizada en hardware de gama alta.
¿Dónde puedo usar Kimi K3 ahora mismo?
A través de la app Kimi, Kimi Code y la API (kimi-k3). Se espera que hosts de terceros como Fireworks estén disponibles una vez que se publiquen los weights. Para saber qué es el modelo y cómo rinde, consulta la descripción general de Kimi K3.
