Kimi K3 est open-weight, mais vous ne pouvez pas encore le télécharger. Moonshot s’est engagé à publier les poids complets d’ici le 27 juillet 2026 sur Hugging Face ; d’ici là, vous accédez à K3 uniquement via l’application et l’API. Ce guide couvre la date à laquelle les poids seront disponibles, où ils seront hébergés, qui héberge K3 actuellement, et la réalité matérielle de l’exécution autonome d’un modèle de 2,8 billions de paramètres.
Kimi K3 est-il open source ?
Oui, il est publié en tant que modèle à poids ouverts, et avec 2,8 billions de paramètres, il est présenté comme le plus grand modèle à poids ouverts publié à ce jour. « Poids ouverts » signifie que Moonshot publie les poids entraînés que vous pouvez télécharger, exécuter et affiner, comme cela a été fait pour les précédents modèles phares Kimi. Ce n’est pas la même chose qu’un code source entièrement ouvert : vous obtenez les poids, pas nécessairement les données d’entraînement ni le pipeline.
L’engagement est confirmé au niveau du personnel, et pas seulement dans le marketing. Interrogé sur X pour savoir si l’open source de K3 serait « un autre moment DeepSeek » pour le secteur, Xinyu Zhou de Moonshot (@zxytim) a simplement répondu : « Will do. »
La réserve importante aujourd’hui est le calendrier. Au moment où j’écris ces lignes, les weights ne sont pas sur l’organisation Hugging Face de Moonshot, qui culmine encore à Kimi K2.7 Code. K3 est donc annoncé comme open-weight, mais il n’est actuellement utilisable que comme modèle hébergé.
Quand les poids de Kimi K3 seront-ils disponibles ?
Le blog technique de Moonshot indique que les poids complets seront publiés d’ici le 27 juillet 2026, accompagnés d’un rapport technique présentant l’architecture et les détails de l’entraînement. Attendez-vous à les trouver sous l’organisation Hugging Face de Moonshot, conformément à la licence Modified MIT qu’elle a utilisée pour les récentes versions de Kimi ; la licence finale sera fournie avec les fichiers.
Jusqu’à cette date, la fiche modèle, les formats de distribution exacts et le nombre officiel de paramètres actifs ne sont pas publics, donc tout lien « download Kimi K3 » avant cette date n’est pas le vrai.
Où exécuter Kimi K3 aujourd'hui
Vous n’avez pas besoin d’attendre les poids pour utiliser K3, vous ne pouvez simplement pas encore l’héberger vous-même.
Disponible dès aujourd’hui est la propre stack de Kimi : l’application sur kimi.com, Kimi Code, et l’API (model ID kimi-k3 sur https://api.moonshot.ai/v1), facturés à 3 $/15 $ par million de tokens. Voir le détail complet des tarifs.
Attendu une fois les weights livrées : les hébergeurs tiers devraient s’illuminer rapidement. Fireworks est un hébergeur probable dès le premier jour, sa page partenaire Kimi ayant proposé K2.5, K2.6 et K2.7 au lancement, et Baseten a ouvert une liste d’attente pour K3 plutôt qu’un endpoint en direct. Considérez les deux comme à venir, et non disponibles pour le moment. Les agrégateurs multi-models ont tendance à suivre aussi ; des plateformes comme AIReiter acheminent déjà des open models chinois tels que DeepSeek V4 et GLM 5.2 via une Anthropic-compatible API.
Pour l’auto-hébergement, attendez-vous à la pile locale habituelle, Ollama, vLLM et les quantifications GGUF, avec l’ajout du support K3 après la mise à disposition des poids, comme ils l’ont fait pour la gamme K2.
La réalité matérielle d’un MoE de 2,8T
Kimi K3 est un modèle Mixture-of-Experts avec 2,8 billions de paramètres au total (16 experts sur 896 actifs par token), et Moonshot recommande de le servir sur des supernodes avec au moins 64 accélérateurs. L’hébergement autonome n’est pas un loisir pour GPU unique.
Pour donner une idée concrète de l’échelle, la génération précédente de Kimi K2.7 Code, avec 1 trillion de paramètres, nécessite à peu près ces ressources (K3, avec 2,8x le nombre de paramètres, en nécessitera nettement plus) :
| Précision | VRAM approx. (K2.7 Code, 1T) |
|---|---|
| FP16 (complet) | ~2,308 GB |
| INT4 | ~577 GB |
| Quantification agressive sur 2 bits (dynamique Unsloth) | ~325 GB |
Deux choses l’atténuent. Moonshot fournit les poids MoE en INT4 natif avec une attention BF16, de sorte qu’une quantification 4 bits est proche de la précision d’entraînement, et non un pis-aller approximatif ; et Kimi Delta Attention offre jusqu’à un décodage 6,3 fois plus rapide dans des contextes d’un million de tokens, ce qui aide les longues sessions agentiques. Même ainsi, un K3 auto-hébergé réaliste implique un serveur multi-GPU ou une build quantifiée sur du matériel sérieux, pas un desktop.
Devriez-vous auto-héberger ou utiliser un modèle hébergé ?
Pour presque tout le monde, l’hébergement géré est la bonne réponse. À 3 $/15 $ par million de tokens sur l’API, il faudrait un volume très élevé et soutenu avant que le coût d’une configuration multi-GPU (ou d’un supernode loué) ne soit amorti par rapport à un endpoint géré. L’auto-hébergement se justifie dans trois cas : exigences strictes de résidence des données ou environnement air-gapped, fine-tuning de K3 sur vos propres données, ou exécution à une échelle où le matériel détenu en propre réduit réellement le coût par token.
Si aucun de ceux-ci ne s’applique, utilisez l’API ou un hébergeur comme Fireworks, et considérez les open weights comme une assurance, l’option de passer en interne plus tard, plutôt que comme un plan dès le premier jour.
FAQ
Kimi K3 est-il open source ?
Il est open-weight : Moonshot publiera les poids téléchargeables, attendus sous une licence Modified MIT. Cela n’est pas la même chose que la publication des données d’entraînement, mais cela permet l’auto-hébergement et le fine-tuning.
Quand les poids de Kimi K3 sont-ils publiés ?
D’ici le 27 juillet 2026, selon le blog technique de Moonshot, sur son organisation Hugging Face, ainsi qu’un rapport technique. Ils ne sont pas téléchargeables avant cette date.
Puis-je exécuter Kimi K3 sur Ollama ?
Pas encore, car les poids ne sont pas publics. Une fois qu'ils seront publiés, attendez-vous à ce qu'Ollama, vLLM et les builds GGUF ajoutent la prise en charge, comme ils l'ont fait pour la série K2.
De quel matériel ai-je besoin pour exécuter Kimi K3 ?
Beaucoup. Moonshot recommande au moins 64 accélérateurs pour le service. À titre indicatif, le 1T K2.7 Code nécessite environ 577 Go de VRAM en INT4 ; le K3, avec 2,8 billions de paramètres, en nécessite nettement plus, donc prévoyez un serveur multi-GPU ou une version quantifiée sur du matériel haut de gamme.
Où puis-je utiliser Kimi K3 dès maintenant ?
Via l’application Kimi, Kimi Code et l’API (kimi-k3). Des hébergeurs tiers comme Fireworks sont attendus une fois que les poids seront disponibles. Pour ce qu’est le modèle et ses performances, consultez la présentation de Kimi K3.
