Oui, Kimi K3 fonctionne dans OpenCode avec trois commandes. Il est répertorié aux tarifs de classe Sonnet ($3/$15 par million de tokens), mais les sessions OpenCode réelles coûtent en moyenne seulement $1.79, grâce à une mise en cache intensive des prompts.
Configurez Kimi K3 dans OpenCode en trois étapes
OpenCode est un agent de codage en terminal open source. Il se connecte à Kimi via une authentification intégrée, vous n’avez donc jamais besoin de coller une URL de base ni de modifier un fichier de configuration. Les étapes ci-dessous correspondent à OpenCode 1.18.3 et au guide d’intégration de Kimi.
1. Configurer la clé API
Exécutez opencode auth login, sélectionnez Moonshot AI comme fournisseur, et collez votre clé depuis le Kimi Open Platform. Deux choses piègent souvent les gens ici. D’abord, le compte doit avoir un solde réel — les bons de réduction pour nouveaux utilisateurs ne fonctionnent pas sur K3. Ensuite, gardez la clé hors de tout fichier de configuration, capture d’écran ou dépôt git ; OpenCode la stocke dans son propre système d’identification pour une raison.
2. Sélectionnez le modèle kimi-k3
Dans OpenCode, exécutez /models et choisissez kimi-k3. Cela charge le modèle avec sa fenêtre de contexte complète de 1M tokens (la sortie est limitée à 131K tokens par tour). La barre d'état devrait maintenant afficher « Kimi K3 » et « Moonshot AI ».
3. Définir l'effort de réflexion
Exécutez /variants pour contrôler à quel point K3 raisonne avant de répondre. La valeur par défaut est max, et vous pouvez passer à high ou low — le levier le plus important sur votre facture, comme le montre la section sur les coûts.
Ce que coûte réellement une session Kimi K3
K3 est proposé à 3 $ par million de jetons en entrée et 15 $ par million en sortie, soit plus que le tarif promotionnel de Claude Sonnet 5 de 2 $/10 $.
En pratique, K3 coûte beaucoup moins cher, car la plupart des tokens sont des lectures de cache bon marché. Les données d’utilisation publiques d’OpenCode (affichées sur sa page par modèle ci-dessous) situent la session moyenne de Kimi K3 à 1,79 $, mesurée sur 66 379 sessions terminées consommant chacune 2,9 M de tokens. Cela revient à environ 0,62 $ par million de tokens réellement utilisés, bien en dessous du tarif catalogue de 3 $. La raison : 93 % des tokens d’entrée sont des accès au cache, et un accès au cache coûte 0,30 $ par million au lieu de 3,00 $, soit une remise de 90 %. (Artificial Analysis indique un coût moyen pondéré de 2,31 $ par million, mais cela suppose seulement 70 % de mise en cache ; le taux réel de 93 % d’OpenCode explique pourquoi les sessions aboutissent à un coût inférieur.)
Le prix catalogue reste de classe Sonnet ; la publication en open-weight (poids complets d’ici le 27 juillet 2026) change ce que vous pouvez auto-héberger, pas ce que vous payez via l’API. Les tarifs par million se comparent ainsi :
K3 se classe au 9e rang par volume de tokens sur OpenCode Go, et son utilisation a doublé au cours des huit semaines jusqu’au 20 juillet (selon les données de momentum d’OpenCode) — coûteux sur le papier, toujours très demandé pour les tâches difficiles.
Pourquoi K3 consomme des tokens, et comment le maîtriser
Le grief le plus fréquent n’est pas le prix par token ; c’est le nombre de tokens que K3 consomme. Comme il utilise par défaut l’effort de réflexion max, K3 raisonne longuement avant d’agir, et pour des modifications simples, ce raisonnement représente une dépense inutile. Un utilisateur d’OpenCode sur X l’a dit sans détour en juillet 2026 : il peut brûler beaucoup de tokens « sans accomplir grand-chose » sur des tâches qu’un modèle plus léger terminerait plus vite.
Trois leviers permettent de garder cela sous contrôle :
- Abandonnez la variante. Passez
/variantsàlowouhighpour les tâches courantes.maxvaut le coup pour l’architecture et les refactorisations multi-fichiers, pas pour renommer une fonction. - Misez sur le cache. Le taux de cache-hit de 93 % de K3 explique pourquoi les sessions restent peu coûteuses. Continuez à travailler dans une seule longue session plutôt que de redémarrer ; chaque redémarrage renvoie le contexte non mis en cache au prix fort.
- Allégez le harness. K3 suranalyse lorsque le scaffold de l’agent est bruyant. Supprimez les fichiers d’instructions toujours actifs, les serveurs MCP inutilisés et les descriptions d’outils verbeuses afin qu’il fasse moins d’allers-retours avec les outils et dispose de moins d’espace pour dériver.
Attendez-vous à un compromis : K3 semble plus lent que les modèles plus légers dans OpenCode — le coût du raisonnement. Lorsque la latence compte plus que la profondeur, changez de modèle.
Kimi K3 contre Kimi K2.7 Code : quand le modèle moins cher l’emporte
K3 coûte environ trois fois plus cher que Kimi K2.7 Code, donc la question est de savoir quand l’écart en vaut la peine.
Pour vérifier l’option la moins chère, j’ai appelé K2.7 Code via son API le 2026-07-20 avec une petite tâche : écrire une fonction Python merge_intervals avec une analyse de la complexité. Elle a renvoyé un code correct et idiomatique (tri, puis fusion linéaire, complexité temporelle O(n log n) et complexité spatiale O(n)) en 10,7 secondes, en utilisant 52 tokens de prompt et 341 tokens de complétion. Pour le codage du quotidien, comme les corrections de bugs, les petites fonctions et le squelette de tests, c’est tout ce dont la plupart des gens ont besoin, et la facture en tokens n’est qu’une fraction de celle de K3.
Réservez K3 à ce qu’il fait le mieux : le travail à long contexte qui remplit sa fenêtre de 1M, le raisonnement complexe sur plusieurs fichiers, et les tâches où un modèle plus léger échoue sans cesse. Le comparatif entre K2.7 Code et GLM 5.2 est une référence utile si vous choisissez un modèle du quotidien plutôt qu’un modèle pour les charges lourdes.
API direct vs OpenRouter vs un abonnement : réduire la facture
La manière dont vous routez vers K3 modifie à la fois la fiabilité et le coût.
API Kimi direct. Se connecter directement à la Kimi Open Platform est la voie la plus fiable. K3 sur OpenRouter est fourni par un seul prestataire et peut renvoyer fréquemment des erreurs 429 (limitation de débit) en cas de forte charge ; passer en direct évite ce goulot d’étranglement.
Abonnement OpenCode Go. Un forfait mensuel (environ 10 à 19 $) transforme K3 en une « seconde réserve » à tarif fixe vers laquelle vous vous tournez lorsque votre modèle principal s’enlise. Plusieurs utilisateurs l’utilisent exactement de cette manière — comme solution de secours lorsqu’une session Claude est interrompue en cours de tâche, et non comme moteur principal à plein temps.
Passerelle API. Si vous acheminez déjà plusieurs modèles via une seule clé, une passerelle compatible Anthropic et OpenAI comme AIReiter vous permet d’appeler K3 aux côtés d’autres modèles avec une tarification à l’usage, tout en bénéficiant des mêmes économies de mise en cache qui réduisent le coût par session. Le détail des tarifs de Kimi K3 présente le calcul par token pour comparer les routes avant de vous engager.
Kimi K3 vaut-il le coup dans OpenCode ?
Deux groupes devraient réfléchir à deux fois avant de s’engager. Si vous exécutez des boucles d’agents bon marché et à grand volume, K2.7 Code ou un modèle plus léger permet d’économiser de l’argent avec peu de perte de qualité. Si vous avez besoin de réponses rapides, le raisonnement avec effort max de K3 vous semblera lent jusqu’à ce que vous réduisiez la variante.
Tous les autres : oui. Un modèle en tête du classement avec un contexte d’1M de tokens, configuré en trois commandes, à moins de 2 $ pour une vraie session — et que vous contrôlez entièrement, si vous quittez un assistant qui se bloque en plein milieu d’une tâche.
FAQ
Kimi K3 est-il gratuit à utiliser dans OpenCode ?
Non. K3 fonctionne au paiement à l’utilisation et nécessite un solde Kimi Open Platform approvisionné ; les bons pour nouveaux utilisateurs ne s’y appliquent pas. OpenCode lui-même est gratuit et open-source — vous ne payez que pour les tokens K3.
Combien coûte Kimi K3 par million de tokens ?
Le tarif de liste est de 3 $ par million de jetons d'entrée et de 15 $ par million de sortie. En pratique, ce que vous payez est bien inférieur : les accès au cache coûtent 0,30 $ par million, et les sessions réelles d'OpenCode coûtent en moyenne 1,79 $ grâce à un taux d'accès au cache de 93 %.
Kimi K3 est-il open source ?
C'est open-weight. Moonshot publie l'intégralité des poids du modèle d'ici le 27 juillet 2026, ce qui en fait le premier modèle ouvert de la classe des 3 000 milliards de paramètres. L'API hébergée reste payante.
Kimi K3 code-t-il aussi bien que Claude ?
Dans le classement de codage d'Arena, K3 est actuellement en tête et obtient 57 sur l’Artificial Analysis Intelligence Index (4e sur 187 modèles). En pratique, il est compétitif avec les modèles propriétaires de pointe sur les tâches de codage difficiles, à un prix catalogue similaire.
Pourquoi est-ce que je reçois des erreurs 429 avec Kimi K3 ?
Les 429 fréquents proviennent généralement du routage via OpenRouter, où K3 est servi par un seul fournisseur. Se connecter directement à Kimi Open Platform via l'authentification intégrée d'OpenCode permet d'éviter cette limite.
