Sí, Kimi K3 funciona en OpenCode con tres comandos. Se enumera a tarifas de clase Sonnet ($3/$15 por millón de tokens), pero las sesiones reales de OpenCode promedian solo $1.79, gracias al intenso almacenamiento en caché de prompts.
Configura Kimi K3 en OpenCode en tres pasos
OpenCode es un agente de codificación de terminal de código abierto. Se conecta a Kimi mediante autenticación integrada, por lo que nunca tienes que pegar una URL base ni editar un archivo de configuración. Los pasos a continuación coinciden con OpenCode 1.18.3 y la propia guía de integración de Kimi.
1. Configura la clave API
Ejecute opencode auth login, seleccione Moonshot AI como proveedor y pegue su clave desde Kimi Open Platform. Hay dos cosas que suelen confundir a la gente aquí. Primero, la cuenta necesita un saldo real — los vales para nuevos usuarios no funcionan en K3. Segundo, mantenga la clave fuera de cualquier archivo de configuración, captura de pantalla o repositorio git; OpenCode la almacena en su propio sistema de credenciales por una razón.
2. Seleccione el modelo kimi-k3
Dentro de OpenCode, ejecuta /models y elige kimi-k3. Eso carga el modelo con su ventana de contexto completa de 1M tokens (la salida se limita a 131K tokens por turno). La barra de estado ahora debería mostrar "Kimi K3" y "Moonshot AI".
3. Establecer el esfuerzo de razonamiento
Ejecute /variants para controlar cuán profundamente razona K3 antes de responder. De forma predeterminada es max, y puede bajarlo a high o low: la palanca más importante en su factura, como muestra la sección de costos.
Lo que realmente cuesta una sesión de Kimi K3
K3 se cotiza a $3 por millón de tokens de entrada y $15 por millón de salida, más que la tarifa promocional de Claude Sonnet 5 de $2/$10.
En la práctica K3 cuesta mucho menos, porque la mayoría de los tokens son lecturas de caché baratas. Los datos de uso público de OpenCode (mostrados en su página por modelo a continuación) sitúan la sesión media de Kimi K3 en $1.79, medida a lo largo de 66,379 sesiones completadas que consumen 2.9M tokens cada una. Eso equivale a aproximadamente $0.62 por millón de tokens realmente utilizados, muy por debajo de la tarifa de lista de $3. La razón: el 93% de los tokens de entrada son aciertos de caché, y un acierto de caché cuesta $0.30 por millón en lugar de $3.00, un descuento del 90%. (Artificial Analysis cita un promedio combinado de $2.31 por millón, pero eso asume solo un 70% de caché; la tasa real de caché del 93% de OpenCode es la razón por la que las sesiones salen más baratas.)
El precio de lista sigue siendo de clase Sonnet; el lanzamiento de pesos abiertos (pesos completos para el 27 de julio de 2026) cambia lo que puedes alojar tú mismo, no lo que pagas a través de la API. Las tarifas por millón se comparan así:
K3 ocupa el puesto #9 por volumen de tokens en OpenCode Go, y su uso se duplicó durante las ocho semanas hasta el 20 de julio (según los datos de momentum de OpenCode) — caro en teoría, pero todavía muy demandado para tareas difíciles.
Por qué K3 quema tokens y cómo controlarlo
La queja más común no es el precio por token; es cuántos tokens gasta K3. Como por defecto usa el esfuerzo de razonamiento max, K3 razona extensamente antes de actuar, y en ediciones simples ese razonamiento es gasto desperdiciado. Un usuario de OpenCode en X lo expresó sin rodeos en julio de 2026: puede quemar muchos tokens "without accomplishing much" en tareas que un modelo más ligero terminaría más rápido.
Tres palancas mantienen eso bajo control:
- Elimina la variante. Cambia
/variantsalowohighpara el trabajo rutinario.maxvale la pena para arquitectura y refactorizaciones de varios archivos, no para renombrar una función. - Apóyate en la caché. La tasa de acierto de caché del 93% de K3 es la razón por la que las sesiones siguen siendo baratas. Sigue trabajando en una sola sesión larga en lugar de reiniciarla; cada reinicio reenvía el contexto no almacenado en caché a precio completo.
- Reduce el arnés. K3 piensa demasiado cuando el andamiaje del agente es ruidoso. Elimina los archivos de instrucciones siempre activos, los servidores MCP no utilizados y las descripciones detalladas de las herramientas para que haga menos idas y vueltas con las herramientas y tenga menos margen para desbocarse.
Espere una compensación: K3 se siente más lento que los modelos más ligeros en OpenCode — el impuesto del razonamiento. Cuando la latencia importa más que la profundidad, cambie de modelo.
Kimi K3 vs Kimi K2.7 Code: cuando el modelo más barato gana
K3 cuesta aproximadamente tres veces el precio de Kimi K2.7 Code, así que la pregunta es cuándo merece la pena el salto.
Para comprobar la opción más barata, llamé a K2.7 Code a través de su API el 2026-07-20 con una tarea pequeña: escribir una función Python merge_intervals con análisis de complejidad. Devolvió código correcto e idiomático (ordenar, luego fusionar linealmente, O(n log n) de tiempo y O(n) de espacio) en 10.7 segundos, usando 52 tokens de prompt y 341 tokens de completion. Para programación cotidiana, como correcciones de bugs, funciones pequeñas y andamiaje de pruebas, eso es todo lo que la mayoría de la gente necesita, y la factura de tokens es una fracción de la de K3.
Reserve K3 para lo que hace mejor: trabajo de contexto largo que llena su ventana de 1M, razonamiento complicado en varios archivos y tareas en las que un modelo más ligero sigue fallando. El cara a cara entre K2.7 Code y GLM 5.2 es una referencia útil si estás eligiendo un modelo para el día a día en lugar de un modelo para tareas pesadas.
API directa vs OpenRouter vs una suscripción: reducir la factura
La forma en que enrutas a K3 cambia tanto la fiabilidad como el costo.
Conéctate directamente a la API de Kimi. Conectarse directamente a Kimi Open Platform es la vía más fiable. K3 en OpenRouter es servido por un único proveedor y puede devolver con frecuencia errores 429 (límite de velocidad) bajo carga; ir directamente evita ese cuello de botella.
Suscripción OpenCode Go. Un plan mensual (alrededor de $10–19) convierte K3 en una "segunda reserva" de tarifa plana a la que recurres cuando tu modelo principal se atasca. Varios usuarios lo usan exactamente así: como respaldo cuando una sesión de Claude se interrumpe a mitad de tarea, no como un motor de uso continuo.
API gateway. Si ya enrutas varios modelos a través de una sola clave, una gateway compatible con Anthropic y OpenAI como AIReiter te permite llamar a K3 junto con otros modelos con precios de pago por uso, con la misma economía de caché que mantiene bajo el costo por sesión. El desglose de precios de Kimi K3 contiene las matemáticas por token para comparar rutas antes de comprometerte.
¿Vale la pena Kimi K3 en OpenCode?
Dos grupos deberían pensarlo dos veces antes de comprometerse. Si ejecutas bucles de agentes baratos y de gran volumen, K2.7 Code o un modelo más ligero ahorra dinero con poca pérdida de calidad. Si necesitas respuestas rápidas, el razonamiento de esfuerzo max de K3 se sentirá lento hasta que reduzcas la variante.
Todos los demás: sí. Un modelo líder en el ranking con un contexto de 1M tokens, configurado en tres comandos, por menos de $2 una sesión real — y uno que controlas completamente, si estás dejando un asistente que se atasca a mitad de tarea.
Preguntas frecuentes
¿Es Kimi K3 gratuito para usar en OpenCode?
No. K3 es de pago por uso y requiere un saldo financiado de Kimi Open Platform; los cupones para nuevos usuarios no se aplican a ello. OpenCode en sí es gratuito y de código abierto — solo pagas por los tokens de K3.
¿Cuánto cuesta Kimi K3 por millón de tokens?
La tarifa de lista es de $3 por millón de tokens de entrada y $15 por millón de salida. Lo que pagas en la práctica es mucho menor: las aciertos de caché cuestan $0.30 por millón, y las sesiones reales de OpenCode promedian $1.79 gracias a una tasa de aciertos de caché del 93%.
¿Es Kimi K3 de código abierto?
Es de pesos abiertos. Moonshot publicará los pesos completos del modelo antes del 27 de julio de 2026, convirtiéndolo en el primer modelo abierto de la clase de 3 billones de parámetros. La API alojada sigue siendo de pago.
¿Puede Kimi K3 programar tan bien como Claude?
En la clasificación de programación de Arena, K3 actualmente ocupa el primer puesto y obtiene 57 en el Artificial Analysis Intelligence Index (#4 de 187 modelos). En la práctica, compite con modelos propietarios de vanguardia en tareas difíciles de programación, a un precio de lista similar.
¿Por qué recibo errores 429 con Kimi K3?
Los 429 frecuentes suelen provenir de enrutar a través de OpenRouter, donde K3 es servido por un único proveedor. Conectarse directamente a la Kimi Open Platform mediante la autenticación integrada de OpenCode evita ese límite.
