AIREITER

Kimi K3 en OpenCode: configuración y coste real por sesión

Última actualización: 2026-07-29 11:31:06

Kimi K3 se puede poner en marcha en OpenCode con solo tres comandos. Aunque su tarifa publicada es propia de Sonnet ($3/$15 por millón de tokens), las sesiones reales de OpenCode se quedan en una media de $1.79 gracias al uso intensivo de la caché de prompts.

Configurar Kimi K3 en OpenCode: solo tres pasos

OpenCode es un agente de programación para terminal y de código abierto. Se conecta a Kimi mediante autenticación integrada, así que no hace falta pegar una URL base ni tocar archivos de configuración. Estos pasos corresponden a OpenCode 1.18.3 y a la propia guía de integración de Kimi.

Página de documentación oficial de Kimi para usar sus modelos en OpenCode, con los tres pasos de configuración

1. Añade tu clave de API

Ejecuta opencode auth login, elige Moonshot AI como proveedor y pega la clave de Kimi Open Platform. Hay dos detalles que suelen causar problemas. El primero es que la cuenta debe tener saldo real: los cupones para usuarios nuevos no funcionan con K3. El segundo, no guardes la clave en archivos de configuración, capturas de pantalla ni repositorios git; por algo OpenCode la almacena en su propio sistema de credenciales.

2. Elige el modelo kimi-k3

Dentro de OpenCode, ejecuta /models y selecciona kimi-k3. Así cargarás el modelo con toda su ventana de contexto de 1M de tokens; la salida está limitada a 131K tokens por turno. En la barra de estado deberían aparecer ahora "Kimi K3" y "Moonshot AI".

3. Ajusta el esfuerzo de razonamiento

Usa /variants para decidir cuánto razona K3 antes de responder. El valor predeterminado es max, pero puedes bajarlo a high o low. Como veremos en la sección de costes, es el ajuste que más influye en la factura.

El coste real de una sesión con Kimi K3

La tarifa de K3 es de $3 por millón de tokens de entrada y $15 por millón de salida, por encima de la tarifa promocional de Claude Sonnet 5, de $2/$10.

En la práctica, K3 cuesta bastante menos porque buena parte de los tokens son lecturas de caché económicas. Los datos públicos de uso de OpenCode, mostrados en su página por modelo y reproducidos abajo, sitúan la sesión media de Kimi K3 en $1.79. La medición cubre 66,379 sesiones completadas, con 2.9M de tokens por sesión. Eso equivale a unos $0.62 por millón de tokens realmente utilizados, muy por debajo de la tarifa publicada de $3. El motivo es que el 93% de los tokens de entrada proceden de la caché: cada acierto cuesta $0.30 por millón en lugar de $3.00, un descuento del 90%. (Artificial Analysis estima un coste combinado de $2.31 por millón, pero parte de una caché del 70%; el 93% real de OpenCode explica por qué sus sesiones salen más baratas.)

Página de datos públicos de uso de OpenCode para Kimi K3, con su puesto 9, contexto de 1M, límite de salida de 131K y lanzamiento en julio de 2026

La tarifa sigue siendo comparable a Sonnet; la publicación con pesos abiertos, prevista con todos los pesos disponibles el 27 de julio de 2026, cambia las posibilidades de autoalojamiento, no lo que pagas a través de la API. Así se comparan las tarifas por millón:

Gráfico de barras agrupadas que compara el precio de entrada y salida por millón de tokens de Kimi K3, Claude Sonnet 5 promo y Kimi K2.5

K3 ocupa el puesto 9 por volumen de tokens en OpenCode Go, y su uso se duplicó durante las ocho semanas previas al 20 de julio, según los datos de impulso de OpenCode. Sobre el papel no es barato, pero sigue teniendo mucha demanda para tareas complejas.

Por qué K3 consume tantos tokens y cómo contenerlo

La queja más habitual no tiene que ver con el precio por token, sino con cuántos tokens llega a gastar K3. Como usa max como esfuerzo de razonamiento predeterminado, reflexiona largo y tendido antes de actuar; en cambios sencillos, ese razonamiento es gasto innecesario. Un usuario de OpenCode en X lo resumió sin rodeos en julio de 2026: puede consumir muchos tokens "without accomplishing much" en tareas que un modelo más ligero terminaría antes.

Hay tres ajustes para mantenerlo bajo control:

  • Baja la variante. Cambia /variants a low o high para el trabajo rutinario. max tiene sentido para arquitectura y refactorizaciones de varios archivos, no para renombrar una función.
  • Aprovecha la caché. El 93% de aciertos de caché de K3 es la razón por la que las sesiones siguen siendo asequibles. Trabaja en una única sesión larga en vez de reiniciarla: cada reinicio vuelve a enviar contexto sin caché al precio completo.
  • Aligera el entorno del agente. K3 tiende a sobrepensar cuando el andamiaje del agente es ruidoso. Elimina archivos de instrucciones siempre activos, servidores MCP sin uso y descripciones de herramientas demasiado extensas para reducir las idas y vueltas con herramientas y dejarle menos margen para entrar en bucle.

Hay una contrapartida: K3 se siente más lento que los modelos ligeros en OpenCode, el precio de su razonamiento. Cuando la latencia importa más que la profundidad, conviene cambiar de modelo.

Kimi K3 frente a Kimi K2.7 Code: cuándo gana el modelo barato

K3 cuesta aproximadamente tres veces más que Kimi K2.7 Code, así que la cuestión es cuándo merece la pena pagar esa diferencia.

Para comprobar que la opción barata cumplía, llamé a K2.7 Code mediante su API el 2026-07-20 con una tarea pequeña: escribir una función Python merge_intervals con análisis de complejidad. Devolvió código correcto e idiomático —ordenar y después fusionar linealmente, O(n log n) de tiempo y O(n) de espacio— en 10.7 segundos, usando 52 tokens de prompt y 341 de completado. Para programación cotidiana, como corregir errores, escribir funciones pequeñas o preparar tests, eso es todo lo que necesita la mayoría, y la factura de tokens es una fracción de la de K3.

Reserva K3 para aquello en lo que destaca: trabajo de contexto largo que aproveche su ventana de 1M, razonamiento complicado entre varios archivos y tareas en las que un modelo más ligero falla una y otra vez. La comparativa directa entre K2.7 Code y GLM 5.2 es una buena referencia si buscas un modelo para el día a día en vez de uno para cargas pesadas.

API directa, OpenRouter o suscripción: cómo reducir la factura

La ruta que elijas para acceder a K3 afecta tanto a la fiabilidad como al coste.

API directa de Kimi. Conectar directamente con Kimi Open Platform es la opción más fiable. K3 en OpenRouter depende de un único proveedor y puede devolver con frecuencia errores 429, de límite de velocidad, cuando hay carga; ir directamente evita ese cuello de botella.

Suscripción a OpenCode Go. Un plan mensual, de alrededor de $10–19, convierte K3 en una "segunda bolsa" de tarifa plana a la que recurrir cuando el modelo principal se atasca. Varios usuarios lo usan exactamente así: como respaldo cuando una sesión de Claude se interrumpe a mitad de tarea, no como modelo de uso continuo.

Gateway de API. Si ya enrutas varios modelos con una sola clave, un gateway compatible con Anthropic y OpenAI como AIReiter permite llamar a K3 junto a otros modelos con pago por uso y con la misma economía de caché que reduce el coste por sesión. El desglose de precios de Kimi K3 incluye las cuentas por token para comparar rutas antes de decidirte.

¿Merece la pena Kimi K3 en OpenCode?

Hay dos perfiles que deberían pensárselo dos veces. Si ejecutas bucles de agentes baratos y de gran volumen, K2.7 Code o un modelo más ligero ahorra dinero con poca pérdida de calidad. Si necesitas respuestas ágiles, el razonamiento con esfuerzo max de K3 te resultará lento hasta que bajes la variante.

Para el resto, sí. Es un modelo puntero en clasificaciones, con contexto de 1M de tokens, configurado en tres comandos y por menos de $2 por sesión real; además, tienes control total sobre él si vienes de un asistente que se atasca a mitad de tarea.

Preguntas frecuentes

¿Kimi K3 es gratis en OpenCode?

No. K3 funciona con pago por uso y requiere saldo en Kimi Open Platform; los cupones para usuarios nuevos no se aplican. OpenCode sí es gratuito y de código abierto: solo pagas los tokens de K3.

¿Cuánto cuesta Kimi K3 por millón de tokens?

La tarifa publicada es de $3 por millón de tokens de entrada y $15 por millón de salida. En la práctica se paga bastante menos: los aciertos de caché cuestan $0.30 por millón y las sesiones reales de OpenCode promedian $1.79 gracias a una tasa de aciertos del 93%.

¿Kimi K3 es de código abierto?

Tiene pesos abiertos. Moonshot publicará los pesos completos del modelo antes del 27 de julio de 2026, lo que lo convierte en el primer modelo abierto de la clase de 3 billones de parámetros. La API alojada sigue siendo de pago.

¿Kimi K3 programa tan bien como Claude?

En el ranking de programación de Arena, K3 ocupa actualmente la primera posición y obtiene 57 en el Artificial Analysis Intelligence Index, donde es el nº 4 de 187 modelos. En la práctica compite con modelos propietarios de frontera en tareas de programación difíciles, con una tarifa publicada similar.

¿Por qué recibo errores 429 con Kimi K3?

Los errores 429 frecuentes suelen aparecer al enrutar mediante OpenRouter, donde K3 depende de un único proveedor. Conectarte directamente a Kimi Open Platform mediante la autenticación integrada de OpenCode evita esa limitación.