El precio por token no cuenta toda la historia al elegir una API para programar. DeepSeek V4 Flash fue la opción más barata de esta prueba, pero no entregó la respuesta más limpia. Kimi K2.7 Code cumplió todos los requisitos, mientras que GPT-5.4 mini terminó cuatro veces antes. Y si un parche defectuoso obliga a reintentar, la opción aparentemente más barata puede dejar de serlo.
Cuatro API económicas ante el mismo bug
El 30 de julio de 2026 enviamos el mismo bug de concurrencia en TypeScript a cuatro API actuales con capacidad de programación. La tarea era pequeña a propósito, pero exigente: corregir mapLimit para mantener el orden de salida, validar que el límite de concurrencia fuera un entero positivo antes de ejecutar código de usuario, no superar nunca ese límite y dejar de planificar trabajo tras el primer rechazo. Además, cada respuesta debía incluir exactamente tres pruebas.
Esta es una muestra de una sola tarea para evaluar el seguimiento de instrucciones, no un benchmark de programación. Cada ejecución directa usó un único mensaje de usuario, sin herramientas, un tope de 8.000 tokens de salida, la temperatura predeterminada del proveedor y una revisión manual frente a los cuatro requisitos indicados. El tiempo total incluye nuestra pasarela compartida y la sobrecarga del proveedor y la red.
| Modelo | Precio verificado de entrada / salida por 1M | Tiempo | Implementación | Pruebas | Veredicto |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 | 59.4s | Cumplió los cuatro requisitos en su versión final | Cubrieron los comportamientos solicitados | La respuesta utilizable más barata; presentación ruidosa |
| MiniMax M3 | $0.30 / $1.20 promocional | 60.7s | El orden y la concurrencia fueron correctos; el estado de rechazo se estableció una capa de promesas tarde | Tres pruebas relevantes | Casi cumple la regla estricta de detenerse |
| Kimi K2.7 Code | $0.95 / $4.00 | 64.3s | Planificador limpio, resultados ordenados y estado final inmediato | Cubrieron orden/concurrencia, rechazo y límites no válidos | La respuesta más completa |
| GPT-5.4 mini | $0.75 / $4.50 | 13.6s | Implementación correcta mediante un grupo de workers | Tres pruebas, pero ninguna verificó límites no válidos | La implementación limpia más rápida; laguna en las pruebas |
DeepSeek V4 Flash: coste mínimo, más limpieza manual
DeepSeek V4 Flash acabó devolviendo una implementación correcta: preasignó el array de resultados, escribió cada resultado según el índice de entrada, validó limit y detuvo los workers mediante una marca de rechazo compartida. El inconveniente estaba en la propia respuesta. Antes de la función definitiva mostró una implementación descartada con una ruta de promesa sin resolver y después explicó por qué aquel borrador era incorrecto.
Es aceptable si un desarrollador revisa cada línea. Para un agente que extrae el primer bloque de código y lo aplica automáticamente, encaja mal. Solo elegiría DeepSeek como primer intento económico cuando las pruebas y la comprobación de tipos sean filtros obligatorios.
MiniMax M3: buen precio, una arista en la concurrencia
MiniMax M3 generó código conciso y preservó el orden con out[i]. Sin embargo, su marca de rechazo se establecía en el catch externo de Promise.all, no dentro del worker que detectaba el fallo del callback. Esa reacción adicional de la promesa deja una pequeña ventana evitable para planificar trabajo antes de que los demás workers vean la señal de parada.
El precio es especialmente atractivo. La página oficial de MiniMax indica una reducción permanente del 50%, hasta $0.30/M de entrada y $1.20/M de salida para M3 con hasta 512K tokens de entrada. Por encima de 512K, la tarifa con descuento sube a $0.60/$2.40.
Kimi K2.7 Code: la respuesta más completa de esta muestra
Kimi K2.7 Code devolvió una única implementación, no un borrador seguido de una corrección. Validó el límite antes de planificar nada, mantuvo un array de resultados indexado, acotó las promesas activas y estableció settled en el controlador de rechazo. Sus tres pruebas cubrieron los tres puntos en los que esta función suele fallar: el orden de finalización, la planificación tras un error y los límites no válidos.
Kimi fue la respuesta más lenta de esta ejecución y cuesta más por token que DeepSeek o MiniMax con descuento. Pagaría esa diferencia en trabajo de agentes sin supervisión, donde pasar por alto un caso límite resulta más caro que otro céntimo de uso de API.
GPT-5.4 mini: código más rápido, pruebas incompletas
GPT-5.4 mini entregó la implementación correcta más rápida: 13.6 segundos en la ejecución aclarada. Su código cumplió los cuatro requisitos, incluida la validación del límite antes de planificar cualquier callback. Las tres pruebas comprobaban el orden, el pico de concurrencia y el comportamiento ante rechazos, pero el modelo no probó su propia validación del límite.
En el primer intento también pidió una ruta del repositorio, aunque la función completa estaba en el prompt. Ese único fallo no mide la fiabilidad global del modelo, pero refuerza una regla para agentes de programación: valida el artefacto, no el nombre del modelo.
El coste real de 100 llamadas de programación
Comparar precios por token es más sencillo con una carga de trabajo concreta. Supongamos que cada solicitud envía 8.000 tokens nuevos de instrucciones y contexto del repositorio, y recibe un parche de 2.000 tokens más una explicación. Con las tarifas verificadas anteriores, 100 llamadas cuestan entre $0.168 y $1.56 antes de la caché.
| Modelo | Coste de 100 llamadas | Fórmula |
|---|---|---|
| DeepSeek V4 Flash | $0.168 | 100 × (0.008 × $0.14 + 0.002 × $0.28) |
| MiniMax M3 | $0.48 | 100 × (0.008 × $0.30 + 0.002 × $1.20) |
| GPT-5.4 mini | $1.50 | 100 × (0.008 × $0.75 + 0.002 × $4.50) |
| Kimi K2.7 Code | $1.56 | 100 × (0.008 × $0.95 + 0.002 × $4.00) |
Cuando los controles de aceptación son débiles, un único reintento fallido puede superar la diferencia de precio por llamada; un parche roto que llega a revisión o a producción cuesta mucho más que cualquiera de las dos llamadas de API.
Los agentes de repositorio pueden reutilizar prefijos estables del prompt y del código. Las tarifas oficiales de entrada en caché son $0.0028/M para DeepSeek V4 Flash, $0.06/M para MiniMax M3, $0.19/M para Kimi K2.7 Code y $0.075/M para GPT-5.4 mini; los archivos modificados y los rastros de herramientas siguen contando como entrada nueva.
En chat, clasificación y otras cargas no orientadas a programación, el mínimo de capacidad es distinto; la comparativa más amplia de API de LLM más baratas recoge por separado esas tarifas estándar.
"Groq y Cerebras son increíblemente rápidos para inferencia, pero limitan mucho el uso cuando alcanzas un volumen moderado." — informe de un desarrollador en r/ArtificialInteligence
Toma ese informe como un caso de prueba, no como una conclusión aplicable a todo el proveedor: mide la API finalista con el número de workers concurrentes que vayas a ejecutar.
La opción más barata según tu flujo de programación
La API de LLM más barata para programar depende de cómo detectes los fallos. DeepSeek es la opción predeterminada de menor coste cuando todos los parches pasan controles deterministas; en esta muestra, Kimi es la alternativa más segura cuando el modelo debe cubrir por sí solo los casos límite.
| Flujo de trabajo | Elección | Motivo | Evítalo si |
|---|---|---|---|
| Prototipos con pruebas y comprobación de tipos | DeepSeek V4 Flash | $0.14/$0.28 y una implementación final correcta | Tu automatización podría aplicar el primer bloque de código sin revisarlo |
| Ciclos de agentes de programación sin supervisión | Kimi K2.7 Code | La implementación y selección de pruebas más completas de esta muestra | La latencia o la factura mínima por token es la restricción principal |
| Acciones interactivas en el editor | GPT-5.4 mini | 13.6s, mucho más rápido que los otros tres en esta ejecución | Esperas que las pruebas generadas cubran todas las invariantes indicadas |
| Trabajo económico con contexto amplio | MiniMax M3 | $0.30/$1.20 hasta 512K con su descuento permanente | La semántica estricta de concurrencia y errores es central en la tarea |
No usaría un modelo generalista de chat pequeño solo porque su salida cuesta $0.08/M. Una API económica para programar debe producir un parche que sobreviva a las comprobaciones que tu flujo pueda ejecutar. Si no hay controles automatizados, prioriza la completitud del modelo en el primer intento antes que el precio de lista más bajo.
Una ruta de barato primero supera a un único modelo fijo
Una estrategia de dos niveles permite aprovechar el precio mínimo por token sin confiar ciegamente en él. La selección del modelo debe depender del resultado de los controles deterministas, no de la longitud del prompt ni de una puntuación subjetiva de confianza.
- Envía el primer intento a DeepSeek V4 Flash.
- Ejecuta el formateador del repositorio, el comprobador de tipos, las pruebas unitarias y cualquier prueba oculta específica de la tarea.
- Acepta el parche cuando todas las comprobaciones se superen.
- Si falla, envía la tarea original, el parche fallido y una salida concisa de las pruebas a Kimi K2.7 Code; usa GPT-5.4 mini en su lugar cuando importe la latencia interactiva.
- Limita los intentos de escalado para que un agente no pueda gastar indefinidamente en un solo problema.
Esta ruta mantiene la economía de menos de un céntimo de DeepSeek en tareas sencillas y paga la tarifa superior solo ante fallos medidos. Una única capa de modelos compatible con OpenAI convierte el cambio en una modificación del nombre del modelo, en lugar de cuatro integraciones separadas; el directorio de API LLM de AIReiter expone los modelos detrás de un único endpoint.
Preguntas frecuentes
¿Cuál es la API de LLM más barata para programar?
DeepSeek V4 Flash fue la API con capacidad de programación más barata de esta prueba, con $0.14/M de entrada y $0.28/M de salida. Produjo una implementación final correcta, pero su respuesta también incluía un borrador descartado y roto, así que conviene acompañarla de controles automatizados.
¿DeepSeek es suficiente para agentes de programación?
DeepSeek V4 Flash es suficiente como primer intento económico cuando el agente debe superar pruebas, comprobación de tipos y formateo antes de aceptar un parche. Para tareas sin supervisión y sin controles sólidos, Kimi K2.7 Code ofreció la respuesta más completa en esta muestra de una tarea.
¿Qué sale más barato: facturación por API o suscripción de programación?
Calcula el coste mensual de la API a partir de los tokens de entrada y salida medidos con las tarifas de la tabla, y compáralo con el precio de la suscripción, los límites de solicitudes y si incluye acceso a API o a agentes. Ningún modelo de facturación es inherentemente más barato.
La regla de enrutamiento en una línea
Inicia las tareas de programación con DeepSeek V4 Flash, acepta solo los parches que superen controles deterministas y escala los fallos a Kimi K2.7 Code, o el trabajo sensible a la latencia a GPT-5.4 mini. Los precios están verificados; el orden de calidad procede de una única tarea con restricciones y deberías volver a probarlo en tu propio repositorio.
