En julio de 2026, las API de LLM más económicas bajan de una décima de céntimo por cada millón de tokens de entrada. Llama 3.1 8B Instant de Groq figura a $0.05 por millón de tokens de entrada y $0.08 por millón de tokens de salida, según la página de precios del propio proveedor consultada este mes.
Pero esa cifra de portada no será necesariamente lo que acabes pagando. La caché de prompts puede reducir el precio efectivo de entrada de DeepSeek entre 50 y 120 veces, mientras que las API por lotes recortan otro 50% en Gemini, Mistral y Groq. Comparar únicamente las tarifas de lista puede llevarte a pagar de más o a elegir el proveedor equivocado para tu carga de trabajo. A continuación encontrarás las opciones económicas, con precios comprobados en las páginas de cada proveedor el 30 de julio de 2026, y cuál conviene en cada escenario.
Las API de LLM más baratas ahora mismo: precios verificados en julio de 2026
Las tarifas más bajas no suelen estar en los endpoints insignia de los laboratorios de frontera, sino en modelos pequeños u optimizados para eficiencia, servidos por especialistas en inferencia. Los precios corresponden a uso estándar bajo demanda y pago por consumo en los principales proveedores directos; la columna de nivel gratuito indica cuándo existe una opción sin coste. Quedan fuera el alojamiento propio y las promociones temporales.
| Modelo (proveedor) | Entrada / 1M | Salida / 1M | Entrada con acierto de caché | Nivel gratuito | Más económico para |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | $0.05 | $0.08 | $0.025 | Sí | Precio estándar más bajo |
| GPT-OSS 20B (Groq) | $0.075 | $0.30 | $0.0375 | Sí | Económico, 1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | $0.10 | $0.40 | — | Sí | Más barato por lotes ($0.05 de entrada) |
| Ministral 3B (Mistral) | $0.10 | $0.10 | — | Leanstral (limitado) | Precio micro uniforme |
| DeepSeek V4 Flash (DeepSeek) | $0.14 | $0.28 | $0.0028 | No | Más barato para razonamiento |
| Mistral Small 4 (Mistral) | $0.15 | $0.60 | −90% | No | Uso general equilibrado |
| Gemini 3.5 Flash-Lite (Google) | $0.30 | $2.50 | — | Sí | Multimodal a escala |
El mínimo lo marca Llama 3.1 8B de Groq, con $0.05/$0.08; ningún otro modelo de esta tabla iguala ese precio de salida. Gemini 2.5 Flash-Lite solo llega a $0.05 de entrada en su tarifa independiente por lotes ($0.10 en estándar). DeepSeek V4 Flash es la alternativa económica orientada al razonamiento.
Por qué cuestan menos que GPT o Claude
Estos precios bajos responden a tres factores: modelos pequeños u optimizados para eficiencia, como Llama 3.1 8B, Ministral 3B y la línea Flash-Lite; especialistas en inferencia que operan infraestructura más barata, como Groq y DeepSeek; y tarifas reducidas para trabajos por lotes y tokens almacenados en caché. La mayoría de los modelos de la tabla tiene pesos abiertos —Llama, DeepSeek y Mistral—; Gemini Flash-Lite es una línea propietaria de Google con precios agresivos para competir por volumen. Alojar pesos abiertos por cuenta propia puede resultar aún más barato con un volumen muy alto y constante, pero solo después de asumir el coste del hardware y de la operación. Para la mayoría de equipos, las API alojadas siguen siendo el punto de partida.
El nivel gratuito: el precio mínimo real
Si por «más barata» entiendes gratis, varios proveedores de esta lista ofrecen una opción sin coste: las familias Groq y Gemini Flash-Lite de Google son gratuitas dentro de sus límites de tasa, Mistral ofrece Leanstral gratis durante un periodo limitado y GitHub Models da acceso gratuito con un token. El nivel gratuito de Google utiliza las solicitudes para entrenar productos; el de pago no. En todos los casos, los límites de tasa son estrictos y no hay SLA. Hemos reunido las opciones gratuitas en una guía específica sobre API de IA gratuitas; para cualquier cosa que vaya más allá del prototipado, importan las tarifas de pago de la tabla anterior.
La trampa del precio por token: la caché y los lotes reducen la factura real
Una tabla ordenada por precio de entrada de lista oculta más de lo que revela. Hay tres palancas capaces de modificar el coste efectivo por órdenes de magnitud, y la mayoría de comparativas las omite o las deja en segundo plano.
"El gran engaño de los precios bajos en las API de LLM." — un hilo de r/LocalLLaMA sobre cómo el precio destacado de un modelo escondía una factura dominada por los cargos de lectura de caché.
Los proveedores cobran por separado la entrada almacenada en caché, la entrada nueva y la salida. Además, la línea de entrada que parece barata suele ser la menor parte de la factura. Estas son las tres variables que debes comparar:
- Caché de prompts. Cuando el proveedor puede reutilizar un prefijo ya enviado, la parte almacenada en caché pasa a costar una fracción del precio de entrada. DeepSeek cobra $0.0028 por millón por entrada en caché con V4 Flash, frente a $0.14 por entrada nueva: un descuento de 50×. En V4 Pro, cobra $0.0036 frente a $0.435, un descuento de 120×. Groq reduce a la mitad el precio de la entrada en caché y Mistral aplica un 90% de descuento. Si tus prompts comparten un prompt de sistema extenso o el prefijo de un documento, y no trabajas con un proveedor compatible con caché, pagarás el precio completo en cada solicitud.
- API por lotes. Google, Mistral y Groq ofrecen aproximadamente un 50% de descuento para trabajos no realizados en tiempo real y procesados dentro de una ventana de entre 24 horas y 7 días. La tarifa por lotes de Gemini 2.5 Flash-Lite reduce la entrada a $0.05. Todo lo que no requiera una respuesta en menos de un segundo —resúmenes nocturnos, clasificación masiva o etiquetado de conjuntos de datos— debería procesarse por lotes.
- Cargas con mucha salida. La generación de código, la redacción extensa y los bucles agénticos producen muchos más tokens de los que consumen. Los $0.08 de salida de Llama 3.1 8B superan a los $0.40 de Gemini 2.5 Flash-Lite en estas tareas, pese a que sus costes de entrada son parecidos. Cuando generar es el cuello de botella, ordena por precio de salida, no por el de entrada.
La lista de comprobación es sencilla: antes de elegir un proveedor por su precio de lista, pregúntate si tus prompts aprovechan bien la caché, si el trabajo debe ser en tiempo real y si produces más tokens de los que lees. Estas tres respuestas reorganizan la tabla anterior con más frecuencia que los precios destacados.
La opción más barata según el caso de uso
Estas recomendaciones parten de que necesitas un nivel de capacidad superior al de los modelos más pequeños; si solo importara el precio bruto, Llama 3.1 8B ocuparía todas las filas. Ponderan el coste real, incluida la caché y el procesamiento por lotes cuando aplican, frente a ese requisito mínimo de capacidad.
| Caso de uso | Opción más barata | Motivo |
|---|---|---|
| Chat general / clasificación | Mistral Small 4 | Modelo de uso general de tamaño medio, por encima del mínimo de 3B/8B; $0.15/$0.60 |
| Programación y bucles agénticos | Groq GPT-OSS 20B o Llama 3.1 8B | Salida por debajo de $0.08; 840–1000 tok/s mantiene ágiles los bucles |
| Razonamiento / prompts complejos | DeepSeek V4 Flash | $0.14/$0.28, optimizado para razonamiento; aprovecha mucho la caché |
| Documentos de contexto largo | Gemini 3.5 Flash-Lite | Ventana de contexto grande y nivel gratuito para probarlo |
| Tiempo real / sensible a la latencia | Groq (cualquier modelo) | Proveedor económico que además destaca en rendimiento, con 840–1000 tok/s |
| Trabajos masivos / nocturnos | Gemini 2.5 Flash-Lite (por lotes) | $0.05 de entrada por lotes, 50% de descuento para procesos asíncronos |
Agregador o proveedor directo: cuándo un revendedor sale realmente más barato
Contratar directamente con DeepSeek, Google, Groq o Mistral te da el menor precio por token para un modelo concreto. El coste alternativo es operativo: claves de API y facturación separadas, conmutación manual ante límites de tasa de un proveedor y la necesidad de reimplementar la lógica de caché y reintentos para cuatro SDK distintos.
Ese problema es lo que venden los agregadores. OpenRouter cobra el precio del proveedor subyacente más una comisión de plataforma del 5.5% sin margen adicional, y ofrece una sola clave, una sola factura y conmutación automática entre los modelos de esta lista. Según el propio análisis de OpenRouter, el punto de equilibrio está en torno a $50 al mes: por debajo de esa cifra, la comisión del 5.5% cuesta menos que el tiempo de ingeniería necesario para integrar varios proveedores; por encima, contratar directamente al proveedor más barato suele ganar en coste bruto. El equilibrio real dependerá de cuántos proveedores integrarías de otro modo y de la volatilidad de tu tráfico.
La misma lógica aplica a una pasarela de revendedor como AIReiter: un endpoint compatible con OpenAI delante de DeepSeek, Gemini, Groq y Mistral, de modo que puedes cambiar de modelo modificando su nombre en lugar de reescribir el cliente.
Preguntas frecuentes
¿Cuál es la API de LLM más barata?
Llama 3.1 8B Instant de Groq, a $0.05/$0.08 por millón de tokens, es la tarifa estándar bajo demanda más baja de esta comparación en julio de 2026. Gemini 2.5 Flash-Lite solo iguala los $0.05 de entrada en su tarifa por lotes ($0.10 en estándar).
¿Cuál es la API de LLM más barata para programar?
GPT-OSS 20B de Groq ($0.075/$0.30) o Llama 3.1 8B ($0.05/$0.08) destacan por precio de salida y velocidad en generación de código y bucles agénticos. Devstral Small 2 de Mistral, a $0.10/$0.30, es la opción económica si necesitas un modelo especializado en programación fuera de Groq.
¿Basta un nivel gratuito de API de LLM para producción?
Normalmente, no. Los niveles gratuitos de Groq, Gemini Flash-Lite y GitHub Models limitan las solicitudes por minuto y no garantizan disponibilidad. Funcionan bien para prototipos. Cuando superes las primeras pruebas, pasa a las opciones de pago de la tabla anterior.
¿Las API de agregadores o revendedores son más caras que contratar directamente?
Por token, sí, ligeramente. OpenRouter añade una comisión del 5.5% sobre el precio del proveedor, y las pasarelas de revendedores incluyen una sobrecarga similar. Sin embargo, resultan más baratas en total cuando tu gasto es reducido o, de otro modo, tendrías que mantener varias integraciones de proveedores. Pasan a ser más caras cuando la comisión supera el valor de esa comodidad.
¿Cuánto cuesta al mes la API de LLM más barata?
Para 10 millones de tokens de entrada y 5 millones de tokens de salida al mes, Llama 3.1 8B de Groq cuesta aproximadamente $0.90 ($0.50 de entrada + $0.40 de salida). Gemini 2.5 Flash-Lite cuesta aproximadamente $3.00 con las tarifas estándar o $1.50 por lotes. El mismo volumen en un modelo propietario de frontera ($5+/M de entrada) cuesta muchas veces más.
Qué elegir
Activa la caché de prompts siempre que el proveedor la admita y envía el trabajo no urgente a procesamiento por lotes. Estas dos decisiones ahorran más que cambiar de proveedor.
