Límites de las API de IA gratuitas, de un vistazo
En las API de IA, «gratis» casi nunca equivale a uso ilimitado. Normalmente significa un plan con límites de frecuencia: puede tratarse de una cuota permanente o de créditos promocionales que se agotan. Todos los proveedores de esta lista entregan claves de API sin exigir tarjeta de crédito, pero el volumen disponible va desde unas pocas solicitudes diarias hasta decenas de miles.
Las cifras de esta guía se contrastaron con la documentación oficial de cada proveedor en agosto de 2026. Los límites cambian con frecuencia, así que conviene verificarlos siempre en la consola del proveedor antes de usarlos para planificar producción.
| Proveedor | Datos clave del plan gratuito | Aspecto destacado de la política de datos | Mejor para |
|---|---|---|---|
| Google AI Studio | Sin tarjeta ni cuenta de facturación; modelos Gemini; cuotas por proyecto que se reinician a medianoche, hora del Pacífico | Los prompts gratuitos entrenan productos de Google | Variedad de modelos y prototipado |
| Groq | 14,400 RPD en Llama 3.1 8B; 70K TPM en modelos Compound | Sin retención predeterminada; ZDR disponible | Prompts cortos de alta frecuencia |
| OpenRouter | 50 solicitudes gratuitas/día; más de 25 modelos gratis; compatible con BYOK | Depende del proveedor de origen | Probar muchos modelos |
| GitHub Models | 15 RPM / 150 RPD (nivel bajo); 8,000 tokens de entrada + 4,000 de salida | Condiciones de datos de Microsoft | Experimentos rápidos con un PAT |
| Cloudflare Workers AI | 10,000 Neurons/día (~280K tokens de salida en Llama 3.1 8B Fast) | Compromiso explícito de no usar datos para entrenamiento | Trabajo con datos sensibles |
| Cohere | 20 solicitudes/min; 1,000 llamadas/mes | Licencia de evaluación | Pruebas de embeddings y reranking |
| NVIDIA NIM | 1,000 créditos de registro; hasta 5,000 con correo empresarial | El uso de endpoints gratuitos se registra | Pruebas puntuales de modelos |
| Hugging Face | $0.10/mes en más de 200 modelos | La asignación puede cambiar | Inferencia a escala de demo |
| Mistral | Modo de clave API gratuito; límites en el Admin Panel | Se menciona una opción sin retención | Modelos alojados en Europa |
Nueve proveedores emiten claves sin tarjeta de crédito. Siete ofrecen planes gratuitos recurrentes, mientras que NVIDIA y Hugging Face dan créditos consumibles que no se renuevan. La diferencia es considerable: GitHub Models permite 8 solicitudes diarias a DeepSeek-R1, mientras Groq ofrece 14,400 solicitudes al día para Llama 3.1 8B.
Google AI Studio: el plan gratuito de referencia
Google AI Studio es el punto de partida más natural para quien busca acceso gratuito a modelos de nivel puntero sin introducir datos de facturación. Basta con iniciar sesión con una cuenta de Google, crear una clave de API y empezar a hacer llamadas: no hace falta tarjeta ni cuenta de facturación.
El plan gratuito incluye la familia Gemini, con Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro y otros modelos. Incluye endpoints de texto y embeddings; las cuotas se asignan por proyecto y se reinician a medianoche, hora del Pacífico.
Las cuotas aparecen solo después de registrarte
Google no publica una tabla única de límites para su «plan gratuito», como sí hacen Groq u OpenRouter. Los límites reales —solicitudes por minuto, tokens por minuto y tokens por día— solo se muestran en la consola de AI Studio después de crear un proyecto. Eso complica la planificación previa: en la práctica, lo recomendable es crear el proyecto, revisar la página Quotas y diseñar según el límite que aparezca.
En el plan gratuito, tus prompts sirven para entrenar productos de Google
Esta es la advertencia más importante. Las condiciones del plan gratuito de Google indican que los prompts y el contenido generado pueden utilizarse para mejorar productos de Google. Si trabajas con datos sensibles, propietarios o personales, este plan no encaja con tu caso. El uso de pago de Gemini API, mediante Google Cloud con una cuenta de facturación, no incluye esta cláusula de entrenamiento, pero requiere tarjeta de crédito.
La generación de imágenes con Gemini tampoco está disponible en el plan gratuito: su alcance se limita a texto y embeddings.
Groq: límites diarios claros y publicados
El plan gratuito de Groq es uno de los más generosos para cargas de trabajo con prompts breves y alta frecuencia. Sus límites están publicados de forma explícita en la documentación de Groq y se aplican por organización, no por usuario. Los tokens en caché no cuentan para los límites de frecuencia.
| Modelo | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
| Llama 3.1 8B Instant | 30 | 14,400 | 6,000 | 500,000 |
| Llama 3.3 70B Versatile | 30 | 1,000 | 12,000 | 100,000 |
| GPT-OSS-120B | 30 | 1,000 | 8,000 | 200,000 |
| GPT-OSS-20B | 30 | 1,000 | 8,000 | 200,000 |
| Qwen 3.6-27B | 30 | 1,000 | 8,000 | 200,000 |
| Groq Compound | 30 | 250 | 70,000 | — |
| Groq Compound Mini | 30 | 250 | 70,000 | — |
| Whisper Large V3 | 20 | 2,000 | — | 28,800 audio sec/day |
La cifra que más destaca es la de Llama 3.1 8B: 14,400 solicitudes diarias, suficiente para un prototipo serio o un endpoint de producción con poco tráfico. Los modelos Compound alcanzan la mayor asignación de tokens por minuto, 70,000 TPM, aunque su límite diario de solicitudes es más restrictivo: 250 RPD.
Groq no conserva datos de inferencia de forma predeterminada y ofrece una opción Zero Data Retention (ZDR), lo que la sitúa entre las alternativas gratuitas más sólidas en privacidad. La principal limitación son los topes de tokens por minuto del modelo 8B, 6,000 TPM, que pueden frenar la generación de mucho volumen o con contexto largo.
OpenRouter: 50 solicitudes gratuitas al día
OpenRouter no aloja modelos directamente, sino que actúa como pasarela de API. Su plan gratuito permite usar un conjunto rotativo de modelos subvencionados por OpenRouter. Para acceder a ellos, añade :free al nombre del modelo o utiliza el enrutador automático openrouter/free.
Límites de uso: Los modelos gratuitos tienen un tope de 20 RPM y 50 solicitudes al día. Una compra única de $10 en créditos eleva de forma permanente el límite diario de modelos gratuitos a 1,000 solicitudes. Estos límites se suman a cualquier restricción aplicada por el proveedor de origen.
Catálogo de modelos gratuitos: En agosto de 2026, OpenRouter lista más de 25 modelos gratis, frente a los 15 de julio, entre generación de texto, embeddings y reranking. La selección incluye modelos de NVIDIA —familias Nemotron 3 Ultra, Super y Nano con hasta 1M-token de contexto—, Google —Gemma 4—, Cohere —North Mini Code—, OpenAI —gpt-oss-20b— y varios más. El catálogo cambia a menudo conforme los proveedores incorporan o retiran endpoints gratuitos.
BYOK (Bring Your Own Key): OpenRouter admite BYOK para más de 60 proveedores de inferencia. Al aportar tus propias claves de API, el proveedor subyacente factura directamente el coste de inferencia y OpenRouter solo cobra su capa de enrutamiento. La asignación gratuita de BYOK depende ahora del plan y se mide por el coste de inferencia a precio de lista, en lugar de por una cantidad fija de solicitudes; revisa la página de precios de OpenRouter para conocer las condiciones vigentes.
Hay un matiz importante: que OpenRouter sea «gratis» significa que no cobra por tokens, no que necesariamente no retenga datos. Cada proveedor de origen aplica su propia política, y algunos, incluidos NVIDIA y Poolside, registran expresamente el uso de endpoints gratuitos o pueden utilizar los prompts para entrenamiento. Si lo necesitas, configura filtros de privacidad por proveedor.
Otros seis planes gratuitos que merece la pena conocer
GitHub Models
GitHub Models ofrece un entorno de pruebas y un endpoint de API para modelos populares mediante un GitHub Personal Access Token (PAT). El nivel bajo permite 15 RPM y 150 RPD; el nivel alto baja a 10 RPM y 50 RPD. Cada solicitud está limitada a 8,000 tokens de entrada y 4,000 tokens de salida. DeepSeek-R1 está disponible, pero limitado a 8 solicitudes diarias.
GitHub Models resulta cómodo para experimentos rápidos porque la autenticación con PAT no exige un registro independiente, pero sus límites ajustados de tokens y solicitudes no dan para mucho más allá del prototipado.
Cloudflare Workers AI
Workers AI de Cloudflare asigna 10,000 Neurons al día a cada cuenta, con reinicio a las 00:00 UTC. En Llama 3.1 8B Fast, eso equivale aproximadamente a 280,000 tokens de salida diarios. Cloudflare también aloja FLUX para generar imágenes gratis: es la principal alternativa de esta lista para imágenes sin tarjeta de crédito.
Su postura de privacidad es la más sólida de todos los proveedores analizados: Cloudflare se compromete explícitamente a no usar los prompts ni las salidas de los clientes para entrenamiento o mejora del servicio sin consentimiento. Por ello, Workers AI es la recomendación principal para cargas con datos sensibles.
La abstracción de Neurons es menos intuitiva que contar solicitudes o tokens directamente: hay que consultar el panel de Workers AI para ver cuántos Neurons consume cada modelo por token.
Cohere, NVIDIA, Hugging Face y Mistral
Cohere: ofrece 20 solicitudes por minuto y 1,000 llamadas de API al mes en su plan gratuito. Es un límite adecuado para evaluar y probar, no para operar con volumen. Incluye los modelos Command de Cohere y sus endpoints de embeddings.
NVIDIA NIM: proporciona 1,000 créditos de registro, ampliables hasta 5,000 con un correo empresarial. Son créditos consumibles de un solo uso, no una asignación mensual recurrente, y no existe una conversión publicada entre créditos y solicitudes. Los modelos gratuitos de NVIDIA en OpenRouter incluyen una advertencia: el uso de endpoints gratuitos se registra, y la compañía aconseja no enviar datos confidenciales ni personales.
Hugging Face: ofrece aproximadamente $0.10 mensuales en créditos de inferencia gratuitos para más de 200 modelos mediante su Serverless Inference API. La asignación se marca expresamente como sujeta a cambios. Es un nivel pensado solo para demos: alcanza para probar un modelo, no para construir sobre él.
Mistral: cuenta con un modo de clave API gratuito cuyos límites solo son visibles en el Admin Panel. La documentación de Mistral menciona una opción sin retención, pero no la presenta como una política predeterminada y clara del plan gratuito, por lo que es más difícil de valorar para usos sensibles desde el punto de vista de la privacidad.
Más allá del texto: imágenes, voz y embeddings
Dos proveedores cubren modalidades distintas del texto:
- Cloudflare Workers AI: aloja FLUX para generación de imágenes sin coste; es la única opción de esta lista que no requiere tarjeta de crédito. Los modelos de imagen de Gemini no están disponibles en el plan gratuito.
- Groq Whisper: ofrece conversión de voz a texto con 2,000 solicitudes diarias y 28,800 audio sec/day en el plan gratuito.
El catálogo gratuito de OpenRouter también ha incorporado modelos de embeddings y reranking de NVIDIA, añadiendo capacidades de recuperación y RAG al plan sin coste.
Con datos sensibles, la lista se reduce a dos opciones
Para trabajo con datos sensibles, propietarios o regulados, la mayoría de los proveedores de esta lista quedan descartados:
- Google AI Studio: utiliza los prompts del plan gratuito para entrenar sus productos.
- NVIDIA: registra el uso de endpoints gratuitos y advierte contra el envío de datos confidenciales.
- OpenRouter: los modelos gratuitos heredan la política de datos que establezca el proveedor de origen; algunos, como Poolside y Liquid, entrenan expresamente con prompts gratuitos.
- Hugging Face y Mistral: tienen condiciones de retención opacas o cambiantes.
Solo quedan dos proveedores con compromisos de privacidad claros y explícitos:
- Cloudflare Workers AI: compromiso explícito de no entrenar ni mejorar el servicio sin consentimiento.
- Groq: no retiene por defecto los datos de inferencia; dispone de la opción Zero Data Retention (ZDR).
Si la privacidad es importante para tu carga de trabajo y el volumen es bajo o moderado, Cloudflare es la opción más segura. Si necesitas más rendimiento y puedes trabajar dentro de los límites de tokens por minuto de Groq, Groq con ZDR es la alternativa.
Cuando el plan gratuito se queda corto
Todos los planes gratuitos de esta lista terminarán limitando tu uso. La cuestión es qué hacer cuando ocurra.
La estrategia recomendada es usar consumo de pago medido con un único proveedor, no saltar entre planes gratuitos. Cambiar de proveedor para esquivar límites añade complejidad operativa —SDK distintos, políticas de datos diferentes y nuevos modos de fallo— que normalmente cuesta más en tiempo de ingeniería que el ahorro en API.
Cuatro de los proveedores anteriores admiten endpoints compatibles con OpenAI: Groq, OpenRouter, Cloudflare Workers AI y Google AI Studio, mediante el wrapper compatible con OpenAI. Eso permite pasar del uso gratuito al de pago en cualquiera de ellos actualizando la URL base y la clave de API, sin reescribir el código de la aplicación.
El recorrido práctico es sencillo: empieza gratis con Google AI Studio si priorizas variedad de modelos, o con Groq si necesitas rendimiento. Cuando alcances los límites diarios de forma constante, añade una cuenta de facturación al mismo proveedor y cambia a precios medidos. Reserva OpenRouter para probar varios modelos y utiliza Cloudflare cuando la privacidad de los datos sea innegociable.
Preguntas frecuentes
¿Qué API de IA gratuita no requiere tarjeta de crédito? Los nueve proveedores anteriores emiten claves de API sin tarjeta de crédito: Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face y Mistral.
¿Qué API gratuita tiene el mayor límite diario de solicitudes? Groq ofrece 14,400 solicitudes al día en Llama 3.1 8B Instant, la mayor cantidad recurrente de solicitudes de los planes gratuitos entre los proveedores incluidos aquí.
¿OpenRouter es realmente gratuito? Las variantes :free de OpenRouter no cuestan nada por token, pero están limitadas a 50 solicitudes al día, o 1,000 tras una compra de $10 en créditos. El modo BYOK permite enrutar mediante tus propias claves de proveedor con una asignación gratuita que depende del plan. Ninguna de las dos opciones es realmente ilimitada.
¿Puedo usar una API de IA gratuita en producción? Sí, siempre que respetes los límites de uso. Groq y Cloudflare son los planes gratuitos más preparados para producción en sus respectivas fortalezas: rendimiento y privacidad. Cuando los límites gratuitos interrumpan tu carga de trabajo de forma habitual, cambia al plan de pago del mismo proveedor.
¿Qué API gratuita es mejor para datos sensibles? Cloudflare Workers AI y Groq son los únicos proveedores con compromisos explícitos de no entrenamiento y no retención en sus planes gratuitos. Los demás entrenan con prompts gratuitos, como Google; registran el uso, como NVIDIA; o aplican políticas dependientes del proveedor, como OpenRouter.