AIREITER
DOCS APIPRECIOS
PLANTILLAS
  • AIReiter
  • Blog
  • Comparativa de API LLM gratis: cuotas de 11 proveedores (2026)

Comparativa de API LLM gratis: cuotas de 11 proveedores (2026)

Última actualización: 2026-09-08 08:40:21

Comparativa rápida de API LLM gratis

Esta información se verificó el 8 de septiembre de 2026. Los límites pueden cambiar según el modelo, la cuenta, la región y la demanda; toma como referencia definitiva la documentación enlazada de cada proveedor.

Las indicaciones sobre tarjeta, uso comercial y compatibilidad con OpenAI se contrastaron también con la comparativa de Free LLM API Hub.

ProveedorAcceso gratuito y cuota publicadaCondición de tarjeta/pagoFormato de APIIndicación en los términosPrincipal limitación
Google AI StudioLos modelos Gemini varían: 5–30 RPM y 15–1.000 RPD; ejemplo con Gemini 2.5 Flash: 10 RPM / 250 RPDNo se indica tarjeta; podrían aplicarse requisitos de verificación de cuenta y proyectoCompatible con OpenAI según la comparativa verificadaEl uso comercial aparece como permitido; confirma los términos vigentesGoogle indica que los límites activos se consultan en AI Studio
GroqPara qwen/qwen3.6-27b: 30 RPM / 1.000 RPD / 8.000 TPM / 200.000 TPDEl plan Free no exige pasar a un plan de pago; el nivel Developer requiere un método de pagoSí, en gran medidaEl uso comercial aparece como permitido; los límites del plan Free difieren de la capacidad de pagoLos límites se aplican por organización y modelo
OpenRouterVariantes gratuitas: 20 RPM / 50 RPD con menos de $10 en créditos comprados; 1.000 RPD tras comprar al menos $10La ruta gratuita básica no necesita tarjeta; comprar créditos aumenta el límiteSí, normalizada a OpenAI Chat APIEl uso comercial aparece como permitido; la disponibilidad de modelos gratis cambiaLa mayor asignación diaria depende de una compra
Cloudflare Workers AI10.000 Neurons/día, compartidos por toda la cuenta; se reinicia a las 00:00 UTCLa asignación básica es gratuita; algunos modelos requieren facturación de pagoCompatible con OpenAI según la comparativa verificadaEl uso comercial aparece como permitido; la elegibilidad depende del modeloLos Neurons miden cómputo, no una cuota fija de tokens
Cerebras InferencePrueba gratuita: 5 RPM / 30K TPM sin caché / 90K TPM totales / 1M TPD para los modelos indicadosRequiere un método de pago verificadoNo se ha establecido en la documentación citadaAcceso de prueba; los créditos caducan tras 30 díasEl crédito de prueba de $5 no es permanente
SambaNova CloudPlan Free: 20 RPM / 20 RPD / 200.000 TPD para los modelos indicadosEl plan Free no requiere método de pago; vincular uno activa el nivel Developer de pagoSí, con diferencias documentadasEl uso comercial aparece como permitido; revisa los términos de cada modeloEl límite de 20 RPD es restrictivo
Cohere1.000 llamadas/mes; Chat 20 RPM, Embed 2.000 entradas/min, Rerank 10 RPMNo se indica tarjeta en la comparativa verificada; confírmalo al registrarteCompatible con OpenAI según la comparativa verificadaSolo evaluación según la comparativa verificadaLas llamadas no son equivalentes a los tokens
Z.AIGLM-4.7-Flash y GLM-4.5-Flash figuran a $0 para las categorías de tokens mostradas; no se especifican RPM/TPM públicosNo se indica tarjeta en la comparativa verificadaCompatible con OpenAI según la comparativa verificadaEl uso comercial aparece como permitido; verifica los términos del modelo$0 por token no revela la capacidad disponible
NVIDIA NIMFree Inference Endpoints para prototipado; la página principal no publica una cuota universalLa condición de pago depende del endpoint; revisa la página del modeloNo se ha establecido en la documentación citadaLa página citada apunta a prototipado/evaluaciónQue la página principal diga gratis no equivale a una cuota publicada
Hugging Face Inference ProvidersLos usuarios Free reciben $0.10/mes en créditos, sujeto a cambios; no se publican RPM/TPMLa documentación oficial de precios no especifica si se requiere tarjetaCompatible con OpenAI según la comparativa verificadaRevisa los términos del proveedor y del modeloEs un crédito pequeño, no una cuota de solicitudes
Mistral StudioModo Free de Studio; la portada de documentación no publica una cuotaLa portada no indica condiciones sobre tarjetaDocumenta un endpoint estilo OpenAI; no se afirma compatibilidad totalIndicación de prueba y exploración/evaluación; verifica los términosEl modo Free no demuestra acceso ilimitado ni apto para producción

No ordenes estos proveedores por la cifra más alta. Solicitudes, tokens, llamadas, dólares y Neurons son unidades distintas; una prueba que caduca no equivale a una asignación renovable.

Para imágenes, voz, embeddings y otras modalidades, consulta la comparativa más amplia de API de IA gratis. Esta página se centra exclusivamente en la inferencia LLM alojada.

Los proveedores con acceso recurrente o sin tarjeta más claro

Google AI Studio: un punto de partida práctico para uso general

La documentación oficial de límites de Google explica que las cuotas de Gemini dependen del modelo y del proyecto. Entre las métricas habituales figuran RPM, TPM de entrada y RPD; las cuotas se aplican al proyecto de Google Cloud, no a cada clave de API, y los valores activos se consultan en AI Studio. Las cuotas diarias de solicitudes se reinician a medianoche, hora del Pacífico.

Una comparativa secundaria verificada indica 10 RPM y 250 RPD para Gemini 2.5 Flash, y un rango de 5–30 RPM y 15–1.000 RPD entre modelos. Úsalas como cifras de planificación: Google advierte de que los límites activos varían y no están garantizados.

Gemini encaja bien en prototipos generales y multimodales, aunque los topes diarios de cada modelo pueden frenar cargas con muchas solicitudes.

Groq: la mejor opción sin tarjeta por cuota de solicitudes publicada

La documentación de límites de Groq detalla las restricciones por modelo y organización. La fila actual del plan Free para qwen/qwen3.6-27b indica 30 RPM, 1.000 RPD, 8.000 TPM y 200.000 TPD. Los límites diarios y de tokens varían en otros modelos.

«Los límites de velocidad se aplican a nivel de organización, no de usuarios individuales». — Documentación de límites de Groq

Tener varias claves de API no crea automáticamente capacidad independiente para toda la organización. La documentación de Groq describe las cabeceras retry-after y x-ratelimit-* para gestionar respuestas HTTP 429.

Groq es el punto de partida más claro para muchas solicitudes pequeñas si el modelo elegido sirve para tu caso. Consulta siempre la fila del modelo concreto, en lugar de asumir una única cuota para todo el proveedor.

OpenRouter: la pasarela más flexible para modelos gratuitos

OpenRouter ofrece una única superficie de API para una selección cambiante de variantes de modelos gratis. Su comparativa actual de acceso gratuito indica 20 solicitudes por minuto y 50 solicitudes al día mientras la cuenta haya comprado menos de $10 en créditos. Al alcanzar al menos $10 en créditos comprados acumulados, la asignación diaria sube a 1.000 solicitudes. Por tanto, el límite superior exige una compra.

La documentación oficial de límites aclara que ni las cuentas adicionales ni las claves de API cambian los límites globales de la plataforma. El servicio expone datos de cuota mediante el endpoint de claves y las cabeceras de errores por límite.

Puedes fijar un modelo con el sufijo :free o usar openrouter/free, que selecciona automáticamente un modelo gratuito disponible. El router puede filtrar por capacidades como tool calling o comprensión de imágenes, pero el modelo subyacente puede cambiar.

OpenRouter resulta útil para experimentar y configurar rutas de respaldo, pero no para una aplicación que dependa del comportamiento estable de un único modelo gratuito.

Cloudflare Workers AI: cómputo recurrente, no tokens gratis

La página oficial de precios de Cloudflare asigna a cada cuenta un total de 10.000 Neurons diarios sin coste. La asignación se comparte entre toda la actividad de Workers AI y se reinicia a las 00:00 UTC. En el plan Workers Free, las operaciones posteriores fallan cuando se agota esa asignación.

Un Neuron representa el cómputo de GPU necesario para una solicitud. Cloudflare publica equivalencias de tokens específicas por modelo, en vez de prometer que 10.000 Neurons equivalen a un número fijo de prompts.

Cloudflare también señala que determinados modelos recientes de DeepSeek, GLM y Kimi requieren un método de facturación de pago. «10.000 Neurons gratis» no significa que todos los modelos estén disponibles sin facturación.

Acceso gratuito, pero con condiciones

Cerebras: una prueba útil, no una API gratis permanente

La documentación de límites de Cerebras indica 5 RPM, 30.000 TPM sin caché, 90.000 TPM totales y 1 millón de TPD para los modelos incluidos en la prueba gratuita. También explica que su cubo de tokens se repone de forma continua, en lugar de esperar a un reinicio diario simple.

Las cuentas nuevas reciben $5 en créditos gratuitos, que caducan a los 30 días, y necesitan un método de pago verificado para activar el acceso a Playground y a la API. Cuando el crédito caduca o se agota, el acceso se detiene salvo que compres más. La documentación revisada no describe una asignación pública gratuita que se renueve permanentemente.

Cerebras sirve para una evaluación breve. No debería ser la única dependencia de un proyecto que necesite funcionar después del periodo de prueba.

SambaNova Cloud: la frontera más clara entre facturación y acceso gratis

SambaNova define su plan Free según el estado de facturación: se aplica cuando no hay ningún método de pago vinculado. Para los modelos incluidos en el plan Free, la documentación oficial muestra 20 RPM, 20 RPD y 200.000 TPD. El límite de 20 RPD puede detener un flujo de trabajo con mucho polling antes de consumir la asignación de tokens.

Vincular un método de pago activa el nivel Developer, que es de pago y no debe contabilizarse como gratuito. SambaNova también expone en las cabeceras de respuesta la información sobre solicitudes restantes y reinicios.

Usa SambaNova solo en pruebas de concepto de volumen bajo: su tope de 20 RPD debe validarse antes de montar cualquier flujo de agentes.

Cohere: útil para RAG, pero vigila bien las llamadas

La clave de prueba de Cohere no es lo mismo que un plan gratuito basado en tokens. La comparativa verificada actual indica 1.000 llamadas al mes, con límites específicos por endpoint de 20 RPM para Chat, 2.000 entradas por minuto para Embed y 10 RPM para Rerank. Las preguntas frecuentes de Cohere describen las claves de prueba como gratuitas, pero limitadas.

Esta combinación hace que Cohere sea útil para experimentos de generación aumentada por recuperación: un mismo proyecto puede probar generación, embeddings y reranking. No convierte la prueba en un backend de chat de gran volumen. No compares directamente 1.000 llamadas/mes con 1 millón de tokens/día.

La comparativa verificada clasifica la prueba como solo para evaluación. Confirma la política de uso actual antes de emplearla en una aplicación pública o comercial.

Z.AI: precio gratuito no equivale a cuota conocida

La documentación de precios de Z.AI muestra GLM-4.7-Flash y GLM-4.5-Flash como gratuitos para las categorías de tokens mostradas. La página pública de precios revisada no proporciona cifras concretas de RPM, RPD, TPM o TPD.

Considera que la cuota de Z.AI es desconocida: puede servir para pruebas manuales, pero no para trabajo por lotes; verifica el endpoint, la disponibilidad del modelo y los términos al registrarte.

NVIDIA, Hugging Face y Mistral: vías para descubrir modelos con cuotas incompletas

ProveedorSeñal de acceso gratuitoCuota pública que faltaUso práctico
NVIDIA NIMFree Inference Endpoints para prototipadoLa página principal no incluye RPM universal, asignación de tokens, regla de tarjeta ni precio por excesoPrueba un endpoint concreto y después revisa sus términos específicos por modelo
Hugging Face Inference Providers$0.10/mes en créditos para usuarios Free, sujeto a cambiosNo hay una cuota comparable de RPM o TPMPequeños experimentos con modelos enrutados sin gestionar infraestructura GPU
Mistral StudioModo Free de Studio y guías rápidas de APILa portada de documentación no publica cuota ni regla de tarjetaPrueba las funciones de la API de Mistral antes de comprometerte con una configuración de pago

¿Qué API LLM gratis deberías elegir?

Tu prioridadMejor punto de partidaMotivo
Prototipo de uso generalGoogle AI StudioGemini ofrece una base general clara; los límites activos se ven en AI Studio
Muchas solicitudes pequeñasGroqFilas publicadas por modelo para el plan Free y un ejemplo de 1.000 RPD
Muchos modelos mediante una APIOpenRouterVariantes gratuitas, enrutamiento e interfaz estilo OpenAI
Aplicación nativa de CloudflareWorkers AIAsignación recurrente de 10.000 Neurons/día
Mayor cifra de tokens declarada en una pruebaCerebrasHasta 1M TPD, pero solo durante una prueba de 30 días que requiere tarjeta
Configuración estricta sin método de pagoPrimero Groq; SambaNova para volúmenes muy bajosEl plan Free de SambaNova tiene un tope de 20 RPD
Componentes para RAGCohereChat, Embed y Rerank comparten el ecosistema de una misma clave de prueba
Probar GLM FlashZ.AIEl precio de token mostrado es $0, pero la cuota pública se desconoce
Descubrir modelos abiertos sin GPUHugging FaceAcceso enrutado y $0.10/mes para usuarios Free

Empieza con un proveedor y registra cuatro campos en cada solicitud: ID del modelo, estado HTTP, uso de tokens y cabeceras de límite restante. Añade un segundo proveedor solo cuando sepas qué límite alcanza la primera ruta; usar varias claves no implica necesariamente más capacidad.

Cómo verificar una API LLM gratis antes de usarla

Antes de lanzar, confirma cinco puntos:

  1. Unidad de cuota: ¿La oferta se mide en solicitudes, tokens, llamadas, dólares o unidades de cómputo?
  2. Comportamiento de reinicio: ¿Se reinicia en un momento UTC o del horario del Pacífico, se repone continuamente, se renueva cada mes o caduca una sola vez?
  3. Ámbito: ¿El límite está asociado al modelo, proyecto, cuenta u organización?
  4. Condición de pago: ¿Añadir una tarjeta desbloquea más capacidad, activa un plan de pago o es obligatorio para la prueba?
  5. Términos y ruta de fallo: ¿La oferta está limitada a pruebas o evaluación, y el cliente gestiona HTTP 429 sin provocar una tormenta de reintentos?

Preguntas frecuentes sobre API LLM gratis

¿Cuál es la mejor API LLM gratis en general?

Google AI Studio encaja en prototipos generales; Groq, en un mayor volumen de solicitudes gratis; y OpenRouter, en variedad de modelos.

¿Puedo usar una API LLM gratis sin tarjeta de crédito?

Sí. Google, Groq, la ruta básica de OpenRouter, la asignación básica de Cloudflare y el plan Free de SambaNova figuran como opciones sin tarjeta en la comparativa verificada. Cerebras exige un método de pago verificado para su prueba gratuita.

¿Las API LLM gratis son realmente permanentes?

Algunos planes recurrentes siguen disponibles mientras se mantengan sus términos, pero las pruebas, los precios promocionales y las rutas :free rotativas no son asignaciones permanentes para todo el proveedor. Consulta la documentación actual y el estado del modelo antes de depender de uno.

¿Puedo usar una API LLM gratis en producción?

No la uses como único backend a menos que sus términos actuales, cuota y disponibilidad de modelo cumplan tus requisitos de producción.

¿Qué ocurre al alcanzar el límite gratuito?

Los proveedores normalmente devuelven un error de limitación o de cuota. Groq documenta cómo gestionar HTTP 429, Cloudflare indica que las operaciones posteriores fallan tras agotar la asignación diaria del plan Free, y Cerebras corta el acceso de prueba cuando su crédito caduca o se agota.

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Gemini 3.6 Flash

Chat

Un modelo Gemini rápido para razonamiento avanzado, programación y tareas agénticas.

GoogleCrear API Key >

Gemini 2.5 Pro

Chat
GoogleCrear API Key >

Claude Fable 5

Chat

Un modelo premium de Claude para razonamiento profundo y trabajo complejo de formato largo.

AnthropicCrear API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrear API Key >

Claude Opus 4.8

Chat

Un modelo Claude de alta capacidad para tareas que exigen razonamiento y trabajo profesional.

AnthropicCrear API Key >

Publicaciones recientes

Cómo usar DeepSeek en Janitor AI (configuración 2026)

2026-09-08

Precios de la API de Muse Spark 1.3: Standard frente a Contributor

2026-09-08

Análisis de la API de GPT-6 Astra (2026): creada para agentes, no para sustituir sin más

2026-09-07

API de Kling: guía de integración oficial y mediante agregadores (2026)

2026-09-07
AIREITER

¿Preguntas? Contáctanos en
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagen IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.