Comparatif rapide des API LLM gratuites
Cette synthèse a été vérifiée le 8 septembre 2026. Les plafonds peuvent dépendre du modèle, du compte, de la région et de la demande : la documentation du fournisseur liée dans chaque ligne reste la référence.
Les indications relatives à la carte bancaire, à l’usage commercial et à la compatibilité OpenAI s’appuient également sur le comparatif de Free LLM API Hub.
| Fournisseur | Accès gratuit et quota publié | Condition de carte/paiement | Format d’API | Indication sur les conditions | Principal point d’attention |
|---|---|---|---|---|---|
| Google AI Studio | Les modèles Gemini varient : 5–30 RPM et 15–1,000 RPD ; exemple pour Gemini 2.5 Flash : 10 RPM / 250 RPD | Aucune carte indiquée ; vérification du compte et du projet potentiellement requise | Compatible OpenAI selon le comparatif vérifié | Usage commercial indiqué comme autorisé ; vérifier les conditions en vigueur | Google demande de consulter les limites actives dans AI Studio |
| Groq | Pour qwen/qwen3.6-27b : 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPD | Le Free Plan ne nécessite pas de passage à une offre payante ; le tier Developer requiert un moyen de paiement | Oui, en grande partie | Usage commercial indiqué comme autorisé ; les limites du Free Plan diffèrent de la capacité payante | Les limites s’appliquent au niveau de l’organisation et du modèle |
| OpenRouter | Variantes gratuites : 20 RPM / 50 RPD sous $10 de crédits achetés ; 1,000 RPD après au moins $10 achetés | La voie gratuite de base ne demande pas de carte ; des crédits débloquent un plafond supérieur | Oui, normalisée sur l’API OpenAI Chat | Usage commercial indiqué comme autorisé ; la disponibilité des modèles gratuits évolue | Le quota journalier le plus élevé est conditionné à un achat |
| Cloudflare Workers AI | 10,000 Neurons/jour, partagés par l’ensemble du compte ; remise à zéro à 00:00 UTC | L’allocation de base est gratuite ; certains modèles requièrent une facturation payante | Compatible OpenAI selon le comparatif vérifié | Usage commercial indiqué comme autorisé ; l’éligibilité varie selon le modèle | Les Neurons mesurent du calcul, pas un quota fixe de tokens |
| Cerebras Inference | Free Trial : 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD pour les modèles indiqués | Méthode de paiement vérifiée requise | Non établi dans la documentation citée | Accès d’essai ; crédits expirant après 30 jours | Le crédit d’essai de $5 n’est pas permanent |
| SambaNova Cloud | Free Tier : 20 RPM / 20 RPD / 200,000 TPD pour les modèles indiqués | Aucun moyen de paiement en Free Tier ; en associer un active le tier Developer payant | Oui, avec des différences documentées | Usage commercial indiqué comme autorisé ; vérifier les conditions du modèle | La limite de 20 RPD est restrictive |
| Cohere | 1,000 appels/mois ; Chat 20 RPM, Embed 2,000 entrées/min, Rerank 10 RPM | Aucune carte indiquée dans le comparatif vérifié ; à confirmer lors de l’inscription | Compatible OpenAI selon le comparatif vérifié | Évaluation uniquement selon le comparatif vérifié | Les appels ne sont pas interchangeables avec les tokens |
| Z.AI | GLM-4.7-Flash et GLM-4.5-Flash sont affichés à $0 pour les catégories de tokens présentées ; aucun RPM/TPM public n’est annoncé | Aucune carte indiquée dans le comparatif vérifié | Compatible OpenAI selon le comparatif vérifié | Usage commercial indiqué comme autorisé ; vérifier les conditions du modèle | Un prix de $0 par token ne renseigne pas sur la capacité |
| NVIDIA NIM | Free Inference Endpoints pour le prototypage ; aucun quota universel sur la page d’accueil | La condition de paiement varie selon l’endpoint ; vérifier la page du modèle | Non établi dans la documentation citée | La page citée évoque le prototypage/l’évaluation | Une mention « gratuit » sur une page d’accueil n’est pas un quota publié |
| Hugging Face Inference Providers | Les utilisateurs gratuits reçoivent $0.10/mois de crédits, montant susceptible d’évoluer ; aucun RPM/TPM publié | La documentation officielle de tarification ne précise pas la condition de carte | Compatible OpenAI selon le comparatif vérifié | Vérifier les conditions du fournisseur et du modèle | Il s’agit d’un petit crédit, pas d’un quota de requêtes |
| Mistral Studio | Studio en Free mode ; aucun quota public sur la page d’accueil de la documentation | La page d’accueil ne précise pas de condition de carte | Endpoint de style OpenAI documenté ; parité complète non revendiquée | Orientation essai/exploration/évaluation ; vérifier les conditions | Le Free mode ne prouve ni un accès illimité ni une disponibilité adaptée à la production |
Ne classez pas les offres d’après le plus grand chiffre affiché. Requêtes, tokens, appels, dollars et Neurons sont des unités différentes ; un essai expirant n’équivaut pas à une allocation renouvelée.
Pour les images, la voix, les embeddings et les autres modalités, consultez le comparatif plus large des API IA gratuites. Cette page se limite à l’inférence LLM hébergée.
Les offres les plus claires pour un accès récurrent ou sans carte
Google AI Studio : le point de départ polyvalent
La documentation officielle de Google sur les limites de débit précise que les quotas Gemini dépendent du modèle et du projet. Elle cite notamment les RPM, input TPM et RPD, indique que les quotas s’appliquent au projet Google Cloud plutôt qu’à chaque clé API, et renvoie les développeurs vers AI Studio pour consulter les valeurs actives. Les quotas quotidiens de requêtes sont remis à zéro à minuit, heure du Pacifique.
Un comparatif secondaire vérifié mentionne 10 RPM et 250 RPD pour Gemini 2.5 Flash, avec une plage de 5–30 RPM et 15–1,000 RPD selon les modèles. Utilisez ces chiffres pour planifier, pas comme une garantie : Google précise que les limites actives varient.
Gemini convient aux prototypes généralistes et multimodaux ; les plafonds quotidiens propres aux modèles peuvent freiner les charges très intensives en requêtes.
Groq : le meilleur choix sans carte pour un volume de requêtes publié
La documentation des limites de débit de Groq détaille les plafonds par modèle et par organisation. La ligne actuelle du Free Plan pour qwen/qwen3.6-27b annonce 30 RPM, 1,000 RPD, 8,000 TPM et 200,000 TPD. Les autres modèles ont leurs propres limites quotidiennes et de tokens.
« Les limites de débit s’appliquent au niveau de l’organisation, et non à chaque utilisateur. » — documentation des limites de débit de Groq
Multiplier les clés API ne crée donc pas automatiquement une capacité indépendante à l’échelle de l’organisation. Groq documente les en-têtes retry-after et x-ratelimit-* pour gérer les réponses HTTP 429.
Groq est le point de départ le plus net pour des requêtes fréquentes et courtes, si le modèle retenu convient à votre usage. Consultez la ligne exacte du modèle au lieu de considérer l’offre du fournisseur comme un quota unique.
OpenRouter : la passerelle la plus souple vers les modèles gratuits
OpenRouter propose une API unique donnant accès à une sélection mouvante de variantes de modèles gratuites. Son comparatif actuel d’accès gratuit indique 20 requêtes par minute et 50 requêtes par jour tant que le compte a acheté moins de $10 de crédits. Après au moins $10 de crédits achetés au total, l’allocation quotidienne passe à 1,000 requêtes. Le plafond supérieur suppose donc un achat.
La documentation officielle des limites précise que les comptes ou clés API supplémentaires ne modifient pas les limites globales de la plateforme. Le service expose les informations de quota via l’endpoint de clé et les en-têtes d’erreur de limite de débit.
Vous pouvez fixer un modèle avec le suffixe :free, ou utiliser openrouter/free, qui sélectionne automatiquement un modèle gratuit disponible. Le routeur peut filtrer selon des capacités comme le tool calling ou la compréhension d’images, mais le modèle sous-jacent peut changer.
Utilisez OpenRouter pour expérimenter et mettre en place du routage de secours, pas pour une application dépendante du comportement stable d’un unique modèle gratuit.
Cloudflare Workers AI : du calcul récurrent, pas des tokens offerts
La page officielle de tarification de Cloudflare accorde à chaque compte une allocation totale de 10,000 Neurons par jour sans frais. Elle est partagée entre les activités Workers AI et réinitialisée à 00:00 UTC. Sur le plan Workers Free, les opérations suivantes échouent une fois l’allocation épuisée.
Un Neuron représente le calcul GPU nécessaire à une requête. Cloudflare publie des équivalences de tokens propres à chaque modèle, plutôt que de promettre qu’un lot de 10,000 Neurons correspond à un nombre fixe de prompts.
Cloudflare précise aussi que certains modèles récents DeepSeek, GLM et Kimi nécessitent un moyen de paiement associé à la facturation. « 10,000 Neurons gratuits » ne signifie pas que tous les modèles restent accessibles sans facturation.
Du gratuit, mais avec une contrepartie
Cerebras : un essai utile, pas une API gratuite pérenne
La documentation Cerebras sur les limites de débit annonce 5 RPM, 30,000 uncached TPM, 90,000 total TPM et 1 million TPD pour les modèles du Free Trial. Elle explique également que son token bucket se recharge en continu, au lieu d’attendre une simple remise à zéro quotidienne.
Les nouveaux comptes reçoivent $5 de crédits gratuits, expirant après 30 jours, et doivent fournir un moyen de paiement vérifié pour activer l’accès au Playground et à l’API. Une fois le crédit épuisé ou expiré, l’accès s’arrête tant que vous n’achetez pas davantage de crédits. La documentation vérifiée ne décrit pas d’allocation gratuite publique et renouvelée en permanence.
Cerebras peut convenir à une évaluation de courte durée. Ce ne doit pas être l’unique dépendance d’un projet qui doit continuer à fonctionner après la période d’essai.
SambaNova Cloud : une frontière nette entre gratuit et facturé
SambaNova définit son Free Tier par le statut de facturation : il s’applique lorsqu’aucun moyen de paiement n’est associé. Pour les modèles concernés, la documentation officielle indique 20 RPM, 20 RPD et 200,000 TPD. La limite de 20 RPD peut bloquer un workflow très axé polling avant même que l’allocation de tokens soit consommée.
Associer un moyen de paiement active le tier Developer, qui est payant et ne doit donc pas être compté comme gratuit. SambaNova expose également les informations sur les requêtes restantes et la réinitialisation via les en-têtes de réponse.
Réservez SambaNova aux preuves de concept à très faible volume : son plafond de 20 RPD doit être validé avant tout workflow d’agent.
Cohere : intéressant pour le RAG, à condition de suivre les appels
La clé d’essai de Cohere ne correspond pas à un tier gratuit basé sur les tokens. Le comparatif vérifié actuel indique 1,000 appels par mois, avec des limites propres aux endpoints : 20 RPM pour Chat, 2,000 entrées par minute pour Embed et 10 RPM pour Rerank. La FAQ de Cohere décrit les clés d’essai comme gratuites, mais limitées.
Cet ensemble est pertinent pour des expérimentations de génération augmentée par récupération : un même projet peut tester génération, embeddings et reranking. Il ne transforme pas l’essai en backend de chat à haut volume. Ne comparez pas directement 1,000 appels/mois à 1 million de tokens/jour.
Le comparatif vérifié classe cet essai comme réservé à l’évaluation. Confirmez la politique d’usage actuelle avant de l’employer dans une application publique ou commerciale.
Z.AI : un tarif gratuit ne constitue pas un quota connu
La documentation tarifaire de Z.AI liste GLM-4.7-Flash et GLM-4.5-Flash comme gratuits dans les catégories de tokens affichées. La page publique de tarification consultée ne fournit toutefois aucun chiffre concret de RPM, RPD, TPM ou TPD.
Considérez donc le quota Z.AI comme inconnu : le service peut convenir à des tests manuels, mais pas à des traitements par lots. Vérifiez l’endpoint, la disponibilité du modèle et les conditions lors de l’inscription.
NVIDIA, Hugging Face et Mistral : des pistes à explorer, avec des quotas incomplets
| Fournisseur | Signal d’accès gratuit | Quota public manquant | Usage pratique |
|---|---|---|---|
| NVIDIA NIM | Free Inference Endpoints pour le prototypage | Pas de RPM universel, d’allocation de tokens, de règle de carte ou de prix de dépassement sur la page d’accueil | Tester un endpoint donné, puis lire les conditions propres à son modèle |
| Hugging Face Inference Providers | $0.10/mois de crédits pour les utilisateurs Free, sous réserve d’évolution | Aucun quota RPM ou TPM comparable | Petites expérimentations avec des modèles routés, sans gérer d’infrastructure GPU |
| Mistral Studio | Studio en Free mode et quickstarts API | Aucun quota ni règle de carte sur la page d’accueil de la documentation | Essayer les fonctions de l’API Mistral avant de passer à une configuration payante |
Quelle API LLM gratuite choisir ?
| Votre priorité | Meilleur point de départ | Pourquoi |
|---|---|---|
| Prototype généraliste | Google AI Studio | Gemini offre une base polyvalente claire ; les limites actives sont visibles dans AI Studio |
| Requêtes fréquentes et courtes | Groq | Des lignes de Free Plan publiées par modèle, dont un exemple à 1,000 RPD |
| De nombreux modèles via une seule API | OpenRouter | Variantes gratuites, routage et interface de style OpenAI |
| Application native Cloudflare | Workers AI | Allocation récurrente de 10,000 Neurons/jour |
| Plus grand chiffre de tokens annoncé pour un essai | Cerebras | Jusqu’à 1M TPD, mais seulement dans un essai de 30 jours avec carte requise |
| Configuration stricte sans moyen de paiement | Groq d’abord ; SambaNova pour de très faibles volumes | Le Free Tier de SambaNova est plafonné à 20 RPD |
| Composants RAG | Cohere | Chat, Embed et Rerank coexistent dans l’écosystème d’une même clé d’essai |
| Tester GLM Flash | Z.AI | Le tarif de token affiché est de $0, mais le quota public est inconnu |
| Découvrir des modèles ouverts sans GPU | Hugging Face | Accès routé et $0.10/mois pour les utilisateurs Free |
Commencez avec un seul fournisseur et enregistrez quatre champs à chaque requête : l’identifiant du modèle, le statut HTTP, l’usage de tokens et les en-têtes de limite restants. N’ajoutez un second fournisseur qu’après avoir identifié la limite atteinte par la première route ; plusieurs clés ne créent pas nécessairement plus de capacité.
Comment vérifier une API LLM gratuite avant de l’utiliser
Avant le lancement, contrôlez cinq points :
- Unité de quota : l’offre est-elle mesurée en requêtes, tokens, appels, dollars ou unités de calcul ?
- Mode de réinitialisation : le quota est-il réinitialisé selon UTC ou l’heure du Pacifique, rechargé en continu, renouvelé mensuellement ou disponible une seule fois ?
- Périmètre : la limite est-elle rattachée au modèle, au projet, au compte ou à l’organisation ?
- Condition de paiement : l’ajout d’une carte débloque-t-il davantage de capacité, active-t-il un tier payant ou est-il obligatoire pour l’essai ?
- Conditions et gestion des échecs : l’offre est-elle limitée aux tests ou à l’évaluation, et le client gère-t-il les HTTP 429 sans déclencher une tempête de nouvelles tentatives ?
FAQ sur les API LLM gratuites
Quelle est la meilleure API LLM gratuite dans l’ensemble ?
Google AI Studio convient aux prototypes généralistes ; Groq aux volumes de requêtes gratuites plus élevés ; OpenRouter à la variété des modèles.
Peut-on utiliser une API LLM gratuite sans carte bancaire ?
Oui. Google, Groq, la voie de base d’OpenRouter, l’allocation de base de Cloudflare et le Free Tier de SambaNova sont indiqués comme des options sans carte dans le comparatif vérifié. Cerebras exige un moyen de paiement vérifié pour son Free Trial.
Les API LLM gratuites sont-elles vraiment permanentes ?
Certains tiers récurrents restent disponibles tant que leurs conditions perdurent, mais les essais, prix promotionnels et routes :free tournantes ne constituent pas des allocations permanentes à l’échelle d’un fournisseur. Vérifiez la documentation et le statut du modèle avant de dépendre d’une seule offre.
Puis-je utiliser une API LLM gratuite en production ?
Ne l’utilisez pas comme unique backend tant que ses conditions actuelles, son quota et la disponibilité de ses modèles ne répondent pas à vos exigences de production.
Que se passe-t-il lorsque la limite gratuite est atteinte ?
Les fournisseurs renvoient généralement une erreur de limitation ou de quota. Groq documente la gestion des HTTP 429, Cloudflare précise que les opérations suivantes échouent après épuisement de l’allocation quotidienne du plan Free, et Cerebras coupe l’accès d’essai lorsque son crédit expire ou est consommé.