AIREITER
DOCS APITARIFS
MODÈLES
  • AIReiter
  • Blog
  • API LLM gratuites : comparatif des quotas de 11 fournisseurs (2026)

API LLM gratuites : comparatif des quotas de 11 fournisseurs (2026)

Dernière mise à jour: 2026-09-08 08:40:51

Comparatif rapide des API LLM gratuites

Cette synthèse a été vérifiée le 8 septembre 2026. Les plafonds peuvent dépendre du modèle, du compte, de la région et de la demande : la documentation du fournisseur liée dans chaque ligne reste la référence.

Les indications relatives à la carte bancaire, à l’usage commercial et à la compatibilité OpenAI s’appuient également sur le comparatif de Free LLM API Hub.

FournisseurAccès gratuit et quota publiéCondition de carte/paiementFormat d’APIIndication sur les conditionsPrincipal point d’attention
Google AI StudioLes modèles Gemini varient : 5–30 RPM et 15–1,000 RPD ; exemple pour Gemini 2.5 Flash : 10 RPM / 250 RPDAucune carte indiquée ; vérification du compte et du projet potentiellement requiseCompatible OpenAI selon le comparatif vérifiéUsage commercial indiqué comme autorisé ; vérifier les conditions en vigueurGoogle demande de consulter les limites actives dans AI Studio
GroqPour qwen/qwen3.6-27b : 30 RPM / 1,000 RPD / 8,000 TPM / 200,000 TPDLe Free Plan ne nécessite pas de passage à une offre payante ; le tier Developer requiert un moyen de paiementOui, en grande partieUsage commercial indiqué comme autorisé ; les limites du Free Plan diffèrent de la capacité payanteLes limites s’appliquent au niveau de l’organisation et du modèle
OpenRouterVariantes gratuites : 20 RPM / 50 RPD sous $10 de crédits achetés ; 1,000 RPD après au moins $10 achetésLa voie gratuite de base ne demande pas de carte ; des crédits débloquent un plafond supérieurOui, normalisée sur l’API OpenAI ChatUsage commercial indiqué comme autorisé ; la disponibilité des modèles gratuits évolueLe quota journalier le plus élevé est conditionné à un achat
Cloudflare Workers AI10,000 Neurons/jour, partagés par l’ensemble du compte ; remise à zéro à 00:00 UTCL’allocation de base est gratuite ; certains modèles requièrent une facturation payanteCompatible OpenAI selon le comparatif vérifiéUsage commercial indiqué comme autorisé ; l’éligibilité varie selon le modèleLes Neurons mesurent du calcul, pas un quota fixe de tokens
Cerebras InferenceFree Trial : 5 RPM / 30K uncached TPM / 90K total TPM / 1M TPD pour les modèles indiquésMéthode de paiement vérifiée requiseNon établi dans la documentation citéeAccès d’essai ; crédits expirant après 30 joursLe crédit d’essai de $5 n’est pas permanent
SambaNova CloudFree Tier : 20 RPM / 20 RPD / 200,000 TPD pour les modèles indiquésAucun moyen de paiement en Free Tier ; en associer un active le tier Developer payantOui, avec des différences documentéesUsage commercial indiqué comme autorisé ; vérifier les conditions du modèleLa limite de 20 RPD est restrictive
Cohere1,000 appels/mois ; Chat 20 RPM, Embed 2,000 entrées/min, Rerank 10 RPMAucune carte indiquée dans le comparatif vérifié ; à confirmer lors de l’inscriptionCompatible OpenAI selon le comparatif vérifiéÉvaluation uniquement selon le comparatif vérifiéLes appels ne sont pas interchangeables avec les tokens
Z.AIGLM-4.7-Flash et GLM-4.5-Flash sont affichés à $0 pour les catégories de tokens présentées ; aucun RPM/TPM public n’est annoncéAucune carte indiquée dans le comparatif vérifiéCompatible OpenAI selon le comparatif vérifiéUsage commercial indiqué comme autorisé ; vérifier les conditions du modèleUn prix de $0 par token ne renseigne pas sur la capacité
NVIDIA NIMFree Inference Endpoints pour le prototypage ; aucun quota universel sur la page d’accueilLa condition de paiement varie selon l’endpoint ; vérifier la page du modèleNon établi dans la documentation citéeLa page citée évoque le prototypage/l’évaluationUne mention « gratuit » sur une page d’accueil n’est pas un quota publié
Hugging Face Inference ProvidersLes utilisateurs gratuits reçoivent $0.10/mois de crédits, montant susceptible d’évoluer ; aucun RPM/TPM publiéLa documentation officielle de tarification ne précise pas la condition de carteCompatible OpenAI selon le comparatif vérifiéVérifier les conditions du fournisseur et du modèleIl s’agit d’un petit crédit, pas d’un quota de requêtes
Mistral StudioStudio en Free mode ; aucun quota public sur la page d’accueil de la documentationLa page d’accueil ne précise pas de condition de carteEndpoint de style OpenAI documenté ; parité complète non revendiquéeOrientation essai/exploration/évaluation ; vérifier les conditionsLe Free mode ne prouve ni un accès illimité ni une disponibilité adaptée à la production

Ne classez pas les offres d’après le plus grand chiffre affiché. Requêtes, tokens, appels, dollars et Neurons sont des unités différentes ; un essai expirant n’équivaut pas à une allocation renouvelée.

Pour les images, la voix, les embeddings et les autres modalités, consultez le comparatif plus large des API IA gratuites. Cette page se limite à l’inférence LLM hébergée.

Les offres les plus claires pour un accès récurrent ou sans carte

Google AI Studio : le point de départ polyvalent

La documentation officielle de Google sur les limites de débit précise que les quotas Gemini dépendent du modèle et du projet. Elle cite notamment les RPM, input TPM et RPD, indique que les quotas s’appliquent au projet Google Cloud plutôt qu’à chaque clé API, et renvoie les développeurs vers AI Studio pour consulter les valeurs actives. Les quotas quotidiens de requêtes sont remis à zéro à minuit, heure du Pacifique.

Un comparatif secondaire vérifié mentionne 10 RPM et 250 RPD pour Gemini 2.5 Flash, avec une plage de 5–30 RPM et 15–1,000 RPD selon les modèles. Utilisez ces chiffres pour planifier, pas comme une garantie : Google précise que les limites actives varient.

Gemini convient aux prototypes généralistes et multimodaux ; les plafonds quotidiens propres aux modèles peuvent freiner les charges très intensives en requêtes.

Groq : le meilleur choix sans carte pour un volume de requêtes publié

La documentation des limites de débit de Groq détaille les plafonds par modèle et par organisation. La ligne actuelle du Free Plan pour qwen/qwen3.6-27b annonce 30 RPM, 1,000 RPD, 8,000 TPM et 200,000 TPD. Les autres modèles ont leurs propres limites quotidiennes et de tokens.

« Les limites de débit s’appliquent au niveau de l’organisation, et non à chaque utilisateur. » — documentation des limites de débit de Groq

Multiplier les clés API ne crée donc pas automatiquement une capacité indépendante à l’échelle de l’organisation. Groq documente les en-têtes retry-after et x-ratelimit-* pour gérer les réponses HTTP 429.

Groq est le point de départ le plus net pour des requêtes fréquentes et courtes, si le modèle retenu convient à votre usage. Consultez la ligne exacte du modèle au lieu de considérer l’offre du fournisseur comme un quota unique.

OpenRouter : la passerelle la plus souple vers les modèles gratuits

OpenRouter propose une API unique donnant accès à une sélection mouvante de variantes de modèles gratuites. Son comparatif actuel d’accès gratuit indique 20 requêtes par minute et 50 requêtes par jour tant que le compte a acheté moins de $10 de crédits. Après au moins $10 de crédits achetés au total, l’allocation quotidienne passe à 1,000 requêtes. Le plafond supérieur suppose donc un achat.

La documentation officielle des limites précise que les comptes ou clés API supplémentaires ne modifient pas les limites globales de la plateforme. Le service expose les informations de quota via l’endpoint de clé et les en-têtes d’erreur de limite de débit.

Vous pouvez fixer un modèle avec le suffixe :free, ou utiliser openrouter/free, qui sélectionne automatiquement un modèle gratuit disponible. Le routeur peut filtrer selon des capacités comme le tool calling ou la compréhension d’images, mais le modèle sous-jacent peut changer.

Utilisez OpenRouter pour expérimenter et mettre en place du routage de secours, pas pour une application dépendante du comportement stable d’un unique modèle gratuit.

Cloudflare Workers AI : du calcul récurrent, pas des tokens offerts

La page officielle de tarification de Cloudflare accorde à chaque compte une allocation totale de 10,000 Neurons par jour sans frais. Elle est partagée entre les activités Workers AI et réinitialisée à 00:00 UTC. Sur le plan Workers Free, les opérations suivantes échouent une fois l’allocation épuisée.

Un Neuron représente le calcul GPU nécessaire à une requête. Cloudflare publie des équivalences de tokens propres à chaque modèle, plutôt que de promettre qu’un lot de 10,000 Neurons correspond à un nombre fixe de prompts.

Cloudflare précise aussi que certains modèles récents DeepSeek, GLM et Kimi nécessitent un moyen de paiement associé à la facturation. « 10,000 Neurons gratuits » ne signifie pas que tous les modèles restent accessibles sans facturation.

Du gratuit, mais avec une contrepartie

Cerebras : un essai utile, pas une API gratuite pérenne

La documentation Cerebras sur les limites de débit annonce 5 RPM, 30,000 uncached TPM, 90,000 total TPM et 1 million TPD pour les modèles du Free Trial. Elle explique également que son token bucket se recharge en continu, au lieu d’attendre une simple remise à zéro quotidienne.

Les nouveaux comptes reçoivent $5 de crédits gratuits, expirant après 30 jours, et doivent fournir un moyen de paiement vérifié pour activer l’accès au Playground et à l’API. Une fois le crédit épuisé ou expiré, l’accès s’arrête tant que vous n’achetez pas davantage de crédits. La documentation vérifiée ne décrit pas d’allocation gratuite publique et renouvelée en permanence.

Cerebras peut convenir à une évaluation de courte durée. Ce ne doit pas être l’unique dépendance d’un projet qui doit continuer à fonctionner après la période d’essai.

SambaNova Cloud : une frontière nette entre gratuit et facturé

SambaNova définit son Free Tier par le statut de facturation : il s’applique lorsqu’aucun moyen de paiement n’est associé. Pour les modèles concernés, la documentation officielle indique 20 RPM, 20 RPD et 200,000 TPD. La limite de 20 RPD peut bloquer un workflow très axé polling avant même que l’allocation de tokens soit consommée.

Associer un moyen de paiement active le tier Developer, qui est payant et ne doit donc pas être compté comme gratuit. SambaNova expose également les informations sur les requêtes restantes et la réinitialisation via les en-têtes de réponse.

Réservez SambaNova aux preuves de concept à très faible volume : son plafond de 20 RPD doit être validé avant tout workflow d’agent.

Cohere : intéressant pour le RAG, à condition de suivre les appels

La clé d’essai de Cohere ne correspond pas à un tier gratuit basé sur les tokens. Le comparatif vérifié actuel indique 1,000 appels par mois, avec des limites propres aux endpoints : 20 RPM pour Chat, 2,000 entrées par minute pour Embed et 10 RPM pour Rerank. La FAQ de Cohere décrit les clés d’essai comme gratuites, mais limitées.

Cet ensemble est pertinent pour des expérimentations de génération augmentée par récupération : un même projet peut tester génération, embeddings et reranking. Il ne transforme pas l’essai en backend de chat à haut volume. Ne comparez pas directement 1,000 appels/mois à 1 million de tokens/jour.

Le comparatif vérifié classe cet essai comme réservé à l’évaluation. Confirmez la politique d’usage actuelle avant de l’employer dans une application publique ou commerciale.

Z.AI : un tarif gratuit ne constitue pas un quota connu

La documentation tarifaire de Z.AI liste GLM-4.7-Flash et GLM-4.5-Flash comme gratuits dans les catégories de tokens affichées. La page publique de tarification consultée ne fournit toutefois aucun chiffre concret de RPM, RPD, TPM ou TPD.

Considérez donc le quota Z.AI comme inconnu : le service peut convenir à des tests manuels, mais pas à des traitements par lots. Vérifiez l’endpoint, la disponibilité du modèle et les conditions lors de l’inscription.

NVIDIA, Hugging Face et Mistral : des pistes à explorer, avec des quotas incomplets

FournisseurSignal d’accès gratuitQuota public manquantUsage pratique
NVIDIA NIMFree Inference Endpoints pour le prototypagePas de RPM universel, d’allocation de tokens, de règle de carte ou de prix de dépassement sur la page d’accueilTester un endpoint donné, puis lire les conditions propres à son modèle
Hugging Face Inference Providers$0.10/mois de crédits pour les utilisateurs Free, sous réserve d’évolutionAucun quota RPM ou TPM comparablePetites expérimentations avec des modèles routés, sans gérer d’infrastructure GPU
Mistral StudioStudio en Free mode et quickstarts APIAucun quota ni règle de carte sur la page d’accueil de la documentationEssayer les fonctions de l’API Mistral avant de passer à une configuration payante

Quelle API LLM gratuite choisir ?

Votre prioritéMeilleur point de départPourquoi
Prototype généralisteGoogle AI StudioGemini offre une base polyvalente claire ; les limites actives sont visibles dans AI Studio
Requêtes fréquentes et courtesGroqDes lignes de Free Plan publiées par modèle, dont un exemple à 1,000 RPD
De nombreux modèles via une seule APIOpenRouterVariantes gratuites, routage et interface de style OpenAI
Application native CloudflareWorkers AIAllocation récurrente de 10,000 Neurons/jour
Plus grand chiffre de tokens annoncé pour un essaiCerebrasJusqu’à 1M TPD, mais seulement dans un essai de 30 jours avec carte requise
Configuration stricte sans moyen de paiementGroq d’abord ; SambaNova pour de très faibles volumesLe Free Tier de SambaNova est plafonné à 20 RPD
Composants RAGCohereChat, Embed et Rerank coexistent dans l’écosystème d’une même clé d’essai
Tester GLM FlashZ.AILe tarif de token affiché est de $0, mais le quota public est inconnu
Découvrir des modèles ouverts sans GPUHugging FaceAccès routé et $0.10/mois pour les utilisateurs Free

Commencez avec un seul fournisseur et enregistrez quatre champs à chaque requête : l’identifiant du modèle, le statut HTTP, l’usage de tokens et les en-têtes de limite restants. N’ajoutez un second fournisseur qu’après avoir identifié la limite atteinte par la première route ; plusieurs clés ne créent pas nécessairement plus de capacité.

Comment vérifier une API LLM gratuite avant de l’utiliser

Avant le lancement, contrôlez cinq points :

  1. Unité de quota : l’offre est-elle mesurée en requêtes, tokens, appels, dollars ou unités de calcul ?
  2. Mode de réinitialisation : le quota est-il réinitialisé selon UTC ou l’heure du Pacifique, rechargé en continu, renouvelé mensuellement ou disponible une seule fois ?
  3. Périmètre : la limite est-elle rattachée au modèle, au projet, au compte ou à l’organisation ?
  4. Condition de paiement : l’ajout d’une carte débloque-t-il davantage de capacité, active-t-il un tier payant ou est-il obligatoire pour l’essai ?
  5. Conditions et gestion des échecs : l’offre est-elle limitée aux tests ou à l’évaluation, et le client gère-t-il les HTTP 429 sans déclencher une tempête de nouvelles tentatives ?

FAQ sur les API LLM gratuites

Quelle est la meilleure API LLM gratuite dans l’ensemble ?

Google AI Studio convient aux prototypes généralistes ; Groq aux volumes de requêtes gratuites plus élevés ; OpenRouter à la variété des modèles.

Peut-on utiliser une API LLM gratuite sans carte bancaire ?

Oui. Google, Groq, la voie de base d’OpenRouter, l’allocation de base de Cloudflare et le Free Tier de SambaNova sont indiqués comme des options sans carte dans le comparatif vérifié. Cerebras exige un moyen de paiement vérifié pour son Free Trial.

Les API LLM gratuites sont-elles vraiment permanentes ?

Certains tiers récurrents restent disponibles tant que leurs conditions perdurent, mais les essais, prix promotionnels et routes :free tournantes ne constituent pas des allocations permanentes à l’échelle d’un fournisseur. Vérifiez la documentation et le statut du modèle avant de dépendre d’une seule offre.

Puis-je utiliser une API LLM gratuite en production ?

Ne l’utilisez pas comme unique backend tant que ses conditions actuelles, son quota et la disponibilité de ses modèles ne répondent pas à vos exigences de production.

Que se passe-t-il lorsque la limite gratuite est atteinte ?

Les fournisseurs renvoient généralement une erreur de limitation ou de quota. Groq documente la gestion des HTTP 429, Cloudflare précise que les opérations suivantes échouent après épuisement de l’allocation quotidienne du plan Free, et Cerebras coupe l’accès d’essai lorsque son crédit expire ou est consommé.

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

Gemini 3.6 Flash

Chat

Un modèle Gemini rapide pour le raisonnement avancé, le codage et les tâches agentiques.

GoogleCréer une API Key >

Gemini 2.5 Pro

Chat
GoogleCréer une API Key >

Claude Fable 5

Chat

Un modèle Claude premium pour le raisonnement approfondi et le travail long et complexe.

AnthropicCréer une API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCréer une API Key >

Claude Opus 4.8

Chat

Un modèle Claude hautement performant pour les tâches de raisonnement exigeantes et le travail professionnel.

AnthropicCréer une API Key >

Articles récents

Comment utiliser DeepSeek sur Janitor AI (configuration 2026)

2026-09-08

Tarifs de l’API Muse Spark 1.3 : Standard ou Contributor

2026-09-08

GPT-6 Astra API : test (2026) — conçu pour les agents, pas pour un remplacement à l’identique

2026-09-07

API Kling : guide d’intégration officielle et via agrégateurs (2026)

2026-09-07
AIREITER

Des questions ? Contactez-nous à
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vidéo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Image IA

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.