Peut-on encore faire tourner un vrai projet avec une API d’IA gratuite en 2026 ? Oui. À elle seule, Groq autorise 14 400 requêtes gratuites par jour sur un modèle Llama 8B. Mais d’un fournisseur à l’autre, les plafonds peuvent varier d’un facteur mille, tandis que Google ne publie plus du tout les chiffres de son offre gratuite. Tous les chiffres ci-dessous proviennent de la documentation officielle des fournisseurs et ont été vérifiés le 29 juillet 2026.
API d’IA gratuites : les limites en un coup d’œil, vérifiées le 29 juillet 2026
Neuf fournisseurs délivrent des clés API sans demander de carte bancaire. Sept proposent un palier gratuit renouvelable ; NVIDIA et Hugging Face accordent des crédits ponctuels, qui finissent par s’épuiser.
| Fournisseur | Offre gratuite (chiffres officiels) | Carte bancaire | Entraîne ses modèles sur vos données (offre gratuite) |
|---|---|---|---|
| Google Gemini API | Tokens gratuits sur les modèles texte flash/pro ; RPM/RPD par modèle visibles uniquement dans votre compte AI Studio | Non | Oui (« Used to improve our products: Yes ») |
| Groq | llama-3.1-8b : 30 RPM / 14 400 RPD ; llama-3.3-70b : 30 RPM / 1 000 RPD / 100K TPD | Non | Aucune conservation par défaut ; ZDR disponible |
| OpenRouter | Modèles :free : 20 RPM, 50 req/jour — 1 000 req/jour après une recharge unique de 10 $ | Non (recharge facultative) | Dépend du fournisseur en amont ; option de refus |
| GitHub Models | Modèles de niveau inférieur : 15 RPM / 150 RPD ; DeepSeek-R1 : 1 RPM / 8 RPD | Non (PAT uniquement) | Non indiqué dans la documentation |
| Cloudflare Workers AI | 10 000 Neurons/jour, remise à zéro à 00:00 UTC | Non | Non (engagement explicite) |
| Cohere | Clé d’essai : 20 req/min, 1 000 appels/mois | Non | Non indiqué sur la page des limites de débit |
| Mistral | Mode gratuit disponible ; limites visibles uniquement dans votre Admin Panel | Non | Non indiqué ; option gratuite sans conservation annoncée |
| Hugging Face Inference Providers | 0,10 $/mois de crédits (« subject to change ») | Non | Selon la politique du fournisseur vers lequel la requête est routée |
| NVIDIA NIM | 1 000 crédits à l’inscription, jusqu’à 5 000 avec une adresse e-mail professionnelle | Non | Non indiqué |
Les plafonds journaliers vont de 8 requêtes pour DeepSeek-R1 sur GitHub Models à 14 400 pour l’endpoint 8B de Groq. Prudence dans les comparaisons : requêtes, tokens, Neurons et crédits en dollars ne mesurent pas la même chose.
Google AI Studio : le choix gratuit par défaut, avec deux réserves
Google AI Studio reste le point de départ le plus logique pour la plupart des développeurs : Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 2.5 Pro et huit autres modèles texte sont accessibles sans frais, sans compte de facturation. Pour être éligible au palier gratuit, il faut « an active project or free trial » ; seul le palier payant Tier 1 impose de lier une facturation.
Les quotas n’apparaissent qu’après l’inscription
La page des limites de débit de Google n’affiche plus les plafonds de requêtes par modèle : elle renvoie désormais vers votre propre projet dans AI Studio. Deux règles restent communes à tous : les quotas sont comptabilisés par projet, et non par clé API, et les compteurs quotidiens sont remis à zéro à minuit, heure du Pacifique. Tout RPM précis trouvé ailleurs doit donc être considéré comme obsolète tant que votre tableau de bord ne l’a pas confirmé.
Avec l’offre gratuite, vos prompts servent à améliorer les produits Google
Toutes les lignes de l’offre gratuite sur la page tarifaire de Google portent la mention « Used to improve our products: Yes » ; le trafic payant est, lui, marqué No. Si vous envoyez des données clients ou des informations soumises à un NDA, cette seule ligne écarte l’offre gratuite, quelle que soit la taille du quota. La génération d’images est également exclue : Gemini gratuit couvre donc uniquement le texte et les embeddings.
Groq : des plafonds quotidiens précis et publiés
Groq publie ses limites de l’offre gratuite modèle par modèle, sans connexion requise :
| Modèle | RPM | Requêtes/jour | Tokens/jour |
|---|---|---|---|
| llama-3.1-8b-instant | 30 | 14 400 | 500K |
| llama-3.3-70b-versatile | 30 | 1 000 | 100K |
| openai/gpt-oss-120b | 30 | 1 000 | 200K |
| whisper-large-v3 | 20 | 2 000 | 28 800 sec audio |
Le point de vigilance concerne les tokens par minute : llama-3.3-70b est plafonné à 12K TPM. Les tâches à long contexte seront donc ralenties, même si le nombre quotidien de requêtes semble généreux. Côté données, Groq ne conserve pas par défaut les entrées ni les sorties d’inférence et propose le Zero Data Retention sur demande.
Pour des prompts courts et fréquents — classification, extraction, enrichissement de webhooks — l’endpoint 8B de Groq et ses 14 400 requêtes quotidiennes constituent la meilleure offre gratuite de cette sélection, à condition qu’un modèle 8B suffise et de rester sous 6K tokens par minute.
OpenRouter : 50 requêtes gratuites par jour, 1 000 avec 10 $ déposés
OpenRouter ne donne pas accès au catalogue d’un seul fournisseur, mais à tous les modèles suffixés par :free. Le 29 juillet 2026, ce pool comptait 15 modèles texte, dont NVIDIA Nemotron 3 Ultra et Ling-3.0-flash.
Les limites s’appliquent à l’ensemble du compte et à tous les modèles gratuits : 20 requêtes par minute et 50 par jour. Un achat unique de 10 $ de crédits porte définitivement le plafond quotidien à 1 000, et ces 10 $ restent utilisables sur les modèles payants. En pratique, l’offre gratuite réellement exploitable d’OpenRouter coûte donc 10 $ une fois.
Le trafic des modèles gratuits est acheminé vers des fournisseurs en amont, selon leurs propres règles. Par défaut, rien n’empêche ceux qui entraînent leurs modèles sur vos entrées ; les réglages de confidentialité permettent de les bloquer, avec des options distinctes pour les modèles gratuits et payants. Sur l’intérêt concret du catalogue, un développeur de r/ChatGPTCoding écrit :
« Je recommande d’utiliser la clé API Openrouter avec le modèle gratuit Deepseek/Deepseek R1 0528, sans limite ni rate limit. Il est intelligent et son raisonnement est solide. »
Le catalogue évolue chaque mois ; les meilleurs choix actuels pour le code sont détaillés modèle par modèle.
Six autres offres gratuites à connaître
GitHub Models : un terrain d’essai gratuit avec une vraie API
Tout compte GitHub accède à l’API avec un simple personal access token : ni carte bancaire ni inscription séparée. Sans abonnement Copilot, vous relevez de la colonne Copilot Free : 15 RPM / 150 requêtes par jour pour les modèles de niveau inférieur, 10 RPM / 50 RPD pour les modèles de niveau supérieur, avec des requêtes limitées à 8 000 tokens en entrée + 4 000 en sortie. Les modèles de raisonnement sont bien plus contraints ; DeepSeek-R1 n’autorise que 8 requêtes par jour. GitHub précise que ces limites peuvent changer sans préavis.
Cloudflare Workers AI : 10 000 Neurons par jour et une garantie d’absence d’entraînement
Cloudflare facture en Neurons : 10 000 par jour, remis à zéro à 00:00 UTC, sur les formules Workers Free comme Paid. D’après la table de conversion de Cloudflare, cela représente environ 280K tokens de sortie quotidiens avec llama-3.1-8b-fast. Le fournisseur affirme aussi noir sur blanc qu’il n’utilisera pas le contenu client pour entraîner les modèles ou améliorer ses services sans consentement. C’est l’engagement le plus ferme des neuf fournisseurs sur les données, et la raison de privilégier Cloudflare pour les usages sensibles.
Cohere, NVIDIA, Hugging Face et Mistral : plus limités ou moins transparents
| Fournisseur | Allocation gratuite | Le point faible |
|---|---|---|
| Cohere | Clé d’essai : 20 req/min | 1 000 appels/mois au total : pour l’évaluation, pas l’exploitation |
| NVIDIA build.nvidia.com | 1 000 crédits à l’inscription ; jusqu’à 5 000 avec une adresse e-mail professionnelle | Crédits ponctuels, pas un palier récurrent, et aucun taux crédit/requête publié |
| Hugging Face Inference Providers | 0,10 $/mois de crédits sur plus de 200 modèles | Suffisant pour des démos uniquement, et annoncé comme « subject to change » |
| Mistral | Mode gratuit pour les clés API | Les limites ne sont pas publiées ; elles apparaissent uniquement dans votre Admin Panel |
Au-delà du texte : image, voix et embeddings à 0 $
Les offres gratuites sont plus rares dès qu’on sort du texte. La génération d’images en est l’exemple le plus net : les modèles d’image Gemini sont indiqués comme « Not available » dans l’offre gratuite, ce qui laisse le déploiement FLUX de Cloudflare, inclus dans les mêmes 10 000 Neurons quotidiens, comme principale option sans carte bancaire. La transcription s’en sort mieux : Groq attribue à whisper-large-v3 un quota gratuit distinct de 2 000 requêtes et 28 800 secondes audio par jour. Pour les embeddings, Gemini (gemini-embedding-001, offre gratuite) et GitHub Models (15 RPM / 150 RPD) fonctionnent tous deux sans paiement.
Pour les données sensibles, la sélection se réduit à deux noms
Cloudflare et Groq sont les deux seuls fournisseurs de cette liste à s’engager par écrit à ne pas entraîner leurs modèles sur les entrées gratuites ni à les conserver. Google affirme explicitement l’inverse, tandis que les cinq autres ne disent rien sur les pages où l’on s’attendrait à trouver cette information ; pour de vraies données utilisateur, cela reste donc non résolu, pas sûr.
Une clé partagée ou relayée depuis un dépôt GitHub ou un serveur Discord ne mérite même pas de figurer dans cette sélection : votre trafic passe par le compte d’un inconnu, et l’accès disparaît dès que ce compte est coupé.
À quel moment l’offre gratuite ne suffit plus
Vous avez dépassé les offres gratuites lorsque l’une de ces situations devient habituelle :
- Un plafond quotidien bloque un travail réel : les 100K tokens/jour de Groq 70B correspondent à une seule tâche batch de taille modérée.
- Vous avez besoin d’une catégorie de modèles absente des paliers gratuits. Les modèles de raisonnement de pointe comme la génération d’images sont absents ou restreints dans les neuf offres ci-dessus.
- Vous passez du temps d’ingénierie à alterner les fournisseurs pour contourner les plafonds.
Le dépassement coûte moins cher qu’il n’y paraît : les modèles de classe flash facturés à l’usage sont tarifés au million de tokens, de sorte qu’une journée au-delà des 100K gratuits de Groq coûte quelques centimes via un agrégateur comme AIReiter. Groq, OpenRouter, Cloudflare et Gemini proposent tous des endpoints compatibles OpenAI : passer de l’un à l’autre revient généralement à changer l’URL de base.
| Votre situation | Rester gratuit ou payer ? |
|---|---|
| Prototype sans données utilisateur réelles | Gratuit : Google AI Studio (large choix) ou Groq (débit) |
| Données sensibles, faible volume | Gratuit : Cloudflare Workers AI (garantie d’absence d’entraînement) |
| Tester de nombreux modèles à moindre coût | OpenRouter : 50 req/jour gratuites ; un achat unique de 10 $ débloque 1 000/jour |
| Les plafonds quotidiens interrompent le travail réel | Facturation à l’usage ; offres gratuites en solution de secours |
FAQ
Existe-t-il une API d’IA entièrement gratuite ?
Oui. Google AI Studio, Groq, GitHub Models et Cloudflare Workers AI proposent tous un accès API fonctionnel sans moyen de paiement enregistré, au 29 juillet 2026. Chacun impose toutefois des plafonds quotidiens ou par minute. L’offre gratuite de Google utilise en outre vos prompts pour améliorer ses produits.
Quelle API d’IA est gratuite sans carte bancaire ?
Les neuf fournisseurs du tableau comparatif ci-dessus délivrent des clés sans carte bancaire. Ce qui les distingue, c’est la taille des plafonds et leur politique de données : comparez les 14 400 requêtes/jour de Groq aux 1 000 appels/mois de Cohere, ou l’engagement de Cloudflare à ne pas entraîner ses modèles sur vos données à la position opposée de Google.
Quelle API GPT est gratuite ?
L’API d’OpenAI ne propose pas d’offre gratuite, mais les modèles gpt-oss à poids ouverts d’OpenAI sont gratuits sur trois plateformes : Groq (gpt-oss-120b à 1 000 requêtes/jour), Cloudflare Workers AI (dans les 10 000 Neurons quotidiens) et OpenRouter (openai/gpt-oss-20b:free). GitHub Models donne également accès à des modèles OpenAI GPT hébergés sur Azure dans son offre gratuite, à l’exception des séries o et des modèles de classe GPT-5.
Quelle est l’offre gratuite d’API d’IA la plus généreuse ?
Tout dépend du critère. En nombre brut de requêtes, llama-3.1-8b-instant de Groq avec 14 400/jour. En volume de tokens, les 10 000 Neurons/jour de Cloudflare. Pour la qualité des modèles à 0 $, Google AI Studio avec Gemini 2.5 Pro inclus, mais en contrepartie de l’utilisation des données pour l’entraînement.
