AIREITER
DOCS APITARIFS
MODÈLES
  • AIReiter
  • Blog
  • Les meilleures API d’IA gratuites en 2026 : limites officielles et politique des données

Les meilleures API d’IA gratuites en 2026 : limites officielles et politique des données

Dernière mise à jour: 2026-08-14 04:19:27

Les limites des API d’IA gratuites en un coup d’œil

Dans l’univers des API d’IA, « gratuit » signifie presque jamais illimité. Il s’agit plutôt d’un accès bridé : parfois un quota renouvelé, parfois des crédits promotionnels qui finissent par s’épuiser. Tous les fournisseurs ci-dessous délivrent une clé API sans demander de carte bancaire, mais les volumes réellement exploitables vont de quelques requêtes par jour à plusieurs dizaines de milliers.

Les chiffres de ce guide ont été vérifiés dans la documentation officielle de chaque fournisseur en août 2026. Les limites évoluent souvent : avant de dimensionner un projet de production, vérifiez-les systématiquement dans la console du fournisseur.

FournisseurPoints clés de l’offre gratuitePoint clé sur les donnéesIdéal pour
Google AI StudioNi carte ni compte de facturation ; modèles Gemini ; quotas par projet réinitialisés à minuit, heure du PacifiqueLes prompts gratuits servent à entraîner les produits GoogleVariété de modèles, prototypage
Groq14 400 RPD sur Llama 3.1 8B ; 70K TPM sur les modèles CompoundAucune conservation par défaut ; ZDR disponiblePrompts courts à haute fréquence
OpenRouter50 requêtes gratuites/jour ; 25+ modèles gratuits ; BYOK pris en chargeDépend du fournisseur amontTester de nombreux modèles
GitHub Models15 RPM / 150 RPD (niveau bas) ; 8 000 jetons en entrée + 4 000 en sortieConditions de données MicrosoftEssais rapides avec un PAT
Cloudflare Workers AI10 000 Neurons/jour (~280K jetons de sortie sur Llama 3.1 8B Fast)Engagement explicite de ne pas entraîner les modèlesTraitements sensibles à la confidentialité
Cohere20 req/min ; 1 000 appels/moisLicence d’évaluationEssais d’embeddings et de reranking
NVIDIA NIM1 000 crédits à l’inscription ; jusqu’à 5 000 avec un e-mail professionnelL’usage des endpoints gratuits est journaliséTests ponctuels de modèles
Hugging Face$0.10/mois sur plus de 200 modèlesAllocation susceptible d’être modifiéeInférence à l’échelle d’une démo
MistralMode de clé API gratuit ; limites dans l’Admin PanelOption de rétention nulle mentionnéeModèles hébergés en Europe

Neuf fournisseurs délivrent donc des clés sans carte bancaire. Sept proposent un niveau gratuit récurrent ; NVIDIA et Hugging Face accordent à la place des crédits consommables qui ne se renouvellent pas. L’écart est considérable : GitHub Models vous limite à 8 requêtes DeepSeek-R1 par jour, tandis que Groq accorde 14 400 requêtes quotidiennes sur Llama 3.1 8B.

Google AI Studio : le point de départ le plus évident

Pour accéder gratuitement à des modèles de premier plan sans renseigner d’informations de facturation, Google AI Studio est le choix le plus naturel. Il suffit de se connecter avec un compte Google, de générer une clé API et de commencer à appeler les modèles : ni carte bancaire ni compte de facturation ne sont nécessaires.

L’offre gratuite donne accès à la famille Gemini, dont Gemini 3.6 Flash, 3.5 Flash, 2.5 Pro et d’autres modèles. Les endpoints de texte et d’embeddings sont inclus ; les quotas sont définis par projet et se réinitialisent à minuit, heure du Pacifique.

Les quotas ne se découvrent qu’après l’inscription

Google ne publie pas de grille unique des limites de son offre gratuite, contrairement à Groq ou OpenRouter. Vos seuils réels — requêtes par minute, jetons par minute et jetons par jour — ne s’affichent dans la console AI Studio qu’une fois le projet créé. Difficile, donc, d’anticiper la capacité. En pratique, créez un projet, consultez la page Quotas et concevez votre intégration autour des plafonds indiqués.

En gratuit, vos prompts peuvent entraîner les produits Google

C’est la réserve la plus importante. Les conditions de l’offre gratuite de Google précisent que les prompts et les contenus générés peuvent être utilisés pour améliorer les produits Google. Si vous manipulez des données sensibles, propriétaires ou personnelles, cette offre gratuite ne convient donc pas. L’utilisation payante de Gemini API, via Google Cloud avec un compte de facturation, ne comporte pas cette clause d’entraînement, mais exige une carte bancaire.

La génération d’images par Gemini n’est pas non plus disponible gratuitement : l’offre couvre uniquement le texte et les embeddings.

Groq : des plafonds quotidiens clairement annoncés

L’offre gratuite de Groq est la plus généreuse pour les usages à forte fréquence reposant sur des prompts courts. Les limites sont publiées explicitement dans la documentation de Groq et s’appliquent par organisation, non par utilisateur. Les jetons mis en cache ne comptent pas dans ces limites.

ModèleRPMRPDTPMTPD
Llama 3.1 8B Instant3014,4006,000500,000
Llama 3.3 70B Versatile301,00012,000100,000
GPT-OSS-120B301,0008,000200,000
GPT-OSS-20B301,0008,000200,000
Qwen 3.6-27B301,0008,000200,000
Groq Compound3025070,000—
Groq Compound Mini3025070,000—
Whisper Large V3202,000—28,800 sec audio/jour

Le chiffre qui se distingue est celui de Llama 3.1 8B : 14 400 requêtes par jour, de quoi soutenir un prototypage sérieux ou un endpoint de production à faible trafic. Les modèles Compound disposent de l’allocation par minute la plus élevée, avec 70 000 TPM, mais leur plafond quotidien est plus serré, à 250 RPD.

Groq ne conserve pas les données d’inférence par défaut et propose une option Zero Data Retention (ZDR), ce qui en fait l’un des choix gratuits les plus solides sur le plan de la confidentialité. Sa principale limite tient au plafond de jetons par minute du modèle 8B, fixé à 6 000 TPM, qui peut brider les contextes longs ou les générations volumineuses.

OpenRouter : 50 requêtes gratuites par jour

OpenRouter est une passerelle API, pas un hébergeur de modèles. Son offre gratuite donne accès à un catalogue tournant de modèles subventionnés par OpenRouter. Pour les appeler, ajoutez :free au nom du modèle ou utilisez l’auto-router openrouter/free.

Limites de débit : Les modèles gratuits sont plafonnés à 20 RPM et 50 requêtes par jour. Un achat unique de $10 de crédits porte durablement le plafond quotidien des modèles gratuits à 1 000 requêtes. Ces limites s’ajoutent à tout bridage éventuel appliqué par le fournisseur amont.

Catalogue de modèles gratuits : En août 2026, OpenRouter référence plus de 25 modèles gratuits, contre 15 en juillet, couvrant la génération de texte, les embeddings et le reranking. On y trouve notamment des modèles NVIDIA — les familles Nemotron 3 Ultra, Super et Nano, avec jusqu’à 1M de jetons de contexte —, Google avec Gemma 4, Cohere avec North Mini Code, OpenAI avec gpt-oss-20b, et plusieurs autres. La sélection évolue fréquemment, au gré des ajouts et retraits d’endpoints gratuits par les fournisseurs.

BYOK (Bring Your Own Key) : OpenRouter prend en charge le BYOK auprès de plus de 60 fournisseurs d’inférence. Lorsque vous fournissez vos propres clés API, le fournisseur sous-jacent facture directement l’inférence et OpenRouter ne facture que sa couche de routage. L’allocation BYOK gratuite dépend désormais du plan et se mesure en coût d’inférence au tarif catalogue, plutôt qu’en nombre fixe de requêtes : consultez la page tarifaire d’OpenRouter pour les conditions actuelles.

Le point pratique à retenir : « gratuit » chez OpenRouter veut dire sans facturation au jeton, pas forcément sans conservation des données. Chaque fournisseur amont définit sa propre politique, et certains, dont NVIDIA et Poolside, journalisent explicitement l’usage de leurs endpoints gratuits ou peuvent utiliser les prompts pour l’entraînement. Configurez des filtres de confidentialité par fournisseur si nécessaire.

Six autres offres gratuites à connaître

GitHub Models

GitHub Models propose un espace de test et un endpoint API pour des modèles populaires, accessibles avec un GitHub Personal Access Token (PAT). Le niveau bas offre 15 RPM et 150 RPD ; le niveau haut descend à 10 RPM et 50 RPD. Chaque requête est limitée à 8 000 jetons en entrée et 4 000 jetons en sortie. DeepSeek-R1 est disponible, mais plafonné à 8 requêtes par jour.

GitHub Models est pratique pour des essais rapides, puisque l’authentification par PAT évite toute inscription distincte. En revanche, les plafonds stricts de jetons et de requêtes le réservent au prototypage.

Cloudflare Workers AI

Workers AI de Cloudflare attribue à chaque compte 10 000 Neurons par jour, réinitialisés à 00:00 UTC. Avec Llama 3.1 8B Fast, cela correspond à environ 280 000 jetons de sortie quotidiens. Cloudflare héberge aussi FLUX pour générer des images gratuitement : c’est la principale option d’image de cette liste sans carte bancaire.

Sa position sur la confidentialité est la plus ferme de tous les fournisseurs recensés ici : Cloudflare s’engage explicitement à ne pas utiliser les prompts ni les sorties des clients pour l’entraînement ou l’amélioration du service sans consentement. Workers AI est donc notre première recommandation pour les charges de travail impliquant des données sensibles.

L’unité Neurons est moins intuitive qu’un simple décompte de requêtes ou de jetons. Il faut consulter le tableau de bord Workers AI pour connaître la quantité de Neurons consommée par jeton pour un modèle donné.

Cohere, NVIDIA, Hugging Face et Mistral

Cohere accorde 20 requêtes par minute et 1 000 appels API par mois dans son offre gratuite. Ce plafond convient à l’évaluation et aux tests, pas à un volume opérationnel. Les modèles Command de Cohere et les endpoints d’embeddings sont inclus.

NVIDIA NIM fournit 1 000 crédits à l’inscription, jusqu’à 5 000 avec une adresse e-mail professionnelle. Il s’agit de crédits consommables uniques, et non d’une allocation mensuelle récurrente ; aucun taux officiel de conversion entre crédits et requêtes n’est publié. Les modèles NVIDIA gratuits sur OpenRouter s’accompagnent d’un avertissement : l’usage des endpoints gratuits est journalisé et l’entreprise déconseille d’y soumettre des données confidentielles ou personnelles.

Hugging Face offre environ $0.10 par mois de crédits d’inférence gratuits sur plus de 200 modèles via sa Serverless Inference API. L’allocation est explicitement indiquée comme susceptible de changer. C’est un niveau adapté aux démonstrations : suffisant pour essayer un modèle, pas pour construire un service dessus.

Mistral propose un mode de clé API gratuit dont les limites ne sont visibles que dans l’Admin Panel. L’option de rétention nulle apparaît dans la documentation de Mistral, sans être présentée comme une règle claire par défaut de l’offre gratuite ; son évaluation pour des usages sensibles est donc plus difficile.

Au-delà du texte : image, parole et embeddings

Deux fournisseurs couvrent des modalités autres que le texte :

  • Cloudflare Workers AI héberge FLUX pour la génération d’images sans frais : c’est la seule option de cette liste sans carte bancaire. Les modèles d’image Gemini ne sont pas accessibles dans l’offre gratuite.
  • Groq Whisper assure la transcription parole-texte avec 2 000 requêtes par jour et 28 800 secondes audio par jour dans l’offre gratuite.

Le catalogue gratuit d’OpenRouter s’est également enrichi de modèles d’embeddings et de reranking de NVIDIA, apportant des capacités de recherche et de RAG à l’offre gratuite.

Pour les données sensibles, la sélection tombe à deux

Pour traiter des données sensibles, propriétaires ou réglementées, la plupart des fournisseurs de cette liste doivent être écartés :

  • Google AI Studio utilise les prompts de l’offre gratuite pour entraîner ses produits.
  • NVIDIA journalise l’usage de ses endpoints gratuits et déconseille l’envoi de données confidentielles.
  • OpenRouter applique aux modèles gratuits la politique du fournisseur amont ; certains, comme Poolside et Liquid, entraînent explicitement leurs modèles sur les prompts gratuits.
  • Hugging Face et Mistral ont des conditions de rétention opaques ou modifiables.

Il reste donc deux fournisseurs avec des engagements de confidentialité clairs et explicites :

  1. Cloudflare Workers AI — engagement explicite de ne pas entraîner les modèles ni améliorer le service sans consentement.
  2. Groq — aucune conservation de l’inférence par défaut ; option Zero Data Retention disponible.

Pour une charge de travail sensible avec un volume faible à modéré, Cloudflare est le choix le plus sûr. Si vous avez besoin d’un débit supérieur et pouvez composer avec les plafonds de jetons par minute de Groq, Groq avec ZDR constitue l’alternative.

Quand l’offre gratuite ne suffit plus

Toutes les offres gratuites de cette liste finiront par vous limiter. La vraie question est la marche à suivre à ce moment-là.

La recommandation est de passer à une facturation à l’usage chez un seul fournisseur, plutôt que de naviguer entre plusieurs offres gratuites. Jongler entre les fournisseurs pour contourner les limites de débit ajoute une complexité opérationnelle — SDK, politiques de données et modes de défaillance différents — qui coûte généralement plus cher en temps d’ingénierie que les économies réalisées sur l’API.

Quatre fournisseurs cités plus haut proposent des endpoints compatibles OpenAI : Groq, OpenRouter, Cloudflare Workers AI et Google AI Studio, via son wrapper compatible OpenAI. Vous pouvez donc passer du gratuit au payant chez l’un d’eux en modifiant l’URL de base et la clé API, sans réécrire le code de l’application.

Le parcours le plus pragmatique : commencez gratuitement sur Google AI Studio pour la variété des modèles, ou sur Groq pour le débit. Lorsque vous atteignez régulièrement les plafonds quotidiens, ajoutez un compte de facturation chez ce même fournisseur et passez à la tarification à l’usage. Gardez OpenRouter pour les tests multi-modèles et choisissez Cloudflare quand la confidentialité des données n’est pas négociable.

FAQ

Quelle API d’IA gratuite ne demande pas de carte bancaire ? Les neuf fournisseurs listés ci-dessus délivrent des clés API sans carte bancaire : Google AI Studio, Groq, OpenRouter, GitHub Models, Cloudflare Workers AI, Cohere, NVIDIA, Hugging Face et Mistral.

Quelle API gratuite offre le plus grand nombre de requêtes quotidiennes ? Groq propose 14 400 requêtes par jour sur Llama 3.1 8B Instant : c’est le plus haut volume de requêtes récurrent gratuit parmi les fournisseurs présentés ici.

OpenRouter est-il vraiment gratuit ? Les variantes de modèles :free d’OpenRouter ne coûtent rien par jeton, mais sont limitées à 50 requêtes par jour, ou 1 000 après un achat de $10 de crédits. Le mode BYOK permet de router les appels via vos propres clés fournisseur, avec une allocation gratuite qui dépend du plan. Aucun de ces mécanismes n’est réellement illimité.

Puis-je utiliser une API d’IA gratuite en production ? Oui, dans les limites de débit prévues. Groq et Cloudflare sont les offres gratuites les plus adaptées à la production pour leurs atouts respectifs, le débit et la confidentialité. Dès que les plafonds gratuits interrompent régulièrement votre charge de travail, passez à l’offre payante du même fournisseur.

Quelle API gratuite convient le mieux aux données sensibles ? Cloudflare Workers AI et Groq sont les seuls fournisseurs à formuler des engagements explicites de non-entraînement et de non-rétention dans leurs offres gratuites. Les autres entraînent leurs produits à partir des prompts gratuits, comme Google, journalisent l’usage, comme NVIDIA, ou appliquent des politiques dépendantes du fournisseur, comme OpenRouter.

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

Gemini 3.6 Flash

Chat

Un modèle Gemini rapide pour le raisonnement avancé, le codage et les tâches agentiques.

GoogleCréer une API Key >

Gemini 2.5 Pro

Chat
GoogleCréer une API Key >

Gemini 3 Pro

Chat
GoogleCréer une API Key >

Claude Fable 5

Chat

Un modèle Claude premium pour le raisonnement approfondi et le travail long et complexe.

AnthropicCréer une API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCréer une API Key >

Articles récents

Clé API LLM gratuite : 8 façons de s’inscrire et leurs limites (2026)

2026-09-13

Suno v6 vs v6-wild vs v6-mini : quel modèle selon le genre et le workflow ?

2026-09-12

Suno v6, usage commercial et droit d’auteur : les risques qui subsistent pour les créateurs

2026-09-12

Test de Suno v6 : mise à niveau ou migration forcée ? (2026)

2026-09-12
AIREITER

Des questions ? Contactez-nous à
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vidéo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Image IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.