En juillet 2026, les API LLM les moins coûteuses facturent moins d’un dixième de centime par million de tokens en entrée. Llama 3.1 8B Instant de Groq est affiché à 0,05 $ par million de tokens en entrée et 0,08 $ par million de tokens en sortie, un tarif confirmé ce mois-ci sur la page de prix du fournisseur.
Mais ce prix d’appel ne correspond pas forcément à votre facture. Le cache de prompts peut diviser par 50 à 120 le prix effectif des entrées chez DeepSeek, tandis que les API batch retirent encore 50 % chez Gemini, Mistral et Groq. Comparer uniquement les tarifs catalogue, c’est risquer de surpayer ou de choisir le mauvais fournisseur pour sa charge de travail. Voici le coût réel des options bon marché, avec chaque chiffre vérifié sur la page tarifaire du fournisseur le 30 juillet 2026, et le meilleur choix selon le besoin.
Les API LLM les moins chères du moment (prix vérifiés en juillet 2026)
Les API LLM les plus abordables ne sont pas les endpoints vedettes des laboratoires de pointe, mais de petits modèles ou des modèles optimisés pour l’efficacité, servis par des spécialistes de l’inférence. Les prix ci-dessous correspondent à la tarification standard à la demande des principaux fournisseurs directs ; la colonne dédiée indique lorsqu’une offre gratuite existe. L’auto-hébergement et les promotions temporaires ne sont pas inclus.
| Modèle (fournisseur) | Entrée / 1 M | Sortie / 1 M | Entrée depuis le cache | Offre gratuite | Le moins cher pour |
|---|---|---|---|---|---|
| Llama 3.1 8B Instant (Groq) | 0,05 $ | 0,08 $ | 0,025 $ | Oui | Le tarif standard le plus bas |
| GPT-OSS 20B (Groq) | 0,075 $ | 0,30 $ | 0,0375 $ | Oui | Économique, 1000 tok/s |
| Gemini 2.5 Flash-Lite (Google) | 0,10 $ | 0,40 $ | — | Oui | Le moins cher en batch (0,05 $ en entrée) |
| Ministral 3B (Mistral) | 0,10 $ | 0,10 $ | — | Leanstral (limité) | Tarif micro fixe |
| DeepSeek V4 Flash (DeepSeek) | 0,14 $ | 0,28 $ | 0,0028 $ | Non | Le moins cher pour le raisonnement |
| Mistral Small 4 (Mistral) | 0,15 $ | 0,60 $ | −90 % | Non | Usage général équilibré |
| Gemini 3.5 Flash-Lite (Google) | 0,30 $ | 2,50 $ | — | Oui | Multimodal à grande échelle |
Le plancher est atteint par Llama 3.1 8B de Groq, à 0,05 $/0,08 $ : aucun autre modèle de ce tableau n’égale son prix en sortie. Gemini 2.5 Flash-Lite atteint bien 0,05 $ en entrée, mais uniquement sur son offre batch distincte ; le tarif standard est de 0,10 $. Pour le raisonnement à bas coût, DeepSeek V4 Flash est le choix à privilégier.
Pourquoi ces modèles coûtent moins cher que GPT ou Claude
Ces tarifs bas s’expliquent par trois facteurs : des modèles de petite taille ou conçus pour l’efficience, comme Llama 3.1 8B, Ministral 3B et la gamme Flash-Lite ; des spécialistes de l’inférence qui exploitent une infrastructure moins coûteuse, tels que Groq et DeepSeek ; enfin, des prix réduits pour le batch et les tokens mis en cache. La plupart des modèles listés sont open-weight — Llama, DeepSeek et Mistral. Gemini Flash-Lite est la gamme propriétaire de Google, agressivement tarifée pour capter les gros volumes. L’auto-hébergement de modèles open-weight peut coûter moins cher à volume très élevé et stable, mais il faut alors absorber les coûts matériels et opérationnels. Pour la majorité des équipes, les API hébergées restent donc la référence.
Les offres gratuites : le vrai prix plancher
Si « le moins cher » signifie gratuit, plusieurs fournisseurs de cette sélection proposent une option sans frais : Groq et les familles Gemini Flash-Lite de Google sont gratuites dans certaines limites de débit, Mistral propose Leanstral gratuitement pendant une période limitée, et GitHub Models fournit un accès gratuit avec un token. Les requêtes du palier gratuit de Google servent à l’entraînement des produits, contrairement aux requêtes payantes. Les limites de débit restent strictes dans tous les cas et aucune offre ne comporte de SLA. Nous avons regroupé ces options gratuites dans notre guide des API IA gratuites ; dès qu’on dépasse le prototypage, ce sont les lignes payantes ci-dessus qui comptent.
Le piège du prix au token : cache et batch font chuter la facture réelle
Classer les modèles selon leur prix catalogue en entrée masque une grande partie de la réalité. Trois leviers peuvent faire varier le prix effectif de plusieurs ordres de grandeur, et les grilles tarifaires les passent souvent sous silence ou les relèguent au second plan.
« La grande tromperie des bas prix dans les API LLM. » — un fil r/LocalLLaMA expliquant comment le prix affiché d’un modèle masquait une facture dominée par les frais de lecture du cache.
Les fournisseurs facturent séparément les entrées mises en cache, les nouvelles entrées et les sorties. Or, la ligne d’entrée qui paraît avantageuse est souvent la plus petite part de la facture. Voici les trois éléments à comparer :
- Le cache de prompts. Lorsqu’un fournisseur peut réutiliser un préfixe déjà envoyé, la portion mise en cache ne coûte plus qu’une fraction du prix d’entrée. Pour V4 Flash, DeepSeek facture 0,0028 $ par million de tokens en cache, contre 0,14 $ pour des tokens nouveaux : une réduction de 50×. Sur V4 Pro, c’est 0,0036 $ contre 0,435 $, soit 120× moins. Groq divise par deux le coût des entrées en cache, Mistral le réduit de 90 %. Si vos prompts partagent un long prompt système ou le préfixe d’un document et que votre fournisseur ne gère pas bien le cache, vous paierez le plein tarif à chaque requête.
- L’API batch. Google, Mistral et Groq accordent tous environ 50 % de réduction pour les tâches non temps réel traitées dans une fenêtre de 24 heures à 7 jours. L’offre batch de Gemini 2.5 Flash-Lite abaisse le prix d’entrée à 0,05 $. Tout ce qui n’exige pas une réponse en moins d’une seconde — résumés nocturnes, classification en masse, annotation de jeux de données — devrait passer par le batch.
- Les charges dominées par la sortie. La génération de code, la rédaction longue et les boucles agentiques produisent beaucoup plus de tokens qu’elles n’en lisent. Les 0,08 $ en sortie de Llama 3.1 8B battent les 0,40 $ de Gemini 2.5 Flash-Lite pour ces usages, malgré un coût d’entrée proche. Lorsque la génération est le facteur limitant, triez les modèles selon leur prix de sortie, pas leur prix d’entrée.
Avant de choisir un fournisseur sur son prix catalogue, posez-vous trois questions : vos prompts se prêtent-ils au cache ? Le traitement doit-il être temps réel ? Produisez-vous davantage de tokens que vous n’en lisez ? Ces réponses réorganisent plus souvent le tableau ci-dessus que les tarifs affichés.
Quel modèle choisir selon l’usage
Ces recommandations supposent un niveau de capacité minimal supérieur à celui des plus petits modèles ; à prix brut uniquement, Llama 3.1 8B figurerait dans chaque ligne. Elles mettent en balance le coût réel — cache et batch inclus quand ils s’appliquent — avec ce niveau d’exigence.
| Cas d’usage | Choix le moins cher | Pourquoi |
|---|---|---|
| Chat généraliste / classification | Mistral Small 4 | Modèle généraliste de taille intermédiaire, au-dessus du seuil 3B/8B ; 0,15 $/0,60 $ |
| Code et boucles agentiques | Groq GPT-OSS 20B ou Llama 3.1 8B | Sortie sous 0,08 $, avec 840–1000 tok/s pour garder des boucles rapides |
| Raisonnement / prompts difficiles | DeepSeek V4 Flash | 0,14 $/0,28 $, optimisé pour le raisonnement ; exploitation intensive du cache |
| Documents à long contexte | Gemini 3.5 Flash-Lite | Grande fenêtre de contexte, offre gratuite pour tester |
| Temps réel / contrainte de latence | Groq (n’importe quel modèle) | Fournisseur économique qui domine aussi en débit, avec 840–1000 tok/s |
| Traitements massifs / nocturnes | Gemini 2.5 Flash-Lite (batch) | 0,05 $ en entrée batch, 50 % de réduction pour l’asynchrone |
Agrégateur ou accès direct : à quel moment un revendeur coûte vraiment moins cher
Passer directement par DeepSeek, Google, Groq ou Mistral donne accès au prix par token le plus bas pour un modèle donné. En contrepartie, le coût est opérationnel : clés API distinctes, facturation séparée, basculement manuel lorsqu’un fournisseur impose une limite de débit, et logique de cache ou de retry à réimplémenter pour quatre SDK différents.
C’est précisément ce que vendent les agrégateurs. OpenRouter facture le prix du fournisseur sous-jacent, auquel s’ajoute une commission de plateforme de 5,5 % sans marge supplémentaire. En échange, vous obtenez une seule clé, une seule facture et un basculement automatique entre les modèles de cette liste. Selon l’analyse d’OpenRouter, le point de bascule se situe autour de 50 $/mois : en dessous, les 5,5 % coûtent moins que le temps d’ingénierie nécessaire à l’intégration de plusieurs fournisseurs ; au-dessus, passer directement par le fournisseur le moins cher l’emporte généralement sur le coût brut. Votre véritable seuil dépend du nombre de fournisseurs que vous auriez autrement intégrés et de la volatilité de votre trafic.
Le même principe s’applique à une passerelle revendeuse telle qu’AIReiter : un endpoint compatible OpenAI devant DeepSeek, Gemini, Groq et Mistral. Il suffit alors de changer le nom du modèle, plutôt que de réécrire le client.
FAQ
Quelle est l’API LLM la moins chère ?
Llama 3.1 8B Instant de Groq, à 0,05 $/0,08 $ par million de tokens, affiche le tarif standard à la demande le plus bas de cette comparaison en juillet 2026. Gemini 2.5 Flash-Lite égale les 0,05 $ en entrée uniquement sur son offre batch, contre 0,10 $ au tarif standard.
Quelle est l’API LLM la moins chère pour coder ?
Les GPT-OSS 20B de Groq (0,075 $/0,30 $) et Llama 3.1 8B (0,05 $/0,08 $) l’emportent pour la génération de code et les boucles agentiques grâce à leur prix en sortie et à leur vitesse. Devstral Small 2 de Mistral, à 0,10 $/0,30 $, est l’option économique si vous avez besoin d’un modèle optimisé pour le code en dehors de Groq.
Une offre gratuite d’API LLM suffit-elle pour la production ?
En général, non. Les offres gratuites de Groq, Gemini Flash-Lite et GitHub Models limitent le nombre de requêtes par minute et ne garantissent pas la disponibilité. Elles conviennent au prototypage. Au-delà des premiers tests, mieux vaut passer aux offres payantes du tableau ci-dessus.
Les API d’agrégateurs ou de revendeurs sont-elles plus coûteuses qu’un accès direct ?
Par token, oui, légèrement. OpenRouter ajoute 5,5 % au prix du fournisseur, et les passerelles de revendeurs intègrent des frais comparables. Elles reviennent toutefois moins cher au total lorsque vos dépenses sont faibles ou que vous devriez autrement maintenir plusieurs intégrations fournisseurs ; elles deviennent plus coûteuses dès que leurs frais dépassent le gain de simplicité.
Combien coûte par mois l’API LLM la moins chère ?
Pour 10 millions de tokens en entrée et 5 millions en sortie par mois, Llama 3.1 8B de Groq coûte environ 0,90 $ : 0,50 $ pour les entrées et 0,40 $ pour les sorties. Gemini 2.5 Flash-Lite revient à environ 3,00 $ aux tarifs standard, ou 1,50 $ en batch. Le même volume sur un modèle propriétaire de pointe, à 5 $+/M tokens en entrée, coûte plusieurs fois plus cher.
Que choisir ?
Activez le cache de prompts partout où le fournisseur le permet, et envoyez les traitements non temps réel vers le batch. Ces deux réglages font économiser davantage qu’un changement de fournisseur.
