AIREITER

Image IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Plus

Vidéo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Plus

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Plus
BientôtSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
DOCS APITARIFS
BlogMises à jourLLM API GuideClaude API GuideKimi K3 API Guide
MODÈLES
  • AIReiter
  • Blog
  • Baisse de prix de GPT-5.6 : ce que coûtent vraiment Luna et Terra désormais

Baisse de prix de GPT-5.6 : ce que coûtent vraiment Luna et Terra désormais

Dernière mise à jour: 2026-07-31 11:00:37

Le 30 juillet 2026, OpenAI a baissé de 80 % le prix de GPT-5.6 Luna et de 20 % celui de Terra. Sol n'a pas changé de tarif standard. Mais pour les agents à plusieurs tours, la facturation des écritures de cache peut absorber l'essentiel de cette réduction avant même qu'elle n'apparaisse sur votre facture.

Ce qui a changé le 30 juillet 2026

Les nouveaux tarifs sont entrés en vigueur le 30 juillet 2026 et concernent les identifiants de modèles existants. OpenAI explique avoir réduit ces deux prix après avoir amélioré l'efficacité des systèmes qui les servent. Le tarif standard de GPT-5.6 Sol, lui, reste inchangé.

ModèleID du modèleEntrée avantEntrée maintenantSortie avantSortie maintenant
GPT-5.6 Lunagpt-5.6-luna$1.00$0.20$6.00$1.20
GPT-5.6 Terragpt-5.6-terra$2.50$2.00$15.00$12.00
GPT-5.6 Solgpt-5.6-sol$5.00$5.00$30.00$30.00

Tarifs par million de tokens, offre standard et contexte court, d'après la documentation tarifaire de l'API OpenAI (vérifiée le 2026-07-31).

Tableau tarifaire de l'API OpenAI affichant les tarifs par million de tokens de gpt-5.6-sol, gpt-5.6-terra et gpt-5.6-luna

Dire que « la gamme GPT-5.6 coûte moins cher » n'est donc vrai qu'aux deux tiers. OpenAI a aussi ajouté un mode Fast pour Sol, facturé $10.00 en entrée et $60.00 en sortie : soit le double du tarif standard, en échange d'un débit pouvant atteindre 2.5× celui-ci, sans modification du modèle sous-jacent. La documentation précise que Fast mode correspond à la fonctionnalité auparavant appelée priority processing. Le même jour, les deux offres les moins chères ont baissé, tandis que l'offre phare gagnait une option plus coûteuse.

Graphique à barres groupées comparant le prix cumulé entrée plus sortie de GPT-5.6 par million de tokens avant et après le 30 juillet

Utilisez l'identifiant complet du modèle plutôt que le seul nom de série. Le catalogue de modèles d'OpenAI indique que gpt-5.6 est un alias de gpt-5.6-sol. En routant vers ce nom court dans l'espoir d'obtenir l'offre économique, vous serez donc facturé au tarif du modèle phare. Certains revendeurs ne proposent même pas cet alias : sur l'endpoint d'AIReiter, gpt-5.6 renvoie Model 'gpt-5.6' not found (testé le 2026-07-31).

Chez les développeurs, la discussion porte moins sur l'ampleur de la baisse que sur sa pérennité :

There's no way OpenAI's 5.6 models actually cost that little to run — titre d'un fil r/Anthropic

Luna devient moins cher que GPT-5.4 nano : quel niveau choisir ?

Avec $0.20 en entrée et $1.20 en sortie, GPT-5.6 Luna coûte désormais moins cher par token de sortie que gpt-5.4-nano ($0.20 / $1.25), et bien moins que gpt-5.4-mini ($0.75 / $4.50). Si vous conserviez des appels nano ou mini plus anciens uniquement pour des raisons de coût, cet argument ne tient plus.

Pour vérifier ce que vaut réellement l'offre économique, j'ai testé les trois modèles GPT-5.6 via l'endpoint compatible OpenAI d'AIReiter le 2026-07-31, sur deux tâches : l'extraction d'un ticket de support en JSON avec un schéma strict, puis un problème de calcul de facturation par tokens avec une seule réponse correcte ($23.71). Deux exécutions par test, max_tokens: 4000, sans nouvelle tentative ; validation binaire par rapport au résultat attendu.

TâcheModèleTokens d'entréeTokens de sortieLatence (exécution 1 / exécution 2)Correct
Ticket → JSONLuna13577–784.0s / 3.5sOui
Terra135462.1s / 2.1sOui
Sol135462.3s / 2.2sOui
Calcul de facturationLuna119111–1223.1s / 4.3sOui
Terra11987–893.8s / 2.8sOui
Sol4,48884–873.5s / 3.2sOui

Deux observations méritent d'être soulignées.

Luna a été le plus lent des trois modèles sur l'extraction, et non le plus rapide : 3.5–4.0s, contre 2.1s pour Terra. L'offre la moins chère n'est pas automatiquement celle qui minimise la latence.

Sol a déclaré 4,488 tokens d'entrée pour un prompt que Terra et Luna comptaient tous deux à 119 tokens, dont 3,840 signalés comme cached_tokens. Le résultat s'est reproduit à l'identique lors des deux exécutions. Avec un prompt trivial (« Reply with only the word OK. »), les trois modèles ont tous déclaré 24 tokens. Le gonflement semble donc lié au prompt, pas au modèle. J'observe les décomptes, pas leur cause : considérez cela comme un comportement de facturation mesuré sur un endpoint, non comme une propriété documentée du modèle.

Au tarif standard officiel, cette même réponse correcte a coûté :

Graphique à barres du coût mesuré pour 1 000 exécutions sur la même tâche avec Luna, Terra et Sol

Pour 1 000 exécutions : Luna $0.16, Terra $1.29, Sol $7.73. Pour retourner le même nombre à trois chiffres, Sol a facturé environ 6× le coût de Terra et 47× celui de Luna.

Il s'agit d'un échantillon réduit — deux exécutions sur deux tâches simples — et non d'un benchmark ; il ne mesure pas non plus la qualité de raisonnement. Une règle s'en dégage toutefois : commencez avec Luna, puis montez en gamme uniquement lorsque vos propres requêtes révèlent des échecs mesurables. Dans ces tests, payer Sol alors que Terra répondait déjà correctement n'apportait rien. La répartition complète des usages figure dans le tableau final.

Pourquoi une baisse de 80 % ne réduit pas forcément la facture de 80 %

Le tarif affiché s'applique aux tokens d'entrée frais et aux tokens de sortie. Or, le trafic d'agents multi-tours est souvent dominé par un troisième poste, les écritures de cache. Pour les trois niveaux GPT-5.6, une écriture de cache coûte 12.5× plus qu'une lecture de cache.

ModèleEntrée mise en cache (lecture)Écriture de cacheRatio
GPT-5.6 Luna$0.02$0.2512.5×
GPT-5.6 Terra$0.20$2.5012.5×
GPT-5.6 Sol$0.50$6.2512.5×

Un test contrôlé publié le 2026-07-11 sur la communauté de développeurs OpenAI illustre l'enjeu. Sur six tours séquentiels de l'API Responses chaînés via previous_response_id, Luna a consommé 3 % de tokens d'entrée en moins et 29 % de tokens de sortie en moins que gpt-5.4-mini, tout en coûtant 96 % de plus ($0.0651 contre $0.0332 par conversation). Environ 70 % des entrées de Luna étaient facturées comme des écritures de cache. Ces chiffres sont antérieurs à la baisse de prix, mais le mécanisme reste le même.

Dans cette implémentation, la cause pouvait être corrigée — et c'est le point utile. Le cache de GPT-5.6 ne valorise pas les correspondances partielles : la moindre modification du préfixe mis en cache impose une réécriture complète. L'auteur reconstruisait un instantané croissant de la conversation dans instructions, ce qui invalidait le préfixe à chaque tour.

Le constat est net : avec des instructions stables, le cache a été utilisé lors de 15 des 15 tours utilisateur suivants ; avec des instructions variables, lors de 0 sur 15. En déplaçant ce contexte dans un élément d'entrée développeur, le surcoût de Luna est passé de 96 % à 16.7 %. Luna est alors devenu plus rapide et a obtenu une meilleure note que mini lors de l'évaluation en aveugle de l'auteur. Ni prompt_cache_key ni les points d'arrêt explicites du cache n'ont aidé.

Avant de conclure que la baisse vous a bien été appliquée, faites deux vérifications :

  1. Ne placez aucune donnée variable dans le préfixe mis en cache. Le texte système, les définitions d'outils et la persona doivent venir en premier et rester strictement identiques octet pour octet ; l'état de la conversation doit être placé dans les éléments d'entrée.
  2. Récupérez le détail d'usage renvoyé par l'API. Le rapport entre usage.prompt_tokens_details.cached_tokens et usage.prompt_tokens indique la part lue depuis le cache à chaque appel. Sur un agent qui tourne longtemps, un ratio bas est le bug de coût le plus rentable à corriger dans cette gamme.

Trois prix GPT-5.6 circulent : lequel vous concerne ?

Une recherche sur le prix de GPT-5.6 Luna renvoie au moins trois montants différents. Chacun correspond, ou correspondait, à une offre donnée. Vérifier l'offre associée à un prix permet de lever la plupart des contradictions.

Prix rencontréEntrée / sortie LunaÀ quoi il correspond
$0.20 / $1.20Offre standard, contexte courtLe tarif par défaut d'un appel API classique
$0.10 / $0.60Offres Batch et FlexExactement la moitié du standard, pour les travaux asynchrones et moins prioritaires
$0.40 / $2.40Mode FastDeux fois le tarif standard
$1.00 / $6.00Tarif standard avant le 30 juilletValable jusqu'à la baisse

Deux autres modificateurs figurent dans la même documentation tarifaire : le contexte long est facturé à 2× le tarif d'entrée en contexte court et à 1.5× le tarif de sortie — la ligne longue de Luna est donc à $0.40 / $1.80, pas $0.40 / $2.40. La documentation mentionne aussi une majoration de 10 % pour les endpoints admissibles de résidence des données sur les modèles sortis à partir du 2026-03-05, ce qui couvre l'ensemble de GPT-5.6.

Lorsqu'une page tarifaire ne correspond pas à votre facture, deux contrôles permettent de trancher : vérifiez la date de validation indiquée sur la page, puis rapprochez-la de la documentation tarifaire officielle correspondant précisément à l'offre que vous appelez. Les agrégateurs et revendeurs publient également leurs propres tarifs : il s'agit d'une troisième catégorie, pas nécessairement de données obsolètes, mais de prix différents.

Chez AIReiter, les trois niveaux GPT-5.6 sont facturés à 50 % du prix catalogue d'OpenAI, et ce positionnement a suivi la baisse du 30 juillet : GPT-5.6 Luna coûte $0.10 / $0.60, Terra $1.00 / $6.00 et Sol $2.50 / $15.00. La même réduction de moitié s'applique aux entrées mises en cache et aux écritures de cache.

Tableau de prix AIReiter comparant les tarifs officiels de l'API GPT-5.6 avec les tarifs AIReiter pour Luna, Terra et Sol

Pour un agent Terra traitant chaque jour 1M de tokens d'entrée et 200K de tokens de sortie, cela représente $4.40 par jour au tarif catalogue, contre $2.20 : même appel, même identifiant de modèle.

La place de Luna sur le marché est une autre question. Dans la comparaison de 30 modèles publiée par VentureBeat le 30 juillet, le tarif combiné de Luna à $1.40 est inférieur à celui de Gemini 3.5 Flash-Lite ($2.80) et de Gemini 3.1 Flash-Lite ($1.75), mais reste au-dessus de DeepSeek v4-flash ($0.42). Si le coût est votre seul critère, les API LLM les moins chères ne sont pas proposées par OpenAI.

Questions fréquentes

GPT-5.6 Sol a-t-il lui aussi baissé ?

Non. Le tarif standard de Sol reste à $5.00 en entrée et $30.00 en sortie par million de tokens. Il a gagné un mode Fast, facturé deux fois plus cher, pour un débit pouvant aller jusqu'à 2.5×.

GPT-5.6 Luna est-il désormais le modèle API le moins cher ?

Non. À $1.40 par million de tokens combinés, il figure parmi les modèles des séries frontier les moins chers, mais le tableau de VentureBeat du 30 juillet place DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash de Xiaomi ($0.40) et DeepSeek v4-pro ($1.305) en dessous.

Pourquoi certaines pages affichent-elles $1 / $6 pour GPT-5.6 Luna ?

Il s'agissait du tarif standard avant le 30 juillet 2026. Vérifiez la date de validation affichée par la page, puis confirmez le prix dans la documentation officielle pour l'offre que vous utilisez.

La baisse s'applique-t-elle aux offres Batch et Flex ?

Oui. Batch et Flex sont fixées à la moitié du tarif standard : Luna y coûte donc $0.10 / $0.60 et Terra $1.00 / $6.00, y compris pour les entrées mises en cache et les écritures de cache.

Dois-je modifier mon code pour profiter du nouveau tarif ?

Non. La baisse s'applique sans migration aux identifiants existants gpt-5.6-luna et gpt-5.6-terra. La modification qui mérite vraiment votre attention est l'audit de votre ratio de lectures de cache : c'est là que la réduction se perd le plus souvent.

Quel niveau choisir selon la charge de travail ?

Charge de travailNiveauPourquoi
Extraction, catégorisation et résumé à fort volumeLunaA réussi les deux tâches testées ; $1.40 combiné par 1M, désormais sous gpt-5.4-nano
Appels orientés utilisateur sensibles à la latenceTerraMesuré plus rapide que Luna en extraction (2.1s contre 3.5–4.0s)
Première montée en gamme lorsque Luna ne passe pas le seuil de qualitéTerra$14 combiné, contre $35 pour Sol
Tâches où Terra sous-performe de façon mesurable sur votre traficSolSeule justification à un coût mesuré par tâche 6× supérieur à Terra
Agents multi-tours, quel que soit le niveauCorriger le cache d'abordLes écritures de cache coûtent 12.5× les lectures ; un mauvais préfixe pèse davantage que le choix du niveau

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

GPT-5.6 Luna

Chat

Un modèle texte GPT-5.6 équilibré pour le codage, l’écriture et les workflows d’agent au quotidien.

OpenAICréer une API Key >

GPT-5.6 Terra

Chat

Un modèle texte GPT-5.6 plus puissant pour les tâches de codage et d’analyse nécessitant un raisonnement poussé.

OpenAICréer une API Key >

GPT-5.6 Sol

Chat

Un modèle de texte GPT-5.6 haut de gamme pour le codage exigeant, le raisonnement et les travaux d’agent au long cours.

OpenAICréer une API Key >

Gemini 3.1 Pro

Chat
GoogleCréer une API Key >

Gemini 3 Pro

Chat
GoogleCréer une API Key >

Articles récents

Clé API invalide : diagnostiquer les 401 et 403 avant de corriger

2026-07-31

Corriger une erreur 429 OpenRouter : fournisseur ou limite de débit ?

2026-07-31

DeepSeek V4 Flash vs GLM-5.2 : test après la mise à jour 0731

2026-07-31

L’intelligence publicitaire B2B passe par le HTML : concevoir un parseur qui résiste aux refontes

2026-07-31
AIREITER

Des questions ? Contactez-nous à
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

Vidéo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

Image IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.