Le 30 juillet 2026, OpenAI a baissé de 80 % le prix de GPT-5.6 Luna et de 20 % celui de Terra. Sol n'a pas changé de tarif standard. Mais pour les agents à plusieurs tours, la facturation des écritures de cache peut absorber l'essentiel de cette réduction avant même qu'elle n'apparaisse sur votre facture.
Ce qui a changé le 30 juillet 2026
Les nouveaux tarifs sont entrés en vigueur le 30 juillet 2026 et concernent les identifiants de modèles existants. OpenAI explique avoir réduit ces deux prix après avoir amélioré l'efficacité des systèmes qui les servent. Le tarif standard de GPT-5.6 Sol, lui, reste inchangé.
| Modèle | ID du modèle | Entrée avant | Entrée maintenant | Sortie avant | Sortie maintenant |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
Tarifs par million de tokens, offre standard et contexte court, d'après la documentation tarifaire de l'API OpenAI (vérifiée le 2026-07-31).
Dire que « la gamme GPT-5.6 coûte moins cher » n'est donc vrai qu'aux deux tiers. OpenAI a aussi ajouté un mode Fast pour Sol, facturé $10.00 en entrée et $60.00 en sortie : soit le double du tarif standard, en échange d'un débit pouvant atteindre 2.5× celui-ci, sans modification du modèle sous-jacent. La documentation précise que Fast mode correspond à la fonctionnalité auparavant appelée priority processing. Le même jour, les deux offres les moins chères ont baissé, tandis que l'offre phare gagnait une option plus coûteuse.
Utilisez l'identifiant complet du modèle plutôt que le seul nom de série. Le catalogue de modèles d'OpenAI indique que gpt-5.6 est un alias de gpt-5.6-sol. En routant vers ce nom court dans l'espoir d'obtenir l'offre économique, vous serez donc facturé au tarif du modèle phare. Certains revendeurs ne proposent même pas cet alias : sur l'endpoint d'AIReiter, gpt-5.6 renvoie Model 'gpt-5.6' not found (testé le 2026-07-31).
Chez les développeurs, la discussion porte moins sur l'ampleur de la baisse que sur sa pérennité :
There's no way OpenAI's 5.6 models actually cost that little to run — titre d'un fil r/Anthropic
Luna devient moins cher que GPT-5.4 nano : quel niveau choisir ?
Avec $0.20 en entrée et $1.20 en sortie, GPT-5.6 Luna coûte désormais moins cher par token de sortie que gpt-5.4-nano ($0.20 / $1.25), et bien moins que gpt-5.4-mini ($0.75 / $4.50). Si vous conserviez des appels nano ou mini plus anciens uniquement pour des raisons de coût, cet argument ne tient plus.
Pour vérifier ce que vaut réellement l'offre économique, j'ai testé les trois modèles GPT-5.6 via l'endpoint compatible OpenAI d'AIReiter le 2026-07-31, sur deux tâches : l'extraction d'un ticket de support en JSON avec un schéma strict, puis un problème de calcul de facturation par tokens avec une seule réponse correcte ($23.71). Deux exécutions par test, max_tokens: 4000, sans nouvelle tentative ; validation binaire par rapport au résultat attendu.
| Tâche | Modèle | Tokens d'entrée | Tokens de sortie | Latence (exécution 1 / exécution 2) | Correct |
|---|---|---|---|---|---|
| Ticket → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | Oui |
| Terra | 135 | 46 | 2.1s / 2.1s | Oui | |
| Sol | 135 | 46 | 2.3s / 2.2s | Oui | |
| Calcul de facturation | Luna | 119 | 111–122 | 3.1s / 4.3s | Oui |
| Terra | 119 | 87–89 | 3.8s / 2.8s | Oui | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | Oui |
Deux observations méritent d'être soulignées.
Luna a été le plus lent des trois modèles sur l'extraction, et non le plus rapide : 3.5–4.0s, contre 2.1s pour Terra. L'offre la moins chère n'est pas automatiquement celle qui minimise la latence.
Sol a déclaré 4,488 tokens d'entrée pour un prompt que Terra et Luna comptaient tous deux à 119 tokens, dont 3,840 signalés comme cached_tokens. Le résultat s'est reproduit à l'identique lors des deux exécutions. Avec un prompt trivial (« Reply with only the word OK. »), les trois modèles ont tous déclaré 24 tokens. Le gonflement semble donc lié au prompt, pas au modèle. J'observe les décomptes, pas leur cause : considérez cela comme un comportement de facturation mesuré sur un endpoint, non comme une propriété documentée du modèle.
Au tarif standard officiel, cette même réponse correcte a coûté :
Pour 1 000 exécutions : Luna $0.16, Terra $1.29, Sol $7.73. Pour retourner le même nombre à trois chiffres, Sol a facturé environ 6× le coût de Terra et 47× celui de Luna.
Il s'agit d'un échantillon réduit — deux exécutions sur deux tâches simples — et non d'un benchmark ; il ne mesure pas non plus la qualité de raisonnement. Une règle s'en dégage toutefois : commencez avec Luna, puis montez en gamme uniquement lorsque vos propres requêtes révèlent des échecs mesurables. Dans ces tests, payer Sol alors que Terra répondait déjà correctement n'apportait rien. La répartition complète des usages figure dans le tableau final.
Pourquoi une baisse de 80 % ne réduit pas forcément la facture de 80 %
Le tarif affiché s'applique aux tokens d'entrée frais et aux tokens de sortie. Or, le trafic d'agents multi-tours est souvent dominé par un troisième poste, les écritures de cache. Pour les trois niveaux GPT-5.6, une écriture de cache coûte 12.5× plus qu'une lecture de cache.
| Modèle | Entrée mise en cache (lecture) | Écriture de cache | Ratio |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
Un test contrôlé publié le 2026-07-11 sur la communauté de développeurs OpenAI illustre l'enjeu. Sur six tours séquentiels de l'API Responses chaînés via previous_response_id, Luna a consommé 3 % de tokens d'entrée en moins et 29 % de tokens de sortie en moins que gpt-5.4-mini, tout en coûtant 96 % de plus ($0.0651 contre $0.0332 par conversation). Environ 70 % des entrées de Luna étaient facturées comme des écritures de cache. Ces chiffres sont antérieurs à la baisse de prix, mais le mécanisme reste le même.
Dans cette implémentation, la cause pouvait être corrigée — et c'est le point utile. Le cache de GPT-5.6 ne valorise pas les correspondances partielles : la moindre modification du préfixe mis en cache impose une réécriture complète. L'auteur reconstruisait un instantané croissant de la conversation dans instructions, ce qui invalidait le préfixe à chaque tour.
Le constat est net : avec des instructions stables, le cache a été utilisé lors de 15 des 15 tours utilisateur suivants ; avec des instructions variables, lors de 0 sur 15. En déplaçant ce contexte dans un élément d'entrée développeur, le surcoût de Luna est passé de 96 % à 16.7 %. Luna est alors devenu plus rapide et a obtenu une meilleure note que mini lors de l'évaluation en aveugle de l'auteur. Ni prompt_cache_key ni les points d'arrêt explicites du cache n'ont aidé.
Avant de conclure que la baisse vous a bien été appliquée, faites deux vérifications :
- Ne placez aucune donnée variable dans le préfixe mis en cache. Le texte système, les définitions d'outils et la persona doivent venir en premier et rester strictement identiques octet pour octet ; l'état de la conversation doit être placé dans les éléments d'entrée.
- Récupérez le détail d'usage renvoyé par l'API. Le rapport entre
usage.prompt_tokens_details.cached_tokensetusage.prompt_tokensindique la part lue depuis le cache à chaque appel. Sur un agent qui tourne longtemps, un ratio bas est le bug de coût le plus rentable à corriger dans cette gamme.
Trois prix GPT-5.6 circulent : lequel vous concerne ?
Une recherche sur le prix de GPT-5.6 Luna renvoie au moins trois montants différents. Chacun correspond, ou correspondait, à une offre donnée. Vérifier l'offre associée à un prix permet de lever la plupart des contradictions.
| Prix rencontré | Entrée / sortie Luna | À quoi il correspond |
|---|---|---|
| $0.20 / $1.20 | Offre standard, contexte court | Le tarif par défaut d'un appel API classique |
| $0.10 / $0.60 | Offres Batch et Flex | Exactement la moitié du standard, pour les travaux asynchrones et moins prioritaires |
| $0.40 / $2.40 | Mode Fast | Deux fois le tarif standard |
| $1.00 / $6.00 | Tarif standard avant le 30 juillet | Valable jusqu'à la baisse |
Deux autres modificateurs figurent dans la même documentation tarifaire : le contexte long est facturé à 2× le tarif d'entrée en contexte court et à 1.5× le tarif de sortie — la ligne longue de Luna est donc à $0.40 / $1.80, pas $0.40 / $2.40. La documentation mentionne aussi une majoration de 10 % pour les endpoints admissibles de résidence des données sur les modèles sortis à partir du 2026-03-05, ce qui couvre l'ensemble de GPT-5.6.
Lorsqu'une page tarifaire ne correspond pas à votre facture, deux contrôles permettent de trancher : vérifiez la date de validation indiquée sur la page, puis rapprochez-la de la documentation tarifaire officielle correspondant précisément à l'offre que vous appelez. Les agrégateurs et revendeurs publient également leurs propres tarifs : il s'agit d'une troisième catégorie, pas nécessairement de données obsolètes, mais de prix différents.
Chez AIReiter, les trois niveaux GPT-5.6 sont facturés à 50 % du prix catalogue d'OpenAI, et ce positionnement a suivi la baisse du 30 juillet : GPT-5.6 Luna coûte $0.10 / $0.60, Terra $1.00 / $6.00 et Sol $2.50 / $15.00. La même réduction de moitié s'applique aux entrées mises en cache et aux écritures de cache.
Pour un agent Terra traitant chaque jour 1M de tokens d'entrée et 200K de tokens de sortie, cela représente $4.40 par jour au tarif catalogue, contre $2.20 : même appel, même identifiant de modèle.
La place de Luna sur le marché est une autre question. Dans la comparaison de 30 modèles publiée par VentureBeat le 30 juillet, le tarif combiné de Luna à $1.40 est inférieur à celui de Gemini 3.5 Flash-Lite ($2.80) et de Gemini 3.1 Flash-Lite ($1.75), mais reste au-dessus de DeepSeek v4-flash ($0.42). Si le coût est votre seul critère, les API LLM les moins chères ne sont pas proposées par OpenAI.
Questions fréquentes
GPT-5.6 Sol a-t-il lui aussi baissé ?
Non. Le tarif standard de Sol reste à $5.00 en entrée et $30.00 en sortie par million de tokens. Il a gagné un mode Fast, facturé deux fois plus cher, pour un débit pouvant aller jusqu'à 2.5×.
GPT-5.6 Luna est-il désormais le modèle API le moins cher ?
Non. À $1.40 par million de tokens combinés, il figure parmi les modèles des séries frontier les moins chers, mais le tableau de VentureBeat du 30 juillet place DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash de Xiaomi ($0.40) et DeepSeek v4-pro ($1.305) en dessous.
Pourquoi certaines pages affichent-elles $1 / $6 pour GPT-5.6 Luna ?
Il s'agissait du tarif standard avant le 30 juillet 2026. Vérifiez la date de validation affichée par la page, puis confirmez le prix dans la documentation officielle pour l'offre que vous utilisez.
La baisse s'applique-t-elle aux offres Batch et Flex ?
Oui. Batch et Flex sont fixées à la moitié du tarif standard : Luna y coûte donc $0.10 / $0.60 et Terra $1.00 / $6.00, y compris pour les entrées mises en cache et les écritures de cache.
Dois-je modifier mon code pour profiter du nouveau tarif ?
Non. La baisse s'applique sans migration aux identifiants existants gpt-5.6-luna et gpt-5.6-terra. La modification qui mérite vraiment votre attention est l'audit de votre ratio de lectures de cache : c'est là que la réduction se perd le plus souvent.
Quel niveau choisir selon la charge de travail ?
| Charge de travail | Niveau | Pourquoi |
|---|---|---|
| Extraction, catégorisation et résumé à fort volume | Luna | A réussi les deux tâches testées ; $1.40 combiné par 1M, désormais sous gpt-5.4-nano |
| Appels orientés utilisateur sensibles à la latence | Terra | Mesuré plus rapide que Luna en extraction (2.1s contre 3.5–4.0s) |
| Première montée en gamme lorsque Luna ne passe pas le seuil de qualité | Terra | $14 combiné, contre $35 pour Sol |
| Tâches où Terra sous-performe de façon mesurable sur votre trafic | Sol | Seule justification à un coût mesuré par tâche 6× supérieur à Terra |
| Agents multi-tours, quel que soit le niveau | Corriger le cache d'abord | Les écritures de cache coûtent 12.5× les lectures ; un mauvais préfixe pèse davantage que le choix du niveau |