AIREITER

Tarifs API de GPT-6 Sol et Luna : coûts, limites et choix du modèle

Dernière mise à jour: 2026-09-23 19:10:33

Sur le papier, les tarifs de GPT-6 Sol et GPT-6 Luna sont limpides : Sol facture 2 $ par million de tokens en entrée et 10 $ en sortie, tandis que Luna facture respectivement 0,10 $ et 0,50 $. En production, la facture dépend aussi de la mise en cache, des prompts très longs, du niveau de raisonnement et des éventuels échecs. Pour l’extraction et le routage à grande échelle, commencez par Luna ; pour les usages API généralistes, Sol reste le choix le plus équilibré ; et gardez Astra lorsque l’échec d’une exécution en plusieurs étapes coûte plus cher que les économies de tokens.

Le bon choix dépend du coût de la tâche, pas seulement du prix des tokens

GPT-6 Sol et GPT-6 Luna sont des modèles d’API commerciaux lancés le 22 septembre 2026. OpenAI présente Sol comme son modèle généraliste le plus puissant et Luna comme une solution efficace pour les tâches ciblées et répétitives. Tous deux disposent d’un contexte de 1,05 million de tokens et peuvent générer jusqu’à 128 000 tokens, selon la documentation du modèle GPT-6.

En pratique, la répartition est assez simple :

Type de chargePoint de départPourquoi
Classification, extraction, routage, résuméGPT-6 LunaPrix par token le plus bas et débit élevé
Agents de programmation, appels d’outils, trafic de production mixteGPT-6 SolBien moins cher qu’Astra sans tomber dans le niveau de qualité de Luna
Tâches complexes en plusieurs étapes, sensibles aux erreursGPT-6 AstraLes graphiques d’OpenAI placent encore Astra devant Sol et Luna avec le niveau d’effort maximal

Il s’agit d’une stratégie de routage, pas de l’affirmation que le modèle le moins cher donnera toujours la tâche terminée la moins chère. Une relance nécessaire, un champ oublié ou un mauvais appel d’outil peuvent rapidement effacer une importante réduction de prix.

Tarifs API de GPT-6 Sol et Luna : le détail de la facture

Le tableau ci-dessous reprend les tarifs standards publiés dans la documentation tarifaire des API d’OpenAI, pour un million de tokens.

Ligne de facturationGPT-6 SolGPT-6 Luna
Entrée2,00 $0,10 $
Entrée mise en cache0,20 $0,01 $
Écriture du cache2,50 $0,125 $
Sortie10,00 $0,50 $
Entrée au-delà de 272K tokens4,00 $0,20 $
Sortie au-delà de 272K tokens15,00 $0,75 $
Entrée Batch/Flex1,00 $0,05 $
Sortie Batch/Flex5,00 $0,25 $
Entrée en Fast mode4,00 $0,20 $
Sortie en Fast mode20,00 $1,00 $

Les identifiants des modèles sont gpt-6-sol et gpt-6-luna. Tous deux sont disponibles via Responses et Chat Completions, avec les différences habituelles de fonctionnalités détaillées sur leurs pages respectives. Si votre application s’appuie sur des appels d’outils avec raisonnement activé, vérifiez la compatibilité entre l’endpoint et le niveau d’effort avant de modifier l’identifiant du modèle : cette compatibilité fait partie du coût de migration.

Par rapport aux tarifs promotionnels affichés pour GPT-5.6, Sol passe de 4 $/20 $ à 2 $/10 $. Luna passe de 0,20 $/1,20 $ à 0,10 $/0,50 $. La baisse est exactement de moitié pour les tokens en entrée et les entrées mises en cache ; pour la sortie de Luna, elle est supérieure à 50 %. Dans sa comparaison au lancement, OpenAI présente les nouveaux tarifs comme 50 % inférieurs aux prix promotionnels de GPT-5.6. Il faut donc considérer cette comparaison comme une référence datée.

Ce qui fait varier la facture

Les tarifs mis en avant masquent trois paramètres de facturation qui comptent réellement en production.

Les longs contextes sont possibles, mais pas gratuits

Les requêtes dépassant 272 000 tokens en entrée sont facturées selon les tarifs majorés applicables aux longs contextes. La fenêtre de contexte atteint 1,05 million de tokens, mais cette capacité n’est pas une enveloppe gratuite. Une requête Sol de 300 000 tokens en entrée et 20 000 tokens en sortie coûte environ 1,20 $ pour l’entrée et 0,30 $ pour la sortie, soit 1,50 $ avant les autres ajustements. Avec Luna, la même requête revient à environ 0,06 $ + 0,015 $, soit 0,075 $.

La mise en cache devient intéressante dès la deuxième utilisation

Écrire dans le cache coûte plus cher qu’une entrée standard : 2,50 $ par million de tokens avec Sol et 0,125 $ avec Luna. La lecture d’un contenu mis en cache coûte 10 % du tarif d’entrée normal. Pour un prompt système stable réutilisé sur plusieurs requêtes, la première écriture est suivie de lectures beaucoup moins coûteuses. Pour un prompt utilisé une seule fois, le cache ne génère aucune économie à lui seul.

OpenAI indique également que le cache de GPT-6 tolère mieux les changements de paramètres, comme le niveau d’effort de raisonnement ou la configuration des outils. Mesurez le taux réel de succès du cache au lieu de supposer que toutes les requêtes qui se ressemblent partagent automatiquement le même préfixe.

Batch et Fast mode répondent à deux besoins opposés

Batch et Flex divisent par deux les tarifs standards d’entrée et de sortie. Ils conviennent donc aux classifications hors ligne, aux extractions en volume et aux évaluations qui n’exigent pas de réponse immédiate. Fast mode double les tarifs standards : il achète de la latence, ce n’est pas une remise.

Par exemple, un traitement Batch comprenant 10 millions de tokens en entrée et 1 million de tokens en sortie avec Luna coûte 0,50 $ + 0,25 $ = 0,75 $. Le même traitement au tarif standard revient à 1,00 $ + 0,50 $ = 1,50 $. En Fast mode, ces mêmes volumes coûteraient 3,00 $.

Choisir entre Luna, Sol et Astra

GPT-6 Luna est le premier modèle à tester pour les files de traitement importantes. Les données du lancement reprises par Digital Applied montrent que les meilleurs scores de Luna restent inférieurs à ceux de Sol dans les benchmarks d’agents d’OpenAI, mais son coût par tâche est nettement plus bas. Avec le niveau d’effort maximal, Luna a atteint 66,6 % sur DeepSWE dans le tableau communiqué par le fournisseur, pour 0,22 $ par tâche, contre 68,8 % pour Sol à 2,74 $. Ces montants ne constituent pas un tarif universel — vos prompts et votre politique de relance détermineront la facture — mais ils expliquent pourquoi Luna a sa place dans le routage et les traitements en arrière-plan.

GPT-6 Sol est le point de départ le plus sûr pour une API généraliste. Capital & Compute rapporte que Sol et Claude Sonnet 5 affichent exactement les mêmes tarifs publiés : 2 $ en entrée, 10 $ en sortie et 0,20 $ pour l’entrée mise en cache. Leur comparaison indépendante de l’Intelligence Index donne l’avantage à Sol, tout en rappelant qu’un benchmark agrégé ne mesure pas l’adéquation avec votre environnement d’exécution. Utilisez Sol lorsque les appels d’outils, le code et l’exhaustivité des réponses comptent suffisamment pour que les erreurs moins chères de Luna deviennent coûteuses.

GPT-6 Astra reste le modèle d’escalade. Dans son tableau au niveau d’effort maximal, OpenAI place Astra devant Sol sur AutomationBench, Agents’ Last Exam, FrontierCode, DeepSWE et OSWorld, tout en indiquant un taux d’erreurs factuelles inférieur. Ces résultats viennent du fournisseur et ne garantissent rien pour votre charge de travail, mais ils justifient de conserver Astra comme solution de repli déclenchée par un échec plutôt que de lui confier chaque requête.

Les retours d’utilisateurs montrent pourquoi ce mécanisme de repli est important. Dans une discussion Reddit consacrée à Luna 6 et Luna 5.6, u/AdmiralMcNugget écrit : « Il a répondu à la question que vous avez posée. Posez plutôt la question que vous voulez vraiment poser : “Quels éléments correspondent à ces critères ?” » (discussion). Il s’agit de l’expérience d’un seul utilisateur, pas d’un résultat de benchmark, mais elle met en évidence un contrôle utile en production : vérifier que le modèle renvoie bien la liste demandée, plutôt qu’un simple résumé techniquement correct.

Ce que les premiers résultats permettent réellement de conclure

Les éléments disponibles confortent fortement l’hypothèse d’un gain de coût, mais appellent davantage de prudence sur les capacités.

Les documents de lancement d’OpenAI indiquent que Sol et Luna sont moins chers que GPT-5.6 et présentent Astra comme le modèle le plus performant. L’analyse des graphiques de lancement publiée par Digital Applied a relevé que GPT-5.6 Sol obtenait encore de meilleurs scores que GPT-6 Sol sur deux graphiques cités — DeepSWE et OSWorld — alors que le nouveau modèle coûtait moins cher par tâche dans la configuration rapportée. Capital & Compute rappelle de son côté que les environnements de benchmark des fournisseurs et ceux des évaluations indépendantes ne sont pas automatiquement comparables.

Les premiers retours d’utilisateurs sont contrastés dans les discussions citées. Certains utilisateurs d’API expliquent que le prix inférieur rend Luna plus intéressant pour leur usage ; d’autres décrivent des réponses plus courtes ou moins complètes, qui nécessitent davantage de travail au niveau des prompts. La vraie question opérationnelle n’est donc pas « Quel modèle gagne ? », mais plutôt : « La baisse de la facture de tokens résiste-t-elle aux relances, aux champs manquants et aux échecs d’appels d’outils ? »

Lancez une petite évaluation sur un jeu de données conservé à part, avec trois mesures : le coût par tâche terminée, le taux de relance nécessaire et le taux d’erreurs critiques. Comparez Luna au niveau d’effort maximal et Sol avec xhigh ou max à votre modèle actuel. Gardez le benchmark inchangé : modifier à la fois les prompts et les paramètres d’effort rend les résultats difficiles à interpréter.

FAQ sur les API GPT-6 Sol et Luna

Quel est le tarif de l’API GPT-6 Sol ?

GPT-6 Sol coûte 2 $ par million de tokens en entrée, 0,20 $ par million de tokens en entrée mise en cache et 10 $ par million de tokens en sortie. L’écriture dans le cache coûte 2,50 $ par million de tokens.

Quel est le tarif de l’API GPT-6 Luna ?

GPT-6 Luna coûte 0,10 $ par million de tokens en entrée, 0,01 $ par million de tokens en entrée mise en cache et 0,50 $ par million de tokens en sortie. L’écriture dans le cache coûte 0,125 $ par million de tokens.

Quel modèle choisir pour les agents de programmation, GPT-6 Sol ou Luna ?

Commencez par Sol lorsque la qualité du code et la fiabilité des appels d’outils sont prioritaires. Testez Luna pour les sous-agents en arrière-plan et les tâches répétitives, lorsque le coût par tâche terminée compte davantage que les capacités de pointe.

GPT-6 Sol et Luna appliquent-ils une tarification spéciale aux longs contextes ?

Oui. Au-delà de 272 000 tokens en entrée, les tarifs publiés passent à 4 $/15 $ pour l’entrée/la sortie de Sol et à 0,20 $/0,75 $ pour l’entrée/la sortie de Luna. L’ensemble de la requête est soumis à la règle de tarification des longs contextes.

Batch et Flex sont-ils moins chers ?

Oui. OpenAI applique la moitié des tarifs standards d’entrée et de sortie aux traitements Batch ou Flex. Ces modes sont conçus pour les tâches qui peuvent attendre, et non pour les requêtes interactives.

Par quel modèle commencer ?

Utilisez Luna pour les tâches structurées à fort volume, Sol pour la plupart des trafics API en production et Astra lorsque l’échec d’une exécution coûte plus cher que l’écart de prix. Validez ce routage avec votre coût par tâche terminée, et pas uniquement avec le prix des tokens.

Le choix pratique

Commencez par transférer les tâches prévisibles et volumineuses vers GPT-6 Luna. Faites passer le trafic lié au code et aux outils par GPT-6 Sol via la même interface, puis conservez GPT-6 Astra comme voie d’escalade. Cette architecture à trois niveaux permet de profiter de la baisse des tarifs sans supposer qu’un token moins cher produit automatiquement un résultat moins coûteux.