Ne vous arrêtez pas au tarif affiché de 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie. Au-delà de 272 000 tokens en entrée, l’intégralité de la requête passe sur une grille tarifaire plus élevée. Et comme l’accès à GPT-6 Astra est encore déployé progressivement, le simple fait de voir le modèle dans la documentation ne garantit pas qu’un compte puisse réellement l’appeler.
Tarifs de l’API GPT-6 Astra en un coup d’œil
La grille ci-dessous provient de la page officielle du modèle publiée par OpenAI. Les prompts mis en cache, les requêtes en contexte long et le mode Fast peuvent modifier sensiblement le coût réel.
| Élément | Détail actuel |
|---|---|
| ID du modèle API | gpt-6-astra |
| Entrée standard | 10,00 $ / 1M tokens |
| Entrée en cache | 1,00 $ / 1M tokens |
| Écriture du cache | 12,50 $ / 1M tokens |
| Sortie standard | 50,00 $ / 1M tokens |
| Fenêtre de contexte | 1 050 000 tokens |
| Sortie maximale | 128 000 tokens |
| Date de connaissance | 30 avril 2026 |
| Entrée/sortie | Entrée texte et image ; sortie texte |
| Palier API gratuit | Non pris en charge |
| Disponibilité actuelle | Déploiement progressif auprès des entreprises bénéficiant du Trusted Access ; un accès API plus large et l’accès via les offres payantes sont annoncés dans les prochains jours |
Ces chiffres proviennent de la page du modèle GPT-6 Astra, et non d’une estimation de préversion. Le guide du modèle d’OpenAI précise que l’appel d’outils nécessite la Responses API.
Trois règles tarifaires qui peuvent faire grimper la facture
GPT-6 Astra distingue quatre catégories de tokens et applique plusieurs règles selon le mode de service. Réduire son prix à un simple endpoint à 10 $ en entrée / 50 $ en sortie sous-estime le coût de création du cache, des prompts longs et du traitement à faible latence.
Entrée standard, entrée en cache et écritures du cache
L’entrée standard coûte 10 $ par million, l’entrée en cache 1 $ par million et les écritures du cache 12,50 $ par million. La réutilisation peut donc devenir très économique après l’écriture initiale.
| Catégorie de tokens | Tarif standard | Ce que cela recouvre |
|---|---|---|
| Entrée non mise en cache | 10,00 $ / 1M | Nouvelles données d’entrée traitées par le modèle |
| Entrée en cache | 1,00 $ / 1M | Données déjà traitées et servies depuis le cache |
| Écriture du cache | 12,50 $ / 1M | Données ajoutées au cache du prompt |
| Sortie | 50,00 $ / 1M | Tokens générés dans la réponse |
Ne multipliez pas la fenêtre de contexte par le tarif d’entrée. Une fenêtre de contexte de 1,05 million de tokens correspond à une limite de capacité, pas à la promesse que tous les tokens seront facturés au tarif de base.
Le seuil de 272K tokens en entrée concerne toute la requête
Lorsqu’une requête contient plus de 272 000 tokens en entrée, OpenAI applique, selon sa grille, des tarifs d’entrée et de cache multipliés par 2, ainsi qu’un tarif de sortie multiplié par 1,5, sur l’intégralité de la requête. Le mode contexte long revient donc à 20 $ par million de tokens d’entrée non mis en cache, 2 $ par million de tokens d’entrée en cache, 25 $ par million pour les écritures du cache et 75 $ par million de tokens en sortie.
| Type de requête | Entrée | Entrée en cache | Écriture du cache | Sortie |
|---|---|---|---|---|
| 272K tokens en entrée ou moins | 10 $ | 1 $ | 12,50 $ | 50 $ |
| Plus de 272K tokens en entrée | 20 $ | 2 $ | 25 $ | 75 $ |
Pour une requête comprenant 300K tokens en entrée, tous les tokens concernés — entrée, cache et sortie — sont facturés selon les tarifs de contexte long. Les 272 premiers milliers ne restent pas au tarif standard.
Batch, Flex, Fast et choix de déploiement régional
OpenAI facture Batch et Flex à 50 % des tarifs applicables. Son guide du modèle indique que le mode Fast coûte 2 fois les tarifs applicables, sans SLA de latence, et qu’il n’est pas disponible avec la résidence des données dans l’UE. Le traitement Priority n’est pas non plus disponible avec cette option de résidence des données.
| Mode | Entrée standard | Sortie standard | À retenir |
|---|---|---|---|
| Standard | 10 $ / 1M | 50 $ / 1M | Mode direct par défaut de l’API |
| Batch ou Flex | 5 $ / 1M | 25 $ / 1M | La moitié du tarif Standard applicable |
| Fast | 20 $ / 1M | 100 $ / 1M | Deux fois le tarif Standard applicable |
| Standard, contexte long | 20 $ / 1M | 75 $ / 1M | S’applique au-delà de 272K tokens en entrée |
| Fast, contexte long | 40 $ / 1M | 150 $ / 1M | Deux fois les tarifs de contexte long |
Le tableau ne présente que les tarifs de l’entrée non mise en cache et de la sortie. Les tarifs de lecture et d’écriture du cache suivent eux aussi le coefficient du mode de service applicable.
Microsoft Foundry publie une grille de déploiement distincte. Son annonce de GPT-6 Astra indique, pour le mode Global Standard en contexte court, des tarifs de 10 $ en entrée, 1 $ pour l’entrée en cache, 12,50 $ pour les écritures du cache et 50 $ en sortie. En U.S. Data Zone Standard, ils passent à 11 $, 1,10 $, 13,75 $ et 55 $. Pour le contexte long, la grille affiche 20 $/2 $/25 $/75 $ en Global et 22 $/2,20 $/27,50 $/82,50 $ en U.S. Data Zone. N’appliquez donc pas directement la grille OpenAI à un budget Azure.
Combien coûte réellement une requête Astra ?
Les exemples utilisent les tarifs directs OpenAI en mode Standard, sans outils ni nouvelles tentatives, et classent les tokens comme non mis en cache ou mis en cache, conformément aux indications fournies.
| Exemple de requête | Calcul | Coût estimé des tokens |
|---|---|---|
| 100K tokens d’entrée non mis en cache + 10K en sortie | 0.1 × $10 + 0.01 × $50 | 1,50 $ |
| 200K tokens d’entrée en cache + 20K en sortie | 0.2 × $1 + 0.02 × $50 | 1,20 $ |
| 300K tokens d’entrée non mis en cache + 30K en sortie | 0.3 × $20 + 0.03 × $75 | 8,25 $ |
Vérifiez le seuil de 272K avant d’adopter des workflows en contexte long. La récupération de contenu ou la condensation du contexte peuvent réduire le coût du modèle, mais elles ajoutent du travail côté application.
Écrire 200K tokens coûte 2,50 $, tandis qu’une lecture ultérieure de 200K tokens depuis le cache revient à 0,20 $. La rentabilité du cache dépend donc de la fréquence de réutilisation.
Dans Microsoft Foundry, une requête de 100K tokens en entrée et 10K en sortie coûte également 1,50 $ dans la grille Global en contexte court, avant les outils et les nouvelles tentatives. En U.S. Data Zone, elle revient à 1,65 $ : 0.1 × $11 + 0.01 × $55.
Le guide d’OpenAI affirme qu’Astra peut offrir un coût estimé inférieur par tâche terminée à celui de modèles précédents, mais cette indication ne constitue pas un benchmark indépendant des coûts en production. Mesurez dans vos propres traces les tokens en entrée, les accès au cache, les tokens en sortie, les appels d’outils, les nouvelles tentatives et les corrections humaines.
Accès, quotas et séparation entre ChatGPT et l’API
GPT-6 Astra est progressivement proposé aux entreprises du Trusted Access Program, tandis que l’accès via l’API ainsi que les offres Plus, Pro, Business et Enterprise doit arriver dans les prochains jours. La documentation du fournisseur OpenAI d’OpenClaw précise elle aussi que la découverte du catalogue du compte détermine si celui-ci dispose d’un accès à Astra. Ajouter le nom du modèle dans la configuration ne suffit pas à obtenir cet accès.
Un utilisateur a décrit le retard du déploiement en ces termes :
« Il est presque 2 heures du matin et je vais me coucher furieux. J’ai attendu Astra TOUTE LA JOURNÉE. ... Et voilà que j’apprends que JE NE PEUX MÊME PAS L’UTILISER. » — @buildwithrajath, X
La page du modèle indique les limites API suivantes selon le niveau d’utilisation :
| Niveau | RPM | TPM | Limite de la file Batch |
|---|---|---|---|
| Free | Non pris en charge | Non pris en charge | Non pris en charge |
| Tier 1 | 500 | 500 000 | 1 500 000 |
| Tier 2 | 5 000 | 1 000 000 | 3 000 000 |
| Tier 3 | 5 000 | 2 000 000 | 100 000 000 |
| Tier 4 | 10 000 | 4 000 000 | 200 000 000 |
| Tier 5 | 15 000 | 40 000 000 | 15 000 000 000 |
La grille tarifaire d’Astra concerne uniquement l’API. La documentation citée n’indique pas que les offres ChatGPT incluent des crédits API : prévoyez donc séparément les coûts d’utilisation de la Platform API.
Vérifications à effectuer avant de migrer des agents existants
Le guide du modèle d’OpenAI couvre trois points de migration :
- Modèle et API : définissez
modelsurgpt-6-astra, vérifiez que le catalogue du compte expose bien le modèle et utilisez la Responses API pour l’appel d’outils. - Paramètres de requête : choisissez
low,medium,high,xhighoumax; Astra ne prend pas en chargenone. Supprimez les paramètres d’échantillonnage et de log-probabilités non compatibles. - Cache et région : remplacez
prompt_cache_retentionparprompt_cache_options.ttl: "30m"en suivant les anciennes instructions de migration des modèles OpenAI, puis revérifiez les paramètres Fast et Priority en cas de résidence des données dans l’UE.
Choix budgétaire : orientez les requêtes selon vos traces, pas selon le seul prix des tokens
GPT-6 Astra se justifie plus facilement pour les tâches longues, riches en outils, coûteuses en cas d’échec, ou dépendantes de logiciels qui n’exposent pas d’API propre. En revanche, c’est un mauvais choix par défaut pour les prompts courts et routiniers si le tarif de 50 $ par million de tokens en sortie ne permet pas de réduire les nouvelles tentatives ou d’obtenir un meilleur résultat final.
- Testez Astra en priorité sur la recherche en contexte long, l’utilisation d’un ordinateur, le code complexe et les workflows impliquant plusieurs applications, lorsque les erreurs entraînent des coûts de vérification ou de reprise.
- Gardez un modèle moins cher par défaut pour la classification courte, l’extraction, la rédaction simple et les transformations prévisibles.
- Utilisez Batch ou Flex lorsque la latence importe peu et que la charge de travail accepte un tarif réduit de 50 %.
- N’activez pas Fast par défaut. À 20 $ en entrée et 100 $ en sortie par million de tokens, avant même l’éventuel coefficient de contexte long, ce mode doit apporter un gain mesurable de débit.
- Définissez une limite stricte à 272K. Déclenchez une alerte avant qu’une requête franchisse ce seuil, puisque le tarif majoré s’applique à toute la requête.
Évaluez le coût par tâche acceptée à partir de vos propres journaux de traces, et pas uniquement du prix des tokens. Pour vos comparaisons budgétaires, consultez le guide des tarifs GPT-5.6 et le guide des tarifs OpenRouter, mais ne transposez pas leurs règles tarifaires à Astra.
FAQ sur les tarifs de l’API GPT-6 Astra
Combien coûte GPT-6 Astra pour 1M tokens ?
Le tarif standard est de 10 $ par million de tokens d’entrée non mis en cache, 1 $ par million de tokens d’entrée en cache, 12,50 $ par million pour les écritures du cache et 50 $ par million de tokens en sortie.
Que se passe-t-il au-delà de 272K tokens en entrée ?
Les tarifs d’entrée et de cache doublent, tandis que celui de la sortie augmente de 50 % : 20 $ en entrée, 2 $ pour l’entrée en cache, 25 $ pour les écritures du cache et 75 $ en sortie par million de tokens sur l’intégralité de la requête.
L’entrée en cache est-elle la même chose qu’une écriture du cache ?
Non. L’entrée en cache correspond à une lecture depuis le cache, facturée 1 $ par million dans le mode Standard. Une écriture crée ou met à jour le préfixe mis en cache et coûte 12,50 $ par million.
Batch ou Flex divisent-ils par deux le prix de GPT-6 Astra ?
OpenAI facture Batch et Flex à 50 % des tarifs Standard applicables, y compris le tarif de contexte long correspondant lorsque le seuil est franchi.
Le mode Fast vaut-il son surcoût ?
Le mode Fast coûte 2 fois les tarifs applicables et ne bénéficie d’aucun SLA de latence. Utilisez-le uniquement si vos traces montrent un gain suffisant de débit ou de valeur pour les utilisateurs afin de compenser ce surcoût.
Puis-je utiliser GPT-6 Astra via l’API aujourd’hui ?
L’accès est déployé progressivement et n’est pas encore ouvert à tous. OpenAI indique une disponibilité initiale pour les entreprises du Trusted Access et annonce un accès API plus large dans les prochains jours. Le catalogue du compte reste donc la vérification décisive.
ChatGPT Plus inclut-il des crédits API pour GPT-6 Astra ?
La documentation du modèle ne promet pas de crédits API avec une offre ChatGPT. Considérez l’accès au modèle dans une offre payante et la facturation à l’usage de la Platform API comme deux éléments distincts, tant que les conditions de facturation explicites de votre compte ne précisent pas le contraire.
Quels changements faut-il apporter à l’API pour GPT-6 Astra ?
Définissez model sur gpt-6-astra, utilisez la Responses API pour l’appel d’outils, sélectionnez un niveau d’effort de raisonnement compatible, supprimez les paramètres d’échantillonnage et de log-probabilités non pris en charge, puis vérifiez la durée de vie du cache et les règles régionales du mode Fast. Avant de faire d’Astra votre modèle par défaut, consignez les tokens, le comportement du cache, les outils, les nouvelles tentatives et les corrections humaines lors d’une exécution représentative.