AIREITER

Tarifs de l’API Grok 4.7 et test en programmation

Dernière mise à jour: 2026-09-21 20:02:13

Pour évaluer Grok 4.7 dans un workflow d’API, il faut aller au-delà du tarif affiché en gros caractères : la documentation de xAI indique 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie pour l’API standard. Le modèle est bien disponible sous l’identifiant grok-4.7, mais le montant réellement facturé peut varier selon la passerelle utilisée, le routage régional aux États-Unis, la mise en cache et la taille du contexte.

En bref : l’accès est bien réel, mais les tarifs 2 $/6 $ ne sont qu’une base en accès direct

Grok 4.7 n’est ni une rumeur ni un simple nom associé à une interface de chat. La page officielle de xAI, mise à jour le 21 septembre 2026, documente un accès via l’API Responses comme via Chat Completions. Elle mentionne une fenêtre de contexte de 500 000 tokens, les entrées texte et image, les sorties texte, l’appel de fonctions, la recherche web, la recherche sur X et l’exécution de code.

Le tarif de 2 $/6 $ est confirmé précisément pour l’accès direct standard :

Route ou mode d’utilisationEntréeSortieCe que cela signifie
API xAI directe, standard2,00 $/M6,00 $/MTarif officiel de référence pour grok-4.7
Endpoint régional xAI aux États-Unis2,20 $/M*6,60 $/M*Surcoût de 10 % par rapport au tarif standard
Référencement standard sur OpenRouter1,60 $/M4,80 $/MTarif de la passerelle ou du fournisseur, pas celui de xAI en accès direct
Promotion Vercel AI Gateway1,20 $/M3,60 $/MTarif promotionnel affiché jusqu’au 27 septembre 2026

*Les montants pour les États-Unis sont calculés à partir du surcoût de 10 % documenté par xAI ; ils ne sont pas publiés séparément comme tarifs de référence. Pour votre budget, partez sur 2 $/6 $ avec l’API xAI directe et considérez les tarifs des passerelles comme spécifiques à chaque route, à vérifier selon leurs conditions et leur disponibilité.

Ce que xAI propose officiellement

L’identifiant officiel du modèle est grok-4.7. xAI documente trois modes d’accès compatibles : son SDK, un client compatible avec OpenAI configuré pour utiliser https://api.x.ai/v1, et une requête POST directe vers https://api.x.ai/v1/responses.

Les caractéristiques publiées sont particulièrement pertinentes pour les agents :

CaractéristiqueValeur documentée par xAI
Fenêtre de contexte500 000 tokens
Date de coupure des connaissancesMai 2026
Niveaux de raisonnementLow, medium, high, xhigh
Raisonnement par défautHigh
EntréesTexte et images
SortiesTexte
APIResponses API et Chat Completions
OutilsAppel de fonctions, recherche web, recherche sur X, exécution de code
Tarif standard des entrées2 $/M tokens
Tarif standard des sorties6 $/M tokens

L’exemple fourni dans la documentation demande au modèle de trouver puis d’expliquer un bug dans une fonction JavaScript qui calcule une médiane. Cela montre que l’API est correctement câblée, pas que le modèle est performant en programmation. La page ne fournit ni tableau de benchmarks indépendants, ni mesure de latence, ni engagement de disponibilité, ni taux de réussite des tâches.

Tarifs de l’API Grok 4.7 : les détails qui peuvent alourdir la facture

API directe ou tarif de passerelle

La page du modèle sur OpenRouter affiche 1,60 $/M en entrée, 4,80 $/M en sortie et 0,40 $/M pour les lectures depuis le cache. La page Vercel AI Gateway affiche une réduction promotionnelle de 40 %, soit 1,20 $/M et 3,60 $/M, valable jusqu’au 27 septembre 2026.

Les tarifs des passerelles peuvent correspondre à une promotion ou à un routage différent. Comparez donc le coût complet des requêtes plutôt que les seuls tarifs affichés par token.

Routage régional aux États-Unis

xAI documente https://us.api.x.ai/v1 comme endpoint régional américain, avec un surcoût de 10 % sur l’utilisation des tokens. Au tarif standard, cela donne 2,20 $/M en entrée et 6,60 $/M en sortie.

La mise en cache compte pour les prompts de dépôt répétés

xAI recommande un identifiant pour le routage du cache : prompt_cache_key avec l’API Responses, ou l’en-tête x-grok-conv-id avec Chat Completions. En envoyant les requêtes successives au même serveur, vous augmentez la fiabilité des accès au cache. À l’inverse, une requête sans entrée en cache peut être facturée au tarif complet des tokens d’entrée.

Le tableau tarifaire de Grok 4.7 chez Cursor fournit un point de comparaison pour une offre hébergée : 0,50 $/M pour les lectures depuis le cache au niveau standard, contre 2 $/M pour les entrées non mises en cache. Il s’agit de la facturation de Cursor, pas d’une garantie que l’API xAI directe applique exactement les mêmes tarifs au cache.

Un grand contexte n’est pas un contexte gratuit

Cursor indique un contexte standard de 256k et un maximum de 500k. Sa documentation précise qu’au-delà de 256k, des tarifs supérieurs s’appliquent pour les longs contextes : l’utilisation standard est multipliée par 2, tandis que l’utilisation Fast est multipliée par 3.

xAI confirme la capacité de 500k tokens, mais ne publie pas de coefficient distinct pour les longs contextes dans le récapitulatif du modèle. Consultez les règles de facturation de votre route avant de supposer que l’utilisation de 500k tokens reste au tarif de base.

Ce que les éléments publiés permettent — ou non — de conclure sur la programmation

Le dossier de Grok 4.7 est surtout convaincant pour les agents qui travaillent sur des tâches longues. xAI, Cursor et OpenRouter le présentent comme un modèle adapté à la programmation, aux sessions prolongées d’ingénierie logicielle, à l’auto-vérification et aux longs contextes. La documentation du modèle chez Cursor mentionne, dans son environnement d’agent, la recherche de fichiers, leur modification, les commandes shell, le contrôle du navigateur, l’accès au web, la génération d’images et les questions de clarification.

Ces fonctionnalités justifient un projet pilote en programmation, mais elles ne démontrent ni une meilleure correction des bugs, ni un meilleur taux de réussite des tests, ni un coût inférieur par tâche. Utilisez un dépôt de test reproductible et mesurez la réussite des tâches, les nouvelles tentatives, les appels d’outils, le temps réel d’exécution et le nombre total de tokens.

Le niveau d’effort va de low à xhigh, avec high comme réglage par défaut. Un niveau supérieur peut allonger l’exécution et modifier la consommation ; vérifiez la manière dont votre fournisseur expose et facture le raisonnement avant d’établir vos prévisions de coûts en production.

Pour les connaissances à jour, la recherche reste indispensable

Grok 4.7 accepte les images, prend en charge la recherche web et la recherche sur X, et dispose d’une date de coupure des connaissances fixée à mai 2026. Pour les recherches d’actualité, utilisez la récupération d’informations ou les outils de recherche, puis évaluez la précision des citations, la couverture des sources, le nombre de révisions et le temps de correction humaine plutôt que la seule qualité de rédaction.

Combien coûteraient deux boucles d’agent types ?

Pour le tarif direct standard, utilisez ce calcul simple :

coût = (tokens_entrée / 1 000 000 × 2 $) + (tokens_sortie / 1 000 000 × 6 $)

Exemple de requêteCoût des entréesCoût des sortiesCoût des tokens
100k en entrée + 20k en sortie0,20 $0,12 $0,32 $
500k en entrée + 50k en sortie1,00 $0,30 $1,30 $

Le second exemple illustre uniquement le tarif de base. La facture peut augmenter avec le surcoût régional, les coefficients appliqués aux longs contextes sur une offre hébergée, les prompts répétés non mis en cache, les règles de facturation propres au raisonnement et les requêtes supplémentaires. Un agent de programmation qui effectue dix requêtes peut coûter bien plus cher qu’une seule requête de 500k tokens.

Comment vérifier l’accès avant de s’engager

  1. Utilisez l’identifiant officiel du modèle. Envoyez grok-4.7, et non un alias deviné ou un nom propre à une passerelle.
  2. Commencez par une petite requête avec l’API Responses. xAI documente une requête POST https://api.x.ai/v1/responses avec authentification Bearer et une entrée texte.
  3. Relevez la consommation dans la réponse et la facture. Enregistrez les tokens d’entrée, les tokens de sortie, la consommation de raisonnement si elle est exposée, les appels d’outils et le montant facturé.
  4. Testez la mise en cache séparément. Répétez le même long prompt système avec prompt_cache_key et comparez la facturation des tokens d’entrée de la seconde requête.
  5. Testez votre niveau de contexte. Effectuez un test sous 256k tokens, puis un autre au-dessus si votre application a besoin d’un long contexte de dépôt.
  6. Choisissez l’endpoint en connaissance de cause. Utilisez l’endpoint standard pour établir une base économique ; ne retenez l’endpoint régional américain que si son avantage en matière de localisation des données justifie le surcoût de 10 %.
  7. Considérez les tarifs des passerelles comme ceux de produits distincts. Vérifiez la fin de la promotion, le routage du fournisseur, le comportement en cas de bascule, les règles de conservation des données et les frais propres à la route avant d’utiliser 1,20 $/3,60 $ ou 1,60 $/4,80 $ dans vos prévisions.
  8. Mesurez les tâches réellement terminées. Pour la programmation, suivez les tests réussis, les nouvelles tentatives, les appels d’outils, le temps réel d’exécution et le coût total par modification acceptée.

FAQ sur l’API Grok 4.7

Grok 4.7 est-il disponible via l’API officielle ?

Oui. La documentation de xAI répertorie le modèle grok-4.7 pour l’API Responses et Chat Completions, avec des exemples utilisant le SDK, un client compatible avec OpenAI et cURL.

Le tarif de 2 $ en entrée et 6 $ en sortie est-il confirmé ?

Oui, pour le tarif standard de l’API xAI directe documenté le 21 septembre 2026. Un endpoint régional américain ajoute 10 %, tandis que les passerelles peuvent afficher d’autres tarifs ou promotions.

Grok 4.7 est-il performant en programmation ?

C’est un candidat pertinent pour un pilote avec des agents de programmation travaillant sur de longues sessions, car sa conception documentée inclut l’utilisation d’outils, un raisonnement réglable, des recommandations de compression du contexte et jusqu’à 500k tokens de contexte. Les sources disponibles ne démontrent pas indépendamment un avantage en programmation : testez-le donc sur vos propres tâches et votre propre dépôt.

Grok 4.7 dispose-t-il d’une fenêtre de contexte de 500k ?

Oui. xAI indique 500 000 tokens. Cursor décrit séparément 256k comme contexte standard et 500k comme niveau maximal, avec une tarification supérieure au-delà de 256k.

Grok 4.7 Fast est-il disponible via l’API publique ?

Non. La documentation de xAI consacrée à Grok 4.7 décrit Grok 4.7 Fast comme le même modèle exécuté sur une infrastructure plus rapide, au double des tarifs standard, mais précise qu’il n’est pas disponible via l’API publique de xAI. Il est proposé dans Cursor et Grok Build.

Le verdict : testez-le, mais budgétez la route que vous utiliserez réellement

L’accès à l’API Grok 4.7 et la base tarifaire de 2 $/6 $ sont confirmés ; son avantage en programmation ne l’est pas. Si votre charge de travail dépasse 256k tokens, dépend d’un contexte de dépôt non mis en cache, utilise le routage américain ou déclenche de nombreux appels de raisonnement, le coût par tâche terminée peut être très différent. Commencez par un pilote instrumenté avant de migrer des charges de production.