Pour l’agent que vous branchez cette semaine, faut-il appeler claude-opus-5 ou gpt-5.6 ? Attention : le second n’est pas un modèle à proprement parler. C’est l’alias de l’un des trois SKU affichés sur trois grilles tarifaires distinctes.
En bref : sous 272 000 tokens en entrée, les deux modèles phares ne sont séparés que de 7 % côté prix. Au-delà, Claude Opus 5 revient environ deux fois moins cher que GPT-5.6 Sol. Le 24 juillet 2026, nous avons fait passer les quatre modèles par les mêmes quatre vérifications et recoupé chaque donnée tarifaire avec la documentation des deux éditeurs.
GPT-5.6 : une génération, trois formats avec Sol, Terra et Luna
OpenAI a lancé les trois le 9 juillet 2026. Sa documentation les rattache aux anciens suffixes de taille : Sol correspond au « tier sans suffixe des précédentes familles GPT-5 », Terra au « tier mini » et Luna au « tier nano ». Il s’agit donc de trois SKU d’une seule génération, et non de trois générations différentes.
La chaîne seule gpt-5.6 est un alias. Le changelog d’OpenAI la redirige vers gpt-5.6-sol : une configuration qui indique gpt-5.6 est donc facturée au tarif le plus élevé de la famille.
| Variante | ID du modèle | Palier représenté | Entrée / sortie par 1M (≤272K) | Évaluation du raisonnement |
|---|---|---|---|---|
| Sol | gpt-5.6-sol (alias gpt-5.6) | sans suffixe | $5.00 / $30.00 | La plus élevée |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | Élevée |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | Haute |
Leurs points communs comptent davantage que leurs différences. Les trois fiches modèles indiquent exactement les mêmes éléments :
- Fenêtre de contexte de 1 050 000 tokens ; sortie maximale de 128 000 tokens
- Date limite des connaissances : 16 février 2026
- Entrées texte et image, sortie texte ; pas de fine-tuning ; aucun snapshot daté
- La même échelle d’effort et la même note de vitesse « Fast »
Les seules différences documentées concernent le prix et l’évaluation du raisonnement. Chaque fiche affiche un badge « Default » dans son propre palier : sa présence sur Terra ne fait donc pas de Terra le choix par défaut de toute la famille.
En face, Anthropic ne propose qu’un seul SKU. Lancé le 24 juillet 2026 sous l’identifiant claude-opus-5, Claude Opus 5 est un snapshot figé sans suffixe de date. Son tarif est de $5 en entrée et $25 en sortie par million de tokens, avec une fenêtre de 1M qui correspond à la fois au réglage par défaut et au maximum.
Code : quatre tests mécaniques, quatre réussites nettes
Nous avons envoyé quatre tâches aux critères de réussite vérifiables automatiquement via une passerelle compatible OpenAI, en conservant exactement le même prompt utilisateur pour chaque modèle :
- Correction de bug : réparer
kth_smallest, qui modifiait la liste de l’appelant avec unsort()sur place et contenait une erreur d’index d’une unité - JSON strict : ordre de clés imposé, nombre et checksum cohérents
- Raisonnement : le plus grand total impossible à former uniquement avec des paquets de 7 et de 12, soit le nombre de Frobenius, 7×12−7−12 = 65
- Refactorisation : ajouter de la validation sans changer la signature
Les quatre modèles ont obtenu 4/4 : sorted() ou une copie avec l’index déplacé à k-1, un JSON parseable dans l’ordre de clés demandé, 65, et une refactorisation propre. Il ne s’agit que d’une exécution par couple modèle-tâche, pas d’un benchmark : à cette échelle, la correction ne les a pas départagés.
Les affirmations plus larges reposent sur des chiffres communiqués par les éditeurs, sans reproduction indépendante. Les documents de lancement d’Anthropic placent Opus 5 à moins de 0,5 % du meilleur score de Fable 5 sur CursorBench 3.2, avec effort maximal, pour la moitié du coût par tâche ; c’est une comparaison relative menée par l’éditeur lui-même. La page de lancement de GPT-5.6 d’OpenAI renvoie une erreur 403 aux récupérations automatisées : les scores de code de Sol appartiennent donc à ceux qui les ont publiés :
| Benchmark tiers | Sol | Terra | Luna |
|---|---|---|---|
| Vellum, Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis, Coding Agent Index | 80 with Codex | 77 | 75 |
Les retours terrain ne suivent pas tous les tableaux de scores. Un développeur ayant comparé les deux à effort High a écrit le 24 juillet que « GPT 5.6 Sol High is still better at coding than Claude Opus 5 High. »
La documentation de migration d’Anthropic apporte un détail à appliquer : Opus 5 vérifie son propre travail. Les prompts hérités qui ajoutent une étape de vérification le poussent désormais à sur-vérifier et devraient être supprimés.
Suivi d’instructions : les formats commencent à différer
Deux vérifications testaient en réalité l’obéissance aux consignes : la tâche JSON imposait items en ordre alphabétique minuscule, un checksum de 14 et aucune clé supplémentaire ; la refactorisation exigeait une ValueError, sans aucun commentaire ni docstring, une règle que les modèles enfreignent souvent en expliquant leur travail. Les quatre ont validé les deux tests.
En revanche, le format de sortie a divergé. Sol et Luna ont encapsulé la réponse en LaTeX avec oxed{65}, tandis qu’Opus 5 et Terra ont renvoyé le nombre brut. Une regex qui récupère le dernier entier fonctionne dans les deux cas ; un parseur qui attend un nombre seul ou un champ JSON, non. Or ce sont précisément les comportements par défaut que vous héritez lorsque vous remplacez claude-opus-5 par gpt-5.6 sans rien modifier d’autre.
Efficacité en tokens : 1 182 tokens en sortie contre 464 pour Sol
Deux paramètres par défaut expliquent probablement l’écart ci-dessous, sans qu’il soit question de qualité. Opus 5 active le thinking par défaut et règle l’effort sur high dans l’API comme dans Claude Code : une requête sans paramétrage est déjà une requête de raisonnement. GPT-5.6 utilise medium par défaut.
Voici les tokens de complétion visibles sur les quatre tâches, avec le coût calculé aux tarifs officiels de sortie. Une requête par paire, sans nouvelle tentative, avec les réglages par défaut :
| Modèle | Tokens de sortie | Tâche de refactorisation | Coût, sortie uniquement |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
Ces coûts doivent être lus avec deux réserves. Pour un même prompt utilisateur, la passerelle a rapporté entre 62 et 4 471 tokens de prompt pour les modèles GPT, contre 592 à 640 pour Claude. Les requêtes n’étaient donc pas identiques sur le réseau : aucun chiffre côté entrée n’est exploitable, et l’écart ne peut pas être attribué proprement.
Le guide du raisonnement d’OpenAI masque par ailleurs les résumés de raisonnement sauf opt-in, alors que GPT-5.6 facture ces tokens cachés comme des tokens de sortie. Les trois coûts GPT sous-estiment donc la facture. La correction reste le signal comparable ici ; tokens et latence ne donnent qu’une tendance.
Le graphique inclut aussi Opus 4.8 et Sonnet 5, deux références Claude issues de la même exécution. Opus 5 a été le plus lent des six, avec 24.6s sur les quatre tâches, contre 20.3s pour Sol, 22.7s pour Terra et 18.4s pour Luna. Opus 4.8 désactive le thinking par défaut et a terminé en 11.8s, ce qui indique que l’écart relève de la configuration plutôt que des capacités.
Artificial Analysis, qui évaluait Opus 5 le jour de sa sortie, a décrit son réglage d’effort comme couvrant une plage d’usage de tokens plus large que les modèles des autres laboratoires. Son coût est donc plus ajustable que ne le laisse penser la grille tarifaire.
Tarifs : le seuil de 272K, chiffres à l’appui
Une phrase publiée tranche la partie tarifaire du match Claude Opus 5 vs GPT-5.6. Au tarif d’appel, les deux modèles phares semblent quasiment au même prix : Opus 5 coûte $5/$25 par million de tokens, Sol $5 en entrée et $30 en sortie. Opus 5 est ainsi 17 % moins cher en sortie et identique en entrée. Mais cela ne vaut que jusqu’à 272 000 tokens en entrée.
Les trois pages modèles GPT-5.6 reprennent la même mention : « Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request. » La majoration s’applique à toute la requête, et non aux seuls tokens au-delà du seuil. Dépassez 272K d’un token et Sol facture $10/$45 pour l’appel entier ; la fenêtre de 1M d’Opus 5 reste à $5/$25 du début à la fin.
Prenons une requête agentique avec 20 000 tokens de sortie et faisons varier l’entrée, selon les tarifs publiés par OpenAI et les tarifs standard d’Anthropic, tous deux consultés le 25 juillet 2026 :
| Tokens en entrée | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
Sous le seuil, les deux modèles phares ne sont distants que de 7 %. Au-dessus, Sol coûte 1.96x le prix d’Opus 5 à 400K tokens en entrée, et 1.98x à 900K. Cent requêtes du profil 400K représentent donc $250 contre $490.
Terra mérite une attention particulière. Au-dessus de 272K, son tarif d’entrée atteint les mêmes $5 par million qu’Opus 5. Tout l’écart se situe donc sur la sortie : $2.50 par million, soit cinq cents pour cette requête de 20k tokens de sortie, aussi bien à 300K qu’à 900K. Cet écart augmente avec la sortie, non avec l’entrée. Le seuil est une marche discrète dans la grille tarifaire, pas la pente que laisse imaginer un axe régulièrement espacé.
Batch, tokenizers et canal d’achat
Les formules remisées conservent le même rapport sur cette requête de 400K :
- Anthropic Batch API : Opus 5 à $2.50/$12.50, soit $1.25 pour la requête
- OpenAI Batch et Flex : 50 % de réduction sur le tarif standard ; le tarif long contexte de Sol passe donc à $5/$22.50, soit $2.45 pour le même appel
Les tarifs par token ne se comparent pas directement d’un fournisseur à l’autre. La documentation tarifaire d’Anthropic précise que les modèles Claude depuis 4.7, dont Opus 5, utilisent un tokenizer plus récent qui produit environ 30 % de tokens supplémentaires pour un même texte, avec une proportion qui dépend du contenu et de la langue. Un document comptant 400 000 tokens GPT-5.6 approchera 520 000 tokens pour Opus 5 : la ligne d’entrée passe alors de $2.00 à $2.60. Cela reste sous les $4.00 de Sol, mais il faut tokeniser vos propres prompts avant de s’engager.
Le lieu d’achat a aussi son importance. AIReiter revend Claude sous le prix catalogue, avec Opus 4.8 à $1.56/$7.76 par million de tokens, soit environ 69 % sous le tarif officiel. Son catalogue s’arrête à Fable 5 et Opus 4.8 : Opus 5 n’y est donc pas encore appelable. Dans la gamme Anthropic elle-même, Fable 5 à $10/$50 face à Opus 5 à $5/$25 pose la question du point d’équilibre.
Contexte : tous deux annoncent 1M, mais un seul le facture sans surcoût
La fenêtre d’Opus 5 atteint 1 000 000 tokens ; c’est à la fois sa valeur par défaut et son maximum, sans variante petit contexte que l’on puisse sélectionner par erreur. Les trois variantes GPT-5.6 affichent 1 050 000 tokens, soit une fenêtre 5 % plus grande. La sortie maximale est de 128 000 des deux côtés, avec une asymétrie : sur l’API Batch d’Anthropic, le header bêta output-300k-2026-03-24 porte le plafond d’Opus 5 à 300 000.
Sol accepte un prompt de 900K tokens, mais facture alors le tarif long contexte pour l’ensemble de la requête. Environ 74 % de sa fenêtre annoncée se situe donc au-dessus du tarif économique. Les capacités à grande longueur sont une autre question : selon l’analyse de Vellum, Luna atteint 41.3 % sur MRCR, contre 91.5 % pour Sol et 89.6 % pour Terra. Voilà une raison de garder le palier nano hors des tâches long contexte, quel que soit son tarif. Anthropic attribue aussi à Opus 5 une date limite de connaissances en mai 2026, là où les trois fiches GPT-5.6 indiquent le 16 février 2026.
Contrôles de raisonnement : une échelle, deux approches
Opus 5 ne nécessite aucun header bêta pour ses niveaux d’effort, et son thinking est activé par défaut. Le désactiver présente une limite stricte : thinking: {"type": "disabled"} n’est accepté qu’avec un effort high ou inférieur ; avec xhigh ou max, l’API renvoie une 400. Anthropic signale ce comportement comme un changement cassant par rapport aux modèles précédents.
| Contrôle | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| Échelle d’effort | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| Effort par défaut | high dans l’API et Claude Code | medium |
| Second réglage | aucun | reasoning.mode : standard (par défaut) ou pro |
| Raisonnement désactivé | impossible au-dessus de l’effort high | effort: none |
Ces deux valeurs de mode sont les seules documentées dans le guide du raisonnement d’OpenAI. L’API n’expose aucune valeur ultra, et le mécanisme du mode Pro n’est pas décrit. Le changelog du 9 juillet cite le raisonnement persistant, l’effort max et le mode Pro parmi les nouveautés de cette famille.
La différence pratique est simple : GPT-5.6 peut couper entièrement le raisonnement pour les appels critiques en latence, ce qu’Opus 5 ne permet pas au-dessus de high. À l’inverse, Opus 5 offre une plage dynamique plus large au sein du raisonnement. Un développeur suivant les deux a retenu une échelle unique entre fournisseurs : Luna high, Sol medium, puis Opus medium, high et xhigh.
Disponibilité, limites de débit et fine-tuning
Opus 5 est disponible via l’API Claude, Amazon Bedrock sous anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code et Claude Cowork. Il est aussi le nouveau modèle par défaut de Claude Max. Le mode rapide d’Anthropic, à $10/$50 pour environ 2.5x le débit, n’existe que sur l’API Claude.
Les trois variantes GPT-5.6 sont des produits de l’API OpenAI, et le palier API gratuit ne donne accès ni à Sol ni à Terra. Les limites documentées de Sol passent de 500 RPM au Tier 1 à 15 000 au Tier 5, plafond également partagé par Terra. Aucun des trois ne prend en charge le fine-tuning ni ne propose de snapshot daté : figer une version revient donc à utiliser l’ID simple et à accepter les mises à jour sur place.
Quel modèle utiliser selon le cas
Commencez par vérifier la taille d’entrée : c’est le seul axe assorti d’une discontinuité tarifaire publiée. Le cache, l’éligibilité au batch et le volume de sortie font ensuite évoluer le total.
Sous 272K, les modèles phares sont suffisamment proches pour laisser les critères secondaires décider. Au-dessus, l’économie au tarif catalogue favorise Opus 5 face à Sol dans un rapport d’environ 2x. Cet avantage ne s’étend toutefois pas à toute la famille : au-dessus du seuil, Terra coûte $2.45 contre $2.50 pour Opus 5 sur la même requête. L’économie long contexte concerne donc Sol, pas GPT-5.6 dans son ensemble.
- Claude Opus 5 : grands prompts, tarif fixe sur une fenêtre de 1M, connaissances jusqu’en mai 2026, ou inférence devant tourner sur Bedrock, Google Cloud ou Foundry.
- GPT-5.6 Terra : le choix par défaut pour le volume, puisqu’il coûte moins cher qu’Opus 5 aux deux extrémités de la plage.
- GPT-5.6 Sol : lorsque le mode
proou l’effortnoneest indispensable. Son supplément de prix se justifie par ses contrôles, pas par un avantage de correction que nous aurions pu mesurer. - GPT-5.6 Luna : tâches simples à très grand volume, à écarter des travaux long contexte.
Le choix entre Claude Opus 5 et GPT-5.6 se résume à une décision par tranche de taille d’entrée, et les deux fournisseurs publient clairement la frontière concernée.
FAQ
Claude Opus 5 est-il meilleur que GPT-5.6 pour coder ?
Sur nos quatre vérifications mécaniques, Opus 5, Sol, Terra et Luna ont tous obtenu 4/4 : à cette taille, la correction ne les a pas séparés, et les développeurs qui utilisent les deux à effort High ne sont pas d’accord entre eux. Le coût est plus net : au-delà de 272K tokens en entrée, Opus 5 revient environ deux fois moins cher que Sol.
Quelle différence entre GPT-5.6 Sol, Terra et Luna ?
Le prix et une évaluation qualitative du raisonnement. La documentation d’OpenAI associe Sol à l’ancien palier sans suffixe, Terra à mini et Luna à nano, aux tarifs de $5/$30, $2.50/$15 et $1/$6 par million de tokens sous 272K tokens en entrée. La fenêtre de contexte, la sortie maximale, la date limite des connaissances, les modalités et l’échelle d’effort sont identiques pour les trois.
Quel est le meilleur choix entre GPT et Claude ?
La réponse dépend du critère, et l’écart publié le plus large se situe sur un axe qu’aucun des deux fournisseurs ne met en avant. benchlm.ai relève un taux d’hallucination AA-Omniscience de 35.9 % pour Claude Opus 4.8, contre 88.8 % pour GPT-5.6 Sol, tout en plaçant Sol devant sur les catégories mathématiques, connaissances et agentiques. C’est le rapprochement publié le plus proche ; aucun agrégateur ne propose encore de données pour Opus 5 ou Terra. Si une réponse erronée coûte davantage qu’une réponse manquante, cet ordre de priorité prime sur tout score de programmation.
Faut-il utiliser GPT-5.6 Terra plutôt que Sol ?
Pour la plupart des volumes, oui. Des praticiens qui routent les tâches selon leur profondeur sur r/codex rapportent arriver à environ 75 % de Terra, 15 % de Luna et 10 % de Sol. Artificial Analysis estime que le palier intermédiaire est dominé, car un réglage de Luna ou de Sol peut généralement l’égaler à coût égal ou inférieur. Testez donc Terra face à ses deux voisins avant de supposer que le milieu est le choix sûr.
GPT-5.6 propose-t-il un mode de raisonnement ultra ?
L’API expose reasoning.mode avec deux valeurs documentées, standard et pro, ainsi que reasoning.effort allant de none à max. Le mode Pro est arrivé avec le changelog du 9 juillet 2026. Aucune valeur ultra n’apparaît dans le guide du raisonnement d’OpenAI ni sur les pages modèles.
