Para o agente que você está montando nesta semana, vale chamar claude-opus-5 ou gpt-5.6? Há uma pegadinha importante no segundo nome: ele não identifica um modelo específico, mas funciona como alias de um entre três SKUs, cada um com sua própria tabela de preços.
Em resumo: até 272.000 tokens de entrada, os dois modelos de ponta ficam separados por no máximo 7% no custo. Acima disso, Claude Opus 5 sai por cerca de metade do preço do GPT-5.6 Sol. Rodamos os quatro modelos nas mesmas quatro verificações em 24 de julho de 2026 e conferimos cada variável nas documentações dos dois fornecedores.
Sol, Terra e Luna: três portes da mesma geração
A OpenAI lançou os três em 9 de julho de 2026. Na referência de modelos, ela os relaciona aos antigos sufixos de porte: Sol representa "the unsuffixed tier of earlier GPT-5 families", Terra corresponde à "the mini model tier" e Luna à "the nano model tier". Portanto, são três SKUs de uma geração, não três gerações diferentes.
A string simples gpt-5.6 é um alias. O changelog da OpenAI a direciona para gpt-5.6-sol; logo, uma configuração que use gpt-5.6 será cobrada pela tarifa mais alta da família.
| Variante | ID do modelo | Tier que representa | Entrada / saída por 1M (≤272K) | Avaliação de raciocínio |
|---|---|---|---|---|
| Sol | gpt-5.6-sol (alias gpt-5.6) | sem sufixo | $5.00 / $30.00 | Mais alta |
| Terra | gpt-5.6-terra | mini | $2.50 / $15.00 | Maior |
| Luna | gpt-5.6-luna | nano | $1.00 / $6.00 | Alta |
O que os três compartilham é mais relevante do que suas diferenças. As três páginas de modelo trazem exatamente as mesmas especificações:
- Janela de contexto de 1.050.000 tokens e saída máxima de 128.000
- Data de corte de conhecimento em 16 de fevereiro de 2026
- Entrada de texto e imagem, saída de texto, sem fine-tuning e sem snapshots datados
- A mesma escala de esforço e a mesma classificação de velocidade "Fast"
Preço e avaliação de raciocínio são as únicas diferenças documentadas. Cada página traz a etiqueta "Default" dentro de seu próprio tier; encontrá-la no Terra, portanto, não faz dele o padrão da família.
Do outro lado, a Anthropic oferece apenas um SKU. O Claude Opus 5 chegou em 24 de julho de 2026 como claude-opus-5, um snapshot fixado sem sufixo de data. Ele custa $5 por milhão de tokens de entrada e $25 por milhão de saída, com janela de 1M que é simultaneamente o padrão e o limite máximo.
Programação: quatro testes objetivos, quatro aprovações
Enviamos quatro tarefas com critérios de aprovação verificáveis por máquina por meio de um gateway compatível com OpenAI, sempre usando o mesmo prompt de usuário:
- Correção de bug: corrigir
kth_smallest, que alterava a lista do chamador ao usarsort()in-place e ainda tinha um erro de índice de uma posição - JSON estrito: ordem fixa das chaves, contagem e checksum consistentes entre si
- Raciocínio: o maior total impossível de formar usando apenas pacotes de 7 e 12, o número de Frobenius: 7×12−7−12 = 65
- Refatoração: adicionar validação sem mudar a assinatura
Os quatro modelos fecharam em 4/4: usaram sorted() ou uma cópia, ajustaram o índice para k-1, produziram JSON parseável na ordem exigida, responderam 65 e fizeram uma refatoração limpa. Foi uma execução por combinação de modelo e tarefa, não um benchmark; nesse porte de tarefa, a correção não distinguiu os modelos.
As alegações mais amplas dependem de números reportados pelos fornecedores, sem reprodução independente. Nos materiais de lançamento, a Anthropic afirma que o Opus 5 ficou a 0,5% do pico de Fable 5 no CursorBench 3.2 com esforço máximo, pela metade do custo por tarefa — um dado relativo produzido pela própria empresa. A página de lançamento do GPT-5.6 da OpenAI devolve 403 para coletas automatizadas, então os resultados de código do Sol dependem de quem os publicou:
| Benchmark de terceiros | Sol | Terra | Luna |
|---|---|---|---|
| Vellum, Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Artificial Analysis, Coding Agent Index | 80 com Codex | 77 | 75 |
Na prática, os relatos não acompanham necessariamente os placares. Um desenvolvedor que comparou os dois com esforço High publicou em 24 de julho que "GPT 5.6 Sol High is still better at coding than Claude Opus 5 High."
As orientações de migração da Anthropic trazem um ponto útil: o Opus 5 verifica o próprio trabalho. Prompts herdados que acrescentam uma etapa de verificação podem levá-lo a verificar demais e devem ser removidos.
Seguimento de instruções: a diferença apareceu no formato
Dois testes eram, na prática, testes de instrução disfarçados. A tarefa de JSON exigia items em ordem alfabética minúscula, checksum de 14 e nenhuma chave extra. Já a refatoração exigia lançar ValueError, sem comentários e sem docstrings — algo que os modelos frequentemente violam ao documentar o que fizeram. Todos passaram nos dois casos.
O formato da saída, porém, variou. Sol e Luna encapsularam a resposta em LaTex, devolvendo \boxed{65}, enquanto Opus 5 e Terra entregaram apenas o número. Uma regex que extraia o último inteiro suporta os dois formatos; já um parser que espere um numeral isolado ou um campo JSON não. E esses padrões são os que você herda ao trocar claude-opus-5 por gpt-5.6 sem alterar mais nada.
Eficiência de tokens: 1.182 tokens de saída contra 464 do Sol
Dois padrões de configuração explicam de forma plausível a diferença abaixo, e nenhum deles é qualidade. O Opus 5 vem com thinking ativado e esforço high como padrão na API e no Claude Code; uma chamada sem configuração já é uma chamada de raciocínio. O GPT-5.6 usa medium por padrão.
Tokens visíveis de conclusão nas quatro tarefas, com custo calculado pela tarifa oficial de saída. Uma chamada por combinação, sem tentativas extras e com configurações padrão:
| Modelo | Tokens de saída | Tarefa de refatoração | Custo, apenas saída |
|---|---|---|---|
| Claude Opus 5 | 1,182 | 600 tok / 8.3s | $0.0296 |
| GPT-5.6 Sol | 464 | 321 tok / 12.0s | $0.0139 |
| GPT-5.6 Terra | 737 | 603 tok / 11.8s | $0.0111 |
| GPT-5.6 Luna | 612 | 380 tok / 8.7s | $0.0037 |
Esses custos têm duas limitações. Para o mesmo prompt de usuário, o gateway reportou entre 62 e 4.471 tokens de prompt nos modelos GPT, enquanto o Claude ficou entre 592 e 640. As requisições, portanto, não foram idênticas no tráfego real: não há como tirar uma conclusão útil sobre custo de entrada, nem atribuir a diferença de forma limpa.
O guia de raciocínio da OpenAI também omite resumos de raciocínio salvo quando você opta por recebê-los, e o GPT-5.6 cobra esses tokens ocultos como saída. Por isso, os custos dos três GPT subestimam a fatura. Correção é o sinal comparável aqui; tokens e latência servem apenas como indicação.
O gráfico inclui também Opus 4.8 e Sonnet 5, referências do lado Claude na mesma execução. O Opus 5 foi o mais lento dos seis, com 24,6s nas quatro tarefas, contra 20,3s do Sol, 22,7s do Terra e 18,4s do Luna. O Opus 4.8 vem com thinking desativado por padrão e terminou em 11,8s, o que aponta a configuração — e não a capacidade — como causa da diferença.
Ao avaliar o Opus 5 no dia de lançamento, a Artificial Analysis descreveu a configuração de esforço como abrangendo uma faixa de uso de tokens maior do que a dos modelos de outros laboratórios. Na prática, seu custo é mais ajustável do que a tabela de preços sugere.
Preço: o degrau dos 272K, em dólares
Uma frase publicada define a metade financeira do comparativo Claude Opus 5 vs GPT-5.6. Na tarifa principal, os modelos de ponta parecem separados por quase nada: Opus 5 custa $5/$25 por milhão de tokens, e Sol cobra $5 pela entrada e $30 pela saída. O Opus 5 é 17% mais barato na saída e igual na entrada. Isso vale até 272.000 tokens de entrada — e não além.
As três páginas de modelo do GPT-5.6 trazem a mesma frase: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." A cobrança incide sobre a requisição inteira, não apenas sobre os tokens acima do limite. Basta ultrapassar 272K por um token para o Sol cobrar $10/$45 pela chamada toda, enquanto a janela de 1M do Opus 5 continua em $5/$25 de ponta a ponta.
Considere uma requisição agentic com 20.000 tokens de saída e varie a entrada, usando as tarifas publicadas da OpenAI e as tarifas padrão da Anthropic, ambas consultadas em 25 de julho de 2026:
| Tokens de entrada | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| 200,000 | $1.50 | $1.60 | $0.80 |
| 400,000 | $2.50 | $4.90 | $2.45 |
| 900,000 | $5.00 | $9.90 | $4.95 |
Abaixo do limite, os modelos de ponta diferem 7%. Acima dele, Sol custa 1,96x o Opus 5 com 400K de entrada e 1,98x com 900K. Em 100 requisições no perfil de 400K, isso representa $250 contra $490.
O Terra é o caso que merece mais atenção. Acima de 272K, ele paga a mesma tarifa de entrada do Opus 5, $5 por milhão. Assim, toda a diferença fica na saída: $2,50 por milhão, ou cinco centavos nesta requisição de 20k tokens de saída, tanto em 300K quanto em 900K. Ela cresce com a saída, não com a entrada. O limite é um degrau discreto na tabela de preços, não a inclinação que um eixo espaçado uniformemente pode sugerir.
Batch, tokenizadores e o canal de compra
As modalidades com desconto preservam a proporção naquela requisição de 400K:
- Anthropic Batch API: Opus 5 por $2.50/$12.50, levando a requisição a $1.25
- OpenAI Batch e Flex: 50% de desconto sobre a tarifa padrão; a tarifa de contexto longo do Sol passa a $5/$22.50, ou $2.45 pela mesma chamada
Tarifas por token não são diretamente comparáveis entre fornecedores. A documentação de preços da Anthropic informa que os modelos Claude a partir do 4.7, incluindo o Opus 5, usam um tokenizador mais novo que gera aproximadamente 30% mais tokens para o mesmo texto; a proporção varia conforme conteúdo e idioma. Um documento com 400.000 tokens no GPT-5.6 fica mais perto de 520.000 no Opus 5, elevando a linha de entrada daquela tabela de $2.00 para $2.60. Ainda é menos que os $4.00 do Sol, mas tokenize seus próprios prompts antes de decidir.
O local de compra também importa. A AIReiter revende Claude abaixo da tabela, com Opus 4.8 a $1.56/$7.76 por milhão de tokens, cerca de 69% abaixo do preço oficial. Seu catálogo vai apenas até Fable 5 e Opus 4.8, portanto o Opus 5 ainda não pode ser chamado por lá. Dentro da própria linha da Anthropic, a comparação de equilíbrio é Fable 5 a $10/$50 contra Opus 5 a $5/$25.
Contexto: ambos anunciam 1M, mas só um cobra tarifa fixa
A janela do Opus 5 tem 1.000.000 de tokens e é, ao mesmo tempo, o padrão e o máximo. Não existe uma variante de contexto menor que possa ser selecionada por engano. As três variantes GPT-5.6 oferecem 1.050.000, uma janela 5% maior. A saída máxima é 128.000 nos dois lados, com uma assimetria: na Batch API da Anthropic, o header beta output-300k-2026-03-24 eleva o teto do Opus 5 para 300.000.
O Sol aceita um prompt de 900K tokens e cobra a tarifa de contexto longo pela requisição inteira, deixando cerca de 74% de sua janela anunciada acima da tarifa barata. Capacidade em contexto extenso é outra questão: a análise da Vellum coloca Luna em 41,3% no MRCR, contra 91,5% do Sol e 89,6% do Terra. É motivo suficiente para não usar o tier nano em trabalhos de contexto longo, independentemente do preço. A Anthropic também posiciona o corte de conhecimento do Opus 5 em maio de 2026, enquanto as três páginas do GPT-5.6 indicam 16 de fevereiro de 2026.
Controles de raciocínio: uma escala, dois ajustes
O Opus 5 não exige header beta em nenhum nível de esforço, e o thinking vem ativado por padrão. Desligá-lo tem uma limitação clara: thinking: {"type": "disabled"} só é aceito em esforço high ou menor e retorna 400 em xhigh ou max. A Anthropic aponta isso como uma mudança incompatível com modelos anteriores.
| Controle | Claude Opus 5 | GPT-5.6 |
|---|---|---|
| Escala de esforço | low → medium → high → xhigh → max | none → low → medium → high → xhigh → max |
| Esforço padrão | high na API e no Claude Code | medium |
| Segundo ajuste | nenhum | reasoning.mode: standard (padrão) ou pro |
| Raciocínio desligado | não disponível acima de esforço high | effort: none |
Esses dois valores de modo são tudo o que o guia de raciocínio da OpenAI documenta. A API não expõe um valor ultra, e o mecanismo por trás do modo Pro não é explicado. O changelog de 9 de julho lista raciocínio persistente, esforço max e modo Pro entre as novidades da família.
Na prática, a assimetria é esta: GPT-5.6 consegue eliminar o raciocínio por completo em chamadas críticas para latência, algo que o Opus 5 não permite acima de esforço high. Já o Opus 5 tem uma faixa dinâmica maior dentro do raciocínio. Um desenvolvedor que acompanha os dois chegou a uma escala única entre fornecedores: Luna high, Sol medium, depois Opus medium, high e xhigh.
Disponibilidade, limites de taxa e fine-tuning
O Opus 5 pode ser chamado pela Claude API, Amazon Bedrock como anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code e Claude Cowork. Ele é o novo padrão no Claude Max. O modo rápido da Anthropic, por $10/$50 e cerca de 2,5x mais throughput, existe apenas na Claude API.
As três variantes GPT-5.6 são produtos da API da OpenAI, e o tier gratuito da API não inclui Sol nem Terra. Os limites documentados do Sol vão de 500 RPM no Tier 1 até 15.000 no Tier 5, teto compartilhado pelo Terra. Nenhum dos três suporta fine-tuning ou expõe um snapshot datado; fixar uma versão, portanto, significa usar o ID simples e aceitar atualizações in-place.
Qual modelo usar em cada caso
Comece pelo tamanho da entrada: é o único eixo com uma descontinuidade publicada. Depois, cache, elegibilidade para batch e volume de saída alteram o total.
Abaixo de 272K, os modelos de ponta estão próximos o suficiente para que outros critérios decidam. Acima disso, a economia de tabela favorece o Opus 5 em relação ao Sol por cerca de 2x. Essa vantagem não vale para toda a família: acima do limite, Terra custa $2.45 contra $2.50 do Opus 5 na mesma requisição. A economia em contexto longo é, portanto, uma comparação com Sol, não com GPT-5.6 como um todo.
- Claude Opus 5: prompts grandes, uma tarifa fixa em toda a janela de 1M, conhecimento até maio de 2026 ou inferência que precise rodar em Bedrock, Google Cloud ou Foundry.
- GPT-5.6 Terra: o padrão para volume, pois custa menos que o Opus 5 nas duas pontas da faixa.
- GPT-5.6 Sol: quando o necessário for o modo
proou o esforçonone. Ele justifica o prêmio pelos controles, não por uma vantagem de correção que conseguimos medir. - GPT-5.6 Luna: trabalho superficial em alto volume, mantendo-o fora de tarefas com contexto longo.
Claude Opus 5 vs GPT-5.6 se resume a uma decisão por faixa de tamanho da entrada, e os dois fornecedores publicam exatamente onde está esse limite.
Perguntas frequentes
Claude Opus 5 é melhor que GPT-5.6 para programação?
Nas nossas quatro verificações objetivas, Opus 5, Sol, Terra e Luna fizeram 4/4. A correção não os distinguiu nesse tamanho de tarefa, e desenvolvedores que usam os dois com esforço High discordam entre si. O custo é mais claro: acima de 272K tokens de entrada, Opus 5 custa cerca de metade do Sol.
Qual é a diferença entre GPT-5.6 Sol, Terra e Luna?
Preço e uma avaliação qualitativa de raciocínio. Os documentos da OpenAI relacionam Sol ao antigo tier sem sufixo, Terra ao mini e Luna ao nano, cobrando $5/$30, $2.50/$15 e $1/$6 por milhão de tokens abaixo de 272K de entrada. Janela de contexto, saída máxima, corte de conhecimento, modalidades e escala de esforço são idênticos nos três.
Qual IA é melhor, GPT ou Claude?
Depende do eixo analisado, e a maior diferença publicada está em um que nenhum fornecedor promove. O benchlm.ai registra taxa de alucinação AA-Omniscience de 35,9% para Claude Opus 4.8, contra 88,8% para GPT-5.6 Sol, ao mesmo tempo que posiciona Sol à frente nas categorias de matemática, conhecimento e agentes. É a comparação publicada mais próxima; nenhum agregador traz dados de Opus 5 ou Terra ainda. Se respostas erradas custam mais do que respostas ausentes, essa ordem pesa mais que qualquer pontuação de código.
Devo usar GPT-5.6 Terra em vez de Sol?
Para a maior parte do volume, sim. Praticantes que roteiam tarefas por profundidade no r/codex relatam algo próximo de Terra em 75% do trabalho, Luna em 15% e Sol em 10%. A Artificial Analysis argumenta que o tier intermediário é dominado, pois alguma configuração de Luna ou Sol normalmente o iguala por custo igual ou menor. Portanto, teste Terra contra os dois vizinhos antes de presumir que o meio é a escolha segura.
GPT-5.6 tem modo de raciocínio ultra?
A API expõe reasoning.mode com dois valores documentados, standard e pro, além de reasoning.effort de none a max. O modo Pro chegou no changelog de 9 de julho de 2026. Nenhum valor ultra aparece no guia de raciocínio ou nas páginas de modelo da OpenAI.
