Claude Opus 5 vs GPT-5.6: comparação entre Sol, Terra e Luna

Última Atualização: 2026-07-25 05:24:29

Para o agente que você está montando nesta semana, vale chamar claude-opus-5 ou gpt-5.6? Há uma pegadinha importante no segundo nome: ele não identifica um modelo específico, mas funciona como alias de um entre três SKUs, cada um com sua própria tabela de preços.

Em resumo: até 272.000 tokens de entrada, os dois modelos de ponta ficam separados por no máximo 7% no custo. Acima disso, Claude Opus 5 sai por cerca de metade do preço do GPT-5.6 Sol. Rodamos os quatro modelos nas mesmas quatro verificações em 24 de julho de 2026 e conferimos cada variável nas documentações dos dois fornecedores.

Sol, Terra e Luna: três portes da mesma geração

A OpenAI lançou os três em 9 de julho de 2026. Na referência de modelos, ela os relaciona aos antigos sufixos de porte: Sol representa "the unsuffixed tier of earlier GPT-5 families", Terra corresponde à "the mini model tier" e Luna à "the nano model tier". Portanto, são três SKUs de uma geração, não três gerações diferentes.

A string simples gpt-5.6 é um alias. O changelog da OpenAI a direciona para gpt-5.6-sol; logo, uma configuração que use gpt-5.6 será cobrada pela tarifa mais alta da família.

VarianteID do modeloTier que representaEntrada / saída por 1M (≤272K)Avaliação de raciocínio
Solgpt-5.6-sol (alias gpt-5.6)sem sufixo$5.00 / $30.00Mais alta
Terragpt-5.6-terramini$2.50 / $15.00Maior
Lunagpt-5.6-lunanano$1.00 / $6.00Alta

O que os três compartilham é mais relevante do que suas diferenças. As três páginas de modelo trazem exatamente as mesmas especificações:

  • Janela de contexto de 1.050.000 tokens e saída máxima de 128.000
  • Data de corte de conhecimento em 16 de fevereiro de 2026
  • Entrada de texto e imagem, saída de texto, sem fine-tuning e sem snapshots datados
  • A mesma escala de esforço e a mesma classificação de velocidade "Fast"

Preço e avaliação de raciocínio são as únicas diferenças documentadas. Cada página traz a etiqueta "Default" dentro de seu próprio tier; encontrá-la no Terra, portanto, não faz dele o padrão da família.

Do outro lado, a Anthropic oferece apenas um SKU. O Claude Opus 5 chegou em 24 de julho de 2026 como claude-opus-5, um snapshot fixado sem sufixo de data. Ele custa $5 por milhão de tokens de entrada e $25 por milhão de saída, com janela de 1M que é simultaneamente o padrão e o limite máximo.

Programação: quatro testes objetivos, quatro aprovações

Enviamos quatro tarefas com critérios de aprovação verificáveis por máquina por meio de um gateway compatível com OpenAI, sempre usando o mesmo prompt de usuário:

  • Correção de bug: corrigir kth_smallest, que alterava a lista do chamador ao usar sort() in-place e ainda tinha um erro de índice de uma posição
  • JSON estrito: ordem fixa das chaves, contagem e checksum consistentes entre si
  • Raciocínio: o maior total impossível de formar usando apenas pacotes de 7 e 12, o número de Frobenius: 7×12−7−12 = 65
  • Refatoração: adicionar validação sem mudar a assinatura

Os quatro modelos fecharam em 4/4: usaram sorted() ou uma cópia, ajustaram o índice para k-1, produziram JSON parseável na ordem exigida, responderam 65 e fizeram uma refatoração limpa. Foi uma execução por combinação de modelo e tarefa, não um benchmark; nesse porte de tarefa, a correção não distinguiu os modelos.

As alegações mais amplas dependem de números reportados pelos fornecedores, sem reprodução independente. Nos materiais de lançamento, a Anthropic afirma que o Opus 5 ficou a 0,5% do pico de Fable 5 no CursorBench 3.2 com esforço máximo, pela metade do custo por tarefa — um dado relativo produzido pela própria empresa. A página de lançamento do GPT-5.6 da OpenAI devolve 403 para coletas automatizadas, então os resultados de código do Sol dependem de quem os publicou:

Benchmark de terceirosSolTerraLuna
Vellum, Terminal-Bench 2.188.8%87.4%84.7%
Artificial Analysis, Coding Agent Index80 com Codex7775

Na prática, os relatos não acompanham necessariamente os placares. Um desenvolvedor que comparou os dois com esforço High publicou em 24 de julho que "GPT 5.6 Sol High is still better at coding than Claude Opus 5 High."

As orientações de migração da Anthropic trazem um ponto útil: o Opus 5 verifica o próprio trabalho. Prompts herdados que acrescentam uma etapa de verificação podem levá-lo a verificar demais e devem ser removidos.

Seguimento de instruções: a diferença apareceu no formato

Dois testes eram, na prática, testes de instrução disfarçados. A tarefa de JSON exigia items em ordem alfabética minúscula, checksum de 14 e nenhuma chave extra. Já a refatoração exigia lançar ValueError, sem comentários e sem docstrings — algo que os modelos frequentemente violam ao documentar o que fizeram. Todos passaram nos dois casos.

O formato da saída, porém, variou. Sol e Luna encapsularam a resposta em LaTex, devolvendo \boxed{65}, enquanto Opus 5 e Terra entregaram apenas o número. Uma regex que extraia o último inteiro suporta os dois formatos; já um parser que espere um numeral isolado ou um campo JSON não. E esses padrões são os que você herda ao trocar claude-opus-5 por gpt-5.6 sem alterar mais nada.

Eficiência de tokens: 1.182 tokens de saída contra 464 do Sol

Dois padrões de configuração explicam de forma plausível a diferença abaixo, e nenhum deles é qualidade. O Opus 5 vem com thinking ativado e esforço high como padrão na API e no Claude Code; uma chamada sem configuração já é uma chamada de raciocínio. O GPT-5.6 usa medium por padrão.

Tokens visíveis de conclusão nas quatro tarefas, com custo calculado pela tarifa oficial de saída. Uma chamada por combinação, sem tentativas extras e com configurações padrão:

ModeloTokens de saídaTarefa de refatoraçãoCusto, apenas saída
Claude Opus 51,182600 tok / 8.3s$0.0296
GPT-5.6 Sol464321 tok / 12.0s$0.0139
GPT-5.6 Terra737603 tok / 11.8s$0.0111
GPT-5.6 Luna612380 tok / 8.7s$0.0037

Esses custos têm duas limitações. Para o mesmo prompt de usuário, o gateway reportou entre 62 e 4.471 tokens de prompt nos modelos GPT, enquanto o Claude ficou entre 592 e 640. As requisições, portanto, não foram idênticas no tráfego real: não há como tirar uma conclusão útil sobre custo de entrada, nem atribuir a diferença de forma limpa.

O guia de raciocínio da OpenAI também omite resumos de raciocínio salvo quando você opta por recebê-los, e o GPT-5.6 cobra esses tokens ocultos como saída. Por isso, os custos dos três GPT subestimam a fatura. Correção é o sinal comparável aqui; tokens e latência servem apenas como indicação.

Gráfico de barras da latência total nas quatro tarefas por modelo: Opus 5 24,6 segundos, Opus 4.8 11,8, Sonnet 5 13,7, GPT-5.6 Terra 22,7, Sol 20,3, Luna 18,4

O gráfico inclui também Opus 4.8 e Sonnet 5, referências do lado Claude na mesma execução. O Opus 5 foi o mais lento dos seis, com 24,6s nas quatro tarefas, contra 20,3s do Sol, 22,7s do Terra e 18,4s do Luna. O Opus 4.8 vem com thinking desativado por padrão e terminou em 11,8s, o que aponta a configuração — e não a capacidade — como causa da diferença.

Ao avaliar o Opus 5 no dia de lançamento, a Artificial Analysis descreveu a configuração de esforço como abrangendo uma faixa de uso de tokens maior do que a dos modelos de outros laboratórios. Na prática, seu custo é mais ajustável do que a tabela de preços sugere.

Preço: o degrau dos 272K, em dólares

Uma frase publicada define a metade financeira do comparativo Claude Opus 5 vs GPT-5.6. Na tarifa principal, os modelos de ponta parecem separados por quase nada: Opus 5 custa $5/$25 por milhão de tokens, e Sol cobra $5 pela entrada e $30 pela saída. O Opus 5 é 17% mais barato na saída e igual na entrada. Isso vale até 272.000 tokens de entrada — e não além.

As três páginas de modelo do GPT-5.6 trazem a mesma frase: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." A cobrança incide sobre a requisição inteira, não apenas sobre os tokens acima do limite. Basta ultrapassar 272K por um token para o Sol cobrar $10/$45 pela chamada toda, enquanto a janela de 1M do Opus 5 continua em $5/$25 de ponta a ponta.

Documentação de preços para desenvolvedores da OpenAI com grupos separados de contexto curto e longo, listando gpt-5.6-sol a $5.00 de entrada e $30.00 de saída, gpt-5.6-terra a $2.50 e $15.00, e gpt-5.6-luna a $1.00 e $6.00 por milhão de tokens

Considere uma requisição agentic com 20.000 tokens de saída e varie a entrada, usando as tarifas publicadas da OpenAI e as tarifas padrão da Anthropic, ambas consultadas em 25 de julho de 2026:

Tokens de entradaClaude Opus 5GPT-5.6 SolGPT-5.6 Terra
200,000$1.50$1.60$0.80
400,000$2.50$4.90$2.45
900,000$5.00$9.90$4.95

Abaixo do limite, os modelos de ponta diferem 7%. Acima dele, Sol custa 1,96x o Opus 5 com 400K de entrada e 1,98x com 900K. Em 100 requisições no perfil de 400K, isso representa $250 contra $490.

Gráfico de linhas do custo por requisição com 20.000 tokens de saída à medida que a entrada cresce até 900K: GPT-5.6 Sol acompanha Claude Opus 5 até 272K, depois salta para $3.90 em 300K e sobe até $9.90, enquanto Opus 5 cresce de modo uniforme até $5.00 e GPT-5.6 Terra sobe no mesmo limite e segue a linha do Opus 5 até $4.95

O Terra é o caso que merece mais atenção. Acima de 272K, ele paga a mesma tarifa de entrada do Opus 5, $5 por milhão. Assim, toda a diferença fica na saída: $2,50 por milhão, ou cinco centavos nesta requisição de 20k tokens de saída, tanto em 300K quanto em 900K. Ela cresce com a saída, não com a entrada. O limite é um degrau discreto na tabela de preços, não a inclinação que um eixo espaçado uniformemente pode sugerir.

Batch, tokenizadores e o canal de compra

As modalidades com desconto preservam a proporção naquela requisição de 400K:

  • Anthropic Batch API: Opus 5 por $2.50/$12.50, levando a requisição a $1.25
  • OpenAI Batch e Flex: 50% de desconto sobre a tarifa padrão; a tarifa de contexto longo do Sol passa a $5/$22.50, ou $2.45 pela mesma chamada

Tarifas por token não são diretamente comparáveis entre fornecedores. A documentação de preços da Anthropic informa que os modelos Claude a partir do 4.7, incluindo o Opus 5, usam um tokenizador mais novo que gera aproximadamente 30% mais tokens para o mesmo texto; a proporção varia conforme conteúdo e idioma. Um documento com 400.000 tokens no GPT-5.6 fica mais perto de 520.000 no Opus 5, elevando a linha de entrada daquela tabela de $2.00 para $2.60. Ainda é menos que os $4.00 do Sol, mas tokenize seus próprios prompts antes de decidir.

O local de compra também importa. A AIReiter revende Claude abaixo da tabela, com Opus 4.8 a $1.56/$7.76 por milhão de tokens, cerca de 69% abaixo do preço oficial. Seu catálogo vai apenas até Fable 5 e Opus 4.8, portanto o Opus 5 ainda não pode ser chamado por lá. Dentro da própria linha da Anthropic, a comparação de equilíbrio é Fable 5 a $10/$50 contra Opus 5 a $5/$25.

Contexto: ambos anunciam 1M, mas só um cobra tarifa fixa

A janela do Opus 5 tem 1.000.000 de tokens e é, ao mesmo tempo, o padrão e o máximo. Não existe uma variante de contexto menor que possa ser selecionada por engano. As três variantes GPT-5.6 oferecem 1.050.000, uma janela 5% maior. A saída máxima é 128.000 nos dois lados, com uma assimetria: na Batch API da Anthropic, o header beta output-300k-2026-03-24 eleva o teto do Opus 5 para 300.000.

O Sol aceita um prompt de 900K tokens e cobra a tarifa de contexto longo pela requisição inteira, deixando cerca de 74% de sua janela anunciada acima da tarifa barata. Capacidade em contexto extenso é outra questão: a análise da Vellum coloca Luna em 41,3% no MRCR, contra 91,5% do Sol e 89,6% do Terra. É motivo suficiente para não usar o tier nano em trabalhos de contexto longo, independentemente do preço. A Anthropic também posiciona o corte de conhecimento do Opus 5 em maio de 2026, enquanto as três páginas do GPT-5.6 indicam 16 de fevereiro de 2026.

Controles de raciocínio: uma escala, dois ajustes

O Opus 5 não exige header beta em nenhum nível de esforço, e o thinking vem ativado por padrão. Desligá-lo tem uma limitação clara: thinking: {"type": "disabled"} só é aceito em esforço high ou menor e retorna 400 em xhigh ou max. A Anthropic aponta isso como uma mudança incompatível com modelos anteriores.

ControleClaude Opus 5GPT-5.6
Escala de esforçolowmediumhighxhighmaxnonelowmediumhighxhighmax
Esforço padrãohigh na API e no Claude Codemedium
Segundo ajustenenhumreasoning.mode: standard (padrão) ou pro
Raciocínio desligadonão disponível acima de esforço higheffort: none

Esses dois valores de modo são tudo o que o guia de raciocínio da OpenAI documenta. A API não expõe um valor ultra, e o mecanismo por trás do modo Pro não é explicado. O changelog de 9 de julho lista raciocínio persistente, esforço max e modo Pro entre as novidades da família.

Na prática, a assimetria é esta: GPT-5.6 consegue eliminar o raciocínio por completo em chamadas críticas para latência, algo que o Opus 5 não permite acima de esforço high. Já o Opus 5 tem uma faixa dinâmica maior dentro do raciocínio. Um desenvolvedor que acompanha os dois chegou a uma escala única entre fornecedores: Luna high, Sol medium, depois Opus medium, high e xhigh.

Disponibilidade, limites de taxa e fine-tuning

O Opus 5 pode ser chamado pela Claude API, Amazon Bedrock como anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code e Claude Cowork. Ele é o novo padrão no Claude Max. O modo rápido da Anthropic, por $10/$50 e cerca de 2,5x mais throughput, existe apenas na Claude API.

As três variantes GPT-5.6 são produtos da API da OpenAI, e o tier gratuito da API não inclui Sol nem Terra. Os limites documentados do Sol vão de 500 RPM no Tier 1 até 15.000 no Tier 5, teto compartilhado pelo Terra. Nenhum dos três suporta fine-tuning ou expõe um snapshot datado; fixar uma versão, portanto, significa usar o ID simples e aceitar atualizações in-place.

Qual modelo usar em cada caso

Comece pelo tamanho da entrada: é o único eixo com uma descontinuidade publicada. Depois, cache, elegibilidade para batch e volume de saída alteram o total.

Abaixo de 272K, os modelos de ponta estão próximos o suficiente para que outros critérios decidam. Acima disso, a economia de tabela favorece o Opus 5 em relação ao Sol por cerca de 2x. Essa vantagem não vale para toda a família: acima do limite, Terra custa $2.45 contra $2.50 do Opus 5 na mesma requisição. A economia em contexto longo é, portanto, uma comparação com Sol, não com GPT-5.6 como um todo.

  • Claude Opus 5: prompts grandes, uma tarifa fixa em toda a janela de 1M, conhecimento até maio de 2026 ou inferência que precise rodar em Bedrock, Google Cloud ou Foundry.
  • GPT-5.6 Terra: o padrão para volume, pois custa menos que o Opus 5 nas duas pontas da faixa.
  • GPT-5.6 Sol: quando o necessário for o modo pro ou o esforço none. Ele justifica o prêmio pelos controles, não por uma vantagem de correção que conseguimos medir.
  • GPT-5.6 Luna: trabalho superficial em alto volume, mantendo-o fora de tarefas com contexto longo.

Claude Opus 5 vs GPT-5.6 se resume a uma decisão por faixa de tamanho da entrada, e os dois fornecedores publicam exatamente onde está esse limite.

Perguntas frequentes

Claude Opus 5 é melhor que GPT-5.6 para programação?

Nas nossas quatro verificações objetivas, Opus 5, Sol, Terra e Luna fizeram 4/4. A correção não os distinguiu nesse tamanho de tarefa, e desenvolvedores que usam os dois com esforço High discordam entre si. O custo é mais claro: acima de 272K tokens de entrada, Opus 5 custa cerca de metade do Sol.

Qual é a diferença entre GPT-5.6 Sol, Terra e Luna?

Preço e uma avaliação qualitativa de raciocínio. Os documentos da OpenAI relacionam Sol ao antigo tier sem sufixo, Terra ao mini e Luna ao nano, cobrando $5/$30, $2.50/$15 e $1/$6 por milhão de tokens abaixo de 272K de entrada. Janela de contexto, saída máxima, corte de conhecimento, modalidades e escala de esforço são idênticos nos três.

Qual IA é melhor, GPT ou Claude?

Depende do eixo analisado, e a maior diferença publicada está em um que nenhum fornecedor promove. O benchlm.ai registra taxa de alucinação AA-Omniscience de 35,9% para Claude Opus 4.8, contra 88,8% para GPT-5.6 Sol, ao mesmo tempo que posiciona Sol à frente nas categorias de matemática, conhecimento e agentes. É a comparação publicada mais próxima; nenhum agregador traz dados de Opus 5 ou Terra ainda. Se respostas erradas custam mais do que respostas ausentes, essa ordem pesa mais que qualquer pontuação de código.

Devo usar GPT-5.6 Terra em vez de Sol?

Para a maior parte do volume, sim. Praticantes que roteiam tarefas por profundidade no r/codex relatam algo próximo de Terra em 75% do trabalho, Luna em 15% e Sol em 10%. A Artificial Analysis argumenta que o tier intermediário é dominado, pois alguma configuração de Luna ou Sol normalmente o iguala por custo igual ou menor. Portanto, teste Terra contra os dois vizinhos antes de presumir que o meio é a escolha segura.

GPT-5.6 tem modo de raciocínio ultra?

A API expõe reasoning.mode com dois valores documentados, standard e pro, além de reasoning.effort de none a max. O modo Pro chegou no changelog de 9 de julho de 2026. Nenhum valor ultra aparece no guia de raciocínio ou nas páginas de modelo da OpenAI.

Leitura complementar