AIREITER

GPT-5.6 Sol vs. GPT-5.5: Mesmo preço, conta diferente (testado)

Última Atualização: 2026-07-29 12:47:49

Uma dúvida aparece repetidamente no r/codex: quem usava GPT-5.5 em extra-high deve escolher Sol ou Terra? A resposta curta é que o GPT-5.6 Sol tem exatamente o mesmo preço de API listado para o GPT-5.5 e supera o antecessor em benchmarks de agentes. Para agentes de longa duração e tarefas de navegação, o upgrade pode sair praticamente de graça.

O problema é que “mesmo preço” não significa necessariamente a mesma fatura. O Sol cobra por gravações de cache, algo que o GPT-5.5 não fazia, e também tende a raciocinar por mais tempo. Na prática, o gasto por tarefa pode se multiplicar mesmo sem nenhuma alteração na tabela de preços.

A tabela de preços é igual, mas a conta não

GPT-5.6 Sol e GPT-5.5 têm a mesma precificação padrão de API: $5.00 por milhão de tokens de entrada, $30.00 por milhão de tokens de saída e $0.50 para entrada em cache. Consultei as duas linhas na página de preços da OpenAI em 29 de julho de 2026:

Tabela de preços da API da OpenAI mostrando gpt-5.6-sol e gpt-5.5 com as mesmas tarifas de $5 para entrada e $30 para saída

Três itens da tabela diferenciam os modelos:

ItemGPT-5.6 SolGPT-5.5
Entrada / saída (por 1M de tokens)$5.00 / $30.00$5.00 / $30.00
Entrada em cache$0.50$0.50
Gravações de cache$6.25sem cobrança
Contexto longo (>272K), entrada / saída$10.00 / $45.00$10.00 / $45.00

A cobrança por gravação de cache é o ponto mais sensível em uma migração. O GPT-5.6 introduz pontos de quebra explícitos no cache, com duração mínima de 30 minutos (a análise da Vellum explica o mecanismo), e a gravação custa 1,25x a tarifa de entrada sem cache, enquanto as leituras continuam com desconto de 90%. Pela conta da tabela: um segmento em cache custa $6.25 para gravar, mais $0.50 por leitura, contra $5.00 para reenviar uma entrada sem cache. Portanto, o cache se paga a partir do segundo reuso. Já um pipeline que grava mais do que lê passa a pagar uma taxa que não existia no GPT-5.5.

O segundo custo tem a ver com o tempo de raciocínio. O Sol pensa por mais tempo antes de responder, e tokens de raciocínio são cobrados como saída. Usuários do Codex que migraram relatam esse efeito de forma direta:

“O 5.6 Sol medium custa três vezes mais que o 5.5-xhigh, entregando a mesma qualidade de código, pelo menos no lançamento do 5.5.” — r/codex, “Tabela de conversão entre GPT 5.5 e 5.6”

A tabela de preços é a mesma, mas o custo por tarefa pode triplicar porque o modelo usa três vezes mais tokens para chegar à resposta. Já o anúncio do GPT-5.6 pela OpenAI aponta na direção oposta: 22% menos tokens de entrada e 23% menos tokens de saída em comparação com o GPT-5.5 nas avaliações internas da empresa. As duas afirmações podem ser verdadeiras ao mesmo tempo: o modelo ficou mais eficiente por unidade de raciocínio, mas configurações de esforço mais altas raciocinam muito mais. O resultado que você verá depende do nível de esforço escolhido.

Onde o GPT-5.6 Sol realmente avançou

Em avaliações independentes, GPT-5.6 Sol e GPT-5.5 estão quase empatados em inteligência bruta: a Artificial Analysis dá 54 pontos ao Sol (medium) no Intelligence Index v4.1, contra 53 do GPT-5.5 (high), com o mesmo custo combinado de $4.35 por milhão de tokens. Os ganhos mais relevantes aparecem em outros pontos:

  • Latência até o primeiro token: 4.13 segundos no Sol, contra 16.67 segundos no GPT-5.5 (high), uma diferença de 4x. Em ferramentas interativas e loops de agentes que fazem dezenas de chamadas sequenciais, esta é a evolução mais perceptível no uso diário.
  • Benchmarks de agentes: o Sol alcança 88.8% no Terminal-Bench 2.1 e 92.2% no BrowseComp. Os maiores avanços desta geração estão concentrados no uso prolongado de ferramentas.
  • Contexto: 1M de tokens no Sol, contra 922K no GPT-5.5, além de raciocínio que persiste entre turnos da conversa, conforme documentado na mesma análise da Vellum citada acima.
  • Velocidade de saída: aqui está a regressão. O Sol transmite 65 tokens por segundo, contra 77.3 no GPT-5.5. Trabalhos de geração em volume ficam mais lentos, não mais rápidos.

A suíte de programação de longo horizonte da CodeRabbit, com mais de 100 tarefas em cinco linguagens, coloca o Sol em 63.7% de aprovação. No benchmark de revisão de código, o Sol adicionou 7.4 pontos percentuais sobre uma integração de referência. Há uma ressalva: a precisão das revisões do Sol foi de 31.6%, ou seja, ele encontra mais problemas reais, mas também os mistura a mais ruído. Os mesmos testes registraram o Sol gastando 8 rodadas em uma alteração simples depois de seguir um caminho errado. Ser melhor em tarefas de maratona não o torna imune a becos sem saída.

Rodei os mesmos três prompts nos dois modelos

Benchmarks favorecem tarefas de longo prazo, mas a maior parte das chamadas de API é curta. Por isso, em 29 de julho de 2026, enviei os mesmos três prompts para gpt-5.6-sol e gpt-5.5: uma correção de bug no tratamento de datas em Python, um quebra-cabeça de lógica com exatamente duas respostas válidas e uma extração rigorosa em JSON com uma armadilha — uma data sem ano, que pelas regras deveria virar null, e não uma estimativa. Foi uma chamada de API por tarefa, com esforço de raciocínio padrão, sem ferramentas e sem tentativas adicionais. É uma amostra pequena, não um benchmark.

Os dois modelos acertaram as três tarefas. O GPT-5.5 corrigiu o bug de travamento em dezembro com calendar.monthrange; o Sol montou manualmente uma tabela correta de anos bissextos. Ambos encontraram exatamente as duas ordens válidas de implantação, retornaram JSON idêntico byte a byte na extração e se recusaram a inventar um ano para “o dia 14 de julho”.

O consumo de tokens e a velocidade dividiram o resultado:

Tokens de conclusão por tarefa: o GPT-5.6 Sol usou 625/143/96 tokens, contra 513/334/160 do GPT-5.5 Latência total por tarefa: o Sol levou 19.8s/5.6s/5.7s, contra 13.8s/9.3s/5.5s do GPT-5.5

No total, o Sol gastou menos tokens de conclusão, 864 contra 1,007, mas foi mais lento e mais prolixo na tarefa de código: 19.8 segundos e 625 tokens, contra 13.8 segundos e 513. No problema de lógica, a situação se inverteu: o Sol respondeu em 5.6 segundos com 143 tokens, enquanto o GPT-5.5 levou 9.3 segundos e usou 334. Depois de acompanhar ambos, minha conclusão é que os modelos são intercambiáveis em tarefas curtas e bem especificadas. Nada neste teste, isoladamente, justificaria uma migração. O argumento a favor do upgrade depende inteiramente do trabalho com agentes e contexto longo mostrado na seção de benchmarks.

Como converter o nível de esforço do GPT-5.5 para o 5.6

Segundo a análise da Vellum citada acima, o ID de modelo simples gpt-5.6 direciona para gpt-5.6-sol por padrão. Quem atualiza apenas trocando o alias acaba no nível principal — e com a conta do nível principal — sem fazer essa escolha conscientemente. Em uma migração planejada, três dados ajudam a estabelecer a equivalência:

  1. GPT-5.5 xhigh → Sol medium é a equivalência prática usada pela comunidade. O relato do r/codex citado acima encontrou paridade de qualidade com o 5.5 e um custo por tarefa cerca de 3x maior no lançamento. Use isso como uma hipótese inicial a validar com seus próprios prompts, não como garantia. Workloads sensíveis a custo que rodavam em 5.5 high estão mais próximos do GPT-5.6 Terra, a $2.50/$15, metade da tabela de preços do Sol.
  2. O tempo de raciocínio aumenta muito no topo. Usuários do ChatGPT Pro relatam que o GPT-5.6 passa 20–50 minutos em tarefas nas quais o 5.5 Pro levava 5–10 minutos. É uma observação no ChatGPT, mas a mesma pilha de raciocínio é cobrada como tokens de saída na API. A configuração reasoning.mode: "pro" está disponível nas três variantes 5.6, portanto esse teto é opcional.
  3. Seus prompts antigos podem atrapalhar o novo modelo. A equipe de testes da Every.to constatou que a qualidade da saída do Sol melhorou muito somente depois que removeram instruções defensivas escritas para modelos antigos. Regras como “sempre confira X” faziam o Sol verificar demais e construir mais do que o necessário. Migre o modelo e depois revise o prompt de sistema: a estrutura paranoica que o GPT-5.5 exigia agora virou um custo.

Quem deve migrar e quem deve ficar no GPT-5.5

Migre para o GPT-5.6 Sol se seu workload é baseado em agentes: uso de ferramentas em múltiplas etapas, pesquisa com navegação ou sessões de código na escala de um repositório. É nesse cenário que entram os 88.8% no Terminal-Bench e os 92.2% no BrowseComp, e a redução de 4x na latência até o primeiro token se acumula em cada iteração do loop. Com a mesma tabela de $5/$30, o salto de capacidade não custa mais — desde que os tokens extras de raciocínio e as gravações de cache não consumam a diferença. O contexto de 1M e a persistência de raciocínio entre turnos eliminam duas soluções alternativas que os pipelines do 5.5 precisavam criar.

Fique no GPT-5.5, por enquanto, se o tráfego consiste em chamadas curtas e bem especificadas: extração, classificação, correções pontuais de código e geração em alto volume. Meu teste com três prompts colocou os modelos em paridade exatamente nesse tipo de trabalho, e o streaming mais lento do Sol, 65 contra 77.3 tokens por segundo, torna jobs em volume objetivamente piores. Pipelines que fazem muitas gravações de cache devem calcular a linha de $6.25 antes de migrar. E, se o objetivo do upgrade for reduzir a fatura mantendo qualidade parecida, a resposta é Terra, não Sol.

Fiz meu comparativo direto pelo AIReiter, que disponibiliza gpt-5.6-sol e gpt-5.5 com uma única chave de API. Assim, trocar a string do modelo basta para fazer o teste A/B: compare taxa de sucesso, latência de ponta a ponta e tokens de conclusão por tarefa no seu próprio tráfego.

Perguntas frequentes

O GPT-5.6 Sol é melhor que o GPT-5.5?

Em tarefas de agentes, claramente: 88.8% no Terminal-Bench 2.1, 92.2% no BrowseComp e latência até o primeiro token 4x menor. Em tarefas curtas e únicas, a avaliação independente separa os dois por apenas um ponto, 54 contra 53 na Artificial Analysis, e meus testes com os mesmos prompts não encontraram diferença de acerto.

O GPT-5.6 Sol custa mais que o GPT-5.5?

O preço listado é idêntico: $5 de entrada e $30 de saída por milhão de tokens. O Sol adiciona uma cobrança de $6.25 por gravação de cache, que o GPT-5.5 não tinha, e em níveis mais altos de esforço usa mais tokens de raciocínio por tarefa. Usuários do r/codex mediram um custo por tarefa aproximadamente 3x maior com paridade de qualidade em relação ao 5.5 xhigh.

Qual é o equivalente ao GPT-5.5 xhigh no GPT-5.6?

O Sol com esforço medium entrega qualidade de código comparável por cerca de três vezes o custo por tarefa. Se a paridade de custo for mais importante que o teto de capacidade, o Terra é o equivalente econômico mais próximo.

Ainda posso usar o GPT-5.5 depois de atualizar?

Sim. O GPT-5.5 continua listado na página de preços da OpenAI com tarifas inalteradas, verificadas em 29 de julho de 2026, como mostra a captura acima. Portanto, a migração ainda não é obrigatória.

A decisão em uma tabela

Seu workloadEscolhaFator decisivo
Agentes de múltiplas etapas, navegação, código na escala de repositóriosGPT-5.6 Sol88.8% no Terminal-Bench, latência até o primeiro token 4x menor, mesma tabela de preços
Extração / classificação / correções pontuais curtasGPT-5.5 (por enquanto)Paridade nos testes com os mesmos prompts; o 5.5 transmite 19% mais rápido
Muitas gravações de cache de promptGPT-5.5, ou reprojete primeiroA tarifa de $6.25/1M por gravação de cache do Sol é nova
Mesma qualidade, fatura menorGPT-5.6 Terra$2.50/$15, metade do preço do Sol; veja acima a comparação entre Terra e 5.5
Máxima profundidade de raciocínioSol com reasoning.mode: "pro"Deliberação de 20–50 min onde o 5.5 levava 5–10