O GPT-5.6 Luna ficou 80% mais barato, e o Terra teve corte de 20%, em 30 de julho de 2026. O preço padrão do Sol não mudou. Mas há uma ressalva importante para quem roda agentes com múltiplos turnos: a cobrança pela escrita de cache pode absorver boa parte do desconto antes que ele apareça na fatura.
O que mudou em 30 de julho de 2026
Os novos preços entraram em vigor em 30 de julho de 2026 e valem para os IDs de modelo já existentes. A OpenAI informou que reduziu as duas tarifas após melhorar a eficiência dos sistemas que as atendem. A tarifa padrão do GPT-5.6 Sol permaneceu a mesma.
| Modelo | ID do modelo | Input anterior | Input atual | Output anterior | Output atual |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
Preços por 1 milhão de tokens, no tier padrão e para contexto curto, segundo a documentação de preços da API da OpenAI (verificada em 2026-07-31).
Dizer que “a série GPT-5.6 ficou mais barata” é verdade apenas em dois terços dos casos. Junto dos cortes, a OpenAI lançou um Fast mode para o Sol, por $10.00 de input e $60.00 de output: o dobro da tarifa padrão em troca de até 2.5× mais throughput, sem alterar o modelo subjacente. A documentação informa que o Fast mode é o recurso antes chamado de processamento prioritário. Ou seja: no mesmo dia em que os dois tiers mais baratos caíram de preço, o tier principal ganhou uma opção mais cara.
Use o ID explícito do modelo, não apenas o nome da série. O catálogo de modelos da OpenAI lista gpt-5.6 como alias de gpt-5.6-sol; portanto, rotear pelo nome curto esperando o tier econômico resulta em cobrança na tarifa do modelo principal. Revendedores podem sequer oferecer esse alias: no endpoint da AIReiter, gpt-5.6 retorna Model 'gpt-5.6' not found (testado em 2026-07-31).
A reação dos desenvolvedores se concentrou menos no tamanho do corte e mais na dúvida sobre sua sustentabilidade:
Não tem como os modelos 5.6 da OpenAI realmente custarem tão pouco para rodar — título de thread no r/Anthropic
Luna agora bate o GPT-5.4 nano no preço: qual tier escolher
Com $0.20 de input e $1.20 de output, o GPT-5.6 Luna agora custa menos por token de output que o gpt-5.4-nano ($0.20 / $1.25) e é muito mais barato que o gpt-5.4-mini ($0.75 / $4.50). Se você mantinha chamadas aos antigos nano ou mini somente por custo, esse argumento deixou de existir.
Para verificar se o tier barato se sustenta na prática, rodei duas tarefas nos três modelos GPT-5.6 pelo endpoint compatível com OpenAI da AIReiter em 2026-07-31: extração de ticket de suporte para JSON com schema rígido e um problema aritmético de cobrança por tokens, com uma única resposta correta ($23.71). Foram duas execuções de cada uma, com max_tokens: 4000, sem retries e avaliação binária de aprovação/reprovação contra a saída esperada.
| Tarefa | Modelo | Tokens de input | Tokens de output | Latência (execução 1 / execução 2) | Correto |
|---|---|---|---|---|---|
| Ticket → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | Sim |
| Terra | 135 | 46 | 2.1s / 2.1s | Sim | |
| Sol | 135 | 46 | 2.3s / 2.2s | Sim | |
| Aritmética de cobrança | Luna | 119 | 111–122 | 3.1s / 4.3s | Sim |
| Terra | 119 | 87–89 | 3.8s / 2.8s | Sim | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | Sim |
Dois resultados merecem destaque.
Luna foi o mais lento dos três na extração, e não o mais rápido: 3.5–4.0s, contra 2.1s do Terra. O tier mais barato não é automaticamente o de menor latência.
O Sol reportou 4,488 tokens de input para um prompt que Terra e Luna contabilizaram como 119, sendo 3,840 deles identificados como cached_tokens. O resultado se repetiu exatamente nas duas execuções. Em um prompt trivial ("Reply with only the word OK."), os três informaram os mesmos 24 tokens; logo, a inflação acompanha o prompt, não o modelo. Consigo ver a contagem de tokens, mas não sua causa. Trate isso como comportamento de cobrança medido em um endpoint, e não como uma propriedade documentada do modelo.
Considerando as tarifas padrão oficiais, a mesma resposta correta custou:
Por 1.000 execuções: Luna $0.16, Terra $1.29 e Sol $7.73. O Sol cobrou cerca de 6× o Terra e 47× o Luna para retornar o mesmo número de três dígitos.
Esta é uma amostra pequena, de apenas duas execuções em duas tarefas simples; não é um benchmark e não mede qualidade de raciocínio. Ainda assim, ela sustenta uma regra: comece pelo Luna e só escale quando houver falhas mensuradas no seu próprio tráfego. Nestes testes, pagar pelo Sol quando o Terra já acertava não trouxe benefício. A divisão completa por tipo de carga está na tabela final.
Por que um corte de 80% pode não reduzir sua fatura em 80%
A tarifa anunciada cobre tokens novos de input e output. Já o tráfego de agentes com múltiplos turnos é dominado por um terceiro número: as escritas de cache. Nos três tiers do GPT-5.6, uma escrita de cache custa 12.5× mais que uma leitura de cache.
| Modelo | Input em cache (leitura) | Escrita de cache | Proporção |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
Um teste controlado publicado na comunidade de desenvolvedores da OpenAI em 2026-07-11 mostra o tamanho desse impacto. Ao longo de seis turnos sequenciais da Responses API, encadeados com previous_response_id, o Luna consumiu 3% menos tokens de input e 29% menos tokens de output que o gpt-5.4-mini, mas custou 96% mais ($0.0651 contra $0.0332 por conversa). Aproximadamente 70% do input do Luna foi cobrado como escrita de cache. Os números são anteriores ao corte de preço, mas o mecanismo não mudou.
Nessa implementação, a causa tinha correção — e esta é a parte útil. O cache do GPT-5.6 não contabiliza correspondências parciais; portanto, qualquer alteração no prefixo em cache força uma reescrita completa. O autor reconstruía um snapshot crescente da conversa dentro de instructions, invalidando o prefixo a cada turno.
O diagnóstico é contundente: instruções estáveis tiveram cache hit em 15 de 15 turnos de usuário posteriores, enquanto instruções mutáveis tiveram 0 de 15. Ao mover esse contexto para um item de input de desenvolvedor, o adicional do Luna caiu de 96% para 16.7%; então, na avaliação cega do autor, o Luna passou a rodar mais rápido e a receber nota maior que o mini. Nem prompt_cache_key nem pontos de quebra de cache explícitos ajudaram.
Antes de assumir que o desconto chegou até você, faça duas coisas:
- Mantenha tudo o que varia fora do prefixo em cache. Texto de sistema, definições de ferramentas e persona devem vir primeiro e permanecer byte a byte idênticos; o estado da conversa deve ficar nos itens de input.
- Leia a divisão de volta pela API.
usage.prompt_tokens_details.cached_tokensem relação ausage.prompt_tokensmostra a parcela de leituras em cada chamada. Uma proporção baixa em um agente de longa duração é o bug de custo de maior impacto nesta série.
Há três preços diferentes para o GPT-5.6: qual vale para você?
Uma busca pelo preço do GPT-5.6 Luna retorna pelo menos três valores diferentes, e cada um deles é ou foi correto para algum tier. Conferir a que tier uma cotação se refere resolve a maior parte da aparente contradição.
| Onde você viu | Input / output do Luna | O que significa |
|---|---|---|
| $0.20 / $1.20 | Tier padrão, contexto curto | O padrão de uma chamada normal à API |
| $0.10 / $0.60 | Tiers Batch e Flex | Exatamente metade da tarifa padrão, para trabalho assíncrono e de menor prioridade |
| $0.40 / $2.40 | Fast mode | O dobro da tarifa padrão |
| $1.00 / $6.00 | Tarifa padrão anterior a 30 de julho | Correta até o corte |
Há ainda dois modificadores, ambos na mesma documentação de preços: contexto longo cobra 2× a tarifa de input para contexto curto e 1.5× a de output — a linha de contexto longo do Luna é $0.40 / $1.80, e não $0.40 / $2.40 — e a documentação lista um adicional de 10% em endpoints elegíveis de residência de dados para modelos lançados em ou após 2026-03-05, o que inclui toda a família GPT-5.6.
Quando uma página de preços divergir da sua fatura, duas verificações resolvem a questão: localize a data de verificação da página e confronte-a com a documentação oficial de preços para o tier específico que você chama. Agregadores e revendedores também publicam as próprias tarifas, que formam uma terceira categoria: não são necessariamente desatualizadas, apenas diferentes.
Na AIReiter, os três tiers GPT-5.6 custam 50% da tarifa de tabela da OpenAI, e isso acompanhou o corte de 30 de julho: o GPT-5.6 Luna sai por $0.10 / $0.60, o Terra por $1.00 / $6.00 e o Sol por $2.50 / $15.00, com a mesma redução pela metade aplicada ao input em cache e às escritas de cache.
Para um agente Terra que processa 1 milhão de tokens de input e 200 mil de output por dia, isso representa $4.40 diários na tarifa de tabela, contra $2.20 — mesma chamada, mesmo ID de modelo.
Outro assunto é onde o Luna se posiciona no mercado mais amplo. Na comparação de 30 modelos feita pela VentureBeat em 30 de julho, a tarifa combinada de $1.40 do Luna fica abaixo de Gemini 3.5 Flash-Lite ($2.80) e Gemini 3.1 Flash-Lite ($1.75), mas acima do DeepSeek v4-flash ($0.42). Se custo for seu único critério, as APIs de LLM mais baratas não são da OpenAI.
Perguntas frequentes
O GPT-5.6 Sol também ficou mais barato?
Não. A tarifa padrão do Sol segue em $5.00 de input e $30.00 de output por 1 milhão de tokens. Ele ganhou um Fast mode que custa o dobro e entrega até 2.5× mais throughput.
O GPT-5.6 Luna é agora o modelo de API mais barato?
Não. Com $1.40 por 1 milhão de tokens combinados, ele está entre os modelos mais baratos de séries frontier, mas a tabela da VentureBeat de 30 de julho coloca DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash da Xiaomi ($0.40) e DeepSeek v4-pro ($1.305) abaixo dele.
Por que vejo $1 / $6 para o GPT-5.6 Luna em algumas páginas?
Essa era a tarifa padrão antes de 30 de julho de 2026. Confira a data de verificação informada na página e, depois, confirme na documentação oficial de preços o tier que você utiliza.
O corte de preço vale para Batch e Flex?
Sim. Batch e Flex custam metade da tarifa padrão; portanto, o Luna sai por $0.10 / $0.60 e o Terra por $1.00 / $6.00 nesses tiers, incluindo input em cache e escritas de cache.
Preciso alterar meu código para receber o novo preço?
Não. O corte vale para os IDs de modelo existentes gpt-5.6-luna e gpt-5.6-terra, sem migração. A única alteração que vale fazer é auditar a proporção de leituras de cache, que é onde o desconto mais frequentemente se perde.
Qual tier usar em cada carga de trabalho
| Carga de trabalho | Tier | Motivo |
|---|---|---|
| Extração, classificação e sumarização em alto volume | Luna | Passou nas duas tarefas de teste; $1.40 combinados por 1 milhão, agora abaixo de gpt-5.4-nano |
| Chamadas voltadas ao usuário e sensíveis à latência | Terra | Foi mais rápido que o Luna na extração (2.1s contra 3.5–4.0s) |
| Primeira escalada quando Luna não atingir a barra de qualidade | Terra | $14 combinados, contra $35 do Sol |
| Tarefas em que Terra tenha desempenho mensuravelmente inferior no seu tráfego | Sol | Única justificativa para o custo medido por tarefa de 6× o do Terra |
| Agentes de múltiplos turnos em qualquer tier | Corrija o cache primeiro | Escritas de cache custam 12.5× as leituras; um prefixo ruim pesa mais que a escolha do tier |