AIREITER

Imagem IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5Mais

Vídeo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1Mais

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5Mais
Em breveSeedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
DOCS APIPREÇOS
BlogAtualizaçõesLLM API GuideClaude API GuideKimi K3 API Guide
TEMPLATES
  • AIReiter
  • Blog
  • Corte de preço do GPT-5.6: quanto Luna e Terra custam agora

Corte de preço do GPT-5.6: quanto Luna e Terra custam agora

Última Atualização: 2026-07-31 11:00:29

O GPT-5.6 Luna ficou 80% mais barato, e o Terra teve corte de 20%, em 30 de julho de 2026. O preço padrão do Sol não mudou. Mas há uma ressalva importante para quem roda agentes com múltiplos turnos: a cobrança pela escrita de cache pode absorver boa parte do desconto antes que ele apareça na fatura.

O que mudou em 30 de julho de 2026

Os novos preços entraram em vigor em 30 de julho de 2026 e valem para os IDs de modelo já existentes. A OpenAI informou que reduziu as duas tarifas após melhorar a eficiência dos sistemas que as atendem. A tarifa padrão do GPT-5.6 Sol permaneceu a mesma.

ModeloID do modeloInput anteriorInput atualOutput anteriorOutput atual
GPT-5.6 Lunagpt-5.6-luna$1.00$0.20$6.00$1.20
GPT-5.6 Terragpt-5.6-terra$2.50$2.00$15.00$12.00
GPT-5.6 Solgpt-5.6-sol$5.00$5.00$30.00$30.00

Preços por 1 milhão de tokens, no tier padrão e para contexto curto, segundo a documentação de preços da API da OpenAI (verificada em 2026-07-31).

Tabela de preços da API da OpenAI mostrando as tarifas por 1 milhão de tokens para gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna

Dizer que “a série GPT-5.6 ficou mais barata” é verdade apenas em dois terços dos casos. Junto dos cortes, a OpenAI lançou um Fast mode para o Sol, por $10.00 de input e $60.00 de output: o dobro da tarifa padrão em troca de até 2.5× mais throughput, sem alterar o modelo subjacente. A documentação informa que o Fast mode é o recurso antes chamado de processamento prioritário. Ou seja: no mesmo dia em que os dois tiers mais baratos caíram de preço, o tier principal ganhou uma opção mais cara.

Gráfico de barras agrupadas comparando o preço combinado de input e output do GPT-5.6 por 1 milhão de tokens antes e depois de 30 de julho

Use o ID explícito do modelo, não apenas o nome da série. O catálogo de modelos da OpenAI lista gpt-5.6 como alias de gpt-5.6-sol; portanto, rotear pelo nome curto esperando o tier econômico resulta em cobrança na tarifa do modelo principal. Revendedores podem sequer oferecer esse alias: no endpoint da AIReiter, gpt-5.6 retorna Model 'gpt-5.6' not found (testado em 2026-07-31).

A reação dos desenvolvedores se concentrou menos no tamanho do corte e mais na dúvida sobre sua sustentabilidade:

Não tem como os modelos 5.6 da OpenAI realmente custarem tão pouco para rodar — título de thread no r/Anthropic

Luna agora bate o GPT-5.4 nano no preço: qual tier escolher

Com $0.20 de input e $1.20 de output, o GPT-5.6 Luna agora custa menos por token de output que o gpt-5.4-nano ($0.20 / $1.25) e é muito mais barato que o gpt-5.4-mini ($0.75 / $4.50). Se você mantinha chamadas aos antigos nano ou mini somente por custo, esse argumento deixou de existir.

Para verificar se o tier barato se sustenta na prática, rodei duas tarefas nos três modelos GPT-5.6 pelo endpoint compatível com OpenAI da AIReiter em 2026-07-31: extração de ticket de suporte para JSON com schema rígido e um problema aritmético de cobrança por tokens, com uma única resposta correta ($23.71). Foram duas execuções de cada uma, com max_tokens: 4000, sem retries e avaliação binária de aprovação/reprovação contra a saída esperada.

TarefaModeloTokens de inputTokens de outputLatência (execução 1 / execução 2)Correto
Ticket → JSONLuna13577–784.0s / 3.5sSim
Terra135462.1s / 2.1sSim
Sol135462.3s / 2.2sSim
Aritmética de cobrançaLuna119111–1223.1s / 4.3sSim
Terra11987–893.8s / 2.8sSim
Sol4,48884–873.5s / 3.2sSim

Dois resultados merecem destaque.

Luna foi o mais lento dos três na extração, e não o mais rápido: 3.5–4.0s, contra 2.1s do Terra. O tier mais barato não é automaticamente o de menor latência.

O Sol reportou 4,488 tokens de input para um prompt que Terra e Luna contabilizaram como 119, sendo 3,840 deles identificados como cached_tokens. O resultado se repetiu exatamente nas duas execuções. Em um prompt trivial ("Reply with only the word OK."), os três informaram os mesmos 24 tokens; logo, a inflação acompanha o prompt, não o modelo. Consigo ver a contagem de tokens, mas não sua causa. Trate isso como comportamento de cobrança medido em um endpoint, e não como uma propriedade documentada do modelo.

Considerando as tarifas padrão oficiais, a mesma resposta correta custou:

Gráfico de barras com o custo medido por 1.000 execuções para Luna, Terra e Sol na mesma tarefa

Por 1.000 execuções: Luna $0.16, Terra $1.29 e Sol $7.73. O Sol cobrou cerca de 6× o Terra e 47× o Luna para retornar o mesmo número de três dígitos.

Esta é uma amostra pequena, de apenas duas execuções em duas tarefas simples; não é um benchmark e não mede qualidade de raciocínio. Ainda assim, ela sustenta uma regra: comece pelo Luna e só escale quando houver falhas mensuradas no seu próprio tráfego. Nestes testes, pagar pelo Sol quando o Terra já acertava não trouxe benefício. A divisão completa por tipo de carga está na tabela final.

Por que um corte de 80% pode não reduzir sua fatura em 80%

A tarifa anunciada cobre tokens novos de input e output. Já o tráfego de agentes com múltiplos turnos é dominado por um terceiro número: as escritas de cache. Nos três tiers do GPT-5.6, uma escrita de cache custa 12.5× mais que uma leitura de cache.

ModeloInput em cache (leitura)Escrita de cacheProporção
GPT-5.6 Luna$0.02$0.2512.5×
GPT-5.6 Terra$0.20$2.5012.5×
GPT-5.6 Sol$0.50$6.2512.5×

Um teste controlado publicado na comunidade de desenvolvedores da OpenAI em 2026-07-11 mostra o tamanho desse impacto. Ao longo de seis turnos sequenciais da Responses API, encadeados com previous_response_id, o Luna consumiu 3% menos tokens de input e 29% menos tokens de output que o gpt-5.4-mini, mas custou 96% mais ($0.0651 contra $0.0332 por conversa). Aproximadamente 70% do input do Luna foi cobrado como escrita de cache. Os números são anteriores ao corte de preço, mas o mecanismo não mudou.

Nessa implementação, a causa tinha correção — e esta é a parte útil. O cache do GPT-5.6 não contabiliza correspondências parciais; portanto, qualquer alteração no prefixo em cache força uma reescrita completa. O autor reconstruía um snapshot crescente da conversa dentro de instructions, invalidando o prefixo a cada turno.

O diagnóstico é contundente: instruções estáveis tiveram cache hit em 15 de 15 turnos de usuário posteriores, enquanto instruções mutáveis tiveram 0 de 15. Ao mover esse contexto para um item de input de desenvolvedor, o adicional do Luna caiu de 96% para 16.7%; então, na avaliação cega do autor, o Luna passou a rodar mais rápido e a receber nota maior que o mini. Nem prompt_cache_key nem pontos de quebra de cache explícitos ajudaram.

Antes de assumir que o desconto chegou até você, faça duas coisas:

  1. Mantenha tudo o que varia fora do prefixo em cache. Texto de sistema, definições de ferramentas e persona devem vir primeiro e permanecer byte a byte idênticos; o estado da conversa deve ficar nos itens de input.
  2. Leia a divisão de volta pela API. usage.prompt_tokens_details.cached_tokens em relação a usage.prompt_tokens mostra a parcela de leituras em cada chamada. Uma proporção baixa em um agente de longa duração é o bug de custo de maior impacto nesta série.

Há três preços diferentes para o GPT-5.6: qual vale para você?

Uma busca pelo preço do GPT-5.6 Luna retorna pelo menos três valores diferentes, e cada um deles é ou foi correto para algum tier. Conferir a que tier uma cotação se refere resolve a maior parte da aparente contradição.

Onde você viuInput / output do LunaO que significa
$0.20 / $1.20Tier padrão, contexto curtoO padrão de uma chamada normal à API
$0.10 / $0.60Tiers Batch e FlexExatamente metade da tarifa padrão, para trabalho assíncrono e de menor prioridade
$0.40 / $2.40Fast modeO dobro da tarifa padrão
$1.00 / $6.00Tarifa padrão anterior a 30 de julhoCorreta até o corte

Há ainda dois modificadores, ambos na mesma documentação de preços: contexto longo cobra 2× a tarifa de input para contexto curto e 1.5× a de output — a linha de contexto longo do Luna é $0.40 / $1.80, e não $0.40 / $2.40 — e a documentação lista um adicional de 10% em endpoints elegíveis de residência de dados para modelos lançados em ou após 2026-03-05, o que inclui toda a família GPT-5.6.

Quando uma página de preços divergir da sua fatura, duas verificações resolvem a questão: localize a data de verificação da página e confronte-a com a documentação oficial de preços para o tier específico que você chama. Agregadores e revendedores também publicam as próprias tarifas, que formam uma terceira categoria: não são necessariamente desatualizadas, apenas diferentes.

Na AIReiter, os três tiers GPT-5.6 custam 50% da tarifa de tabela da OpenAI, e isso acompanhou o corte de 30 de julho: o GPT-5.6 Luna sai por $0.10 / $0.60, o Terra por $1.00 / $6.00 e o Sol por $2.50 / $15.00, com a mesma redução pela metade aplicada ao input em cache e às escritas de cache.

Tabela de preços da AIReiter comparando os preços oficiais da API GPT-5.6 com as tarifas da AIReiter para Luna, Terra e Sol

Para um agente Terra que processa 1 milhão de tokens de input e 200 mil de output por dia, isso representa $4.40 diários na tarifa de tabela, contra $2.20 — mesma chamada, mesmo ID de modelo.

Outro assunto é onde o Luna se posiciona no mercado mais amplo. Na comparação de 30 modelos feita pela VentureBeat em 30 de julho, a tarifa combinada de $1.40 do Luna fica abaixo de Gemini 3.5 Flash-Lite ($2.80) e Gemini 3.1 Flash-Lite ($1.75), mas acima do DeepSeek v4-flash ($0.42). Se custo for seu único critério, as APIs de LLM mais baratas não são da OpenAI.

Perguntas frequentes

O GPT-5.6 Sol também ficou mais barato?

Não. A tarifa padrão do Sol segue em $5.00 de input e $30.00 de output por 1 milhão de tokens. Ele ganhou um Fast mode que custa o dobro e entrega até 2.5× mais throughput.

O GPT-5.6 Luna é agora o modelo de API mais barato?

Não. Com $1.40 por 1 milhão de tokens combinados, ele está entre os modelos mais baratos de séries frontier, mas a tabela da VentureBeat de 30 de julho coloca DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash da Xiaomi ($0.40) e DeepSeek v4-pro ($1.305) abaixo dele.

Por que vejo $1 / $6 para o GPT-5.6 Luna em algumas páginas?

Essa era a tarifa padrão antes de 30 de julho de 2026. Confira a data de verificação informada na página e, depois, confirme na documentação oficial de preços o tier que você utiliza.

O corte de preço vale para Batch e Flex?

Sim. Batch e Flex custam metade da tarifa padrão; portanto, o Luna sai por $0.10 / $0.60 e o Terra por $1.00 / $6.00 nesses tiers, incluindo input em cache e escritas de cache.

Preciso alterar meu código para receber o novo preço?

Não. O corte vale para os IDs de modelo existentes gpt-5.6-luna e gpt-5.6-terra, sem migração. A única alteração que vale fazer é auditar a proporção de leituras de cache, que é onde o desconto mais frequentemente se perde.

Qual tier usar em cada carga de trabalho

Carga de trabalhoTierMotivo
Extração, classificação e sumarização em alto volumeLunaPassou nas duas tarefas de teste; $1.40 combinados por 1 milhão, agora abaixo de gpt-5.4-nano
Chamadas voltadas ao usuário e sensíveis à latênciaTerraFoi mais rápido que o Luna na extração (2.1s contra 3.5–4.0s)
Primeira escalada quando Luna não atingir a barra de qualidadeTerra$14 combinados, contra $35 do Sol
Tarefas em que Terra tenha desempenho mensuravelmente inferior no seu tráfegoSolÚnica justificativa para o custo medido por tarefa de 6× o do Terra
Agentes de múltiplos turnos em qualquer tierCorrija o cache primeiroEscritas de cache custam 12.5× as leituras; um prefixo ruim pesa mais que a escolha do tier

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

GPT-5.6 Luna

Chat

Um modelo de texto GPT-5.6 equilibrado para codificação, escrita e fluxos de trabalho de agentes no dia a dia.

OpenAICriar API Key >

GPT-5.6 Terra

Chat

Um modelo de texto GPT-5.6 mais forte para tarefas de programação e análise com raciocínio intensivo.

OpenAICriar API Key >

GPT-5.6 Sol

Chat

Um modelo de texto premium GPT-5.6 para codificação exigente, raciocínio e trabalho agêntico de longa duração.

OpenAICriar API Key >

Gemini 3.1 Pro

Chat
GoogleCriar API Key >

Gemini 3 Pro

Chat
GoogleCriar API Key >

Posts recentes

Chave de API inválida: diagnostique erros 401 e 403 antes de corrigir

2026-07-31

Como corrigir o erro 429 no OpenRouter: provider ou limite de taxa?

2026-07-31

DeepSeek V4 Flash vs GLM-5.2: atualização 0731 testada

2026-07-31

Inteligência de anúncios B2B só vem do HTML: como criar um parser que resiste a redesigns

2026-07-31
AIREITER

Dúvidas? Entre em contato em
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

Vídeo IA

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

Imagem IA

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.