AIREITER

Preços da API do GPT-6 Sol e Luna: custos, limites e qual escolher

Última Atualização: 2026-09-23 19:10:34

Na tabela de preços, o GPT-6 Sol parece simples: custa US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. O GPT-6 Luna sai por US$ 0,10 e US$ 0,50, respectivamente. O problema começa quando entram na conta cache, prompts longos, esforço de raciocínio e tarefas que precisam ser refeitas. Para extração e roteamento em alto volume, comece pelo Luna; para uso geral na API, o Sol é a opção mais equilibrada; e deixe o Astra para os casos em que uma execução complexa com falha custa mais do que a economia de tokens.

A escolha depende do custo da tarefa, não só do preço por token

O GPT-6 Sol e o GPT-6 Luna são modelos comerciais de API lançados em 22 de setembro de 2026. A OpenAI posiciona o Sol como a opção mais forte para uso geral e o Luna como o modelo eficiente para tarefas focadas e repetitivas. Segundo a documentação dos modelos GPT-6, os dois têm janela de contexto de 1,05 milhão de tokens e suportam até 128.000 tokens de saída.

Na prática, a divisão é esta:

Carga de trabalhoPonto de partidaPor quê
Classificação, extração, roteamento e resumoGPT-6 LunaMenor preço publicado por token e alto throughput
Agentes de programação, chamadas de ferramentas e tráfego de produção mistoGPT-6 SolMuito mais barato que o Astra sem cair no mesmo nível de qualidade do Luna
Tarefas complexas, com várias etapas e sensíveis a falhasGPT-6 AstraOs próprios gráficos da OpenAI ainda colocam o Astra acima do Sol e do Luna nas avaliações com esforço máximo

Isso é uma decisão de roteamento — não significa que o modelo mais barato sempre produza a tarefa concluída mais barata. Uma nova tentativa, um campo ausente ou uma chamada de ferramenta incorreta podem consumir rapidamente a economia obtida nos tokens.

Preços da API do GPT-6 Sol e Luna, item por item

A tabela abaixo usa as tarifas padrão publicadas na documentação de preços da API da OpenAI, por milhão de tokens.

Item da cobrançaGPT-6 SolGPT-6 Luna
EntradaUS$ 2,00US$ 0,10
Entrada em cacheUS$ 0,20US$ 0,01
Gravação no cacheUS$ 2,50US$ 0,125
SaídaUS$ 10,00US$ 0,50
Entrada acima de 272 mil tokensUS$ 4,00US$ 0,20
Saída acima de 272 mil tokensUS$ 15,00US$ 0,75
Entrada em Batch/FlexUS$ 1,00US$ 0,05
Saída em Batch/FlexUS$ 5,00US$ 0,25
Entrada no modo FastUS$ 4,00US$ 0,20
Saída no modo FastUS$ 20,00US$ 1,00

Os IDs dos modelos na API são gpt-6-sol e gpt-6-luna. Os dois estão disponíveis em Responses e Chat Completions, com as diferenças de recursos descritas nas respectivas páginas de modelo. Se a aplicação depende de chamadas de ferramentas com raciocínio habilitado, verifique a combinação entre endpoint e nível de esforço antes de trocar o ID do modelo: a compatibilidade também entra no custo da migração.

Em comparação com as tarifas promocionais divulgadas para o GPT-5.6, o Sol cai de US$ 4/US$ 20 para US$ 2/US$ 10. O Luna passa de US$ 0,20/US$ 1,20 para US$ 0,10/US$ 0,50. As reduções de entrada e entrada em cache são exatamente de metade; no Luna, a queda no preço da saída é maior que 50%. A comparação de lançamento da OpenAI descreve as novas tarifas como 50% menores que os preços promocionais do GPT-5.6, portanto trate esse dado como uma referência datada.

O que realmente muda o valor da fatura

Os preços de destaque escondem três decisões de cobrança importantes para quem usa a API em produção.

Contexto longo é útil, mas não sai barato

Solicitações com mais de 272.000 tokens de entrada são cobradas pelas tarifas maiores de contexto longo. A janela de contexto chega a 1,05 milhão de tokens, mas isso não funciona como uma franquia gratuita. Uma solicitação no Sol com 300.000 tokens de entrada e 20.000 tokens de saída custa aproximadamente US$ 1,20 pela entrada e US$ 0,30 pela saída — US$ 1,50 antes de outros ajustes. No Luna, a mesma solicitação fica em cerca de US$ 0,06 mais US$ 0,015, totalizando US$ 0,075.

O cache começa a compensar na reutilização

Gravar no cache custa mais do que enviar um token de entrada normalmente: US$ 2,50 por milhão no Sol e US$ 0,125 no Luna. Ler do cache custa 10% do valor normal da entrada. Em um prompt de sistema estável e reutilizado em várias solicitações, a primeira gravação é seguida por leituras muito mais baratas. Para prompts usados uma única vez, o cache não gera economia por si só.

A OpenAI também afirma que o cache do GPT-6 tolera melhor mudanças como o nível de esforço de raciocínio e a configuração de ferramentas. Ainda assim, meça a taxa real de acertos do cache em vez de presumir que toda solicitação visualmente parecida compartilha o mesmo prefixo.

Batch e Fast resolvem problemas opostos

Batch e Flex reduzem pela metade as tarifas padrão de entrada e saída. São opções adequadas para classificação offline, extração em massa e avaliações que não precisam de resposta imediata. O modo Fast dobra as tarifas padrão: ele compra latência, não desconto.

Por exemplo, um trabalho em batch com 10 milhões de tokens de entrada e 1 milhão de tokens de saída no Luna custa US$ 0,50 + US$ 0,25 = US$ 0,75. O mesmo trabalho usando as tarifas padrão custa US$ 1,00 + US$ 0,50 = US$ 1,50. No modo Fast, o valor seria US$ 3,00 para esses mesmos volumes de tokens.

Como escolher entre Luna, Sol e Astra

O GPT-6 Luna é o primeiro modelo que faz sentido testar em filas grandes. Os dados de lançamento compilados pela Digital Applied mostram que as melhores pontuações do Luna ficaram abaixo das do Sol nos benchmarks de agentes da OpenAI, mas o custo por tarefa é muito menor. No esforço máximo, o Luna chegou a 66,6% no DeepSWE, por US$ 0,22 por tarefa, enquanto o Sol atingiu 68,8%, por US$ 2,74, na tabela divulgada pelo fornecedor. Esses não são preços universais — seus prompts e sua política de novas tentativas determinam a fatura —, mas os números explicam por que o Luna é uma boa opção para roteamento e tarefas em segundo plano.

O GPT-6 Sol é o ponto de partida mais seguro para uma API de uso geral. A Capital & Compute relata que o Sol e o Claude Sonnet 5 têm as mesmas tarifas publicadas: US$ 2 para entrada, US$ 10 para saída e US$ 0,20 para entrada em cache. A comparação independente da Intelligence Index favoreceu o Sol, mas a própria página alerta que um benchmark agregado não mede a adequação ao seu conjunto de ferramentas. Use o Sol quando uso de ferramentas, programação e completude da saída forem importantes o bastante para que os erros mais baratos do Luna acabem saindo caros.

O GPT-6 Astra continua sendo a opção de escalada. Na tabela de esforço máximo da própria OpenAI, o Astra fica à frente do Sol no AutomationBench, Agents’ Last Exam, FrontierCode, DeepSWE e OSWorld, além de apresentar uma taxa menor de erros factuais. São resultados do fornecedor, não uma garantia para a sua carga de trabalho, mas eles justificam manter o Astra como fallback acionado por falhas, em vez de encaminhar todas as solicitações para ele.

Uma discussão com usuários reais mostra por que esse fallback é importante. Em uma thread do Reddit sobre Luna 6 contra Luna 5.6, u/AdmiralMcNugget escreveu: “Ele respondeu à pergunta que você fez. Faça a pergunta que realmente quer: ‘Quais itens atendem a este critério?’” (thread). É a experiência de um usuário, não um resultado de benchmark, mas ela aponta para uma verificação de produção que vale a pena adicionar: testar se o modelo devolve a lista solicitada ou apenas um resumo tecnicamente correto.

O que as primeiras evidências realmente mostram

As evidências sustentam uma tese forte de redução de custo e uma conclusão mais cautelosa sobre capacidade.

Os materiais de lançamento da OpenAI afirmam que o Sol e o Luna são mais baratos que o GPT-5.6 e posicionam o Astra como o modelo topo de linha. A análise da Digital Applied sobre os gráficos de lançamento descobriu que o GPT-5.6 Sol ainda marcou mais pontos que o GPT-6 Sol em dois gráficos citados — DeepSWE e OSWorld — embora o modelo mais novo tenha custado menos por tarefa no cenário divulgado. A Capital & Compute também alerta que os ambientes de benchmark dos fornecedores e os ambientes de benchmarks independentes não são automaticamente comparáveis.

O feedback inicial dos usuários é misto nas discussões citadas. Alguns usuários da API dizem que o preço mais baixo torna o Luna melhor para seu caso; outros relatam respostas mais curtas ou menos completas e a necessidade de escrever prompts mais elaborados. A pergunta operacional recorrente não é “qual modelo vence?”, mas sim: “A redução na fatura de tokens continua existindo depois de considerar novas tentativas, campos ausentes e falhas em chamadas de ferramentas?”

Faça uma avaliação pequena com um conjunto de casos separado e acompanhe três medidas: custo por tarefa concluída, taxa de follow-up necessário e taxa de erros críticos. Compare o Luna no esforço máximo e o Sol em xhigh ou max com o modelo usado atualmente. Mantenha o benchmark fixo; mudar os prompts e as configurações de esforço ao mesmo tempo torna o resultado difícil de interpretar.

FAQ sobre a API do GPT-6 Sol e Luna

Quanto custa a API do GPT-6 Sol?

O GPT-6 Sol custa US$ 2 por milhão de tokens de entrada, US$ 0,20 por milhão de tokens de entrada em cache e US$ 10 por milhão de tokens de saída. As gravações no cache custam US$ 2,50 por milhão de tokens.

Quanto custa a API do GPT-6 Luna?

O GPT-6 Luna custa US$ 0,10 por milhão de tokens de entrada, US$ 0,01 por milhão de tokens de entrada em cache e US$ 0,50 por milhão de tokens de saída. As gravações no cache custam US$ 0,125 por milhão de tokens.

Qual é melhor para agentes de programação: GPT-6 Sol ou Luna?

Comece pelo Sol quando a qualidade do código e a confiabilidade das chamadas de ferramentas forem importantes. Teste o Luna para subagentes em segundo plano e tarefas repetitivas nas quais o custo menor por tarefa concluída pese mais que a capacidade de ponta.

O GPT-6 Sol e o Luna têm preços para contexto longo?

Sim. Acima de 272.000 tokens de entrada, as tarifas publicadas sobem para US$ 4/US$ 15 na entrada/saída do Sol e US$ 0,20/US$ 0,75 na entrada/saída do Luna. A solicitação inteira fica sujeita à regra de preços para contexto longo.

Batch e Flex são mais baratos?

Sim. A OpenAI lista metade das tarifas padrão de entrada e saída para processamento em Batch ou Flex. Essas modalidades foram criadas para trabalhos que podem esperar, não para solicitações interativas.

Qual modelo devo usar primeiro?

Use o Luna para tarefas estruturadas e em alto volume; o Sol para a maior parte do tráfego de produção na API; e o Astra para trabalhos em que uma execução com falha custe mais do que a diferença de preço. Valide esse roteamento usando o custo da tarefa concluída no seu cenário, não apenas o preço por token.

A recomendação prática

Migre primeiro as tarefas previsíveis e de alto volume para o GPT-6 Luna. Mantenha o GPT-6 Sol atrás da mesma interface para tráfego com programação e uso intenso de ferramentas, e preserve o GPT-6 Astra como rota de escalada. Essa estrutura em três níveis captura a redução de preço sem presumir que um token mais barato resulte automaticamente em um resultado mais barato.