O que você pode fazer com o GPT-6 Luna
O GPT-6 Luna é o nível rápido e de baixo custo da família GPT-6. Quatro aspectos sobre ele mudam a forma como você projeta soluções, e nenhum deles está nos textos de marketing.
A saída custa 5x mais que a entrada
$0,03 por 1M de entrada contra $0,15 por 1M de saída. Prompts longos são quase gratuitos; respostas longas não. Limitar o número máximo de tokens de conclusão altera sua fatura muito mais do que encurtar o prompt.
Uma janela de 1M com salto de preço em 272K
A janela de contexto é de 1.050.000 tokens, mas ultrapassar 272K tokens de entrada reajusta o preço de toda a requisição para 2x na entrada e 1,5x na saída — não apenas o excedente. Um prompt de 280K tokens custa mais do que dois de 140K.
Ele raciocina antes de responder
Em nossos testes, o primeiro token transmitido levou de 5,0 a 5,6 segundos de uma resposta total de 7,2 a 7,4 segundos. O streaming não oculta esse intervalo. Se você precisa de texto na tela mais rápido, reduza o esforço de raciocínio em vez do limite de saída.
A saída estruturada se mantém sem um schema
Ao solicitar em texto simples quatro campos específicos como JSON, ele retornou exatamente essas quatro chaves em um bloco de código, sem schema, sem definição de função e sem repetições. O exemplo acima é essa resposta sem edições.
Preços do GPT-6 Luna
Tokens de Entrada
$0,03 por 1M de tokens, contra os $0,10 oficiais da OpenAI.
Tokens de Saída
$0,15 por 1M de tokens, contra os $0,50 oficiais da OpenAI.
Leituras de Entrada em Cache
$0,003 por 1M de tokens, contra os $0,01 oficiais da OpenAI.
Faixa de Contexto Longo
Requisições acima de 272K tokens de entrada seguem a sobretaxa da própria OpenAI: 2x na entrada e 1,5x na saída.
Casos de Uso do GPT-6 Luna
Triagem de Suporte a $0,05 por 1.000 Chamados
Resumo mais gravidade, área do produto, versão afetada e uma etiqueta de prioridade, em uma única chamada por chamado. Um backlog de 50.000 chamados é reprocessado por cerca de $2,30.
Enriquecimento em Lote com Prefixo em Cache
Tarefas em lote repetem as mesmas instruções em cada linha. Mantenha esse prefixo idêntico em nível de bytes e a parte repetida será lida a $0,003 por 1M em vez de $0,03 — um décimo do custo de entrada em toda a execução.
Nível Padrão Atrás de um Roteador
Envie tudo para o Luna e escale apenas o que falhar em uma verificação. Como o Sol custa cerca de 20x mais, um roteador que mantém 95% do tráfego no Luna paga cerca de um décimo de um fluxo totalmente baseado em Sol — os 5% que escalam representam metade da fatura restante.
Documentos Inteiros Abaixo da Linha de 272K
Relatórios, transcrições e contratos cabem na janela de 1M, mas mantenha-se abaixo de 272K tokens de entrada por requisição para evitar o reajuste de preço de 2x. Dividir em partes abaixo dessa linha geralmente sai mais barato do que fazer uma única chamada grande.
Como Usar o GPT-6 Luna
O Luna é um modelo voltado para volume, portanto, teste-o da mesma forma que irá executá-lo: em um registro real, com as configurações que você pode manter em escala.
Cole um Registro Real
Use um ticket, transcrição ou documento real em vez de um prompt de teste. O ponto fraco do Luna são entradas desorganizadas, não o raciocínio complexo.
Ajuste para Baixo, Não para Cima
Comece com baixo esforço de raciocínio e um limite restrito de max completion tokens. A saída custa 5x o preço da entrada, portanto, o limite de saída é a alavanca que define sua fatura.
Multiplique a Contagem de Tokens
Pegue o uso informado abaixo da resposta, multiplique pelo seu volume diário e você terá o custo mensal antes de escrever qualquer código de integração.
Desenvolva com a API do GPT-6 Luna
O que importa em uma integração em lote não é a primeira chamada, mas a décima milésima: custo por registro, comportamento de cache e o que acontece quando uma linha falha.
Model ID Drop-In
Aponte um cliente compatível com OpenAI existente para gpt-6-luna e não altere mais nada. Streaming, system prompts e saídas no formato JSON funcionam exatamente como na API upstream.
Prefixos em Cache Valem a Pena Aqui
Trabalhos em lote repetem as mesmas instruções a cada linha. Leituras em cache custam $0.003 por 1M contra $0.03 para entradas novas, então vale a pena estruturar um prefixo de prompt estável.
Contabilidade de Custos por Resposta
Cada resposta reporta entrada, saída, leituras em cache e créditos consumidos, permitindo que um pipeline registre a economia unitária por registro em vez de descobri-la na fatura.
Escale para o GPT-6 Sol Sem Reestruturar
Sol e Luna compartilham o mesmo endpoint, chave e saldo; portanto, rotear uma linha complexa para o nível topo de linha é apenas uma troca de model-ID, não uma segunda integração.
GPT-6 Luna vs GPT-6 Sol vs GPT-5.6 Luna
GPT-6 Luna - cerca de $0.05 por 1.000 tickets
$0.03 de entrada e $0.15 de saída por 1M de tokens no AIReiter, contra os $0.10 e $0.50 oficiais da OpenAI. O nível GPT-6 mais barato e o que faz a conta da automação por registro fechar.
GPT-6 Sol - cerca de $0.91 por 1.000 tickets
$0.60 de entrada e $3.00 de saída por 1M de tokens, aproximadamente 20x o Luna. Vale a pena quando uma tarefa exige raciocínio de ponta; desperdício quando a tarefa é uma extração que o Luna já resolve com precisão.
GPT-5.6 Luna - a geração anterior
Valor oficial de $0.20 de entrada e $1.20 de saída por 1M de tokens. O GPT-6 Luna reduz pela metade o preço oficial de entrada e diminui a saída para menos da metade, na mesma categoria de custo-benefício.
Como escolher
Execute o seu pior registro em ambos os níveis no playground acima. Se a resposta do Luna for suficiente, a diferença de 20x significa que o Sol precisa justificar o custo adicional nessa tarefa específica, e não apenas pela reputação.
FAQ do GPT-6 Luna
Perguntas comuns sobre o playground online, preços e acesso à API.
/ 01Quando devo escolher o GPT-6 Luna?
Escolha o Luna para tarefas de alto volume e bem definidas, como sumarização, extração e classificação. Migre para o GPT-6 Sol apenas quando uma tarefa exigir raciocínio avançado.
/ 02Quanto custa o GPT-6 Luna no AIReiter?
O AIReiter cobra 30% das tarifas oficiais da OpenAI: $0,03 por 1M de tokens de entrada e $0,15 por 1M de tokens de saída, em comparação aos $0,10 e $0,50 oficiais. As leituras de entrada em cache custam $0,003 por 1M.
/ 03Qual é a diferença entre o GPT-6 Luna e o GPT-5.6 Luna?
O GPT-6 Luna é a geração mais recente, pela metade do preço oficial de entrada e um quinto do preço oficial de saída do GPT-5.6 Luna, na mesma categoria de ótimo custo-benefício.
/ 04Qual é a janela de contexto?
O GPT-6 Luna suporta aproximadamente 1M de tokens de entrada e até 128K tokens de saída. Solicitações acima de 272K tokens de entrada são cobradas a 2x na entrada e 1,5x na saída, seguindo a própria política da OpenAI.
/ 05Quão rápido é o GPT-6 Luna?
No AIReiter, uma solicitação de sumarização e extração em um ticket de suporte de 494 tokens retornou 204 tokens de saída em 10,6 segundos sem streaming e de 7,2 a 7,4 segundos de ponta a ponta com streaming. Observe que o Luna raciocina antes de responder: o primeiro token em streaming levou de 5,0 a 5,6 segundos entre as execuções, portanto, a maior parte da espera ocorre antes que qualquer texto apareça. Reduza o esforço de raciocínio se precisar que a resposta comece mais cedo.
/ 06Quanto custa o GPT-6 Luna por 1.000 registros?
Usando essa mesma solicitação medida — 494 tokens de entrada e 204 de saída — cerca de $0,05 por 1.000 tickets nas tarifas do AIReiter. A mesma carga de trabalho no GPT-6 Sol custa aproximadamente $0,91 por 1.000.
/ 07Posso chamar o GPT-6 Luna por meio de uma API?
Sim. Siga a documentação da API vinculada e use o ID de modelo gpt-6-luna no endpoint compatível com a OpenAI.