Não faça seu orçamento considerando apenas os valores chamativos de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Requisições com mais de 272.000 tokens de entrada passam a usar uma tarifa maior para a solicitação inteira. Além disso, o acesso ao GPT-6 Astra ainda está sendo liberado gradualmente — ter a documentação em mãos não garante que sua conta já possa chamá-lo.
Preços da API GPT-6 Astra em resumo
A tabela abaixo foi extraída da página oficial do modelo da OpenAI. Prompts em cache, requisições com contexto longo e o modo Fast podem alterar bastante o custo final.
| Item | Detalhes atuais |
|---|---|
| ID do modelo na API | gpt-6-astra |
| Entrada padrão | US$ 10,00 / 1 milhão de tokens |
| Entrada em cache | US$ 1,00 / 1 milhão de tokens |
| Gravação em cache | US$ 12,50 / 1 milhão de tokens |
| Saída padrão | US$ 50,00 / 1 milhão de tokens |
| Janela de contexto | 1.050.000 tokens |
| Saída máxima | 128.000 tokens |
| Data de corte do conhecimento | 30 de abril de 2026 |
| Entrada/saída | Entrada de texto e imagem; saída de texto |
| Nível gratuito da API | Não compatível |
| Disponibilidade atual | Liberação gradual para empresas do Trusted Access; o acesso mais amplo à API e aos planos pagos está previsto para os próximos dias |
Esses valores vêm da página do modelo GPT-6 Astra, não de uma estimativa de pré-lançamento. O guia do modelo da OpenAI informa que o uso de ferramentas exige a Responses API.
Três regras de cobrança que mudam o valor final
O GPT-6 Astra tem quatro categorias de tokens, além das regras específicas de cada modo de serviço. Tratar o modelo simplesmente como um endpoint de US$ 10 na entrada / US$ 50 na saída subestima o custo de criação de cache, prompts longos e processamento de baixa latência.
Entrada padrão, entrada em cache e gravação no cache
A entrada padrão custa US$ 10 por milhão, a entrada em cache sai por US$ 1 por milhão e a gravação em cache custa US$ 12,50 por milhão. Depois da gravação inicial, reutilizar o conteúdo pode sair barato.
| Categoria de tokens | Tarifa padrão | O que representa |
|---|---|---|
| Entrada sem cache | US$ 10,00 / 1 milhão | Entrada nova processada pelo modelo |
| Entrada em cache | US$ 1,00 / 1 milhão | Entrada processada anteriormente e servida pelo cache |
| Gravação no cache | US$ 12,50 / 1 milhão | Entrada adicionada ao cache de prompts |
| Saída | US$ 50,00 / 1 milhão | Tokens gerados na resposta |
Não multiplique o tamanho da janela de contexto pela tarifa de entrada. Uma janela de contexto de 1,05 milhão de tokens é um limite de capacidade, não uma promessa de que todos os tokens serão cobrados pela tarifa básica.
O limite de 272 mil tokens vale para a requisição inteira
Quando uma requisição contém mais de 272.000 tokens de entrada, a OpenAI aplica 2x nas tarifas de entrada e cache e 1,5x na tarifa de saída para a solicitação completa. Na prática, a faixa de contexto longo custa US$ 20 por milhão de tokens de entrada sem cache, US$ 2 por milhão de tokens de entrada em cache, US$ 25 por milhão de tokens gravados no cache e US$ 75 por milhão de tokens de saída.
| Faixa da requisição | Entrada | Entrada em cache | Gravação no cache | Saída |
|---|---|---|---|---|
| Até 272 mil tokens de entrada | US$ 10 | US$ 1 | US$ 12,50 | US$ 50 |
| Acima de 272 mil tokens de entrada | US$ 20 | US$ 2 | US$ 25 | US$ 75 |
Em uma requisição com 300 mil tokens de entrada, todos os tokens aplicáveis de entrada, cache e saída usam as tarifas maiores de contexto longo. Os primeiros 272 mil não são cobrados pela faixa padrão.
Batch, Flex, Fast e as opções de implantação regional
A OpenAI cobra 50% das tarifas aplicáveis nos modos Batch e Flex. O guia do modelo informa que o modo Fast custa 2x as tarifas aplicáveis, não oferece SLA de latência e não está disponível com residência de dados na União Europeia. O processamento Priority também não pode ser usado com residência de dados na União Europeia.
| Modo | Entrada padrão | Saída padrão | Leitura prática |
|---|---|---|---|
| Standard | US$ 10 / 1 milhão | US$ 50 / 1 milhão | Faixa padrão da API direta |
| Batch ou Flex | US$ 5 / 1 milhão | US$ 25 / 1 milhão | Metade da tarifa Standard aplicável |
| Fast | US$ 20 / 1 milhão | US$ 100 / 1 milhão | O dobro da tarifa Standard aplicável |
| Standard com contexto longo | US$ 20 / 1 milhão | US$ 75 / 1 milhão | Aplicado acima de 272 mil tokens de entrada |
| Fast com contexto longo | US$ 40 / 1 milhão | US$ 150 / 1 milhão | 2x as tarifas de contexto longo |
A tabela mostra apenas entrada sem cache e saída. As tarifas de leitura e gravação no cache também seguem o multiplicador aplicável ao modo de serviço.
O Microsoft Foundry tem uma tabela de implantação publicada separadamente. O anúncio do GPT-6 Astra lista, no Global Standard de contexto curto, US$ 10 para entrada, US$ 1 para entrada em cache, US$ 12,50 para gravação no cache e US$ 50 para saída. No U.S. Data Zone Standard, os valores são US$ 11, US$ 1,10, US$ 13,75 e US$ 55. Para contexto longo, a tabela informa US$ 20/US$ 2/US$ 25/US$ 75 no Global e US$ 22/US$ 2,20/US$ 27,50/US$ 82,50 no U.S. Data Zone. Não copie a tabela de preços da OpenAI diretamente para um orçamento do Azure.
Quanto custa uma requisição real ao Astra
Os exemplos usam os preços diretos do OpenAI Standard, não incluem ferramentas nem novas tentativas e classificam os tokens exatamente como entrada sem cache ou em cache.
| Exemplo de requisição | Cálculo | Cobrança estimada por tokens |
|---|---|---|
| 100 mil de entrada sem cache + 10 mil de saída | 0,1 × US$ 10 + 0,01 × US$ 50 | US$ 1,50 |
| 200 mil de entrada em cache + 20 mil de saída | 0,2 × US$ 1 + 0,02 × US$ 50 | US$ 1,20 |
| 300 mil de entrada sem cache + 30 mil de saída | 0,3 × US$ 20 + 0,03 × US$ 75 | US$ 8,25 |
Teste o limite de 272 mil antes de adotar fluxos de trabalho com contexto longo. Recuperação de informações ou compactação podem reduzir o custo do modelo, mas acrescentam trabalho à aplicação.
Gravar 200 mil tokens custa US$ 2,50, enquanto uma leitura posterior de 200 mil tokens no cache custa US$ 0,20. O cache começa a compensar de acordo com a frequência de reutilização.
No Microsoft Foundry, uma requisição com 100 mil tokens de entrada e 10 mil de saída na tabela Global de contexto curto também custa US$ 1,50, antes de ferramentas ou novas tentativas. A versão U.S. Data Zone custa US$ 1,65: 0,1 × US$ 11 + 0,01 × US$ 55.
O guia da OpenAI afirma que o Astra pode oferecer um custo estimado menor por tarefa concluída do que os modelos anteriores, mas essa orientação não é um benchmark independente de custo em produção. Meça tokens de entrada, acertos de cache, tokens de saída, chamadas de ferramentas, novas tentativas e correções humanas nos seus próprios rastros.
Acesso, cotas e a separação entre ChatGPT e API
O GPT-6 Astra está sendo liberado para empresas do Trusted Access Program. O acesso à API e aos planos Plus, Pro, Business e Enterprise virá nos próximos dias. A documentação do provedor OpenAI do OpenClaw também informa que a descoberta do catálogo da conta determina se ela tem acesso ao Astra; adicionar o nome do modelo à configuração não libera o acesso.
Um usuário descreveu o atraso na liberação assim:
“Já são quase 2 da manhã e vou dormir furioso. Passei O DIA TODO esperando pelo Astra. ... E aí descubro: NÃO POSSO NEM USÁ-LO.” — @buildwithrajath, X
A página do modelo lista os seguintes limites da API por faixa de uso:
| Faixa | RPM | TPM | Limite da fila Batch |
|---|---|---|---|
| Gratuita | Não compatível | Não compatível | Não compatível |
| Tier 1 | 500 | 500.000 | 1.500.000 |
| Tier 2 | 5.000 | 1.000.000 | 3.000.000 |
| Tier 3 | 5.000 | 2.000.000 | 100.000.000 |
| Tier 4 | 10.000 | 4.000.000 | 200.000.000 |
| Tier 5 | 15.000 | 40.000.000 | 15.000.000.000 |
A tabela de preços do Astra é exclusiva da API. A documentação citada não inclui créditos de API nos planos do ChatGPT, portanto trate o uso da Platform API como uma despesa separada.
O que verificar ao migrar agentes existentes
O guia do modelo destaca três pontos de verificação na migração:
- Modelo e API: defina
modelcomogpt-6-astra, confirme que o catálogo da conta expõe o modelo e use a Responses API para chamadas de ferramentas. - Parâmetros da requisição: escolha
low,medium,high,xhighoumax; o Astra não é compatível comnone. Remova os parâmetros de amostragem e de log-probabilidade que não são aceitos. - Cache e região: substitua
prompt_cache_retentionporprompt_cache_options.ttl: "30m"ao seguir a orientação de migração da OpenAI para modelos mais antigos. Depois, revise as configurações de Fast e Priority quando houver residência de dados na União Europeia.
Decisão de orçamento: escolha com base no rastro, não só no preço dos tokens
O GPT-6 Astra faz mais sentido quando a tarefa é longa, depende muito de ferramentas, custa caro quando falha ou é executada em softwares que não oferecem uma API adequada. Já como padrão para prompts curtos e rotineiros, ele é uma escolha ruim quando a tarifa de US$ 50 por milhão de tokens de saída não resulta em menos tentativas ou em um trabalho concluído de melhor qualidade.
- Teste o Astra primeiro em pesquisas com contexto longo, uso de computador, programação complexa e fluxos que envolvem vários aplicativos, nos quais uma falha gera revisão ou retrabalho.
- Mantenha um modelo mais barato como padrão para classificação curta, extração, rascunhos simples e transformações previsíveis.
- Use Batch ou Flex quando a latência não for importante e a carga de trabalho puder aproveitar uma tarifa 50% menor.
- Não use Fast por padrão. Com US$ 20 de entrada e US$ 100 de saída por milhão de tokens, antes de qualquer multiplicador de contexto longo, o modo precisa entregar um ganho mensurável de throughput.
- Defina uma barreira rígida em 272 mil tokens. Gere um alerta antes que a requisição ultrapasse o limite, porque o adicional é aplicado à solicitação inteira.
Avalie o custo por tarefa aceita a partir dos seus próprios registros, e não apenas pelo preço dos tokens. Para outros cálculos de orçamento, compare as premissas do guia de preços do GPT-5.6 e do guia de preços da OpenRouter, em vez de transferir as regras dessas tabelas de preços para o Astra.
Perguntas frequentes sobre os preços da API GPT-6 Astra
Quanto custa o GPT-6 Astra por 1 milhão de tokens?
O preço padrão é de US$ 10 por milhão de tokens de entrada sem cache, US$ 1 por milhão de tokens de entrada em cache, US$ 12,50 por milhão de tokens gravados no cache e US$ 50 por milhão de tokens de saída.
O que acontece acima de 272 mil tokens de entrada?
As tarifas de entrada e cache dobram, e a saída aumenta 50%: US$ 20 de entrada, US$ 2 de entrada em cache, US$ 25 de gravação no cache e US$ 75 de saída por milhão de tokens para a requisição inteira.
Entrada em cache é a mesma coisa que gravação no cache?
Não. A entrada em cache é uma leitura do cache cobrada a US$ 1 por milhão na faixa Standard. Já a gravação cria ou atualiza o prefixo armazenado e custa US$ 12,50 por milhão.
Batch ou Flex reduzem pela metade o preço do GPT-6 Astra?
A OpenAI lista Batch e Flex a 50% das tarifas Standard aplicáveis, incluindo a tarifa de contexto longo quando o limite correspondente é atingido.
O modo Fast vale o custo adicional?
O modo Fast custa 2x as tarifas aplicáveis e não oferece SLA de latência. Use-o apenas quando seus registros mostrarem ganho suficiente de throughput ou de valor para o usuário a ponto de compensar o adicional.
Posso usar o GPT-6 Astra pela API hoje?
O acesso está sendo liberado gradualmente, e não aberto de forma universal. A OpenAI lista a disponibilidade inicial para empresas do Trusted Access e informa que o acesso mais amplo à API virá nos próximos dias. Por isso, o catálogo da conta é a verificação definitiva.
O ChatGPT Plus inclui créditos para a API do GPT-6 Astra?
A documentação do modelo não promete créditos de API para quem tem um plano do ChatGPT. Considere o acesso ao modelo no plano pago e a cobrança por uso da Platform API como itens separados, até que os termos de cobrança explícitos da sua conta indiquem o contrário.
Quais mudanças na API são necessárias para usar o GPT-6 Astra?
Defina model como gpt-6-astra, use a Responses API para chamadas de ferramentas, selecione um nível de raciocínio compatível, remova os parâmetros de amostragem e de log-probabilidade que não são aceitos e revise o TTL do cache e as regras regionais do modo Fast. Antes de tornar o Astra o modelo padrão, registre tokens, comportamento do cache, ferramentas, novas tentativas e correções humanas em uma execução representativa.