AIREITER

OpenAI Ultrafast Mode: GPT-5.6 Sol até 14x mais rápido, mas sem preço

Última Atualização: 2026-08-17 00:35:22

Há três ofertas da OpenAI com “fast” ou “ultra” no nome, mas apenas uma chega a 750 tokens por segundo. Anunciado em 13 de agosto de 2026, o OpenAI Ultrafast mode é uma nova camada de serviço da API que executa o GPT-5.6 Sol em chips wafer-scale da Cerebras, com velocidade de até 14x em relação ao Standard. O problema é que o acesso ainda é apenas por convite e a OpenAI não divulgou preços. Na prática, a camada mais rápida que qualquer cliente pode contratar hoje continua sendo o Fast mode, por US$ 10/US$ 60 por milhão de tokens.

Entenda a diferença entre ultra, Fast mode e Ultrafast

Quem compra o GPT-5.6 Sol hoje encontra três nomes ligados a velocidade, embora cada um descreva algo bem diferente. Esta tabela elimina a confusão.

NomeO que éComo acessarPreço do Sol (por 1M de tokens)Velocidade anunciada
Configuração de raciocínio ultraUm modo de raciocínio/trabalho que emprega subagentes e computação extra em uma tarefaConfiguração do Codex, não uma camada de API contratada separadamenteSem tarifa própria; consome rapidamente os limites de usoMais lento por definição
Fast modeCamada de processamento da API, renomeada de Priority em 30 de julho de 2026service_tier="fast" em qualquer requisição à APIUS$ 10 de entrada / US$ 60 de saída (contexto curto)Até 2,5x o Standard
Ultrafast modeCamada de API para GPT-5.6 Sol acelerada pela Cerebras, apresentada em prévia em 13 de agosto de 2026Prévia limitada, apenas para clientes selecionadosNão divulgadoAté 14x o Standard

Os dois extremos seguem direções opostas: ultra é o modo de trabalho com subagentes que troca velocidade por profundidade, enquanto o Ultrafast mode entrega velocidade bruta de decodificação no mesmo modelo. Entre eles está o Fast mode, um upgrade de latência contratável e documentado separadamente na página do Fast mode da OpenAI.

O que a prévia de 13 de agosto realmente entrega

Página de anúncio do OpenAI Ultrafast mode com a prévia de velocidade do GPT-5.6 Sol

O anúncio oficial confirma cinco pontos concretos. O Ultrafast estreia na API da OpenAI, executa exclusivamente o GPT-5.6 Sol, alcança até 14x a velocidade do processamento Standard e até 750 tokens de saída por segundo, usa infraestrutura da Cerebras e chega como prévia limitada para um grupo selecionado de clientes, incluindo Jane Street, Podium, Basis e Rogo.

Ao mesmo tempo, o anúncio deixa de fora quatro informações essenciais para qualquer comprador: preço por token, ID do modelo, limites de taxa e SLA de latência. Também não há benchmarks identificados.

A demonstração da OpenAI coloca lado a lado o Ultrafast e o Standard Sol criando um simulador de armazém em 3D a partir de um único prompt. A proposta fica resumida na fala de Alex Wang, da Rogo: “Ultrafast faz pesquisas financeiras complexas parecerem uma interação em tempo real.”

O ganho prático ao sair de 2,5x para 14x

Gráfico de barras comparando os multiplicadores de velocidade anunciados para Standard, Fast mode e Ultrafast no GPT-5.6 Sol

Antes dos números, vale uma ressalva: os 750 tokens por segundo são vazão de saída anunciada, enquanto o número do Fast mode é um piso de SLA. As métricas são relacionadas, mas não idênticas. Ao dividir 750 por 14, chega-se a cerca de 54 tokens por segundo para o Standard Sol. Isso colocaria uma geração de 10.000 tokens em aproximadamente 186 segundos no Standard, até 125 segundos no piso de SLA Enterprise do Fast mode, de 80 tokens por segundo, e cerca de 13 segundos no Ultrafast.

Carga de trabalhoStandard (~54 tok/s, estimado)Fast mode (SLA ≥80 tok/s)Ultrafast (750 tok/s anunciados)
Geração de 10.000 tokens~186 s≤125 s~13 s
Loop de agente com 5 turnos, 1.000 tokens por turno~93 s≤63 s~7 s

Números em circulação no r/AIToolsPerformance atribuem essas comparações à Artificial Analysis e à Cerebras: o Ultrafast seria 11x mais rápido que o Claude Fable 5 e 5x mais rápido que o Opus 4.8 no Fast mode, além de concluir uma execução completa de 2.500 perguntas do Humanity's Last Exam em 11 horas e 11 minutos, contra 78 horas e 27 minutos do Fable 5. Todos esses dados foram reportados por fornecedores; ainda não há replicação independente.

O preço que ninguém fora da prévia conhece

Página da tabela de preços do OpenAI Fast mode para clientes da API

Não existe preço público para o Ultrafast. O anúncio não informa nenhuma tarifa, e a comunidade identificou essa lacuna imediatamente. Como resumiu uma publicação no r/AIToolsPerformance: “O que o blog não diz é o preço. Ninguém fora da prévia sabe quanto custa.”

A referência disponível hoje é a tabela conhecida de preços do GPT-5.6 Sol, todos por milhão de tokens:

CamadaEntrada (ctx curto)Saída (ctx curto)Entrada (ctx longo >272k)Saída (ctx longo)Entrada em cache
StandardUS$ 5,00US$ 30,00US$ 10,00US$ 45,00US$ 0,50
Fast modeUS$ 10,00US$ 60,00US$ 20,00US$ 90,00US$ 1,00
Ultrafastnão divulgadonão divulgadonão divulgadonão divulgadonão divulgado
Gráfico de barras agrupadas com os preços por milhão de tokens do GPT-5.6 Sol Standard versus Fast mode

O Fast mode custa exatamente 2x o Standard para o Sol, mas as informações públicas não permitem projetar o preço do Ultrafast a partir dessa proporção. As tarifas podem se mover em ambas as direções — a OpenAI reduziu os preços de Terra/Luna em 30 de julho. Há ainda uma regra importante para o orçamento de latência do Fast mode: ao ultrapassar 1 milhão de tokens por minuto e aumentar o tráfego em mais de 50% em menos de 15 minutos, as requisições excedentes são silenciosamente rebaixadas para o Standard, retornam service_tier="Default" e são cobradas pelas tarifas Standard.

Como está o acesso neste momento

O acesso ao Ultrafast é por convite, não por lista de espera pública. A OpenAI diz que a prévia será ampliada “conforme a capacidade crescer” e oferece, na página do anúncio, um cadastro para receber atualizações de acesso. Já uma reportagem de julho contabilizava apenas cerca de 20 organizações com acesso inicial ao Sol.

A infraestrutura não surgiu do nada: a parceria entre OpenAI e Cerebras remonta a 14 de janeiro de 2026 e reserva 750 MW de capacidade wafer-scale. No mesmo hardware, o GPT-5.3-Codex-Spark já ultrapassou 1.000 tokens por segundo.

Como entregar respostas rápidas enquanto o convite não chega

O Fast mode já está disponível para qualquer cliente da API, e ativá-lo exige mudar apenas um parâmetro:

  1. Adicione service_tier="fast" a uma requisição em /v1/responses ou /v1/chat/completions.
  2. Os valores legados service_tier="priority" continuam funcionando. Os modelos existentes ainda exibem priority nos painéis de uso, enquanto os modelos posteriores ao GPT-5.6 mostrarão fast.
  3. Para definir o padrão de um projeto inteiro, acesse Project settings -> Default Service Tier -> Fast.
Modelo com Fast modePreço por 1M (entrada / saída)SLA de latência
GPT-5.6 SolUS$ 10 / US$ 60>80 tok/s
GPT-5.6 TerraUS$ 4 / US$ 24>70 tok/s
GPT-5.6 LunaUS$ 0,40 / US$ 2,40>100 tok/s

O Luna tem o maior piso de SLA entre os três. Leituras de cache reduzem em 90% o custo de entrada — para US$ 0,50/M no Standard Sol, com TTL de aproximadamente 30 minutos. Por isso, manter uma sessão ativa tende a ser melhor do que iniciar requisições novas em qualquer camada. Para testar essas opções com tráfego real, o endpoint da API GPT-5.6 reúne os três modelos em uma única interface.

Perguntas frequentes

O Ultrafast mode está disponível no ChatGPT ou no Codex?

Não. O Ultrafast estreia na API da OpenAI, e o anúncio não informa uma data para disponibilidade no ChatGPT ou no Codex.

Executar o GPT-5.6 Sol na Cerebras muda a qualidade das respostas?

A OpenAI apresenta o Ultrafast como o mesmo GPT-5.6 Sol atendido com mais velocidade, não como outro modelo. Um ganho de velocidade de 5,6x no GDP-Val sem perda de qualidade, reportado pela Cerebras, é a única alegação de qualidade até agora e não foi replicada por benchmarks independentes.

Existe SLA de latência para o Ultrafast mode?

Não há SLA publicado. O Fast mode oferece SLA p50 de >80 tokens/s e 99,9% de disponibilidade para clientes Enterprise; o Ultrafast não tem SLA informado durante a prévia.

Quais modelos têm suporte ao Ultrafast mode?

Apenas o GPT-5.6 Sol. Terra e Luna têm suporte ao Fast mode, mas não fazem parte da prévia do Ultrafast.

Quanto custará o Ultrafast mode?

Não existe valor oficial. O adicional de 2x do Fast mode sobre o Standard Sol é o único ponto de referência publicado.