AIREITER

Preços e API do Prime Inference: guia de 2026

Última Atualização: 2026-10-03 07:26:29

O Prime Inference já está disponível: é compatível com OpenAI e foi projetado para tráfego contínuo de agentes, não apenas anunciado como um produto futuro. O ponto menos claro é a precificação. O post de lançamento da Prime Intellect detalha bem a infraestrutura de serving, mas a tabela completa de preços por modelo está, por enquanto, mais acessível em diretórios de preços ao vivo do que em uma página oficial convencional.

Página de lançamento do Prime Inference da Prime Intellect

Prime Inference está no ar, mas os preços estão espalhados

A Prime Intellect lançou oficialmente o Prime Inference em 2 de outubro de 2026. O produto oferece endpoints serverless para demanda variável e capacidade reservada para cargas sustentadas. A API pública é desacoplada da frota de modelos, permitindo mover ou substituir capacidade sem alterar o endpoint usado pelo cliente.

Trata-se de um lançamento para produção, não de uma lista de espera. Segundo a Prime Intellect, sua primeira implantação pública, GLM-5.3, entrou no ar no OpenRouter em 22 de setembro, enquanto clientes diretos podem apontar SDKs compatíveis com OpenAI para https://api.pinference.ai/api/v1.

A ressalva sobre os preços é simples: a página oficial de lançamento promete cobrança unificada e acompanhamento de uso por equipe, mas não traz uma tabela completa de tarifas. Portanto, antes de comprometer orçamento, confira os preços atuais de cada modelo no dashboard autenticado ou no endpoint de modelos. Diretórios públicos servem como retratos do momento, não como cotações contratuais.

Quanto custa o Prime Inference hoje

O preço do Prime Inference varia por modelo e pelo uso. Tokens de entrada e saída são cobrados separadamente; a saída pode custar várias vezes mais que a entrada. Por isso, uma tarifa de entrada aparentemente baixa pode enganar em agentes de programação ou tarefas de raciocínio que produzem respostas longas.

O retrato abaixo foi registrado em 3 de outubro de 2026 no catálogo da Prime Intellect no endpoints.run, que listava 64 endpoints. Confirme cada preço com a Prime Intellect antes da compra.

ID do modeloEntrada / 1M de tokensSaída / 1M de tokensContexto listadoMelhor uso
meta-llama/Llama-3.2-1B-Instruct$0.03$0.2060KClassificação e extração simples
qwen/qwen3.7-flash$0.03$0.131MTrabalho geral de baixo custo e contexto longo
z-ai/glm-5.3-flash$0.15$0.501MFluxos mais rápidos de agentes e ferramentas
qwen/qwen3-coder-next$0.30$1.50262KProgramação e uso de ferramentas
deepseek/deepseek-v4.1-flash$0.30$1.201MRaciocínio de contexto longo e visão
z-ai/glm-5.3$1.40$4.401MCargas de agentes GLM de ponta
deepseek/deepseek-v4-pro$1.91$3.831MRaciocínio mais avançado
moonshotai/kimi-k3$3.45$17.251MTarefas premium de contexto longo

Um segundo diretório, o Compute Prices, mostrava 111 modelos na mesma data e um mínimo exato de $0.027 por milhão de tokens de entrada para Llama 3.2 1B. A diferença entre as contagens é mais um motivo para consultar a API ao vivo em vez de tratar qualquer um dos diretórios como inventário fixo: as listagens podem incluir namespaces distintos, modelos de gateway ou ser atualizadas em momentos diferentes.

Três cenários realistas de custo

O custo de tokens pode ser estimado assim:

(input tokens ÷ 1,000,000 × input rate) + (output tokens ÷ 1,000,000 × output rate)

Carga mensalModelo e volume de tokensFatura estimada de tokens
Bot de suporte leveQwen3.7 Flash; 50M de entrada + 10M de saída$2.80
Agente de programaçãoQwen3 Coder Next; 100M de entrada + 40M de saída$90.00
Agente de ponta com muita saídaGLM-5.3; 200M de entrada + 100M de saída$720.00

Esses cálculos cobrem apenas as cobranças de tokens listadas. Eles não incluem contratos de capacidade reservada, execução em sandbox, treinamento, avaliações ou aluguel de GPUs. A Prime Intellect vende esses itens como serviços separados, portanto a conta completa de um agente pode ir além dos tokens de inferência.

O suporte a contexto longo também não significa que toda requisição consuma um milhão de tokens. A cobrança segue os tokens efetivamente processados. Ainda assim, um agente que reenvia repetidamente um histórico de 140K tokens pode acumular cobranças de entrada rapidamente, a menos que o cache de prefixo ou o gerenciamento de contexto na aplicação reduza esse trabalho repetido.

Para usar a API, basta trocar o endpoint

O Prime Inference expõe um endpoint compatível com OpenAI. Em geral, uma integração existente com o SDK da OpenAI só precisa de uma nova base URL, uma chave de API e o identificador do modelo. O post de lançamento da Prime Intellect informa a base URL como https://api.pinference.ai/api/v1.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_PRIME_API_KEY",
    base_url="https://api.pinference.ai/api/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3",
    messages=[
        {"role": "user", "content": "Write a haiku about KV caches."}
    ],
    stream=False,
)

print(response.choices[0].message.content)

A requisição equivalente em cURL é:

curl https://api.pinference.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $PRIME_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3",
    "messages": [
      {"role": "user", "content": "Write a haiku about KV caches."}
    ]
  }'

A Prime Intellect também documenta uma opção via CLI: instale a ferramenta prime, autentique-se com prime login e execute prime inference chat. Antes de implantar, consulte a lista atual de modelos e copie o ID exato: os prefixos usados por diretórios variam entre catálogos.

O que a arquitetura de lançamento muda para agentes

O Prime Inference se diferencia mais quando os prompts são longos, as sessões retornam com frequência e as chamadas de ferramentas precisam continuar válidas. A Prime Intellect afirma que uma interação típica de agente interno adiciona cerca de 6K tokens a um prompt de 140K tokens, o que torna a retenção de cache e o roteamento tão importantes quanto a velocidade bruta de decodificação.

O relatório oficial de lançamento traz várias medições concretas da implantação do GLM-5.3 em hardware GB200 NVL72:

  • Separar os workers de prefill e decode reduziu em quase 40% a latência intertoken p90 nos testes da Prime Intellect.
  • Com a meta de 100 tokens de ponta a ponta por segundo por usuário, uma topologia testada de prefill/decode de 1:4 atendeu 66 sessões por grupo de prefill a 101 tokens por segundo por usuário.
  • Reduzir o orçamento de prefill de 8K para 4K tokens por GPU diminuiu a espera mediana na fila de 550 ms para 110 ms e reduziu o tempo mediano até o primeiro token em aproximadamente 20%.
  • A compressão NVFP4 elevou a capacidade de cache de 1,09 milhão para 1,63 milhão de tokens em cache por decodificador — cerca de 50% — com o mesmo orçamento de memória.
  • Um layout de cache block-major reduziu os descritores de transferência em cerca de 10× e baixou o tempo médio de transferência de 146 ms para 78 ms em uma comparação TP8 separada.

Esses números dependem da carga de trabalho e da configuração; não são garantias universais de latência. Na prática, seu valor está em revelar os gargalos que a Prime Intellect otimizou: reutilização de cache em sessões recorrentes, atraso de admissão, interferência entre prefill e decode e sobrecarga de transferência de cache.

O uso de ferramentas merece testes próprios. A Prime Intellect encontrou casos em que ferramentas não declaradas eram descartadas silenciosamente ou argumentos recebiam tipos incorretos. Em resposta, adicionou decodificação restrita e testes de schema ao caminho de serving do GLM. A empresa relata uma taxa quase zero de erros em chamadas de ferramentas, mas quem compra deve repetir seus próprios schemas aninhados, argumentos anuláveis, chamadas em streaming e requisições malformadas antes de migrar tráfego de produção.

Serverless ou capacidade reservada: a escolha depende do tráfego

Para a maioria das equipes, serverless é o ponto de partida mais sensato, pois transforma demanda incerta em cobrança por tokens. A capacidade reservada passa a fazer sentido quando concorrência sustentada, latência previsível ou uma implantação personalizada pesam mais que evitar capacidade ociosa.

Carga de trabalhoMelhor opção inicialMotivo
Protótipo ou chatbot intermitenteServerlessNão é necessário reservar GPUs ociosas
Jobs de avaliação em picosServerless por enquantoInferência em lote e assíncrona de menor preço aparece no roadmap, não como recurso atual de lançamento
Serviço de agentes estável e com alta concorrênciaCotação de capacidade reservadaO planejamento de capacidade pode importar mais que as tarifas nominais por token
Modelo fine-tuned ou LoRAConfirme a disponibilidade primeiroA implantação dedicada com um clique de modelos fine-tuned é descrita como trabalho de roadmap no post de lançamento
SLA contratual rígido ou exigência de regiãoAnálise comercialO material público de lançamento não informa contrato universal, matriz de regiões ou preço padrão para capacidade reservada

Não presuma que “reservado” custa automaticamente menos. Compare o custo da capacidade cotada com o gasto serverless medido em uma concorrência representativa, incluindo períodos ociosos e folga para picos.

O que a Prime Intellect ainda não deixa claro publicamente

O Prime Inference oferece um nível incomum de transparência sobre infraestrutura, mas vários pontos relevantes para a compra continuam pouco claros no material público indexado:

  • uma tabela oficial e completa de preços por modelo;
  • regras de cobrança de entrada em cache e tokens de raciocínio para todos os modelos;
  • limites públicos de taxa e concorrência;
  • um mapa de processamento por região;
  • termos padrão de retenção de dados para requisições de inferência;
  • um SLA formal universal e suas compensações;
  • prazos mínimos e preços para capacidade reservada;
  • quais entradas do catálogo são hospedadas diretamente pela Prime e quais são modelos roteados por gateway.

Não saber não significa que o recurso não exista. Significa que esses itens devem ser confirmados no dashboard, na documentação, no endpoint de modelos, no contrato ou na resposta comercial, em vez de inferidos a partir da compatibilidade com OpenAI.

Perguntas frequentes sobre o Prime Inference

O Prime Inference está oficialmente disponível?

Sim. A Prime Intellect anunciou o lançamento público em 2 de outubro de 2026 e publicou uma base URL de API, um comando de CLI e a divisão do produto entre serverless e capacidade reservada.

O Prime Inference tem plano gratuito?

O post público de lançamento não especifica créditos gratuitos para o Prime Inference. A Prime Intellect possui opções gratuitas ou de preço zero em outras partes de sua stack de treinamento, mas isso não deve ser tratado como uma camada gratuita de inferência.

O Prime Inference é compatível com o SDK da OpenAI?

Sim. Defina a base URL compatível com OpenAI como https://api.pinference.ai/api/v1, informe uma chave de API Prime e use um ID de modelo disponível no momento.

O Prime Inference oferece suporte a tool calling?

O caminho de serving do GLM-5.3 suporta tool calling, e a Prime Intellect descreve imposição gramatical e testes de regressão para schemas de argumentos. Ainda assim, o suporte deve ser verificado por modelo, porque as capacidades variam.

Quantos modelos estão disponíveis?

Diretórios públicos mostravam 64 e 111 entradas em 3 de outubro de 2026. Como as contagens divergem, o endpoint de modelos ao vivo ou o dashboard da Prime é a fonte confiável para saber o inventário disponível em uma conta.

O Prime Inference é mais barato que alugar GPUs?

Serverless costuma ser mais fácil de justificar para tráfego variável; GPUs alugadas ou reservadas podem se tornar econômicas com utilização alta e estável. A resposta depende dos tokens medidos, da concorrência, das metas de latência e da capacidade ociosa — não apenas do preço por token.

Uma checagem de cinco minutos para decidir

Vale testar o Prime Inference para equipes que precisam acessar modelos abertos, servir agentes com contexto longo ou levar a stack de treinamento da Prime Intellect à produção. Mas ele não está pronto para uma compra sem verificação baseada apenas em uma tabela pública de preços.

  1. Consulte a lista de modelos ao vivo e registre as tarifas exatas de entrada, saída, cache e raciocínio.
  2. Repita uma conversa longa representativa e meça a latência até o primeiro token, a velocidade de geração e o total de tokens cobrados.
  3. Execute os schemas reais de ferramentas da aplicação nos modos com e sem streaming.
  4. Se a carga for sensível, solicite termos de retenção, região, limite de taxa, SLA e capacidade reservada.
  5. Compare o gasto serverless medido com uma cotação de capacidade reservada somente depois de observar o tráfego normal e os picos.

O equilíbrio decisivo é claro: o Prime Inference oferece engenharia de serving convincente e uma API de baixa fricção, mas a validação de preços e condições contratuais ainda exige uma etapa adicional além da própria página de lançamento.