AIREITER

Gemini 3.8 Live vs GPT-Live-1: custos de agentes de voz em produção

Última Atualização: 2026-09-15 19:42:05

Um agente de voz pode parecer barato até o momento em que o cliente faz uma pausa, muda de assunto, espera uma ferramenta responder ou permanece conectado por meia hora. O Gemini 3.8 Live e o GPT-Live-1 expõem esse risco de maneiras diferentes: o Gemini trabalha com tokens e sofre os efeitos do contexto persistente, enquanto o GPT-Live-1 divulga um preço simples de $0.05 por minuto para a camada de voz. Em produção, a melhor escolha não é necessariamente a que tem o menor número na vitrine, mas a que usa um medidor compatível com o comportamento real das suas sessões.

A resposta curta para equipes de produção

A documentação da Live API do Google identifica a string de modelo gemini-3.8-live no exemplo de retomada de sessão. A documentação atual do Live também informa que o áudio é cobrado como tokens e que o contexto mantido pode ser processado novamente em turnos posteriores. Já o anúncio do GPT-Live-1 da OpenAI lista o preço de $0.05 por minuto para a camada de voz do front-end, com raciocínio de back-end e ferramentas cobrados à parte.

Na prática, isso divide os cenários assim:

Necessidade em produçãoMelhor ponto de partidaPor quê
Orçamento previsível para a camada de vozGPT-Live-1É mais fácil prever o tempo de sessão no relógio do que o crescimento do contexto de áudio
Otimização em nível de tokenGemini 3.8 LiveÉ possível ajustar o contexto ativo, a compressão e as modalidades usadas
Conversas longas com memória controladaGemini 3.8 Live, se for bem projetadoCompressão e retomada fazem parte explícita do desenho da API
Implantação rápida de agentes telefônicosGPT-Live-1A OpenAI posiciona o modelo para telefonia full-duplex e delegação ao back-end
Uma chamada que pode ficar em silêncioNenhum dos dois sem controles preventivosO GPT-Live-1 cobra pelo tempo de sessão; o Gemini ainda pode acumular custos de contexto e transporte

A ressalva importante é que a página de preços da Gemini API do Google não apresenta uma linha de preço separada para o Gemini 3.8 Live no material analisado aqui. Não use as tarifas do Gemini 3.1 Flash Live no planejamento financeiro do Gemini 3.8 Live.

Gemini 3.8 Live vs GPT-Live-1: como funciona a cobrança

Gemini 3.8 Live: tokens de áudio, contexto e compressão

O guia de boas práticas da Live API do Google informa que o áudio nativo acumula aproximadamente 25 tokens por segundo de áudio. O mesmo guia explica que uma sessão persistente pode cobrar novamente o contexto acumulado nos turnos seguintes. Conforme a conversa cresce, uma nova resposta pode carregar uma entrada histórica maior do que a resposta anterior.

O modelo aproximado é:

Custo da sessão Gemini
= uso atual de áudio e texto
+ reprocessamento do contexto mantido entre os turnos
+ uso de áudio de saída e raciocínio
+ uso opcional de transcrição
+ ferramentas e infraestrutura

A compressão altera essa curva. O Google documenta ContextWindowCompressionConfig e uma estratégia de janela deslizante para sessões longas. No exemplo documentado pelo Google, a compressão é acionada em 25.000 tokens, com uma janela deslizante de 8.000 tokens. A configuração exata para produção deve ser validada em relação à capacidade de recuperação de informações e à precisão das ferramentas, em vez de ser copiada sem testes.

As transcrições podem acrescentar outra cobrança. O Google informa que ativar inputAudioTranscription ou outputAudioTranscription gera uso adicional de tokens de texto, além da cobrança pelo áudio nativo. Se a equipe precisa de transcrições pesquisáveis, esse adicional deve entrar no cálculo do custo por resolução.

GPT-Live-1: tempo de sessão de voz no relógio

A OpenAI lista o GPT-Live-1 a $0.05 por minuto, com cobrança em granularidade de segundos, para a camada de voz do front-end. A conta é direta:

Duração da sessãoCusto da camada de voz do GPT-Live-1
5 minutos$0.25
30 minutos$1.50
1 hora$3.00
8 horas continuamente aberta$24.00

O ponto crítico é o silêncio. O preço divulgado por minuto está ligado ao tempo da sessão, não apenas aos segundos em que o cliente fala. Uma chamada de 30 minutos com dez minutos de silêncio continua ocupando a sessão durante os 30 minutos.

O GPT-Live-1 também não representa o custo total do agente: a OpenAI o descreve como uma camada de voz capaz de delegar chamadas de raciocínio mais profundo e ferramentas. Portanto, tokens de back-end, ferramentas, telefonia, armazenamento, monitoramento e transferências para atendentes humanos devem ser contabilizados separadamente.

Economia em sessões longas: quatro cenários

A comparação a seguir usa a aritmética publicada do GPT-Live-1 e fórmulas, sem inventar um preço para o Gemini 3.8.

1. Chamada de cinco minutos para agendamento

O GPT-Live-1 contribui com $0.25 antes do raciocínio de back-end e da telefonia. Não é possível precificar o Gemini 3.8 Live de forma defensável até que o Google publique ou disponibilize a tarifa aplicável ao ID exato do modelo.

No caso do Gemini, meça os segundos de áudio de entrada, os segundos de áudio de saída, os tokens de contexto mantidos, os tokens de transcrição e as chamadas de ferramentas em sessões reais. Uma chamada curta é o cenário em que a cobrança por tokens pode parecer mais atraente, mas apenas se o prompt e o contexto estiverem sob controle.

2. Chamada de suporte de trinta minutos

O GPT-Live-1 contribui com $1.50 para a camada de voz. É um número fácil de incluir no orçamento, mas ele não informa se o problema foi realmente resolvido.

O custo do Gemini depende de quanto áudio é mantido e de quantos turnos a sessão gera. Duas chamadas de 30 minutos podem ter volumes de tokens bastante diferentes se uma tiver fala contínua e a outra incluir pausas longas, explicações repetidas ou entrada multimodal.

3. Espera em silêncio ou ferramenta atrasada

O GPT-Live-1 continua cobrando enquanto a sessão permanece aberta. O controle operacional é aplicar um tempo limite rígido para o silêncio ou mudar explicitamente a chamada para um estado de transferência.

O Gemini não fica automaticamente “gratuito enquanto está em silêncio”. A conexão, a orquestração das ferramentas, a política de contexto e qualquer turno posterior ainda precisam entrar no modelo de custos. Trate o silêncio como um estado do produto, não apenas como um detalhe do preço do provedor.

4. Sessão de escuta durante todo o dia

Na tarifa publicada da camada de voz do GPT-Live-1, oito horas continuamente abertas custam $24. Dez sessões desse tipo custam $240 por dia, antes dos modelos de back-end e de outras partes da infraestrutura.

O modelo baseado em tokens do Gemini pode ser mais eficiente em interações esparsas se o aplicativo evitar o envio de áudio desnecessário e comprimir o histórico. Por outro lado, pode ser menos previsível quando o aplicativo mantém o contexto bruto da conversa e permite ciclos conversacionais ilimitados. Um design sempre ativo precisa passar por testes de carga, não ser projetado a partir da extrapolação de uma demonstração de cinco minutos.

Restrições de produção que mudam a planilha

Contexto e duração da conexão

A documentação de gerenciamento de sessões do Google registra sessões sem compressão, somente de áudio, de 15 minutos e sessões de áudio e vídeo de 2 minutos. A mesma documentação descreve conexões WebSocket individuais com duração de aproximadamente 10 minutos, separadamente da duração da sessão lógica. Clientes em produção precisam tanto de compressão de contexto quanto de retomada de sessão.

Os identificadores de retomada do Google continuam válidos por duas horas após o encerramento da última sessão. O servidor também envia um GoAway antes de fechar a conexão. Ignorar esses eventos pode transformar uma chamada longa em uma chamada interrompida, uma ação de ferramenta duplicada ou uma perda do estado do cliente.

Concorrência é um custo separado

Um preço por minuto responde à pergunta “quanto custa manter uma sessão aberta?”. Ele não responde a “quantas sessões posso executar ao mesmo tempo?”. A documentação do GPT-Live-1 descreve a capacidade em sessões simultâneas, com faixas informadas que vão de 25 sessões no Tier 1 a 500 no Tier 5. Um pico repentino de chamadas pode atingir esse limite mesmo quando o gasto mensal está dentro do orçamento. Consulte a referência do modelo GPT-Live-1 da OpenAI para verificar o limite atual de concorrência antes do lançamento.

No Gemini, registre WebSockets simultâneos, taxas de reconexão, eventos de compressão e erros de cota. Vazão de tokens e número de sessões simultâneas são gargalos diferentes.

Telefonia e a ponte de áudio

Um agente telefônico adiciona custos que ficam fora dos dois modelos. O guia de integração telefônica do Gemini usa uma ponte como o Twilio Media Streams. O material descreve a conversão entre o áudio μ-law de 8 kHz do Twilio, a entrada PCM de 16 kHz do Gemini e a saída PCM de 24 kHz do Gemini. Essa retransmissão acrescenta trabalho de operadora, transporte, computação e operação.

O posicionamento full-duplex do GPT-Live-1 pode reduzir a orquestração personalizada das interrupções, mas não elimina as tarifas da operadora nem o trabalho de back-end. Compare o custo completo da chamada, não apenas o custo de inferência.

“Lancei um agente de voz com Gemini Live para captação de leads de marketing. Ele continuava travando no meio do agendamento.” — @ramanpal, relatando um bug no tratamento de turnComplete no Gemini 3.8 Live Extended Thinking (X).

Esse é o relato inicial de implantação de um desenvolvedor, não uma taxa de falha medida. Ainda assim, ele serve como lembrete de que a semântica do protocolo pode custar mais do que uma pequena diferença no preço por token.

A regra de decisão que eu usaria

Escolha o GPT-Live-1 quando a camada de voz for a principal incerteza e o financeiro precisar de uma estimativa clara baseada na duração. Estabeleça limites rígidos para silêncio, duração máxima da chamada, concorrência e raciocínio de back-end. O valor de $0.05 é um piso para a camada de voz, não o custo total por chamada.

Escolha o Gemini 3.8 Live quando sua equipe puder instrumentar o uso de tokens e se beneficiar de compressão de contexto, multimodalidade ou controle em nível de token. Comece com um fluxo delimitado, não com um assistente aberto. Acompanhe o custo por tarefa concluída, não o custo por minuto:

custo por resolução bem-sucedida
= custo total de modelo + ferramentas + telefonia + infraestrutura
  / resoluções válidas concluídas

Antes de tomar a decisão, execute o mesmo conjunto de chamadas nos dois sistemas e registre a duração mediana e p95, os segundos de áudio, os tokens de contexto mantidos, o uso de transcrição, as novas tentativas de ferramentas, a taxa de transferência, as reconexões e a taxa de resolução. O vencedor é o sistema que mantém essas métricas estáveis à medida que as chamadas ficam mais longas.

Perguntas frequentes

O Gemini 3.8 Live está oficialmente disponível?

A documentação atual de gerenciamento de sessões do Google usa gemini-3.8-live em um exemplo de retomada de sessão. Verifique acesso, região, cotas e a linha de preço exata no seu projeto do Google antes de levar o sistema para produção.

O GPT-Live-1 cobra pelo silêncio?

O preço publicado é por minuto de tempo da sessão de voz do front-end, com cobrança por segundo. Considere que o tempo da sessão — incluindo o silêncio — será cobrado, a menos que o contrato da sua conta estabeleça o contrário.

Os $0.05 por minuto do GPT-Live-1 representam o custo total da chamada?

Não. A OpenAI descreve esse valor como o preço da camada de voz do front-end. Raciocínio de back-end, ferramentas, telefonia, armazenamento, monitoramento e escalonamento para atendentes humanos são centros de custo adicionais.

A compressão de contexto do Gemini pode tornar uma sessão longa gratuita?

Não. A compressão é um mecanismo de gerenciamento de contexto, não um modo sem custo. Ela pode limitar o histórico mantido e ajudar a evitar limites de duração, mas áudio ao vivo, saída, ferramentas e infraestrutura continuam sendo cobrados ou operacionalmente relevantes.

Qual modelo é mais barato para sessões longas de voz?

Não existe uma resposta universal defensável até que a tarifa aplicável do Gemini 3.8 Live e o perfil do seu tráfego sejam conhecidos. O GPT-Live-1 é mais fácil de prever; o Gemini pode se beneficiar de um controle cuidadoso do contexto e das entradas. Meça os dois com base nas resoluções concluídas.

Um agente de voz em produção não é precificado pela primeira conversa agradável. O custo aparece na cauda longa: silêncio, novas tentativas, crescimento do contexto, reconexões e chamadas que ainda precisam de uma pessoa. Incorpore o medidor à arquitetura antes de escolher o modelo.