Un agente de voz puede parecer barato hasta que la persona que llama hace una pausa, cambia de tema, espera una herramienta o permanece conectada durante media hora. Gemini 3.8 Live y GPT-Live-1 hacen visible ese riesgo de formas distintas: Gemini factura mediante tokens y el contexto persistente puede aumentar el coste, mientras que GPT-Live-1 publica un precio sencillo de $0.05 por minuto para la capa de voz. En producción, la mejor opción no es la que muestra la cifra más baja, sino la que utiliza un contador que encaja con el comportamiento real de tus sesiones.
La respuesta rápida para equipos de producción
La documentación de Live API de Google identifica la cadena de modelo gemini-3.8-live en su ejemplo de reanudación de sesiones. La documentación actual de Live de Google también indica que el audio se factura como tokens y que el contexto retenido puede volver a procesarse en turnos posteriores. El anuncio de GPT-Live-1 de OpenAI fija el precio de la capa de voz frontal en $0.05 por minuto, mientras que el razonamiento del backend y las herramientas se facturan aparte.
En la práctica, esto divide los casos de uso:
| Necesidad en producción | Mejor punto de partida | Motivo |
|---|---|---|
| Presupuestar la capa de voz con previsibilidad | GPT-Live-1 | Es más fácil prever la duración de la sesión que el crecimiento del contexto de audio |
| Optimizar a nivel de tokens | Gemini 3.8 Live | Se pueden ajustar el contexto activo, la compresión y las modalidades |
| Conversaciones largas con memoria controlada | Gemini 3.8 Live, si se implementa con cuidado | La compresión y la reanudación forman parte explícita del diseño de la API |
| Desplegar rápidamente un agente telefónico | GPT-Live-1 | OpenAI posiciona el modelo para telefonía full-duplex y delegación en el backend |
| Una llamada que puede quedarse en silencio | Ninguno sin límites de control | GPT-Live-1 cobra el tiempo de sesión; Gemini también puede acumular costes de contexto y transporte |
La salvedad importante es que la página de precios de Gemini API de Google no muestra una fila de precio independiente para Gemini 3.8 Live en el material revisado aquí. No sustituyas las tarifas de Gemini 3.1 Flash Live por las de Gemini 3.8 Live en una previsión financiera.
Unidades de facturación de Gemini 3.8 Live y GPT-Live-1
Gemini 3.8 Live: tokens de audio, contexto y compresión
La guía de buenas prácticas de Live API de Google indica que el audio nativo acumula aproximadamente 25 tokens por segundo de audio. La misma guía explica que una sesión persistente puede volver a facturar el contexto acumulado en los turnos posteriores. A medida que crece la conversación, una nueva respuesta puede llevar, por tanto, una entrada histórica mayor que la respuesta anterior.
El modelo aproximado sería:
Gemini session cost
= current audio and text usage
+ retained context reprocessed across turns
+ output audio and thinking usage
+ optional transcription usage
+ tools and infrastructure
La compresión cambia la curva. Google documenta ContextWindowCompressionConfig y una estrategia de ventana deslizante para sesiones largas. En el ejemplo documentado por Google, la compresión se activa en 25,000 tokens con una ventana deslizante de 8,000 tokens. El ajuste exacto para producción debe probarse con respecto a la capacidad de recuperación de información y la precisión de las herramientas; no conviene copiarlo sin más.
Las transcripciones pueden añadir otro cargo. Google indica que activar inputAudioTranscription o outputAudioTranscription genera un uso adicional de tokens de texto además de la facturación del audio nativo. Si necesitas transcripciones que se puedan buscar, incluye ese recargo en el modelo de coste por resolución.
GPT-Live-1: tiempo de sesión de voz según el reloj
OpenAI sitúa GPT-Live-1 en $0.05 por minuto, con facturación con granularidad por segundo, para la capa de voz frontal. Las cuentas son sencillas:
| Duración de la sesión | Coste de la capa de voz de GPT-Live-1 |
|---|---|
| 5 minutos | $0.25 |
| 30 minutos | $1.50 |
| 1 hora | $3.00 |
| 8 horas abiertas de forma continua | $24.00 |
El silencio es el matiz clave. El precio publicado por minutos está ligado al tiempo de sesión, no solo a los segundos en los que habla la persona. Una llamada de 30 minutos con diez minutos de silencio sigue ocupando la sesión durante 30 minutos.
GPT-Live-1 tampoco representa el coste total del agente: OpenAI lo describe como una capa de voz que puede delegar el razonamiento avanzado y las llamadas a herramientas. Por tanto, añade por separado los tokens del backend, las herramientas, la telefonía, el almacenamiento, la monitorización y las transferencias a agentes humanos.
Economía de las sesiones largas: cuatro escenarios
La siguiente comparación utiliza las cuentas publicadas de GPT-Live-1 y fórmulas, en lugar de inventar un precio para Gemini 3.8.
1. Llamada de cinco minutos para concertar una cita
GPT-Live-1 aporta $0.25 antes de sumar el razonamiento del backend y la telefonía. Gemini 3.8 Live no se puede presupuestar de forma rigurosa hasta que Google publique o exponga la tarifa aplicable al ID exacto del modelo.
En Gemini, mide los segundos de audio de entrada, los segundos de audio de salida, los tokens de contexto retenidos, los tokens de transcripción y las llamadas a herramientas a partir de sesiones reales. Una llamada corta es el escenario en el que la facturación por tokens puede resultar atractiva, pero solo si el prompt y el contexto están acotados.
2. Llamada de soporte de treinta minutos
GPT-Live-1 aporta $1.50 por la capa de voz. Es una cifra fácil de presupuestar, pero no indica si la llamada resolvió el problema.
El coste de Gemini depende de cuánto audio se conserve y de cuántos turnos genere la sesión. Dos llamadas de 30 minutos pueden tener una huella de tokens muy diferente si una contiene habla continua y la otra incluye pausas largas, explicaciones repetidas o entradas multimodales.
3. Espera en silencio o herramienta con retraso
GPT-Live-1 sigue cobrando mientras la sesión permanece abierta. El control operativo consiste en establecer un tiempo máximo estricto para el silencio o pasar explícitamente a un estado de transferencia.
Gemini no es automáticamente “gratis cuando hay silencio”. La conexión, la orquestación de herramientas, la política de contexto y cualquier turno posterior deben formar parte del modelo de costes. Trata el silencio como un estado del producto, no solo como un detalle de precios del proveedor.
4. Sesión de escucha durante todo el día
Con la tarifa publicada de GPT-Live-1 para la capa de voz, ocho horas abiertas de forma continua cuestan $24. Diez sesiones de este tipo cuestan $240 al día, antes de sumar los modelos del backend y el resto de la infraestructura.
El modelo basado en tokens de Gemini puede ser más eficiente en interacciones esporádicas si la aplicación evita enviar audio innecesario y comprime el historial. También puede ser menos predecible si conserva el contexto bruto de la conversación y permite bucles conversacionales ilimitados. Un diseño siempre activo debe someterse a pruebas de carga; no conviene extrapolar su coste a partir de una demo de cinco minutos.
Restricciones de producción que cambian la hoja de cálculo
Contexto y duración de la conexión
La documentación de gestión de sesiones de Google establece sesiones sin comprimir de solo audio de 15 minutos y sesiones de audio y vídeo de 2 minutos. La misma documentación describe conexiones WebSocket individuales de alrededor de 10 minutos, un límite independiente de la duración lógica de la sesión. Los clientes de producción necesitan tanto compresión de contexto como reanudación de sesiones.
Los identificadores de reanudación de Google siguen siendo válidos durante dos horas después de que termine la última sesión. El servidor también envía GoAway antes de cerrar una conexión. Ignorar estos eventos puede convertir una llamada larga en una llamada interrumpida, una acción duplicada de una herramienta o la pérdida del estado del interlocutor.
La concurrencia es otro coste distinto
Un precio por minuto responde a la pregunta “¿cuánto cuesta una sesión abierta?”. No responde a “¿cuántas sesiones puedo ejecutar a la vez?”. La documentación de GPT-Live-1 describe la capacidad en sesiones concurrentes, con niveles que van de 25 sesiones en el nivel 1 a 500 en el nivel 5. Un pico repentino de llamadas puede alcanzar ese límite aunque el gasto mensual se mantenga dentro del presupuesto. Consulta la referencia del modelo GPT-Live-1 de OpenAI para comprobar el límite de concurrencia vigente antes del lanzamiento.
En Gemini, registra los WebSocket simultáneos, las tasas de reconexión, los eventos de compresión y los errores de cuota. El rendimiento de tokens y el número de sesiones simultáneas son cuellos de botella diferentes.
Telefonía y puente de audio
Un agente telefónico añade costes que quedan fuera de cualquiera de los dos modelos. La guía de integración telefónica de Gemini utiliza un puente como Twilio Media Streams. Describe la conversión entre el audio μ-law de 8 kHz de Twilio, la entrada PCM de 16 kHz de Gemini y la salida PCM de 24 kHz de Gemini. Ese relé añade trabajo de operador, transporte, computación y operación.
El posicionamiento full-duplex de GPT-Live-1 puede reducir la orquestación personalizada de las interrupciones, pero no elimina los cargos del operador ni el trabajo del backend. Compara el coste total de la llamada, no solo el coste de inferencia.
“Lancé un agente de voz con Gemini Live para recopilar datos de marketing. Se quedaba bloqueado a mitad de la reserva.” — @ramanpal, al informar de un error en la gestión de
turnCompleteen Gemini 3.8 Live Extended Thinking (X).
Este es el informe inicial de despliegue de un desarrollador, no una tasa de fallos medida. Aun así, sirve para recordar que la semántica del protocolo puede costar más que una pequeña diferencia en el precio por token.
La regla de decisión que yo aplicaría
Elige GPT-Live-1 cuando la principal incertidumbre esté en la capa de voz y finanzas necesite una estimación clara basada en la duración. Establece límites estrictos para el silencio, la duración máxima de la llamada, la concurrencia y el razonamiento del backend. La cifra de $0.05 es el mínimo de la capa de voz, no el coste total por llamada.
Elige Gemini 3.8 Live cuando tu equipo pueda instrumentar el uso de tokens y se beneficie de la compresión del contexto, la multimodalidad o el control a nivel de token. Empieza con un flujo acotado, no con un asistente abierto. Mide el coste por tarea completada, no el coste por minuto:
cost per successful resolution
= total model + tool + telephony + infrastructure cost
/ completed valid resolutions
Antes de comprometerte, ejecuta la misma combinación de llamadas en ambos sistemas y registra la duración mediana y p95, los segundos de audio, los tokens de contexto retenidos, el uso de transcripciones, los reintentos de herramientas, la tasa de transferencias, las reconexiones y la tasa de resolución. El ganador será el sistema que mantenga estables esas métricas cuando las llamadas se alarguen.
Preguntas frecuentes
¿Está disponible oficialmente Gemini 3.8 Live?
La documentación actual de gestión de sesiones de Google utiliza gemini-3.8-live en un ejemplo de reanudación de sesiones. Verifica el acceso, la región, las cuotas y la fila de precios exacta en tu proyecto de Google antes de llevarlo a producción.
¿GPT-Live-1 cobra por el silencio?
Su precio publicado corresponde al tiempo de sesión de voz frontal por minuto, con facturación por segundo. Cuenta con que el tiempo de sesión —incluido el silencio— sea facturable, salvo que el contrato de tu cuenta indique lo contrario.
¿Los $0.05 por minuto de GPT-Live-1 son el coste total de la llamada?
No. OpenAI describe esa cantidad como el precio de la capa de voz frontal. El razonamiento del backend, las herramientas, la telefonía, el almacenamiento, la monitorización y la escalación a una persona son centros de coste adicionales.
¿La compresión del contexto de Gemini puede hacer que una sesión larga sea gratis?
No. La compresión es un mecanismo de gestión del contexto, no un modo sin coste. Puede limitar el historial retenido y ayudar a evitar los límites de duración, pero el audio en directo, la salida, las herramientas y la infraestructura siguen siendo facturables o relevantes desde el punto de vista operativo.
¿Qué modelo es más barato para sesiones de voz largas?
No existe una respuesta universal defendible hasta conocer la tarifa aplicable de Gemini 3.8 Live y la forma de tu tráfico. GPT-Live-1 es más fácil de prever; Gemini puede beneficiarse de una gestión cuidadosa del contexto y de las entradas. Mide ambos sistemas en función de las resoluciones completadas.
Un agente de voz en producción no se calcula por su primera conversación agradable. Se calcula por la cola larga: silencios, reintentos, crecimiento del contexto, reconexiones y llamadas que aún necesitan a una persona. Integra el sistema de medición en la arquitectura antes de elegir el modelo.