Una publicación de lanzamiento puede dar la impresión de que un modelo ya está disponible mucho antes de que los desarrolladores puedan llamarlo desde una API. En el caso de GPT-Live-1, la página pública de registro de la API de OpenAI todavía pide a los desarrolladores que soliciten recibir un aviso cuando el modelo esté disponible, mientras que la API Realtime documentada sí publica sus tarifas. La diferencia es importante: no incluyas GPT-Live-1 en un presupuesto de producción ni lo integres hasta que OpenAI publique un identificador de modelo, un endpoint, documentación y una tarifa.
La decisión, en un minuto
GPT-Live-1 no aparece documentado como una API de disponibilidad general en el material de OpenAI que he podido verificar. La página de la API de GPT-Live-1 de OpenAI es un formulario para recibir avisos, no una referencia de API: no incluye endpoint, identificador de modelo, precios, límites ni fecha de lanzamiento.
Eso no demuestra que no exista algún acceso privado. Sí significa que un desarrollador no puede tratar un anuncio en redes sociales o una experiencia de voz de ChatGPT como un contrato de API que pueda invocarse.
Para una aplicación de voz en producción hoy:
| Necesidad | Opción práctica |
|---|---|
| Lanzar ya una API de voz en tiempo real documentada | GPT-Realtime-2.1 |
| Reducir el coste de audio y de tokens de texto | GPT-Realtime-2.1 mini |
| Preparar un prototipo para cambiar de modelo en el futuro | Configurar el identificador del modelo y los precios |
| Exigir específicamente GPT-Live-1 | Apuntarse a la lista de avisos; no prometer una fecha de lanzamiento |
El precio de GPT-Live-1 no es una tarifa de API publicada
La página de registro verificada de OpenAI dice: “Sign up to get notified when GPT‑Live‑1 is available in the API.” No muestra ningún precio por minuto, coste por token de audio, coste por token de texto, consumo mínimo ni límite de uso. Por tanto, el precio honesto de la API de GPT-Live-1 es desconocido: no son $0.05 por minuto ni una estimación copiada de otro modelo en tiempo real.
El precio de las suscripciones de ChatGPT corresponde a un producto distinto. Una suscripción Plus o Pro puede incluir acceso a la función de voz para consumidores, pero no proporciona automáticamente créditos para la API. Conviene mantener la factura de la suscripción y la factura de la API en presupuestos separados.
Qué puedes comprar y desarrollar hoy
La página del modelo GPT-Realtime de OpenAI publica tarifas basadas en tokens. Las cifras siguientes son las tarifas recogidas en los materiales de investigación para la familia Realtime actual; vuelve a consultar la página oficial antes del despliegue porque los precios pueden cambiar.
| Modelo | Entrada de texto / en caché | Salida de texto | Entrada de audio / en caché | Salida de audio | Contexto / salida máxima |
|---|---|---|---|---|---|
| GPT-Realtime-2.1 | $4 / $0.40 por 1M | $24 por 1M | $32 / $0.40 por 1M | $64 por 1M | 128k / 32k |
| GPT-Realtime-2.1 mini | $0.60 / $0.06 por 1M | $2.40 por 1M | $10 / $0.30 por 1M | $20 por 1M | 128k / 32k |
Según el material analizado sobre el estado de la API, ambos modelos aceptan entradas de texto, audio e imagen y producen salidas de texto y audio; el vídeo no figura entre los formatos compatibles. El modelo estándar es la opción más segura cuando importan el razonamiento complejo o el uso de herramientas. Mini es la alternativa orientada al coste cuando la latencia y el precio pesan más que la capacidad máxima.
El detalle clave de la facturación es que las entradas y las salidas se cobran por separado. Una llamada de cinco minutos no equivale automáticamente a cinco minutos de audio del usuario más cinco minutos de audio del asistente. Mide cuánto habla realmente cada lado.
Diseña un presupuesto que aguante un cambio de modelo
Mientras GPT-Live-1 no publique una tarifa, utiliza un modelo por escenarios en lugar de inventar un precio combinado:
exposición mensual = sesiones
× uso facturable medido por sesión
× tarifa del proveedor
× factores de reintentos y llamadas a herramientas
Registra estos datos en cada piloto:
- Segundos de voz del usuario y segundos de voz del asistente, por separado.
- Tokens de entrada de texto, de entrada en caché y de salida de texto.
- Turnos, llamadas a herramientas, herramientas fallidas, reintentos y reconexiones.
- Duración de la sesión, silencios, sesiones abandonadas y concurrencia máxima.
- Tráfico de respaldo, como el modo de solo texto o un modelo más pequeño.
Por ejemplo, una hoja de planificación puede usar 500 minutos de entrada y 500 minutos de salida, pero debe marcar cualquier conversión de tokens de audio por minuto como una hipótesis. Para elaborar un presupuesto exacto, utiliza los registros de uso que devuelve la API, no la conversión genérica por minutos de una calculadora.
Define un límite estricto de duración por sesión, un máximo de llamadas a herramientas, una alerta de gasto y un interruptor de emergencia antes de abrir el piloto. Un agente de voz que se reconecta después de una caída de red puede generar consumo sin completar la tarea del cliente, así que el concepto de “uso razonable” no sirve como control financiero.
Preguntas frecuentes sobre la API de GPT-Live-1
¿El formulario de avisos concede acceso a la API de GPT-Live-1?
No. El formulario público recopila datos de contacto y de la empresa para que OpenAI pueda avisar a los desarrolladores interesados. No muestra una clave de API, un identificador de modelo, un endpoint, un contrato de precios ni una incorporación garantizada a la beta.
¿ChatGPT Plus o Pro puede pagar el uso de la API?
No. Las suscripciones de ChatGPT y el uso de la API se facturan por separado. Elige un plan de consumo para el producto ChatGPT y calcula las llamadas de la API para desarrolladores a partir de la tarifa de la API.
¿GPT-Live-Transcribe es lo mismo que GPT-Live-1?
No. Un modelo de transcripción convierte la voz en texto. GPT-Live-1 hace referencia a la experiencia de conversación por voz. El precio por minuto de transcripción no puede utilizarse como precio de un agente full-duplex que escucha, razona, habla y puede llamar a herramientas.
¿Debería un equipo esperar o usar Realtime ya?
Para producción, utiliza ahora GPT-Realtime-2.1 o su variante mini. Si el modelo de interacción de GPT-Live-1 es estratégico, aísla la configuración del modelo detrás de un adaptador para que una migración posterior implique cambiar la configuración y no toda la aplicación.
“Much more effective to dictate the same prompt within a chatgpt work window.” — @pranavkrn, al describir una limitación que observó al llamar a herramientas mediante voz; publicación original. Es un informe de usuario sobre la experiencia de ChatGPT, no una prueba sobre una API no documentada.
La decisión práctica
La opción más clara es lanzar el producto sobre un modelo Realtime documentado, registrar las categorías de uso que determinan el coste y mantener GPT-Live-1 como objetivo de configuración sustituible. Esperar solo está justificado cuando el comportamiento full-duplex específico de GPT-Live-1 sea un requisito imprescindible del producto. En cualquier otro caso, un precio y un endpoint no publicados introducen riesgos evitables para los plazos de entrega y el margen.