Il suffit parfois d’un billet de lancement pour donner l’impression qu’un modèle est déjà accessible, alors que les développeurs ne peuvent pas encore l’appeler. C’est le cas de GPT-Live-1 : la page publique d’inscription à l’API d’OpenAI invite toujours les développeurs à demander une notification lorsque le modèle sera disponible, tandis que l’API Realtime dispose déjà de tarifs documentés. La conclusion est importante : n’intégrez pas GPT-Live-1 dans un budget ou une application de production tant qu’OpenAI n’a pas publié son identifiant de modèle, son endpoint, sa documentation et sa grille tarifaire.
La décision en une minute
GPT-Live-1 n’est pas documenté publiquement comme une API généralement disponible dans les ressources d’OpenAI que j’ai pu vérifier. La page de l’API GPT-Live-1 d’OpenAI est un formulaire de notification, pas une référence d’API : elle ne fournit ni endpoint, ni identifiant de modèle, ni tarifs, ni limites, ni date de lancement.
Cela ne prouve pas qu’aucun accès privé n’existe. En revanche, un développeur qui utilise l’API publiquement ne peut pas considérer une annonce sur les réseaux sociaux ou une expérience vocale dans ChatGPT comme un contrat d’API exploitable.
Pour une application vocale destinée à la production aujourd’hui :
| Besoin | Choix pratique |
|---|---|
| Déployer dès maintenant une API vocale temps réel documentée | GPT-Realtime-2.1 |
| Réduire le coût de l’audio et des tokens texte | GPT-Realtime-2.1 mini |
| Préparer le remplacement futur du modèle | Placer l’identifiant du modèle et les tarifs dans la configuration |
| Exiger spécifiquement GPT-Live-1 | S’inscrire à la liste de notification ; ne promettre aucune date de lancement |
Le tarif de GPT-Live-1 n’est pas un prix d’API publié
La page d’inscription officielle et vérifiée d’OpenAI indique : « Sign up to get notified when GPT‑Live‑1 is available in the API. » Elle ne mentionne ni prix à la minute, ni tarif des tokens audio ou texte, ni facturation minimale, ni limite d’utilisation. Le tarif honnête de l’API GPT-Live-1 est donc inconnu : ce n’est ni $0.05 par minute, ni une estimation recopiée depuis un autre modèle temps réel.
Les abonnements ChatGPT relèvent d’un produit distinct. Un abonnement Plus ou Pro peut inclure l’accès vocal grand public, mais il ne fournit pas automatiquement de crédits API. Les développeurs doivent donc séparer le budget de l’abonnement et celui de l’API.
Ce que vous pouvez acheter et construire aujourd’hui
La page du modèle GPT-Realtime publiée par OpenAI détaille des tarifs fondés sur les tokens. Les chiffres ci-dessous correspondent aux tarifs relevés dans les documents de recherche consacrés à la famille Realtime actuelle ; vérifiez à nouveau la page officielle avant le déploiement, car les tarifs peuvent évoluer.
| Modèle | Entrée texte / mise en cache | Sortie texte | Entrée audio / mise en cache | Sortie audio | Contexte / sortie maximale |
|---|---|---|---|---|---|
| GPT-Realtime-2.1 | $4 / $0.40 per 1M | $24 per 1M | $32 / $0.40 per 1M | $64 per 1M | 128k / 32k |
| GPT-Realtime-2.1 mini | $0.60 / $0.06 per 1M | $2.40 per 1M | $10 / $0.30 per 1M | $20 per 1M | 128k / 32k |
D’après les documents étudiés sur l’état de l’API, les deux modèles acceptent des entrées texte, audio et image, et produisent du texte et de l’audio ; la vidéo n’est pas indiquée comme prise en charge. Le modèle standard est le choix le plus sûr lorsque le raisonnement complexe ou l’utilisation d’outils sont prioritaires. Mini est préférable si le coût et la latence comptent davantage que le niveau maximal de capacités.
Le point essentiel pour la facturation est que les entrées et les sorties sont comptabilisées séparément. Un appel de cinq minutes ne correspond pas automatiquement à cinq minutes d’audio utilisateur et cinq minutes d’audio assistant. Mesurez le temps de parole réel de chaque côté.
Construire un budget qui résiste à un changement de modèle
Tant que GPT-Live-1 ne dispose pas d’une grille tarifaire, utilisez un modèle par scénarios plutôt qu’un prix moyen inventé :
monthly exposure = sessions
× measured billable usage per session
× provider rate
× retry and tool-call factors
Suivez ces indicateurs pour chaque pilote :
- Le nombre de secondes de parole de l’utilisateur et de l’assistant, séparément.
- Les tokens d’entrée texte, d’entrée mise en cache et de sortie texte.
- Les tours de dialogue, appels d’outils, échecs d’outils, nouvelles tentatives et reconnexions.
- La durée des sessions, les silences, les sessions abandonnées et la concurrence maximale.
- Le trafic basculé vers un mode texte seul ou vers un modèle plus petit.
Par exemple, une feuille de préparation peut partir de 500 minutes d’entrée et 500 minutes de sortie, mais toute conversion des tokens audio en minutes doit être clairement identifiée comme une hypothèse. Pour établir un budget précis, utilisez les données d’utilisation renvoyées par l’API plutôt qu’une conversion générique en minutes proposée par une calculatrice.
Avant d’ouvrir un pilote, définissez une durée maximale de session, un plafond d’appels d’outils, une alerte de dépenses et un bouton d’arrêt d’urgence. Un agent vocal qui se reconnecte après une coupure réseau peut générer de la consommation sans mener la tâche du client à son terme : la notion de « fair use » ne constitue donc pas un contrôle financier.
FAQ sur l’API GPT-Live-1
Le formulaire de notification donne-t-il accès à l’API GPT-Live-1 ?
Non. Le formulaire public recueille des coordonnées et des informations sur l’activité afin qu’OpenAI puisse prévenir les développeurs intéressés. Il n’affiche ni clé API, ni identifiant de modèle, ni endpoint, ni contrat tarifaire, ni garantie d’inscription à une bêta.
ChatGPT Plus ou Pro peut-il financer l’utilisation de l’API ?
Non. Les abonnements ChatGPT et l’utilisation de l’API sont facturés séparément. Choisissez une formule grand public pour le produit ChatGPT et budgétez les appels API développeur à partir de la grille tarifaire de l’API.
GPT-Live-Transcribe est-il le même modèle que GPT-Live-1 ?
Non. Un modèle de transcription transforme la parole en texte. GPT-Live-1 désigne une expérience conversationnelle vocale. Le prix d’une minute de transcription ne peut pas servir à calculer le coût d’un agent full-duplex qui écoute, raisonne, parle et peut éventuellement appeler des outils.
Une équipe doit-elle attendre ou utiliser Realtime dès maintenant ?
Utilisez GPT-Realtime-2.1 ou sa variante mini pour la production dès maintenant. Si le mode d’interaction de GPT-Live-1 revêt une importance stratégique, isolez la configuration du modèle derrière un adaptateur : une migration ultérieure pourra ainsi se limiter à un changement de configuration, sans réécrire toute l’application.
« Much more effective to dictate the same prompt within a chatgpt work window. » — @pranavkrn, à propos d’une limite observée avec l’appel d’outils vocal ; publication originale. Il s’agit du retour d’un utilisateur sur l’expérience ChatGPT, pas d’un élément prouvant l’existence d’une API non documentée.
La décision concrète
La voie la plus claire consiste à déployer un modèle Realtime documenté, à enregistrer les catégories d’utilisation qui déterminent le coût et à conserver GPT-Live-1 comme cible de configuration remplaçable. Attendre ne se justifie que si le comportement full-duplex spécifique de GPT-Live-1 est une exigence produit incontournable. Dans le cas contraire, un endpoint et un tarif non publiés créent un risque évitable pour les délais de livraison comme pour les marges.