Un agent vocal peut sembler peu coûteux… jusqu’à ce que l’appelant fasse une pause, change de sujet, attende le résultat d’un outil ou reste en ligne pendant une demi-heure. Gemini 3.8 Live et GPT-Live-1 rendent ce risque visible de manière très différente : Gemini facture à l’usage des tokens, avec un contexte persistant qui peut alourdir les tours suivants, tandis que GPT-Live-1 affiche un tarif simple de 0,05 $ par minute pour la couche vocale. En production, le meilleur choix n’est donc pas forcément celui qui affiche le chiffre le plus bas, mais celui dont le compteur correspond le mieux au comportement réel de vos sessions.
En bref : quel choix pour la production ?
La documentation Live API de Google mentionne l’identifiant de modèle gemini-3.8-live dans son exemple de reprise de session. La documentation Live actuelle de Google précise également que l’audio est facturé en tokens et que le contexte conservé peut être retraité lors des tours suivants. De son côté, l’annonce de GPT-Live-1 par OpenAI indique un tarif de 0,05 $ par minute pour la couche vocale front-end, le raisonnement backend et les outils étant facturés séparément.
En pratique, le choix se répartit ainsi :
| Besoin en production | Point de départ recommandé | Pourquoi |
|---|---|---|
| Prévoir simplement le budget de la couche vocale | GPT-Live-1 | La durée réelle de la session est plus facile à estimer qu’un contexte audio qui s’allonge |
| Optimiser au niveau des tokens | Gemini 3.8 Live | Le contexte actif, la compression et les choix de modalité peuvent être ajustés |
| Gérer de longues conversations avec une mémoire maîtrisée | Gemini 3.8 Live, avec une implémentation rigoureuse | La compression et la reprise de session font explicitement partie de la conception de l’API |
| Déployer rapidement un agent téléphonique | GPT-Live-1 | OpenAI positionne le modèle pour la téléphonie full-duplex et la délégation au backend |
| Gérer un appel susceptible de rester silencieux | Aucun des deux sans garde-fous | GPT-Live-1 facture la durée de la session ; Gemini peut tout de même accumuler des coûts de contexte et de transport |
Attention toutefois : la page tarifaire de l’API Gemini de Google ne présente pas de ligne de prix distincte pour Gemini 3.8 Live dans les éléments examinés ici. Ne remplacez pas les tarifs de Gemini 3.1 Flash Live par ceux de Gemini 3.8 Live dans une prévision financière.
Gemini 3.8 Live et GPT-Live-1 : quelle unité de facturation ?
Gemini 3.8 Live : tokens audio, contexte et compression
Le guide des bonnes pratiques de la Live API de Google indique que l’audio natif s’accumule à raison d’environ 25 tokens par seconde d’audio. Le même guide explique qu’une session persistante peut refacturer le contexte accumulé lors des tours suivants. Plus la conversation s’allonge, plus la requête d’une nouvelle réponse peut donc embarquer d’historique par rapport à la précédente.
Le modèle de coût, en simplifiant, ressemble à ceci :
Coût d’une session Gemini
= utilisation audio et texte du tour en cours
+ retraitement du contexte conservé au fil des tours
+ utilisation de l’audio de sortie et du raisonnement
+ utilisation éventuelle de la transcription
+ outils et infrastructure
La compression modifie cette courbe. Google documente ContextWindowCompressionConfig ainsi qu’une stratégie de fenêtre glissante pour les longues sessions. Dans l’exemple fourni par Google, la compression se déclenche à 25 000 tokens, avec une fenêtre glissante de 8 000 tokens. En production, ces paramètres doivent être validés sur la capacité de rappel et la fiabilité des outils, plutôt que repris tels quels.
Les transcriptions peuvent ajouter une ligne à la facture. Google précise que l’activation de inputAudioTranscription ou outputAudioTranscription entraîne une consommation supplémentaire de tokens texte, en plus de la facturation de l’audio natif. Si vos équipes ont besoin de transcriptions consultables, intégrez ce surcoût à votre calcul du coût par résolution.
GPT-Live-1 : une facturation basée sur la durée réelle de la session
OpenAI affiche GPT-Live-1 à 0,05 $ par minute, avec une facturation à la seconde, pour la couche vocale front-end. Le calcul est direct :
| Durée de la session | Coût de la couche vocale GPT-Live-1 |
|---|---|
| 5 minutes | 0,25 $ |
| 30 minutes | 1,50 $ |
| 1 heure | 3,00 $ |
| 8 heures ouvertes en continu | 24,00 $ |
Le silence est le principal point de vigilance. Le tarif publié à la minute dépend de la durée de la session, pas uniquement des secondes pendant lesquelles l’appelant parle. Un appel de 30 minutes comprenant dix minutes de silence occupe donc toujours la session pendant 30 minutes.
GPT-Live-1 ne représente pas non plus le coût total de l’agent : OpenAI le décrit comme une couche vocale capable de déléguer le raisonnement approfondi et les appels d’outils. Il faut donc ajouter séparément les tokens backend, les outils, la téléphonie, le stockage, la supervision et les transferts vers un humain.
Le coût des longues sessions : quatre scénarios
La comparaison ci-dessous s’appuie sur les calculs publiés pour GPT-Live-1 et sur des formules, sans inventer de tarif pour Gemini 3.8.
1. Un appel de cinq minutes pour prendre rendez-vous
GPT-Live-1 représente 0,25 $ avant le raisonnement backend et la téléphonie. Pour Gemini 3.8 Live, impossible de produire un tarif fiable tant que Google n’a pas publié ou exposé le prix applicable à l’identifiant exact du modèle.
Avec Gemini, mesurez sur de vraies sessions les secondes d’audio entrant, les secondes d’audio sortant, les tokens de contexte conservés, les tokens de transcription et les appels d’outils. Sur un appel court, la facturation aux tokens peut sembler avantageuse, mais seulement si le prompt et le contexte restent bornés.
2. Un appel d’assistance de trente minutes
GPT-Live-1 représente 1,50 $ pour la couche vocale. Le budget est facile à établir, mais ce chiffre ne dit rien de la résolution effective du problème.
Avec Gemini, le coût dépend de la quantité d’audio conservée et du nombre de tours générés pendant la session. Deux appels de 30 minutes peuvent présenter une empreinte de tokens très différente : l’un peut être constitué d’un échange continu, l’autre de longues pauses, d’explications répétées ou d’entrées multimodales.
3. Une mise en attente silencieuse ou un outil qui tarde à répondre
GPT-Live-1 continue de facturer tant que la session reste ouverte. Le garde-fou opérationnel consiste à imposer un délai maximal de silence ou à basculer explicitement vers un état de transfert.
Gemini n’est pas automatiquement « gratuit pendant les silences ». La connexion, l’orchestration des outils, la politique de conservation du contexte et le tour qui suivra doivent tous figurer dans le modèle de coût. Traitez le silence comme un état produit à gérer, pas uniquement comme une question de tarification fournisseur.
4. Une session d’écoute ouverte toute la journée
Au tarif publié de GPT-Live-1, huit heures d’ouverture continue de la couche vocale coûtent 24 $. Dix sessions de ce type représentent 240 $ par jour, avant les modèles backend et le reste de l’infrastructure.
Le modèle aux tokens de Gemini peut être plus efficace pour des interactions sporadiques si l’application évite d’envoyer de l’audio inutile et compresse l’historique. Il peut en revanche devenir moins prévisible si elle conserve le contexte brut de la conversation et autorise des boucles de dialogue sans limite. Une architecture toujours active doit être testée en charge, pas extrapolée à partir d’une démo de cinq minutes.
Les contraintes de production qui changent le calcul
Durée du contexte et de la connexion
La documentation de Google sur la gestion des sessions indique une durée de 15 minutes pour les sessions audio uniquement non compressées et de 2 minutes pour les sessions audio-vidéo. Elle précise également que les connexions WebSocket individuelles durent environ 10 minutes, indépendamment de la durée de vie de la session logique. En production, les clients ont donc besoin à la fois de la compression du contexte et de la reprise de session.
Les jetons de reprise de Google restent valides pendant deux heures après la dernière fin de session. Le serveur envoie également GoAway avant de fermer une connexion. Ignorer ces événements peut transformer un long appel en appel interrompu, en double exécution d’un outil ou en perte de l’état de l’appelant.
La concurrence est un coût à part entière
Un tarif à la minute répond à la question « combien coûte une session ouverte ? ». Il ne répond pas à « combien de sessions puis-je exécuter simultanément ? ». La documentation de GPT-Live-1 décrit la capacité en nombre de sessions concurrentes, avec des paliers annoncés allant de 25 sessions au niveau 1 à 500 au niveau 5. Un pic soudain d’appels peut donc atteindre cette limite même si les dépenses mensuelles restent dans le budget. Consultez la fiche de référence du modèle GPT-Live-1 d’OpenAI pour vérifier le quota de concurrence actuellement associé à votre compte avant le lancement.
Pour Gemini, suivez le nombre de WebSockets simultanés, les taux de reconnexion, les événements de compression et les erreurs de quota. Le débit de tokens et le nombre de sessions simultanées sont deux goulots d’étranglement différents.
Téléphonie et pont audio
Un agent téléphonique entraîne des coûts qui ne dépendent d’aucun des deux modèles. Le guide d’intégration téléphonique de Gemini utilise un pont tel que Twilio Media Streams. Il décrit la conversion entre l’audio μ-law à 8 kHz de Twilio, l’entrée PCM à 16 kHz de Gemini et la sortie PCM à 24 kHz de Gemini. Ce relais ajoute du travail côté opérateur, transport, calcul et exploitation.
Le positionnement full-duplex de GPT-Live-1 peut réduire la complexité de l’orchestration personnalisée des interruptions, mais il ne supprime ni les frais opérateur ni le travail backend. Comparez le coût complet d’un appel, pas uniquement celui de l’inférence.
« J’ai déployé un agent vocal Gemini Live pour qualifier des demandes marketing. Il restait bloqué en pleine prise de rendez-vous. » — @ramanpal, qui signale un bug de gestion de
turnCompletesur Gemini 3.8 Live Extended Thinking (X).
Il s’agit du retour d’expérience précoce d’un développeur, et non d’un taux d’échec mesuré. Le témoignage rappelle néanmoins que la sémantique du protocole peut coûter bien plus cher qu’un petit écart de prix entre deux modèles.
La règle de décision que j’appliquerais
Choisissez GPT-Live-1 lorsque la principale inconnue concerne la couche vocale et que l’équipe financière a besoin d’une estimation claire basée sur la durée. Encadrez strictement les silences, la durée maximale des appels, la concurrence et le raisonnement backend. Le chiffre de 0,05 $ constitue un plancher pour la couche vocale, pas le coût total d’un appel.
Choisissez Gemini 3.8 Live si votre équipe sait instrumenter la consommation de tokens et tire parti de la compression du contexte, du multimodal ou d’un contrôle précis de l’usage des tokens. Commencez par un workflow borné, pas par un assistant généraliste sans limites. Suivez le coût par tâche terminée plutôt que le coût par minute :
coût par résolution réussie
= coût total des modèles + outils + téléphonie + infrastructure
/ nombre de résolutions valides terminées
Avant de vous engager, faites passer le même échantillon d’appels dans les deux systèmes et mesurez la durée médiane et p95, les secondes d’audio, les tokens de contexte conservés, l’usage de la transcription, les nouvelles tentatives d’appel d’outils, le taux de transfert, les reconnexions et le taux de résolution. Le gagnant sera le système qui maintient ces indicateurs à un niveau stable lorsque les appels s’allongent.
FAQ
Gemini 3.8 Live est-il officiellement disponible ?
La documentation actuelle de Google sur la gestion des sessions utilise gemini-3.8-live dans un exemple de reprise de session. Vérifiez l’accès, la région, les quotas et la ligne tarifaire correspondant exactement à votre projet Google avant le déploiement en production.
GPT-Live-1 facture-t-il les silences ?
Son tarif publié est calculé à la minute de temps de session vocale front-end, avec une facturation à la seconde. Partez du principe que la durée totale de la session — silences compris — est facturable, sauf indication contraire dans le contrat de votre compte.
Les 0,05 $ par minute de GPT-Live-1 correspondent-ils au coût total d’un appel ?
Non. OpenAI présente ce montant comme le tarif de la couche vocale front-end. Le raisonnement backend, les outils, la téléphonie, le stockage, la supervision et l’escalade vers un humain sont autant de postes supplémentaires.
La compression du contexte Gemini peut-elle rendre une longue session gratuite ?
Non. La compression est un mécanisme de gestion du contexte, pas un mode sans coût. Elle peut limiter l’historique conservé et aider à éviter les limites de durée, mais l’audio live, la sortie, les outils et l’infrastructure restent facturables ou importants sur le plan opérationnel.
Quel modèle est le moins cher pour les longues sessions vocales ?
Il n’existe pas de réponse universelle défendable tant que le tarif applicable à Gemini 3.8 Live et la forme de votre trafic ne sont pas connus. GPT-Live-1 est plus facile à prévoir ; Gemini peut récompenser une gestion rigoureuse du contexte et des entrées. Mesurez les deux systèmes sur le nombre de résolutions terminées.
Le prix d’un agent vocal en production ne se mesure pas à sa première conversation réussie. Il se révèle dans la longue traîne : silences, nouvelles tentatives, croissance du contexte, reconnexions et appels qui nécessitent encore l’intervention d’un humain. Intégrez le compteur à l’architecture avant de choisir le modèle.