Голосовой агент может казаться почти бесплатным, пока абонент не замолчал, не сменил тему, не ждет ответа инструмента или не остается на линии полчаса. Gemini 3.8 Live и GPT-Live-1 по-разному показывают эту сторону экономики: Gemini считает токены и повторно учитывает накопленный контекст, а GPT-Live-1 предлагает понятную ставку $0.05 за минуту голосового слоя. Для продакшена важна не самая низкая цифра в прайсе, а модель оплаты, которая соответствует реальному поведению ваших сессий.
Короткий вывод для продакшен-команд
В документации Google по Live API строка модели gemini-3.8-live используется в примере возобновления сессии. В актуальной документации Google также сказано, что аудио тарифицируется как токены, а сохраненный контекст может повторно обрабатываться на следующих ходах диалога. В анонсе GPT-Live-1 OpenAI указывает цену $0.05 за минуту для фронтенд-слоя голосового взаимодействия; глубокое рассуждение и инструменты тарифицируются отдельно.
На практике получается следующее разделение:
| Задача в продакшене | С чего лучше начать | Почему |
|---|---|---|
| Предсказуемый бюджет голосового слоя | GPT-Live-1 | Продолжительность сессии по часам прогнозировать проще, чем растущий аудиоконтекст |
| Оптимизация на уровне токенов | Gemini 3.8 Live | Можно настраивать активный контекст, компрессию и набор используемых модальностей |
| Долгие разговоры с управляемой памятью | Gemini 3.8 Live — при грамотной реализации | Компрессия и возобновление сессии заложены в дизайн API |
| Быстрый запуск телефонного агента | GPT-Live-1 | OpenAI позиционирует модель для полнодуплексной телефонии и передачи задач бэкенду |
| Звонок, во время которого абонент может молчать | Ни один вариант без защитных ограничений | GPT-Live-1 тарифицирует время сессии, а Gemini по-прежнему может накапливать контекст и транспортные расходы |
Важная оговорка: на странице цен Gemini API от Google в рассмотренных здесь материалах нет отдельной строки с ценой Gemini 3.8 Live. Не подставляйте тарифы Gemini 3.1 Flash Live в финансовый прогноз для Gemini 3.8 Live.
Gemini 3.8 Live и GPT-Live-1: за что именно вы платите
Gemini 3.8 Live: аудиотокены, контекст и компрессия
В руководстве Google по оптимальной работе с Live API сказано, что нативное аудио накапливается примерно по 25 токенов в секунду аудио. Там же объясняется: в постоянной сессии накопленный контекст может повторно тарифицироваться на последующих ходах. Поэтому по мере роста разговора новый ответ может получать на вход существенно больше истории, чем предыдущий.
Упрощенная формула выглядит так:
Gemini session cost
= current audio and text usage
+ retained context reprocessed across turns
+ output audio and thinking usage
+ optional transcription usage
+ tools and infrastructure
Компрессия меняет характер роста расходов. Google документирует ContextWindowCompressionConfig и стратегию скользящего окна для долгих сессий. В приведенном Google примере компрессия запускается на отметке 25 000 токенов при размере скользящего окна 8 000 токенов. Но в продакшене эти параметры стоит проверять на сохранение нужной информации и точность работы инструментов, а не копировать вслепую.
Дополнительные расходы могут появиться и из-за транскриптов. Google указывает, что включение inputAudioTranscription или outputAudioTranscription создает дополнительное потребление текстовых токенов поверх тарификации нативного аудио. Если команде нужны поисковые транскрипты, эту надбавку нужно включить в расчет стоимости одного решенного обращения.
GPT-Live-1: оплата за фактическое время голосовой сессии
OpenAI указывает для GPT-Live-1 цену $0.05 за минуту с тарификацией с точностью до секунды для фронтенд-слоя голосового взаимодействия. Базовый расчет прост:
| Продолжительность сессии | Стоимость голосового слоя GPT-Live-1 |
|---|---|
| 5 минут | $0.25 |
| 30 минут | $1.50 |
| 1 час | $3.00 |
| 8 часов непрерывно открытой сессии | $24.00 |
Главная оговорка — паузы. Опубликованная поминутная ставка привязана ко времени сессии, а не только к секундам, когда абонент говорит. Поэтому 30-минутный звонок с десятью минутами молчания все равно занимает сессию на 30 минут.
GPT-Live-1 также не равен полной стоимости агента: OpenAI описывает его как голосовой слой, который может передавать более глубокое рассуждение и вызовы инструментов бэкенду. Токены серверных моделей, инструменты, телефония, хранение, мониторинг и переводы на оператора нужно считать отдельно.
Экономика долгих сессий: четыре сценария
Ниже приведены расчеты для GPT-Live-1 на основе опубликованной арифметики; цену Gemini 3.8 Live мы не придумываем.
1. Пятиминутный звонок для записи
На голосовой слой GPT-Live-1 придется $0.25 — без учета серверного рассуждения и телефонии. Для Gemini 3.8 Live нельзя корректно назвать цену, пока Google не опубликует или не предоставит применимый тариф для точного ID модели.
Для Gemini собирайте реальные данные сессий: секунды входного и выходного аудио, токены сохраненного контекста, токены транскрипции и вызовы инструментов. На коротком звонке токенная модель может выглядеть выгодно, но только если промпт и контекст остаются ограниченными.
2. Тридцатиминутный звонок в поддержку
Голосовой слой GPT-Live-1 обойдется в $1.50. Эту сумму удобно закладывать в бюджет, но сама по себе она ничего не говорит о том, решена ли проблема клиента.
Стоимость Gemini зависит от объема сохраненного аудио и количества ходов диалога. Два 30-минутных звонка могут заметно отличаться по числу токенов: в одном будет непрерывная речь, в другом — долгие паузы, повторные объяснения или мультимодальный ввод.
3. Молчание на линии или задержка инструмента
GPT-Live-1 продолжает тарифицироваться, пока сессия остается открытой. Операционный контроль здесь — жесткий тайм-аут тишины или явный режим передачи звонка.
Gemini не становится автоматически «бесплатным во время паузы». В модель расходов все равно входят соединение, оркестрация инструментов, политика хранения контекста и последующий ход диалога. Молчание нужно рассматривать как состояние продукта, а не только как особенность тарифа провайдера.
4. Сессия, открытая весь рабочий день
При опубликованной ставке GPT-Live-1 восемь часов непрерывно открытой голосовой сессии стоят $24. Десять таких сессий обойдутся в $240 в день — без учета бэкенд-моделей и другой инфраструктуры.
Токенная модель Gemini может оказаться эффективнее при редких взаимодействиях, если приложение не отправляет лишнее аудио и сжимает историю. Но при сохранении необработанного контекста и бесконечных циклах диалога расходы могут стать менее предсказуемыми. Сценарий постоянного прослушивания нужно проверять нагрузочными тестами, а не экстраполировать из пятиминутной демонстрации.
Ограничения продакшена, которые меняют расчеты
Контекст и время жизни соединения
В документации Google по управлению сессиями указано, что несжатые сессии только с аудио рассчитаны на 15 минут, а сессии с аудио и видео — на 2 минуты. В той же документации сказано, что отдельные WebSocket-соединения работают около 10 минут — это отдельное ограничение, не совпадающее со временем жизни логической сессии. Продакшен-клиентам понадобятся и компрессия контекста, и возобновление сессии.
Маркеры возобновления Google остаются действительными в течение двух часов после завершения последней сессии. Перед закрытием соединения сервер также отправляет GoAway. Если не обрабатывать эти события, долгий звонок может завершиться обрывом, повторным вызовом инструмента или потерей состояния абонента.
Параллельность — это отдельная статья расходов
Поминутная ставка отвечает на вопрос «сколько стоит открытая сессия?», но не на вопрос «сколько сессий я могу вести одновременно?». В документации GPT-Live-1 пропускная способность описывается через число параллельных сессий: заявленные уровни варьируются от 25 сессий на Tier 1 до 500 на Tier 5. Резкий всплеск звонков может упереться в этот потолок, даже если месячный бюджет еще не выбран. Перед запуском проверьте справочник моделей GPT-Live-1 от OpenAI и актуальные права на параллельные сессии.
Для Gemini отслеживайте число одновременных WebSocket-соединений, частоту переподключений, события компрессии и ошибки квот. Пропускная способность по токенам и число одновременных сессий — разные узкие места.
Телефония и аудиомост
Телефонный агент добавляет расходы, не связанные напрямую ни с одной из моделей. В руководстве по интеграции Gemini с телефонией используется мост вроде Twilio Media Streams. В нем описано преобразование между аудио Twilio в формате 8 кГц μ-law, входом Gemini в формате 16 кГц PCM и выходом Gemini в формате 24 кГц PCM. Такой промежуточный слой добавляет расходы на оператора связи, передачу данных, вычисления и эксплуатацию.
Полнодуплексный подход GPT-Live-1 может уменьшить объем собственной логики для обработки перебиваний, но не отменяет расходы на связь и работу бэкенда. Сравнивайте полную стоимость звонка, а не только стоимость инференса.
«Я запустил голосового агента на Gemini Live для приема маркетинговых заявок. Во время бронирования он постоянно зависал». — @ramanpal о проблеме с обработкой
turnCompleteв Gemini 3.8 Live Extended Thinking (X).
Это ранний отчет одного разработчика, а не измеренная частота сбоев. Но он хорошо напоминает: особенности протокола иногда обходятся дороже, чем небольшая разница в цене токенов.
Какое правило выбора я бы применил
Выбирайте GPT-Live-1, когда главная неопределенность связана с голосовым слоем, а финансовой команде нужна прозрачная оценка по длительности сессии. Заранее ограничьте время молчания, максимальную длительность звонка, число параллельных сессий и объем серверного рассуждения. Ставка $0.05 — это нижняя граница стоимости голосового слоя, а не итоговая цена звонка.
Выбирайте Gemini 3.8 Live, если команда умеет измерять токены и ей важны компрессия контекста, мультимодальность или управление расходами на уровне токенов. Начинайте с ограниченного сценария, а не с универсального ассистента без четких рамок. Считайте стоимость завершенной задачи, а не стоимость минуты:
cost per successful resolution
= total model + tool + telephony + infrastructure cost
/ completed valid resolutions
Перед окончательным выбором прогоните одинаковый набор звонков через обе системы и соберите медианную и p95-длительность, секунды аудио, токены сохраненного контекста, использование транскрипции, повторы вызовов инструментов, долю переводов на оператора, переподключения и долю успешно решенных обращений. Победит система, которая сохраняет эти показатели стабильными по мере удлинения звонков.
FAQ
Gemini 3.8 Live официально доступна?
В актуальной документации Google по управлению сессиями gemini-3.8-live используется в примере возобновления сессии. Перед запуском в продакшене проверьте доступность модели, регион, квоты и точную строку тарифа в своем проекте Google.
GPT-Live-1 тарифицирует молчание?
Опубликованная цена указана за минуту времени голосовой сессии фронтенд-слоя с тарификацией посекундно. Исходите из того, что оплачивается все время сессии, включая молчание, если в договоре вашего аккаунта не сказано иное.
$0.05 за минуту для GPT-Live-1 — это полная стоимость звонка?
Нет. OpenAI описывает эту сумму как цену фронтенд-слоя голосового взаимодействия. Серверное рассуждение, инструменты, телефония, хранение, мониторинг и эскалация к оператору оплачиваются или учитываются отдельно.
Может ли компрессия контекста Gemini сделать долгую сессию бесплатной?
Нет. Компрессия — это механизм управления контекстом, а не бесплатный режим. Она помогает ограничить объем сохраняемой истории и избежать ограничений по длительности, но живое аудио, вывод, инструменты и инфраструктура по-прежнему тарифицируются или требуют операционных ресурсов.
Какая модель дешевле для долгих голосовых сессий?
Универсального и обоснованного ответа нет, пока не известны применимый тариф Gemini 3.8 Live и характер вашего трафика. GPT-Live-1 проще прогнозировать, а Gemini может быть выгоднее при аккуратном управлении контекстом и входными данными. Сравнивайте обе системы по числу завершенных обращений.
Стоимость голосового агента определяется не первым приятным разговором. Ее формирует длинный хвост: молчание, повторы, рост контекста, переподключения и звонки, которые все равно приходится передавать человеку. Заложите измерение этих факторов в архитектуру еще до выбора модели.