음성 에이전트는 통화가 잠시 멈추거나, 화제가 바뀌거나, 도구 응답을 기다리거나, 30분 가까이 연결된 뒤에야 실제 비용이 드러납니다. Gemini 3.8 Live와 GPT-Live-1은 이 문제를 서로 다른 방식으로 보여줍니다. Gemini는 토큰을 기준으로 과금하고 지속되는 컨텍스트의 영향을 받는 반면, GPT-Live-1은 음성 레이어에 분당 $0.05라는 단순한 가격을 제시합니다. 프로덕션에서 더 중요한 건 헤드라인 가격이 아닙니다. 실제 세션 패턴에 더 잘 맞는 과금 방식이 무엇인지입니다.
프로덕션 팀을 위한 결론부터 정리하면
Google의 Live API 문서는 세션 재개 예제에서 gemini-3.8-live 모델 문자열을 사용합니다. Google의 최신 Live 문서에 따르면 오디오는 토큰으로 과금되며, 유지된 컨텍스트가 이후 턴에서 다시 처리될 수 있습니다. OpenAI의 GPT-Live-1 발표는 프런트엔드 음성 레이어 가격을 분당 $0.05로 제시하고 있으며, 백엔드 추론과 도구 사용 비용은 별도로 계산합니다.
따라서 실무에서는 다음과 같이 나뉩니다.
| 프로덕션 요구사항 | 우선 검토할 선택지 | 이유 |
|---|---|---|
| 예측하기 쉬운 음성 레이어 예산 | GPT-Live-1 | 늘어나는 오디오 컨텍스트보다 실제 연결 시간이 예측하기 쉽습니다 |
| 토큰 단위 최적화 | Gemini 3.8 Live | 활성 컨텍스트, 압축, 모달리티 구성을 세밀하게 조정할 수 있습니다 |
| 메모리를 통제해야 하는 장시간 대화 | Gemini 3.8 Live(신중하게 설계한 경우) | 컨텍스트 압축과 세션 재개가 API 설계에 명시적으로 포함돼 있습니다 |
| 빠른 전화 에이전트 배포 | GPT-Live-1 | OpenAI는 이 모델을 풀 듀플렉스 전화 환경과 백엔드 위임에 적합한 모델로 소개합니다 |
| 무음 상태가 길어질 수 있는 통화 | 가드레일 없이는 어느 쪽도 적합하지 않음 | GPT-Live-1은 세션 시간에 과금하고, Gemini도 컨텍스트와 오디오 전송 비용이 계속 발생할 수 있습니다 |
다만 중요한 전제가 있습니다. 검토한 자료 기준으로 Google의 Gemini API 가격 페이지에는 Gemini 3.8 Live의 별도 가격 항목이 표시돼 있지 않습니다. 재무 예측에서 Gemini 3.8 Live 대신 Gemini 3.1 Flash Live 요금을 적용해서는 안 됩니다.
Gemini 3.8 Live와 GPT-Live-1은 무엇을 기준으로 과금할까
Gemini 3.8 Live: 오디오 토큰, 컨텍스트, 압축
Google의 Live API 모범 사례 가이드에 따르면 네이티브 오디오는 오디오 1초당 약 25토큰씩 누적됩니다. 같은 가이드는 지속형 세션에서 누적된 컨텍스트가 다음 턴에 다시 과금될 수 있다고 설명합니다. 대화가 길어질수록 새 응답이 이전 응답보다 더 많은 과거 입력을 함께 처리하게 될 수 있다는 뜻입니다.
대략적인 비용 구조는 다음과 같습니다.
Gemini session cost
= current audio and text usage
+ retained context reprocessed across turns
+ output audio and thinking usage
+ optional transcription usage
+ tools and infrastructure
컨텍스트 압축을 적용하면 비용 증가 곡선을 완화할 수 있습니다. Google은 장시간 세션을 위해 ContextWindowCompressionConfig와 슬라이딩 윈도우 전략을 문서화했습니다. Google이 공개한 예제에서는 25,000토큰에서 압축을 시작하고, 8,000토큰 슬라이딩 윈도우를 사용합니다. 다만 이 설정을 그대로 복사하기보다는 실제 서비스에서 기억 재현율과 도구 호출 정확도를 기준으로 검증해야 합니다.
트랜스크립트도 추가 비용을 만들 수 있습니다. Google은 inputAudioTranscription 또는 outputAudioTranscription을 활성화하면 네이티브 오디오 과금에 더해 텍스트 토큰 사용량이 추가된다고 설명합니다. 검색 가능한 통화 기록이 필요한 팀이라면 해결 건당 비용을 계산할 때 이 추가분까지 포함해야 합니다.
GPT-Live-1: 실제 연결 시간 기준의 음성 세션 과금
OpenAI는 GPT-Live-1의 프런트엔드 음성 레이어 가격을 분당 $0.05로 제시하며, 초 단위로 계산한다고 설명합니다. 계산은 간단합니다.
| 세션 길이 | GPT-Live-1 음성 레이어 비용 |
|---|---|
| 5분 | $0.25 |
| 30분 | $1.50 |
| 1시간 | $3.00 |
| 8시간 연속 연결 | $24.00 |
여기서 핵심 변수는 무음 구간입니다. 공개된 분당 가격은 사용자가 실제로 말한 초가 아니라 세션이 유지된 시간에 연동됩니다. 10분 동안 아무도 말하지 않은 30분 통화라면 세션은 30분 동안 유지된 것으로 계산됩니다.
GPT-Live-1 역시 에이전트 전체 비용을 의미하지는 않습니다. OpenAI는 이 모델을 더 깊은 추론과 도구 호출을 위임할 수 있는 음성 레이어로 설명합니다. 따라서 백엔드 토큰, 도구, 전화망, 스토리지, 모니터링, 상담원 연결 비용은 별도로 더해야 합니다.
장시간 세션 비용을 가르는 네 가지 시나리오
아래 비교는 Gemini 3.8의 가격을 임의로 추정하지 않고, 공개된 GPT-Live-1 산식과 비용 계산 방식만 사용했습니다.
1. 5분짜리 예약 통화
GPT-Live-1의 음성 레이어 비용은 백엔드 추론과 전화망 비용을 제외하고 $0.25입니다. Gemini 3.8 Live는 Google이 정확한 모델 ID에 적용되는 요금을 공개하거나 제공하기 전까지 방어 가능한 방식으로 가격을 산정하기 어렵습니다.
Gemini를 검토한다면 실제 세션에서 오디오 입력 초, 오디오 출력 초, 유지된 컨텍스트 토큰, 트랜스크립션 토큰, 도구 호출 횟수를 측정해야 합니다. 짧은 통화에서는 토큰 과금이 매력적으로 보일 수 있지만, 프롬프트와 컨텍스트가 제한돼 있을 때의 이야기입니다.
2. 30분짜리 고객 지원 통화
GPT-Live-1의 음성 레이어 비용은 $1.50입니다. 예산을 세우기는 쉽지만, 이 숫자만으로 통화가 문제를 해결했는지는 알 수 없습니다.
Gemini의 비용은 얼마나 많은 오디오를 보존하는지, 세션에서 턴이 얼마나 자주 발생하는지에 따라 달라집니다. 같은 30분 통화라도 한쪽은 계속 대화하고 다른 한쪽은 긴 침묵, 반복 설명, 멀티모달 입력을 포함할 수 있어 토큰 사용량이 크게 달라질 수 있습니다.
3. 무음 대기 또는 지연된 도구 호출
GPT-Live-1은 세션이 열려 있는 동안 계속 과금됩니다. 운영 단계에서는 엄격한 무음 타임아웃을 두거나 명시적인 인계 상태로 전환하는 방식이 필요합니다.
Gemini도 무음 상태라고 해서 자동으로 ‘무료’가 되지는 않습니다. 연결 유지, 도구 오케스트레이션, 컨텍스트 정책, 이후에 이어지는 다음 턴까지 모두 비용 모델에 포함해야 합니다. 무음은 단순한 공급자 가격 문제가 아니라 제품 상태를 어떻게 설계할지의 문제로 봐야 합니다.
4. 하루 종일 열어두는 청취 세션
GPT-Live-1이 공개한 음성 레이어 요금 기준으로 8시간 연속 연결은 $24입니다. 이런 세션 10개를 운영하면 백엔드 모델과 기타 인프라 비용을 제외하고도 하루 $240이 듭니다.
Gemini의 토큰 모델은 불필요한 오디오 전송을 줄이고 대화 기록을 압축한다면 상호작용이 드문 환경에서 더 효율적일 수 있습니다. 반대로 원본 대화 컨텍스트를 계속 보존하고 대화 루프를 제한 없이 허용하면 비용 예측이 더 어려워질 수 있습니다. 상시 연결 설계는 5분짜리 데모에서 단순 extrapolation할 일이 아니라 부하 테스트로 검증해야 합니다.
비용표를 다시 계산하게 만드는 프로덕션 제약
컨텍스트 한도와 연결 수명
Google의 세션 관리 문서에 따르면 압축하지 않은 오디오 전용 세션은 15분, 오디오·비디오 세션은 2분으로 안내돼 있습니다. 같은 문서는 논리적 세션 수명과 별개로 개별 WebSocket 연결이 약 10분 동안 유지된다고 설명합니다. 따라서 프로덕션 클라이언트에는 컨텍스트 압축과 세션 재개가 모두 필요합니다.
Google의 세션 재개 핸들은 마지막 세션이 종료된 뒤 2시간 동안 유효합니다. 서버는 연결이 닫히기 전에 GoAway 이벤트도 전송합니다. 이 이벤트를 놓치면 장시간 통화가 끊기거나, 도구가 중복 실행되거나, 통화 상태가 유실될 수 있습니다.
동시성은 별도로 계산해야 한다
분당 요금은 ‘열린 세션 하나에 얼마가 드는가?’에는 답하지만, ‘동시에 몇 개의 세션을 운영할 수 있는가?’까지 알려주지는 않습니다. GPT-Live-1 문서는 동시 세션 기준으로 용량을 설명하며, 공개된 티어별 수치는 Tier 1의 25개 세션부터 Tier 5의 500개 세션까지입니다. 월간 지출이 예산 안에 있어도 갑작스러운 통화 급증으로 이 한도에 도달할 수 있습니다. 출시 전에 현재 동시성 할당량은 OpenAI의 GPT-Live-1 모델 레퍼런스에서 확인해야 합니다.
Gemini에서는 동시 WebSocket 수, 재연결 비율, 압축 발생 횟수, 할당량 오류를 기록해야 합니다. 토큰 처리량과 동시 세션 수는 서로 다른 병목입니다.
전화망과 오디오 브리지
전화 에이전트를 운영하면 두 모델의 비용과 별개로 추가 비용이 발생합니다. Gemini 전화 통합 가이드는 Twilio Media Streams 같은 브리지를 사용합니다. 이 가이드는 Twilio의 8kHz μ-law 오디오를 Gemini의 16kHz PCM 입력으로, Gemini의 24kHz PCM 출력을 다시 전달하는 변환 과정을 설명합니다. 이 중계 계층에는 통신사, 전송, 컴퓨팅, 운영 비용과 추가 작업이 따라옵니다.
GPT-Live-1은 풀 듀플렉스 구조를 내세우기 때문에 인터럽트 처리를 직접 오케스트레이션해야 하는 부담을 줄일 수 있습니다. 그렇다고 통신사 비용이나 백엔드 작업까지 사라지는 것은 아닙니다. 추론 비용만 보지 말고 통화 한 건의 전체 비용을 비교해야 합니다.
“마케팅 인테이크용 Gemini Live 음성 에이전트를 출시했습니다. 예약을 진행하던 중 계속 멈췄습니다.” — @ramanpal, Gemini 3.8 Live Extended Thinking에서
turnComplete처리 버그를 보고하며 (X).
이는 한 개발자가 초기 배포 단계에서 전한 사례일 뿐, 측정된 장애율은 아닙니다. 그래도 토큰 가격의 작은 차이보다 프로토콜의 동작 의미를 잘못 이해했을 때 더 큰 비용이 발생할 수 있다는 점을 보여주는 사례입니다.
제가 실제로 적용할 선택 기준
음성 레이어의 비용 변동성이 가장 큰 걱정이고 재무팀에 깔끔한 시간 기반 예측치를 제시해야 한다면 GPT-Live-1을 선택하겠습니다. 무음 시간, 최대 통화 시간, 동시성, 백엔드 추론에 상한을 설정해야 합니다. 분당 $0.05는 음성 레이어의 하한선이지, 통화 한 건의 전체 비용이 아닙니다.
팀에서 토큰 사용량을 계측할 수 있고 컨텍스트 압축, 멀티모달 처리, 토큰 단위 제어가 필요하다면 Gemini 3.8 Live를 선택하겠습니다. 처음부터 무엇이든 처리하는 열린 비서로 시작하지 말고, 범위가 제한된 워크플로부터 검증하는 편이 낫습니다. 분당 비용이 아니라 완료된 작업 하나당 비용을 추적하세요.
cost per successful resolution
= total model + tool + telephony + infrastructure cost
/ completed valid resolutions
최종 결정 전에는 동일한 통화 구성을 두 시스템에 모두 투입하고, 중앙값과 p95 통화 시간, 오디오 초, 유지된 컨텍스트 토큰, 트랜스크립션 사용량, 도구 재시도, 상담원 전환율, 재연결 횟수, 해결률을 기록해야 합니다. 통화가 길어져도 이 지표들을 안정적으로 유지하는 쪽이 실제 승자입니다.
FAQ
Gemini 3.8 Live는 공식적으로 사용할 수 있나요?
Google의 최신 세션 관리 문서는 세션 재개 예제에서 gemini-3.8-live를 사용합니다. 프로덕션에 배포하기 전 Google 프로젝트에서 실제 접근 권한, 지원 지역, 할당량, 정확한 가격 항목을 확인해야 합니다.
GPT-Live-1은 무음 구간에도 과금하나요?
공개된 가격은 프런트엔드 음성 세션의 분당 요금이며, 초 단위로 계산됩니다. 계정 계약에 다른 조건이 명시돼 있지 않다면 무음 구간을 포함한 세션 시간 전체가 과금된다고 보고 계획을 세우는 편이 안전합니다.
GPT-Live-1의 분당 $0.05가 통화 전체 비용인가요?
아닙니다. OpenAI가 제시한 금액은 프런트엔드 음성 레이어 가격입니다. 백엔드 추론, 도구, 전화망, 스토리지, 모니터링, 상담원 연결에는 별도의 비용이 발생합니다.
Gemini의 컨텍스트 압축을 사용하면 장시간 세션을 무료로 운영할 수 있나요?
아닙니다. 압축은 컨텍스트를 관리하는 기능이지 무료 모드가 아닙니다. 유지되는 대화 기록을 줄이고 시간 제한을 피하는 데 도움을 줄 수 있지만, 실시간 오디오, 출력, 도구, 인프라 비용과 운영 부담은 여전히 남습니다.
장시간 음성 세션에는 어느 모델이 더 저렴한가요?
적용 가능한 Gemini 3.8 Live 요금과 실제 트래픽 형태를 알기 전에는 보편적으로 어느 쪽이 더 저렴하다고 말하기 어렵습니다. GPT-Live-1은 비용 예측이 쉽고, Gemini는 컨텍스트와 입력을 잘 관리했을 때 이점을 얻을 수 있습니다. 두 모델 모두 완료된 해결 건을 기준으로 측정해야 합니다.
프로덕션 음성 에이전트의 가격은 처음 나눈 매끄러운 대화 한 번으로 결정되지 않습니다. 무음, 재시도, 컨텍스트 증가, 재연결, 결국 사람의 도움이 필요한 통화까지 포함한 긴 꼬리 비용이 진짜 가격을 만듭니다. 모델을 고르기 전에 아키텍처에 비용 측정 장치를 먼저 심어두세요.