AIREITER

Gemini 3.8 Flash API 가격: 성공한 에이전트 작업 1건당 비용 계산법

마지막 업데이트: 2026-09-15 19:33:54

Gemini 3.8 Flash 에이전트는 입력 토큰 100만 개당 $0.75라는 가격만 보면 저렴해 보인다. 하지만 이는 도입 기간 요금이다. Google은 2027년 1월 1일부터 표준 요금을 두 배로 책정해 두었고, 추론 토큰과 재시도까지 더하면 실제 승인된 작업 1건당 비용은 더 커질 수 있다. 지금 보이는 토큰 단가가 아니라 1월 요금과 실제 성공률을 기준으로 예산을 잡아야 한다.

에이전트 개발자가 봐야 할 가격 지표

중요한 수치는 API 호출 1회당 비용이 아니다. 성공한 작업 1건당 비용, 즉 전체 모델·도구 지출을 승인 기준을 통과한 실행 횟수로 나눈 값이다.

Gemini 3.8 Flash는 추가 추론이 재시도를 줄이거나 승인 결과를 개선하는 복잡한 다단계 작업에서 가장 설득력 있다. 반면 형식이 고정된 추출 작업이나 단순 분류 경로까지 모두 이 모델의 기본 대상으로 삼을 이유는 없다.

“에이전트 루프에 flash를 쓴다면, 오늘 API 페이지가 아니라 1월 청구서를 기준으로 가격을 계산하세요.” — Vraj (@vraj_ai), 2026년 9월 3일

2027년 1월 1일 이후 Gemini 3.8 Flash API 요금

Google의 Gemini API 가격 문서모델 문서에는 2026년 12월 31일까지 적용되는 도입 기간 요금이 안내돼 있다. 표준 요금은 2027년 1월 1일부터 시작된다.

과금 방식2026년 12월 31일까지 입력2026년 12월 31일까지 출력2027년 1월 1일부터 입력2027년 1월 1일부터 출력
Standard$0.75 / 1M$3.75 / 1M$1.50 / 1M$7.50 / 1M
Batch$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Flex$0.375 / 1M$1.875 / 1M$0.75 / 1M$3.75 / 1M
Priority$1.35 / 1M$6.75 / 1M$2.70 / 1M$13.50 / 1M
Cached input$0.075 / 1M$0.15 / 1M

이 표는 토큰 단가일 뿐, 에이전트 전체 청구 금액은 아니다. 문서에 명시된 grounding, 캐시 저장소, 외부 도구, 호스팅, 제공업체 수수료에는 별도 비용이 붙을 수 있다. 출력 과금에는 사용자에게 보이는 답변뿐 아니라 thinking 토큰도 포함된다.

처리가 늦어도 되는 작업이라면 Batch가 가장 유용한 예산 절감 수단이다. 변경 후 Batch 요금은 현재 Standard 요금과 같아진다. 단, 해당 워크로드가 Batch 조건을 충족하고 실제 사용하는 API 인터페이스에 Batch 요금이 적용돼야 한다.

성공한 작업 1건당 비용 계산식

토큰 수에 단가를 한 번 곱하는 대신, 다음 네 단계로 계산하자.

  1. 시도 1회당 모델 비용 = (입력 토큰 × 입력 단가) + (출력 토큰 × 출력 단가).
  2. 시도 1회당 총비용 = 모델 비용 + 도구, grounding, 저장소, 인프라 비용.
  3. 예상 성공 작업당 비용 = 시도 비용 ÷ 성공 확률.
  4. 실측 성공 작업당 비용 = 총지출 ÷ 승인된 작업 수.

에이전트 루프에서는 모든 모델 턴과 재시도를 포함해야 한다. 한 번의 실행이 답을 내기까지 세 번 호출됐다면, 입력·출력 토큰은 세 호출의 합계다. thinking 토큰도 출력 사용량에 포함해 집계한다. Google은 Gemini 응답에서 promptTokenCount, thoughtsTokenCount, candidatesTokenCount 같은 사용량 필드를 제공한다.

계산 예시: 입력 20,000토큰, 출력 5,000토큰

완전한 시도 1회가 입력 20,000토큰과 출력 5,000토큰을 사용한다고 가정하자. 이 예시에서는 도구 비용을 제외한다.

기간계산식시도 1회당 비용성공률 70%일 때 성공 작업당 비용
2026년 12월 31일까지0.02 × $0.75 + 0.005 × $3.75$0.03375$0.0482
2027년 1월 1일부터0.02 × $1.50 + 0.005 × $7.50$0.06750$0.0964

토큰 사용량과 성공 확률이 같다면 요금 변경으로 비용은 정확히 두 배가 된다. 일부 실패에서 에이전트가 한 번 더 재시도한다면, 실패한 시도 역시 토큰을 쓰므로 실제 평균 비용은 이 단순 추정치보다 높아진다.

분모가 핵심이다. 호출당 $0.05가 들지만 실행 절반만 성공하는 에이전트라면 도구 비용을 제외하고도 승인 작업당 $0.10이 든다. 반대로 호출당 $0.08이 들고 성공률이 90%라면 승인 작업당 비용은 약 $0.0889다.

예산 계산 결과를 바꾸는 세 가지 시나리오

형식이 고정된 추출 작업

안정적인 스키마를 가진 PDF-to-JSON 경로는 보통 승인 기준이 명확하다. 필수 필드가 존재하고, 타입 검증을 통과하며, 불필요한 설명 문장이 없어야 한다. 우선 low thinking으로 시작해 작업 통과 여부를 측정하자. 검증을 이미 통과하는데 high effort에 비용을 더 쓰는 것은 분모를 늘리지 못한 채 비용만 추가할 수 있다.

Google의 모델 문서에 따르면 Gemini 3.8 Flash는 low, medium, high thinking 수준을 지원하며 minimal은 지원하지 않는다. thinking 수준은 애플리케이션 전체의 단일 기본값이 아니라 경로별 비용 설정으로 다루는 편이 낫다.

긴 컨텍스트를 다루는 에이전트

코딩이나 리서치 에이전트는 여러 턴에 걸쳐 큰 컨텍스트를 반복 전송하고, 여기에 추가 추론과 도구 호출까지 생성할 수 있다. 이런 경우 명목상 출력 단가보다 캐시 입력, 재시도 감소, 성공률 개선이 더 큰 영향을 줄 수 있다.

장시간 작업에서는 컨텍스트 재전송분과 새 입력을 따로 기록하자. 100만 토큰 컨텍스트 창이 있다고 해서 그 토큰이 무료가 되는 것은 아니다. 상호작용형 경로라면 Standard나 Priority가 적절할 수 있고, 밤새 실행해도 된다면 요구되는 처리 시간을 기준으로 Batch와 Flex를 비교해야 한다.

재시도가 많은 자동화

2027년 1월 1일 이후 시도 1회당 $0.0675가 들고 성공률이 70%인 경로를 가정해 보자. 재시도가 서로 독립적이고 재시도 횟수 제한이 없다면, 성공 1건에 필요한 기대 시도 횟수는 약 1 ÷ 0.70 = 1.43이다. 승인 작업 1건당 모델 비용은 약 $0.0964가 된다.

실패 시 비용이 큰 브라우저 작업, 검색 호출, 사람의 검토가 이어진다면 그 비용도 분자에 넣어야 한다. 토큰 비용이 낮은 에이전트라도 운영 비용은 높을 수 있다.

Gemini 3.8 Flash가 더 비싼 값을 하는 경우

추가 추론이 결과를 실제로 바꿀 때 Gemini 3.8 Flash를 써야 한다. 거부되는 패치가 줄어들고, 도구 실행 시퀀스 실패가 감소하며, 다단계 검증이 개선되거나, 어려운 작업의 승인률이 높아지는 경우다. 반복 변환, 라우팅, 추출처럼 낮은 effort에서도 이미 승인 기준을 통과하는 작업에는 더 저렴한 경로를 유지하자.

Artificial Analysis가 보고하고 Apidog가 요약한 독립 수치에 따르면, high-thinking 구성에서 Gemini 3.8 Flash의 벤치마크 작업당 비용은 약 $0.58이고 Gemini 3.7 Flash는 약 $0.40이다. Intelligence Index 점수는 각각 59와 56이다. 이는 특정 벤치마크 기준 수치이지 일반적인 청구 비용 전망은 아니다. 워크로드의 견적이 아니라 토큰 소비량이 경제성을 바꿀 수 있다는 근거로 활용해야 한다.

커뮤니티 보고도 같은 방향을 가리킨다. Jan (@jan_volad)은 Gemini 3.8 Flash 비교 한 건에서 출력 토큰이 약 1억 2,000만 개였으며, 경쟁 모델은 2,900만~3,500만 개였다고 전했다. 또한 혼합 작업 비용을 $0.58로 설명했다. 이는 독립 감사를 거친 프로덕션 청구서가 아니라 사용자 관찰이다. 해당 게시물은 100만 토큰당 낮은 단가가 실제 절감폭을 과장할 수 있는 이유를 보여준다는 점에서 참고할 만하다.

실무적인 라우팅 원칙은 다음과 같다.

  • 난도가 높은 에이전트 작업: Gemini 3.8 Flash를 medium 또는 high로 테스트하고 승인 작업당 비용을 측정한다.
  • 반복적인 작업: 먼저 low를 테스트하고, 품질 게이트를 통과할 때만 해당 경로를 유지한다.
  • 지연 허용 대량 작업: 1월 1일 이후 Batch와 Standard를 비교한다.
  • 품질이 불확실한 모든 경로: 성공 확률을 측정하기 전에는 토큰 단가 최적화부터 하지 않는다.

Gemini 3.8 Flash 가격 FAQ

Batch는 항상 더 저렴한가요?

표에 명시된 단가만 보면 Batch가 더 저렴하다. 다만 처리 지연을 허용할 수 있는 워크로드를 위한 방식이다. 즉시 응답해야 하는 상호작용형 에이전트를 그대로 대체할 수는 없다.

성공한 에이전트 작업 1건당 비용은 어떻게 계산하나요?

집계 기간의 모델, 도구, grounding, 인프라 비용을 모두 더한 뒤 승인 기준을 통과한 실행 수로 나눈다. 예측값이 필요하다면 예상 시도 비용을 추정 성공 확률로 나누고, 예상 재시도까지 포함한다.

결론: 모델이 아니라 경로 단위로 예산을 세워라

경로별로 입력, thinking, 가시 출력, 도구 턴, 재시도, 지연 시간, 지출, 승인 상태를 기록하자. 관련 thinking 수준을 테스트한 뒤 12월 요금표와 1월 요금표를 모두 반영해 비용을 추정해야 한다.

판단 기준은 간단하다. 추가 추론이 성공 결과를 늘리는 곳에는 Gemini 3.8 Flash를 쓰고, 이미 통과하는 작업에는 낮은 effort를 적용하며, 조건을 충족하는 대량 작업은 Batch로 옮긴다. 2027년 1월 요금 변경은 현재 공개된 표에 예정돼 있다. 다만 이 모델이 경제적인지는 성공 결과 하나 뒤에 쌓인 토큰과 실패 횟수에 달려 있다.