Gemini 3.5 Flash-Lite: 가격, 속도, 추천 활용처

마지막 업데이트: 2026-07-22 07:17:31

Gemini를 가장 낮은 비용으로 운영하려면 Gemini 3.5 Flash-Lite가 답이다. 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50으로 Gemini 라인업 중 가장 저렴하다. 동일한 작업을 놓고 Gemini 3.6 Flash와 간단히 비교해 보니 비용은 94% 낮았고, 스트리밍 응답도 더 빨랐으며 정답도 모두 맞혔다. 다만 이 모델은 깊이 있는 추론보다 처리량과 속도에 맞춰 설계됐다. 대규모로 반복되는 비교적 단순한 업무라면 가장 먼저 고려할 모델이다.

Gemini 3.5 Flash-Lite는 어떤 모델인가

Flash-Lite는 Gemini 고속 모델군의 가장 아래 티어다. 한 번의 호출 비용과 지연 시간이 모델의 절대적인 지능보다 중요한, 단순하고 대량의 작업을 겨냥한다. 핵심 사양은 다음과 같다.

  • 가격: 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50.
  • 컨텍스트: 상위 Flash 모델과 동일한 100만 토큰.
  • 속도: Google 기준 초당 약 350개의 출력 토큰.
  • 지능: Artificial Analysis Index는 36이다. 더 비싼 3.6 Flash의 50보다 낮으며, 이 차이가 비용 절감의 대가다.

3.6 Flash 및 보안 중심 모델인 3.5 Flash Cyber와 함께 출시됐지만, 맡는 역할은 다르다. 분류, 정보 추출, 라우팅, 태깅, 단순한 대화처럼 규모가 큰 반복 작업이 주력이다.

Gemini 중 가장 낮은 가격대

Google 공식 가격 페이지 기준으로 다른 모델과 비교하면 Flash-Lite의 가격 차이는 분명하다.

모델입력 /100만출력 /100만
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash (이전 모델)$1.50$9.00

토큰 사용량을 고려하기 전 가격만 봐도 3.6 Flash보다 입력은 5배, 출력은 3배 저렴하다. 실제 비용 차이는 모델별 토큰 소비량까지 합치면 더욱 벌어진다.

3.6 Flash와 직접 비교해 봤다

2026년 7월 22일, OpenRouter에서 temperature 0으로 두 모델에 동일한 세 가지 프롬프트를 보냈다. 코딩 작업, 추론 문제, JSON 추출 작업을 각각 하나씩 테스트했다.

측정 항목(3개 작업, temp 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
입력 토큰147148
출력 토큰5433,058
총비용$0.0014$0.023
첫 토큰까지 평균 시간1.2초4.5초
생성 속도초당 400토큰 이상
정답 수3 / 33 / 3

Flash-Lite는 94% 더 저렴했고, 여러 단계로 풀어야 하는 열차 시간 문제를 포함해 모든 작업에 올바르게 답했다. 비용 차이를 만든 요인은 두 가지다. 우선 실제 스트리밍 속도는 초당 400토큰을 넘어 Google이 제시한 350보다 빨랐다. 3.6 Flash처럼 답변 전에 ‘생각’하느라 멈추는 과정이 적어 첫 토큰도 더 빨리 나왔다. 또 출력이 훨씬 짧았다. 3.6 Flash는 사용자가 비용을 지불하는 숨겨진 추론 토큰을 많이 쓰기 때문에 수천 토큰을 소비한 반면, Flash-Lite는 수백 토큰 수준이었다. 단순한 작업에서는 이런 추론 비용이 굳이 필요 없는 오버헤드가 될 수 있다.

동일한 세 작업에서 Gemini 3.5 Flash-Lite 비용이 Gemini 3.6 Flash의 약 6%임을 보여주는 막대 차트

체감 응답성 차이도 컸다. Flash-Lite는 첫 토큰이 평균 약 1.2초 만에 나왔고, 3.6 Flash는 4.5초가 걸렸다. 채팅이나 대량 처리 파이프라인에서는 Flash-Lite가 확실히 더 민첩하게 느껴진다.

첫 토큰까지 평균 시간을 비교한 막대 차트. Gemini 3.5 Flash-Lite는 1.2초, Gemini 3.6 Flash는 4.5초

다만 두 가지는 염두에 둬야 한다. 첫째, 이번 결과는 temperature 0에서 한 번씩 실행한 테스트다. 모델 응답은 실행마다 달라질 수 있으므로, 수치를 절대적인 벤치마크가 아니라 참고값으로 보는 편이 맞다. 둘째, 세 작업 모두 쉬운 편이었다. Intelligence Index의 차이(36 대 50)는 실제로 존재하며, 어려운 문제나 복잡한 다단계 에이전트, 미묘한 코딩 작업, 신중한 추론이 필요한 업무에서는 드러난다. 이때 Flash-Lite의 제한된 추론 예산은 절감 요소가 아니라 성능 한계가 된다.

Flash-Lite를 써야 할 때와 3.6 Flash로 올려야 할 때

  • Gemini 3.5 Flash-Lite를 선택할 작업: 대량 처리, 낮은 지연 시간, 낮은 복잡도가 중요한 업무다. 분류, 엔터티 추출, 라우팅과 트리아지, 태깅, 짧은 텍스트 요약, 단순 채팅이 여기에 해당한다. 이 가격이라면 3.6 Flash로는 부담스러운 규모도 운영할 수 있다.
  • 3.6 Flash로 올릴 작업: 실질적인 추론이 필요한 경우다. 에이전트 기반 코딩, 컴퓨터 사용, 다단계 워크플로, 오답의 비용이 큰 업무라면 3.6 Flash가 적합하다. 이 티어의 벤치마크와 가격은 Gemini 3.6 Flash 가이드에서 확인할 수 있다.

실무에서는 두 모델을 함께 쓰는 방식이 흔하다. 저렴하고 단순한 요청 대부분은 Flash-Lite로 보내고, 어려운 사례만 3.6 Flash로 승격하는 식이다. 두 모델 모두 100만 토큰 컨텍스트와 동일한 API를 사용하므로 모델 ID 한 줄만 바꾸면 전환할 수 있다.

Gemini 3.5 Flash-Lite 사용 방법

이 모델은 Gemini API와 Google AI Studio에서 gemini-3.5-flash-lite ID로 사용할 수 있다. AI Studio에는 테스트용 무료 티어도 제공된다. 애그리게이터를 이용한다면 OpenRouter와 AIReiter 모두 Google 정가로 이 모델을 제공한다. 하나의 키로 Gemini와 Claude 모델을 함께 운영할 때 편리하다.

FAQ

Gemini 3.5 Flash-Lite 가격은 얼마인가요?

입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50이다. Gemini 라인업에서 가장 저렴한 티어다.

Gemini 3.5 Flash-Lite는 무료인가요?

Google AI Studio에는 프로토타이핑을 위한 무료 티어가 있다. 프로덕션 사용에는 앞서 설명한 종량제 가격이 적용된다.

Gemini 3.5 Flash-Lite는 얼마나 빠른가요?

Google은 초당 약 350개의 출력 토큰으로 안내한다. 내 스트리밍 테스트에서는 초당 400토큰 이상이었고, 첫 토큰은 약 1.2초 만에 도착했다.

Flash-Lite면 충분한가요, 아니면 3.6 Flash를 써야 하나요?

단순하고 대량으로 처리하는 작업에서는 Flash-Lite도 정확하며 비용은 훨씬 낮다. 추론 비중이 높거나 에이전트 기반 작업이라면 더 높은 지능(Index 50 대 36)을 갖춘 3.6 Flash에 추가 비용을 지불할 가치가 있다.

함께 읽으면 좋은 글