입력 토큰 가격이 6.7배 더 싼 Google의 3.5세대 최저가 모델이 정말 Pro를 대체할 수 있을까? 2026년 7월 23일, gemini-3.5-flash-lite와 gemini-3.1-pro-preview에 동일한 4개 프롬프트를 넣어 비교했다. 정확도는 동률이었지만 실제 청구 비용은 25배 차이 났다. 다만 Flash-Lite가 한 번 어긴 규칙은 실제 프로덕션 파이프라인을 멈출 수 있는 종류의 실수였다. 중간 등급 Flash도 고민 중이라면 Gemini 3.5 Flash vs Gemini 3.1 Pro 비교도 참고할 만하다.
동일 프롬프트 4종으로 붙여본 결과
두 모델에는 같은 프롬프트와 같은 OpenAI 호환 API 경로를 사용했다. 응답은 모두 프로그램으로 채점했으며, 코드 과제는 로컬 테스트 케이스 8개, 추출 과제는 엄격한 스키마로 검증했다.
| 작업 | Flash-Lite | 3.1 Pro | 승자 |
|---|---|---|---|
| Python ISO-8601 duration 파서(테스트 8개) | 8/8, 3.7초 | 8/8, 38.2초 | 정확도 동률 |
| 지저분한 이메일에서 엄격한 JSON 추출 | 필드는 정확, 마크다운 펜스로 감쌈, 1.0초 | 정확한 순수 JSON, 9.8초 | Pro |
| 백분율 논리 함정(정답: 50) | 정확, 1.8초 | 정확, 10.6초 | 동률 |
| 의도적으로 결함 3개를 심은 코드 리뷰 | 3개 중 2개 발견 + 심지 않은 문제 1개 지적, 3.7초 | 3개 중 2개 발견 + 심지 않은 문제 1개 지적, 30.2초 | 동률 |
두 모델 모두 완전히 정확한 duration 파서를 만들었다. 코드 리뷰에서도 SQL 인젝션, mutable default argument 캐시, 비효율적인 필터링을 모두 찾아냈고, 내가 심어 둔 naive datetime의 타임존 버그는 둘 다 놓쳤다. 이 네 가지 일상적인 작업만 놓고 보면 정확도 차이는 없었다.
다만 주의할 점은 두 가지다. 이는 아래의 30회 호출 실험을 더한 스폿 테스트일 뿐, 종합 벤치마크는 아니다. 또 Pro는 무해한 코드 리뷰 프롬프트에서 한 번 엉뚱한 거부 응답을 내놓아 재시도가 필요했다. 중계 경로의 노이즈일 수도 있지만, 어느 쪽이든 재시도 비용은 예산에 넣어야 한다.
Flash-Lite가 무너지는 지점
출력 형식을 끝까지 지키지 못했다
추출 프롬프트는 "Return ONLY the JSON object."라고 명시했다. Pro는 순수 JSON만 반환했다. 반면 Flash-Lite는 올바른 데이터를 ``json fences로 감싸 반환했다. 이 경우 후단의 json.loads()` 호출은 펜스를 제거하는 단계를 추가하기 전까지 실패한다.
한 번의 실수만으로 판단하기는 어려워 추가로 측정했다. 서로 다른 지원 이메일 10개에 대해 모델별로 추출 요청을 30회씩 실행하고, 순수 JSON 준수 여부와 스키마 유효성을 프로그램으로 채점했다. Flash-Lite는 30회 중 29회(96.7%)를 통과했고, 정확히 한 번 펜스로 감싼 응답을 냈다. 3.1 Pro는 30회 전부 통과했다. 유일한 실패에서도 내용 자체는 틀리지 않았다. 필드는 맞았고, 포장 방식만 잘못됐다.
출력 형식 준수는 애초에 Google이 이 모델의 강점으로 내세우는 부분이다. 공식 Flash-Lite 페이지는 이 모델을 "best for low-latency and high throughput agentic tasks"로 소개한다. 3.3%의 이탈률은 작아 보이지만, 작업당 모델을 20회 호출하는 에이전트 루프에서는 전체 실행의 약 절반에서 적어도 한 번 문제 응답을 만나게 된다(1 − 0.967²⁰ ≈ 0.49). 구조화된 출력 작업을 Flash-Lite에 보낸다면 검증기와 1회 재시도를 붙이는 편이 좋다. 실패율이 3.3%일 때 재시도 한 번이면 호출당 잔여 실패율은 약 0.1%까지 떨어지며, 내 실험의 실패는 모두 내용이 아니라 포맷 문제였다.
여전히 Pro가 맡아야 할 영역
위 네 작업은 모두 Flash-Lite가 편하게 처리할 수 있는 범위였다. 짧은 컨텍스트, 명확한 요구사항, 단발성 응답이라는 공통점이 있다. 출시 후 일주일간 나온 커뮤니티 보고도 경계선을 비교적 일관되게 보여준다. 긴 문서를 다루는 r/GeminiAI 사용자들은 작은 Gemini 모델이 흐트러지는 지점에서 Pro는 인물과 플롯의 일관성을 유지한다고 보고했다. 독립 지표도 같은 방향이다. Artificial Analysis의 Intelligence Index에서 3.1 Pro는 46점, Flash-Lite는 36점이다. 격차는 코딩이나 추출보다는 다단계 추론 평가에 집중돼 있다. 같은 추적 사이트는 관측 중인 152개 모델 가운데 Flash-Lite의 출력 속도를 2위, 지능 순위를 13위로 매긴다. 범용 대체재라기보다 뚜렷한 전문형 모델에 가까운 프로필이다.
내가 넣은 더 까다로운 과제도 한계를 암시했다. 타임존 버그는 두 모델 모두 잡지 못했다. Flash-Lite가 Pro와 같은 결과를 냈다고 Flash-Lite가 Pro가 되는 것은 아니다. 두 모델 모두 사각지대가 있다는 뜻이며, Pro의 약간 더 깊은 추론에 25배를 지불할지는 각자의 리스크로 판단해야 한다.
실무 기준으로 정리하면, 모델이 작업 도중 계획을 다시 세워야 하거나, 5만 단어 이상에서 일관성을 유지해야 하거나, 실패 비용이 큰 판단을 내려야 하는 작업은 여전히 Pro를 쓸 이유가 있다. 템플릿화할 수 있는 작업은 그렇지 않다.
가격표상 4.8배가 아니라, 실측 25배였다
가격표만 보면 Pro의 출력 비용은 Flash-Lite보다 4.8배 높다(100만 토큰당 $12 대 $2.50). 하지만 네 작업에서 내가 측정한 실제 지출은 Flash-Lite 약 $0.005, Pro 약 $0.13으로 25배 차이였다. Lite는 총 약 570 입력 토큰과 2,020 출력 토큰을 청구했고, Pro는 정가 기준 1,700 입력 토큰과 10,386 출력 토큰을 청구했다.
차이를 키운 원인은 사고 토큰이다. Gemini 3.1 Pro는 답변 전 추론을 수행하고, Google은 그 추론을 출력 토큰으로 과금한다. 파서 작업에서 Pro는 출력 토큰 5,125개를 냈는데 그중 4,811개(94%)가 사고 토큰이었다. Flash-Lite는 같은 프롬프트에 819토큰으로 바로 답했다. 네 작업 전체에서는 Pro에 청구된 모든 토큰의 84%가 사고 토큰이었다.
30회 추출 실험에서는 격차가 줄지 않고 오히려 더 벌어졌다. 짧은 출력일수록 사고 토큰 오버헤드 비율이 커지기 때문이다. Flash-Lite는 30회 전체를 출력 토큰 1,899개, 총 약 $0.006에 처리했다. Pro는 출력 토큰 29,468개를 청구했으며, 이 중 27,636개(94%)가 사고 토큰이었다. 비용은 약 $0.38, 이 워크로드에서는 65배 차이다. 이를 월간 추출 호출 100만 건으로 늘리면 청구 항목은 $190과 $12,500의 차이가 된다.
이 현상은 내 작은 표본만의 특이점이 아니다. Tessl 코딩 벤치마크 팀은 약 3,300개의 코딩 에이전트 작업을 실행한 결과, 정가가 더 높음에도 Gemini 3.1 Pro가 추론 비중이 높은 Gemini 3.5 Flash보다 실제로 더 저렴했다고 밝혔다. 메커니즘은 같고 결과 방향만 반대인 사례다. Artificial Analysis의 cost-to-run-index 수치도 같은 역전을 보여준다. 여기서 얻을 수 있는 원칙은 분명하다. 토큰당 가격표가 아니라 완료된 작업당 실측 비용으로 모델을 비교해야 한다.
2026년 7월 23일 기준 사양과 가격
Google의 공식 Gemini API 가격 페이지 기준이다.
| Gemini 3.5 Flash-Lite | Gemini 3.1 Pro (≤200k ctx) | |
|---|---|---|
| 입력 / 100만 토큰 | $0.30 | $2.00 (200k 초과 시 $4.00) |
| 출력 / 100만 토큰(사고 토큰 포함) | $2.50 | $12.00 (200k 초과 시 $18.00) |
| 배치 티어 | $0.15 / $1.25 | $1.00 / $6.00 |
| 컨텍스트 캐싱 | $0.03 | $0.20 |
| 컨텍스트 윈도우 | 입력 1M / 출력 64k | 입력 1M / 출력 32k |
| 출력 속도(Artificial Analysis) | 426.8 tok/s | 112.2 tok/s |
| 상태 | GA, gemini-3.5-flash-lite | Preview, gemini-3.1-pro-preview |
눈여겨볼 부분은 두 가지다. Flash-Lite는 전작보다 오히려 가격이 올랐다. 3.1 Flash-Lite의 가격은 $0.25/$1.50이었으므로 출력 비용은 67% 상승했다. Google의 근거는 성능 향상이다. DeepMind 모델 페이지의 공개 수치에 따르면 3.5 Flash-Lite는 3.1 Flash-Lite 대비 SWE-Bench Pro에서 38.3%에서 54.2%로, Terminal-bench 2.1에서는 31%에서 54%로 올랐다. 출력 한도도 비대칭적이다. Flash-Lite는 Pro의 32k보다 두 배인 64k 출력 토큰을 허용한다. 역설적으로 아주 긴 단일 생성은 저렴한 모델의 영역이다.
초기 사용자 평가는 엇갈린다
검증 시점에 모델 출시 후 이틀밖에 지나지 않아 논의량은 아직 많지 않다. 그래도 X에서 나온 첫 프로덕션 보고는 크게 세 갈래로 나뉜다.
- 가격 인상에 대한 불만: 7월 23일 @samarthg1911은 "Why is 3.5 flash lite 50% more expensive. It is so sneaky,"라고 썼다. 가격 인상은 가장 자주 보이는 불만이다.
- 파이프라인 성과: ML 엔지니어 @mrdbourke는 이 모델이 "very fast and excellent at vision"이라고 평가하며, 일부 파이프라인에서 출력 가격이 3.6배인 Gemini 3.5 Flash를 대체했다고 밝혔다. 콘텐츠 도구를 운영하는 또 다른 팀도 인터넷 슬랭 파싱에서 3.1 Flash-Lite 대비 "significant step up"이라고 평가했다.
- 성능 하락 보고: 한 엔지니어의 내부 평가는 정반대 결론을 냈다. "3.5 flash lite is a real downgrade"라며 팀이 3.1 Flash-Lite에 남았다고 했다.
초기 평가가 엇갈린다는 것은 대개 모델의 장점이 워크로드에 따라 뚜렷하게 갈린다는 뜻이다. 내 데이터도 마찬가지였다. 자기 영역에서는 훌륭하지만, 경계에서는 조용히 허술해진다.
작업별 모델 라우팅 기준
Gemini 3.5 Flash-Lite와 Gemini 3.1 Pro 중 하나만 고를 필요는 없다. 측정 결과와 커뮤니티의 실패 보고를 함께 고려하면, 나는 다음처럼 배포하겠다.
Flash-Lite로 보낼 작업($0.30/$2.50):
- 구조화된 추출, 분류, 태깅 작업(JSON 검증기와 1회 재시도 포함)
- 템플릿 수준의 코드 생성(파서, 변환기, CRUD 스캐폴딩)
- 빈도가 높은 에이전트 단계: 도구 호출 포맷팅, 요약 후 전달, 라우팅 결정
- 비전 비중이 높고 물량이 많은 처리 작업. 초기 사용자들의 긍정 평가가 가장 집중된 영역이다
- 기존에 3.1 Flash-Lite를 쓰던 모든 작업. 동일 티어 모델이 이제 SWE-Bench Pro에서 16점 더 높다
3.1 Pro에 남겨둘 작업($2/$12):
- 수만 단어에 걸친 일관성 자체가 결과물인 장문서 작업(커뮤니티 보고 기준이며, 이번 테스트에서는 검증하지 않음)
- 도구 호출이 예상치 못한 결과를 돌려줄 때 계획을 다시 세워야 하는 에이전트 작업
- 답 하나를 틀렸을 때의 비용이 한 달간의 가격 차이보다 큰 판단 작업
- 200k 컨텍스트를 넘는 작업. 이 구간에서는 $4/$18로 두 배가 되는 요금을 반영해야 한다
한 모델을 고정하는 것보다 효과적인 패턴은 기본적으로 Flash-Lite로 보내고, 명확한 트리거에서만 Pro로 승격하는 방식이다. 예를 들어 한 번 재시도한 뒤에도 스키마 검증에 실패했을 때, 도구 호출이 오류나 예상 밖의 형태를 반환했을 때, 입력이 팀의 컨텍스트 안정 범위를 넘었을 때, 혹은 업스트림에서 고위험 작업으로 태그했을 때다. 실측 비용 차이가 25배인 만큼 승격 비율을 약 15%로 유지하면, 모든 작업을 Pro에서 돌리는 것보다 지출을 약 80% 줄일 수 있다(0.85 + 0.15 × 25 = Lite 비용의 4.6배, Pro만 사용할 때는 25배).
두 모델 호출 방법
Flash-Lite는 Gemini API, Google AI Studio, Gemini 앱에서 gemini-3.5-flash-lite라는 GA 모델로 제공된다. 3.1 Pro는 gemini-3.1-pro-preview라는 Preview 모델로 남아 있다. 둘 다 OpenAI 호환 릴레이 플랫폼에서도 사용할 수 있다. 예를 들어 AIReiter의 Google 모델 카탈로그는 Gemini 라인을 다른 공급자 모델과 함께 제공하며, 나는 이 방식으로 SDK 두 개를 오가지 않고 위 비교를 실행했다. 같은 테스트를 재현한다면 호출마다 엔드포인트가 보고하는 사고 토큰 수를 기록해 두는 것이 좋다. OpenAI 호환 경로에서는 usage.completion_tokens_details.reasoning_tokens, 네이티브 Gemini API에서는 thoughtsTokenCount다. 25배 차이는 바로 이 필드에 숨어 있다.
FAQ
Gemini 3.5 Flash-Lite가 Gemini 3.1 Pro보다 더 좋은가요?
아니다. 내 4개 작업 스폿 테스트에서는 코드 생성, 추출, 논리, 코드 리뷰 모두 Pro와 같은 결과를 냈고, 응답은 8배 빠르며 비용은 25배 낮았다. 하지만 장문 컨텍스트 일관성, 동적 재계획, 추론 깊이에서는 Pro가 우위다. Artificial Analysis 지수도 46 대 36이다.
Gemini Flash와 Flash-Lite 중 어느 쪽이 더 좋은가요?
Flash($1.50/$9.00)는 추론 모델이며 에이전트 벤치마크 점수가 더 높다. Flash-Lite($0.30/$2.50)는 사고 수준 조절을 지원하지만, 내 34회 호출에서는 모두 사고 토큰이 0개였고 그래서 약 1초 만에 답했다. 대량 추출, 분류, 비전 파이프라인이라면 Flash-Lite의 5~6배 가격 우위가 대체로 더 유리하다. 다단계 에이전트 추론에는 Flash 비용을 지불하는 편이 낫다.
Gemini 3.5 Flash-Lite 가격은 왜 올랐나요?
Google은 3.1 Flash-Lite의 $0.25/$1.50에서 $0.30/$2.50로 가격을 올렸다. 출력 비용 기준 67% 인상이다. 동시에 공개 성능 수치는 크게 뛰었다. SWE-Bench Pro는 38.3% → 54.2%, Terminal-bench는 31% → 54%다. 토큰당 가격은 더 내지만, 시도 횟수가 적은 모델에 비용을 지불하는 구조다.
Gemini 3.5 Pro도 있나요?
2026년 7월 23일 기준으로는 없다. 3.5세대에는 Flash-Lite, Flash, Live Translate 티어와 더 새로운 3.6 Flash가 출시됐다. Pro 라인의 최신 릴리스는 여전히 Preview 상태인 3.1 Pro다.
