Gemini 3.6 Flash vs 3.1 Pro: 가격·속도·최종 선택

마지막 업데이트: 2026-07-23 09:47:56

보통은 Pro가 이깁니다. 이번에는 아닙니다. Gemini 3.6 Flash 는 Gemini 3.1 Pro보다 가격이 낮고, 출력 속도는 2배를 넘으며, 코딩과 에이전틱 벤치마크 대부분에서 더 좋은 점수를 냈습니다. 기존 3.1 Pro가 지키는 영역은 하나뿐입니다. 가장 난도가 높은 순수 추론 테스트에서의 근소한 우위입니다. 두 모델에 동일한 작업을 실행했고, 아래 가격과 사양은 2026년 7월 23일 Google 문서와 Artificial Analysis를 다시 대조해 확인했습니다.

30초 결론: 기본 선택은 Flash

Gemini 3.6 Flash

Gemini 3.1 Pro

우세

API 가격(입력/출력, 1M당, ≤200k)

$1.50 / $7.50

$2.00 / $12.00

Flash

긴 프롬프트(>200k 토큰)

동일한 고정 요금

$4.00 / $18.00

Flash

출력 속도

261 tokens/s

112 tokens/s

Flash

코딩·에이전틱 벤치마크

4개 직접 비교 모두 승리

Flash

최고난도 추론(GPQA, HLE)

1.3~6.4점 앞섬

3.1 Pro

지식 컷오프

2026년 3월

2025년 1월

Flash

출시 상태

정식 출시

2026년 2월부터 Preview

Flash

여기까지만 읽는다면 결론은 간단합니다. 기본 모델로는 Gemini 3.6 Flash를 쓰고, 최상위 추론 성능이 반드시 필요한 작업에서만 3.1 Pro를 꺼내면 됩니다. API 키 없이도 브라우저 채팅에서 직접 프롬프트를 넣어 Gemini 3.6 Flash 와 Gemini 3.1 Pro 를 비교할 수도 있습니다. 아래에서는 그 근거와 재현 가능한 3개 작업 테스트를 다룹니다.

가격 차이: 긴 컨텍스트일수록 더 벌어진다

Gemini 3.6 Flash는 프롬프트 길이와 관계없이 동일한 요금을 적용합니다. 반면 Gemini 3.1 Pro는 기본 요금부터 높고, 긴 프롬프트에는 별도 구간 요금이 붙습니다. 2026년 7월 23일 확인한 1M 토큰당 API 가격은 다음과 같습니다.

Gemini 3.6 Flash

Gemini 3.1 Pro

입력(≤200k)

$1.50

$2.00

출력(≤200k)

$7.50

$12.00

입력(>200k)

$1.50

$4.00

출력(>200k)

$7.50

$18.00

컨텍스트 캐시 읽기(≤200k)

$0.15

$0.20

Batch(입력/출력, ≤200k)

$0.75 / $3.75

$1.00 / $6.00

체감 차이는 출력 비용에서 큽니다. 짧은 프롬프트에서도 3.1 Pro의 출력 토큰당 가격은 60% 높고, 프롬프트가 200k 토큰을 넘으면 최대 140%까지 비싸집니다.

할인 옵션을 써도 격차는 유지됩니다. Batch 모드는 두 모델의 요금을 모두 절반으로 낮추지만, Pro는 여전히 60% 더 비쌉니다. 토큰 읽기 비용과 별도로 시간당 청구되는 캐시 저장 비용은 Pro가 1M 토큰당 시간당 $4.50, Flash가 $1.00입니다. Google 공개 정가 기준으로는 Standard, Batch, Priority, 캐싱 어느 방식에서도 Pro가 더 저렴해지는 경우가 없습니다.

동일한 3개 작업으로 직접 비교했다

가격표는 두 모델의 토큰 사용량이 같다는 전제에서 출발합니다. 실제 차이를 보기 위해 2026년 7월 22일, OpenRouter에서 모델 ID google/gemini-3.6-flashgoogle/gemini-3.1-pro-preview를 사용해 temperature 0으로 동일한 프롬프트 3개를 각각 한 번씩 실행했습니다.

1. 코드: docstring과 사용 예시를 포함한 Python merge_intervals 함수 작성 2. 추론: 시간·속도 대수가 필요한 두 열차의 추월 시점 문장제 3. 추출: 정리되지 않은 팀 메시지에서 할 일을 JSON 배열로 추출

작업

Flash 지연 시간

Pro 지연 시간

Flash 비용

Pro 비용

코드

2.4s

4.5s

$0.0085

$0.0102

추론

1.9s

2.4s

$0.0082

$0.0118

추출

1.3s

2.6s

$0.0049

$0.0057

합계

5.65s

9.48s

$0.0215

$0.0277

*합계는 원본 밀리초·토큰 로그를 바탕으로 계산했습니다. 작업별 수치는 반올림한 값이라 열별 값을 더하면 0.01 정도 차이가 날 수 있습니다.*

두 모델 모두 세 작업을 정확히 처리했습니다. 병합 구간도 맞았고, 추월 시점도 맞았으며, JSON도 깔끔했습니다. 차이는 답을 얻는 데 든 비용과 시간입니다.

Flash는 OpenRouter 사용량 메타데이터상 Pro보다 더 많은 토큰을 생성했습니다(2,843 대 2,285). 양쪽 모두 대부분은 내부 추론 토큰이었습니다. 그럼에도 전체 기준으로 22% 저렴했고 완료 시간은 40% 빨랐습니다. Pro는 답변이 더 짧았지만, 높은 출력 단가와 느린 생성 속도를 상쇄하지 못했습니다. 단계마다 이 지연 시간이 반복되는 에이전틱 루프에서는 차이가 더 누적됩니다.

작업별 비용과 지연 시간을 비교한 Gemini 3.6 Flash 및 3.1 Pro 막대 차트. 3.1 Pro를 100으로 놓았을 때 Flash는 비용 78, 지연 시간 60

프롬프트 3개는 벤치마크가 아니라 간단한 현장 점검입니다. 따라서 정확한 퍼센트는 참고용으로 봐야 합니다. 다만 방향성은 더 큰 규모의 측정 결과와 일치하며, 이제 그 결과를 살펴보겠습니다.

코딩·에이전틱 벤치마크는 Flash가 모두 앞섰다

공개된 직접 비교 수치(Artificial Analysis)에서 3.6 Flash는 코딩, ML 엔지니어링, 터미널 사용 전반에 걸쳐 이전 세대인 3.1 Pro를 앞섭니다.

벤치마크

Gemini 3.1 Pro

Gemini 3.6 Flash

DeepSWE v1.1

12%

49%

MLE-Bench

42.6%

63.9%

SWE-Bench Pro

54.2%

58.7%

Terminal-Bench 2.1

73.8%

78.0%

DeepSWE, MLE-Bench, SWE-Bench Pro, Terminal-Bench 2.1에서 Gemini 3.6 Flash가 3.1 Pro를 앞선 코딩·에이전틱 벤치마크 그룹 막대 차트

가장 큰 차이는 DeepSWE에서 나왔습니다. Flash는 49%, Pro는 12%입니다. Flash는 멀티모달 추론에서도 Pro를 소폭 앞섰고(MMMU-Pro 83.2% 대 82.4%), 종합 지표인 Artificial Analysis Intelligence Index도 50 대 46으로 가져갔습니다.

속도도 같은 양상입니다. 2026년 7월 23일 기준 Artificial Analysis 측정에서 Flash는 초당 261토큰, 3.1 Pro는 112토큰으로 Flash가 2.3배 빠릅니다. 표준 워크로드의 첫 토큰 생성 시간도 Flash는 12.8s, Pro는 31.2s입니다. 이 첫 토큰 수치에는 답변이 시작되기 전 각 모델의 사고 시간이 포함되므로, 앞서 진행한 짧은 작업은 훨씬 빨리 끝난 것입니다. 전체 리더보드로 범위를 넓혀 보면 Flash는 세 축에서 동시에 상위권에 자리합니다.

Gemini 3.6 Flash를 강조한 Artificial Analysis 리더보드 차트: Intelligence Index 50, 출력 속도 초당 261토큰, 작업당 가중 비용 $0.50

긴 컨텍스트에서는 한 가지 구분이 필요합니다. 두 모델 모두 1M 토큰 입력을 처리하지만, 극단적으로 긴 입력에서 항목을 *찾아내는* 능력은 Flash가 훨씬 뛰어납니다(MRCR 1M 토큰 검색: 54% 대 27% 미만). 반면 긴 입력을 바탕으로 *추론하는* 능력은 Pro가 약간 더 좋으며, 다음에서 다룹니다.

Gemini 3.1 Pro가 여전히 앞서는 경우

플래그십 모델에도 공정하게 말하자면, 3.1 Pro가 앞서는 벤치마크는 3개이고 모두 고난도 지식·추론 테스트입니다.

벤치마크

Gemini 3.1 Pro

Gemini 3.6 Flash

GPQA Diamond(박사 수준 과학)

94.1%

92.8%

Humanity's Last Exam(도구 미사용)

44.7%

38.3%

AA-LCR(긴 컨텍스트 추론)

72.7%

69.7%

GPQA와 긴 컨텍스트 추론의 격차는 작지만 Humanity's Last Exam에서는 더 큽니다. Google은 3.1 Pro를 "폭넓은 세계 지식과 모달리티 전반의 고급 추론이 필요한 복잡한 작업"을 위한 모델로 설명합니다. 연구 수준의 과학 질문이나 긴 문서를 대상으로 한 다단계 추론처럼 이 최전선에 속하는 작업이라면, 추가 성능 여지는 실제로 존재하며 비용을 낼 가치가 있습니다.

다만 실무적으로는 다음 두 가지를 함께 고려해야 합니다.

  • 더 오래된 지식. Pro의 컷오프는 2025년 1월로, Flash의 2026년 3월보다 14개월 이전입니다. 플래그십 모델이 오히려 최신 세계에 관한 지식은 더 적습니다.

  • Preview 상태. 2026년 2월 출시 후 5개월이 지난 시점에도 3.1 Pro는 Google 가격 페이지에서 Preview로 표기됩니다(모델 ID도 gemini-3.1-pro-preview입니다). 반면 Flash는 현재의 안정적인 기본 모델로 제공됩니다.

그래서 어떤 모델을 써야 할까

  • Gemini 3.6 Flash를 고를 때: 코딩 에이전트, 터미널·컴퓨터 사용 자동화, ML 엔지니어링, 대량 추출·분류, 지연 시간에 민감한 앱, 긴 문서 검색에 적합합니다. 공개 수치상 이 작업들에서는 더 저렴하고, 더 빠르며, 지식도 더 최신이고, 점수도 더 높습니다.

  • Gemini 3.1 Pro를 고를 때: 박사 수준 과학 문제나 긴 입력에 대한 다단계 분석처럼 최전선 추론이 필요한 경우입니다. 비용, 속도, 지식 최신성보다 몇 점의 벤치마크 차이가 더 중요할 때 선택할 만합니다. Preview 단계 모델은 정식 버전 출시 시 모델 ID가 바뀌거나 폐기될 수 있으므로 그 변동성도 감안해야 합니다.

이 비교만으로는 두 가지를 판단할 수 없습니다. 특정 도구 호출 패턴에서의 신뢰성, 그리고 각 도메인의 예외 사례에서 나타나는 출력 품질입니다.

두 모델은 같은 Gemini API로 제공되므로, 가장 저렴하고 확실한 방법은 중요한 프롬프트 10개를 각각에 직접 돌려보는 것입니다. 위의 3개 작업 스크립트는 실행에 약 1분이 걸렸습니다.

두 모델을 사용하는 방법

두 모델은 Gemini API와 Google AI Studio에서 사용할 수 있으며, 모델 ID는 gemini-3.6-flashgemini-3.1-pro-preview입니다. AI Studio의 무료 티어만으로도 도입 전 나란히 테스트할 수 있습니다.

이미 애그리게이터를 사용 중이라면 OpenRouterAIReiter 모두 하나의 키로 Google 정가에 두 모델을 제공합니다. 위 A/B 테스트도 이 방식으로 진행했습니다.

FAQ

Gemini 3.6 Flash가 3.1 Pro보다 더 좋은가요?

대부분의 프로덕션 작업에서는 그렇습니다. 코딩, 에이전틱, ML, 컴퓨터 사용, 멀티모달 벤치마크에서 더 낮은 비용으로 승리하며 속도도 2.3배 빠릅니다. 3.1 Pro가 앞서는 것은 GPQA Diamond, Humanity's Last Exam, 긴 컨텍스트 추론뿐이며 차이는 1.3~6.4점입니다.

Gemini 3.6 Flash가 3.1 Pro보다 저렴한가요?

네. 모든 모드에서 저렴합니다. 표준 API 출력 가격은 1M 토큰당 $7.50 대 $12.00이며, 200k 토큰을 넘는 프롬프트에서는 $7.50 대 $18.00으로 차이가 벌어집니다. Batch 모드에서도 Pro의 60% 프리미엄은 그대로고, 캐시 저장 비용은 Pro가 4.5배 비쌉니다.

Gemini 3.6 Flash와 3.1 Pro 중 어느 쪽이 빠른가요?

Flash가 더 빠릅니다. Artificial Analysis의 2026년 7월 23일 측정 기준으로 Flash는 초당 약 261토큰, 3.1 Pro는 112토큰을 생성합니다. 추론 비중이 높은 워크로드에서 첫 토큰 생성 시간도 12.8s 대 31.2s로 Flash가 더 짧습니다. 직접 실행한 3개 작업 테스트에서도 전체 완료 시간은 40% 빨랐습니다.

Gemini 3.1 Pro는 아직 사용할 가치가 있나요?

추론 성능의 상한이 꼭 필요하고, 2025년 1월 지식 컷오프를 가진 Preview 단계 모델을 감수할 수 있을 때만 그렇습니다. 그보다 낮은 난도의 작업에서는 추가 비용이 Flash보다 더 나은 결과를 산다는 근거가 공개 수치에서 보이지 않습니다.

관련 글