보통은 Pro가 이깁니다. 이번에는 아닙니다. Gemini 3.6 Flash 는 Gemini 3.1 Pro보다 가격이 낮고, 출력 속도는 2배를 넘으며, 코딩과 에이전틱 벤치마크 대부분에서 더 좋은 점수를 냈습니다. 기존 3.1 Pro가 지키는 영역은 하나뿐입니다. 가장 난도가 높은 순수 추론 테스트에서의 근소한 우위입니다. 두 모델에 동일한 작업을 실행했고, 아래 가격과 사양은 2026년 7월 23일 Google 문서와 Artificial Analysis를 다시 대조해 확인했습니다.
30초 결론: 기본 선택은 Flash
Gemini 3.6 Flash | Gemini 3.1 Pro | 우세 | |
|---|---|---|---|
API 가격(입력/출력, 1M당, ≤200k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
긴 프롬프트(>200k 토큰) | 동일한 고정 요금 | $4.00 / $18.00 | Flash |
출력 속도 | 261 tokens/s | 112 tokens/s | Flash |
코딩·에이전틱 벤치마크 | 4개 직접 비교 모두 승리 | — | Flash |
최고난도 추론(GPQA, HLE) | — | 1.3~6.4점 앞섬 | 3.1 Pro |
지식 컷오프 | 2026년 3월 | 2025년 1월 | Flash |
출시 상태 | 정식 출시 | 2026년 2월부터 Preview | Flash |
여기까지만 읽는다면 결론은 간단합니다. 기본 모델로는 Gemini 3.6 Flash를 쓰고, 최상위 추론 성능이 반드시 필요한 작업에서만 3.1 Pro를 꺼내면 됩니다. API 키 없이도 브라우저 채팅에서 직접 프롬프트를 넣어 Gemini 3.6 Flash 와 Gemini 3.1 Pro 를 비교할 수도 있습니다. 아래에서는 그 근거와 재현 가능한 3개 작업 테스트를 다룹니다.
가격 차이: 긴 컨텍스트일수록 더 벌어진다
Gemini 3.6 Flash는 프롬프트 길이와 관계없이 동일한 요금을 적용합니다. 반면 Gemini 3.1 Pro는 기본 요금부터 높고, 긴 프롬프트에는 별도 구간 요금이 붙습니다. 2026년 7월 23일 확인한 1M 토큰당 API 가격은 다음과 같습니다.
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
입력(≤200k) | $1.50 | $2.00 |
출력(≤200k) | $7.50 | $12.00 |
입력(>200k) | $1.50 | $4.00 |
출력(>200k) | $7.50 | $18.00 |
컨텍스트 캐시 읽기(≤200k) | $0.15 | $0.20 |
Batch(입력/출력, ≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
체감 차이는 출력 비용에서 큽니다. 짧은 프롬프트에서도 3.1 Pro의 출력 토큰당 가격은 60% 높고, 프롬프트가 200k 토큰을 넘으면 최대 140%까지 비싸집니다.
할인 옵션을 써도 격차는 유지됩니다. Batch 모드는 두 모델의 요금을 모두 절반으로 낮추지만, Pro는 여전히 60% 더 비쌉니다. 토큰 읽기 비용과 별도로 시간당 청구되는 캐시 저장 비용은 Pro가 1M 토큰당 시간당 $4.50, Flash가 $1.00입니다. Google 공개 정가 기준으로는 Standard, Batch, Priority, 캐싱 어느 방식에서도 Pro가 더 저렴해지는 경우가 없습니다.
동일한 3개 작업으로 직접 비교했다
가격표는 두 모델의 토큰 사용량이 같다는 전제에서 출발합니다. 실제 차이를 보기 위해 2026년 7월 22일, OpenRouter에서 모델 ID google/gemini-3.6-flash와 google/gemini-3.1-pro-preview를 사용해 temperature 0으로 동일한 프롬프트 3개를 각각 한 번씩 실행했습니다.
1. 코드: docstring과 사용 예시를 포함한 Python merge_intervals 함수 작성 2. 추론: 시간·속도 대수가 필요한 두 열차의 추월 시점 문장제 3. 추출: 정리되지 않은 팀 메시지에서 할 일을 JSON 배열로 추출
작업 | Flash 지연 시간 | Pro 지연 시간 | Flash 비용 | Pro 비용 |
|---|---|---|---|---|
코드 | 2.4s | 4.5s | $0.0085 | $0.0102 |
추론 | 1.9s | 2.4s | $0.0082 | $0.0118 |
추출 | 1.3s | 2.6s | $0.0049 | $0.0057 |
합계 | 5.65s | 9.48s | $0.0215 | $0.0277 |
*합계는 원본 밀리초·토큰 로그를 바탕으로 계산했습니다. 작업별 수치는 반올림한 값이라 열별 값을 더하면 0.01 정도 차이가 날 수 있습니다.*
두 모델 모두 세 작업을 정확히 처리했습니다. 병합 구간도 맞았고, 추월 시점도 맞았으며, JSON도 깔끔했습니다. 차이는 답을 얻는 데 든 비용과 시간입니다.
Flash는 OpenRouter 사용량 메타데이터상 Pro보다 더 많은 토큰을 생성했습니다(2,843 대 2,285). 양쪽 모두 대부분은 내부 추론 토큰이었습니다. 그럼에도 전체 기준으로 22% 저렴했고 완료 시간은 40% 빨랐습니다. Pro는 답변이 더 짧았지만, 높은 출력 단가와 느린 생성 속도를 상쇄하지 못했습니다. 단계마다 이 지연 시간이 반복되는 에이전틱 루프에서는 차이가 더 누적됩니다.

프롬프트 3개는 벤치마크가 아니라 간단한 현장 점검입니다. 따라서 정확한 퍼센트는 참고용으로 봐야 합니다. 다만 방향성은 더 큰 규모의 측정 결과와 일치하며, 이제 그 결과를 살펴보겠습니다.
코딩·에이전틱 벤치마크는 Flash가 모두 앞섰다
공개된 직접 비교 수치(Artificial Analysis)에서 3.6 Flash는 코딩, ML 엔지니어링, 터미널 사용 전반에 걸쳐 이전 세대인 3.1 Pro를 앞섭니다.
벤치마크 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

가장 큰 차이는 DeepSWE에서 나왔습니다. Flash는 49%, Pro는 12%입니다. Flash는 멀티모달 추론에서도 Pro를 소폭 앞섰고(MMMU-Pro 83.2% 대 82.4%), 종합 지표인 Artificial Analysis Intelligence Index도 50 대 46으로 가져갔습니다.
속도도 같은 양상입니다. 2026년 7월 23일 기준 Artificial Analysis 측정에서 Flash는 초당 261토큰, 3.1 Pro는 112토큰으로 Flash가 2.3배 빠릅니다. 표준 워크로드의 첫 토큰 생성 시간도 Flash는 12.8s, Pro는 31.2s입니다. 이 첫 토큰 수치에는 답변이 시작되기 전 각 모델의 사고 시간이 포함되므로, 앞서 진행한 짧은 작업은 훨씬 빨리 끝난 것입니다. 전체 리더보드로 범위를 넓혀 보면 Flash는 세 축에서 동시에 상위권에 자리합니다.

긴 컨텍스트에서는 한 가지 구분이 필요합니다. 두 모델 모두 1M 토큰 입력을 처리하지만, 극단적으로 긴 입력에서 항목을 *찾아내는* 능력은 Flash가 훨씬 뛰어납니다(MRCR 1M 토큰 검색: 54% 대 27% 미만). 반면 긴 입력을 바탕으로 *추론하는* 능력은 Pro가 약간 더 좋으며, 다음에서 다룹니다.
Gemini 3.1 Pro가 여전히 앞서는 경우
플래그십 모델에도 공정하게 말하자면, 3.1 Pro가 앞서는 벤치마크는 3개이고 모두 고난도 지식·추론 테스트입니다.
벤치마크 | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond(박사 수준 과학) | 94.1% | 92.8% |
Humanity's Last Exam(도구 미사용) | 44.7% | 38.3% |
AA-LCR(긴 컨텍스트 추론) | 72.7% | 69.7% |
GPQA와 긴 컨텍스트 추론의 격차는 작지만 Humanity's Last Exam에서는 더 큽니다. Google은 3.1 Pro를 "폭넓은 세계 지식과 모달리티 전반의 고급 추론이 필요한 복잡한 작업"을 위한 모델로 설명합니다. 연구 수준의 과학 질문이나 긴 문서를 대상으로 한 다단계 추론처럼 이 최전선에 속하는 작업이라면, 추가 성능 여지는 실제로 존재하며 비용을 낼 가치가 있습니다.
다만 실무적으로는 다음 두 가지를 함께 고려해야 합니다.
더 오래된 지식. Pro의 컷오프는 2025년 1월로, Flash의 2026년 3월보다 14개월 이전입니다. 플래그십 모델이 오히려 최신 세계에 관한 지식은 더 적습니다.
Preview 상태. 2026년 2월 출시 후 5개월이 지난 시점에도 3.1 Pro는 Google 가격 페이지에서 Preview로 표기됩니다(모델 ID도
gemini-3.1-pro-preview입니다). 반면 Flash는 현재의 안정적인 기본 모델로 제공됩니다.
그래서 어떤 모델을 써야 할까
Gemini 3.6 Flash를 고를 때: 코딩 에이전트, 터미널·컴퓨터 사용 자동화, ML 엔지니어링, 대량 추출·분류, 지연 시간에 민감한 앱, 긴 문서 검색에 적합합니다. 공개 수치상 이 작업들에서는 더 저렴하고, 더 빠르며, 지식도 더 최신이고, 점수도 더 높습니다.
Gemini 3.1 Pro를 고를 때: 박사 수준 과학 문제나 긴 입력에 대한 다단계 분석처럼 최전선 추론이 필요한 경우입니다. 비용, 속도, 지식 최신성보다 몇 점의 벤치마크 차이가 더 중요할 때 선택할 만합니다. Preview 단계 모델은 정식 버전 출시 시 모델 ID가 바뀌거나 폐기될 수 있으므로 그 변동성도 감안해야 합니다.
이 비교만으로는 두 가지를 판단할 수 없습니다. 특정 도구 호출 패턴에서의 신뢰성, 그리고 각 도메인의 예외 사례에서 나타나는 출력 품질입니다.
두 모델은 같은 Gemini API로 제공되므로, 가장 저렴하고 확실한 방법은 중요한 프롬프트 10개를 각각에 직접 돌려보는 것입니다. 위의 3개 작업 스크립트는 실행에 약 1분이 걸렸습니다.
두 모델을 사용하는 방법
두 모델은 Gemini API와 Google AI Studio에서 사용할 수 있으며, 모델 ID는 gemini-3.6-flash 및 gemini-3.1-pro-preview입니다. AI Studio의 무료 티어만으로도 도입 전 나란히 테스트할 수 있습니다.
이미 애그리게이터를 사용 중이라면 OpenRouter와 AIReiter 모두 하나의 키로 Google 정가에 두 모델을 제공합니다. 위 A/B 테스트도 이 방식으로 진행했습니다.
FAQ
Gemini 3.6 Flash가 3.1 Pro보다 더 좋은가요?
대부분의 프로덕션 작업에서는 그렇습니다. 코딩, 에이전틱, ML, 컴퓨터 사용, 멀티모달 벤치마크에서 더 낮은 비용으로 승리하며 속도도 2.3배 빠릅니다. 3.1 Pro가 앞서는 것은 GPQA Diamond, Humanity's Last Exam, 긴 컨텍스트 추론뿐이며 차이는 1.3~6.4점입니다.
Gemini 3.6 Flash가 3.1 Pro보다 저렴한가요?
네. 모든 모드에서 저렴합니다. 표준 API 출력 가격은 1M 토큰당 $7.50 대 $12.00이며, 200k 토큰을 넘는 프롬프트에서는 $7.50 대 $18.00으로 차이가 벌어집니다. Batch 모드에서도 Pro의 60% 프리미엄은 그대로고, 캐시 저장 비용은 Pro가 4.5배 비쌉니다.
Gemini 3.6 Flash와 3.1 Pro 중 어느 쪽이 빠른가요?
Flash가 더 빠릅니다. Artificial Analysis의 2026년 7월 23일 측정 기준으로 Flash는 초당 약 261토큰, 3.1 Pro는 112토큰을 생성합니다. 추론 비중이 높은 워크로드에서 첫 토큰 생성 시간도 12.8s 대 31.2s로 Flash가 더 짧습니다. 직접 실행한 3개 작업 테스트에서도 전체 완료 시간은 40% 빨랐습니다.
Gemini 3.1 Pro는 아직 사용할 가치가 있나요?
추론 성능의 상한이 꼭 필요하고, 2025년 1월 지식 컷오프를 가진 Preview 단계 모델을 감수할 수 있을 때만 그렇습니다. 그보다 낮은 난도의 작업에서는 추가 비용이 Flash보다 더 나은 결과를 산다는 근거가 공개 수치에서 보이지 않습니다.
