Gemini 3.5 Flash vs Gemini 3.1 Pro: 전체 비교

마지막 업데이트: 2026-07-15 02:22:09

Gemini 3.5 Flash는 Gemini 3.1 Pro보다 초당 출력 토큰 수가 2.6배 많고, 토큰당 비용은 25% 더 저렴하며, Artificial Analysis의 Intelligence Index에서도 Pro를 근소하게 앞섭니다(50 대 46). Gemini 3.1 Pro는 ARC-AGI-2에서 여전히 5점 앞서며(77.1% 대 72.1%), Flash의 장문 맥락 검색 점수는 128k 토큰을 넘기면 84.9%에서 77.3%로 떨어집니다. 어떤 모델을 사용할지는 작업에 따라 다릅니다. Flash는 처리량과 도구 호출 지연 시간에 최적화되어 있고, Pro는 다단계 추론의 깊이에 최적화되어 있으며, 종합 벤치마크는 이 두 우선순위를 하나의 점수로 평균 내어 실제 워크로드에 무엇이 필요한지를 가려버립니다.

벤치마크 점수표: 각 모델이 실제로 앞서는 분야

Gemini 3.5 Flash vs Gemini 3.1 Pro benchmark comparison chart
지표Gemini 3.5 FlashGemini 3.1 Pro승자
지능 지수 (Artificial Analysis)5046Flash
ARC-AGI-2, 추상적 추론 (BenchLM)72.1%77.1%Pro
128k 컨텍스트에서의 MRCR v2 (nxcode)77.3% (짧은 컨텍스트에서는 84.9%에서 하락)동일한 길이로는 공개 보고되지 않음데이터 부족
멀티모달 평균 점수 (BenchLM)83.882.6Flash
출력 속도 (BenchLM)284.2 tok/s109 tok/sFlash (2.6x)
GDPval-AA Elo, 실제 세계 에이전트 작업 (apiyi)16561314Flash

Flash는 처리량과 범용 작업 처리 능력을 측정하는 지표에서 우위를 보입니다. Pro는 ARC-AGI-2 추론 깊이에서 명확하게 문서화된 우위를 가지고 있습니다. 장문 컨텍스트 검색에서는 Flash가 128k 토큰 이후에 문서화된 성능 저하를 보이지만, Pro의 대응 점수는 공개되어 있지 않으므로 이를 Pro의 승리라고 하기보다 결론을 내릴 수 없음으로 보는 것이 맞습니다. 이러한 차이는 어떤 종류의 작업을 수행하느냐에 직접적으로 대응하며, 이는 단일 종합 Intelligence Index 수치보다 더 유용합니다.

BenchLM 자체 비교에서 한 가지 방법론적 주의점이 있습니다: 두 모델 모두 공개된 결과가 있는 약 34개 벤치마크 중, 직접 비교 가능한 범주는 단 3개뿐입니다. Pro는 14개 벤치마크에서 독점적인 결과를 가지고 있고, Flash는 17개에서 그렇습니다. 또한 thinking-budget 설정은 두 모델 간에 항상 일치하지 않습니다. 위 표는 방향성 측면에서 신뢰할 수 있는 것으로 보시면 됩니다. ARC-AGI-2와 MRCR v2의 격차는 신뢰해도 될 만큼 충분히 크지만, 공통 지표에서 1~2포인트 차이는 결정적인 것으로 해석해서는 안 됩니다.

Flash의 우위가 무너지는 지점

ARC-AGI-2 격차(5점)는 BenchLM의 비교에서 두 모델 간에 발견된 단일 카테고리 차이 중 가장 큽니다. ARC-AGI-2는 패턴 매칭 지름길을 막기 위해 특별히 설계되었기 때문에, 그곳에서의 5점 격차는 더 전통적인 벤치마크에서의 비슷한 격차보다 추론 깊이에 대해 더 강한 신호입니다. nxcode의 MRCR v2 결과는 같은 방향의 두 번째 데이터 포인트를 추가합니다. Flash의 자체 검색 정확도는 컨텍스트가 128k 토큰에 가까워질수록 84.9%에서 77.3%로 떨어집니다. 같은 길이에서 Pro의 점수는 공개적으로 보고되지 않았으므로, 이것은 Pro의 문서화된 일대일 패배는 아닙니다. 그러나 이것은 Flash에 대해 문서화된 성능 저하이며, Pro의 벤치마크 표에는 나타나지 않습니다.

벤치마크 증거가 아닌 일화적 메모: 사용자가 어려운 작업에 어떤 모델을 선호하는지 묻는 Reddit r/GeminiAI 스레드에서 댓글 작성자들은 Flash가 Pro를 "긴 컨텍스트, 추상적 [추론]을 제외한 모든 면에서" 앞선다고 설명했습니다. 이는 몇몇 의견에 불과하며 데이터는 아닙니다 — 하지만 우연히도 벤치마크가 보여주는 바로 그 두 가지 예외를 설명하고 있어, 그 자체로 어떤 것을 증명하진 않더라도 약간 유용한 타당성 확인이 됩니다.

가격 책정과 캐싱: 실제 비용 그림

기본 가격은 처음 보이는 것보다 가격 우위를 더 좁힙니다:

  • Gemini 3.5 Flash: $1.50 / 백만 입력 토큰, $9 / 백만 출력 토큰
  • Gemini 3.1 Pro: $2 / 백만 입력 토큰, $12 / 백만 출력 토큰

그것은 종이상으로는 25% 할인이며, Flash가 이전에 구형 Pro 모델들에 대해 유지하던 4~8배의 격차는 아닙니다. 더 큰 레버는 캐싱입니다:

  • Flash 캐시 쓰기는 무료입니다; 캐시된 입력 비용은 $0.15/백만 토큰입니다
  • Pro 캐시 쓰기는 $0.38/백만 토큰입니다; 캐시된 입력 비용은 $0.50/백만 토큰으로 — Flash의 캐시된 입력 요금의 3배 이상입니다

동일한 시스템 프롬프트나 문서 컨텍스트를 여러 턴에 걸쳐 다시 전송하는 모든 워크플로우—채팅 에이전트, 지속적인 코드베이스 컨텍스트를 가진 코딩 어시스턴트, 멀티턴 지원 봇—에서는 이러한 캐싱 격차가 빠르게 누적됩니다. 단일 요청에서는 차이가 거의 보이지 않지만, 천 턴짜리 에이전트 세션에서는 그렇지 않습니다.

격차도 일정하지 않습니다. apiyi의 가격 분석에 따르면, 대략 20만 tokens의 컨텍스트를 넘어서면 두 모델 간의 가격 차이는 25-50%로 줄어듭니다. 두 모델의 토큰당 경제성이 그 규모에서는 수렴하기 때문입니다. 작업 부하가 짧고 반복적인 호출보다 매우 긴 단일 문서에 의해 좌우된다면, Flash를 선택해야 할 가격상의 논리는 약해집니다.

구체적인 예시: 하루에 캐시된 입력 토큰 100만 개를 보내고 출력 토큰 50만 개를 생성하는 지원 봇 워크플로입니다. Flash에서는 캐시 쓰기에 $0, 그리고 $0.15 x 1(캐시된 입력) + $9 x 0.5(출력) = 하루 $4.65입니다. Pro에서는 같은 작업이 $0.38(캐시 쓰기, 1회) + $0.50 x 1(캐시된 입력) + $12 x 0.5(출력) = 첫날 약 $6.88이며, 첫 쓰기 이후에는 하루 $6.50로 안정됩니다. 한 달로 보면 대략 $140와 $195의 차이입니다. 실제로 필요할 때 Pro의 더 깊은 추론을 고려하기 전의 금액입니다.

에이전트 루프: 왜 Flash는 속도에서는 이기지만, 항상 신뢰성에서는 그렇지 않은가

nxcode의 agent-loop 벤치마크는 8단계 agent loop를 실행했으며, Flash는 전체 시퀀스를 약 25초 만에 완료한 반면 Pro는 100초가 걸렸습니다. 이는 4배 차이로, 단계가 추가될수록 그 격차는 더 커집니다. 실제 지식 노동자 agent 작업을 중심으로 구성된 벤치마크인 GDPval-AA에서 Flash의 Elo 점수(1656)는 Pro의 점수(1314)를 342점 앞서며, 이는 전체 벤치마크 표에서 가장 큰 격차입니다.

단서가 있습니다. 그 속도와 점수 우위는 에이전트 루프가 깔끔하게 실행된다는 가정에 기반합니다. 추론 및 장문 컨텍스트 작업에서 드러나는 ARC-AGI-2와 MRCR v2의 동일한 격차는, 루프 중간에 도구 호출이 예상치 못한 결과를 반환하고 에이전트가 재계획을 해야 할 때 Flash가 덜 관대할 것이라고 예상할 만한 충분히 타당한 근거가 됩니다. 이는 위의 추론 깊이 데이터에서 도출한 추론이지, 별도로 벤치마크된 주장은 아닙니다. 에이전트가 감독 하에 실행되어 단계 사이마다 사람이 출력을 확인한다면, Flash의 속도는 거의 공짜 승리에 가깝습니다. 하지만 사람이 개입하지 않은 채 여러 단계에 걸쳐 비감독으로 실행된다면, 두 모델의 실패율 데이터가 공개되기 전까지는 Pro의 추론 마진이 더 안전한 선택입니다.

어떤 것을 사용해야 할까요: 작업 기반 의사결정 매트릭스

작업 유형권장 모델이유
일상적인 코딩(테스트, PR 리뷰, 언어 간 번역)Flash속도와 비용이 유리하며, 추론 깊이는 병목이 아님
깊은 리팩터링, 새로운 알고리즘 설계ProARC-AGI-2 격차가 다단계 논리 추론에서 직접 드러남
장문 문서 검색(계약서, 128k 토큰을 넘는 연구 코퍼스)ProFlash는 이 길이에서 MRCR v2 회귀가 문서화되어 있으며, Pro의 경우는 공개되지 않았지만 더 안전한 기본값은 알려진 약점이 없는 모델임
대량 배치 생성Flash무료 캐시 쓰기와 2.6배 처리량이 대규모에서 가장 중요함
사람이 출력을 확인하는 감독형 에이전트 워크플로Flash비감독 신뢰성 위험 없이 속도 이점을 얻을 수 있음
비감독, 고위험 에이전트 체인Pro사람이 중간 루프 오류를 잡아주지 않는 상황에서는 추론 깊이 여유가 더 안전한 선택임
같은 컨텍스트를 재사용하는 빈번한 멀티턴 호출Flash캐시된 입력 가격은 대략 Pro의 3분의 1 수준임

위의 매트릭스 대부분은 하나의 간단한 기본 규칙으로 설명됩니다: 다음 세 가지 조건 중 하나가 참이 아닌 한 요청을 Flash로 보내세요 — 컨텍스트가 128k 토큰을 초과하고 검색 정확성이 중요한 경우, 작업이 추상적/다단계 추론(새로운 알고리즘, 법률 또는 연구 요약)인 경우, 또는 에이전트가 몇 단계 이상 비감독 상태로 실행되는 경우입니다. 이 세 가지 중 하나라도 해당하면 호출은 Pro 쪽으로 기울고, 하나도 해당하지 않으면 Flash의 속도와 캐시 가격이 더 저렴한 기본 선택이 됩니다.

자주 묻는 질문

Gemini 3.5 Flash가 3.1 Pro보다 더 나은가요?

속도, 비용, 그리고 범용 벤치마크에서는 그렇습니다. 추상적 추론(ARC-AGI-2)에서는 Gemini 3.1 Pro가 여전히 5점 앞섭니다. 128k 토큰을 넘는 장문 컨텍스트 검색에서는 Flash에 문서화된 회귀가 있고 Pro의 이에 상응하는 점수는 공개되지 않았으므로, 그 비교는 확인된 Pro의 승리라기보다 결론이 나지 않은 것으로 보아야 합니다. 어떤 쪽이 "더 낫다"인지는 당신의 작업이 이들 범주 중 어디에 속하는지에 달려 있습니다.

Gemini 3.5 Flash는 3.1 Pro보다 얼마나 더 저렴한가요?

기본 입력/출력 가격이 약 25% 더 저렴합니다($1.50/$9 vs $2/$12 per million tokens). 더 큰 절감 효과는 캐싱에서 나타납니다: Flash의 캐시 쓰기는 무료이고 캐시된 입력은 Pro 요금의 약 3분의 1 수준이며, 이는 다중 턴 또는 대량 작업에서 가장 큰 차이를 만듭니다.

Gemini 3.5 Flash는 코딩에 좋은가요?

네, 일상적인 작업 — 테스트 생성, PR 검토, 언어 간 코드 변환 — 에는 그렇습니다. 심층 리팩터링이나 새로운 알고리즘 설계의 경우에는, 추상적 추론 벤치마크에서 Pro의 우위가 결과물 품질에 드러나는 경향이 있습니다.

Gemini 3.5 Flash는 긴 컨텍스트를 잘 처리하나요?

더 짧은 컨텍스트 길이에서는 그렇습니다 — MRCR v2 검색 정확도는 84.9%를 유지합니다. 128k 토큰을 넘어서면 77.3%로 떨어지는데, 이는 여러 문서에 걸친 계약 검토 같은 작업에서는 의미 있는 격차입니다. 같은 길이에서의 Gemini 3.1 Pro 점수는 아직 공개되지 않았으므로, 이를 확인된 Pro의 우위라기보다 알려진 Flash의 한계로 보아야 합니다.

핵심 요약

Gemini 3.5 Flash는 대부분의 일상적이고 대량 처리 작업에 더 나은 기본 선택입니다 — 더 빠르고, 캐시 비용이 더 저렴하며, 일반 벤치마크에서도 성능 차이가 거의 없어 그 트레이드오프가 문제 되는 경우는 드뭅니다. Gemini 3.1 Pro는 추상적 추론과 비지도 에이전트 체인에서 더 높은 비용을 정당화합니다. 128k 토큰을 넘는 긴 문서에서는 Flash의 자체 수치가 약점을 보여 주지만, Pro의 수치는 이를 확인해 주지도, 배제해 주지도 않습니다. 따라서 어느 쪽으로 결정하든 본격적으로 채택하기 전에 직접 테스트해 볼 가치가 있는 항목으로 보세요.

이 비교는 직접적인 API 테스트가 아니라 공개 벤치마크 데이터(Artificial Analysis, BenchLM, nxcode, 및 apiyi)를 바탕으로 작성되었습니다. Gemini 3.1 Pro는 Flash의 속도 중심 포지셔닝과는 다른, 추론 중심의 포지셔닝으로 출시되었습니다. 이 글을 작성하는 시점에서 Gemini 3.5 Pro는 아직 출시되지 않았으며 — 보도에 따르면 2026년 7월 출시가 예상됩니다 — 따라서 이를 현재 시점의 스냅샷으로 보아야 하며, Pro의 다음 버전이 나오면 두 모델과 이 비교 모두를 다시 검토할 필요가 있습니다.

관련 읽기