Gemini 3.6 Flash를 쓴 지 3주밖에 되지 않았다면, Gemini 3.7 Flash로 바꿔야 할 이유가 생겼습니다. DeepSWE v1.1 점수가 48.6%에서 65.3%로 크게 뛰었지만, 2026년 12월까지 적용되는 출시 프로모션 가격은 입력·출력 100만 토큰당 각각 $0.75/$3.75로 두 모델이 같습니다. 토큰 단가 인상 없이 업그레이드할 수 있는 셈이지만, 체감 이득은 워크로드에 따라 다릅니다.
18개 벤치마크로 본 Gemini 3.7 Flash와 3.6 Flash의 차이
Google DeepMind의 공식 모델 페이지를 보면 Gemini 3.7 Flash는 전반적으로 3.6 Flash를 앞섭니다. 특히 코딩 에이전트와 엔터프라이즈 자동화 관련 지표에서 격차가 큽니다. 아래는 Google이 두 모델에 대해 공개한 18개 전체 지표입니다. 비교 참고용으로 Claude Sonnet 5와 GPT-5.6 Terra도 함께 언급했습니다.
| 벤치마크 | Gemini 3.7 Flash | Gemini 3.6 Flash | 차이 |
|---|---|---|---|
| Artificial Analysis Intelligence Index (종합) | 56 | 52 | +4 |
| FrontierCode 1.1 (프로덕션 코드 품질) | 43.6% | 34.4% | +9.2 |
| DeepSWE v1.1 (장기 소프트웨어 엔지니어링) | 65.3% | 48.6% | +16.7 |
| Code Arena (웹 개발 Elo) | 1588 | 1538 | +50 |
| Terminal-Bench 2.1 (에이전트형 터미널 코딩) | 85.8% | 78.0% | +7.8 |
| Terminal-Bench 3.0 (범용 에이전트 역량) | 14.9% | 5.4% | +9.5 |
| AutomationBench (엔터프라이즈 워크플로 자동화) | 30.4% | 17.0% | +13.4 |
| GDPVal-AA v2 (지식 노동 Elo) | 1525 | 1422 | +103 |
| Harvey LAB-AA (복잡한 법률 워크플로) | 90.7% | 85.1% | +5.6 |
| GDP.pdf (전문 PDF 이해) | 34.0% | 22.0% | +12.0 |
| CharXiv, 도구 미사용 (차트 추론) | 84.5% | 85.2% | −0.7 |
| CharXiv, 도구 사용 | 88.7% | 89.4% | −0.7 |
| LVBench (긴 영상 이해) | 85.4% | 84.2% | +1.2 |
| GDM-MRCR v2, 128k (긴 컨텍스트 검색) | 97.0% | 91.8% | +5.2 |
| OSWorld-2.0 (에이전트형 컴퓨터 사용) | 47.9% | 33.8% | +14.1 |
| Agent's Last Exam (데스크톱 에이전트 작업) | 26.3% | 24.2% | +2.1 |
| HLE-Verified (다학제 전문가 추론) | 53.6% | 51.2% | +2.4 |
| LABBench2 (생물학 연구 작업) | 82.1% | 76.1% | +6.0 |
모든 수치는 3.7 Flash 모델 페이지에서 Google DeepMind가 공개한 벤더 자체 보고 값입니다. 대부분의 벤치마크는 아직 독립 재현 결과가 나오지 않았으므로, 수치를 각자의 워크로드 성능 보장치가 아닌 방향성 지표로 보는 편이 좋습니다.
코딩 에이전트에서는 3.7 Flash의 격차가 크다
두 모델의 차이가 가장 선명하게 드러나는 곳은 코딩 및 에이전트형 작업입니다. 실제 리포지터리 작업에서 장기 소프트웨어 엔지니어링 능력을 평가하는 DeepSWE v1.1은 48.6%에서 65.3%로 16.7포인트 올랐습니다. 동일 지표에서 Claude Sonnet 5의 53.8%를 넘었고, GPT-5.6 Terra의 69.6%와 비교하면 그 사이에 위치합니다. 모든 비교 수치는 DeepMind 벤치마크 표를 기준으로 합니다.
다른 에이전트 중심 벤치마크도 상승 폭이 작지 않습니다.
- Terminal-Bench 3.0 (멀티 도구 에이전트 역량): 5.4% → 14.9%, 약 3배 상승
- AutomationBench (엔터프라이즈 워크플로 자동화): 17.0% → 30.4%
- FrontierCode 1.1 (프로덕션 코드 품질): +9.2포인트
- OSWorld-2.0 (에이전트형 컴퓨터 사용): 33.8% → 47.9%
Reddit의 초기 사용자 반응은 벤치마크 성과와 일상적인 개발 경험 사이의 간극도 보여줍니다.
구현에는 효과적이지만, 계획 수립이나 코드 리뷰, 어려운 문제의 분해에서는 약할 수 있다.
— r/google_antigravity 사용자 토론
Google이 DeepMind 모델 페이지에 공개한 고객 사례도 이 흐름과 맞닿아 있습니다. Browser Use는 “Gemini 3.7 Flash 에이전트가 3.6 Flash보다 35% 저렴했고, 관측된 프롬프트 캐시 적중률은 8% 높았으며 도구 오류도 더 적었다”고 밝혔습니다. Harvey는 Legal Agent Bench에서 전체 통과율이 2.6포인트 올랐다고 측정했습니다. Nunu.ai는 GPT-5.6-Terra와 동등한 성능을 “비용은 약 절반” 수준에서 확인했습니다. 세 사례 모두 토큰 할인 때문이 아니라 에이전트 루프 단계가 줄어든 데서 비용 절감이 나왔다고 설명합니다.
문서·지식 작업과 멀티모달도 개선됐지만 폭은 작다
코딩 밖의 영역에서는 격차가 다소 줄어듭니다. Artificial Analysis Intelligence Index는 52에서 56으로 올랐고, DeepMind 비교 표 기준으로 Claude Sonnet 5의 55와 GPT-5.6 Terra의 57 사이에 자리합니다. 비코딩 영역에서 가장 눈에 띄는 개선은 문서 이해입니다. GDP.pdf는 22.0%에서 34.0%로 12포인트 상승해, 복잡한 문서·재무 보고서·법률 서류를 처리하는 파이프라인에 의미가 있습니다. 128K 토큰에서 긴 컨텍스트 검색 능력을 측정하는 GDM-MRCR v2도 91.8%에서 97.0%로 개선됐습니다.
복잡한 법률 워크플로를 평가하는 Harvey LAB-AA는 85.1%에서 90.7%로 올랐습니다. 긴 영상 이해(LVBench)와 생물학 연구 작업(LABBench2) 역시 약 6포인트 개선됐습니다. 특화 워크로드에는 중요할 수 있지만, 이 지표만으로 업그레이드를 결정할 정도는 아닐 가능성이 큽니다.
가격은 같다: 두 모델 모두 출시 프로모션 적용
| 모델 | 입력($/100만 토큰) | 출력($/100만 토큰) | 표준 요금(2027년 1월 1일~) |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Gemini 3.6 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Claude Sonnet 5 | $2.00 | $10.00 | — |
| GPT-5.6 Terra | $2.00 | $12.00 | — |
\*출시 프로모션 가격은 2026년 12월 31일에 종료됩니다. 모든 가격은 DeepMind 모델 페이지 기준입니다.
Google은 2026년 8월 13일 3.7 Flash를 출시하면서 두 Flash 모델 모두에 $0.75/$3.75 프로모션 요금을 적용했습니다. 그 전까지 3.6 Flash의 표준 요금은 $1.50/$7.50이었습니다. Google이 프로모션을 연장하지 않는 한, 2027년 1월 1일부터 두 모델 모두 $1.50/$7.50로 돌아갑니다. 토큰당 가격이 같은 만큼 실질 비용 차이는 작업 효율에서 나옵니다. Browser Use가 보고한 35% 에이전트 비용 절감도 동일 워크로드에서 측정한 결과로, 요금 차이가 아니라 도구 호출 감소와 높은 캐시 적중률에 따른 것이었습니다.
캐싱, Batch API, grounding 비용까지 포함한 3.7 Flash API 비용 분석은 Gemini 3.7 Flash API pricing guide에서 확인할 수 있습니다.
Gemini 3.6 Flash가 앞서는 유일한 영역
차트 추론에서는 3.6 Flash가 근소하게 우세합니다. 도구 없이 진행한 CharXiv에서 3.6은 85.2%, 3.7은 84.5%를 기록했습니다. 도구를 켠 경우에도 차이는 같습니다. 89.4% 대 88.7%입니다. 1포인트에도 못 미치는 격차라 개별 차트 작업에서는 두 모델이 비슷한 성능을 낼 수 있습니다. 기본 모델을 결정하기 전에 실제 차트 워크로드로 검증하는 것이 좋습니다.
Google의 비교 표에서 3.6이 3.7을 앞서는 벤치마크는 이 두 항목뿐입니다. 차트 추론을 제외하고 가장 경합이 적은 영역은 Intelligence Index의 52 대 56이지만, 이 경우에도 3.7이 앞섭니다.
마이그레이션: 모델 문자열 외에 확인할 것
기계적인 마이그레이션 자체는 모델 ID 변경으로 끝납니다. gemini-3.6-flash를 gemini-3.7-flash로 바꾸면 됩니다. DeepMind 모델 페이지에 따르면 두 모델은 컨텍스트 윈도우(입력 1M, 출력 64K), 입력 모달리티(텍스트, 이미지, 비디오, 오디오, PDF), 도구 사용 기능(function calling, search grounding, computer use)이 같습니다. 모델 페이지상 3.7 Flash의 상태는 일반 공급입니다.
다만 주의할 점이 있습니다. 3.5에서 3.6으로 넘어갈 때는 개발자가 미처 예상하지 못한 API 동작 변경이 있었습니다. 독립 테스트 기록에 따르면 temperature, top_p, top_k는 아무 알림 없이 무시됐고, thinking_budget는 문자열 열거형인 thinking_level로 바뀌었으며 응답 프리필 기능도 제거됐습니다. Google은 3.7 Flash에 유사한 변경이 있는지 아직 공개하지 않았습니다. 관련 문서가 나오기 전까지는 프로덕션 트래픽을 옮기기 전에 두 모델 문자열을 모두 대상으로 평가 스위트를 실행하세요. 3.6은 폴백으로 남겨두는 편이 안전합니다.
Gemini 3.7 Flash로 지금 바꿔야 할까?
결정 기준은 워크로드 유형에 따라 나뉩니다.
- 코딩 에이전트를 운영한다면 지금 전환하세요. DeepSWE v1.1은 16.7포인트 올랐고 Terminal-Bench 3.0은 약 3배 상승했습니다. 토큰당 가격도 같으므로, 코딩 에이전트 워크로드에서 3.6을 유지할 금전적 이유는 없습니다.
- 복잡한 문서를 처리한다면 지금 전환하세요. GDP.pdf 이해도는 12포인트(22.0% → 34.0%) 뛰었습니다. 128K 토큰의 긴 컨텍스트 검색은 97.0%로 거의 완벽한 수준입니다.
- 차트 추론이 핵심 작업이라면 먼저 테스트하세요. CharXiv는 1포인트 미만으로 3.6에 유리합니다. 전환을 확정하기 전 나란히 평가해 보세요.
- 검증을 마쳤고 안정적인 파이프라인이라면 3.6을 유지해도 됩니다. DeepMind 모델 페이지에는 3.6 Flash의 종료일이 명시되지 않았습니다. 워크플로가 회귀 테스트를 통과했고 코딩 성능 향상이 당장 필요하지 않다면, 동작 변화에 대응하는 비용이 이득보다 클 수 있습니다. 워크플로 단위로 하나씩 이전하세요.
- 빠른 출시 주기를 감안하세요. Google은 3.6 출시 3주 뒤에 3.7을 내놓았습니다. 3.7의 이득이 가장 큰 워크플로부터 이전하되 3.6은 폴백으로 고정해 두고, Flash의 각 릴리스는 플랫폼 전환이 아닌 검토할 점진적 업그레이드로 다루는 편이 좋습니다.
Gemini 3.7 Flash 및 Gemini 3.6 Flash 채팅 인터페이스에서 두 모델을 나란히 비교해 볼 수 있습니다.
Gemini 3.7 Flash는 새 아키텍처인가, 포스트 트레이닝 업데이트인가?
Google은 3.7 Flash를 새 아키텍처 또는 포스트 트레이닝 패치 가운데 어느 쪽으로도 공식 규정하지 않았습니다. Artificial Analysis Intelligence Index는 52에서 56으로 올랐지만, 독립 테스트에서 확인된 3.5 Flash와 3.6 Flash의 같은 지표 점수는 모두 50이었습니다. 3.7의 향상이 아키텍처 변경에서 비롯됐는지, 더 나은 학습 데이터에서 나온 것인지는 문서화돼 있지 않습니다.
Gemini 3.7 Flash는 3.6 Flash보다 비싼가?
아닙니다. 두 모델은 2026년 12월 31일까지 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75로 동일합니다. 이후 두 모델 모두 $1.50/$7.50로 전환됩니다. 업그레이드에 따른 절감 효과는 토큰당 요금 인하가 아니라 작업당 필요한 도구 호출과 추론 단계가 줄어드는 데서 나옵니다.
Gemini 3.7 Flash는 어디에서 사용할 수 있나?
DeepMind 모델 페이지에 따르면 3.7 Flash는 Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise, Gemini App에서 이용할 수 있으며 일반 공급 상태입니다.
지금 이전하지 말고 다음 Flash 버전을 기다려야 할까?
3.7 Flash는 벤치마크와 고객 도입 사례가 공개된 GA 모델입니다. 코딩과 에이전트 성능 향상이 현재 워크로드에 도움이 된다면 해당 워크플로는 지금 이전하고, 다음 버전이 나오면 다시 평가하세요. 기다리는 동안에는 이미 활용할 수 있는 개선 효과를 놓치는 기회비용이 발생합니다.