Gemini 3.7 Flash의 핵심은 단순하다. 코딩 에이전트와 여러 단계의 도구 호출 작업에서 성능은 크게 올렸고, 출시 초기 API 가격은 Gemini 3.6 Flash 표준 요금의 절반이다. Google은 2026년 8월 13일 이 모델을 출시했으며, DeepSWE v1.1에서는 3.6 Flash의 49.0%보다 높은 65.3%를 기록했다고 밝혔다. 입력은 100만 토큰당 $0.75, 출력은 $3.75다. 다만 이 가격은 2027년 1월 $1.50/$7.50로 두 배가 될 것으로 알려져 있어, 낮은 요금으로 평가할 수 있는 기간은 약 4개월이다.
Gemini 3.7 Flash API 가격: 2026년 말까지 $0.75/$3.75, 이후 두 배
Google DeepMind 출시 발표와 커뮤니티 보고, 검색 색인 결과에 따르면 Gemini 3.7 Flash의 도입 가격은 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75다. 비교 기준으로 Gemini 3.6 Flash의 표준 가격은 입력 $1.50/M, 출력 $7.50/M이다(AgentPedia). 3.7 Flash의 초기 가격은 3.6 Flash의 Batch/Flex 티어와 같지만, 표준 처리량에 적용된다는 점이 다르다.
세부 조건에서 주의할 부분도 있다. 커뮤니티 보고에 따르면 도입 가격은 2026년 12월 31일까지 적용되며, 이후에는 입력 $1.50/M, 출력 $7.50/M으로 돌아간다. 한 Reddit 사용자는 표시된 가격의 작은 글씨 때문에 "4개월 뒤 가격이 두 배가 된다"고 지적했다(r/GeminiAI).
| 가격 티어 | 입력 ($/M tokens) | 출력 ($/M tokens) | 비고 |
|---|---|---|---|
| 3.7 Flash 도입 가격 (2026년 8~12월) | $0.75 | $3.75 | 커뮤니티 보고 기준, 2027년 1월 두 배 인상 |
| 3.7 Flash 표준 가격 (2027년 1월 이후) | $1.50 | $7.50 | 3.6 Flash 표준 가격과 동일 |
| 3.6 Flash 표준 | $1.50 | $7.50 | 현재 GA 가격 |
| 3.6 Flash Batch/Flex | $0.75 | $3.75 | 낮은 처리량 티어 |
| 3.5 Flash-Lite 표준 | $0.30 | $2.50 | 가장 저렴한 Gemini Flash 티어 |
출력 가격에는 thinking 토큰이 포함된다. 3.6 Flash의 공개 가격을 기준으로 보면 컨텍스트 캐싱에는 표준 티어에서 $0.15/M tokens가 추가된다(AgentPedia). Google Search grounding과 Maps grounding은 별도 과금이다. 컨텍스트 윈도우는 3.6 Flash와 동일한 100만 토큰이며 최대 출력도 64K로 유지된다. 기존 API 호출이 컨텍스트 한도 변경 때문에 깨질 일은 없다.
벤치마크에서 얼마나 올랐나
Google이 공개한 수치는 소프트웨어 엔지니어링, 코딩, 문서 처리에서 개선 폭이 크다. 아래 결과는 2026년 8월 13일 커뮤니티 게시물을 통해 알려진 Google 출시 발표 기준이다.
| 벤치마크 | Gemini 3.7 Flash | Gemini 3.6 Flash | 차이 |
|---|---|---|---|
| DeepSWE v1.1 | 65.3% | 49.0% | +16.3 pts |
| FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2 pts |
| WebDev Arena (Elo) | 1,588 | 1,538 | +50 Elo |
| GDP.pdf 문서 처리 | 34.0% | 22.0% | +12.0 pts |
| AutomationBench | 30.4% | ~17% | +13 pts |
| 롱 컨텍스트 검색 | 97% | — | — |
가장 눈에 띄는 결과는 DeepSWE의 49%에서 65.3%로의 상승이다. 상대 기준으로 +33%에 해당한다. DeepSWE는 여러 파일 수정, 테스트 실행, 코드베이스 탐색처럼 리포지터리 수준의 소프트웨어 엔지니어링 역량을 평가한다. 다만 이 수치가 실제 프로덕션 환경에서도 그대로 재현될지를 두고 Reddit 커뮤니티의 의견은 갈린다. 한 사용자는 "입증되기 전까지는 벤치마크 최적화 결과라고 봐야 한다"고 썼다(r/GeminiAI). 또 다른 의견으로는 비교에서 3.6 Flash가 high thinking을 사용한 반면 일부 경쟁 모델은 medium을 썼으며, 이것이 점수를 부풀릴 수 있다는 지적도 나왔다. 반면 대규모 코드베이스 전체에서 필요한 코드를 찾아야 하는 코딩 워크플로에서는 97%의 롱 컨텍스트 검색 결과가 실질적인 관심을 끌었다.
경쟁 코딩 모델과 비교한 비용 효율
Reddit의 초기 사용자들은 곧바로 3.7 Flash의 가격 대비 성능을 더 저렴한 대안과 비교했다. 평가는 엇갈린다. 3.7 Flash의 점수는 좋지만, 예산형 코딩 모델보다 작업당 비용이 상당히 높다는 의견이다.
벤치마크 스레드의 한 댓글은 Artificial Analysis의 작업당 비용 기준으로 Gemini 3.7 Flash가 거의 비슷한 벤치마크 점수의 GPT-5.6 Luna보다 약 8배 비싸다고 추정했다. 다른 사용자는 Gemini 3.7 Flash가 이전에는 DeepSeek V4 Flash보다 약 13배 비쌌다고 언급했지만, 이후 DeepSeek 가격도 올랐다. 같은 댓글 작성자는 거의 같은 결과에 Luna보다 "300% 이상 더 든다"고 직설적으로 표현했다(r/GeminiAI).
반론도 있다. Luna는 환각이 더 잦고, DeepSeek V4 Flash의 추론은 "실수가 많다"는 평가가 나왔다. 다만 이는 일화적 경험에 근거한 주장이다.
3.7 Flash가 특히 좋은 평가를 받는 지점은 속도다. 사용자들은 대부분의 응답이 3~6초 안에 나온다고 보고했다. 가장 오래 걸린 사례는 창작 글쓰기 테스트였으며 약 1분이 걸렸다. 여러 댓글에서 "엄청나게 빠르다"는 표현이 나왔다.
사양과 제공 범위, API 접근 방법
커뮤니티 토론과 3.6 Flash 문서를 기준으로 보면 Gemini 3.7 Flash는 3.6 Flash와 같은 컨텍스트 한도와 기능 구성을 유지한다.
| 사양 | 값 |
|---|---|
| 컨텍스트 윈도우 | 1,048,576 tokens (1M) |
| 최대 출력 | 65,536 tokens (64K) |
| Thinking 수준 | Low, Medium, High |
| 모달리티 | 텍스트, 이미지, 비디오, 오디오, PDF (입력); 텍스트 (출력) |
| 지식 컷오프 | 2026년 3월 (3.6 Flash; 3.7 Flash 컷오프는 미확인) |
| 캐시 입력 가격 | $0.15/M tokens (표준, 3.6 Flash 기준 추정) |
이용 가능한 곳:
- Gemini API / Google AI Studio — 개발자 접근
- Gemini app — 일반 사용자 대상 배포
- Gemini Spark — Google AI Pro 및 Google AI Ultra 구독자 이용 가능
- Vertex AI — 3.6 Flash의 제공 패턴을 따를 것으로 예상
Google의 3.6 Flash 명명 규칙을 따르면 예상 API 모델 ID는 gemini-3.7-flash다. 배포 전에는 Google AI for Developers documentation에서 정확한 문자열을 확인하고, gemini-flash-latest 같은 별칭에 의존하지 말고 해당 ID를 고정하는 편이 좋다.
3.6 Flash에서 마이그레이션할까
판단은 워크로드 유형과 2027년 1월 가격 인상이 예산에 미치는 영향에 달려 있다.
마이그레이션을 고려할 경우 코딩 에이전트, 여러 단계로 이어지는 도구 사용 체인, 문서 비중이 높은 처리를 운영한다면 적합하다. DeepSWE가 49%에서 65.3%로 오른 폭은 에이전트 루프가 첫 시도에 성공하는 비율을 바꿀 만큼 크다. 도입 가격이 절반이므로 더 낮은 비용으로 평가할 수도 있다. 이미 3.6 Flash를 쓰는 팀이라면 컨텍스트 윈도우에 대한 가정을 다시 작성하지 않고도 feature flag 뒤에서 모델 ID만 교체할 수 있다.
기다리는 편이 나은 경우 대량 분류, 라우팅, 추출처럼 Flash-Lite가 이미 $0.30/$2.50에 충분히 처리하는 작업이라면 서두를 이유가 적다. 3.7 Flash의 도입 가격도 입력 기준 Flash-Lite보다 2.5배 높으며, 1월 가격 인상 뒤에는 격차가 더 커진다.
가격 인상을 전제로 예산을 짜야 한다. 2027년 1월부터는 현재 도입 가격이 아닌 $1.50/$7.50을 기준으로 비용을 계산해야 한다. 단위 경제성이 $0.75/$3.75에서만 성립한다면, 4개월 후 모델 비용은 2배가 된다.
FAQ
Gemini 3.7 Flash의 $0.75/$3.75 가격은 계속 유지되나?
아니다. 커뮤니티 보고에 따르면 이 가격은 도입 프로모션으로, 2026년 12월 31일까지 유효하다. 2027년 1월부터는 입력 $1.50/M, 출력 $7.50/M으로 두 배가 되며, 3.6 Flash의 표준 가격과 같아진다.
Gemini 3.7 Flash는 Vertex AI에서 사용할 수 있나?
출시 시점의 Vertex AI 제공 여부는 독립적으로 확인되지 않았다. Gemini 3.6 Flash는 GA 시점에 Vertex AI를 통해 제공됐으므로, 3.7 Flash도 이를 따를 것으로 예상된다. 현재 모델 목록은 Google Cloud 콘솔에서 확인해야 한다.
3.7 Flash는 Gemini 3.1 Pro와 비교해 어떤가?
Reddit 사용자들은 3.7 Flash가 특정 에이전트 및 코딩 벤치마크, 특히 에이전트 기반 문서 분석에서 Pro 티어 모델과 경쟁하거나 더 나은 성능을 보인다고 전했다. 도입 가격 기준 순수 코딩 에이전트 루프에서는 3.7 Flash가 더 나은 가격 대비 성능을 제공하지만, 복잡한 추론과 계획 수립에서는 Pro가 여전히 더 강한 선택지다.
Thinking 토큰은 별도로 청구되나?
아니다. Thinking 토큰은 표준 출력 요금으로 출력 토큰에 포함돼 청구된다. 도입 기간에는 $3.75/M이다. high thinking을 쓰면 출력 비용이 비례해서 늘어나므로, 추가 추론이 필요 없는 대량 워크로드에서는 medium 또는 low를 사용하는 것이 좋다.