에이전트를 대규모로 운영한다면 Gemini 3.6 Flash에서 볼 숫자는 두 가지다. Google은 2026년 7월 21일 이 모델을 출시하면서 출력 토큰 가격을 100만 토큰당 $9.00에서 $7.50로 내렸고, 같은 작업에 필요한 출력 토큰도 약 17% 줄었다고 밝혔다. 출력 비중이 높은 워크로드라면 작업당 비용이 최선의 경우 약 3분의 1까지 낮아질 수 있다. 코딩과 에이전트형 벤치마크에서는 이전 3.5 Flash는 물론 더 큰 3.1 Pro까지 대부분의 테스트에서 앞선다. 기존 3.5 Flash 사용자에게는 사실상 비용 부담 없는 업그레이드에 가깝지만, 이 등급에서 명목 가격이 가장 싼 모델은 아니다.
7월 21일 Google이 공개한 모델 3종
이번에는 용도가 서로 다른 세 모델이 함께 나왔다.
- Gemini 3.6 Flash (
gemini-3.6-flash): 빠른 속도와 높은 지능을 함께 노린 주력 모델이다. 컨텍스트 윈도는 100만 토큰, 최대 출력은 64k이며, 지식 컷오프는 2025년 1월에서 2026년 3월로 갱신됐다. - Gemini 3.5 Flash-Lite: 단순하고 대량 처리해야 하는 작업을 위한 고처리량 모델이다. 출력 속도는 초당 약 350토큰이며 가격도 훨씬 낮다.
- Gemini 3.5 Flash Cyber: 취약점을 찾아 검증하고 패치하도록 보안 특화 조정된 모델이다. CodeMender 내부에서 동작하며, 일반 공개가 아닌 정부 기관 및 신뢰할 수 있는 파트너 대상의 제한적 접근 파일럿이다.
공식 모델 페이지에서 3.6 Flash는 “속도를 위해 구축한 가장 지능적인 모델”로 소개된다. 가격은 Google's Gemini API pricing page에서 확인할 수 있다.
이번 Flash 갱신은 독립적으로 나온 일이 아니다. 플래그십 Gemini 3.5 Pro의 출시 일정이 밀렸고, DeepMind는 이미 Gemini 4 사전 학습을 시작했다고 밝혔다. 대형 모델 출시 사이의 공백을 이번 Flash 업데이트가 메우는 구도다.
Gemini 3.6 Flash 가격: 인하 폭을 제대로 봐야 하는 이유
Gemini 3.6 Flash의 표준 API 가격은 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50이다. 출력 가격에는 사고 토큰도 포함된다. 컨텍스트 캐싱은 100만 토큰당 $0.15이고, 저장 비용은 100만 토큰당 시간당 $1.00이다.
출시 소식에서 자주 빠지는 부분이 있다. 가격 인하는 출력에만 적용됐다. 이전 Gemini 3.5 Flash의 가격은 입력 $1.50, 출력 $9.00이었다. 입력 가격은 그대로고 출력만 $9.00에서 $7.50로 내려갔으니, 전반적인 할인이라기보다 16.7%의 출력 가격 인하다. 긴 문서를 넣고 짧은 답을 받는 식의 입력 중심 워크로드라면 표면적인 절감 폭은 크지 않다. 진짜 차이는 다른 곳에서 나온다.
토큰 단가보다 중요한 지표, 작업당 비용
세대가 다른 모델을 비교할 때 토큰당 표시 가격만 보는 것은 적절하지 않다. 실제 비용은 가격 × 사용 토큰 수로 결정된다. 여기서는 두 요소가 바뀐다. 출력 단가는 16.7% 낮아졌고, Google은 Artificial Analysis Index를 통해 같은 작업에서 출력 토큰이 약 17% 감소했다고 보고했다. 둘을 합치면 최선의 경우 0.833 × 0.83 ≈ 0.69, 즉 출력 비용이 약 31% 낮아진다.
실제 절감 폭은 워크로드에 따라 다르다. 그래서 2026년 7월 22일, OpenRouter를 통해 동일한 세 프롬프트(코딩 작업, 추론 문제, JSON 추출)를 온도 0에서 두 모델에 각각 실행했다.
| 지표(작업 3개, temp 0) | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 입력 토큰 | 146 | 145 |
| 출력 토큰 | 2,736 | 2,593 |
| 총비용 | $0.0207 | $0.0236 |
| 총 지연 시간 | 5.20s | 5.19s |
두 모델 모두 정확하고 비슷한 수준의 답변을 반환했다. 이 작은 표본에서는 3.6 Flash가 거의 같은 속도에서 약 12% 저렴했다. 다만 추론에 더 많은 토큰을 사용하면서 출력 토큰은 몇 퍼센트 더 많았다. 결론은 명확하다. 확실히 기대할 수 있는 절감은 출력 단가 인하($9.00에서 $7.50)다. 토큰 효율 개선도 전체적으로는 실제 효과가 있지만 작업마다 차이가 크며 항상 나타나는 것은 아니다. 실무에서는 출력 기준 12~17% 절감을 예상하고, 31%는 최선의 경우로 보는 편이 맞다.
(작업 3개, 온도 0의 소규모 표본이며 정식 벤치마크는 아니다.)
빠른 모델군 가격 비교: Gemini 3.6 Flash의 위치
토큰당 가격이 가장 낮다고 해서 가치가 가장 높은 것은 아니다. 빠른 모델군을 나란히 비교해 볼 필요가 있다. 아래 수치는 각 공급사의 공식 가격 페이지 기준이며, 모두 배치가 아닌 표준 요금의 100만 토큰당 가격이다.
| 모델 | 입력 /1M | 출력 /1M | 컨텍스트 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M |
| Gemini 3.5 Flash (이전 모델) | $1.50 | $9.00 | 1M |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k |
| GPT-5.6 Luna | $1.00 | $6.00 | — |
| DeepSeek V4 Flash | $0.14 | $0.28 | 1M |
표시 가격만 보면 3.6 Flash가 승자는 아니다. Claude Haiku 4.5와 GPT-5.6 Luna는 출력 가격에서 더 저렴하고, DeepSeek V4 Flash는 비용 차원이 다르다. 3.6 Flash가 내세우는 가치는 달러당 지능이다. Artificial Analysis Intelligence Index 50으로 빠른 모델군의 중앙값을 크게 웃돌며, 출력 속도는 초당 약 304토큰이고 컨텍스트 윈도는 100만 토큰 전체를 제공한다. 플래그십 가격을 지불하지 않고도 최상급 에이전트형·코딩 품질이 필요하다면 선택할 이유가 있다. 단순 작업을 최대한 저렴하게 처리하는 것이 목표라면 더 저렴한 모델들이 낫다.
3.5 Flash에서 얼마나 좋아졌나
세대 차이는 분명하다. 특히 기존 Flash 라인이 약했던 장기 코딩 작업과 에이전트형 작업에서 개선 폭이 가장 크다.
| 벤치마크 | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| DeepSWE v1.1 | 37% | 49% |
| MLE-Bench | 49.7% | 63.9% |
| OSWorld-Verified (컴퓨터 사용) | 78.4% | 83.0% |
| SWE-Bench Pro | 55.1% | 58.7% |
| Terminal-Bench 2.1 | 76.2% | 78.0% |
점수는 Google DeepMind Flash model page와 Artificial Analysis에서 가져왔다. DeepSWE는 12포인트, MLE-Bench는 14포인트 상승해 특히 눈에 띈다. Google은 GDPval-AA 지식 노동 점수도 1349에서 1421로 올랐다고 보고했다. 이들 항목 중 일부에서는 3.6 Flash가 더 크고 비싼 3.1 Pro도 앞선다. Flash 모델로서는 이례적인 결과다.
Gemini 3.6 Flash와 3.1 Pro, 성능과 가격의 역전
흥미로운 점은 이 빠른 모델이 에이전트형·코딩 작업에서 Google의 더 크고 비싼 3.1 Pro를 이긴다는 것이다. Gemini 3.1 Pro Preview는 프롬프트 길이에 따라 100만 토큰당 입력 $2.00~$4.00, 출력 $12.00~$18.00의 차등 요금을 적용한다. 반면 3.6 Flash는 입력 $1.50, 출력 $7.50의 고정 요금이다.
| Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
| 입력 /1M | $1.50 | $2.00–$4.00 |
| 출력 /1M | $7.50 | $12.00–$18.00 |
| DeepSWE v1.1 | 49% | 12% |
| SWE-Bench Pro | 58.7% | 54.2% |
| Terminal-Bench 2.1 | 78.0% | 73.8% |
3.1 Pro는 여전히 더 크고 고가인 모델이며, 가장 어려운 추론 및 긴 컨텍스트 작업을 겨냥한다. 하지만 대다수의 코딩·에이전트형 워크로드에서는 3.6 Flash가 위 벤치마크 기준으로 더 저렴하면서 점수도 높다. 기본값으로 Pro 등급을 선택하기 전 3.1 Pro와의 비교를 해볼 만한 이유다. full Gemini 3.6 Flash vs 3.1 Pro breakdown에서 일대일 벤치마크, 차등 가격, 직접 측정한 속도 테스트를 확인할 수 있다.
Gemini 3.5 Flash에서 옮겨야 할까
이미 3.5 Flash를 쓰는 대부분의 팀이라면 그렇다. 비용과 성능 면에서 거의 일방적으로 유리하다.
- 입력 가격은 동일($1.50/1M)하고 출력 가격은 더 낮다($7.50 vs $9.00).
- 같은 작업에 필요한 출력 토큰이 더 적다(약 17% 감소).
- 지식 컷오프가 더 최신이다(2025년 1월 대비 2026년 3월).
- 위에서 본 모든 에이전트형·코딩 벤치마크에서 더 높은 점수를 기록했다.
프로덕션에 교체하기 전에는 두 가지를 확인해야 한다. 먼저 최대 출력 64k 제한이 워크로드에 맞는지 살펴보자. 더 긴 단일 응답에 의존해 왔다면 이 경계를 테스트해야 한다. 다음으로 자체 평가 세트를 돌려야 한다. 토큰 효율과 추론 방식의 변화는 이미 다듬어 둔 프롬프트의 동작을 바꿀 수 있으므로, 기본 모델을 바꾸기 전에 실제 트래픽 기준으로 지연 시간과 출력 품질을 측정하는 편이 안전하다.
Flash, Flash-Lite, Cyber 중 무엇을 골라야 하나
세 모델의 역할은 명확히 나뉜다.
- Gemini 3.6 Flash는 기본 선택지다. 빠른 모델군 가격으로 최상급 에이전트형, 코딩, 멀티모달 품질이 필요할 때 적합하다.
- Gemini 3.5 Flash-Lite($0.30/$2.50, 초당 약 350토큰)는 분류, 추출, 라우팅, 단순 채팅처럼 대량 처리·낮은 지연 시간·낮은 복잡도가 중요한 작업에 맞는다. Gemini를 대규모로 가장 저렴하게 운영하는 방법이다.
- Gemini 3.5 Flash Cyber는 정부 기관 또는 검증된 보안 파트너에게만 해당한다. CodeMender 안에서 진행되는 파일럿이며, 표준 API로 호출할 수 있는 모델이 아니다.
Gemini 3.6 Flash API 사용 방법
이 모델은 Gemini API와 Google AI Studio에서 사용할 수 있다. AI Studio에는 프로토타이핑용 무료 등급이 있으며, 이후에는 다른 Gemini 모델과 마찬가지로 free-then-paid Google AI Studio path를 통해 gemini-3.6-flash 모델 ID로 종량제 사용으로 전환한다. 엔터프라이즈 환경으로는 Antigravity, Android Studio, Gemini Enterprise Agent Platform도 안내돼 있다. Vertex AI에서 반드시 사용해야 한다면 2026년 7월 22일 기준으로 해당 환경의 제공 범위가 아직 순차 확대 중이었으므로 Vertex 콘솔의 등록 여부를 확인해야 한다.
Gemini API를 호출하는 최소한의 REST 예시는 다음과 같다.
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'
여러 공급자를 함께 쓰는 팀은 키를 따로 관리하는 대신 애그리게이터로 모델을 라우팅하기도 한다. OpenRouter와 AIReiter 모두 Google의 정가로 gemini-3.6-flash 모델을 제공한다. 차이는 같은 키 뒤에 어떤 모델 구성이 연결되는지다. OpenRouter는 여러 공급자에 걸쳐 라우팅하고, AIReiter는 Anthropic 호환 방식으로 Claude와 Gemini를 함께 연결한다. 따라서 하나의 청구서에서 3.6 Flash와 Claude's API pricing을 비교하려는 경우 유용하다. 단일 모델만 배포한다면 Google을 직접 사용하는 편이 더 단순하다.
자주 묻는 질문
Gemini 3.6 Flash는 무료인가?
Google AI Studio에는 사용량 제한이 있는 프로토타이핑용 무료 등급이 있다. 프로덕션 사용은 100만 토큰당 입력 $1.50, 출력 $7.50의 종량제 가격이 적용된다.
Gemini 3.6 Flash는 3.5 Flash보다 나은가?
그렇다. 공개된 벤치마크에서 DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro, Terminal-Bench 모두 3.5 Flash를 앞선다. 출력 토큰당 비용은 더 낮고 작업당 사용 토큰도 더 적다.
Gemini 3.6 Flash는 Gemini 3.1 Pro보다 나은가?
DeepSWE, SWE-Bench Pro, Terminal-Bench 같은 에이전트형·코딩 벤치마크에서는 그렇고, 가격도 더 낮다($1.50/$7.50 vs $2.00–$4.00/$12.00–$18.00). Gemini 3.1 Pro는 더 큰 모델이며 가장 어려운 긴 컨텍스트 추론과 멀티모달 작업에서는 여전히 앞서므로, 적합한 선택은 워크로드에 따라 달라진다.
Gemini 3.6 Flash 가격은 얼마인가?
표준 등급 기준으로 입력은 100만 토큰당 $1.50, 출력은 100만 토큰당 $7.50이다. 컨텍스트 캐싱은 100만 토큰당 $0.15다.
Gemini 3.6 Flash의 지식 컷오프는 언제인가?
2026년 3월이다. 이전 Gemini 3.5 Flash의 2025년 1월에서 갱신됐다.
Gemini 3.6 Flash는 Vertex AI에서 사용할 수 있나?
Gemini API와 Google AI Studio, 그리고 여러 엔터프라이즈 환경에서의 제공은 확인됐다. 출시 당시 Vertex AI 제공 여부는 명시적으로 확인되지 않았으므로, 해당 환경에서 구축하기 전 Vertex 모델 카탈로그를 확인해야 한다.
Gemini 3.5 Flash Cyber란 무엇인가?
소프트웨어 취약점을 탐지하고 검증하며 패치하도록 조정된 보안 중심 변형 모델이다. Google DeepMind의 CodeMender 에이전트 안에서 동작하며, 공개 모델이 아니라 정부 기관과 신뢰할 수 있는 파트너를 대상으로 한 제한적 접근 파일럿이다.
