Gemini 3.6 Flashの登場からわずか3週間後、GoogleはGemini 3.7 Flashをリリースしました。注目は、1Mトークンあたり入力$0.75/出力$3.75という導入価格を維持したまま、性能を大きく引き上げている点です。たとえばDeepSWE v1.1は48.6%から65.3%へ、16.7ポイント上昇しています。トークン単価だけ見れば移行コストはゼロですが、恩恵の大きさはワークロードによって異なります。
Gemini 3.7 Flashと3.6 Flash:全18ベンチマークを比較
Google DeepMindの公式モデルページでは、Gemini 3.7 Flashがほぼ全項目で3.6 Flashを上回っています。特に差が大きいのは、コーディングエージェントとエンタープライズ自動化に関する評価です。以下はGoogleが両モデルについて公開している18指標をすべてまとめたものです。参考としてClaude Sonnet 5とGPT-5.6 Terraも比較対象に含まれています。
| ベンチマーク | Gemini 3.7 Flash | Gemini 3.6 Flash | 差分 |
|---|---|---|---|
| Artificial Analysis Intelligence Index(総合指標) | 56 | 52 | +4 |
| FrontierCode 1.1(実運用コードの品質) | 43.6% | 34.4% | +9.2 |
| DeepSWE v1.1(長期的なソフトウェアエンジニアリング) | 65.3% | 48.6% | +16.7 |
| Code Arena(Web開発Elo) | 1588 | 1538 | +50 |
| Terminal-Bench 2.1(エージェント型ターミナルコーディング) | 85.8% | 78.0% | +7.8 |
| Terminal-Bench 3.0(汎用エージェント能力) | 14.9% | 5.4% | +9.5 |
| AutomationBench(エンタープライズ業務の自動化) | 30.4% | 17.0% | +13.4 |
| GDPVal-AA v2(ナレッジワークElo) | 1525 | 1422 | +103 |
| Harvey LAB-AA(複雑な法務ワークフロー) | 90.7% | 85.1% | +5.6 |
| GDP.pdf(専門的なPDF理解) | 34.0% | 22.0% | +12.0 |
| CharXiv、ツールなし(グラフ推論) | 84.5% | 85.2% | −0.7 |
| CharXiv、ツールあり | 88.7% | 89.4% | −0.7 |
| LVBench(長尺動画の理解) | 85.4% | 84.2% | +1.2 |
| GDM-MRCR v2、128k(長文コンテキスト検索) | 97.0% | 91.8% | +5.2 |
| OSWorld-2.0(エージェントによるコンピュータ操作) | 47.9% | 33.8% | +14.1 |
| Agent's Last Exam(デスクトップエージェントのタスク) | 26.3% | 24.2% | +2.1 |
| HLE-Verified(分野横断の専門推論) | 53.6% | 51.2% | +2.4 |
| LABBench2(生物学研究タスク) | 82.1% | 76.1% | +6.0 |
数値はいずれも3.7 FlashのモデルページでGoogle DeepMindが公表しているベンダー報告値です。大半のベンチマークについては独立した再現検証がまだ公開されていないため、差分は個別ワークロードでの成果を保証するものではなく、傾向として捉えるべきでしょう。
コーディングとエージェント用途では3.7 Flashが大きくリード
両モデルの差が最もはっきり出ているのは、コーディングとエージェント型のベンチマークです。実際のリポジトリを対象に長期的なソフトウェアエンジニアリング能力を測るDeepSWE v1.1では、3.7 Flashは48.6%から65.3%へ、16.7ポイント伸びました。同じ指標ではClaude Sonnet 5の53.8%を上回り、GPT-5.6 Terraの69.6%に次ぐ位置です。比較スコアはすべてDeepMindのベンチマーク表によります。
そのほかのエージェント系評価でも、伸びは目立ちます。
- Terminal-Bench 3.0:汎用エージェント能力:5.4% → 14.9%で、ほぼ3倍
- AutomationBench:企業ワークフローの自動化:17.0% → 30.4%
- FrontierCode 1.1:実運用コードの品質:+9.2ポイント
- OSWorld-2.0:エージェントによるコンピュータ操作:33.8% → 47.9%
一方、Redditの初期ユーザー評価からは、ベンチマーク上の勝利と日々の開発体験には隔たりも見えてきます。
実装には有効だが、計画立案、コードレビュー、難しい問題の分解は弱いかもしれない。
— r/google_antigravityのユーザー投稿より
DeepMindのモデルページに掲載されたGoogleの顧客事例も、この傾向を裏付けています。Browser Useによると、「Gemini 3.7 Flash agentは3.6 Flashより35%低コストで、観測されたプロンプトキャッシュヒット率は8%向上し、ツールエラーも減少した」とのことです。HarveyはLegal Agent Benchで全項目通過率が2.6ポイント上がったと測定しています。Nunu.aiは、GPT-5.6-Terraと同等の性能を「およそ半分のコスト」で得られたとしています。いずれも節約の理由はトークン単価の値引きではなく、エージェントループのステップ数削減です。
ナレッジワークとマルチモーダルは堅実な改善
コーディング以外では、改善幅はやや小さくなります。Artificial Analysis Intelligence Indexは52から56へ上昇し、DeepMindの比較表ではClaude Sonnet 5の55とGPT-5.6 Terraの57の間に位置します。コーディング以外で特に大きいのは文書理解です。GDP.pdfは22.0%から34.0%へ12ポイント上昇しました。複雑な文書、財務報告書、法的提出書類を取り込むパイプラインでは意味のある差です。128Kトークンでの長文コンテキスト検索を測るGDM-MRCR v2も、91.8%から97.0%へ改善しています。
複雑な法務ワークフローを評価するHarvey LAB-AAは85.1%から90.7%に上昇しました。長尺動画理解のLVBenchと、生物学研究タスクのLABBench2も、ともに約6ポイント改善しています。専門的な用途では重要ですが、これらだけで移行を決めるケースは多くないでしょう。
料金は同じ:両モデルに導入価格が適用中
| モデル | 入力($/1Mトークン) | 出力($/1Mトークン) | 通常料金(2027年1月1日以降) |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Gemini 3.6 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Claude Sonnet 5 | $2.00 | $10.00 | — |
| GPT-5.6 Terra | $2.00 | $12.00 | — |
\*導入価格は2026年12月31日に終了します。料金はすべてDeepMindのモデルページに基づきます。
Googleは2026年8月13日の3.7 Flashリリース時、両Flashモデルに入力$0.75/出力$3.75のプロモーション料金を適用しました。それ以前の3.6 Flashは、通常料金である$1.50/$7.50でした。Googleがプロモーションを延長しない限り、2027年1月1日からは両モデルとも$1.50/$7.50に戻ります。トークン単価は同一なので、コスト差を生むのはタスク効率です。Browser Useが報告した35%のエージェントコスト削減も、同一ワークロードで測定されたもので、料金差ではなくツール呼び出しの減少とキャッシュヒット率の向上によるものです。
キャッシュ、Batch API、グラウンディング料金を含む3.7 Flash APIコストの詳しい内訳は、Gemini 3.7 Flash API料金ガイドを参照してください。
3.6 Flashが優位な領域もある
3.6 Flashがわずかに上回るのは、グラフ推論です。ツールを使わないCharXivでは、3.6 Flashが85.2%、3.7 Flashが84.5%です。ツールを有効にしても差は同じで、89.4%対88.7%となっています。ただし差はいずれも1ポイント未満です。個々のグラフタスクでは両モデルが同等の結果を出す可能性があるため、標準モデルを決める前に自社のグラフ系ワークロードで検証してください。
Googleの比較表で3.6 Flashが3.7 Flashを上回るのは、この2項目だけです。グラフ推論を除くと競っている領域はIntelligence Indexの52対56ですが、ここでも3.7 Flashがリードしています。
移行で変わるのはモデル名だけではない
機械的な移行作業は、モデルIDのgemini-3.6-flashをgemini-3.7-flashへ置き換えることです。DeepMindのモデルページによれば、両モデルはコンテキストウィンドウが同一です。入力1M、出力64Kで、対応する入力モダリティもテキスト、画像、動画、音声、PDFと共通しています。ツール利用機能も、function calling、search grounding、computer useが共通です。3.7 Flashは一般提供(GA)として記載されています。
ただし注意点があります。3.5から3.6への移行時には、開発者が想定していなかったサイレントなAPI挙動変更がありました。独立テストの記録によれば、temperature、top_p、top_kは暗黙に無視されるようになり、thinking_budgetは文字列列挙型のthinking_levelへ変わり、レスポンスのプリフィルも廃止されました。3.7 Flashに同様の変更があるかどうかは、Googleからまだ公表されていません。文書化されるまでは、本番トラフィックを移す前に両方のモデル文字列で評価スイートを実行するのが安全です。3.6はフォールバックとして残しておきましょう。
Gemini 3.7 Flashへ切り替えるべきか
判断はワークロード別に分けるのが現実的です。
- コーディングエージェントを使うなら、すぐに切り替える。DeepSWE v1.1は16.7ポイント上がり、Terminal-Bench 3.0はほぼ3倍になりました。トークン単価が同じ以上、コーディングエージェント用途で3.6を使い続ける経済的な理由はありません。
- 複雑な文書を処理するなら、すぐに切り替える。GDP.pdfの理解度は12ポイント上昇し、22.0%から34.0%になりました。128Kトークンの長文コンテキスト検索は97.0%と、ほぼ完全な水準です。
- グラフ推論が主用途なら、まず検証する。CharXivは3.6が1ポイント未満ながら上回っています。切り替えを決める前に、並行評価を実施してください。
- 検証済みで安定したパイプラインなら、3.6を維持する選択肢もある。DeepMindのモデルページには3.6 Flashの終了日は記載されていません。ワークフローが回帰テストを通過しており、コーディング性能の向上をすぐ必要としないなら、挙動変化のデバッグコストがメリットを上回ることもあります。移行は一度に行わず、ワークフロー単位で進めるべきです。
- リリース間隔も考慮する。Googleは3.6の3週間後に3.7を出しました。現時点で3.7の伸びが大きいワークフローを移行し、3.6はフォールバックとして固定しておくのがよいでしょう。Flashの各リリースはプラットフォーム移行ではなく、評価すべき段階的なアップグレードとして扱うのが妥当です。
両モデルは、Gemini 3.7 FlashとGemini 3.6 Flashのチャットインターフェースで並べて比較できます。
Gemini 3.7 Flashは新アーキテクチャか、それとも追加学習による更新か?
Googleは3.7 Flashについて、新アーキテクチャなのか追加学習による更新なのかを公表していません。Artificial Analysis Intelligence Indexは52から56へ上昇していますが、独立テストでは3.5 Flashと3.6 Flashはいずれも同指数で50点だったことが確認されています。3.7の改善がアーキテクチャ変更によるものか、トレーニングデータの改善によるものかは文書化されていません。
Gemini 3.7 Flashは3.6 Flashより高価か?
いいえ。2026年12月31日までは、どちらも入力100万トークンあたり$0.75、出力100万トークンあたり$3.75です。その後は両モデルとも$1.50/$7.50になります。アップグレードによる節約は、トークン単価の低下ではなく、1タスクあたりのツール呼び出しや推論ステップが減ることによるものです。
Gemini 3.7 Flashはどこで利用できる?
DeepMindのモデルページによると、3.7 FlashはGemini API、Google AI Studio、Google Antigravity、Vertex AI、Gemini Enterprise、Gemini Appで利用可能です。ステータスは一般提供となっています。
今は移行せず、次のFlashバージョンを待つべきか?
3.7 Flashは、ベンチマークと顧客導入事例が公開されているGAモデルです。コーディングやエージェント性能の改善がワークロードに効くなら、そのワークフローは今移行し、次のバージョンが出た時点で再評価するのがよいでしょう。待つことには、すでに使える改善を活用できない機会コストがあります。