Gemini 3.5 Flash-Lite:料金・速度・使いどころ

最終更新日: 2026-07-22 07:17:34

大量のシンプルなAI処理を回すなら、Gemini 3.5 Flash-Liteは有力な選択肢です。料金は100万入力トークンあたり$0.30、100万出力トークンあたり$2.50と、Geminiモデルのなかで最安。実際にGemini 3.6 Flashと同じタスクで比較したところ、コストは94%低く、ストリーミングも高速で、回答はいずれも正解でした。深い推論よりも、処理量と応答速度を優先するためのモデルです。高スループットで比較的素直なワークロードなら、まず候補に入ります。

Gemini 3.5 Flash-Liteはどんなモデルか

Flash-LiteはGeminiの高速モデル群における最廉価クラスです。1リクエストあたりのコストとレイテンシを重視し、シンプルな処理を大量にこなす用途に向けて設計されています。主な仕様は次のとおりです。

  • 料金:100万トークンあたり、入力$0.30/出力$2.50。
  • コンテキスト長:上位のFlashモデルと同じ100万トークン。
  • 速度:Googleの評価では、出力速度は毎秒約350トークン。
  • 知能:Artificial Analysis Indexは36。より高価な3.6 Flashは50で、この差が性能面でのトレードオフです。

3.6 Flashおよびセキュリティ重視の3.5 Flash Cyberと同時に登場しましたが、役割は異なります。想定されるのは、分類、情報抽出、ルーティング、タグ付け、そして大規模なシンプルチャットです。

Gemini最安の料金設定

ほかのモデルと比べると、Flash-Liteの価格差はかなり大きくなります。以下はGoogleの公式料金ページに基づく金額です。

モデル入力/100万出力/100万
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash(従来版)$1.50$9.00

3.6 Flashと比較すると、入力は5分の1、出力は3分の1です。さらに実際にはモデルごとの出力トークン数にも差が出るため、総コストではこの差がいっそう広がります。

3.6 Flashと同条件で比較した結果

2026年7月22日、OpenRouter経由で両モデルに同じ3つのプロンプトを与えました。内容はコーディング、推論問題、JSON抽出で、temperatureは0です。

指標(3タスク、temp 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
入力トークン147148
出力トークン5433,058
総コスト$0.0014$0.023
最初のトークンまでの平均時間1.2秒4.5秒
生成速度毎秒400トークン超
正解数3 / 33 / 3

結果として、Flash-Liteは94%安価で、複数ステップの列車時刻問題を含む全タスクに正答しました。差を生んだ要因は2つあります。1つはストリーミング速度です。Flash-Liteは毎秒400トークン超で生成され、公式の350トークンという評価を上回りました。また、3.6 Flashのように「考える」ための待機を挟まないため、最初のトークンも早く返ります。もう1つは出力の簡潔さです。3.6 Flashは数千トークンを出力したのに対し、Flash-Liteは数百トークンでした。3.6 Flashでは、利用料金の対象となる隠れた推論トークンを多く使うためです。単純な仕事では、この推論は不要なオーバーヘッドになり得ます。

同じ3タスクでGemini 3.5 Flash-LiteのコストがGemini 3.6 Flashの約6%であることを示す棒グラフ

体感上も応答性の差は明確です。Flash-Liteは最初のトークンを平均約1.2秒で返したのに対し、3.6 Flashは4.5秒でした。チャットや大量処理パイプラインでは、Flash-Liteのほうが明らかに軽快に感じられます。

最初のトークンまでの平均時間を比較した棒グラフ。Gemini 3.5 Flash-Liteは1.2秒、Gemini 3.6 Flashは4.5秒

ただし、注意点は2つあります。まず、これはtemperature 0での1回の実行結果です。モデルの出力には実行ごとのばらつきがあるため、数値はベンチマークではなく参考値として見るべきです。次に、今回の3タスクは簡単なものでした。Intelligence Indexの差(36対50)は実在し、難しい問題、複雑な複数ステップのエージェント、微妙な判断が必要なコーディング、慎重な推論が求められる処理では表れます。そのような場面では、Flash-Liteの限られた推論予算は節約ではなく上限になります。

Flash-Liteを選ぶ場面、選ばない場面

  • Gemini 3.5 Flash-Liteが向く用途:高スループットかつ低レイテンシが必要で、複雑さが比較的低い処理です。分類、エンティティ抽出、ルーティングとトリアージ、タグ付け、短文要約、シンプルなチャットが該当します。この価格なら、3.6 Flashではためらう規模でも運用しやすくなります。
  • 3.6 Flashへ上げるべき用途:本格的な推論を要するタスクです。エージェント型コーディング、コンピュータ操作、複数ステップのワークフロー、あるいは誤答のコストが高い処理では3.6 Flashを選ぶべきです。このティアのベンチマークと料金については、Gemini 3.6 Flashの完全ガイドで解説しています。

実運用では、両者を併用する形がよくあります。安価で単純な大半のリクエストはFlash-Liteに流し、難しいケースだけ3.6 Flashへエスカレーションする方法です。両モデルは100万トークンのコンテキスト長と同じAPIを共有しているため、切り替えはモデルIDを1行変更するだけです。

Gemini 3.5 Flash-Liteの利用方法

このモデルはGemini APIとGoogle AI Studioで提供されており、モデルIDはgemini-3.5-flash-liteです。AI Studioにはテスト用の無料枠もあります。アグリゲーター経由で利用するなら、OpenRouterとAIReiterのどちらもGoogleの定価で提供しています。GeminiやClaudeのモデルを1つのキーの背後で使い分けたい場合に便利です。

よくある質問

Gemini 3.5 Flash-Liteの料金はいくらですか?

100万入力トークンあたり$0.30、100万出力トークンあたり$2.50です。Geminiラインで最も安いティアになります。

Gemini 3.5 Flash-Liteは無料ですか?

Google AI Studioにはプロトタイピング向けの無料枠があります。本番利用では、上記の従量課金料金が適用されます。

Gemini 3.5 Flash-Liteはどれくらい速いですか?

Googleの評価は毎秒約350出力トークンです。今回のストリーミングテストでは毎秒400トークンを超え、最初のトークンは約1.2秒で返りました。

Flash-Liteで十分ですか? それとも3.6 Flashを使うべきですか?

シンプルで大量のタスクなら、Flash-Liteは正確でコストも大幅に低くなります。推論負荷が高い仕事やエージェント型の処理では、3.6 Flashのより高い知能(Index 50対36)に追加コストを払う価値があります。

関連記事