Если задачи простые, а запросов много, переплачивать за сложное рассуждение нет смысла. Gemini 3.5 Flash-Lite — самый дешёвый способ запускать модели Gemini: $0.30 за миллион входных токенов и $2.50 за миллион выходных. В моём быстром сравнении с Gemini 3.6 Flash она обошлась на 94% дешевле на тех же задачах, начала отвечать быстрее и при этом дала верные результаты. Но модель рассчитана на потоковую обработку и низкую задержку, а не на глубокие рассуждения. Для высоконагруженных, в основном несложных сценариев это очень удачный выбор.
Что представляет собой Gemini 3.5 Flash-Lite
Flash-Lite — младшая модель в быстрой линейке Gemini. Её сделали для массовых несложных задач, где важнее цена одного вызова и задержка, чем максимальный уровень интеллекта. Главное:
- Стоимость: $0.30 за входные и $2.50 за выходные токены на 1 млн.
- Контекст: 1 млн токенов — столько же, сколько у более крупных моделей Flash.
- Скорость: Google заявляет около 350 выходных токенов в секунду.
- Уровень интеллекта: 36 баллов в Artificial Analysis Index против 50 у более дорогой 3.6 Flash. В этом и заключается компромисс.
Модель вышла одновременно с 3.6 Flash и ориентированной на безопасность 3.5 Flash Cyber, но решает совсем другие задачи: классификацию, извлечение данных, маршрутизацию, тегирование и простой чат в большом масштабе.
Цены: самый доступный Gemini
На фоне остальных моделей линейки Flash-Lite стоит заметно дешевле. Все цифры взяты с официальной страницы цен Google:
| Модель | Вход / 1 млн | Выход / 1 млн |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash (предыдущая) | $1.50 | $9.00 |
До учёта фактического расхода токенов Flash-Lite в 5 раз дешевле на входе и в 3 раза на выходе, чем 3.6 Flash. А реальная разница становится ещё заметнее именно при сравнении потребления токенов.
Сравнение с 3.6 Flash на одинаковых задачах
22 июля 2026 года я отправил обеим моделям через OpenRouter три одинаковых промпта при temperature 0: задачу по программированию, задачу на рассуждение и извлечение JSON.
| Метрика (3 задачи, temp 0) | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Входные токены | 147 | 148 |
| Выходные токены | 543 | 3,058 |
| Общая стоимость | $0.0014 | $0.023 |
| Среднее время до первого токена | 1.2 с | 4.5 с |
| Скорость генерации | более 400 ток/с | — |
| Верных ответов | 3 / 3 | 3 / 3 |
Flash-Lite оказалась на 94% дешевле и правильно решила все три задачи, включая многошаговую задачу о расписании поездов. Такой разрыв объясняют два фактора. Во-первых, модель стримит со скоростью свыше 400 токенов в секунду — выше заявленных 350 — и быстрее выдаёт первый токен, поскольку не делает пауз на «размышления», как 3.6 Flash. Во-вторых, она отвечает гораздо лаконичнее: несколько сотен выходных токенов вместо нескольких тысяч. 3.6 Flash активно расходует скрытые токены рассуждений, за которые тоже приходится платить. В простых задачах эти рассуждения становятся ненужными накладными расходами.
Разница в отзывчивости не менее заметна на практике. Flash-Lite в среднем возвращает первый токен примерно за 1.2 секунды против 4.5 секунды у 3.6 Flash, поэтому в чате или высоконагруженном конвейере она просто ощущается быстрее.
Есть два важных ограничения. Во-первых, это один запуск при temperature 0, а результаты моделей могут отличаться от запуска к запуску, поэтому точные цифры стоит воспринимать как ориентир, а не как полноценный бенчмарк. Во-вторых, мои три задачи были лёгкими. Разрыв в Intelligence Index — 36 против 50 — реален и проявляется на более сложных задачах, в многошаговых агентных сценариях, тонкой работе с кодом и любых случаях, где требуется аккуратное рассуждение. Здесь небольшой бюджет на размышления у Flash-Lite становится не экономией, а ограничением.
Когда выбирать Flash-Lite, а когда — нет
- Выбирайте Gemini 3.5 Flash-Lite для массовых, чувствительных к задержке и не слишком сложных задач: классификации, извлечения сущностей, маршрутизации и триажа, тегирования, краткого суммирования текстов и простого чата. При такой цене модель можно использовать в масштабах, которые были бы некомфортны для 3.6 Flash.
- Переходите на 3.6 Flash, когда задаче действительно нужно рассуждение: для агентного программирования, управления компьютером, многошаговых рабочих процессов или любых случаев, где цена ошибки высока. В полном руководстве по Gemini 3.6 Flash разобраны бенчмарки и цены этой модели.
Распространённый подход — использовать обе модели: основной поток дешёвых и простых запросов направлять в Flash-Lite, а сложные случаи передавать 3.6 Flash. У них одинаковое контекстное окно в 1 млн токенов и один API, поэтому для переключения достаточно изменить ID модели в одной строке.
Как получить доступ к Gemini 3.5 Flash-Lite
Модель доступна в Gemini API и Google AI Studio под ID gemini-3.5-flash-lite; в AI Studio есть бесплатный тариф для тестирования. Если вы пользуетесь агрегатором, модель доступна и в OpenRouter, и в AIReiter по рекомендованной цене Google. Это удобно, если через один ключ вы работаете одновременно с моделями Gemini и Claude.
FAQ
Сколько стоит Gemini 3.5 Flash-Lite?
$0.30 за 1 млн входных токенов и $2.50 за 1 млн выходных токенов. Это самый доступный тариф в линейке Gemini.
Gemini 3.5 Flash-Lite бесплатна?
Для прототипирования в Google AI Studio доступен бесплатный тариф. В продакшене применяется указанная выше оплата по факту использования.
Насколько быстра Gemini 3.5 Flash-Lite?
Google заявляет около 350 выходных токенов в секунду; в моём стриминговом тесте скорость превысила 400 токенов в секунду, а первый токен приходил примерно через 1.2 секунды.
Достаточно ли Flash-Lite или лучше использовать 3.6 Flash?
Для простых массовых задач Flash-Lite даёт корректные ответы и обходится значительно дешевле. Для задач с интенсивным рассуждением или агентных сценариев более высокий интеллект 3.6 Flash — Index 50 против 36 — оправдывает дополнительные расходы.
