Gemini 3.5 Flash-Lite: цена, скорость и сценарии использования

Последнее обновление: 2026-07-22 07:18:20

Если задачи простые, а запросов много, переплачивать за сложное рассуждение нет смысла. Gemini 3.5 Flash-Lite — самый дешёвый способ запускать модели Gemini: $0.30 за миллион входных токенов и $2.50 за миллион выходных. В моём быстром сравнении с Gemini 3.6 Flash она обошлась на 94% дешевле на тех же задачах, начала отвечать быстрее и при этом дала верные результаты. Но модель рассчитана на потоковую обработку и низкую задержку, а не на глубокие рассуждения. Для высоконагруженных, в основном несложных сценариев это очень удачный выбор.

Что представляет собой Gemini 3.5 Flash-Lite

Flash-Lite — младшая модель в быстрой линейке Gemini. Её сделали для массовых несложных задач, где важнее цена одного вызова и задержка, чем максимальный уровень интеллекта. Главное:

  • Стоимость: $0.30 за входные и $2.50 за выходные токены на 1 млн.
  • Контекст: 1 млн токенов — столько же, сколько у более крупных моделей Flash.
  • Скорость: Google заявляет около 350 выходных токенов в секунду.
  • Уровень интеллекта: 36 баллов в Artificial Analysis Index против 50 у более дорогой 3.6 Flash. В этом и заключается компромисс.

Модель вышла одновременно с 3.6 Flash и ориентированной на безопасность 3.5 Flash Cyber, но решает совсем другие задачи: классификацию, извлечение данных, маршрутизацию, тегирование и простой чат в большом масштабе.

Цены: самый доступный Gemini

На фоне остальных моделей линейки Flash-Lite стоит заметно дешевле. Все цифры взяты с официальной страницы цен Google:

МодельВход / 1 млнВыход / 1 млн
Gemini 3.5 Flash-Lite$0.30$2.50
Gemini 3.6 Flash$1.50$7.50
Gemini 3.5 Flash (предыдущая)$1.50$9.00

До учёта фактического расхода токенов Flash-Lite в 5 раз дешевле на входе и в 3 раза на выходе, чем 3.6 Flash. А реальная разница становится ещё заметнее именно при сравнении потребления токенов.

Сравнение с 3.6 Flash на одинаковых задачах

22 июля 2026 года я отправил обеим моделям через OpenRouter три одинаковых промпта при temperature 0: задачу по программированию, задачу на рассуждение и извлечение JSON.

Метрика (3 задачи, temp 0)Gemini 3.5 Flash-LiteGemini 3.6 Flash
Входные токены147148
Выходные токены5433,058
Общая стоимость$0.0014$0.023
Среднее время до первого токена1.2 с4.5 с
Скорость генерацииболее 400 ток/с
Верных ответов3 / 33 / 3

Flash-Lite оказалась на 94% дешевле и правильно решила все три задачи, включая многошаговую задачу о расписании поездов. Такой разрыв объясняют два фактора. Во-первых, модель стримит со скоростью свыше 400 токенов в секунду — выше заявленных 350 — и быстрее выдаёт первый токен, поскольку не делает пауз на «размышления», как 3.6 Flash. Во-вторых, она отвечает гораздо лаконичнее: несколько сотен выходных токенов вместо нескольких тысяч. 3.6 Flash активно расходует скрытые токены рассуждений, за которые тоже приходится платить. В простых задачах эти рассуждения становятся ненужными накладными расходами.

Столбчатая диаграмма: Gemini 3.5 Flash-Lite стоит около 6 процентов от стоимости Gemini 3.6 Flash на тех же трёх задачах

Разница в отзывчивости не менее заметна на практике. Flash-Lite в среднем возвращает первый токен примерно за 1.2 секунды против 4.5 секунды у 3.6 Flash, поэтому в чате или высоконагруженном конвейере она просто ощущается быстрее.

Столбчатая диаграмма среднего времени до первого токена: Gemini 3.5 Flash-Lite — 1.2 секунды, Gemini 3.6 Flash — 4.5 секунды

Есть два важных ограничения. Во-первых, это один запуск при temperature 0, а результаты моделей могут отличаться от запуска к запуску, поэтому точные цифры стоит воспринимать как ориентир, а не как полноценный бенчмарк. Во-вторых, мои три задачи были лёгкими. Разрыв в Intelligence Index — 36 против 50 — реален и проявляется на более сложных задачах, в многошаговых агентных сценариях, тонкой работе с кодом и любых случаях, где требуется аккуратное рассуждение. Здесь небольшой бюджет на размышления у Flash-Lite становится не экономией, а ограничением.

Когда выбирать Flash-Lite, а когда — нет

  • Выбирайте Gemini 3.5 Flash-Lite для массовых, чувствительных к задержке и не слишком сложных задач: классификации, извлечения сущностей, маршрутизации и триажа, тегирования, краткого суммирования текстов и простого чата. При такой цене модель можно использовать в масштабах, которые были бы некомфортны для 3.6 Flash.
  • Переходите на 3.6 Flash, когда задаче действительно нужно рассуждение: для агентного программирования, управления компьютером, многошаговых рабочих процессов или любых случаев, где цена ошибки высока. В полном руководстве по Gemini 3.6 Flash разобраны бенчмарки и цены этой модели.

Распространённый подход — использовать обе модели: основной поток дешёвых и простых запросов направлять в Flash-Lite, а сложные случаи передавать 3.6 Flash. У них одинаковое контекстное окно в 1 млн токенов и один API, поэтому для переключения достаточно изменить ID модели в одной строке.

Как получить доступ к Gemini 3.5 Flash-Lite

Модель доступна в Gemini API и Google AI Studio под ID gemini-3.5-flash-lite; в AI Studio есть бесплатный тариф для тестирования. Если вы пользуетесь агрегатором, модель доступна и в OpenRouter, и в AIReiter по рекомендованной цене Google. Это удобно, если через один ключ вы работаете одновременно с моделями Gemini и Claude.

FAQ

Сколько стоит Gemini 3.5 Flash-Lite?

$0.30 за 1 млн входных токенов и $2.50 за 1 млн выходных токенов. Это самый доступный тариф в линейке Gemini.

Gemini 3.5 Flash-Lite бесплатна?

Для прототипирования в Google AI Studio доступен бесплатный тариф. В продакшене применяется указанная выше оплата по факту использования.

Насколько быстра Gemini 3.5 Flash-Lite?

Google заявляет около 350 выходных токенов в секунду; в моём стриминговом тесте скорость превысила 400 токенов в секунду, а первый токен приходил примерно через 1.2 секунды.

Достаточно ли Flash-Lite или лучше использовать 3.6 Flash?

Для простых массовых задач Flash-Lite даёт корректные ответы и обходится значительно дешевле. Для задач с интенсивным рассуждением или агентных сценариев более высокий интеллект 3.6 Flash — Index 50 против 36 — оправдывает дополнительные расходы.

Читайте также