Gemini 3.5 Flash-Lite против Gemini 3.1 Pro: сравнил оба

Последнее обновление: 2026-07-23 03:20:18

Может ли самая доступная модель Google поколения 3.5 заменить Pro, которая стоит в 6,7 раза дороже по входным токенам? 23 июля 2026 года я отправил четыре одинаковых запроса в gemini-3.5-flash-lite и gemini-3.1-pro-preview. По корректности получилась ничья, зато стоимость различалась в 25 раз. И единственная ошибка Flash-Lite — именно тот тип сбоя, который способен сломать production-пайплайн. Если выбираете между Pro и средней моделью Flash, смотрите отдельное сравнение: Gemini 3.5 Flash vs Gemini 3.1 Pro.

Четыре одинаковых задачи: результаты без скидок

Запросы были идентичными, маршрут API — один и тот же, OpenAI-совместимый. Каждый ответ оценивался программно: для задачи с кодом было 8 локальных тестов, для извлечения данных — строгая схема.

ЗадачаFlash-Lite3.1 ProПобедитель
Python-парсер длительностей ISO-8601 (8 тестов)8/8, 3,7 с8/8, 38,2 сНичья по корректности
Строгое извлечение JSON из неаккуратного письмаПоля верны, но JSON обёрнут в markdown-блок, 1,0 сКорректный JSON без обёртки, 9,8 сPro
Ловушка в логике процентов (ответ: 50)Верно, 1,8 сВерно, 10,6 сНичья
Ревью кода с 3 намеренно добавленными ошибкамиНашла 2 из 3 и ещё одну ошибку, которой не было в задании, 3,7 сНашла 2 из 3 и ещё одну ошибку, которой не было в задании, 30,2 сНичья
Сравнение задержек на четырёх одинаковых запросах: Gemini 3.5 Flash-Lite и Gemini 3.1 Pro

Обе модели написали полностью рабочий парсер длительностей. В ревью кода обе заметили SQL-инъекцию, кэш из-за изменяемого аргумента по умолчанию и неэффективную фильтрацию. И обе пропустили одну и ту же специально заложенную ошибку с часовым поясом naive-datetime. На этих четырёх типовых задачах разницы в точности не было.

Но есть две оговорки. Это точечная проверка и описанный ниже прогон из 30 вызовов, а не полноценный бенчмарк. Кроме того, один вызов Pro выдал необоснованный отказ на безобидный запрос о ревью кода — пришлось повторить запрос. Возможно, шум внёс relay-сервис, а не сама модель, но бюджет на повторы закладывать стоит в любом случае.

Где Flash-Lite начинает ошибаться

Сбой на соблюдении формата

В запросе на извлечение было прямое требование: «Верни ТОЛЬКО объект JSON». Pro выдала чистый JSON. Flash-Lite вернула правильные данные, но завернула их в блок ``json fences, из-за чего вызов json.loads()` в следующем шаге падает, пока не добавите очистку ответа.

Один такой случай мог оказаться шумом, поэтому я измерил частоту: по 30 запросов на извлечение к каждой модели, на 10 разных письмах в поддержку. Результаты программно проверялись на чистый JSON без обёртки и соответствие схеме. Flash-Lite прошла 29 из 30 проверок (96,7%): ровно один ответ оказался в markdown-блоке. У 3.1 Pro — 30 из 30. В единственном сбое Flash-Lite проблема была не в содержимом: поля извлечены верно, неправильной оказалась только упаковка ответа.

Именно для таких задач Google и позиционирует эту модель: на официальной странице Flash-Lite она названа «best for low-latency and high throughput agentic tasks». Частота сбоев 3,3% выглядит терпимо, пока не учесть накопительный эффект: в агентном цикле с 20 вызовами модели хотя бы один некорректный ответ появится примерно в половине запусков (1 − 0.967²⁰ ≈ 0.49). Если отправляете структурированный вывод в Flash-Lite, поставьте валидатор и один повтор: при 3,3% ошибок один retry снижает остаточный риск примерно до 0,1% на вызов. В моих прогонах все сбои касались упаковки, а не данных.

В чём Pro всё ещё сильнее

Все четыре задачи выше лежат в комфортной зоне Flash-Lite: короткий контекст, чёткая спецификация, один запрос — один ответ. Отчёты сообщества за неделю после релиза довольно последовательно очерчивают границу. Пользователи r/GeminiAI, работающие с длинными документами, сообщают, что Pro лучше удерживает последовательность персонажей и сюжета, тогда как младшие Gemini начинают дрейфовать. Независимый индекс указывает в ту же сторону: Artificial Analysis ставит 3.1 Pro 46 баллов в Intelligence Index против 36 у Flash-Lite; основной разрыв приходится на оценки многошагового рассуждения, а не на кодинг или извлечение. В том же рейтинге Flash-Lite занимает второе место по скорости генерации среди 152 отслеживаемых моделей, но лишь 13-е по интеллектуальному индексу. Это профиль узкого специалиста, а не универсальной замены.

Карточка Artificial Analysis для Gemini 3.5 Flash-Lite: Intelligence Index 36, скорость вывода 426,8 токена в секунду и цена $0.30 и $2.50 за миллион токенов

Более сложная задача в моём тесте тоже обозначила потолок: ошибку с часовым поясом не заметила ни одна из моделей. То, что Flash-Lite сравнялась с Pro, не делает её Pro. Это лишь показывает, что у обеих есть слепые зоны — и за немного более глубокие возможности Pro вы платите в 25 раз больше, принимая риск на себя.

Практическая граница такая: Pro по-прежнему оправдана для задач, где модель должна перестраивать план по ходу работы, сохранять связность текста объёмом более 50k слов или принимать решения с дорогой ценой ошибки. Всё, что укладывается в шаблонный сценарий, — нет.

Фактическая стоимость: не 4,8x, а 25x

По прайс-листу вывод Pro стоит в 4,8 раза дороже Flash-Lite: $12 против $2.50 за миллион токенов. В моих четырёх задачах реальный расход составил примерно $0.005 для Flash-Lite и $0.13 для Pro — разница в 25 раз. Lite суммарно тарифицировала около 570 входных и 2 020 выходных токенов, Pro — 1 700 входных и 10 386 выходных, по каталожным ценам.

Причина — thinking tokens. Gemini 3.1 Pro рассуждает перед ответом, а Google тарифицирует эти рассуждения как выходные токены. На задаче с парсером Pro выдала 5 125 выходных токенов, из которых 4 811, или 94%, пришлись на thinking. Flash-Lite ответила на тот же запрос ровно за 819 токенов. По всем четырём задачам thinking составил 84% от всего, что Pro выставила мне к оплате.

Тарифицируемые выходные токены по задачам: накладные расходы thinking tokens у Gemini 3.1 Pro

Прогон из 30 запросов на извлечение только увеличил разрыв: короткие ответы максимально повышают долю thinking overhead. Flash-Lite выполнила все 30 вызовов за 1 899 выходных токенов и примерно $0.006 суммарно. Pro выставила 29 468 выходных токенов, из них 27 636, или 94%, — thinking, на сумму около $0.38: разрыв в 65 раз на этой нагрузке. В масштабе миллиона запросов на извлечение в месяц это разница между статьёй расходов в $190 и $12,500.

Это не особенность моей небольшой выборки. Команда бенчмарка для программирования Tessl запустила примерно 3 300 задач для coding-агентов и обнаружила, что Gemini 3.1 Pro в итоге оказалась *дешевле* ориентированной на рассуждения Gemini 3.5 Flash, несмотря на более высокие цены в прайсе. Механизм тот же, только направление обратное. Показатели cost-to-run-index от Artificial Analysis демонстрируют такую же инверсию. Вывод простой: сравнивайте модели по измеренной стоимости успешно выполненной задачи, а не по цене токена в таблице.

Характеристики и цены на 23 июля 2026 года

Данные взяты с официальной страницы цен Gemini API:

Gemini 3.5 Flash-LiteGemini 3.1 Pro (≤200k ctx)
Ввод / 1 млн токенов$0.30$2.00 ($4.00 свыше 200k)
Вывод / 1 млн токенов (включая thinking)$2.50$12.00 ($18.00 свыше 200k)
Batch-тариф$0.15 / $1.25$1.00 / $6.00
Кэширование контекста$0.03$0.20
Контекстное окно1M вход / 64k выход1M вход / 32k выход
Скорость вывода (Artificial Analysis)426.8 ток/с112.2 ток/с
СтатусGA, gemini-3.5-flash-litePreview, gemini-3.1-pro-preview
Официальная таблица цен Gemini API для Gemini 3.5 Flash-Lite, июль 2026 года

Стоит отметить два момента. Flash-Lite стала *дороже* предшественницы: 3.1 Flash-Lite стоила $0.25/$1.50, так что цена выхода выросла на 67%. Google объясняет это приростом возможностей: опубликованные на странице модели DeepMind показатели говорят, что 3.5 Flash-Lite выросла с 38.3% до 54.2% на SWE-Bench Pro и с 31% до 54% на Terminal-bench 2.1 относительно 3.1 Flash-Lite. Также обратите внимание на асимметрию лимитов вывода: Flash-Lite допускает 64k выходных токенов, вдвое больше 32k у Pro. Поэтому для очень длинных одиночных генераций, как ни странно, подходит именно дешёвая модель.

Что говорят первые пользователи

На момент проверки модели всего два дня, поэтому обсуждений пока немного. Первые production-отзывы в X делятся на три группы:

  • Недовольство ценой: «Why is 3.5 flash lite 50% more expensive. It is so sneaky», — написал @samarthg1911 23 июля. Повышение цены — самая частая претензия.
  • Успехи в пайплайнах: ML-инженер @mrdbourke сообщил, что модель «очень быстрая и отлично работает со зрением», а в некоторых их пайплайнах она заменила Gemini 3.5 Flash, модель с ценой выхода в 3,6 раза выше. Другая команда, работающая с контентными инструментами, назвала её «существенным шагом вперёд» относительно 3.1 Flash-Lite в разборе интернет-сленга.
  • Сообщения о регрессе: внутренние оценки одного инженера привели к противоположному выводу: «3.5 flash lite is a real downgrade», и команда осталась на 3.1 Flash-Lite.

Противоречивые ранние отзывы обычно означают, что сильные стороны модели зависят от конкретной нагрузки. Мои данные говорят о том же: в своей нише она превосходна, но на границах может незаметно допускать небрежности.

Какую модель выбрать для каждой задачи

Выбор между Gemini 3.5 Flash-Lite и Gemini 3.1 Pro — не вопрос «одна вместо другой». По результатам измерений и сообщениям сообщества я бы настроил маршрутизацию так:

Отправляйте в Flash-Lite ($0.30/$2.50):

  • Структурированное извлечение, классификацию и тегирование — с JSON-валидатором и одним повтором
  • Генерацию шаблонного кода: парсеры, конвертеры, CRUD-каркасы
  • Частые шаги агентного пайплайна: форматирование tool calls, краткое резюме с передачей дальше, решения о маршрутизации
  • Высокообъёмную обработку с упором на vision — именно здесь ранние пользователи хвалят модель чаще всего
  • Любые задачи, где раньше использовали 3.1 Flash-Lite: тот же класс моделей теперь набирает на 16 баллов больше в SWE-Bench Pro

Оставляйте на 3.1 Pro ($2/$12):

  • Работу с длинными документами, где важна последовательность на десятках тысяч слов — по сообщениям сообщества, не по моему тесту
  • Агентные задачи, где нужно перестраивать план, если tool call вернул ошибку или неожиданный результат
  • Решения, где цена одного неверного ответа выше месячной разницы в стоимости моделей
  • Задачи с контекстом свыше 200k — с учётом удвоенного тарифа $4/$18

Лучше всего работает не выбор одной модели, а эскалация по условиям: по умолчанию направляйте задачи в Flash-Lite, а в Pro переводите при конкретных триггерах — схема не прошла валидацию после одного повтора, tool call вернул ошибку или неожиданный формат, входные данные вышли за комфортный размер контекста либо задача заранее помечена как высокорисковая. При измеренной разнице в цене 25x удержание доли эскалаций около 15% сокращает расходы примерно на 80% по сравнению с запуском всего на Pro: 0.85 + 0.15 × 25 = 4.6x от стоимости Lite против 25x.

Как вызывать обе модели

Flash-Lite доступна в статусе GA как gemini-3.5-flash-lite в Gemini API, Google AI Studio и приложении Gemini. 3.1 Pro по-прежнему находится в preview под именем gemini-3.1-pro-preview. Обе модели доступны и через OpenAI-совместимые relay-платформы: в каталоге моделей Google от AIReiter линейка Gemini перечислена вместе с провайдерами других моделей. Именно так я провёл это сравнение, не переключаясь между двумя SDK. Если будете повторять тест, логируйте число thinking tokens, которое endpoint сообщает для каждого вызова: usage.completion_tokens_details.reasoning_tokens в OpenAI-совместимых маршрутах и thoughtsTokenCount в нативном Gemini API. Именно в этом поле скрывается разница в 25x.

FAQ

Gemini 3.5 Flash-Lite лучше Gemini 3.1 Pro?

Нет. В моей точечной проверке из четырёх задач — генерация кода, извлечение, логика и ревью кода — она сравнялась с Pro по качеству, отвечала в 8 раз быстрее и стоила в 25 раз дешевле. Но Pro сохраняет преимущество в последовательности на длинном контексте, динамической перестройке плана и глубине рассуждений: 46 против 36 в индексе Artificial Analysis.

Что лучше: Gemini Flash или Flash-Lite?

Flash ($1.50/$9.00) — модель с рассуждением и более высокими результатами на агентных бенчмарках. Flash-Lite ($0.30/$2.50) поддерживает настраиваемые уровни thinking, но во всех 34 моих вызовах работала с нулём thinking tokens — отсюда ответы примерно за секунду. Для массового извлечения, классификации и vision-пайплайнов обычно выигрывает ценовое преимущество Flash-Lite в 5–6 раз; для многошаговых агентных рассуждений стоит платить за Flash.

Почему Gemini 3.5 Flash-Lite стала дороже?

Google повысила цену этого уровня относительно 3.1 Flash-Lite: $0.25/$1.50 → $0.30/$2.50, то есть вывод подорожал на 67%. Одновременно опубликованы большие улучшения способностей: SWE-Bench Pro вырос с 38.3% до 54.2%, Terminal-bench — с 31% до 54%. Вы платите больше за токен модели, которой требуется меньше попыток.

Существует ли Gemini 3.5 Pro?

Нет, на 23 июля 2026 года такой модели нет. В поколении 3.5 вышли уровни Flash-Lite, Flash и Live Translate, а также более новая 3.6 Flash. Последний релиз линейки Pro — всё ещё 3.1 Pro в статусе preview.

Читайте также