Может ли самая доступная модель Google поколения 3.5 заменить Pro, которая стоит в 6,7 раза дороже по входным токенам? 23 июля 2026 года я отправил четыре одинаковых запроса в gemini-3.5-flash-lite и gemini-3.1-pro-preview. По корректности получилась ничья, зато стоимость различалась в 25 раз. И единственная ошибка Flash-Lite — именно тот тип сбоя, который способен сломать production-пайплайн. Если выбираете между Pro и средней моделью Flash, смотрите отдельное сравнение: Gemini 3.5 Flash vs Gemini 3.1 Pro.
Четыре одинаковых задачи: результаты без скидок
Запросы были идентичными, маршрут API — один и тот же, OpenAI-совместимый. Каждый ответ оценивался программно: для задачи с кодом было 8 локальных тестов, для извлечения данных — строгая схема.
| Задача | Flash-Lite | 3.1 Pro | Победитель |
|---|---|---|---|
| Python-парсер длительностей ISO-8601 (8 тестов) | 8/8, 3,7 с | 8/8, 38,2 с | Ничья по корректности |
| Строгое извлечение JSON из неаккуратного письма | Поля верны, но JSON обёрнут в markdown-блок, 1,0 с | Корректный JSON без обёртки, 9,8 с | Pro |
| Ловушка в логике процентов (ответ: 50) | Верно, 1,8 с | Верно, 10,6 с | Ничья |
| Ревью кода с 3 намеренно добавленными ошибками | Нашла 2 из 3 и ещё одну ошибку, которой не было в задании, 3,7 с | Нашла 2 из 3 и ещё одну ошибку, которой не было в задании, 30,2 с | Ничья |
Обе модели написали полностью рабочий парсер длительностей. В ревью кода обе заметили SQL-инъекцию, кэш из-за изменяемого аргумента по умолчанию и неэффективную фильтрацию. И обе пропустили одну и ту же специально заложенную ошибку с часовым поясом naive-datetime. На этих четырёх типовых задачах разницы в точности не было.
Но есть две оговорки. Это точечная проверка и описанный ниже прогон из 30 вызовов, а не полноценный бенчмарк. Кроме того, один вызов Pro выдал необоснованный отказ на безобидный запрос о ревью кода — пришлось повторить запрос. Возможно, шум внёс relay-сервис, а не сама модель, но бюджет на повторы закладывать стоит в любом случае.
Где Flash-Lite начинает ошибаться
Сбой на соблюдении формата
В запросе на извлечение было прямое требование: «Верни ТОЛЬКО объект JSON». Pro выдала чистый JSON. Flash-Lite вернула правильные данные, но завернула их в блок ``json fences, из-за чего вызов json.loads()` в следующем шаге падает, пока не добавите очистку ответа.
Один такой случай мог оказаться шумом, поэтому я измерил частоту: по 30 запросов на извлечение к каждой модели, на 10 разных письмах в поддержку. Результаты программно проверялись на чистый JSON без обёртки и соответствие схеме. Flash-Lite прошла 29 из 30 проверок (96,7%): ровно один ответ оказался в markdown-блоке. У 3.1 Pro — 30 из 30. В единственном сбое Flash-Lite проблема была не в содержимом: поля извлечены верно, неправильной оказалась только упаковка ответа.
Именно для таких задач Google и позиционирует эту модель: на официальной странице Flash-Lite она названа «best for low-latency and high throughput agentic tasks». Частота сбоев 3,3% выглядит терпимо, пока не учесть накопительный эффект: в агентном цикле с 20 вызовами модели хотя бы один некорректный ответ появится примерно в половине запусков (1 − 0.967²⁰ ≈ 0.49). Если отправляете структурированный вывод в Flash-Lite, поставьте валидатор и один повтор: при 3,3% ошибок один retry снижает остаточный риск примерно до 0,1% на вызов. В моих прогонах все сбои касались упаковки, а не данных.
В чём Pro всё ещё сильнее
Все четыре задачи выше лежат в комфортной зоне Flash-Lite: короткий контекст, чёткая спецификация, один запрос — один ответ. Отчёты сообщества за неделю после релиза довольно последовательно очерчивают границу. Пользователи r/GeminiAI, работающие с длинными документами, сообщают, что Pro лучше удерживает последовательность персонажей и сюжета, тогда как младшие Gemini начинают дрейфовать. Независимый индекс указывает в ту же сторону: Artificial Analysis ставит 3.1 Pro 46 баллов в Intelligence Index против 36 у Flash-Lite; основной разрыв приходится на оценки многошагового рассуждения, а не на кодинг или извлечение. В том же рейтинге Flash-Lite занимает второе место по скорости генерации среди 152 отслеживаемых моделей, но лишь 13-е по интеллектуальному индексу. Это профиль узкого специалиста, а не универсальной замены.
Более сложная задача в моём тесте тоже обозначила потолок: ошибку с часовым поясом не заметила ни одна из моделей. То, что Flash-Lite сравнялась с Pro, не делает её Pro. Это лишь показывает, что у обеих есть слепые зоны — и за немного более глубокие возможности Pro вы платите в 25 раз больше, принимая риск на себя.
Практическая граница такая: Pro по-прежнему оправдана для задач, где модель должна перестраивать план по ходу работы, сохранять связность текста объёмом более 50k слов или принимать решения с дорогой ценой ошибки. Всё, что укладывается в шаблонный сценарий, — нет.
Фактическая стоимость: не 4,8x, а 25x
По прайс-листу вывод Pro стоит в 4,8 раза дороже Flash-Lite: $12 против $2.50 за миллион токенов. В моих четырёх задачах реальный расход составил примерно $0.005 для Flash-Lite и $0.13 для Pro — разница в 25 раз. Lite суммарно тарифицировала около 570 входных и 2 020 выходных токенов, Pro — 1 700 входных и 10 386 выходных, по каталожным ценам.
Причина — thinking tokens. Gemini 3.1 Pro рассуждает перед ответом, а Google тарифицирует эти рассуждения как выходные токены. На задаче с парсером Pro выдала 5 125 выходных токенов, из которых 4 811, или 94%, пришлись на thinking. Flash-Lite ответила на тот же запрос ровно за 819 токенов. По всем четырём задачам thinking составил 84% от всего, что Pro выставила мне к оплате.
Прогон из 30 запросов на извлечение только увеличил разрыв: короткие ответы максимально повышают долю thinking overhead. Flash-Lite выполнила все 30 вызовов за 1 899 выходных токенов и примерно $0.006 суммарно. Pro выставила 29 468 выходных токенов, из них 27 636, или 94%, — thinking, на сумму около $0.38: разрыв в 65 раз на этой нагрузке. В масштабе миллиона запросов на извлечение в месяц это разница между статьёй расходов в $190 и $12,500.
Это не особенность моей небольшой выборки. Команда бенчмарка для программирования Tessl запустила примерно 3 300 задач для coding-агентов и обнаружила, что Gemini 3.1 Pro в итоге оказалась *дешевле* ориентированной на рассуждения Gemini 3.5 Flash, несмотря на более высокие цены в прайсе. Механизм тот же, только направление обратное. Показатели cost-to-run-index от Artificial Analysis демонстрируют такую же инверсию. Вывод простой: сравнивайте модели по измеренной стоимости успешно выполненной задачи, а не по цене токена в таблице.
Характеристики и цены на 23 июля 2026 года
Данные взяты с официальной страницы цен Gemini API:
| Gemini 3.5 Flash-Lite | Gemini 3.1 Pro (≤200k ctx) | |
|---|---|---|
| Ввод / 1 млн токенов | $0.30 | $2.00 ($4.00 свыше 200k) |
| Вывод / 1 млн токенов (включая thinking) | $2.50 | $12.00 ($18.00 свыше 200k) |
| Batch-тариф | $0.15 / $1.25 | $1.00 / $6.00 |
| Кэширование контекста | $0.03 | $0.20 |
| Контекстное окно | 1M вход / 64k выход | 1M вход / 32k выход |
| Скорость вывода (Artificial Analysis) | 426.8 ток/с | 112.2 ток/с |
| Статус | GA, gemini-3.5-flash-lite | Preview, gemini-3.1-pro-preview |
Стоит отметить два момента. Flash-Lite стала *дороже* предшественницы: 3.1 Flash-Lite стоила $0.25/$1.50, так что цена выхода выросла на 67%. Google объясняет это приростом возможностей: опубликованные на странице модели DeepMind показатели говорят, что 3.5 Flash-Lite выросла с 38.3% до 54.2% на SWE-Bench Pro и с 31% до 54% на Terminal-bench 2.1 относительно 3.1 Flash-Lite. Также обратите внимание на асимметрию лимитов вывода: Flash-Lite допускает 64k выходных токенов, вдвое больше 32k у Pro. Поэтому для очень длинных одиночных генераций, как ни странно, подходит именно дешёвая модель.
Что говорят первые пользователи
На момент проверки модели всего два дня, поэтому обсуждений пока немного. Первые production-отзывы в X делятся на три группы:
- Недовольство ценой: «Why is 3.5 flash lite 50% more expensive. It is so sneaky», — написал @samarthg1911 23 июля. Повышение цены — самая частая претензия.
- Успехи в пайплайнах: ML-инженер @mrdbourke сообщил, что модель «очень быстрая и отлично работает со зрением», а в некоторых их пайплайнах она заменила Gemini 3.5 Flash, модель с ценой выхода в 3,6 раза выше. Другая команда, работающая с контентными инструментами, назвала её «существенным шагом вперёд» относительно 3.1 Flash-Lite в разборе интернет-сленга.
- Сообщения о регрессе: внутренние оценки одного инженера привели к противоположному выводу: «3.5 flash lite is a real downgrade», и команда осталась на 3.1 Flash-Lite.
Противоречивые ранние отзывы обычно означают, что сильные стороны модели зависят от конкретной нагрузки. Мои данные говорят о том же: в своей нише она превосходна, но на границах может незаметно допускать небрежности.
Какую модель выбрать для каждой задачи
Выбор между Gemini 3.5 Flash-Lite и Gemini 3.1 Pro — не вопрос «одна вместо другой». По результатам измерений и сообщениям сообщества я бы настроил маршрутизацию так:
Отправляйте в Flash-Lite ($0.30/$2.50):
- Структурированное извлечение, классификацию и тегирование — с JSON-валидатором и одним повтором
- Генерацию шаблонного кода: парсеры, конвертеры, CRUD-каркасы
- Частые шаги агентного пайплайна: форматирование tool calls, краткое резюме с передачей дальше, решения о маршрутизации
- Высокообъёмную обработку с упором на vision — именно здесь ранние пользователи хвалят модель чаще всего
- Любые задачи, где раньше использовали 3.1 Flash-Lite: тот же класс моделей теперь набирает на 16 баллов больше в SWE-Bench Pro
Оставляйте на 3.1 Pro ($2/$12):
- Работу с длинными документами, где важна последовательность на десятках тысяч слов — по сообщениям сообщества, не по моему тесту
- Агентные задачи, где нужно перестраивать план, если tool call вернул ошибку или неожиданный результат
- Решения, где цена одного неверного ответа выше месячной разницы в стоимости моделей
- Задачи с контекстом свыше 200k — с учётом удвоенного тарифа $4/$18
Лучше всего работает не выбор одной модели, а эскалация по условиям: по умолчанию направляйте задачи в Flash-Lite, а в Pro переводите при конкретных триггерах — схема не прошла валидацию после одного повтора, tool call вернул ошибку или неожиданный формат, входные данные вышли за комфортный размер контекста либо задача заранее помечена как высокорисковая. При измеренной разнице в цене 25x удержание доли эскалаций около 15% сокращает расходы примерно на 80% по сравнению с запуском всего на Pro: 0.85 + 0.15 × 25 = 4.6x от стоимости Lite против 25x.
Как вызывать обе модели
Flash-Lite доступна в статусе GA как gemini-3.5-flash-lite в Gemini API, Google AI Studio и приложении Gemini. 3.1 Pro по-прежнему находится в preview под именем gemini-3.1-pro-preview. Обе модели доступны и через OpenAI-совместимые relay-платформы: в каталоге моделей Google от AIReiter линейка Gemini перечислена вместе с провайдерами других моделей. Именно так я провёл это сравнение, не переключаясь между двумя SDK. Если будете повторять тест, логируйте число thinking tokens, которое endpoint сообщает для каждого вызова: usage.completion_tokens_details.reasoning_tokens в OpenAI-совместимых маршрутах и thoughtsTokenCount в нативном Gemini API. Именно в этом поле скрывается разница в 25x.
FAQ
Gemini 3.5 Flash-Lite лучше Gemini 3.1 Pro?
Нет. В моей точечной проверке из четырёх задач — генерация кода, извлечение, логика и ревью кода — она сравнялась с Pro по качеству, отвечала в 8 раз быстрее и стоила в 25 раз дешевле. Но Pro сохраняет преимущество в последовательности на длинном контексте, динамической перестройке плана и глубине рассуждений: 46 против 36 в индексе Artificial Analysis.
Что лучше: Gemini Flash или Flash-Lite?
Flash ($1.50/$9.00) — модель с рассуждением и более высокими результатами на агентных бенчмарках. Flash-Lite ($0.30/$2.50) поддерживает настраиваемые уровни thinking, но во всех 34 моих вызовах работала с нулём thinking tokens — отсюда ответы примерно за секунду. Для массового извлечения, классификации и vision-пайплайнов обычно выигрывает ценовое преимущество Flash-Lite в 5–6 раз; для многошаговых агентных рассуждений стоит платить за Flash.
Почему Gemini 3.5 Flash-Lite стала дороже?
Google повысила цену этого уровня относительно 3.1 Flash-Lite: $0.25/$1.50 → $0.30/$2.50, то есть вывод подорожал на 67%. Одновременно опубликованы большие улучшения способностей: SWE-Bench Pro вырос с 38.3% до 54.2%, Terminal-bench — с 31% до 54%. Вы платите больше за токен модели, которой требуется меньше попыток.
Существует ли Gemini 3.5 Pro?
Нет, на 23 июля 2026 года такой модели нет. В поколении 3.5 вышли уровни Flash-Lite, Flash и Live Translate, а также более новая 3.6 Flash. Последний релиз линейки Pro — всё ещё 3.1 Pro в статусе preview.
