Обычно версия Pro оказывается сильнее. В этот раз всё иначе: Gemini 3.6 Flash стоит дешевле Gemini 3.1 Pro, генерирует ответы более чем вдвое быстрее и выигрывает почти во всех бенчмарках для программирования и агентных задач. У прежней 3.1 Pro остаётся одно преимущество — небольшой отрыв в самых трудных тестах на чистое рассуждение. Я прогнал обе модели через одинаковые задачи, а цены и характеристики ниже сверил с документацией Google и Artificial Analysis 23 июля 2026 года.
Коротко: какую модель выбрать
Gemini 3.6 Flash | Gemini 3.1 Pro | Победитель | |
|---|---|---|---|
Цена API (ввод/вывод за 1 млн, ≤200k) | $1.50 / $7.50 | $2.00 / $12.00 | Flash |
Длинные промпты (>200k токенов) | та же фиксированная цена | $4.00 / $18.00 | Flash |
Скорость вывода | 261 токен/с | 112 токенов/с | Flash |
Бенчмарки кода и агентов | выигрывает все 4 прямых сравнения | — | Flash |
Самое сложное рассуждение (GPQA, HLE) | — | впереди на 1.3–6.4 п. | 3.1 Pro |
Срез знаний | март 2026 года | январь 2025 года | Flash |
Статус релиза | общедоступна | Preview с февраля 2026 года | Flash |
Если нужен ответ без деталей: по умолчанию выбирайте Gemini 3.6 Flash, а к 3.1 Pro обращайтесь только там, где критичен максимальный уровень рассуждений. Можно и вовсе не читать дальше, а сразу сравнить Gemini 3.6 Flash и Gemini 3.1 Pro в браузерном чате на собственных промптах — API-ключ не нужен. Ниже — подтверждающие данные, включая воспроизводимый тест из трёх задач.
Насколько Flash дешевле
У Gemini 3.6 Flash единая цена независимо от длины промпта. Gemini 3.1 Pro дороже, а для длинных запросов у неё действует отдельный тариф. Стандартные тарифы API за 1 млн токенов, проверено 23 июля 2026 года:
Gemini 3.6 Flash | Gemini 3.1 Pro | |
|---|---|---|
Ввод (≤200k) | $1.50 | $2.00 |
Вывод (≤200k) | $7.50 | $12.00 |
Ввод (>200k) | $1.50 | $4.00 |
Вывод (>200k) | $7.50 | $18.00 |
Чтение кэша контекста (≤200k) | $0.15 | $0.20 |
Batch (ввод/вывод, ≤200k) | $0.75 / $3.75 | $1.00 / $6.00 |
Особенно заметна разница на выводе: при коротких промптах каждый выходной токен 3.1 Pro обходится на 60% дороже, а после порога в 200k токенов — вплоть до 140% дороже.
Скидки картину не меняют. В пакетном режиме тарифы обеих моделей уменьшаются вдвое, поэтому Pro и здесь на 60% дороже. *Хранение* кэша, которое оплачивается почасово помимо цены чтения за токен, у Pro стоит $4.50 за 1 млн токенов в час против $1.00 у Flash. В публичном прайс-листе Google нет ни одного режима — Standard, Batch, Priority или caching, — где Pro была бы более выгодным выбором.
Три одинаковые задачи для обеих моделей
Таблицы цен предполагают одинаковый расход токенов, поэтому 22 июля 2026 года я отправил обеим моделям через OpenRouter одни и те же три промпта. Использовались model ID google/gemini-3.6-flash и google/gemini-3.1-pro-preview, температура — 0, по одному запуску на задачу:
1. Код: написать на Python функцию merge_intervals с docstring и примером использования 2. Рассуждение: текстовая задача о сближении двух поездов, требующая алгебры времени и скорости 3. Извлечение данных: выделить задачи из неструктурированного сообщения команды в виде JSON-массива
Задача | Задержка Flash | Задержка Pro | Стоимость Flash | Стоимость Pro |
|---|---|---|---|---|
Код | 2.4s | 4.5s | $0.0085 | $0.0102 |
Рассуждение | 1.9s | 2.4s | $0.0082 | $0.0118 |
Извлечение данных | 1.3s | 2.6s | $0.0049 | $0.0057 |
Итого | 5.65s | 9.48s | $0.0215 | $0.0277 |
*Итоги рассчитаны по исходным логам в миллисекундах и токенах. Значения отдельных задач округлены, поэтому сумма в столбце может отличаться на одну сотую.*
Обе модели правильно справились со всеми тремя задачами: верно объединили интервалы, нашли нужное время сближения и выдали чистый JSON. Разница была в цене каждого ответа.
Flash сгенерировала *больше* токенов, чем Pro — 2,843 против 2,285 по метаданным использования OpenRouter; в основном это были внутренние токены рассуждений у обеих моделей. Но итог всё равно оказался в пользу Flash: она была на 22% дешевле и на 40% быстрее по полному времени выполнения. Более высокий тариф за вывод и более медленная генерация у Pro перевешивают её более краткие ответы. В агентных циклах, где задержка оплачивается на каждом шаге, разрыв только накапливается.

Три коротких промпта — это точечная проверка, а не полноценный бенчмарк, поэтому точные проценты стоит считать иллюстративными. Но направление совпадает с результатами более масштабных замеров — к ним и перейдём.
В коде и агентных задачах Flash выигрывает все сравнения
По публичным результатам прямых сравнений (Artificial Analysis) 3.6 Flash обходит более старую 3.1 Pro в программировании, ML-инженерии и работе с терминалом:
Бенчмарк | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
DeepSWE v1.1 | 12% | 49% |
MLE-Bench | 42.6% | 63.9% |
SWE-Bench Pro | 54.2% | 58.7% |
Terminal-Bench 2.1 | 73.8% | 78.0% |

Самый большой разрыв — в DeepSWE: 49% против 12%. Flash также немного опережает Pro в мультимодальном рассуждении — MMMU-Pro 83.2% против 82.4% — и выигрывает сводный Artificial Analysis Intelligence Index: 50 против 46.
По скорости картина та же. На 23 июля 2026 года Artificial Analysis измеряет 261 токен/с у Flash и 112 токенов/с у 3.1 Pro, то есть Flash быстрее в 2.3 раза. Время до первого токена на их стандартной нагрузке составляет 12.8s против 31.2s. Эти цифры включают время на размышление до начала ответа, поэтому мои короткие задачи выше завершились заметно быстрее. Если посмотреть на весь лидерборд, Flash оказывается почти в верхней части сразу по трём показателям:

Есть важный нюанс по длинному контексту. Обе модели принимают входы до 1 млн токенов, но на предельной длине Flash гораздо лучше *находит* нужные сведения: MRCR retrieval при 1 млн токенов — 54% против менее 27%. Pro, в свою очередь, чуть лучше *рассуждает* по длинному вводу — об этом далее.
В чём Gemini 3.1 Pro всё ещё сильнее
Стоит отдать флагману должное: 3.1 Pro лидирует в трёх бенчмарках, и все они проверяют сложные знания и рассуждения.
Бенчмарк | Gemini 3.1 Pro | Gemini 3.6 Flash |
|---|---|---|
GPQA Diamond (научные вопросы уровня PhD) | 94.1% | 92.8% |
Humanity's Last Exam (без инструментов) | 44.7% | 38.3% |
AA-LCR (рассуждение по длинному контексту) | 72.7% | 69.7% |
В GPQA и рассуждениях по длинному контексту отрыв невелик, в Humanity's Last Exam — заметнее. Google позиционирует 3.1 Pro именно для таких сценариев: «сложных задач, требующих широких знаний о мире и продвинутого мультимодального рассуждения». Если ваша нагрузка действительно находится на этом уровне — например, научные вопросы исследовательской сложности или многошаговый анализ длинного документа, — запас возможностей у Pro реален и может оправдать доплату.
Но на практике есть два важных ограничения:
Менее свежие знания. Срез знаний Pro — январь 2025 года, то есть на четырнадцать месяцев старше, чем март 2026 года у Flash. Флагманская модель хуже осведомлена о текущих событиях, чем более доступная.
Статус Preview. Через пять месяцев после февральского запуска 2026 года 3.1 Pro всё ещё отмечена как Preview на странице тарифов Google; это видно и по model ID
gemini-3.1-pro-preview. Flash при этом поставляется как актуальная стабильная модель по умолчанию.
Какую модель использовать
Выбирайте Gemini 3.6 Flash для агентов-программистов, автоматизации работы в терминале и за компьютером, ML-инженерии, массового извлечения данных или классификации, чувствительных к задержке приложений и поиска по длинным документам. Согласно опубликованным результатам, для всех этих задач она дешевле, быстрее, свежее и набирает больше баллов.
Выбирайте Gemini 3.1 Pro, если задача требует рассуждений на пределе возможностей — например, научных вопросов уровня PhD или многошагового анализа длинных входов — и несколько баллов в бенчмарках важнее цены, скорости и свежести знаний. Также учитывайте нестабильность моделей на стадии Preview: model ID превью-версий могут переименовать или вывести из эксплуатации после выпуска стабильной версии.
Это сравнение не ответит за вас на два вопроса: насколько модели надёжны в ваших конкретных паттернах вызова инструментов и каково качество ответов на пограничных случаях именно в вашей предметной области.
Обе модели доступны через один Gemini API, поэтому самый недорогой способ принять решение — прогнать через каждую ваши десять наиболее важных промптов. Мой скрипт из трёх задач выполнился примерно за минуту.
Где доступны обе модели
Обе модели есть в Gemini API и Google AI Studio под model ID gemini-3.6-flash и gemini-3.1-pro-preview. Бесплатного тарифа AI Studio достаточно, чтобы протестировать их рядом друг с другом до принятия решения.
Если вы уже используете агрегатор, то OpenRouter и AIReiter предоставляют доступ к обеим моделям по прайс-листу Google через один ключ. Именно так я провёл приведённый выше A/B-тест.
FAQ
Gemini 3.6 Flash лучше, чем 3.1 Pro?
Для большинства рабочих сценариев — да. Она выигрывает в бенчмарках кода, агентных задач, ML, computer use и мультимодальности, при этом стоит меньше и работает в 2.3 раза быстрее. 3.1 Pro сохраняет лидерство только в GPQA Diamond, Humanity's Last Exam и рассуждении по длинному контексту — с преимуществом от 1.3 до 6.4 пункта.
Gemini 3.6 Flash дешевле, чем 3.1 Pro?
Да, во всех режимах. Стандартный вывод через API стоит $7.50 против $12.00 за 1 млн токенов, а после промптов длиннее 200k токенов разрыв увеличивается до $7.50 против $18.00. В Batch сохраняется та же 60%-ная надбавка у Pro. Хранение кэша у Pro дороже в 4.5 раза.
Что быстрее: Gemini 3.6 Flash или 3.1 Pro?
Flash генерирует около 261 токена/с против 112 у 3.1 Pro по данным Artificial Analysis на 23 июля 2026 года. Она и начинает отвечать раньше: 12.8s против 31.2s до первого токена на нагрузках с интенсивным рассуждением. В моём тесте из трёх задач это вылилось в ускорение полного выполнения на 40%.
Есть ли смысл всё ещё использовать Gemini 3.1 Pro?
Только если вам нужен её максимальный уровень рассуждений и вы готовы работать с моделью в статусе Preview, у которой срез знаний ограничен январём 2025 года. Для менее сложных задач опубликованные результаты не показывают, что доплата даёт более качественный результат по сравнению с Flash.
