Gemini 3.5 Flash против Gemini 3.1 Pro: полное сравнение

Последнее обновление: 2026-07-15 02:24:21

Gemini 3.5 Flash генерирует в 2,6 раза больше выходных токенов в секунду, чем Gemini 3.1 Pro, стоит на 25% меньше за токен и немного опережает Pro по Artificial Analysis's Intelligence Index (50 против 46). Gemini 3.1 Pro по-прежнему лидирует на 5 пунктов в ARC-AGI-2 (77,1% против 72,1%), а показатель Flash по извлечению в длинном контексте падает с 84,9% до 77,3%, когда вы выходите за предел 128k токенов. Какую модель использовать, зависит от задачи: Flash оптимизирована для пропускной способности и задержки вызова инструментов, Pro — для глубины многошагового рассуждения, а агрегированные бенчмарки сводят эти два приоритета к одному баллу, скрывая, какой из них на самом деле нужен вашей нагрузке.

Таблица результатов бенчмарков: где на самом деле лидирует каждая модель

Gemini 3.5 Flash vs Gemini 3.1 Pro benchmark comparison chart
МетрикаGemini 3.5 FlashGemini 3.1 ProПобедитель
Индекс интеллекта (Artificial Analysis)5046Flash
ARC-AGI-2, абстрактное мышление (BenchLM)72.1%77.1%Pro
MRCR v2 при контексте 128k (nxcode)77.3% (снижение с 84.9% при более коротком контексте)публично не сообщалось для той же длиныНедостаточно данных
Средний балл по мультимодальности (BenchLM)83.882.6Flash
Скорость вывода (BenchLM)284.2 tok/s109 tok/sFlash (2.6x)
GDPval-AA Elo, реальные задачи агента (apiyi)16561314Flash

Flash выигрывает по метрикам, которые измеряют пропускную способность и обработку общих задач. У Pro есть явное, документированное преимущество по глубине рассуждений в ARC-AGI-2; в задачах извлечения из длинного контекста у Flash есть документированная деградация после 128k токенов, но сопоставимый показатель у Pro публично недоступен, так что это лучше считать неубедительным результатом, а не победой Pro. Такое разделение напрямую зависит от того, какой именно тип задачи вы выполняете, и это полезнее, чем единое итоговое число Intelligence Index.

Оговорка по методологии из собственного сравнения BenchLM: из примерно 34 бенчмарков, по которым у обеих моделей опубликованы результаты, только 3 категории можно напрямую сравнивать — у Pro эксклюзивные результаты на 14 бенчмарках, у Flash — на 17, и настройки thinking-budget не всегда совпадают между ними. Рассматривайте таблицу выше как ориентировочно надежную; разрывы по ARC-AGI-2 и MRCR v2 достаточно велики, чтобы им можно было доверять, но разницу в 1-2 пункта по общей метрике не следует считать решающей.

Где преимущество Flash начинает разрушаться

Разрыв ARC-AGI-2 (5 баллов) — это наибольшая разница по одной категории, которую сравнение BenchLM обнаружило между двумя моделями. ARC-AGI-2 специально создан, чтобы противостоять обходным путям на основе сопоставления шаблонов, поэтому разрыв в 5 баллов здесь — более сильный сигнал о глубине рассуждений, чем такой же разрыв на более обычном бенчмарке. Результат nxcode для MRCR v2 добавляет вторую точку данных в том же направлении: собственная точность извлечения Flash падает с 84,9% до 77,3% по мере роста контекста примерно до 128k токенов. Результат Pro на той же длине публично не опубликован, так что это не задокументированное прямое поражение Pro — но это задокументированная регрессия для Flash, которую таблица бенчмарков Pro не показывает.

Анекдотическая заметка, а не доказательство из бенчмарков: тред Reddit r/GeminiAI, в котором пользователей спрашивали, какую модель они предпочитают для сложных задач, привёл к тому, что комментаторы описывали Flash как превосходящий Pro «во всём, кроме длинного контекста, абстрактного [рассуждения]». Это лишь несколько мнений, а не данные — но, что примечательно, это описывает те же два исключения, которые показывают бенчмарки, и потому служит скорее немного полезной проверкой на здравый смысл, чем доказательством чего-либо само по себе.

Цены и кэширование: реальная картина затрат

Базовое ценообразование уменьшает ценовое преимущество сильнее, чем это кажется на первый взгляд:

  • Gemini 3.5 Flash: $1.50 / million input tokens, $9 / million output tokens
  • Gemini 3.1 Pro: $2 / million input tokens, $12 / million output tokens

На бумаге это скидка 25%, а не разрыв в 4–8 раз, который Flash ранее имел по сравнению со старыми моделями Pro. Более важный рычаг — кэширование:

  • Записи во Flash cache бесплатны; кэшированный ввод стоит $0.15/миллион токенов
  • Записи в Pro cache стоят $0.38/миллион токенов; кэшированный ввод стоит $0.50/миллион токенов — более чем в 3 раза выше, чем ставка Flash для кэшированного ввода

Для любого рабочего процесса, который повторно отправляет один и тот же системный prompt или контекст документа в нескольких ходах — chat agents, coding assistants с постоянным контекстом codebase, multi-turn support bots — этот пробел в кэшировании быстро накапливается. Один запрос почти не показывает разницу; сессия агента на тысячу ходов показывает.

Разрыв также не является постоянным. разбивка цен apiyi отмечает, что примерно после 200 тыс. токенов контекста разница в цене между двумя моделями сокращается до 25–50%, поскольку на таком масштабе экономическая эффективность обеих моделей в расчёте на токен сходится. Если ваша нагрузка в основном состоит из очень длинных однократных документов, а не из коротких повторяющихся запросов, ценовой аргумент в пользу Flash становится слабее.

Конкретный пример: рабочий процесс support-bot, который отправляет 1M кэшированных входных токенов и генерирует 500K выходных токенов в день. На Flash это $0 за запись в кэш плюс $0.15 x 1 (кэшированный вход) + $9 x 0.5 (выход) = $4.65/день. На Pro та же нагрузка стоит $0.38 (запись в кэш, однократно) + $0.50 x 1 (кэшированный вход) + $12 x 0.5 (выход) = примерно $6.88/день в первый день, а затем снижается до $6.50/день после первой записи. За месяц это разница примерно между $140 и $195 — не считая более глубокого reasoning у Pro для любого запроса, где он действительно нужен.

Циклы агентов: почему Flash выигрывает по скорости, но не всегда по надежности

бенчмарк agent-loop от nxcode запускал 8-шаговый цикл агента и показал, что Flash завершает всю последовательность примерно за 25 секунд против 100 секунд у Pro — разница в 4 раза, которая увеличивается с каждым дополнительным шагом. На GDPval-AA, бенчмарке, построенном вокруг реальных задач агентной работы с знаниями, Elo-оценка Flash (1656) превосходит показатель Pro (1314) на 342 балла, что является самым большим разрывом во всей таблице бенчмарков.

Оговорка: это преимущество в скорости и баллах предполагает, что цикл агента выполняется без сбоев. Те же разрывы в ARC-AGI-2 и MRCR v2, которые проявляются в задачах на рассуждение и длинный контекст, дают разумные основания ожидать, что Flash также менее снисходителен, когда вызов инструмента возвращает что-то неожиданное в середине цикла и агенту приходится перепланировать — это вывод из приведённых выше данных о глубине рассуждений, а не отдельно проверенное утверждение. Если ваш агент работает под наблюдением, а человек проверяет результат между шагами, скорость Flash почти что бесплатная победа. Если он работает без наблюдения много шагов подряд, без участия человека в цикле, запас по рассуждению у Pro — более безопасная ставка, пока кто-нибудь не опубликует данные по частоте сбоев для обоих.

Какой из них следует использовать: матрица принятия решений по задачам

Тип задачиРекомендуемая модельПочему
Повседневное программирование (тесты, ревью PR, перевод между языками)FlashСкорость и стоимость дают преимущество, глубина рассуждений не является узким местом
Глубокие рефакторинги, проектирование новых алгоритмовProРазрыв ARC-AGI-2 проявляется напрямую в многошаговом логическом рассуждении
Извлечение из длинных документов (контракты, исследовательские корпуса свыше 128k tokens)ProУ Flash на такой длине задокументирован регресс MRCR v2; у Pro он не опубликован, но более безопасный выбор — модель без известного слабого места
Высокообъемная пакетная генерацияFlashБесплатные записи в cache и пропускная способность в 2.6x наиболее важны на масштабе
Супервизируемые agent workflows с человеком, проверяющим outputFlashПреимущество в скорости без риска ненадежности при отсутствии контроля
Несупервизируемые, критически важные agent chainsProЗапас по глубине рассуждений — более безопасная ставка, когда человек не ловит ошибки в середине цикла
Частые многоходовые вызовы с повторным использованием одного и того же contextFlashЦена за cached-input примерно в треть от цены Pro

Простое правило по умолчанию покрывает большую часть матрицы выше: отправляйте запросы в Flash, если не выполняется одно из трех условий — контекст превышает 128k токенов и важна точность retrieval, задача связана с абстрактным/многошаговым reasoning (новые алгоритмы, юридический или исследовательский synthesis), либо агент работает unsupervised больше чем несколько шагов. Любое из этих трех условий склоняет выбор в сторону Pro; если ни одно из них не выполняется, скорость Flash и цены на cache делают его более дешевым вариантом по умолчанию.

Часто задаваемые вопросы

Gemini 3.5 Flash лучше, чем 3.1 Pro?

По скорости, стоимости и общим бенчмаркам — да. В абстрактном рассуждении (ARC-AGI-2) Gemini 3.1 Pro по-прежнему лидирует на 5 пунктов. В извлечении информации из длинного контекста свыше 128k токенов у Flash задокументирована регрессия, а сопоставимый результат Pro не опубликован, поэтому это сравнение следует считать нерешённым, а не подтверждённой победой Pro. Что именно «лучше» зависит от того, к какой из этих категорий относится ваша задача.

Насколько Gemini 3.5 Flash дешевле, чем 3.1 Pro?

Примерно на 25% дешевле по базовой стоимости ввода/вывода ($1.50/$9 против $2/$12 за миллион токенов). Более заметная экономия проявляется в кэшировании: запись в кэш у Flash бесплатна, а цена кэшированного ввода примерно в три раза ниже, чем у Pro, что особенно важно для многоходовых или высоконагруженных сценариев.

Подходит ли Gemini 3.5 Flash для программирования?

Да, для повседневной работы — генерации тестов, проверки PR, перевода кода между языками. Для глубоких рефакторингов или разработки новых алгоритмов преимущество Pro в бенчмарках на абстрактное мышление обычно проявляется в качестве результата.

Хорошо ли Gemini 3.5 Flash обрабатывает длинный контекст?

При более коротких контекстах — да: точность извлечения MRCR v2 составляет 84,9%. После 128k токенов она снижается до 77,3%, что является существенным разрывом для задач вроде многодокументного анализа контрактов. Оценка Gemini 3.1 Pro на той же длине пока не опубликована, поэтому рассматривайте это как известное ограничение Flash, а не как подтверждённое преимущество Pro.

Итог

Gemini 3.5 Flash — более удачный вариант по умолчанию для большинства повседневных задач и работы с большим объёмом — он быстрее, дешевле по кэшу и достаточно близок по общим бенчмаркам, так что компромисс редко имеет значение. Gemini 3.1 Pro оправдывает более высокую стоимость в абстрактном мышлении и в неуправляемых цепочках агентов; в длинных документах свыше 128k токенов собственные цифры Flash показывают слабое место, которое данные Pro не подтверждают и не опровергают, поэтому перед окончательным выбором стоит проверить этот случай самостоятельно.

Это сравнение основано на публичных данных бенчмарков (Artificial Analysis, BenchLM, nxcode и apiyi), а не на собственном тестировании API. Gemini 3.1 Pro был запущен с акцентом на рассуждения, отличающимся от ориентации Flash на скорость. На момент написания Gemini 3.5 Pro ещё не выпущен — сообщения указывают на релиз в июле 2026 года — поэтому воспринимайте это как снимок текущего состояния: и обеим моделям, и этому сравнению потребуется пересмотр, когда выйдет следующая версия Pro.

Связанное чтение