AIREITER

Gemini 3.5 Flash vs Gemini 3.1 Pro: подробное сравнение

Последнее обновление: 2026-07-29 12:13:48

Gemini 3.5 Flash выдаёт в 2,6 раза больше выходных токенов в секунду, чем Gemini 3.1 Pro, стоит на 25% дешевле за токен и немного опережает Pro в Intelligence Index от Artificial Analysis: 50 против 46. Но у Gemini 3.1 Pro остаётся преимущество в 5 пунктов на ARC-AGI-2 — 77,1% против 72,1%, — а точность Flash при извлечении данных из длинного контекста падает с 84,9% до 77,3% после 128k токенов. Поэтому выбирать модель стоит не по одному сводному баллу: Flash рассчитан на высокую пропускную способность и быстрые вызовы инструментов, а Pro — на глубокое многошаговое рассуждение.

Бенчмарки: в чём сильна каждая модель

Сравнительная диаграмма бенчмарков Gemini 3.5 Flash и Gemini 3.1 Pro
МетрикаGemini 3.5 FlashGemini 3.1 ProПобедитель
Intelligence Index (Artificial Analysis)5046Flash
ARC-AGI-2, абстрактное рассуждение (BenchLM)72,1%77,1%Pro
MRCR v2 при контексте 128k (nxcode)77,3% (снижение с 84,9% на более коротком контексте)публично не раскрывался для той же длиныНедостаточно данных
Средний мультимодальный балл (BenchLM)83,882,6Flash
Скорость генерации (BenchLM)284,2 токена/с109 токенов/сFlash (2,6x)
GDPval-AA Elo, реальные агентные задачи (apiyi)16561314Flash

Flash лидирует в метриках пропускной способности и универсальных прикладных задач. У Pro есть явное, подтверждённое преимущество на ARC-AGI-2, где измеряется глубина рассуждения. В длинном контексте у Flash зафиксировано ухудшение результата после 128k токенов, но сопоставимый показатель Pro не опубликован. Называть это победой Pro было бы преждевременно: корректнее считать результат неопределённым. Однако само разделение хорошо показывает, для каких сценариев предназначена каждая модель, — и это полезнее единого значения Intelligence Index.

Важно учитывать методологическую оговорку из сравнения BenchLM. Из примерно 34 бенчмарков, где опубликованы результаты обеих моделей, напрямую сопоставимы лишь 3 категории: у Pro есть эксклюзивные результаты по 14 бенчмаркам, у Flash — по 17, а настройки thinking budget не всегда совпадают. Таблицу выше можно считать надёжной для оценки общего направления. Разрывы на ARC-AGI-2 и MRCR v2 достаточно велики, чтобы им доверять, но преимущество в 1–2 пункта на общей метрике не стоит воспринимать как решающее.

Где преимущество Flash заканчивается

Разница в 5 пунктов на ARC-AGI-2 — самое крупное расхождение между моделями в отдельной категории, которое обнаружило сравнение BenchLM. ARC-AGI-2 специально устроен так, чтобы не давать выигрывать за счёт поверхностного распознавания паттернов. Поэтому отрыв в 5 пунктов здесь лучше говорит о глубине рассуждения, чем аналогичная разница в более традиционном тесте. Результат MRCR v2 от nxcode указывает в ту же сторону: точность извлечения данных у Flash падает с 84,9% до 77,3%, когда объём контекста приближается к 128k токенов. Показатель Pro на той же длине контекста публично не раскрыт, так что это не документально подтверждённое проигрыш Flash модели Pro. Но это задокументированная слабость Flash, которой в таблице результатов Pro не видно.

Наблюдение из пользовательского опыта, а не бенчмарк: в ветке Reddit r/GeminiAI пользователи, обсуждая предпочтительную модель для сложных задач, описывали Flash как модель, которая превосходит Pro «во всём, кроме длинного контекста и абстрактного [рассуждения]». Это лишь несколько мнений, а не данные. Но они совпадают с двумя исключениями, которые видны в бенчмарках, — полезная проверка здравого смысла, но не самостоятельное доказательство.

Цена и кэширование: из чего складывается реальная стоимость

По базовому прайсу преимущество Flash не так велико, как может показаться:

  • Gemini 3.5 Flash: $1.50 за миллион входных токенов, $9 за миллион выходных токенов
  • Gemini 3.1 Pro: $2 за миллион входных токенов, $12 за миллион выходных токенов

На бумаге скидка составляет 25%, а не прежние 4–8x, которыми Flash превосходил старые Pro-модели. Ключевая разница — в кэшировании:

  • Запись в кэш Flash бесплатна; кэшированный вход стоит $0.15 за миллион токенов
  • Запись в кэш Pro стоит $0.38 за миллион токенов; кэшированный вход — $0.50 за миллион токенов, то есть более чем в 3 раза дороже Flash

В сценариях, где один и тот же системный промпт или документный контекст передаётся в нескольких ходах, разница быстро накапливается. Это относится к чат-агентам, coding-ассистентам с постоянным контекстом кодовой базы и многошаговым ботам поддержки. В одном запросе разница почти незаметна, в агентной сессии на тысячу ходов — уже нет.

При этом отрыв не остаётся постоянным. В разборе цен apiyi отмечается, что после примерно 200k токенов контекста разница в стоимости между моделями сжимается до 25–50%, поскольку экономика токенов у обеих моделей на таком масштабе сближается. Если ваша нагрузка — это в основном одиночные запросы к очень длинным документам, а не короткие повторяющиеся вызовы, ценовой аргумент в пользу Flash становится слабее.

Конкретный пример: бот поддержки ежедневно отправляет 1M кэшированных входных токенов и генерирует 500K выходных. Для Flash это $0 за запись в кэш плюс $0.15 x 1 за кэшированный ввод и $9 x 0.5 за вывод, итого $4.65 в день. Для Pro та же нагрузка стоит $0.38 за однократную запись в кэш, плюс $0.50 x 1 за кэшированный ввод и $12 x 0.5 за вывод: примерно $6.88 в первый день, а после первой записи — $6.50 в день. За месяц это около $140 против $195 — без учёта более глубокого рассуждения Pro в тех запросах, где оно действительно нужно.

Агентные циклы: Flash быстрее, но не всегда надёжнее

В бенчмарке агентных циклов nxcode модели выполняли цикл из 8 шагов. Flash завершил всю последовательность примерно за 25 секунд, Pro — за 100 секунд: разница в 4 раза, которая растёт с каждым дополнительным шагом. На GDPval-AA, бенчмарке реальных агентных задач из сферы интеллектуального труда, Flash набрал 1656 Elo против 1314 у Pro. Отрыв в 342 пункта — самый большой во всей таблице бенчмарка.

Но это преимущество в скорости и баллах предполагает, что агентный цикл проходит без сбоев. Те же различия на ARC-AGI-2 и MRCR v2, которые проявляются в задачах на рассуждение и длинный контекст, дают основания ожидать, что Flash хуже справится с неожиданным результатом вызова инструмента в середине цикла, когда агенту нужно перестраивать план. Это вывод на основе приведённых выше данных о глубине рассуждения, а не отдельный бенчмарк. Если агент работает под контролем человека, который проверяет результат между шагами, скорость Flash почти безоговорочно выигрывает. Если же он автономно выполняет много шагов без человека в контуре, преимущество Pro в рассуждении — более безопасный выбор, пока не появятся данные о частоте сбоев обеих моделей.

Какую модель выбрать: матрица по типам задач

Тип задачиРекомендуемая модельПочему
Повседневная разработка: тесты, ревью PR, перенос кода между языкамиFlashВыигрывает по скорости и стоимости, а глубина рассуждения не становится узким местом
Глубокий рефакторинг, разработка новых алгоритмовProРазница на ARC-AGI-2 напрямую проявляется в многошаговом логическом рассуждении
Поиск в длинных документах: договоры, исследовательские корпуса свыше 128k токеновProУ Flash зафиксировано ухудшение MRCR v2 на такой длине; результат Pro не опубликован, но безопаснее выбрать модель без известного слабого места
Массовая пакетная генерацияFlashНа масштабе особенно важны бесплатная запись в кэш и производительность в 2,6 раза выше
Агентные процессы под надзором человекаFlashПреимущество в скорости без риска автономной ненадёжности
Автономные критичные агентные цепочкиProЗапас по глубине рассуждения безопаснее, когда некому перехватить ошибку в середине цикла
Частые многошаговые вызовы с повторным использованием одного контекстаFlashКэшированный ввод стоит примерно треть от цены Pro

Для большинства случаев достаточно простого правила: отправляйте запросы в Flash, если не выполняется хотя бы одно из трёх условий. Первое: контекст превышает 128k токенов и критична точность извлечения информации. Второе: задача требует абстрактного или многошагового рассуждения — например, новый алгоритм, юридический или исследовательский синтез. Третье: агент работает автономно больше нескольких шагов. Любое из этих условий склоняет выбор в сторону Pro; если ни одно не выполняется, Flash будет более дешёвым вариантом благодаря скорости и цене кэширования.

FAQ

Gemini 3.5 Flash лучше, чем 3.1 Pro?

По скорости, стоимости и универсальным бенчмаркам — да. В абстрактном рассуждении на ARC-AGI-2 Gemini 3.1 Pro по-прежнему впереди на 5 пунктов. При извлечении данных из контекста длиннее 128k токенов у Flash есть задокументированное ухудшение, а сопоставимый результат Pro не опубликован. Поэтому считать это подтверждённой победой Pro нельзя. Какая модель «лучше», зависит от того, к какой из этих категорий относится ваша задача.

Насколько Gemini 3.5 Flash дешевле 3.1 Pro?

По базовой цене входных и выходных токенов — примерно на 25%: $1.50/$9 против $2/$12 за миллион токенов. Более заметная экономия появляется при кэшировании: запись в кэш Flash бесплатна, а кэшированный ввод обходится примерно в треть тарифа Pro. Это особенно важно для многошаговых и высоконагруженных сценариев.

Подходит ли Gemini 3.5 Flash для программирования?

Да, для повседневных задач: генерации тестов, ревью PR, переноса кода между языками. Для глубокого рефакторинга и разработки новых алгоритмов преимущество Pro в бенчмарках абстрактного рассуждения обычно заметно и в качестве результата.

Хорошо ли Gemini 3.5 Flash работает с длинным контекстом?

На более коротком контексте — да: точность извлечения в MRCR v2 держится на уровне 84,9%. После 128k токенов она падает до 77,3%, а для задач вроде анализа нескольких договоров это значимая разница. Результат Gemini 3.1 Pro на той же длине не опубликован, поэтому речь идёт об известном ограничении Flash, а не о подтверждённом преимуществе Pro.

Итог

Gemini 3.5 Flash — оптимальный вариант по умолчанию для повседневной и массовой работы: он быстрее, выгоднее при кэшировании и достаточно близок к Pro по общим бенчмаркам, так что компромисс редко оказывается важен. Более высокая цена Gemini 3.1 Pro оправдана в задачах на абстрактное рассуждение и автономных агентных цепочках. А при работе с документами длиннее 128k токенов показатели Flash указывают на слабое место, которое данные по Pro пока не подтверждают и не опровергают. Перед окончательным выбором в таком сценарии стоит протестировать обе модели на своих данных.

Это сравнение основано на публичных данных бенчмарков — Artificial Analysis, BenchLM, nxcode и apiyi, — а не на собственном тестировании API. Gemini 3.1 Pro вышел с позиционированием, сфокусированным на рассуждении, в отличие от Flash с упором на скорость. На момент написания Gemini 3.5 Pro ещё не вышел: сообщения указывают на релиз в июле 2026 года. Поэтому это лишь снимок текущей ситуации: после выхода следующей версии Pro обе модели и их сравнение потребуется пересмотреть.

Читайте также