AIREITER

Gemini 3.7 Flash vs 3.6 Flash: та же цена, заметно лучше код

Последнее обновление: 2026-08-14 07:48:27

Между релизами Gemini 3.6 Flash и Gemini 3.7 Flash прошло всего три недели, однако прирост оказался существенным. В DeepSWE v1.1 новая модель набрала 65,3% против 48,6% у предшественницы. При этом до декабря 2026 года обе модели стоят одинаково: $0.75 за миллион входных и $3.75 за миллион выходных токенов. Переход не увеличивает цену токена, но его практическая ценность зависит от типа задач.

Gemini 3.7 Flash и 3.6 Flash: результаты всех бенчмарков

На официальной странице моделей Google DeepMind приводит улучшения Gemini 3.7 Flash по всем ключевым метрикам. Самые заметные разрывы видны в бенчмарках для кодовых агентов и корпоративной автоматизации. Ниже — все 18 метрик, опубликованных Google для обеих моделей; Claude Sonnet 5 и GPT-5.6 Terra приведены в статье для контекста.

Сравнение Gemini 3.7 Flash и 3.6 Flash по шести ключевым бенчмаркам
БенчмаркGemini 3.7 FlashGemini 3.6 FlashРазница
Artificial Analysis Intelligence Index (сводный показатель)5652+4
FrontierCode 1.1 (качество production-кода)43.6%34.4%+9.2
DeepSWE v1.1 (долгосрочные задачи software engineering)65.3%48.6%+16.7
Code Arena (Elo в веб-разработке)15881538+50
Terminal-Bench 2.1 (агентное программирование в терминале)85.8%78.0%+7.8
Terminal-Bench 3.0 (общие возможности агентов)14.9%5.4%+9.5
AutomationBench (автоматизация корпоративных процессов)30.4%17.0%+13.4
GDPVal-AA v2 (Elo в интеллектуальной работе)15251422+103
Harvey LAB-AA (сложные юридические процессы)90.7%85.1%+5.6
GDP.pdf (понимание экспертных PDF-документов)34.0%22.0%+12.0
CharXiv, без инструментов (анализ графиков)84.5%85.2%−0.7
CharXiv, с инструментами88.7%89.4%−0.7
LVBench (понимание длинных видео)85.4%84.2%+1.2
GDM-MRCR v2, 128k (поиск информации в длинном контексте)97.0%91.8%+5.2
OSWorld-2.0 (работа агента за компьютером)47.9%33.8%+14.1
Agent's Last Exam (задачи desktop-агентов)26.3%24.2%+2.1
HLE-Verified (междисциплинарное экспертное рассуждение)53.6%51.2%+2.4
LABBench2 (задачи биологических исследований)82.1%76.1%+6.0

Все значения заявлены Google DeepMind на странице модели 3.7 Flash. Для большинства этих бенчмарков независимых воспроизведений результатов пока нет, поэтому разницу стоит считать ориентиром, а не гарантией для конкретной нагрузки.

Код и агенты: главное преимущество 3.7 Flash

Максимальный отрыв между моделями наблюдается именно в программировании и агентных сценариях. DeepSWE v1.1 оценивает выполнение длительных инженерных задач в реальных репозиториях: результат вырос с 48,6% до 65,3%, то есть на 16,7 процентного пункта. По этой метрике Gemini 3.7 Flash обходит Claude Sonnet 5 с 53,8% и располагается между ним и GPT-5.6 Terra с 69,6% — все сравнительные результаты взяты из таблицы бенчмарков DeepMind.

Другие агентные тесты показывают ту же картину:

  • Terminal-Bench 3.0 — задачи для агентов с несколькими инструментами: рост с 5.4% до 14.9%, почти втрое
  • AutomationBench — автоматизация корпоративных процессов: 17.0% → 30.4%
  • FrontierCode 1.1 — качество production-кода: +9.2 пункта
  • OSWorld-2.0 — работа агента за компьютером: 33.8% → 47.9%

Первые отзывы пользователей на Reddit хорошо отражают разрыв между победами в бенчмарках и повседневным опытом разработчика:

Хорошо справляется с реализацией, но может быть слабее в планировании, ревью кода и декомпозиции сложных задач.

— Обсуждение пользователя в r/google_antigravity

Похожие выводы следуют и из кейсов клиентов Google, опубликованных на странице модели DeepMind. Browser Use сообщил, что «агент Gemini 3.7 Flash оказался на 35% дешевле 3.6 Flash, с наблюдаемым ростом cache hit rate на 8% и меньшим числом ошибок инструментов». Harvey зафиксировала прирост на 2,6 пункта по метрике all-pass в Legal Agent Bench. Nunu.ai получила производительность на уровне GPT-5.6-Terra «примерно за половину стоимости». Все три компании связывают экономию не со скидкой на токены, а с меньшим числом шагов в агентном цикле.

Работа с документами и мультимодальность: прирост есть, но скромнее

За пределами кодинга улучшения менее радикальны. Artificial Analysis Intelligence Index вырос с 52 до 56: по сравнительной таблице DeepMind, Gemini 3.7 Flash находится между Claude Sonnet 5 с 55 и GPT-5.6 Terra с 57. Самый сильный некодовый результат — понимание документов: в GDP.pdf показатель поднялся с 22,0% до 34,0%. Это прирост на 12 пунктов для пайплайнов, обрабатывающих сложные документы, финансовые отчёты или юридические материалы. GDM-MRCR v2 для поиска в контексте объёмом 128K токенов вырос с 91,8% до 97,0%.

В Harvey LAB-AA, оценивающем сложные юридические процессы, результат увеличился с 85,1% до 90,7%. Понимание длинных видео в LVBench и задачи биологических исследований в LABBench2 также прибавили примерно по 6 пунктов. Для узкоспециализированных сценариев это важно, но само по себе вряд ли станет решающим аргументом для миграции.

Цена не изменилась: одинаковая промоставka для обеих моделей

МодельВход ($/1M токенов)Выход ($/1M токенов)Стандартная цена (с 1 января 2027 года)
Gemini 3.7 Flash$0.75\*$3.75\*$1.50 / $7.50
Gemini 3.6 Flash$0.75\*$3.75\*$1.50 / $7.50
Claude Sonnet 5$2.00$10.00—
GPT-5.6 Terra$2.00$12.00—

\*Промо-цена действует до 31 декабря 2026 года. Все цены приведены по странице модели DeepMind.

Когда 13 августа 2026 года вышла 3.7 Flash, Google установила для обеих Flash-моделей промотариф $0.75/$3.75. До этого 3.6 Flash стоила $1.50/$7.50 по стандартному тарифу. С 1 января 2027 года обе модели вернутся к цене $1.50/$7.50, если Google не продлит акцию. При одинаковой стоимости токенов разница в расходах определяется эффективностью на задаче: заявленное Browser Use снижение стоимости агентных операций на 35% измерялось на тех же рабочих нагрузках и объяснялось меньшим количеством вызовов инструментов и более высоким cache hit rate, а не другой тарификацией.

Подробный разбор расходов на API Gemini 3.7 Flash, включая кеширование, Batch API и оплату grounding, читайте в нашем гайде по ценам Gemini 3.7 Flash API.

В чём Gemini 3.6 Flash всё ещё сильнее

У 3.6 Flash остаётся небольшое преимущество в анализе графиков. В CharXiv без инструментов она набирает 85,2% против 84,5% у 3.7. При включённых инструментах разрыв такой же: 89,4% против 88,7%. Разница меньше одного пункта, поэтому в отдельных задачах с графиками модели могут показывать сопоставимый результат. Прежде чем выбирать модель по умолчанию, проверьте её на собственном наборе таких задач.

В остальных бенчмарках из таблицы Google модель 3.6 не опережает 3.7. Ближайшая спорная зона за пределами анализа графиков — индекс интеллекта: 52 против 56, но и здесь лидирует 3.7.

Миграция на 3.7 Flash: не только замена model ID

На техническом уровне миграция сводится к замене model ID: вместо gemini-3.6-flash нужно указать gemini-3.7-flash. Согласно странице модели DeepMind, у обеих моделей одинаковое контекстное окно — 1M токенов на вход и 64K на выход, одинаковые входные модальности — текст, изображения, видео, аудио и PDF — а также одинаковые возможности работы с инструментами: function calling, search grounding и computer use. Для 3.7 Flash на странице указан статус general availability.

Но есть важный нюанс. Переход с 3.5 на 3.6 принёс неочевидные изменения поведения API, к которым разработчики оказались не готовы. Как показало независимое тестирование, параметры temperature, top_p и top_k молча игнорировались, thinking_budget превратился в строковый enum thinking_level, а prefilling ответов был удалён. Google пока не сообщала, появились ли аналогичные изменения в 3.7 Flash. Пока такой документации нет, перед переключением production-трафика прогоните свой набор оценок с обоими model ID. И сохраните 3.6 как резервный вариант.

Стоит ли переходить на 3.7 Flash?

Решение зависит от типа нагрузки:

  • Переходите сразу, если используете кодовых агентов. DeepSWE v1.1 прибавил 16.7 пункта, а результат в Terminal-Bench 3.0 вырос почти втрое. При одинаковой цене за токен нет финансовых причин оставаться на 3.6 в нагрузках с кодовыми агентами.
  • Переходите сразу, если обрабатываете сложные документы. Понимание GDP.pdf выросло на 12 пунктов: 22.0% → 34.0%. Поиск в контексте объёмом 128K токенов почти идеален — 97.0%.
  • Сначала тестируйте, если ваша ключевая задача — анализ графиков. В CharXiv 3.6 опережает 3.7 менее чем на 1 пункт. Прежде чем принимать решение, сравните модели на своих данных.
  • Оставайтесь на 3.6, если пайплайн проверен и стабилен. На странице модели DeepMind не указана дата прекращения поддержки 3.6 Flash. Если ваш процесс проходит регрессионные тесты и прирост в кодинге вам сейчас не нужен, отладка изменений поведения может обойтись дороже, чем выгода. Переносите по одному workflow за раз.
  • Учитывайте темп релизов. Google выпустила 3.7 через три недели после 3.6. Перенесите сейчас те workflow, где преимущества 3.7 максимальны, оставьте 3.6 закреплённой как резервную модель и оценивайте каждый новый релиз Flash как поэтапное обновление, а не смену платформы.

Сравнить модели вживую можно в чат-интерфейсах Gemini 3.7 Flash и Gemini 3.6 Flash.

Gemini 3.7 Flash — это новая архитектура или обновление post-training?

Google публично не характеризовала 3.7 Flash ни как новую архитектуру, ни как post-training-обновление. Artificial Analysis Intelligence Index вырос с 52 до 56, тогда как независимое тестирование подтвердило, что 3.5 и 3.6 Flash получили по 50 баллов в том же индексе. Неизвестно, обусловлен ли прогресс 3.7 изменениями архитектуры или улучшенными обучающими данными: документация этого не раскрывает.

Gemini 3.7 Flash дороже Gemini 3.6 Flash?

Нет. До 31 декабря 2026 года обе модели стоят $0.75 за миллион входных токенов и $3.75 за миллион выходных. Затем обе перейдут на тариф $1.50/$7.50. Экономия при обновлении достигается за счёт меньшего числа вызовов инструментов и шагов рассуждения на задачу, а не более низкой цены токена.

Где доступна Gemini 3.7 Flash?

Согласно странице модели DeepMind, 3.7 Flash доступна через Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise и Gemini App; статус модели — general availability.

Стоит ли ждать следующую версию Flash вместо миграции сейчас?

3.7 Flash — GA-модель с опубликованными бенчмарками и уже подтверждённым внедрением у клиентов. Если ваша нагрузка выигрывает от улучшений в кодинге и агентных сценариях, переносите эти workflow сейчас и повторно оценивайте модель после выхода следующей версии. Ожидание означает упущенную выгоду от улучшений, которыми уже можно пользоваться.