Gemini 3.6 Flash: цены, бенчмарки и доступ к API

Последнее обновление: 2026-07-22 07:24:50

21 июля 2026 года Google представила Gemini 3.6 Flash — и для команд, которые масштабируют ИИ-агентов, здесь важны две цифры. Цена выходных токенов снизилась с $9.00 до $7.50 за миллион, а для той же работы модель использует примерно на 17% меньше выходных токенов. В ресурсоёмных по генерации сценариях это может сократить стоимость одной задачи примерно на треть. В бенчмарках по программированию и агентным задачам новинка обходит не только Gemini 3.5 Flash, но и более крупную Gemini 3.1 Pro в большинстве тестов. Для нынешних пользователей 3.5 Flash это почти бесплатный апгрейд, хотя по номинальной цене модель не самая дешёвая в своём классе.

Что Google выпустила 21 июля

Одновременно вышли три модели, каждая рассчитана на свой сценарий:

  • Gemini 3.6 Flash (gemini-3.6-flash): основная модель в категории «быстрая, но умная». Контекст — 1 млн токенов, максимальный вывод — 64k, дата отсечения знаний перенесена на март 2026 года вместо января 2025 года.
  • Gemini 3.5 Flash-Lite: модель для высокой пропускной способности, генерирующая примерно 350 выходных токенов в секунду. Она заметно дешевле и рассчитана на простые массовые задачи.
  • Gemini 3.5 Flash Cyber: версия с настройкой под задачи безопасности — обнаружение, проверку и исправление уязвимостей. Она работает внутри CodeMender и доступна в рамках ограниченного пилота для государственных структур и доверенных партнёров, а не для общего использования.
Официальная страница цен Gemini API: Gemini 3.6 Flash стоит $1.50 за входные и $7.50 за выходные токены на 1 млн

На официальной странице Gemini 3.6 Flash названа «нашей самой интеллектуальной моделью, созданной для скорости», а актуальные тарифы опубликованы на странице цен Gemini API от Google.

Этот релиз появился не сам по себе. Выход флагманской Gemini 3.5 Pro сдвинулся по срокам, а DeepMind уже сообщила о начале предобучения Gemini 4. Обновлённая Flash закрывает этот промежуток до появления более крупных релизов.

Цены Gemini 3.6 Flash: почему снижение не такое большое, как кажется

Стандартный тариф API для Gemini 3.6 Flash составляет $1.50 за 1 млн входных токенов и $7.50 за 1 млн выходных токенов; в выходные включаются и thinking tokens. Кэширование контекста стоит $0.15 за 1 млн токенов, хранение — $1.00 за 1 млн токенов в час.

В обзорах запуска часто упускают главное: цена снизилась только для выхода. Предыдущая Gemini 3.5 Flash стоила $1.50 за входные и $9.00 за выходные токены. Стоимость входа не изменилась, а выход подешевел с $9.00 до $7.50 — это снижение на 16.7%, а не общая скидка на все токены. Если у вас входной сценарий с длинными документами и короткими ответами, экономия по прайс-листу будет небольшой. Основной выигрыш находится в другом месте.

Считать нужно стоимость задачи, а не цену токена

Сравнивать поколения моделей только по цене токена некорректно. Итоговый счёт определяется формулой «цена × число использованных токенов». Здесь меняются два параметра: выходной токен стоит на 16.7% дешевле, а Google, ссылаясь на Artificial Analysis Index, заявляет примерно на 17% меньше выходных токенов для той же работы. В лучшем случае получается 0.833 × 0.83 ≈ 0.69 — то есть примерно на 31% дешевле по выходным токенам.

Реальная экономия зависит от типа задач, поэтому 22 июля 2026 года я прогнал через OpenRouter при temperature 0 три одинаковых запроса на обеих моделях: задачу по программированию, задачу на рассуждение и извлечение JSON.

Метрика (3 задачи, temp 0)Gemini 3.6 FlashGemini 3.5 Flash
Входные токены146145
Выходные токены2,7362,593
Общая стоимость$0.0207$0.0236
Общая задержка5.20s5.19s

Обе модели дали корректные и сопоставимые ответы. В этой небольшой выборке 3.6 Flash оказалась примерно на 12% дешевле при практически одинаковой скорости, хотя сгенерировала на несколько процентов больше токенов — модель активнее расходовала их на рассуждение. Вывод такой: надёжная экономия — это снижение цены выхода с $9.00 до $7.50; выигрыш в эффективности токенов подтверждается в совокупности, но сильно меняется от задачи к задаче и проявляется не всегда. На практике стоит рассчитывать на 12–17% экономии по выходу, а 31% считать лучшим возможным сценарием.

Столбчатая диаграмма стоимости выходных токенов на задачу: Gemini 3.5 Flash — 100, Gemini 3.6 Flash — 88 по трём задачам и 69 в лучшем случае при использовании на 17% меньшего числа токенов

(Небольшая выборка: три задачи, temperature 0; это не формальный бенчмарк.)

Gemini 3.6 Flash на фоне других быстрых моделей

Самая низкая цена токена не всегда означает лучшую экономику, поэтому полезно сопоставить модели быстрого сегмента. Все значения ниже — стандартные, без batch-режима, за 1 млн токенов по официальным страницам цен поставщиков.

МодельВход /1MВыход /1MКонтекст
Gemini 3.6 Flash$1.50$7.501M
Gemini 3.5 Flash (предыдущая)$1.50$9.001M
Gemini 3.5 Flash-Lite$0.30$2.501M
Claude Haiku 4.5$1.00$5.00200k
GPT-5.6 Luna$1.00$6.00
DeepSeek V4 Flash$0.14$0.281M

Если смотреть только на прайс-лист, 3.6 Flash не лидирует. Claude Haiku 4.5 и GPT-5.6 Luna дешевле по выходным токенам, а DeepSeek V4 Flash находится совсем в другой ценовой категории. Сильная сторона 3.6 Flash — соотношение интеллекта и стоимости: её показатель Intelligence Index от Artificial Analysis равен 50, заметно выше медианы быстрого сегмента. При этом скорость составляет примерно 304 выходных токена в секунду, а окно контекста — полноценный 1 млн токенов. Если вам нужна передовая агентная и кодовая производительность без цен флагманского уровня, это аргумент в пользу модели. Для простых задач, где критична минимальная стоимость, выигрывают более дешёвые строки таблицы.

Насколько Gemini 3.6 Flash лучше 3.5 Flash

Смена поколения действительно заметна, причём сильнее всего именно в тех областях, где линейка Flash раньше уступала: длительных задачах по программированию и агентных сценариях.

БенчмаркGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.137%49%
MLE-Bench49.7%63.9%
OSWorld-Verified (управление компьютером)78.4%83.0%
SWE-Bench Pro55.1%58.7%
Terminal-Bench 2.176.2%78.0%
Групповая столбчатая диаграмма сравнения Gemini 3.6 Flash и 3.5 Flash в DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro и Terminal-Bench 2.1: 3.6 Flash лидирует во всех пяти тестах

Результаты взяты со страницы моделей Flash от Google DeepMind и из Artificial Analysis. Особенно выделяются DeepSWE и MLE-Bench: прирост составляет 12 и 14 процентных пунктов соответственно. Google также приводит оценку 1421 в тесте знаний для офисной работы GDPval-AA против 1349 ранее. В нескольких из этих тестов 3.6 Flash опережает более крупную и дорогую 3.1 Pro — необычный результат для модели линейки Flash.

Gemini 3.6 Flash против 3.1 Pro

Самое неожиданное здесь то, что модель быстрого сегмента обходит более крупную и дорогую Google 3.1 Pro в агентных задачах и программировании. Gemini 3.1 Pro Preview стоит $2.00–$4.00 за входные и $12.00–$18.00 за выходные токены на 1 млн, в зависимости от длины промпта. У 3.6 Flash единый тариф — $1.50/$7.50.

Gemini 3.6 FlashGemini 3.1 Pro
Вход /1M$1.50$2.00–$4.00
Выход /1M$7.50$12.00–$18.00
DeepSWE v1.149%12%
SWE-Bench Pro58.7%54.2%
Terminal-Bench 2.178.0%73.8%

3.1 Pro всё ещё остаётся более крупной и дорогой моделью, ориентированной на самые сложные задачи рассуждения и длинный контекст. Но для большинства агентных и кодовых сценариев 3.6 Flash теперь и дешевле, и показывает более высокие результаты в приведённых бенчмарках. Поэтому перед выбором Pro-уровня стоит провести такое сравнение на своих данных. В подробном сравнении Gemini 3.6 Flash и 3.1 Pro есть прямые результаты бенчмарков, тарифы по уровням и практический тест скорости.

Стоит ли переходить с Gemini 3.5 Flash

Для большинства команд, уже использующих 3.5 Flash, ответ — да. По расчётам переход почти во всём выгоднее:

  • Та же цена входа ($1.50/1M) и более дешёвый выход ($7.50 вместо $9.00).
  • Меньше выходных токенов на ту же задачу — примерно на 17%.
  • Более свежая дата отсечения знаний: март 2026 года против января 2025 года.
  • Более высокие результаты во всех приведённых бенчмарках по агентным задачам и программированию.

Перед заменой модели в production стоит проверить два момента. Во-первых, убедитесь, что вашим сценариям достаточно лимита в 64k выходных токенов: если вы полагались на более длинные одиночные ответы, протестируйте это ограничение. Во-вторых, прогоните собственный набор оценок. Изменения в рассуждениях и экономии токенов могут повлиять на поведение в уже настроенных промптах, поэтому до смены модели по умолчанию сравните задержку и качество ответов на вашем трафике.

Flash, Flash-Lite или Cyber: что выбрать

У трёх моделей разные роли:

  • Gemini 3.6 Flash — вариант по умолчанию. Выбирайте её, если нужна передовая производительность в агентных, кодовых и мультимодальных задачах по цене быстрого сегмента.
  • Gemini 3.5 Flash-Lite ($0.30/$2.50, ~350 токенов/сек) подходит для массовых, чувствительных к задержке и несложных задач: классификации, извлечения данных, маршрутизации, простых чатов. Это самый дешёвый способ масштабно использовать Gemini.
  • Gemini 3.5 Flash Cyber имеет смысл рассматривать только государственным организациям и проверенным партнёрам по безопасности. Это пилот внутри CodeMender, а не модель, которую можно вызвать через стандартный API.

Как получить доступ к Gemini 3.6 Flash

Модель уже доступна в Gemini API и Google AI Studio. В AI Studio есть бесплатный уровень для прототипирования, после чего можно перейти на оплату по факту использования с ID модели gemini-3.6-flash — тот же путь от бесплатного Google AI Studio к платному, что и для остальных моделей Gemini. Также указаны корпоративные среды Antigravity, Android Studio и Gemini Enterprise Agent Platform. Если модель нужна именно в Vertex AI, проверьте её наличие в консоли Vertex: по состоянию на 22 июля 2026 года развёртывание там ещё продолжалось.

Минимальный REST-запрос к Gemini API выглядит так:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize agentic AI in one sentence."}]}]}'

Команды, работающие с несколькими поставщиками, иногда используют агрегатор моделей вместо отдельных ключей. И OpenRouter, и AIReiter предлагают gemini-3.6-flash по рекомендованной цене Google; разница в наборе моделей, доступных через тот же ключ. OpenRouter распределяет запросы между множеством провайдеров, тогда как AIReiter совместим с Anthropic и маршрутизирует Gemini вместе с Claude. Это удобно, если вы сравниваете 3.6 Flash с ценами Claude API в рамках одного счёта. Для развёртывания одной модели проще обращаться напрямую к Google.

FAQ

Gemini 3.6 Flash бесплатна?

Для прототипирования в Google AI Studio есть бесплатный уровень с лимитами на использование. Production-использование оплачивается по тарифу $1.50 за входные и $7.50 за выходные токены на 1 млн.

Gemini 3.6 Flash лучше 3.5 Flash?

Да. В опубликованных бенчмарках она превосходит 3.5 Flash в DeepSWE, MLE-Bench, OSWorld-Verified, SWE-Bench Pro и Terminal-Bench, при этом дешевле по выходным токенам и использует меньше токенов на задачу.

Gemini 3.6 Flash лучше Gemini 3.1 Pro?

В агентных и кодовых тестах, включая DeepSWE, SWE-Bench Pro и Terminal-Bench, — да, и при более низкой цене ($1.50/$7.50 против $2.00–$4.00/$12.00–$18.00). Gemini 3.1 Pro — более крупная модель и всё ещё лидирует в самых сложных задачах на рассуждение с длинным контекстом и в мультимодальных сценариях, поэтому выбор зависит от вашей нагрузки.

Сколько стоит Gemini 3.6 Flash?

$1.50 за 1 млн входных токенов и $7.50 за 1 млн выходных токенов на стандартном уровне. Кэширование контекста стоит $0.15 за 1 млн токенов.

Какая дата отсечения знаний у Gemini 3.6 Flash?

Март 2026 года. У предыдущей Gemini 3.5 Flash это был январь 2025 года.

Доступна ли Gemini 3.6 Flash в Vertex AI?

Её доступность подтверждена в Gemini API и Google AI Studio, а также на нескольких корпоративных поверхностях. На момент запуска наличие в Vertex AI явно не подтверждалось, поэтому перед разработкой на этой платформе проверьте каталог моделей Vertex.

Что такое Gemini 3.5 Flash Cyber?

Это специализированная версия для безопасности, настроенная на обнаружение, проверку и исправление программных уязвимостей. Она работает внутри агента CodeMender от Google DeepMind и доступна в ограниченном пилоте для государственных структур и доверенных партнёров, а не как публичная модель.

Читайте также