AIREITER

DeepSeek V4 Pro GA: цены API, бенчмарки и инструкция по миграции

Последнее обновление: 2026-08-13 13:45:48

13 августа 2026 года DeepSeek выпустила стабильную версию V4 Pro GA. Вместе с релизом компания опубликовала полные результаты бенчмарков, веса модели под лицензией MIT и три уровня интенсивности рассуждений. Но для пользователей API важнее другое: на официальной странице с тарифами подтверждён переход на тарификацию по пиковым и непиковым часам с 16 августа 2026 года, 16:00 UTC. Стоимость миллиона выходных токенов V4 Pro вырастет с $0.87 до $1.98 в непиковые часы и до $3.96 в пиковые.

Официальная страница тарифов DeepSeek API с ценами в пиковые и непиковые часы

Что вошло в релиз: V4-Pro-0813, бенчмарки и открытые веса

Теперь псевдоним API deepseek-v4-pro указывает на модель DeepSeek-V4-Pro-0813. Она доступна в приложении, веб-версии и API DeepSeek. О запуске компания сообщила 13 августа, отдельно отметив «значительно улучшенные возможности работы в роли агента» по сравнению с предварительной сборкой от 24 апреля.

Архитектура и характеристики:

ПараметрDeepSeek-V4-Pro-0813
Опубликованный размер модели1.7T параметров (карточка модели; в превью было 1.6T)
Размер контекста1 миллион токенов
Максимальный вывод384K токенов
Режимы рассужденийБез рассуждений и с рассуждениями (по умолчанию включён режим с рассуждениями)
Уровни интенсивности рассужденийlow, high, max
Новый модуль декодированияСпекулятивное декодирование DSpark (7 спекулятивных токенов)
Совместимость APIOpenAI ChatCompletions, Responses API, Anthropic API, Codex
Лимит параллельных запросов500
ЛицензияMIT

В карточке модели для агентских сценариев рекомендуются значения temperature = 1.0 и top_p = 0.95. Максимальная длина вывода при уровнях high и max составляет 384K токенов.

Официальные бенчмарки GA

В карточке модели DeepSeek опубликовала сравнение по десяти бенчмаркам. Для задач с кодовыми агентами использовался DeepSeek Harness в минимальном режиме с интенсивностью рассуждений max. Две последние строки (DSBench) — внутренние тестовые наборы DeepSeek. Все приведённые ниже результаты взяты из этой карточки модели.

Результаты бенчмарков DeepSeek V4-Pro-0813 GA в сравнении с Kimi K3, Opus 4.8 и Fable 5 в пяти агентских тестах
БенчмаркPro-0813Flash-0731Pro PreviewKimi K3Opus 4.8Fable 5
HLE (без инструментов / с инструментами)42.7 / 60.037.8 / 51.537.7 / 48.243.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.982.772.188.385.088.0
DeepSWE62.754.412.867.558.070.0
Toolathlon-Verified74.170.355.976.576.277.9
Cybergym83.376.752.780.078.383.1
NL2Repo61.554.238.5—69.7—
Agents' Last Exam25.725.216.527.625.7—
AutomationBench (Public)31.825.112.830.827.229.1
DSBench-FullStack (internal)71.168.741.873.771.677.2
DSBench-Hard (internal)67.259.631.163.071.768.3

По сравнению с превью версия GA прибавила очень заметно: результат DeepSWE вырос с 12.8 до 62.7, а AutomationBench — с 12.8 до 31.8. В сравнении с конкурентами Pro-0813 лидирует на HLE с инструментами — 60.0 против 56.0 у Kimi K3 и 57.9 у Opus 4.8. При этом на DeepSWE, Terminal Bench и Toolathlon-Verified модель уступает Kimi K3 и Fable 5. Два теста DSBench — внутренние бенчмарки производителя, поэтому напрямую сопоставлять их с независимо поддерживаемыми тестами не стоит.

Открытые веса

Веса версии 0813 уже доступны на Hugging Face под лицензией MIT. Для развёртывания предусмотрены vLLM и SGLang. В карточке модели также есть пример запуска через vLLM со спекулятивным декодированием DSpark, FP8 KV-кэшем и одним узлом 4x GB300.

«В целом сопоставима с наиболее сильными доступными проприетарными моделями». — карточка DeepSeek V4-Pro на Hugging Face

Полный разбор цен: сколько стоит Pro до и после 16 августа

На странице тарифов указаны как текущая единая ставка, так и запланированные цены для пиковых и непиковых часов, которые начнут действовать 16 августа 2026 года в 16:00 UTC. Пиковые интервалы — 01:00–04:00 UTC и 06:00–10:00 UTC (09:00–12:00 и 14:00–18:00 по Пекину). Остальное время считается непиковым. Непиковая ставка ровно вдвое ниже пиковой.

DeepSeek V4 Pro (DeepSeek-V4-Pro-0813)

Категория тарификацииТекущая единая ставкаНепиковые часы (16 авг.)Пиковые часы (16 авг.)Изменение в пик
Ввод, попадание в кэш$0.003625/M$0.022/M$0.044/M+1,114%
Ввод, промах кэша$0.435/M$0.66/M$1.32/M+203%
Вывод$0.87/M$1.98/M$3.96/M+355%
Сравнение тарифов DeepSeek V4 Pro за миллион токенов: текущая единая ставка, пиковые и непиковые часы

В пиковые часы вывод подорожает в 4.6 раза. Для производственных агентских сценариев сильнее всего изменится стоимость попадания в кэш: раньше ставка $0.003625/M была примерно в 120 раз ниже цены промаха кэша. После 16 августа разница сократится до 30 раз в обоих режимах (0.022 против 0.66 в непиковые часы и 0.044 против 1.32 в пиковые), а абсолютная стоимость кэшированных входных токенов вырастет в 6–12 раз.

DeepSeek V4 Flash (DeepSeek-V4-Flash-0731)

Категория тарификацииТекущая единая ставкаНепиковые часы (16 авг.)Пиковые часы (16 авг.)Изменение в пик
Ввод, попадание в кэш$0.0028/M$0.007/M$0.014/M+400%
Ввод, промах кэша$0.14/M$0.22/M$0.44/M+214%
Вывод$0.28/M$0.66/M$1.32/M+371%

Лимит параллельных запросов — 2,500, то есть в пять раз больше, чем у Pro.

Когда начинаются пиковые часы в вашем часовом поясе

Часовой поясПиковый интервал 1Пиковый интервал 2
Пекин (UTC+8)09:00–12:0014:00–18:00
Лондон (UTC+1)02:00–05:0007:00–11:00
Нью-Йорк (UTC-4)21:00–00:00 (предыдущий день)02:00–06:00
Сан-Франциско (UTC-7)18:00–21:0023:00–03:00

Для команд из США пиковые интервалы в основном приходятся на вечер и ночь. В Китае и Восточной Азии они совпадают с обычными рабочими часами.

Во сколько это обойдётся: Pro при 10 000 запросов в день

Рассмотрим производственного агента, который отправляет в каждом запросе префикс на 50K токенов, полностью попадающий в кэш, и получает ответ длиной 2K токенов.

Составляющая стоимостиТекущая единая ставкаНепиковые часыПиковые часы
Вход, попадание в кэш (500M токенов)$1.81$11.00$22.00
Вывод (20M токенов)$17.40$39.60$79.20
Итого за день$19.21$50.60$101.20
Итого за 30 дней$576$1,518$3,036

В реальной нагрузке запросы распределяются между пиковыми и непиковыми часами, поэтому итоговая сумма окажется между этими значениями. Та же нагрузка на Flash стоит $7.00 в день по текущей единой ставке, примерно $16.70 в день в непиковые часы и примерно $33.40 в пиковые. Пиковая стоимость Flash ($33.40 в день) выше текущей единой ставки Pro ($19.21 в день), но непиковая цена Flash ($16.70 в день) ниже неё.

Миграция: идентификаторы моделей, управление рассуждениями и фиксация версии

Какие конечные точки отключаются и чем их заменить

В анонсе от 24 апреля DeepSeek сообщила, что deepseek-chat и deepseek-reasoner будут «полностью отключены и недоступны после 24 июля 2026 года, 15:59 по UTC». Код, в котором используются эти строки, нужно обновить.

Старая конечная точкаКуда направляла запросыЗамена
deepseek-chatV4 Flash, без рассужденийdeepseek-v4-flash
deepseek-reasonerV4 Flash, с рассуждениямиdeepseek-v4-flash (с рассуждениями) или deepseek-v4-pro

Многие команды полагали, что deepseek-reasoner использует рассуждения уровня Pro. На самом деле запросы отправлялись во Flash в режиме рассуждений. Переход на deepseek-v4-pro даст другое качество ответов и увеличит расходы.

// Before (retired — fails)
{"model": "deepseek-reasoner", "messages": [...]}

// After
{"model": "deepseek-v4-pro", "messages": [...]}

Базовый URL остаётся прежним: https://api.deepseek.com. Остальная структура запроса не меняется.

Уровни интенсивности рассуждений

В V4-Pro-0813 появились три уровня интенсивности рассуждений: low для простых задач, high для повседневной работы агентов и max для сложных проблем. Режим рассуждений включён по умолчанию, а потраченные на него токены учитываются в стоимости вывода. Если перед ответом длиной 200 токенов модель потратит 3 000 токенов на рассуждения, тарификация составит 3 200 выходных токенов. В пиковом режиме это $0.0127 за запрос против $0.0008 только за сам ответ. Для простых задач DeepSeek рекомендует уровень low: дополнительное обдумывание в таких сценариях увеличивает расходы, но не приносит пользы.

Фиксация версии модели

Псевдоним deepseek-v4-pro указывает на актуальную сборку и может переключиться на будущие версии после их выпуска DeepSeek. Для воспроизводимого поведения в продакшене проверьте, поддерживает ли ваш провайдер идентификаторы моделей с датой. Некоторые сторонние шлюзы предлагают закреплённые маршруты, но перед использованием в продакшене нужно уточнить в документации провайдера, какую именно сборку обслуживает каждый маршрут.

Совместимость протоколов API

Обе модели поддерживают форматы OpenAI ChatCompletions и Anthropic API. Конечная точка Anthropic — https://api.deepseek.com/anthropic. Совместимость с Responses API и Codex появилась именно в GA-сборке. Если после миграции возникнут ошибки, протестируйте оба варианта протокола.

Pro или Flash: что выбрать после повышения цен?

V4-Pro-0813 опережает V4-Flash-0731 по всем десяти опубликованным показателям. Разрыв зависит от сложности задачи:

БенчмаркPro 0813Flash 0731Разрыв
Terminal Bench 2.187.982.75.2 пункта
DeepSWE62.754.48.3 пункта
AutomationBench31.825.16.7 пункта
Cybergym83.376.76.6 пункта

V4 Pro стоит выбрать, если:

  • Цикл работы агента снова и снова отправляет один и тот же большой префикс. Экономия на попаданиях в кэш сохраняется даже при более высокой базовой ставке
  • Для сложных рассуждений, многошаговой работы с инструментами или генерации большого объёма кода вам нужен увеличенный размер модели Pro
  • Ваша нагрузка укладывается в лимит 500 параллельных запросов

V4 Flash подойдёт, если:

  • Задачи простые, их много или для них критична задержка
  • Для параллельного запуска множества задач вам нужен лимит 2 500 одновременных запросов
  • Разница в качестве не оправдывает трёхкратную стоимость выходных токенов

Более подробное сравнение моделей смотрите в нашем материале DeepSeek V4 Flash и Pro: сравнение. Протестировать модель без самостоятельного управления API-ключами можно на странице чата V4 Pro и странице чата V4 Flash.

FAQ

Доступны ли веса V4-Pro-0813 для самостоятельного развёртывания?

Да. Веса распространяются под лицензией MIT и доступны на Hugging Face. Для развёртывания предусмотрены варианты с vLLM и SGLang — подробности приведены выше, в разделе об открытых весах.

Стоит ли переходить с V4 Flash на V4 Pro после выхода GA?

Для большинства чувствительных к стоимости сценариев Flash остаётся более выгодным вариантом. По бенчмаркам он уступает Pro от 0.5 пункта (Agents' Last Exam) до 8.5 пункта (HLE с инструментами), зато вывод обходится в 3 раза дешевле. Переходите на Pro, если вашей нагрузке нужен полный размер модели для сложных многошаговых рассуждений или генерации большого объёма кода.

Как уменьшить влияние повышения цен?

Есть три основных способа: переносить пакетные задачи и отложенные агентские процессы на непиковые часы (01:00–04:00 и 06:00–10:00 UTC); максимально увеличивать долю попаданий в кэш, сохраняя стабильными префиксы промптов; отправлять простые задачи во Flash или включать для Pro уровень рассуждений low.

Относится ли тарификация по пиковым и непиковым часам к приложению и сайту DeepSeek?

На официальной странице тарифов описана только тарификация токенов API. Указанное расписание применяется к прямым вызовам API; сторонние шлюзы могут передавать эти цены без изменений, добавлять наценку или использовать собственные тарифы. Актуальные условия проверяйте на странице с тарифами.