13 августа 2026 года DeepSeek выпустила стабильную версию V4 Pro GA. Вместе с релизом компания опубликовала полные результаты бенчмарков, веса модели под лицензией MIT и три уровня интенсивности рассуждений. Но для пользователей API важнее другое: на официальной странице с тарифами подтверждён переход на тарификацию по пиковым и непиковым часам с 16 августа 2026 года, 16:00 UTC. Стоимость миллиона выходных токенов V4 Pro вырастет с $0.87 до $1.98 в непиковые часы и до $3.96 в пиковые.
Что вошло в релиз: V4-Pro-0813, бенчмарки и открытые веса
Теперь псевдоним API deepseek-v4-pro указывает на модель DeepSeek-V4-Pro-0813. Она доступна в приложении, веб-версии и API DeepSeek. О запуске компания сообщила 13 августа, отдельно отметив «значительно улучшенные возможности работы в роли агента» по сравнению с предварительной сборкой от 24 апреля.
Архитектура и характеристики:
| Параметр | DeepSeek-V4-Pro-0813 |
|---|---|
| Опубликованный размер модели | 1.7T параметров (карточка модели; в превью было 1.6T) |
| Размер контекста | 1 миллион токенов |
| Максимальный вывод | 384K токенов |
| Режимы рассуждений | Без рассуждений и с рассуждениями (по умолчанию включён режим с рассуждениями) |
| Уровни интенсивности рассуждений | low, high, max |
| Новый модуль декодирования | Спекулятивное декодирование DSpark (7 спекулятивных токенов) |
| Совместимость API | OpenAI ChatCompletions, Responses API, Anthropic API, Codex |
| Лимит параллельных запросов | 500 |
| Лицензия | MIT |
В карточке модели для агентских сценариев рекомендуются значения temperature = 1.0 и top_p = 0.95. Максимальная длина вывода при уровнях high и max составляет 384K токенов.
Официальные бенчмарки GA
В карточке модели DeepSeek опубликовала сравнение по десяти бенчмаркам. Для задач с кодовыми агентами использовался DeepSeek Harness в минимальном режиме с интенсивностью рассуждений max. Две последние строки (DSBench) — внутренние тестовые наборы DeepSeek. Все приведённые ниже результаты взяты из этой карточки модели.
| Бенчмарк | Pro-0813 | Flash-0731 | Pro Preview | Kimi K3 | Opus 4.8 | Fable 5 |
|---|---|---|---|---|---|---|
| HLE (без инструментов / с инструментами) | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 88.3 | 85.0 | 88.0 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 76.5 | 76.2 | 77.9 |
| Cybergym | 83.3 | 76.7 | 52.7 | 80.0 | 78.3 | 83.1 |
| NL2Repo | 61.5 | 54.2 | 38.5 | — | 69.7 | — |
| Agents' Last Exam | 25.7 | 25.2 | 16.5 | 27.6 | 25.7 | — |
| AutomationBench (Public) | 31.8 | 25.1 | 12.8 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack (internal) | 71.1 | 68.7 | 41.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard (internal) | 67.2 | 59.6 | 31.1 | 63.0 | 71.7 | 68.3 |
По сравнению с превью версия GA прибавила очень заметно: результат DeepSWE вырос с 12.8 до 62.7, а AutomationBench — с 12.8 до 31.8. В сравнении с конкурентами Pro-0813 лидирует на HLE с инструментами — 60.0 против 56.0 у Kimi K3 и 57.9 у Opus 4.8. При этом на DeepSWE, Terminal Bench и Toolathlon-Verified модель уступает Kimi K3 и Fable 5. Два теста DSBench — внутренние бенчмарки производителя, поэтому напрямую сопоставлять их с независимо поддерживаемыми тестами не стоит.
Открытые веса
Веса версии 0813 уже доступны на Hugging Face под лицензией MIT. Для развёртывания предусмотрены vLLM и SGLang. В карточке модели также есть пример запуска через vLLM со спекулятивным декодированием DSpark, FP8 KV-кэшем и одним узлом 4x GB300.
«В целом сопоставима с наиболее сильными доступными проприетарными моделями». — карточка DeepSeek V4-Pro на Hugging Face
Полный разбор цен: сколько стоит Pro до и после 16 августа
На странице тарифов указаны как текущая единая ставка, так и запланированные цены для пиковых и непиковых часов, которые начнут действовать 16 августа 2026 года в 16:00 UTC. Пиковые интервалы — 01:00–04:00 UTC и 06:00–10:00 UTC (09:00–12:00 и 14:00–18:00 по Пекину). Остальное время считается непиковым. Непиковая ставка ровно вдвое ниже пиковой.
DeepSeek V4 Pro (DeepSeek-V4-Pro-0813)
| Категория тарификации | Текущая единая ставка | Непиковые часы (16 авг.) | Пиковые часы (16 авг.) | Изменение в пик |
|---|---|---|---|---|
| Ввод, попадание в кэш | $0.003625/M | $0.022/M | $0.044/M | +1,114% |
| Ввод, промах кэша | $0.435/M | $0.66/M | $1.32/M | +203% |
| Вывод | $0.87/M | $1.98/M | $3.96/M | +355% |
В пиковые часы вывод подорожает в 4.6 раза. Для производственных агентских сценариев сильнее всего изменится стоимость попадания в кэш: раньше ставка $0.003625/M была примерно в 120 раз ниже цены промаха кэша. После 16 августа разница сократится до 30 раз в обоих режимах (0.022 против 0.66 в непиковые часы и 0.044 против 1.32 в пиковые), а абсолютная стоимость кэшированных входных токенов вырастет в 6–12 раз.
DeepSeek V4 Flash (DeepSeek-V4-Flash-0731)
| Категория тарификации | Текущая единая ставка | Непиковые часы (16 авг.) | Пиковые часы (16 авг.) | Изменение в пик |
|---|---|---|---|---|
| Ввод, попадание в кэш | $0.0028/M | $0.007/M | $0.014/M | +400% |
| Ввод, промах кэша | $0.14/M | $0.22/M | $0.44/M | +214% |
| Вывод | $0.28/M | $0.66/M | $1.32/M | +371% |
Лимит параллельных запросов — 2,500, то есть в пять раз больше, чем у Pro.
Когда начинаются пиковые часы в вашем часовом поясе
| Часовой пояс | Пиковый интервал 1 | Пиковый интервал 2 |
|---|---|---|
| Пекин (UTC+8) | 09:00–12:00 | 14:00–18:00 |
| Лондон (UTC+1) | 02:00–05:00 | 07:00–11:00 |
| Нью-Йорк (UTC-4) | 21:00–00:00 (предыдущий день) | 02:00–06:00 |
| Сан-Франциско (UTC-7) | 18:00–21:00 | 23:00–03:00 |
Для команд из США пиковые интервалы в основном приходятся на вечер и ночь. В Китае и Восточной Азии они совпадают с обычными рабочими часами.
Во сколько это обойдётся: Pro при 10 000 запросов в день
Рассмотрим производственного агента, который отправляет в каждом запросе префикс на 50K токенов, полностью попадающий в кэш, и получает ответ длиной 2K токенов.
| Составляющая стоимости | Текущая единая ставка | Непиковые часы | Пиковые часы |
|---|---|---|---|
| Вход, попадание в кэш (500M токенов) | $1.81 | $11.00 | $22.00 |
| Вывод (20M токенов) | $17.40 | $39.60 | $79.20 |
| Итого за день | $19.21 | $50.60 | $101.20 |
| Итого за 30 дней | $576 | $1,518 | $3,036 |
В реальной нагрузке запросы распределяются между пиковыми и непиковыми часами, поэтому итоговая сумма окажется между этими значениями. Та же нагрузка на Flash стоит $7.00 в день по текущей единой ставке, примерно $16.70 в день в непиковые часы и примерно $33.40 в пиковые. Пиковая стоимость Flash ($33.40 в день) выше текущей единой ставки Pro ($19.21 в день), но непиковая цена Flash ($16.70 в день) ниже неё.
Миграция: идентификаторы моделей, управление рассуждениями и фиксация версии
Какие конечные точки отключаются и чем их заменить
В анонсе от 24 апреля DeepSeek сообщила, что deepseek-chat и deepseek-reasoner будут «полностью отключены и недоступны после 24 июля 2026 года, 15:59 по UTC». Код, в котором используются эти строки, нужно обновить.
| Старая конечная точка | Куда направляла запросы | Замена |
|---|---|---|
deepseek-chat | V4 Flash, без рассуждений | deepseek-v4-flash |
deepseek-reasoner | V4 Flash, с рассуждениями | deepseek-v4-flash (с рассуждениями) или deepseek-v4-pro |
Многие команды полагали, что deepseek-reasoner использует рассуждения уровня Pro. На самом деле запросы отправлялись во Flash в режиме рассуждений. Переход на deepseek-v4-pro даст другое качество ответов и увеличит расходы.
// Before (retired — fails)
{"model": "deepseek-reasoner", "messages": [...]}
// After
{"model": "deepseek-v4-pro", "messages": [...]}
Базовый URL остаётся прежним: https://api.deepseek.com. Остальная структура запроса не меняется.
Уровни интенсивности рассуждений
В V4-Pro-0813 появились три уровня интенсивности рассуждений: low для простых задач, high для повседневной работы агентов и max для сложных проблем. Режим рассуждений включён по умолчанию, а потраченные на него токены учитываются в стоимости вывода. Если перед ответом длиной 200 токенов модель потратит 3 000 токенов на рассуждения, тарификация составит 3 200 выходных токенов. В пиковом режиме это $0.0127 за запрос против $0.0008 только за сам ответ. Для простых задач DeepSeek рекомендует уровень low: дополнительное обдумывание в таких сценариях увеличивает расходы, но не приносит пользы.
Фиксация версии модели
Псевдоним deepseek-v4-pro указывает на актуальную сборку и может переключиться на будущие версии после их выпуска DeepSeek. Для воспроизводимого поведения в продакшене проверьте, поддерживает ли ваш провайдер идентификаторы моделей с датой. Некоторые сторонние шлюзы предлагают закреплённые маршруты, но перед использованием в продакшене нужно уточнить в документации провайдера, какую именно сборку обслуживает каждый маршрут.
Совместимость протоколов API
Обе модели поддерживают форматы OpenAI ChatCompletions и Anthropic API. Конечная точка Anthropic — https://api.deepseek.com/anthropic. Совместимость с Responses API и Codex появилась именно в GA-сборке. Если после миграции возникнут ошибки, протестируйте оба варианта протокола.
Pro или Flash: что выбрать после повышения цен?
V4-Pro-0813 опережает V4-Flash-0731 по всем десяти опубликованным показателям. Разрыв зависит от сложности задачи:
| Бенчмарк | Pro 0813 | Flash 0731 | Разрыв |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 | 5.2 пункта |
| DeepSWE | 62.7 | 54.4 | 8.3 пункта |
| AutomationBench | 31.8 | 25.1 | 6.7 пункта |
| Cybergym | 83.3 | 76.7 | 6.6 пункта |
V4 Pro стоит выбрать, если:
- Цикл работы агента снова и снова отправляет один и тот же большой префикс. Экономия на попаданиях в кэш сохраняется даже при более высокой базовой ставке
- Для сложных рассуждений, многошаговой работы с инструментами или генерации большого объёма кода вам нужен увеличенный размер модели Pro
- Ваша нагрузка укладывается в лимит 500 параллельных запросов
V4 Flash подойдёт, если:
- Задачи простые, их много или для них критична задержка
- Для параллельного запуска множества задач вам нужен лимит 2 500 одновременных запросов
- Разница в качестве не оправдывает трёхкратную стоимость выходных токенов
Более подробное сравнение моделей смотрите в нашем материале DeepSeek V4 Flash и Pro: сравнение. Протестировать модель без самостоятельного управления API-ключами можно на странице чата V4 Pro и странице чата V4 Flash.
FAQ
Доступны ли веса V4-Pro-0813 для самостоятельного развёртывания?
Да. Веса распространяются под лицензией MIT и доступны на Hugging Face. Для развёртывания предусмотрены варианты с vLLM и SGLang — подробности приведены выше, в разделе об открытых весах.
Стоит ли переходить с V4 Flash на V4 Pro после выхода GA?
Для большинства чувствительных к стоимости сценариев Flash остаётся более выгодным вариантом. По бенчмаркам он уступает Pro от 0.5 пункта (Agents' Last Exam) до 8.5 пункта (HLE с инструментами), зато вывод обходится в 3 раза дешевле. Переходите на Pro, если вашей нагрузке нужен полный размер модели для сложных многошаговых рассуждений или генерации большого объёма кода.
Как уменьшить влияние повышения цен?
Есть три основных способа: переносить пакетные задачи и отложенные агентские процессы на непиковые часы (01:00–04:00 и 06:00–10:00 UTC); максимально увеличивать долю попаданий в кэш, сохраняя стабильными префиксы промптов; отправлять простые задачи во Flash или включать для Pro уровень рассуждений low.
Относится ли тарификация по пиковым и непиковым часам к приложению и сайту DeepSeek?
На официальной странице тарифов описана только тарификация токенов API. Указанное расписание применяется к прямым вызовам API; сторонние шлюзы могут передавать эти цены без изменений, добавлять наценку или использовать собственные тарифы. Актуальные условия проверяйте на странице с тарифами.