С 16 августа 2026 года API DeepSeek больше не работает по единым ставкам за токен. Для deepseek-v4-flash и deepseek-v4-pro теперь действуют отдельные цены в часы пик и вне пика. В непиковое время вход без попадания в кэш и выходные токены подорожали в 1,5–2,4 раза, а в пиковые часы — ещё вдвое. Самый заметный рост пришёлся на кэшированные входные токены: от 2,5–6,1 раза вне пика и до 12,1 раза в пик. Насколько вырастет именно ваш счёт, в первую очередь зависит от доли попаданий в prompt cache.
Что изменилось 16 августа 2026 года
Переход произошёл в воскресенье, 16 августа, в 16:00 UTC — это уже полночь 17 августа по пекинскому времени. Время подтверждают и ветка с объявлением, и аудит 650 запросов в r/DeepSeek. На официальной странице Models & Pricing уже опубликованы новые таблицы — это не анонс будущих изменений, а действующие тарифы.
DeepSeek разделил сутки на пиковые и непиковые окна. В пике цены ровно в 2 раза выше непиковых. Пиковые интервалы: 01:00–04:00 UTC и 06:00–10:00 UTC — всего семь часов в сутки; остальные семнадцать часов относятся к непиковым. Версии моделей (DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), совместимость API и заявленные характеристики, согласно той же официальной странице, не изменились. Меняется биллинг, а не сами модели.
Новые тарифы DeepSeek API
Все цены ниже указаны в долларах США за 1 млн токенов и взяты с официальной страницы тарифов по состоянию на 16 августа 2026 года.
| V4 Flash | Вне пика | Пик |
|---|---|---|
| Вход, попадание в кэш | $0.007 | $0.014 |
| Вход, промах кэша | $0.22 | $0.44 |
| Выход | $0.66 | $1.32 |
| V4 Pro | Вне пика | Пик |
|---|---|---|
| Вход, попадание в кэш | $0.022 | $0.044 |
| Вход, промах кэша | $0.66 | $1.32 |
| Выход | $1.98 | $3.96 |
Остальная механика биллинга не изменилась: запрос оплачивается по тарифу, действующему в момент его выполнения. DeepSeek также прямо оставляет за собой право вновь менять цены.
Насколько реально выросли цены DeepSeek API
Старые единые тарифы подтверждались сторонними трекерами до 31 июля 2026 года: для Flash — $0.14 за вход без кэша, $0.0028 за попадание в кэш и $0.28 за выход; для Pro — $0.435 / $0.003625 / $0.87 (TLDL, BenchLM). Вот прямое сравнение старой и новой сетки:
| За 1 млн токенов | Старый единый тариф | Новый вне пика | Новый в пик | Вне пика к старому | Пик к старому |
|---|---|---|---|---|---|
| Flash: вход, попадание в кэш | $0.0028 | $0.007 | $0.014 | 2.5× | 5.0× |
| Flash: вход, промах кэша | $0.14 | $0.22 | $0.44 | 1.57× | 3.14× |
| Flash: выход | $0.28 | $0.66 | $1.32 | 2.36× | 4.71× |
| Pro: вход, попадание в кэш | $0.003625 | $0.022 | $0.044 | 6.07× | 12.14× |
| Pro: вход, промах кэша | $0.435 | $0.66 | $1.32 | 1.52× | 3.03× |
| Pro: выход | $0.87 | $1.98 | $3.96 | 2.28× | 4.55× |
Цифра «рост на 1 114%», которую обсуждают на Reddit, верна, но описывает очень частный случай: вход V4 Pro из кэша в пиковые часы ($0.003625 -> $0.044). Для нагрузки вообще без кэша в непиковое время рост ближе к 1,5–2,3 раза. Итоговый множитель для вашего случая будет лежать между этими крайностями — и именно он имеет значение.
Почему сильнее всего подорожали сценарии с активным кэшированием
Стоимость входных токенов при попадании в кэш выросла в 2,5–12 раз, тогда как вход без кэша и выход подорожали в 1,5–4,7 раза. Поэтому чем больше трафика раньше проходило по сверхдешёвому кэшированному тарифу, тем выше процентный рост расходов. Один пользователь r/DeepSeek пересчитал 650 реальных API-вызовов: 16 сессий, 155,9 млн токенов промптов и 98,09% попаданий в кэш. Результат он сверил с биллингом в консоли DeepSeek, расхождение составило менее 2%:
«чем лучше у вас сегодня работает кэширование, тем сильнее вырастут расходы» — u/Swimming-Soup-1173, аудит 650 API-вызовов в r/DeepSeek
Для его агентной нагрузки пересчёт дал 2.7× вне пика, против 1,5× для той же нагрузки при нулевых попаданиях в кэш. Другой пользователь смоделировал длинноконтекстный сценарий: счёт вырастает с $33 до $100 вне пика или до $200 в пик — то есть в 3–6 раз. Под наибольшим давлением оказываются пакетные задачи, RAG-конвейеры и агенты со статичными системными промптами. Одноразовая суммаризация без повторяемого контекста, напротив, ближе к непиковому минимуму в 1,5–2,3 раза.
Часы пик по часовым поясам
Официальная страница приводит интервалы только в UTC. Ниже — пересчёт для августа, когда действует летнее время:
| Часовой пояс | Пиковые интервалы по местному времени | Ваш рабочий день с 9 до 17 |
|---|---|---|
| Пекин (UTC+8) | 09:00–12:00, 14:00–18:00 | Пик, кроме обеда с 12:00 до 14:00 |
| Центральная Европа (UTC+2) | 03:00–06:00, 08:00–12:00 | Пиковое утро |
| Лондон (UTC+1) | 02:00–05:00, 07:00–11:00 | Пиковое утро |
| Восток США (UTC-4) | 21:00–00:00, 02:00–06:00 | Полностью вне пика |
| Запад США (UTC-7) | 18:00–21:00, 23:00–03:00 | Полностью вне пика |
Пиковые окна почти совпадают с рабочим днём в Китае, за вычетом обеда: с 12:00 до 14:00 по Пекину действует непиковый тариф. Американские команды проводят весь рабочий день вне пика. Европейским командам придётся платить вдвое за утренние пакетные задачи — 08:00–12:00 CEST относятся к пику, поэтому такие процессы стоит переносить на вторую половину дня или ночь.
Стоит ли теперь использовать prompt cache
Да, безусловно. Скидка стала меньше, но никуда не исчезла. Раньше кэшированный вход был примерно в 50 раз дешевле входа без кэша для Flash и в 120 раз — для Pro. Теперь для обеих моделей разница составляет около 30 раз: вне пика 31× у Flash и 30× у Pro — $0.007 против $0.22 и $0.022 против $0.66. Автор аудита, который зафиксировал рост в 2,7 раза, пришёл к тому же выводу:
«Кэширование по-прежнему однозначно того стоит» — тот же аудит r/DeepSeek
В его нагрузке кэширование всё ещё снижало расходы примерно в 15 раз по сравнению с отправкой того же контекста без кэша. Кэш работает в режиме best-effort: процент попаданий не гарантирован, а неиспользуемые записи обычно удаляются через срок от нескольких часов до нескольких дней (BenchLM). Поэтому бюджет лучше строить по собственным замерам: логируйте поля prompt_cache_hit_tokens и prompt_cache_miss_tokens в объекте usage, как рекомендует BenchLM, и считайте фактическую долю попаданий.
Остаётся ли DeepSeek бюджетным вариантом
Вне пика — да. В пиковые часы преимущество Flash над GPT-5.6 практически исчезает. Ниже приведены стандартные цены за 1 млн токенов:
| Модель | Вход | Выход | Примечания |
|---|---|---|---|
| DeepSeek V4 Flash (вне пика) | $0.22 | $0.66 | Контекст 1M |
| DeepSeek V4 Flash (пик) | $0.44 | $1.32 | Выход дороже Luna |
| GPT-5.6 Luna | $0.20 | $1.20 | Снижение цены на 80% 30 июля |
| DeepSeek V4 Pro (вне пика) | $0.66 | $1.98 | Всё ещё примерно в 6× дешевле Terra |
| DeepSeek V4 Pro (пик) | $1.32 | $3.96 | Примерно в 3× дешевле Terra |
| GPT-5.6 Terra | $2 | $12 | |
| Claude Sonnet 5 | $2 | $10 | Стартовый тариф до 31 августа, затем $3/$15 |
Вне пика выход V4 Flash за $0.66 на 45% дешевле GPT-5.6 Luna и в 18 раз дешевле Terra: для высокообъёмных задач DeepSeek остаётся самым дешёвым по выходным токенам. Но в пик Luna с $1.20 за выход и $0.20 за вход обходит Flash по обеим обычным ставкам. При этом чтение кэша Luna стоит $0.02 за 1M по журналу изменений AI Price Index, то есть дороже кэшированного входа Flash в любое время суток. У Flash также заявлены контекст 1M токенов и 2 500 одновременных запросов в официальной таблице характеристик. Как написал один из комментаторов в ветке анонса: «DS4 хороша, пока дешёвая».
Что сделать на этой неделе
- Сначала пересчитайте собственный счёт. Возьмите логи использования за прошлый месяц и посчитайте: кэшированный вход × доля попаданий × цена попадания + вход без кэша × доля промахов × цена промаха + выход × цена выхода. Для каждого запроса используйте пиковый или непиковый тариф, действовавший в его временном окне. Границы диапазона видны по аудиту: 1,5× при нулевом кэше и 2,7× при 98% попаданий.
- Перенесите пакетные задачи из пика. Cron-задачи, оценки, обработку документов — всё, что не ждёт пользователь, — можно запускать в 17 непиковых часов. Для команд в США это почти не требует усилий: рабочий день и так проходит вне пика. Европейским командам стоит переносить утренние пакеты на вторую половину дня.
- Продолжайте добиваться попаданий в кэш. Если текущая структура промптов уже даёт вам cache hits, сохраняйте её: кэшированный вход всё ещё примерно в 30 раз дешевле входа без кэша.
- Проверьте Flash на рутинных запросах. Pro везде стоит в 3 раза дороже Flash, а на кэшированных токенах — в 3,1 раза. Если вы не тестировали Flash после обновления post-training 0731, направьте на него часть обычного трафика. Компромиссы при выборе модели разобраны в нашем сравнении V4 Flash и V4 Pro.
- Миграция при уходе может быть небольшой. В клиентах с совместимостью OpenAI переход часто сводится к замене base URL и ID модели. Сторонние хостинги и relay-платформы используют собственные тарифы: DataLLM Lab фиксировал у хостов цены V4 Pro около $1.74/$3.48 за 1M ещё до этого повышения. Сравнивайте не рекламную цену, а фактическую ставку.
Решение — в одной таблице:
| Ваш сценарий | Что делать |
|---|---|
| Часовой пояс США, агентный трафик с активным кэшем | Оставаться — непиковые цены и кэшированный тариф примерно в 30× ниже сохраняют минимальную стоимость входа для кэш-зависимого трафика |
| Часовой пояс Европы, утренние пакетные задачи | Оставаться, но перенести расписание — попадание в пик создаётся самим графиком и его можно избежать |
| Только пиковые часы, чувствительное к качеству программирование на Pro | Пересмотреть выбор — пиковый выход Pro ($3.96) всё ещё дешевле Terra ($12), но разрыв теперь 3×, а не 14×, как до 16 августа |
| Одноразовые задачи без кэша | Оставаться — рост в 1,5–2,3× вне пика минимален в таблице |
FAQ
Когда именно начали действовать новые цены DeepSeek?
16 августа 2026 года в 16:00 UTC, или в полночь 17 августа по пекинскому времени. Это подтверждают ветка с объявлением и аудит 650 запросов в r/DeepSeek. В тот же день новые таблицы появились на официальной странице тарифов.
Насколько вырастет мой счёт за DeepSeek?
Для нагрузки без кэша пересчёт даёт примерно 1,5× вне пика, а для измеренной нагрузки с 98% попаданий — 2,7×. В пиковые часы эти показатели удваиваются; для кэшированного входа Pro рост доходит до 12×. Все пары тарифов приведены в таблице выше.
Какие часы считаются пиковыми в США?
Восточное время США: 21:00–00:00 и 02:00–06:00. Тихоокеанское время США: 18:00–21:00 и 23:00–03:00. Обычные рабочие часы в США целиком попадают в непиковые окна.
Доступны ли ещё deepseek-chat и deepseek-reasoner?
Нет. Срок отключения устаревших алиасов истёк 24 июля 2026 года, согласно истории ID моделей BenchLM. В новых интеграциях следует вызывать deepseek-v4-flash или deepseek-v4-pro.
DeepSeek всё ещё дешевле GPT-5.6 и Claude?
Вне пика — да: выход Flash на 45% дешевле GPT-5.6 Luna и в 18 раз дешевле Terra. В пик $1.20 за 1M выходных токенов у Luna ниже, чем $1.32 за 1M у Flash, поэтому ответ зависит от времени выполнения вашего трафика.