DeepSeek V4 Pro теперь стоит $0.435 за миллион входных токенов и $0.87 за миллион выходных в официальном API. Та же модель в Azure AI Foundry по-прежнему указана по $1.74 и $3.48, то есть ровно по докорректировочной цене. Этот 4-кратный разрыв, подтверждённый 14 июля 2026 года, — самый важный факт о динамике затрат на enterprise AI DeepSeek прямо сейчас: то, сколько ваша компания платит, зависит меньше от модели и больше от того, через какую дверь вы к ней заходите.
В этой статье приводятся числа с датами для прямого API и Azure, проверяется один путь через реселлера, одна и та же нагрузка прогоняется через обе модели V4 и в конце приводится рамочная схема принятия решения, а также один срок: старые псевдонимы deepseek-chat и deepseek-reasoner будут сняты с поддержки 24 июля 2026 года.
Цены DeepSeek V4 сегодня: цифры, которые важны
Вот официальный прайс-лист из документации API DeepSeek, проверенный 14 июля 2026 года:
| Модель | Ввод (cache hit) | Ввод (cache miss) | Вывод | Контекст | Ограничение на одновременные запросы |
|---|---|---|---|---|---|
| deepseek-v4-flash | $0.0028/M | $0.14/M | $0.28/M | 1M tokens | 2,500 |
| deepseek-v4-pro | $0.003625/M | $0.435/M | $0.87/M | 1M tokens | 500 |
Три детали в этой таблице важнее, чем процентные ставки в заголовке:
- Цена за cache-hit — это настоящая цена для agent workloads. Cache hit на V4 Pro стоит $0.003625 за миллион токенов, что в 120 раз дешевле, чем cache miss. Agent systems, которые повторно отправляют один и тот же system prompt и определения tool на каждом вызове, почти полностью живут в зоне cache, и DeepSeek применяет caching автоматически, без какой-либо настройки.
- Здесь нет рекламной звездочки. Снижение на 75%, которое начиналось как launch promotion, теперь является list price. На странице pricing нет даты истечения. Репортаж InfoWorld объяснял эту постоянность инженерной архитектурой V4 Pro: примерно четверть compute на токен по сравнению с предшественником при long context, так что снижение является структурным, а не субсидией.
- Срок для alias реален. Имена моделей
deepseek-chatиdeepseek-reasonerустаревают 24 июля 2026 года в 15:59 UTC. Production code, который все еще вызывает эти имена, требует однострочной миграции наdeepseek-v4-flashилиdeepseek-v4-pro. Поскольку новые default работают в thinking mode, количество output token (и счета) изменится, если вы явно не зададите mode.
Обе модели поддерживают контекстное окно в 1 млн токенов и до 384K токенов вывода, а API теперь предоставляет Anthropic-compatible формат на api.deepseek.com/anthropic наряду с форматом OpenAI, что важно, если ваша команда хочет заменить DeepSeek в инструментах, созданных для Claude.
Сокращение на 75% коснулось не всех каналов
Azure AI Foundry продает тот же DeepSeek-V4 Pro по $1.74 за вход и $3.48 за выход на миллион токенов (глобальное развертывание, Central US, проверено 14 июля 2026). Это цена до снижения, без изменений. V4 Flash в Azure стоит $0.19/$0.51: премия 36% на вход и 82% на выход по сравнению со ставкой прямого API при промахе кэша.
На странице цен Azure, которую мы проверили (Global deployment, Central US, July 14, 2026), для каких-либо моделей DeepSeek не отображается отдельная строка cached-input; уточните у своей команды Microsoft account team, поскольку цены на marketplace могут отставать от цен вендора. В прямом API агентная нагрузка с интенсивным повторным использованием префикса оплачивает доли цента за миллион входных токенов; в Azure каждый из этих токенов тарифицируется по полной ставке. Для нагрузок с большим объёмом кэша фактический разрыв составляет не 4x; на стороне input он может превышать 100x.
Справедливости ради по отношению к Azure: вы покупаете не совсем то же самое. Хостинг Foundry удерживает трафик внутри облака Microsoft, на условиях обработки данных Microsoft, с SLA Azure и без вывода данных на серверы, управляемые китайской компанией, что для многих команд по комплаенсу и есть главная цель. Microsoft именно так и позиционирует это, подключая DeepSeek к многомодельной маршрутизации Copilot. Но теперь эта премия за управление и контроль стала измеримой: для эталонной нагрузки ниже разница составляет от $31 до $209 в месяц на одну нагрузку, и командам по закупкам следует учитывать это как отдельную статью расходов, а не поглощать как невидимую настройку по умолчанию.
Агрегаторы и API-реселлеры находятся посередине. Платформы вроде OpenRouter передают цены почти по официальному тарифу, а сообщения сообщества отмечают, что глобальный кэш DeepSeek по-прежнему действует и через них. Загвоздка в видимости; ниже мы расскажем об этом подробнее, потому что мы это проверили.
Что стоит настоящая корпоративная нагрузка
Тарифы сами по себе становятся значимыми только тогда, когда вы умножаете их на нагрузку. Возьмём помощника для компании среднего размера: 100 млн входных токенов в месяц (50% попадания в кэш, консервативный показатель для трафика агентов, которые постоянно повторно отправляют системные промпты) плюс 10 млн выходных токенов. Ниже эта же самая нагрузка, оценённая по шести каналам, с использованием тарифов, подтверждённых 14 июля 2026 года:
| Канал | Ежемесячная стоимость |
|---|---|
| DeepSeek V4 Flash, direct API | $9.94 |
| Azure V4 Flash Global | $24.10 |
| DeepSeek V4 Pro, direct API | $30.63 |
| GPT-5.6-Luna (OpenAI) | $115.00 |
| Azure V4 Pro Global | $208.80 |
| GPT-5.6-Sol (OpenAI) | $575.00 |
Математика, лежащая в основе таблицы, пригодна для повторного использования: ежемесячная стоимость = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. Определяющую роль играет доля кэша. Та же рабочая нагрузка с 100M входных токенов на V4 Pro напрямую стоит $52.20 в месяц при 0% попадании в кэш, $30.63 при 50% и $13.38 при 90% — тогда как в Azure она остаётся $208.80 во всех трёх случаях, поскольку скидка за кэш не опубликована.
Два прочтения этой таблицы. Во-первых, самый дешевый канал DeepSeek и самый дорогой frontier-канал отличаются в 58 раз при одинаковом трафике. Во-вторых, и это менее очевидно: Azure's DeepSeek V4 Pro стоит дороже, чем OpenAI's GPT-5.6-Luna. Если в вашем сводном отчете о закупках написано «мы стандартизировали DeepSeek, чтобы сэкономить деньги», но развертывание идет через Azure Global, экономия может оказаться меньше, чем дала бы модель среднего уровня OpenAI.
Множитель, который ломает бюджеты, — это агентное усиление. Одноходовый чатбот обычно выставляет счёт примерно за один вызов на один вопрос пользователя; продакшн-агент объединяет планирование, извлечение, вызовы инструментов и верификацию, и соотношение входных данных к платным запросам может достигать 1:700 — эту величину в анализе экономики агентов VentureBeat за июль 2026 года называет «проблемой 100x». При таком соотношении наш эталонный рабочий набор в 100 млн токенов — это то, что генерирует одна умеренно загруженная агентная функция, а не весь трафик компании. Дешевая цена за токен — это не разрешение игнорировать контроль затрат; именно она делает агентные продукты жизнеспособными, пока вы их создаёте.
Мы запустили ту же самую задачу в V4 Flash и V4 Pro
Страницы с ценами не отвечают на вопрос, который зададут ваши инженеры: сколько стоит один запрос и сколько времени он занимает? 14 июля 2026 года мы отправили идентичную задачу по программированию — "Write a Python function that parses an ISO 8601 duration string into total seconds, with 3 test cases" — обеим моделям V4 с настройками по умолчанию (режим thinking включён, максимум 4,000 выходных токенов) через endpoint реселлера, совместимый с OpenAI. Мы не называем реселлера, потому что суть в поведении этой категории, а не одного поставщика; в сырых ответах присутствовало поле DeepSeek reasoning_content, по которому мы и подтвердили базовую модель:
| V4 Flash | V4 Pro | |
|---|---|---|
| Общее время выполнения | 15.5s | 35.1s |
| Токены завершения (вкл. рассуждения) | 1,690 | 1,902 |
| Эффективная скорость вывода | ~109 tok/s | ~54 tok/s |
| Стоимость по официальным тарифам | ~$0.0005 | ~$0.0017 |
Оговорки, сказанные прямо: это единичный пример, а задержка включает накладные расходы relay, так что относитесь к показателям wall-clock как к верхней границе, а не как к бенчмарку прямого API. Оба ответа вернули фирменное поле DeepSeek reasoning_content: обе модели по умолчанию работают в режиме thinking, и эти reasoning-токены тарифицируются как output. Flash потратил 2,703 символа на рассуждения о функции парсинга перед тем, как ответить. Если вашей нагрузке не нужен chain-of-thought, отключение thinking — одна из самых дешёвых доступных оптимизаций. Для более глубокого сравнения, когда дополнительное качество Pro оправдывает цену в 3x, мы прогнали обе модели через полное сопоставление в DeepSeek V4 Flash vs V4 Pro.
Тест выявил один момент, который мы не видели задокументированным где-либо ещё: в отчётах об использовании канала-посредника не было разбивки по кэшу. Мы дважды подряд отправили один и тот же префикс из 824 токенов — учебный пример cache hit, если реселлер сохраняет префиксное кеширование DeepSeek — и ответ API сообщил только prompt_tokens, completion_tokens и total_tokens, без разделения prompt_cache_hit_tokens. В прямом API именно по этому полю вы проверяете, проходит ли 120-кратная скидка за кэш в ваш счёт. Через посредника вы можете получить скидку, не имея возможности это подтвердить, или не получить её вовсе. Если вы покупаете DeepSeek через любого реселлера, обязательно уточните, передаётся ли цена за cache-hit и как это отображается в вашем счёте.
Прямой API, Azure или агрегатор: как выбрать
Выбор канала сводится к короткой таблице:
| Direct API | Azure AI Foundry | Aggregator/reseller | |
|---|---|---|---|
| V4 Pro price (in/out per M) | $0.435 / $0.87 | $1.74 / $3.48 | Varies; typically near official |
| Cache-hit discount | Да, автоматически, поддаётся аудиту | Не указано | Иногда; часто не поддаётся аудиту |
| Data residency | Серверы DeepSeek | Облако Microsoft, ваш tenant | Инфраструктура реселлера |
| Contract/compliance | Китайское юрлицо | Существующее соглашение Azure | Условия реселлера |
| Concurrency | 500 (Pro) / 2,500 (Flash) | Доступно выделение PTU | Пуловый, варьируется |
| Multi-model consolidation | Только DeepSeek | Каталог Foundry | Широкий каталог, один счёт |
На практике: direct API выигрывает по чистой экономике: ни один канал не сравним по цене cache-hit — $0.003625 за миллион, и это единственный канал, где можно проверить эту скидку. Azure выигрывает, когда ваша юридическая команда не готова одобрить трафик к собственной инфраструктуре DeepSeek; вы платите примерно в 7 раз больше эффективной ставки ради управления и соответствия требованиям, и этот обмен может быть вполне рациональным, если вы осознанно на него идёте. Aggregators выигрывают, когда DeepSeek — одна из нескольких моделей за роутером, а консолидированное выставление счетов стоит небольшой наценки; перед тем как брать на себя объёмы, проверьте, передаётся ли cache pass-through.
Независимо от того, какой канал вы выберете, правила маршрутизации, которые помогают держать счета DeepSeek на одном уровне, не отличаются эффектностью: по умолчанию направляйте классификацию, извлечение и суммаризацию на Flash; оставляйте Pro для генерации кода по нескольким файлам и задач рассуждения в длинном контексте; отключайте thinking mode для детерминированных задач (эти токены рассуждения тарифицируются как output); и ограничивайте глубину цикла агента для каждого workflow. Хорошо настроенный router важнее, чем 3x разница между Flash и Pro.
Почему DeepSeek может предлагать такую низкую цену — и насколько она оправдана
Цены — это не рекламный трюк с убыточной ценой. Архитектура V4 представляет собой конструкцию mixture-of-experts с 1,6 триллионами общих параметров, но только около 49 миллиардов активны на каждый прямой проход: вы выполняете inference объёма вычислений, сопоставимого с моделью среднего размера, получая при этом возможности уровня frontier-class (80,6% на SWE-bench Verified, согласно опубликованным результатам DeepSeek). В версии V4 Pro особое внимание было уделено снижению стоимости длинного контекста, именно поэтому компания превратила свою 75% promotion в постоянную цену вместо того, чтобы позволить ей истечь.
Тренд движения выгоден покупателям. По большинству отраслевых оценок, затраты на unit costs для frontier inference снижаются примерно в 3 раза в год, а сокращение DeepSeek за один год, при том что context length вырос до 1M tokens, опережает даже эту кривую. OpenAI за тот же период пошла в противоположную сторону, подняв позиционирование своего флагманского уровня с GPT-5.6-Sol до $5/$30.
Противовес здесь — эффект Джевонса: более дешёвый inference надёжно приводит к большему объёму inference. Наблюдение New Street Research — цитируемое ещё со времён V3 — о том, что усиление конкуренции редко снижает общие расходы, подтверждалось на всём протяжении строительства AI-экосистемы. Массовое внедрение agent multiplies количество вызовов на пользователя быстрее, чем падают цены за токен, и именно поэтому бюджеты удерживают в рамках те компании, которые рассматривают routing, caching и дисциплину prompt как первоклассную инженерную задачу, а не те, кто просто выбрал самую дешёвую модель. Понимание этих динамик затрат, а не только цены на ценнике, и отличает внедрение DeepSeek, которое остаётся дешёвым, от того, которое незаметно раздувается.
Часто задаваемые вопросы
Почему DeepSeek V4 такой дешёвый?
Архитектура mixture-of-experts: 1,6T общих параметров, ~49B активных на токен. Затраты на вычисления на токен напоминают гораздо меньшую модель, а инженерия длинного контекста в V4 Pro снизила вычисления на токен примерно до четверти по сравнению с предшественником. Ценообразование носит структурный, а не промоакционный характер.
Насколько была снижена цена DeepSeek V4 Pro?
75%: с $1.74/$3.48 за миллион токенов (input/output) до $0.435/$0.87. Это началось как ограниченная акция и стало постоянной ценой по прайс-листу.
Снижение цены на 75% действует в Azure?
Нет. По состоянию на 14 июля 2026 года Azure AI Foundry указывает DeepSeek-V4 Pro Global по цене $1.74/$3.48 — это ставка до снижения, без опубликованной цены за кэшированный ввод. Для нагрузок с интенсивным использованием кэша эффективный разрыв по сравнению с прямым API может превышать 4x; уточняйте актуальные тарифы у Microsoft, поскольку цены на маркетплейсе могут отставать от снижения у вендора.
Бесплатен ли DeepSeek для использования в корпоративной среде?
API оплачивается за токен, но веса модели лицензированы по MIT, поэтому self-hosting законен для коммерческого использования. На масштабе V4 вам понадобится серьёзная GPU-инфраструктура; для большинства команд цена API за токен значительно ниже TCO при self-hosting.
Как стоимость DeepSeek сравнивается со стоимостью ChatGPT?
По ценам API, DeepSeek V4 Pro ($0.435/$0.87) обходится примерно в 11 раз дешевле, чем GPT-5.6-Sol ($5/$30), по входным данным и в 34 раза по выходным. Подписки ChatGPT ($20–$200/месяц за место) — это другой продукт; для программных нагрузок сравнение API-to-API является более значимым.
Что сделать до 24 июля
Три действия, в порядке срочности:
1. Мигрируйте псевдонимы моделей прямо сейчас. deepseek-chat и deepseek-reasoner перестанут разрешаться 24 июля 2026 в 15:59 UTC. Явно закрепите deepseek-v4-flash или deepseek-v4-pro и сознательно задайте режим мышления; значение по умолчанию изменилось, а токены рассуждений тарифицируются как output. 2. Пересчитайте стоимость вашего канала. Если вы используете Azure по причинам governance, подтвердите, что это по-прежнему осознанный выбор при 4x от list и без скидки за cache. Если вы работаете через reseller, получите письменное подтверждение cache pass-through. 3. Проверьте вашу долю cache hits. В direct API смотрите prompt_cache_hit_tokens в данных по использованию. Если трафик вашего agent ниже 50% cache hits, перестройте prompts так, чтобы статический контент шел первым: при разнице 120x между hit и miss порядок prompt — это решение по бюджету.
Модель стала дешевой. Динамика того, кто получает выгоду от этой дешевизны (поставщик, облачный сервис, реселлер или вы), — это то, на чем в этом году зарабатываются и теряются корпоративные деньги.
Похожие материалы: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · Руководство по ценам OpenRouter
