Hy3 против DeepSeek V4 Flash: цены, контекст, реальные отзывы

Последнее обновление: 2026-07-14 13:27:45

Если ваша нагрузка — это coding agent, который работает с контекстом примерно до 150K tokens, Hy3 — более умная модель и стоит примерно столько же за input token. Если ваши сессии длятся долго, ваш repo большой или вам нужна высокая concurrency в production, DeepSeek V4 Flash выигрывает по трём параметрам, с которыми Hy3 не может сравниться: окно контекста на 1M tokens, документированная цена $0.0028 за cache-hit и потолок concurrency в 2,500 requests. Это краткая версия решения hy3 vs deepseek v4 flash. Доказательства: pricing проверен 14 июля 2026 года по официальным docs DeepSeek и live listings OpenRouter, third-party benchmark data, а также по сообщениям developers на Hacker News и Reddit после ежедневного использования обеих моделей.

Две модели, две разные ставки

Tencent выпустила финальную версию Hy3 6 июля 2026 года, обновив предварительную версию, которая была доступна с 23 апреля. Согласно этому объявлению, это модель Mixture-of-Experts с 295 млрд общих параметров и 21 млрд активных, построенная вокруг того, что Tencent называет гибридным быстрым и медленным мышлением: модель для каждого запроса определяет, сколько ресурсов на рассуждение ей выделить. Контекст достигает 256K токенов. Веса открыты под Apache 2.0, а API работает на Tencent Cloud TokenHub.

DeepSeek V4 Flash был выпущен в апреле 2026 года как быстрый уровень семейства V4. Это также open-weights MoE (284B всего, 13B активных, по данным Artificial Analysis), но с лицензией MIT и настроен для другой цели: недорогое обслуживание контекста в 1M токенов. Он поддерживает как режим thinking, так и non-thinking (thinking используется по умолчанию), с максимальным объёмом вывода 384K токенов.

Количество параметров выглядит похожим. Цели проектирования — нет. Hy3 расходует свой бюджет на качество рассуждений на токен; Flash — на длину контекста, эффективность кэша и пропускную способность. Большинство практических различий ниже обусловлены именно этим разделением.

Спецификация (проверено 2026-07-14)Hy3DeepSeek V4 Flash
Параметры295B total / 21B active284B total / 13B active
Окно контекста256K1M (384K max output)
РассуждениеГибридное быстрое/медленное мышлениеРежимы thinking и non-thinking
ЛицензияApache 2.0MIT
Выпущен6 июля 2026 (preview 23 апр.)Апрель 2026
Официальный APITencent Cloud TokenHubapi.deepseek.com (форматы OpenAI + Anthropic)

Что на самом деле показывают бенчмарки

В Artificial Analysis Intelligence Index v4.1 Hy3 набирает 41 против 37 у DeepSeek V4 Flash в режиме рассуждения при высоких усилиях. Разница в четыре пункта в этом индексе — это уже реальный разрыв, примерно такой же, как дистанция между Flash и моделями на ступень ниже, но это не разница в классе. Обе модели находятся в категории «очень способные, но не передовые».

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

Перед тем как придавать этому баллу слишком большое значение, есть два оговорки.

Во-первых, бенчмарки agentic coding рассказывают более суровую историю о обеих моделях. Комментатор в обсуждении запуска на Hacker News раскопал результат Hy3 в DeepSWE: 28% против 52% у GPT-5.4 при максимальных усилиях. Ни одна из китайских моделей не близка к frontier agentic coding; они конкурируют друг с другом, а не с лидерами таблицы.

Во-вторых, относитесь к опубликованным поставщиками таблицам бенчмарков от любой компании со стандартной долей скепсиса. Стартовые показатели Hy3 сразу же вызвали в треде HN обвинения в «benchmaxxed», а собственные таблицы DeepSeek охватывают только те evals, которые они решили запустить. На сторонние цифры выше я бы опирался в первую очередь, и они говорят: Hy3 немного умнее, а разрыв достаточно мал, чтобы цена и контекст могли изменить решение.

Ценообразование: цена на ценнике — это отвлекающий фактор

Два прайс-листа, проверенные 14 июля 2026 года, и их стоит хранить отдельно. DeepSeek публикует точные первые цены за токен в документации API. Tencent не публикует эквивалентную англоязычную тарифную сетку для финального Hy3 — в его пресс-релизе указана цена входных данных Hy3 preview примерно $0.18 за миллион токенов на TokenHub — поэтому в столбце Hy3 ниже используются указанные OpenRouter тарифы, то есть рыночная цена, а не цена от первой стороны.

За 1 млн токеновHy3 (маркетплейс OpenRouter)DeepSeek V4 Flash (first-party API)
Ввод$0.14$0.14 (промах кэша)
Ввод, кэшированный$0.035$0.0028 (попадание в кэш)
Вывод$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

Входные цены идентичны. Решение находится в двух других строках.

Множитель попадания в кэш

Цена DeepSeek за cache-hit в 50 раз дешевле, чем его цена за cache-miss, и в 12,5 раза дешевле, чем кэшированная ставка Hy3 на OpenRouter. (Обратите внимание, что эти две кэш-ставки не полностью эквивалентны — цена DeepSeek это цена API от первого лица, а у Hy3 — это то, сколько базовые провайдеры OpenRouter взимают за чтение из кэша — но именно эти ставки вы фактически будете платить сегодня.) Это важнее любого другого числа на этой странице, если вы запускаете agents. Цикл агента повторно отправляет каждый ход один и тот же растущий контекст — system prompt, определения инструментов, содержимое файлов, историю разговора. В сессии из 40 ходов подавляющее большинство ваших входных токенов — это повторы. При 90% rate cache-hit эффективная цена входа у Flash снижается с $0.14 до примерно $0.017 за миллион токенов. У Hy3 она снижается примерно до $0.045 — всё ещё дёшево, но почти в 3 раза дороже, и разрыв увеличивается по мере того, как продолжаются ваши сессии.

Токены вывода — это то, где Hy3 становится дорогим

Оба являются моделями рассуждения, что означает, что оба тарифицируют свои токены мышления как output. У Hy3 ставка за output $0.58 более чем вдвое выше, чем у Flash — $0.28, поэтому каждая расширенная цепочка рассуждений обходится пользователям Hy3 примерно вдвое дороже. У Flash также есть предохранительный клапан, которого нет у Hy3: можно переключиться в режим без мышления для механических задач (форматирование, извлечение, простые правки) и перестать платить за рассуждения, которые вам не нужны. Разбор deepseek-v4-flash-vs-deepseek-v4-pro объясняет, как это переключение режима работает на практике.

Бесплатный тариф

Одно реальное преимущество Hy3: OpenRouter указывает вариант tencent/hy3:free с нулевой стоимостью, с ограничением по частоте запросов, но рабочий. Для оценки модели перед тем, как делать выбор, это лучше, чем у Flash, у которого нет бесплатного API-уровня. Предварительная версия Hy3 также по-прежнему указана по цене $0.063/$0.21 — ниже цены финального релиза — если вас устраивает контрольная точка за апрель.

Налог на окно контекста

Контекст Hy3 в 256K звучит как много, пока не запускаешь агента на реальной кодовой базе. Пользователь Reddit в r/hermesagent, прогоняя обе модели в одном и том же harness, назвал Hy3 «почти идентичным, за исключением размера контекста, так что частая компактация». Компактация — это не просто неудобство: каждый цикл компактации расходует output tokens на суммаризацию, выбрасывает детали и аннулирует ваш prompt cache, а это значит, что вы платите по rate промаха кэша, чтобы восстановить его.

Разрыв становится структурным, если вы разворачиваете модель у себя. Архитектура V4 с разреженным вниманием (DeepSeek называет этот механизм lightning indexer) делает её KV cache значительно легче, чем у Hy3 с обычным вниманием. Это отдельные пользовательские отчёты, а не бенчмарки, но цифры в ветке HN впечатляют: один комментатор, запускавший обе модели на паре DGX Sparks, сообщил, что смог разместить 3M tokens KV cache вместе с DeepSeek V4 Flash, тогда как с Hy3, квантизованной до FP4, получилось примерно 130K tokens. Другой предположил, что как только llama.cpp полностью поддержит indexer, полный контекст Flash в 1M должен требовать лишь около 6GB RAM. У Flash также есть опыт устойчивости к агрессивной квантизации: несколько пользователей в той же ветке сообщают, что она остаётся связной даже при 2-bit, — результата, который для Hy3 пока не был продемонстрирован.

Если ваш сценарий использования остается значительно ниже 200K токенов, весь этот раздел не будет вам ничего стоить, а четыре дополнительных балла интеллекта Hy3 достаются бесплатно. Если же нет, то контекстный налог накапливается: больше сжатия, больше инвалидации кэша, больше памяти на сеанс.

Отчеты с мест с момента запуска

Самый полезный сигнал, который я обнаружил, не в какой-либо таблице бенчмарков. Это разница в характере, которую описывают разработчики, когда они запускают обе модели внутри coding agents.

Пользователь в той же ветке Hacker News, который после отмены своей подписки Anthropic перешёл на DeepSeek V4 Flash и Pro в качестве основных моделей, а затем попробовал Hy3, описал Flash так: скорость отличная, но он «часто строит совершенно неверную ментальную модель и несётся по неправильному пути», требуя регулярной коррекции и сжатия истории. По их опыту, Hy3 «не такой быстрый, но пока, похоже, гораздо надёжнее держится курса» и меньше деградирует по мере роста контекста. Другие участники той же ветки хвалили у Hy3 знание мира и качество прозы как лучшие, чем у Flash, для его размера.

На Reddit картина для чистого кодинга складывается в другую сторону. Сравнение одной и той же задачи в r/LLMDevs поставило "DeepSeek V4 Flash > Hy3 > GLM", при этом всё же назвав Hy3 "многообещающим для практических рабочих процессов кодирования." В r/opencode повторяющееся мнение таково, что Flash "более чем достаточно" для повседневной работы агентом.

Также есть операционная история, которую стоит учитывать. Спрос на запуск Hy3 превысил возможности обслуживания Tencent: пользователи в треде HN сообщали о жёстком rate limiting, а один из тех, кто отслеживает публичные рейтинги использования OpenRouter, отметил, что модель за месяц опустилась с первого места на 8-е–9-е, прямо связывая падение с этими ограничениями. DeepSeek, напротив, документирует потолок одновременных 2,500 запросов для Flash в своём официальном API — в пять раз больше, чем разрешено для V4 Pro. Для production-трафика один из этих вендоров опубликовал гарантии по capacity, а у другого есть история перегрузок.

Как выбрать

  • Agent coding, сеансы короче ~150K токенов: Hy3. Более высокое качество рассуждений, лучше удерживает задачу, а затраты на вход совпадают с ценой Flash. (150K, а не полные 256K, потому что контекст агента растет быстро, и вам нужен запас до того, как сработает compaction.)
  • Длинные сеансы, большие репозитории, RAG по большим документам: Flash обычно лучше подходит. Окно 1M плюс скидка на cache в 50x — это другой класс стоимости, а накладные расходы на compaction у Hy3 съедают его преимущество в интеллекте.
  • Высоконагруженные production API: Flash. Документированная concurrency 2,500, стабильная история serving и non-thinking mode для дешевых массовых вызовов.
  • Писательство, исследования, задачи на world-knowledge: Hy3. Отчеты сообщества и AA knowledge evals оба отдают ему предпочтение в этом размере.
  • Локальное развертывание: Flash для большинства hardware. Его эффективность KV cache и устойчивость к quantization имеют гораздо больше полевых подтверждений; собственная рекомендация Tencent по serving для Hy3, процитированная в launch thread, — восемь GPU класса H20.
  • Оценка перед принятием решения: бесплатный tier OpenRouter у Hy3 ничего не стоит, чтобы попробовать. Прогоните через него свои задачи, прежде чем верить чьей-либо таблице benchmark, включая эту.

Где их запускать

DeepSeek V4 Flash: официальный API предоставляет как конечные точки в формате OpenAI (api.deepseek.com), так и в формате Anthropic (api.deepseek.com/anthropic), что означает, что он подключается к инструментам, совместимым с Claude, при изменении base-URL. Обратите внимание на срок миграции на той же странице с ценами: старые имена моделей deepseek-chat и deepseek-reasoner устаревают 24 июля 2026 года, соответствуя режимам Flash non-thinking и thinking соответственно. OpenRouter предлагает его по $0.09/$0.18, немного ниже официального тарифа, хотя без цен на cache-hit официального API.

Hy3: Tencent Cloud TokenHub — это фирменный маршрут. OpenRouter поддерживает финальный релиз, более дешёвый preview checkpoint и бесплатный tier. SiliconFlow предложил launch promotions. Self-hosting работает под Apache 2.0, если у вас есть GPUs. Руководство по настройке Hy3 API подробно объясняет, как получить ключ и выполнить первый вызов.

Часто задаваемые вопросы

Hy3 можно использовать бесплатно?

Частично. OpenRouter указывает тарифный план с ограничением по скорости tencent/hy3:free по нулевой стоимости, а потребительские продукты Tencent (Yuanbao, ima) используют Hy3 бесплатно. Доступ к Production API через TokenHub или платный тариф OpenRouter тарифицируется по токенам.

Hy3 — это то же самое, что Tencent Hunyuan?

Да — Hy3 — это третье поколение линейки моделей Hunyuan от Tencent, которую теперь Tencent продвигает под брендом «Tencent Hy». Предварительная версия была запущена 23 апреля 2026 года, а финальный релиз — 6 июля 2026 года.

Что лучше для программирования, Hy3 или DeepSeek V4 Flash?

Результаты сообщества разделились по типу задачи. В сравнениях на Reddit для одинаковых задач сырые ответы Flash были оценены выше, чем у Hy3, тогда как пользователи агентского режима при длительных сессиях сообщают, что Hy3 надёжнее удерживает курс. Короткие, чётко ограниченные задачи благоприятствуют скорости Flash; многочасовые агентские сессии, где сбой дорого обходится, больше подходят Hy3, при условии что ваш контекст уверенно укладывается в его окно 256K.

Могу ли я запускать DeepSeek V4 Flash локально?

Да, и более практично, чем Hy3. Веса имеют лицензию MIT, KV cache в архитектуре необычно легковесен, и пользователи отмечают приемлемое качество даже при 2-битной квантизации на машинах с примерно 96 ГБ RAM.

Почему сравнение цен hy3 и deepseek v4 flash такое запутанное?

Поскольку существует как минимум четыре прайс-листа: Tencent TokenHub, финальные и preview-списки Hy3 от OpenRouter и официальный API DeepSeek с отдельной ставкой за cache-hit rate. Сравнивайте эффективную цену для своего собственного паттерна трафика: в агентских рабочих нагрузках преобладает cached input, и именно здесь ставку DeepSeek в $0.0028 трудно превзойти.

Итог

Hy3 — более сильная модель по доступным сторонним данным; DeepSeek V4 Flash — более сильный сервис. Для production API workloads Flash — мой выбор по умолчанию: экономика кеша, размер контекстного окна и заявленная concurrency в сумме дают преимущества, которые не компенсировать четырёхбалльным отрывом в бенчмарке. Выбирайте Hy3, когда качество reasoning на один prompt важнее масштаба — и сначала попробуйте его free tier, поскольку это ничего не стоит, чтобы проверить его на ваших собственных tasks.

Похожие материалы