Если ваша нагрузка — это coding agent, который работает с контекстом примерно до 150K tokens, Hy3 — более умная модель и стоит примерно столько же за input token. Если ваши сессии длятся долго, ваш repo большой или вам нужна высокая concurrency в production, DeepSeek V4 Flash выигрывает по трём параметрам, с которыми Hy3 не может сравниться: окно контекста на 1M tokens, документированная цена $0.0028 за cache-hit и потолок concurrency в 2,500 requests. Это краткая версия решения hy3 vs deepseek v4 flash. Доказательства: pricing проверен 14 июля 2026 года по официальным docs DeepSeek и live listings OpenRouter, third-party benchmark data, а также по сообщениям developers на Hacker News и Reddit после ежедневного использования обеих моделей.
Две модели, две разные ставки
Tencent выпустила финальную версию Hy3 6 июля 2026 года, обновив предварительную версию, которая была доступна с 23 апреля. Согласно этому объявлению, это модель Mixture-of-Experts с 295 млрд общих параметров и 21 млрд активных, построенная вокруг того, что Tencent называет гибридным быстрым и медленным мышлением: модель для каждого запроса определяет, сколько ресурсов на рассуждение ей выделить. Контекст достигает 256K токенов. Веса открыты под Apache 2.0, а API работает на Tencent Cloud TokenHub.
DeepSeek V4 Flash был выпущен в апреле 2026 года как быстрый уровень семейства V4. Это также open-weights MoE (284B всего, 13B активных, по данным Artificial Analysis), но с лицензией MIT и настроен для другой цели: недорогое обслуживание контекста в 1M токенов. Он поддерживает как режим thinking, так и non-thinking (thinking используется по умолчанию), с максимальным объёмом вывода 384K токенов.
Количество параметров выглядит похожим. Цели проектирования — нет. Hy3 расходует свой бюджет на качество рассуждений на токен; Flash — на длину контекста, эффективность кэша и пропускную способность. Большинство практических различий ниже обусловлены именно этим разделением.
| Спецификация (проверено 2026-07-14) | Hy3 | DeepSeek V4 Flash |
|---|---|---|
| Параметры | 295B total / 21B active | 284B total / 13B active |
| Окно контекста | 256K | 1M (384K max output) |
| Рассуждение | Гибридное быстрое/медленное мышление | Режимы thinking и non-thinking |
| Лицензия | Apache 2.0 | MIT |
| Выпущен | 6 июля 2026 (preview 23 апр.) | Апрель 2026 |
| Официальный API | Tencent Cloud TokenHub | api.deepseek.com (форматы OpenAI + Anthropic) |
Что на самом деле показывают бенчмарки
В Artificial Analysis Intelligence Index v4.1 Hy3 набирает 41 против 37 у DeepSeek V4 Flash в режиме рассуждения при высоких усилиях. Разница в четыре пункта в этом индексе — это уже реальный разрыв, примерно такой же, как дистанция между Flash и моделями на ступень ниже, но это не разница в классе. Обе модели находятся в категории «очень способные, но не передовые».
Перед тем как придавать этому баллу слишком большое значение, есть два оговорки.
Во-первых, бенчмарки agentic coding рассказывают более суровую историю о обеих моделях. Комментатор в обсуждении запуска на Hacker News раскопал результат Hy3 в DeepSWE: 28% против 52% у GPT-5.4 при максимальных усилиях. Ни одна из китайских моделей не близка к frontier agentic coding; они конкурируют друг с другом, а не с лидерами таблицы.
Во-вторых, относитесь к опубликованным поставщиками таблицам бенчмарков от любой компании со стандартной долей скепсиса. Стартовые показатели Hy3 сразу же вызвали в треде HN обвинения в «benchmaxxed», а собственные таблицы DeepSeek охватывают только те evals, которые они решили запустить. На сторонние цифры выше я бы опирался в первую очередь, и они говорят: Hy3 немного умнее, а разрыв достаточно мал, чтобы цена и контекст могли изменить решение.
Ценообразование: цена на ценнике — это отвлекающий фактор
Два прайс-листа, проверенные 14 июля 2026 года, и их стоит хранить отдельно. DeepSeek публикует точные первые цены за токен в документации API. Tencent не публикует эквивалентную англоязычную тарифную сетку для финального Hy3 — в его пресс-релизе указана цена входных данных Hy3 preview примерно $0.18 за миллион токенов на TokenHub — поэтому в столбце Hy3 ниже используются указанные OpenRouter тарифы, то есть рыночная цена, а не цена от первой стороны.
| За 1 млн токенов | Hy3 (маркетплейс OpenRouter) | DeepSeek V4 Flash (first-party API) |
|---|---|---|
| Ввод | $0.14 | $0.14 (промах кэша) |
| Ввод, кэшированный | $0.035 | $0.0028 (попадание в кэш) |
| Вывод | $0.58 | $0.28 |
Входные цены идентичны. Решение находится в двух других строках.
Множитель попадания в кэш
Цена DeepSeek за cache-hit в 50 раз дешевле, чем его цена за cache-miss, и в 12,5 раза дешевле, чем кэшированная ставка Hy3 на OpenRouter. (Обратите внимание, что эти две кэш-ставки не полностью эквивалентны — цена DeepSeek это цена API от первого лица, а у Hy3 — это то, сколько базовые провайдеры OpenRouter взимают за чтение из кэша — но именно эти ставки вы фактически будете платить сегодня.) Это важнее любого другого числа на этой странице, если вы запускаете agents. Цикл агента повторно отправляет каждый ход один и тот же растущий контекст — system prompt, определения инструментов, содержимое файлов, историю разговора. В сессии из 40 ходов подавляющее большинство ваших входных токенов — это повторы. При 90% rate cache-hit эффективная цена входа у Flash снижается с $0.14 до примерно $0.017 за миллион токенов. У Hy3 она снижается примерно до $0.045 — всё ещё дёшево, но почти в 3 раза дороже, и разрыв увеличивается по мере того, как продолжаются ваши сессии.
Токены вывода — это то, где Hy3 становится дорогим
Оба являются моделями рассуждения, что означает, что оба тарифицируют свои токены мышления как output. У Hy3 ставка за output $0.58 более чем вдвое выше, чем у Flash — $0.28, поэтому каждая расширенная цепочка рассуждений обходится пользователям Hy3 примерно вдвое дороже. У Flash также есть предохранительный клапан, которого нет у Hy3: можно переключиться в режим без мышления для механических задач (форматирование, извлечение, простые правки) и перестать платить за рассуждения, которые вам не нужны. Разбор deepseek-v4-flash-vs-deepseek-v4-pro объясняет, как это переключение режима работает на практике.
Бесплатный тариф
Одно реальное преимущество Hy3: OpenRouter указывает вариант tencent/hy3:free с нулевой стоимостью, с ограничением по частоте запросов, но рабочий. Для оценки модели перед тем, как делать выбор, это лучше, чем у Flash, у которого нет бесплатного API-уровня. Предварительная версия Hy3 также по-прежнему указана по цене $0.063/$0.21 — ниже цены финального релиза — если вас устраивает контрольная точка за апрель.
Налог на окно контекста
Контекст Hy3 в 256K звучит как много, пока не запускаешь агента на реальной кодовой базе. Пользователь Reddit в r/hermesagent, прогоняя обе модели в одном и том же harness, назвал Hy3 «почти идентичным, за исключением размера контекста, так что частая компактация». Компактация — это не просто неудобство: каждый цикл компактации расходует output tokens на суммаризацию, выбрасывает детали и аннулирует ваш prompt cache, а это значит, что вы платите по rate промаха кэша, чтобы восстановить его.
Разрыв становится структурным, если вы разворачиваете модель у себя. Архитектура V4 с разреженным вниманием (DeepSeek называет этот механизм lightning indexer) делает её KV cache значительно легче, чем у Hy3 с обычным вниманием. Это отдельные пользовательские отчёты, а не бенчмарки, но цифры в ветке HN впечатляют: один комментатор, запускавший обе модели на паре DGX Sparks, сообщил, что смог разместить 3M tokens KV cache вместе с DeepSeek V4 Flash, тогда как с Hy3, квантизованной до FP4, получилось примерно 130K tokens. Другой предположил, что как только llama.cpp полностью поддержит indexer, полный контекст Flash в 1M должен требовать лишь около 6GB RAM. У Flash также есть опыт устойчивости к агрессивной квантизации: несколько пользователей в той же ветке сообщают, что она остаётся связной даже при 2-bit, — результата, который для Hy3 пока не был продемонстрирован.
Если ваш сценарий использования остается значительно ниже 200K токенов, весь этот раздел не будет вам ничего стоить, а четыре дополнительных балла интеллекта Hy3 достаются бесплатно. Если же нет, то контекстный налог накапливается: больше сжатия, больше инвалидации кэша, больше памяти на сеанс.
Отчеты с мест с момента запуска
Самый полезный сигнал, который я обнаружил, не в какой-либо таблице бенчмарков. Это разница в характере, которую описывают разработчики, когда они запускают обе модели внутри coding agents.
Пользователь в той же ветке Hacker News, который после отмены своей подписки Anthropic перешёл на DeepSeek V4 Flash и Pro в качестве основных моделей, а затем попробовал Hy3, описал Flash так: скорость отличная, но он «часто строит совершенно неверную ментальную модель и несётся по неправильному пути», требуя регулярной коррекции и сжатия истории. По их опыту, Hy3 «не такой быстрый, но пока, похоже, гораздо надёжнее держится курса» и меньше деградирует по мере роста контекста. Другие участники той же ветки хвалили у Hy3 знание мира и качество прозы как лучшие, чем у Flash, для его размера.
На Reddit картина для чистого кодинга складывается в другую сторону. Сравнение одной и той же задачи в r/LLMDevs поставило "DeepSeek V4 Flash > Hy3 > GLM", при этом всё же назвав Hy3 "многообещающим для практических рабочих процессов кодирования." В r/opencode повторяющееся мнение таково, что Flash "более чем достаточно" для повседневной работы агентом.
Также есть операционная история, которую стоит учитывать. Спрос на запуск Hy3 превысил возможности обслуживания Tencent: пользователи в треде HN сообщали о жёстком rate limiting, а один из тех, кто отслеживает публичные рейтинги использования OpenRouter, отметил, что модель за месяц опустилась с первого места на 8-е–9-е, прямо связывая падение с этими ограничениями. DeepSeek, напротив, документирует потолок одновременных 2,500 запросов для Flash в своём официальном API — в пять раз больше, чем разрешено для V4 Pro. Для production-трафика один из этих вендоров опубликовал гарантии по capacity, а у другого есть история перегрузок.
Как выбрать
- Agent coding, сеансы короче ~150K токенов: Hy3. Более высокое качество рассуждений, лучше удерживает задачу, а затраты на вход совпадают с ценой Flash. (150K, а не полные 256K, потому что контекст агента растет быстро, и вам нужен запас до того, как сработает compaction.)
- Длинные сеансы, большие репозитории, RAG по большим документам: Flash обычно лучше подходит. Окно 1M плюс скидка на cache в 50x — это другой класс стоимости, а накладные расходы на compaction у Hy3 съедают его преимущество в интеллекте.
- Высоконагруженные production API: Flash. Документированная concurrency 2,500, стабильная история serving и non-thinking mode для дешевых массовых вызовов.
- Писательство, исследования, задачи на world-knowledge: Hy3. Отчеты сообщества и AA knowledge evals оба отдают ему предпочтение в этом размере.
- Локальное развертывание: Flash для большинства hardware. Его эффективность KV cache и устойчивость к quantization имеют гораздо больше полевых подтверждений; собственная рекомендация Tencent по serving для Hy3, процитированная в launch thread, — восемь GPU класса H20.
- Оценка перед принятием решения: бесплатный tier OpenRouter у Hy3 ничего не стоит, чтобы попробовать. Прогоните через него свои задачи, прежде чем верить чьей-либо таблице benchmark, включая эту.
Где их запускать
DeepSeek V4 Flash: официальный API предоставляет как конечные точки в формате OpenAI (api.deepseek.com), так и в формате Anthropic (api.deepseek.com/anthropic), что означает, что он подключается к инструментам, совместимым с Claude, при изменении base-URL. Обратите внимание на срок миграции на той же странице с ценами: старые имена моделей deepseek-chat и deepseek-reasoner устаревают 24 июля 2026 года, соответствуя режимам Flash non-thinking и thinking соответственно. OpenRouter предлагает его по $0.09/$0.18, немного ниже официального тарифа, хотя без цен на cache-hit официального API.
Hy3: Tencent Cloud TokenHub — это фирменный маршрут. OpenRouter поддерживает финальный релиз, более дешёвый preview checkpoint и бесплатный tier. SiliconFlow предложил launch promotions. Self-hosting работает под Apache 2.0, если у вас есть GPUs. Руководство по настройке Hy3 API подробно объясняет, как получить ключ и выполнить первый вызов.
Часто задаваемые вопросы
Hy3 можно использовать бесплатно?
Частично. OpenRouter указывает тарифный план с ограничением по скорости tencent/hy3:free по нулевой стоимости, а потребительские продукты Tencent (Yuanbao, ima) используют Hy3 бесплатно. Доступ к Production API через TokenHub или платный тариф OpenRouter тарифицируется по токенам.
Hy3 — это то же самое, что Tencent Hunyuan?
Да — Hy3 — это третье поколение линейки моделей Hunyuan от Tencent, которую теперь Tencent продвигает под брендом «Tencent Hy». Предварительная версия была запущена 23 апреля 2026 года, а финальный релиз — 6 июля 2026 года.
Что лучше для программирования, Hy3 или DeepSeek V4 Flash?
Результаты сообщества разделились по типу задачи. В сравнениях на Reddit для одинаковых задач сырые ответы Flash были оценены выше, чем у Hy3, тогда как пользователи агентского режима при длительных сессиях сообщают, что Hy3 надёжнее удерживает курс. Короткие, чётко ограниченные задачи благоприятствуют скорости Flash; многочасовые агентские сессии, где сбой дорого обходится, больше подходят Hy3, при условии что ваш контекст уверенно укладывается в его окно 256K.
Могу ли я запускать DeepSeek V4 Flash локально?
Да, и более практично, чем Hy3. Веса имеют лицензию MIT, KV cache в архитектуре необычно легковесен, и пользователи отмечают приемлемое качество даже при 2-битной квантизации на машинах с примерно 96 ГБ RAM.
Почему сравнение цен hy3 и deepseek v4 flash такое запутанное?
Поскольку существует как минимум четыре прайс-листа: Tencent TokenHub, финальные и preview-списки Hy3 от OpenRouter и официальный API DeepSeek с отдельной ставкой за cache-hit rate. Сравнивайте эффективную цену для своего собственного паттерна трафика: в агентских рабочих нагрузках преобладает cached input, и именно здесь ставку DeepSeek в $0.0028 трудно превзойти.
Итог
Hy3 — более сильная модель по доступным сторонним данным; DeepSeek V4 Flash — более сильный сервис. Для production API workloads Flash — мой выбор по умолчанию: экономика кеша, размер контекстного окна и заявленная concurrency в сумме дают преимущества, которые не компенсировать четырёхбалльным отрывом в бенчмарке. Выбирайте Hy3, когда качество reasoning на один prompt важнее масштаба — и сначала попробуйте его free tier, поскольку это ничего не стоит, чтобы проверить его на ваших собственных tasks.
