Hy3 vs DeepSeek V4 Flash: Preços, Contexto, Feedback Real

Última Atualização: 2026-07-14 13:16:22

Se sua carga de trabalho é um agente de codificação que permanece abaixo de aproximadamente 150K tokens de contexto, Hy3 é o modelo mais inteligente e custa quase o mesmo por token de entrada. Se suas sessões duram muito, seu repositório é grande ou você precisa de alta concorrência em produção, DeepSeek V4 Flash vence em três números que o Hy3 não consegue igualar: uma janela de contexto de 1M tokens, um preço documentado de $0.0028 por cache hit e um teto de concorrência de 2.500 solicitações. Essa é a versão curta da decisão entre hy3 vs deepseek v4 flash. As evidências por trás disso: preços verificados em 14 de julho de 2026 com base na documentação oficial da DeepSeek e nas listas ao vivo da OpenRouter, dados de benchmarks de terceiros e no que desenvolvedores no Hacker News e no Reddit relatam depois de usar ambos diariamente.

Dois modelos, duas apostas diferentes

A Tencent lançou a versão final do Hy3 em 6 de julho de 2026, atualizando a versão de prévia que estava disponível desde 23 de abril. Segundo esse anúncio, trata-se de um modelo Mixture-of-Experts com 295B de parâmetros no total e 21B ativos, construído em torno do que a Tencent chama de pensamento híbrido rápido e lento: o modelo decide, a cada solicitação, quanto raciocínio gastar. O contexto atinge no máximo 256K tokens. Os pesos são abertos sob a Apache 2.0, e a API funciona no Tencent Cloud TokenHub.

DeepSeek V4 Flash foi lançado em abril de 2026 como a camada rápida da família V4. Também é um MoE de pesos abertos (284B no total, 13B ativos, segundo a Artificial Analysis), mas licenciado sob MIT e ajustado para um objetivo diferente: atender 1M tokens de contexto com baixo custo. Ele suporta os modos com raciocínio e sem raciocínio (o modo com raciocínio é o padrão), com uma saída máxima de 384K tokens.

As contagens de parâmetros parecem semelhantes. Os objetivos de design não são. O Hy3 gasta seu orçamento na qualidade do raciocínio por token; o Flash o gasta em comprimento de contexto, eficiência de cache e throughput. A maioria das diferenças práticas abaixo decorre dessa divisão.

Especificação (verificada em 2026-07-14)Hy3DeepSeek V4 Flash
Parâmetros295B total / 21B ativo284B total / 13B ativo
Janela de contexto256K1M (384K saída máxima)
RaciocínioPensamento híbrido rápido/lentoModos com pensamento e sem pensamento
LicençaApache 2.0MIT
Lançado6 de julho de 2026 (prévia em 23 de abril)Abril de 2026
API oficialTencent Cloud TokenHubapi.deepseek.com (formatos OpenAI + Anthropic)

O que os benchmarks realmente mostram

No Artificial Analysis Intelligence Index v4.1, Hy3 pontua 41 contra 37 para o DeepSeek V4 Flash no modo de raciocínio com alto esforço. Quatro pontos nesse índice é uma diferença real, aproximadamente a distância entre o Flash e os modelos um nível abaixo dele, mas não é uma diferença de categoria. Ambos os modelos se situam na faixa de "muito capazes, mas não de fronteira".

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

Dois cuidados antes de dar muito peso a essa pontuação.

Primeiro, benchmarks de codificação agentic contam uma história mais dura sobre ambos os modelos. Um comentarista no tópico de lançamento no Hacker News desenterrou o resultado do DeepSWE do Hy3: 28%, contra 52% do GPT-5.4 no esforço máximo. Nenhum dos modelos chineses está perto da fronteira da codificação agentic; eles competem entre si, não com o topo do ranking.

Segundo, trate com ceticismo padrão as tabelas de benchmarks publicadas pelos fornecedores de qualquer uma das empresas. Os números de lançamento da Hy3 geraram acusações imediatas de "benchmaxxed" no tópico do HN, e as próprias tabelas da DeepSeek cobrem apenas as avaliações que ela escolheu executar. Os números de terceiros acima são os que eu consideraria como referência, e eles dizem: a Hy3 é um pouco mais inteligente, e a diferença é pequena o suficiente para que preço e contexto possam inverter a decisão.

Preço: o valor de etiqueta é uma distração

Duas tabelas de preços, verificadas em 14 de julho de 2026, e que valem a pena manter separadas. A DeepSeek publica preços exatos por token, diretamente da primeira parte, em sua documentação da API. A Tencent não publica uma tabela de preços equivalente em inglês para o Hy3 final — seu comunicado à imprensa informa que a entrada do pré-lançamento do Hy3 custa aproximadamente US$ 0,18 por milhão de tokens no TokenHub — então a coluna do Hy3 abaixo usa as tarifas listadas pela OpenRouter, um preço de marketplace em vez de um da primeira parte.

Por 1M tokensHy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
Entrada$0.14$0.14 (cache miss)
Entrada, em cache$0.035$0.0028 (cache hit)
Saída$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

Os preços de entrada são idênticos. A decisão está nas outras duas linhas.

O multiplicador de acerto do cache

O preço de cache-hit da DeepSeek é 50x mais barato do que seu preço de cache-miss, e 12,5x mais barato do que a tarifa em cache da Hy3 no OpenRouter. (Observe que as duas tarifas de cache não são estritamente equivalentes — a da DeepSeek é um preço de API first-party, a da Hy3 é o que quer que os provedores subjacentes do OpenRouter cobrem por leituras de cache — mas são as tarifas que você realmente pagaria hoje.) Isso importa mais do que qualquer outro número nesta página se você executa agents. Um loop de agent reenviá o mesmo contexto crescente a cada turno — prompt de sistema, definições de tools, conteúdo de arquivos, histórico da conversa. Em uma sessão de 40 turnos, a grande maioria dos seus tokens de entrada são repetições. Com uma taxa de cache-hit de 90%, o preço efetivo de entrada do Flash cai de US$ 0,14 para cerca de US$ 0,017 por milhão de tokens. O da Hy3 cai para cerca de US$ 0,045 — ainda barato, mas quase 3x mais, e a diferença aumenta quanto mais longas forem as suas sessões.

Os tokens de saída são onde o Hy3 fica caro

Ambos são modelos de raciocínio, o que significa que ambos cobram seus tokens de pensamento como saída. A taxa de saída de $0.58 do Hy3 é mais que o dobro dos $0.28 do Flash, então cada cadeia de raciocínio estendida custa aos usuários do Hy3 cerca do dobro. O Flash também tem uma válvula de escape que o Hy3 não possui: mudar para o modo sem pensamento para tarefas mecânicas (formatação, extração, edições simples) e parar de pagar por raciocínio de que você não precisa. O detalhamento em deepseek-v4-flash-vs-deepseek-v4-pro cobre como essa mudança de modo funciona na prática.

O plano gratuito

Uma vantagem genuína do Hy3: o OpenRouter lista uma variante tencent/hy3:free sem custo, com limite de taxa, mas real. Para avaliar o modelo antes de se comprometer, isso é melhor do que o Flash, que não tem camada de API gratuita. A prévia do Hy3 também continua listada por $0.063/$0.21 — abaixo do preço do lançamento final — se você puder conviver com o checkpoint de abril.

O imposto da janela de contexto

O contexto de 256K do Hy3 parece mais do que suficiente até você executar um agente em uma base de código real. Um usuário do Reddit em r/hermesagent, executando ambos os modelos no mesmo harness, chamou o Hy3 de "quase idêntico, exceto pelo tamanho do contexto, então há compactação frequente." A compactação é mais do que um incômodo: cada ciclo de compactação consome tokens de saída para resumir, descarta detalhes e invalida o cache do seu prompt, o que significa que você paga a taxa de cache miss para reconstruí-lo.

A lacuna se torna estrutural se você hospedar por conta própria. O design de atenção esparsa da arquitetura V4 (a DeepSeek chama o mecanismo de lightning indexer) torna seu cache KV dramaticamente mais leve do que a atenção convencional do Hy3. São relatos de usuários individuais, e não benchmarks, mas os números no fio do HN são contundentes: um comentarista executando ambos em um par de DGX Sparks relatou conseguir acomodar 3M tokens de cache KV junto com o DeepSeek V4 Flash, contra cerca de 130K tokens com o Hy3 quantizado para FP4. Outro estimou que, assim que o llama.cpp oferecer suporte total ao indexer, o contexto completo de 1M do Flash exigirá apenas cerca de 6GB de RAM. O Flash também tem um histórico de sobreviver a quantização agressiva: vários usuários no mesmo fio relatam que ele continua coerente mesmo em 2-bit, um resultado ainda não demonstrado para o Hy3.

Se o seu caso de uso permanecer bem abaixo de 200K tokens, esta seção inteira não custa nada para você, e os quatro pontos extras de inteligência do Hy3 são gratuitos. Se não, o imposto de contexto se acumula: mais compactação, mais invalidação de cache, mais memória por sessão.

Relatórios de campo desde o lançamento

O sinal mais útil que encontrei não está em nenhuma tabela de benchmark. É a diferença de caráter que os desenvolvedores descrevem quando executam ambos os modelos dentro de agentes de codificação.

Um usuário no mesmo thread do Hacker News, que trocou para DeepSeek V4 Flash e Pro como uso diário após cancelar sua assinatura Anthropic e depois experimentar o Hy3, descreveu o Flash desta forma: a velocidade é ótima, mas ele "muitas vezes constrói um modelo mental completamente errado e sai disparado pela rota errada", precisando de correções regulares e compactação do histórico. O Hy3, na experiência dele, "não é tão rápido, mas até agora parece manter o foco de forma muito mais confiável" e degrada menos conforme o contexto cresce. Outros no mesmo thread elogiaram o conhecimento de mundo e a qualidade da prosa do Hy3 como melhores que os do Flash para o tamanho.

A imagem do Reddit pende para o outro lado quando se trata de saída bruta de programação. Uma comparação da mesma tarefa em r/LLMDevs classificou "DeepSeek V4 Flash > Hy3 > GLM" e ainda chamou o Hy3 de "promissor para fluxos de trabalho de programação práticos." Em r/opencode, o sentimento recorrente é que o Flash é "mais do que suficiente" para o trabalho diário com agents.

Há também um histórico operacional a considerar. A demanda no lançamento do Hy3 excedeu a capacidade de atendimento da Tencent: usuários no tópico do HN relataram forte limitação de taxa, e um deles, que acompanha os rankings públicos de uso do OpenRouter, observou que o modelo caiu da 1ª para a 8ª–9ª posição em um mês, atribuindo a queda diretamente a esses limites. O DeepSeek, em contraste, documenta um teto de concorrência de 2.500 solicitações para o Flash em sua API oficial — cinco vezes o que permite para o V4 Pro. Para tráfego de produção, um desses fornecedores publicou garantias de capacidade e o outro tem um histórico de congestionamento.

Como escolher

  • Codificação com agente, sessões abaixo de ~150K tokens: Hy3. Maior qualidade de raciocínio, permanece na tarefa melhor e os custos de entrada correspondem ao preço de tabela do Flash. (150K em vez do 256K completo porque o contexto do agente cresce rápido, e você quer margem antes que a compactação entre em ação.)
  • Sessões longas, grandes repositórios, RAG sobre documentos grandes: Flash costuma ser a melhor opção. A janela de 1M mais o desconto de 50x no cache é uma classe de custo diferente, e a sobrecarga de compactação do Hy3 consome sua vantagem de inteligência.
  • APIs de produção de alto volume: Flash. Concurrency documentada de 2.500, histórico de serving estável e modo não pensante para chamadas em massa baratas.
  • Escrita, pesquisa, tarefas de conhecimento de mundo: Hy3. Relatos da comunidade e as avaliações de conhecimento da AA favorecem ambos a este tamanho.
  • Implantação local: Flash para a maioria do hardware. Sua eficiência de KV cache e resiliência à quantização têm muito mais evidências em campo; a própria orientação de serving da Tencent para Hy3, citada no tópico de lançamento, é oito GPUs classe H20.
  • Avaliando antes de se comprometer: o nível gratuito do OpenRouter do Hy3 não custa nada para testar. Rode suas próprias tarefas nele antes de acreditar na tabela de benchmarks de qualquer pessoa, inclusive nesta.

Onde executá-los

DeepSeek V4 Flash: a API oficial oferece endpoints nos formatos OpenAI (api.deepseek.com) e Anthropic (api.deepseek.com/anthropic), o que significa que ela se integra diretamente a ferramentas compatíveis com Claude com uma mudança de base URL. Observe o prazo de migração na mesma página de preços: os antigos nomes de modelo deepseek-chat e deepseek-reasoner serão descontinuados em 24 de julho de 2026, correspondendo aos modos sem raciocínio e com raciocínio do Flash, respectivamente. O OpenRouter o oferece por US$ 0,09/US$ 0,18, ligeiramente abaixo da tarifa oficial, embora sem a precificação por cache-hit da API oficial.

Hy3: Tencent Cloud TokenHub é a rota oficial do first-party. A OpenRouter oferece a versão final, o checkpoint de prévia mais barato e o plano gratuito. A SiliconFlow ofereceu promoções de lançamento. O self-hosting funciona sob a Apache 2.0 se você tiver GPUs. O guia de configuração da API Hy3 orienta você na obtenção de uma chave e na realização da primeira chamada.

Perguntas Frequentes

O Hy3 é gratuito para usar?

Parcialmente. A OpenRouter lista um nível tencent/hy3:free com limite de taxa e custo zero, e os produtos de consumo da Tencent (Yuanbao, ima) usam Hy3 sem custo. O acesso à API em produção por meio do TokenHub ou do nível pago da OpenRouter é cobrado por token.

Hy3 é o mesmo que Tencent Hunyuan?

Sim — Hy3 é a terceira geração da linha de modelos Hunyuan da Tencent, que a Tencent agora chama de "Tencent Hy." A prévia foi lançada em 23 de abril de 2026, e a versão final em 6 de julho de 2026.

Qual é melhor para programar, Hy3 ou DeepSeek V4 Flash?

Resultados da comunidade divididos por tipo de tarefa. Comparações no Reddit da mesma tarefa classificaram a saída bruta do Flash acima da do Hy3, enquanto usuários de agentes em sessões longas relatam que o Hy3 se mantém no rumo com mais confiabilidade. Tarefas curtas e bem delimitadas favorecem a velocidade do Flash; sessões de agente de várias horas, em que sair do trilho custa caro, favorecem o Hy3, desde que seu contexto permaneça confortavelmente dentro de sua janela de 256K.

Posso executar o DeepSeek V4 Flash localmente?

Sim, e de forma mais prática do que o Hy3. Os pesos têm licença MIT, o cache KV da arquitetura é incomumente leve, e os usuários relatam qualidade utilizável até mesmo com quantização de 2 bits em máquinas com ~96GB de RAM.

Por que a comparação de preços entre hy3 e deepseek v4 flash é tão confusa?

Como há pelo menos quatro tabelas de preços: Tencent TokenHub, as listagens final e preview do Hy3 da OpenRouter e a API oficial da DeepSeek com sua taxa separada de cache-hit. Compare o preço efetivo para o seu próprio padrão de tráfego: entradas em cache dominam as cargas de trabalho de agentes, e é aí que a taxa de US$ 0,0028 da DeepSeek é difícil de superar.

Conclusão

Hy3 é o modelo mais forte com base nas evidências de terceiros disponíveis; DeepSeek V4 Flash é o serviço mais forte. Para cargas de trabalho de API em produção, Flash é minha opção padrão: sua economia de cache, janela de contexto e concorrência publicada se combinam de formas que uma vantagem de quatro pontos em benchmark não consegue compensar. Opte pelo Hy3 quando a qualidade do raciocínio por prompt importar mais do que a escala — e teste primeiro o plano gratuito, já que não custa nada verificar em relação às suas próprias tarefas.

Leituras relacionadas