Hy3 vs DeepSeek V4 Flash: Prezzi, contesto, feedback reali

Ultimo Aggiornamento: 2026-07-14 13:15:24

Se il tuo carico di lavoro è un coding agent che resta sotto circa 150K token di contesto, Hy3 è il modello più intelligente e costa più o meno lo stesso per token in input. Se le tue sessioni si protraggono a lungo, il tuo repo è grande o hai bisogno di alta concorrenza in produzione, DeepSeek V4 Flash vince su tre numeri che Hy3 non può eguagliare: una finestra di contesto da 1M token, un prezzo documentato di $0.0028 per cache-hit e un limite di concorrenza di 2,500 richieste. Questa è la versione breve della decisione hy3 vs deepseek v4 flash. Le prove a supporto: prezzi verificati il 14 luglio 2026 rispetto alla documentazione ufficiale di DeepSeek e alle inserzioni live di OpenRouter, dati di benchmark di terze parti e ciò che riportano gli sviluppatori su Hacker News e Reddit dopo averli eseguiti entrambi ogni giorno.

Due modelli, due scommesse diverse

Tencent ha rilasciato la versione finale di Hy3 il 6 luglio 2026, aggiornando la versione di anteprima che era stata online dal 23 aprile. Secondo quell'annuncio, si tratta di un modello Mixture-of-Experts con 295B parametri totali e 21B attivi, costruito attorno a ciò che Tencent chiama un pensiero ibrido veloce-lento: il modello decide per ogni richiesta quanta capacità di ragionamento impiegare. La context window arriva fino a 256K token. I pesi sono open source sotto Apache 2.0 e l'API gira su Tencent Cloud TokenHub.

DeepSeek V4 Flash è stato rilasciato nell’aprile 2026 come la fascia veloce della famiglia V4. È anche un MoE a pesi aperti (284B totali, 13B attivi, secondo Artificial Analysis) ma con licenza MIT e ottimizzato per un obiettivo diverso: servire 1M token di contesto a basso costo. Supporta sia la modalità thinking sia quella non-thinking (thinking è l’impostazione predefinita), con un output massimo di 384K token.

Il conteggio dei parametri sembra simile. Gli obiettivi di progettazione non lo sono. Hy3 investe il suo budget nella qualità del ragionamento per token; Flash lo investe nella lunghezza del contesto, nell'efficienza della cache e nel throughput. La maggior parte delle differenze pratiche riportate di seguito deriva da questa divisione.

Spec (verificato 2026-07-14)Hy3DeepSeek V4 Flash
Parametri295B totali / 21B attivi284B totali / 13B attivi
Finestra di contesto256K1M (384K max output)
RagionamentoPensiero ibrido veloce/lentoModalità di pensiero e non di pensiero
LicenzaApache 2.0MIT
Rilasciato6 luglio 2026 (anteprima 23 apr)aprile 2026
API ufficialeTencent Cloud TokenHubapi.deepseek.com (formati OpenAI + Anthropic)

Cosa mostrano realmente i benchmark

Nell'Artificial Analysis Intelligence Index v4.1, Hy3 ottiene 41 contro 37 per DeepSeek V4 Flash in modalità reasoning ad alto effort. Quattro punti su quell'indice sono un divario reale, circa la distanza tra Flash e i modelli di una fascia inferiore, ma non è una differenza di classe. Entrambi i modelli si collocano nella fascia "very capable, not frontier".

Artificial Analysis comparison cards showing Hy3 at 41 and DeepSeek V4 Flash at 37 on the Intelligence Index

Due avvertenze prima di dare troppo peso a quel punteggio.

Innanzitutto, i benchmark di coding agentico raccontano una storia più severa per entrambi i modelli. Un commentatore nel thread di lancio su Hacker News ha recuperato il risultato DeepSWE di Hy3: 28%, contro il 52% di GPT-5.4 al massimo sforzo. Nessuno dei due modelli cinesi è vicino al coding agentico all’avanguardia; competono tra loro, non con il vertice della classifica.

In secondo luogo, considerate con il consueto scetticismo le tabelle di benchmark pubblicate dal fornitore da entrambe le aziende. I numeri del lancio di Hy3 hanno attirato subito accuse di "benchmaxxed" nel thread di HN, e le tabelle di DeepSeek coprono solo le valutazioni che ha scelto di eseguire. I numeri di terze parti riportati sopra sono quelli su cui farei affidamento, e dicono: Hy3 è leggermente più intelligente, e il divario è מספיקto piccolo da far sì che prezzo e contesto possano ribaltare la decisione.

Prezzi: il prezzo di listino è una distrazione

Due schede tariffarie, verificate il 14 luglio 2026, e da mantenere separate. DeepSeek pubblica prezzi esatti per token di prima parte nella sua documentazione API. Tencent non pubblica una rate card equivalente in inglese per il finale Hy3 — il suo comunicato stampa indica l’input di anteprima Hy3 a circa $0,18 per milione di token su TokenHub — quindi la colonna Hy3 qui sotto usa le tariffe elencate da OpenRouter, un prezzo di mercato piuttosto che uno di prima parte.

Per 1M tokenHy3 (OpenRouter marketplace)DeepSeek V4 Flash (first-party API)
Input$0.14$0.14 (cache miss)
Input, cached$0.035$0.0028 (cache hit)
Output$0.58$0.28
DeepSeek official pricing table showing $0.0028 per 1M cached input tokens

I prezzi di input sono identici. La decisione si trova nelle altre due righe.

Il moltiplicatore di cache-hit

Il prezzo per cache-hit di DeepSeek è 50 volte più economico del suo prezzo per cache-miss e 12,5 volte più economico della tariffa cached di Hy3 su OpenRouter. (Nota: le due tariffe di cache non sono strettamente equivalenti — quella di DeepSeek è un prezzo API di prima parte, quella di Hy3 è ciò che i provider sottostanti di OpenRouter addebitano per le letture della cache — ma sono le tariffe che pagheresti davvero oggi.) Questo conta più di qualsiasi altro numero in questa pagina se esegui agenti. Un ciclo di agenti reinvia a ogni turno lo stesso contesto in crescita — prompt di sistema, definizioni degli strumenti, contenuti dei file, cronologia della conversazione. In una sessione di 40 turni, la stragrande maggioranza dei token di input sono ripetizioni. Con un tasso di cache-hit del 90%, il prezzo effettivo di input di Flash scende da $0,14 a circa $0,017 per milione di token. Quello di Hy3 scende a circa $0,045 — ancora economico, ma quasi 3 volte di più, e il divario si amplia quanto più a lungo durano le tue sessioni.

I token di output sono dove Hy3 diventa costoso

Entrambi sono modelli di ragionamento, il che significa che entrambi contabilizzano i token di pensiero come output. La tariffa di output di Hy3 di $0.58 è più del doppio di quella di Flash, $0.28, quindi ogni catena di ragionamento estesa costa agli utenti Hy3 circa il doppio. Flash ha anche una valvola di sfogo che Hy3 non ha: passare alla modalità non-thinking per attività meccaniche (formattazione, estrazione, modifiche semplici) e smettere di pagare per un ragionamento di cui non hai bisogno. La panoramica deepseek-v4-flash-vs-deepseek-v4-pro illustra come funziona in pratica questo passaggio di modalità.

Il livello gratuito

Un vantaggio concreto di Hy3: OpenRouter elenca una variante tencent/hy3:free a costo zero, con limite di frequenza ma reale. Per valutare il modello prima di impegnarsi, questo è meglio di Flash, che non ha un livello API gratuito. L'anteprima di Hy3 rimane inoltre indicata a $0.063/$0.21 — al di sotto del prezzo della release finale — se puoi convivere con il checkpoint di aprile.

La tassa della finestra di contesto

Il contesto da 256K di Hy3 sembra abbondante finché non esegui un agent su una codebase reale. Un utente di Reddit in r/hermesagent, eseguendo entrambi i modelli nello stesso harness, ha definito Hy3 "praticamente identico tranne che per la dimensione del contesto, quindi compattazione frequente." La compattazione è più di un inconveniente: ogni ciclo di compattazione consuma token di output per il riassunto, elimina dettagli e invalida la cache del prompt, il che significa che paghi il tasso di cache miss per ricostruirla.

Il divario diventa strutturale se lo ospiti in self-hosting. Il design sparse-attention dell'architettura V4 (DeepSeek chiama il meccanismo lightning indexer) rende la sua KV cache drasticamente più leggera rispetto all'attenzione convenzionale di Hy3. Si tratta di segnalazioni di singoli utenti piuttosto che di benchmark, ma i numeri nel thread su HN sono netti: un commentatore che esegue entrambi su una coppia di DGX Sparks ha riferito di riuscire a far entrare 3M token di KV cache insieme a DeepSeek V4 Flash, contro circa 130K token con Hy3 quantizzato a FP4. Un altro ha stimato che, una volta che llama.cpp supporterà completamente l'indexer, il contesto completo da 1M di Flash richiederà solo circa 6GB di RAM. Flash ha anche una comprovata capacità di sopravvivere a una quantizzazione aggressiva: diversi utenti nello stesso thread riferiscono che rimane coerente anche a 2-bit, un risultato non ancora dimostrato per Hy3.

Se il tuo caso d'uso rimane ben al di sotto di 200K token, l'intera sezione non ti costa nulla, e i quattro punti extra di intelligenza di Hy3 sono gratuiti. Se invece supera quel limite, la tassa del contesto si accumula: più compattazione, più invalidazione della cache, più memoria per sessione.

Rapporti sul campo dal lancio

Il segnale più utile che ho trovato non è in nessuna tabella di benchmark. È la differenza di carattere che gli sviluppatori descrivono quando eseguono entrambi i modelli all'interno di agenti di coding.

Un utente nello stesso thread di Hacker News, che è passato a DeepSeek V4 Flash e Pro come modelli principali dopo aver annullato il proprio abbonamento Anthropic e poi ha provato Hy3, ha descritto Flash in questo modo: la velocità è ottima, ma "spesso costruisce un modello mentale completamente sbagliato e si lancia nella direzione sbagliata", richiedendo correzioni regolari e compattazione della cronologia. Hy3, nella loro esperienza, "non è altrettanto veloce, ma finora sembra mantenersi molto più affidabilmente sulla giusta traiettoria" e degrada meno con l'aumentare del contesto. Altri nello stesso thread hanno elogiato la conoscenza del mondo e la qualità della prosa di Hy3 come migliori di quelle di Flash per le sue dimensioni.

L’immagine di Reddit pende dall’altra parte per l’output di coding grezzo. Un confronto sullo stesso task in r/LLMDevs ha classificato "DeepSeek V4 Flash > Hy3 > GLM" definendo comunque Hy3 "promettente per i flussi di lavoro di coding pratici." In r/opencode, il sentimento ricorrente è che Flash sia "più che sufficiente" per il lavoro quotidiano degli agent.

C'è anche uno storico operativo da valutare. La domanda al lancio di Hy3 ha superato la capacità di serving di Tencent: gli utenti nel thread HN hanno segnalato un forte rate limiting, e una persona che monitora le classifiche pubbliche di utilizzo di OpenRouter ha notato che il modello è sceso dal primo posto all'8º–9º entro un mese, attribuendo il calo direttamente a quei limiti. DeepSeek, al contrario, documenta un tetto di 2.500 richieste in concorrenza per Flash sulla sua API ufficiale — cinque volte quello consentito per V4 Pro. Per il traffico di produzione, uno di questi vendor ha pubblicato garanzie di capacità e l'altro ha una storia di congestione.

Come scegliere

  • Codifica agentica, sessioni sotto ~150K token: Hy3. Qualità di ragionamento più alta, rimane meglio sul compito e i costi di input corrispondono al prezzo di listino di Flash. (150K invece dell'intero 256K perché il contesto agentico cresce rapidamente e vuoi margine prima che entri in funzione la compattazione.)
  • Sessioni lunghe, repository grandi, RAG su documenti voluminosi: Flash è di solito la scelta migliore. La finestra da 1M più lo sconto sulla cache di 50x sono una classe di costo diversa, e l'overhead di compattazione di Hy3 erode il suo vantaggio in intelligenza.
  • API di produzione ad alto volume: Flash. Concorrenza documentata di 2.500, storico di serving stabile e modalità non-thinking per chiamate bulk a basso costo.
  • Scrittura, ricerca, task di conoscenza del mondo: Hy3. Le segnalazioni della community e le valutazioni di conoscenza AA lo favoriscono entrambi a questa dimensione.
  • Deployment locale: Flash per la maggior parte dell'hardware. L'efficienza della cache KV e la resilienza alla quantizzazione hanno molte più evidenze sul campo; la guida di serving di Tencent per Hy3, citata nel thread di lancio, parla di otto GPU di classe H20.
  • Valutare prima di impegnarsi: il livello gratuito OpenRouter di Hy3 non costa nulla da provare. Esegui i tuoi task attraverso di esso prima di credere alla tabella dei benchmark di chiunque, inclusa questa.

Dove eseguirli

DeepSeek V4 Flash: la API ufficiale fornisce endpoint sia in formato OpenAI (api.deepseek.com) sia in formato Anthropic (api.deepseek.com/anthropic), il che significa che si integra in strumenti compatibili con Claude con una semplice modifica del base URL. Nota la scadenza per la migrazione su quella stessa pagina dei prezzi: i vecchi nomi di modello deepseek-chat e deepseek-reasoner saranno deprecati il 24 luglio 2026, mappando rispettivamente alle modalità non-thinking e thinking di Flash. OpenRouter lo propone a $0.09/$0.18, leggermente al di sotto della tariffa ufficiale, anche se senza il prezzo per cache-hit dell'API ufficiale.

Hy3: Tencent Cloud TokenHub è il canale first-party. OpenRouter include la versione finale, il checkpoint di anteprima più economico e il tier gratuito. SiliconFlow ha offerto promozioni di lancio. L'auto-hosting funziona con Apache 2.0 se disponi delle GPU. La guida di configurazione dell'API Hy3 illustra come ottenere una chiave ed effettuare la prima chiamata.

FAQ

Hy3 è gratuito da usare?

Parzialmente. OpenRouter elenca un livello tencent/hy3:free con limitazione di frequenza a costo zero, e i prodotti consumer di Tencent (Yuanbao, ima) usano Hy3 senza costi. L'accesso API in produzione tramite TokenHub o il livello a pagamento di OpenRouter è tariffato per token.

Hy3 è la stessa cosa di Tencent Hunyuan?

Sì — Hy3 è la terza generazione della linea di modelli Hunyuan di Tencent, che Tencent ora propone con il marchio "Tencent Hy". L'anteprima è stata lanciata il 23 aprile 2026 e la versione finale il 6 luglio 2026.

Quale è meglio per programmare, Hy3 o DeepSeek V4 Flash?

I risultati della community si dividono in base alla tipologia del task. Nei confronti su Reddit per lo stesso task, l’output grezzo di Flash è stato classificato sopra quello di Hy3, mentre gli utenti di agent con sessioni lunghe segnalano che Hy3 rimane più affidabile sulla giusta rotta. I task brevi e ben definiti favoriscono la velocità di Flash; le sessioni di agent di più ore in cui una deviazione ti costa caro favoriscono Hy3, purché il tuo contesto resti comodamente entro la sua finestra da 256K.

Posso eseguire DeepSeek V4 Flash in locale?

Sì, e più praticamente di Hy3. I pesi sono con licenza MIT, la cache KV dell'architettura è insolitamente leggera, e gli utenti segnalano una qualità utilizzabile anche con quantizzazione a 2 bit su macchine con ~96GB di RAM.

Perché il confronto dei prezzi tra hy3 e deepseek v4 flash è così confuso?

Poiché ci sono almeno quattro tabelle dei prezzi: Tencent TokenHub, le inserzioni finali e di anteprima di Hy3 di OpenRouter, e l'API ufficiale di DeepSeek con il suo tasso separato di cache-hit. Confronta il prezzo effettivo per il tuo pattern di traffico: l'input cachato domina i carichi di lavoro degli agenti, ed è lì che la tariffa di DeepSeek di $0.0028 è difficile da battere.

In sintesi

Hy3 è il modello più forte sulla base delle prove di terze parti disponibili; DeepSeek V4 Flash è il servizio più forte. Per i carichi di lavoro API in produzione, Flash è la mia scelta predefinita: l’economia della cache, la finestra di contesto e la concorrenza pubblicata si sommano in modi che un vantaggio di quattro punti nel benchmark non può compensare. Scegli Hy3 quando la qualità del ragionamento per prompt conta più della scala — e prova prima il suo piano gratuito, visto che non costa nulla verificarlo rispetto ai tuoi stessi task.

Letture correlate