Dinamiche dei costi dell'AI Enterprise di DeepSeek: chi ha ottenuto il taglio del 75%?

Ultimo Aggiornamento: 2026-07-15 02:19:22

DeepSeek V4 Pro ora costa $0.435 per milione di token in input e $0.87 per milione di output sull'API ufficiale. Lo stesso modello su Azure AI Foundry è ancora indicato a $1.74 e $3.48, esattamente il prezzo precedente al taglio. Questo divario 4x, verificato il 14 luglio 2026, è il dato singolarmente più importante sulle dinamiche dei costi dell'IA enterprise di DeepSeek in questo momento: ciò che la tua azienda paga dipende meno dal modello e più dalla porta attraverso cui ci accedi.

Questo articolo mette numeri con data e ora sulla API diretta e su Azure, testa un percorso tramite un rivenditore, esegue lo stesso carico di lavoro attraverso entrambi i modelli V4 e si conclude con un framework decisionale, più una scadenza: i vecchi alias deepseek-chat e deepseek-reasoner andranno in pensione il 24 luglio 2026.

Prezzi di DeepSeek V4 oggi: i numeri che contano

Ecco il listino prezzi ufficiale dalla documentazione API di DeepSeek, verificato il 14 luglio 2026:

ModelloInput (cache hit)Input (cache miss)OutputContestoLimite di concorrenza
deepseek-v4-flash$0.0028/M$0.14/M$0.28/M1M tokens2,500
deepseek-v4-pro$0.003625/M$0.435/M$0.87/M1M tokens500
DeepSeek official API pricing table showing V4 Flash and V4 Pro rates per million tokens

Tre dettagli in quella tabella contano più dei tassi principali:

  • Il prezzo cache-hit è il prezzo reale per i workload degli agenti. Un cache hit su V4 Pro costa $0.003625 per milione di token, 120 volte meno di un cache miss. I sistemi agentici che reinviano a ogni chiamata lo stesso system prompt e le stesse definizioni degli strumenti vivono quasi interamente nel territorio della cache, e DeepSeek applica la cache automaticamente, senza configurazione.
  • Non c’è alcun asterisco promozionale. La riduzione del 75% che era iniziata come promozione di lancio è ora il prezzo di listino. La pagina dei prezzi non riporta alcuna data di scadenza. Il reporting di InfoWorld attribuiva la permanenza all’ingegneria di V4 Pro: circa un quarto del compute per token del suo predecessore a lungo contesto, quindi il taglio è strutturale, non un sussidio.
  • La scadenza dell’alias è reale. I nomi dei modelli deepseek-chat e deepseek-reasoner sono deprecati il 24 luglio 2026 alle 15:59 UTC. Il codice in produzione che chiama ancora quei nomi necessita di una migrazione in una riga a deepseek-v4-flash o deepseek-v4-pro. Poiché i nuovi default vengono eseguiti in modalità thinking, il numero di token in output (e le fatture) cambierà se non imposti esplicitamente la modalità.

Entrambi i modelli espongono una finestra di contesto da 1M token e fino a 384K token di output, e l'API ora fornisce un formato compatibile con Anthropic all'indirizzo api.deepseek.com/anthropic insieme al formato OpenAI, il che è importante se il tuo team vuole integrare DeepSeek in strumenti costruiti per Claude.

Il taglio del 75% non ha riguardato tutti i canali

Azure AI Foundry vende lo stesso DeepSeek-V4 Pro a $1.74 in input e $3.48 in output per milione di token (distribuzione globale, Stati Uniti centrali, verificato il 14 luglio 2026). Questo è il prezzo precedente al taglio, invariato. V4 Flash su Azure costa $0.19/$0.51: un sovrapprezzo del 36% sull'input e dell'82% sull'output rispetto al tasso di cache-miss dell'API diretta.

Azure AI Foundry pricing table listing DeepSeek V4 Pro Global at $1.74 input and $3.48 output per million tokens

Nella pagina dei prezzi di Azure che abbiamo controllato (Global deployment, Central US, 14 luglio 2026), non compare alcuna voce di costo per cached-input per nessun modello DeepSeek; confermalo con il tuo team Microsoft account, poiché i prezzi del marketplace possono essere in ritardo rispetto ai prezzi del vendor. Sulla API diretta, un workload agent con un forte riuso del prefisso paga frazioni di centesimo per milione di input token; su Azure, ognuno di quei token viene fatturato alla tariffa piena. Per i workload con forte uso della cache, il divario effettivo non è 4x; può superare 100x sul lato input.

Per essere giusti con Azure, non stai acquistando la stessa cosa. L'hosting di Foundry mantiene il traffico all'interno del cloud di Microsoft, sotto i termini di trattamento dei dati di Microsoft, con SLA di Azure e senza che i dati escano verso server gestiti da un'azienda cinese, il che per molti team di compliance è esattamente il punto. Microsoft si sta posizionando proprio in questo modo mentre integra DeepSeek nel routing multi-model di Copilot. Ma questo premium di governance è ora quantificabile: per il workload di riferimento qui sotto, la differenza è tra 31 $ e 209 $ al mese per workload, e i team di procurement dovrebbero considerarlo come una voce di costo, non assorbirlo come un'impostazione predefinita invisibile.

Gli aggregator e i rivenditori API si collocano nel mezzo. Piattaforme come OpenRouter trasferiscono i prezzi quasi alla tariffa ufficiale e le segnalazioni della community indicano che la cache globale di DeepSeek continua ad applicarsi anche tramite loro. Il problema è la visibilità; ne parleremo più avanti, perché l'abbiamo testato.

Quanto costa realmente un carico di lavoro aziendale

Le tariffe sulla carta diventano decisioni solo quando le moltiplichi per un carico di lavoro. Prendiamo un assistente per un’azienda di medie dimensioni: 100M token in input al mese (50% di cache hit, un tasso prudente per il traffico degli agenti che reinvia costantemente i prompt di sistema) più 10M token in output. Ecco lo stesso identico carico di lavoro prezzato su sei canali, usando le tariffe verificate il 14 luglio 2026:

Bar chart comparing monthly cost of the same workload across six channels, from $9.94 on DeepSeek V4 Flash direct to $575 on GPT-5.6-Sol
CanaleCosto mensile
DeepSeek V4 Flash, API diretta$9.94
Azure V4 Flash Global$24.10
DeepSeek V4 Pro, API diretta$30.63
GPT-5.6-Luna (OpenAI)$115.00
Azure V4 Pro Global$208.80
GPT-5.6-Sol (OpenAI)$575.00

La matematica dietro la tabella è riutilizzabile: costo mensile = miss_tokens x miss_rate + hit_tokens x hit_rate + output_tokens x output_rate. La quota di cache la domina. Lo stesso carico di lavoro da 100M input su V4 Pro costa direttamente $52.20 al mese con 0% di cache hit, $30.63 al 50% e $13.38 al 90% - mentre su Azure resta $208.80 in tutti e tre i casi, perché non viene pubblicato alcuno sconto per la cache.

Due letture di quella tabella. Primo, il canale DeepSeek più economico e il canale frontier più costoso differiscono di 58x sullo stesso traffico. Secondo, e meno ovvio: DeepSeek V4 Pro su Azure costa più di GPT-5.6-Luna di OpenAI. Se il tuo riepilogo degli acquisti dice "abbiamo standardizzato su DeepSeek per risparmiare denaro" ma la distribuzione è Azure Global, il risparmio potrebbe essere inferiore a quello che offrirebbe un modello OpenAI di fascia media.

Il moltiplicatore che fa saltare i budget è l’amplificazione agentica. Un chatbot a turno singolo addebita grosso modo una chiamata per ogni domanda dell’utente; un agente in produzione concatena pianificazione, retrieval, chiamate agli strumenti e verifica, e il rapporto tra input e token addebitati può arrivare a 1:700, una cifra che l’analisi di VentureBeat del luglio 2026 sull’economia degli agenti definisce il “problema 100x.” A quel rapporto, il nostro workload di riferimento da 100M token è ciò che genera una funzionalità agente moderatamente trafficata, non il traffico di un’intera azienda. Un prezzo basso per token non è una licenza per saltare i controlli dei costi; è ciò che rende i prodotti agentici sostenibili mentre li costruisci.

Abbiamo eseguito lo stesso job su V4 Flash e V4 Pro

Le pagine dei prezzi non rispondono alla domanda che i vostri ingegneri si faranno: quanto costa una singola richiesta e quanto tempo richiede? Il 14 luglio 2026 abbiamo inviato l'identico compito di coding - "Write a Python function that parses an ISO 8601 duration string into total seconds, with 3 test cases" - a entrambi i modelli V4 con le impostazioni predefinite (thinking mode attivata, massimo 4.000 token di output) tramite un endpoint reseller compatibile con OpenAI. Non nominiamo il reseller perché il punto è il comportamento della categoria, non quello di un singolo fornitore; le risposte grezze contenevano il campo reasoning_content di DeepSeek, che è il modo in cui abbiamo confermato il modello sottostante:

V4 FlashV4 Pro
Tempo trascorso15.5s35.1s
Token di completamento (incl. reasoning)1,6901,902
Velocità di output effettiva~109 tok/s~54 tok/s
Costo alle tariffe ufficiali~$0.0005~$0.0017

Le avvertenze sono espresse in modo chiaro: questo è un singolo campione, e la latenza include l’overhead del relay, quindi considerate i numeri di wall-clock come un limite superiore piuttosto che come un benchmark dell’API diretta. Entrambe le risposte hanno restituito il campo distintivo reasoning_content di DeepSeek: entrambi i modelli eseguono di default la modalità thinking, e quei token di ragionamento vengono addebitati come output. Flash ha impiegato 2.703 caratteri a ragionare su una funzione di parsing prima di rispondere. Se il vostro workload non ha bisogno della chain-of-thought, disattivare thinking è una delle ottimizzazioni più economiche disponibili. Per un confronto più approfondito su quando la qualità extra di Pro giustifica un prezzo 3 volte superiore, abbiamo eseguito entrambi i modelli in un confronto completo in DeepSeek V4 Flash vs V4 Pro.

Il test ha evidenziato un aspetto che non abbiamo visto documentato altrove: i report di utilizzo del canale relay non includevano alcuna ripartizione della cache. Abbiamo inviato due volte di seguito lo stesso prefisso di 824 token - un classico cache hit se il rivenditore preserva il prefix caching di DeepSeek - e la risposta dell'API riportava solo prompt_tokens, completion_tokens e total_tokens, senza alcuna suddivisione di prompt_cache_hit_tokens. Sulla API diretta, quel campo è ciò che usi per verificare se lo sconto cache 120x si riflette sulla tua fattura. Tramite un intermediario, potresti ricevere lo sconto senza poterlo verificare, oppure non riceverlo affatto. Se acquisti DeepSeek tramite qualsiasi rivenditore, chiedi esplicitamente se il pricing per i cache hit viene trasferito e come appare sulla tua fattura.

API diretta, Azure o un aggregatore: come scegliere

La decisione del canale si riduce a una breve tabella:

API direttaAzure AI FoundryAggregatore/rivenditore
Prezzo V4 Pro (in/out per M)$0.435 / $0.87$1.74 / $3.48Variabile; in genere vicino al prezzo ufficiale
Sconto per cache-hitSì, automatico, verificabileNon elencatoA volte; spesso non verificabile
Residenza dei datiI server di DeepSeekCloud Microsoft, il tuo tenantInfrastruttura del rivenditore
Contratto/conformitàEntità cineseAccordo Azure esistenteTermini del rivenditore
Concorrenza500 (Pro) / 2,500 (Flash)Provisioning PTU disponibileCondivisa, variabile
Consolidamento multi-modelloSolo DeepSeekCatalogo FoundryCatalogo ampio, un'unica fattura

In pratica: la direct API vince sul piano puramente economico: nessun canale eguaglia il prezzo del cache-hit a $0.003625 per milione, ed è l’unico canale in cui puoi verificare questo sconto. Azure vince quando il tuo team legale non approva il traffico verso la stessa infrastruttura di DeepSeek; stai pagando circa 7x il tasso effettivo per la governance, e questo scambio può essere del tutto razionale se lo fai consapevolmente. Gli aggregators vincono quando DeepSeek è uno dei diversi modelli dietro un router e la fatturazione consolidata vale un margine sottile; verifica il pass-through della cache prima di impegnare volume.

Qualunque canale tu scelga, le regole di routing che mantengono invariati i costi di DeepSeek sono poco glamour: classificazione predefinita, estrazione e summarization su Flash; riserva Pro per la generazione di codice multi-file e il ragionamento su contesti lunghi; disattiva la modalità thinking per i task deterministici (quei token di ragionamento vengono addebitati come output); e limita la profondità del loop dell’agente per ogni workflow. Un router ben ottimizzato conta più della differenza di 3x tra Flash e Pro.

Perché DeepSeek può applicare un prezzo così basso — e se può mantenerlo

I prezzi non sono una manovra da prodotto civetta. L'architettura di V4 è un design mixture-of-experts con 1,6 trilioni di parametri totali ma solo circa 49 miliardi attivi per ogni forward pass: fai inference con un livello di compute da modello di medie dimensioni ottenendo però capacità di classe frontier (80,6% su SWE-bench Verified, secondo i risultati pubblicati da DeepSeek). La revisione V4 Pro ha aggredito in particolare il costo del long-context, ed è per questo che l'azienda ha trasformato la sua promozione al 75% nel prezzo standard invece di lasciarla scadere.

La direzione del mercato favorisce gli acquirenti. Secondo la maggior parte delle stime del settore, i costi unitari di inferenza all’avanguardia sono scesi di circa 3x all’anno, e il taglio di DeepSeek in un anno, mentre la lunghezza del contesto è cresciuta fino a 1M token, supera persino quella curva. OpenAI si è mossa nella direzione opposta nello stesso periodo, riposizionando verso l’alto il suo livello di punta con GPT-5.6-Sol a $5/$30.

Il contrappeso è Jevons: un’inferenza più economica produce in modo affidabile più inferenza. L’osservazione di New Street Research - citata fin dall’era V3 - secondo cui una maggiore concorrenza raramente riduce la spesa totale, ha retto per tutto il processo di sviluppo dell’AI. L’adozione degli agent moltiplica le chiamate per utente più rapidamente di quanto scendano i prezzi per token, ed è per questo che le aziende che mantengono invariati i budget sono quelle che trattano routing, caching e disciplina dei prompt come ingegneria di primo livello, non quelle che hanno scelto il modello più economico. Comprendere queste dinamiche dei costi, non solo il prezzo di listino, è ciò che distingue una distribuzione di DeepSeek che resta economica da una che cresce silenziosamente fino a diventare molto più costosa.

FAQ

Perché DeepSeek V4 è così economico?

Architettura mixture-of-experts: 1,6T parametri totali, ~49B attivi per token. Il costo di calcolo per token è simile a quello di un modello molto più piccolo, e l’ingegneria del contesto lungo di V4 Pro ha ridotto il calcolo per token a circa un quarto rispetto al predecessore. Il prezzo è strutturale, non promozionale.

Di quanto è stato ridotto il prezzo di DeepSeek V4 Pro?

75%: da $1.74/$3.48 per milione di token (input/output) a $0.435/$0.87. È iniziato come una promozione limitata ed è diventato il prezzo di listino permanente.

La riduzione del prezzo del 75% si applica su Azure?

No. Al 14 luglio 2026, Azure AI Foundry elenca DeepSeek-V4 Pro Global a $1.74/$3.48, la tariffa precedente al taglio, senza prezzi pubblicati per l'input in cache. Per i carichi di lavoro fortemente basati sulla cache, il divario effettivo rispetto all'API diretta può superare 4x; verifica le tariffe attuali con Microsoft, poiché i prezzi del marketplace possono essere in ritardo rispetto ai tagli del fornitore.

DeepSeek è gratuito per l'uso aziendale?

L'API è a pagamento per token, ma i pesi del modello sono con licenza MIT, quindi l'auto-hosting è legale per uso commerciale. Alla scala di V4, avresti bisogno di una seria infrastruttura GPU; per la maggior parte dei team, il prezzo per token dell'API è molto più conveniente del TCO di una soluzione self-hosted.

Come si confronta il costo di DeepSeek con ChatGPT?

Per i prezzi API, DeepSeek V4 Pro ($0.435/$0.87) costa circa 11 volte meno di GPT-5.6-Sol ($5/$30) in input e 34 volte in output. Gli abbonamenti ChatGPT ($20–$200/mese per postazione) sono un prodotto diverso; per i carichi di lavoro programmatici, il confronto API-to-API è quello significativo.

Cosa fare prima del 24 luglio

Tre azioni, in ordine di urgenza:

1. Migra subito gli alias del modello. deepseek-chat e deepseek-reasoner smetteranno di risolversi il 24 luglio 2026 alle 15:59 UTC. Fissa esplicitamente deepseek-v4-flash o deepseek-v4-pro e imposta deliberatamente la modalità di thinking; il valore predefinito è cambiato e i token di reasoning vengono conteggiati come output. 2. Rivaluta il prezzo del tuo canale. Se usi Azure per motivi di governance, conferma che si tratti ancora di una scelta consapevole a 4x listino e senza sconto cache. Se usi un reseller, fatti mettere per iscritto il pass-through della cache. 3. Analizza il tuo tasso di cache hit. Sulla API diretta, controlla prompt_cache_hit_tokens nei dati di utilizzo. Se il traffico del tuo agent è sotto il 50% di cache hit, ristruttura i prompt in modo che il contenuto statico venga per primo: con un rapporto hit/miss di 120x, l'ordine del prompt è una decisione di budget.

Il modello è diventato economico. Le dinamiche di chi cattura questa economicità (fornitore, cloud, rivenditore o tu) sono il punto in cui quest'anno si vincono e si perdono soldi nel settore enterprise.

Letture correlate: DeepSeek V4 Flash vs V4 Pro · GLM 5.2 vs DeepSeek V4 Pro · Guida ai prezzi di OpenRouter