AIREITER

Aumento dei prezzi API DeepSeek: vecchie e nuove tariffe (agosto 2026)

Ultimo Aggiornamento: 2026-08-16 18:59:44

Dal 16 agosto 2026 usare le API DeepSeek costa di più. Le tariffe fisse per token sono state sostituite da una fatturazione differenziata tra ore di picco e fuori picco per deepseek-v4-flash e deepseek-v4-pro. Fuori picco, input senza cache hit e output costano ora da 1,5× a 2,4× rispetto a prima; nelle fasce di picco il costo raddoppia. L'input servito dalla cache, invece, aumenta da 2,5× a 6,1× fuori picco e fino a 12,1× nelle ore di punta. Il dato che fa davvero la differenza nella bolletta è il cache-hit rate dei prompt.

Dal 16 agosto cambia la fatturazione

Il nuovo schema è entrato in vigore domenica 16 agosto alle 16:00 UTC, ovvero alla mezzanotte del 17 agosto a Pechino, secondo sia il thread dell'annuncio sia l'audit su 650 chiamate pubblicato su r/DeepSeek. La pagina ufficiale Models & Pricing riporta già le nuove tabelle: non è solo un annuncio, il cambiamento è attivo.

DeepSeek ha introdotto fasce di picco e fuori picco, con le prime fissate esattamente al doppio delle seconde. Le finestre di picco sono 01:00–04:00 UTC e 06:00–10:00 UTC: sette ore di picco al giorno e diciassette fuori picco. Versioni dei modelli (DeepSeek-V4-Flash-0731, DeepSeek-V4-Pro-0813), compatibilità API e specifiche pubblicate restano invariate sulla stessa pagina: è un intervento sui prezzi, non sui modelli.

Le nuove tariffe delle API DeepSeek

Tutti i prezzi indicati sono in USD per 1 milione di token e provengono direttamente dalla pagina ufficiale dei prezzi al 16 agosto 2026.

V4 FlashFuori piccoPicco
Input, cache hit$0.007$0.014
Input, cache miss$0.22$0.44
Output$0.66$1.32
V4 ProFuori piccoPicco
Input, cache hit$0.022$0.044
Input, cache miss$0.66$1.32
Output$1.98$3.96
Pagina ufficiale dei prezzi API DeepSeek con le nuove tariffe di picco e fuori picco, 16 agosto 2026

Le modalità di fatturazione restano per il resto invariate: ogni richiesta viene addebitata alla tariffa attiva nel momento in cui viene eseguita e DeepSeek si riserva esplicitamente il diritto di modificare di nuovo i prezzi.

Di quanto sono aumentate davvero le API DeepSeek?

Le precedenti tariffe fisse sono state confermate da tracker di terze parti fino al 31 luglio 2026: Flash a $0.14 per l'input senza cache hit, $0.0028 per cache hit e $0.28 per l'output; Pro a $0.435 / $0.003625 / $0.87 (TLDL, BenchLM). Ecco il confronto diretto tra le due strutture:

Per 1M di tokenVecchia tariffa fissaNuova fuori piccoNuova piccoFuori picco vs vecchiaPicco vs vecchia
Flash input, cache hit$0.0028$0.007$0.0142.5×5.0×
Flash input, cache miss$0.14$0.22$0.441.57×3.14×
Flash output$0.28$0.66$1.322.36×4.71×
Pro input, cache hit$0.003625$0.022$0.0446.07×12.14×
Pro input, cache miss$0.435$0.66$1.321.52×3.03×
Pro output$0.87$1.98$3.962.28×4.55×
Prezzi API DeepSeek V4: vecchia tariffa fissa contro nuove fasce fuori picco e di picco, USD per milione di token

Il dato del «+1.114%» circolato su Reddit è corretto, ma riguarda un caso molto specifico: l'input cache hit di V4 Pro in fascia di picco ($0.003625 -> $0.044). Un carico senza cache, eseguito fuori picco, si avvicina piuttosto a un aumento di 1,5–2,3×. Il moltiplicatore effettivo dipende da dove si colloca il vostro utilizzo fra questi due estremi.

I carichi basati sulla cache sono i più penalizzati

I prezzi dei cache hit sono aumentati da 2,5× a 12×, contro 1,5×–4,7× per cache miss e output. Di conseguenza, più volume di input passava dalla corsia molto economica della cache, maggiore sarà l'incremento percentuale. Un utente di r/DeepSeek ha ricalcolato 650 chiamate API reali — 16 sessioni, 155,9M di prompt token e un cache-hit rate del 98,09% — con entrambe le tabelle, riconciliando il risultato con la fatturazione nella console DeepSeek con uno scarto entro il 2%:

"the better caching works for you today, the bigger your increase" - u/Swimming-Soup-1173, audit r/DeepSeek su 650 chiamate API

Per quel carico agent, il nuovo costo è risultato 2.7× più alto fuori picco, contro 1,5× per lo stesso carico senza cache hit. Un altro utente ha modellato un carico con contesto lungo che passa da $33 a $100 fuori picco o a $200 nelle ore di punta: un salto da 3× a 6×. Batch job, pipeline RAG e agent con prompt di sistema statici sono i profili più sotto pressione; il traffico di summarization one-shot rimane invece più vicino alla soglia fuori picco di 1,5–2,3×.

Le ore di picco nel tuo fuso orario

La pagina ufficiale indica solo le finestre UTC. Ecco la conversione per agosto, quando è in vigore l'ora legale:

FusoFinestre di picco localiLa tua giornata 9-17
Pechino (UTC+8)09:00–12:00, 14:00–18:00Picco, esclusa la pausa pranzo 12:00–14:00
Europa centrale (UTC+2)03:00–06:00, 08:00–12:00Mattina in fascia di picco
Londra (UTC+1)02:00–05:00, 07:00–11:00Mattina in fascia di picco
USA Est (UTC-4)21:00–00:00, 02:00–06:00Interamente fuori picco
USA Ovest (UTC-7)18:00–21:00, 23:00–03:00Interamente fuori picco

Le fasce di picco coincidono con la giornata lavorativa cinese, a eccezione della pausa pranzo: dalle 12:00 alle 14:00 ora di Pechino si applicano le tariffe fuori picco. I team statunitensi lavorano per intero fuori picco; quelli europei pagano il doppio per i batch del mattino — 08:00–12:00 CEST è fascia di picco — e dovrebbero spostarli al pomeriggio o durante la notte.

Il prompt caching conviene ancora?

Sì, senza dubbio: lo sconto si è ridotto, ma non è sparito. In precedenza l'input con cache hit costava circa 50× meno dell'input cache miss su Flash e 120× meno su Pro; ora è circa 30× più economico su entrambi i modelli, precisamente 31× per Flash e 30× per Pro fuori picco: $0.007 contro $0.22, $0.022 contro $0.66. Anche l'autore dell'audit che ha misurato l'aumento di 2,7× è arrivato alla stessa conclusione:

"Caching is still absolutely worth it" - lo stesso audit su r/DeepSeek

Nel suo caso, la cache continuava a ridurre i costi di circa 15× rispetto all'invio dello stesso contesto senza cache. Il caching resta best-effort, senza alcuna garanzia sul tasso di hit; le voci inutilizzate vengono in genere eliminate dopo un intervallo che va da ore a giorni (BenchLM). Prima di definire il budget, conviene quindi misurare: registrate i campi prompt_cache_hit_tokens e prompt_cache_miss_tokens dell'oggetto usage, come raccomanda BenchLM, per calcolare la quota effettiva di hit.

DeepSeek resta l'opzione economica?

Fuori picco sì; nelle ore di punta, per Flash, il vantaggio su GPT-5.6 si azzera praticamente. Di seguito i prezzi standard per 1M di token:

ModelloInputOutputNote
DeepSeek V4 Flash (fuori picco)$0.22$0.66Contesto da 1M
DeepSeek V4 Flash (picco)$0.44$1.32Supera il prezzo output di Luna
GPT-5.6 Luna$0.20$1.20Prezzo ridotto dell'80% il 30 luglio
DeepSeek V4 Pro (fuori picco)$0.66$1.98Ancora circa 6× sotto Terra
DeepSeek V4 Pro (picco)$1.32$3.96Circa 3× sotto Terra
GPT-5.6 Terra$2$12
Claude Sonnet 5$2$10Tariffa di lancio fino al 31 agosto, poi $3/$15

Fuori picco, l'output di V4 Flash a $0.66 costa il 45% in meno di GPT-5.6 Luna e 18× meno di Terra: DeepSeek resta l'opzione più economica per l'output ad alto volume. In fascia di picco, Luna — $1.20 per l'output e $0.20 per l'input — batte Flash su entrambe le tariffe standard. La cache-read rate di Luna ($0.02/M nel changelog dell'AI Price Index) è però più cara della fascia cache hit di Flash a qualsiasi ora; Flash continua inoltre a offrire contesto da 1M di token e concorrenza di 2.500 nella tabella delle specifiche ufficiali. Come ha sintetizzato un commentatore nel thread dell'annuncio: "DS4 is good but when cheap."

Cosa fare questa settimana

  1. Ricalcolate la vostra spesa prima di allarmarvi. Recuperate i log di utilizzo del mese scorso e calcolate: input cache hit × hit rate × prezzo hit + input cache miss × miss rate × prezzo miss + output × prezzo output. Applicate poi la tariffa di picco o fuori picco in vigore nella finestra di ciascuna richiesta. Gli estremi dell'audit definiscono l'intervallo: 1,5× senza cache hit, 2,7× con un hit rate del 98%.
  2. Spostate fuori picco il lavoro differibile. Cron job, valutazioni, elaborazione documentale: tutto ciò che non ha un utente in attesa può girare nelle 17 ore fuori picco. Per i team USA è quasi gratuito, perché la giornata lavorativa è già fuori picco; per quelli UE, conviene spostare i batch mattutini al pomeriggio.
  3. Continuate a generare cache hit. Mantenete la struttura dei prompt che già produce cache hit: la relativa fascia resta circa 30× meno costosa dell'input cache miss.
  4. Provate Flash sulle chiamate di routine. Pro costa 3× Flash praticamente su tutta la linea, 3,1× per i cache hit. Se non avete rivalutato Flash dopo l'aggiornamento post-training 0731, instradate verso di esso una quota del traffico ordinario: i compromessi nella scelta del modello sono trattati nel nostro confronto V4 Flash vs V4 Pro.
  5. Se cambiate provider, la migrazione può essere minima. Per i client compatibili con OpenAI, spesso basta modificare base URL e model ID. Host di terze parti e piattaforme relay applicano listini propri: DataLLM Lab ha documentato host che quotavano V4 Pro intorno a $1.74/$3.48 per 1M già prima dell'aumento. Confrontate quindi il prezzo effettivo, non quello esposto in vetrina.

La decisione, in una tabella:

Il tuo profiloScelta consigliata
Fuso orario USA, traffico agent con forte uso della cacheResta: le tariffe fuori picco e la fascia cache circa 30× più economica mantengono il costo input più basso per questo tipo di traffico
Fuso orario UE, batch job mattutiniResta, ma riprogramma: l'esposizione al picco è autoindotta e si può evitare
Solo ore di picco, coding sensibile alla qualità su ProRivaluta: l'output Pro in fascia di picco ($3.96) è ancora sotto Terra ($12), ma il divario è ora 3×, non più 14× come prima del 16 agosto
Carichi one-shot senza cacheResta: l'aumento fuori picco di 1,5–2,3× è il più contenuto della tabella

FAQ

Quando sono entrati esattamente in vigore i nuovi prezzi DeepSeek?

Il 16 agosto 2026 alle 16:00 UTC, ovvero alla mezzanotte del 17 agosto a Pechino, secondo il thread dell'annuncio e l'audit su 650 chiamate su r/DeepSeek. La pagina ufficiale dei prezzi mostrava le nuove tabelle nello stesso giorno.

Di quanto aumenterà la mia bolletta DeepSeek?

Un carico senza cache passa a circa 1,5× fuori picco, mentre un carico misurato con hit rate del 98% arriva a 2,7×; nelle ore di punta questi valori raddoppiano, fino a 12× per l'input cache hit di Pro. La tabella dei moltiplicatori qui sopra riporta tutte le coppie di tariffe.

Quali sono le ore di picco negli Stati Uniti?

USA Eastern: 21:00–00:00 e 02:00–06:00. USA Pacific: 18:00–21:00 e 23:00–03:00. Le normali ore lavorative statunitensi ricadono interamente nelle finestre fuori picco.

deepseek-chat e deepseek-reasoner sono ancora disponibili?

No. Gli alias legacy hanno raggiunto la data di ritiro il 24 luglio 2026, secondo la cronologia dei model ID di BenchLM; le nuove integrazioni devono chiamare deepseek-v4-flash o deepseek-v4-pro.

DeepSeek costa ancora meno di GPT-5.6 e Claude?

Fuori picco sì: l'output Flash costa il 45% in meno di GPT-5.6 Luna e 18× meno di Terra. In fascia di picco, l'output di Luna a $1.20/M è inferiore ai $1.32/M di Flash, quindi la risposta dipende dall'orario in cui gira il vostro traffico.