AIREITER

Prezzi API di Claude Haiku 5.5: il limite dei 100.000 token

Ultimo Aggiornamento: 2026-10-07 19:01:50

Claude Haiku 5.5 sembra un modello economico e semplice da mettere a budget, finché una richiesta non supera i 100.000 token di input. Sotto questa soglia, Anthropic indica $0.10 per milione di token in input e $0.50 per milione di token in output; oltre il limite, le tariffe salgono rispettivamente a $0.50 e $2.50. È questo aumento di cinque volte sul prezzo dell'input, più dello slogan del lancio, il dato da tenere presente quando si pianifica un utilizzo in produzione.

Prezzi API di Claude Haiku 5.5 in sintesi

Il listino API diretto distingue le richieste in base alla dimensione del prompt di input, con prezzi in USD per milione di token. La tabella si basa sui prezzi della piattaforma Claude e sull'annuncio del lancio di Haiku 5.5; le tariffe dei marketplace possono essere diverse.

La soglia dei 100.000 token è il vero punto da valutare

La soglia riguarda il prompt di input della singola richiesta. Non è un sovrapprezzo generico applicato perché il modello dispone di una finestra di contesto ampia. Una richiesta con 90.000 token di input e 2.000 token di output resta nella fascia più economica; una richiesta con 120.000 token di input applica invece le tariffe più alte previste per i prompt lunghi, sia all'input sia all'output.

Per una richiesta semplice con 10.000 token di input e 500 token di output, il calcolo nella fascia più bassa è:

(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035

Su 10.000 richieste identiche, il costo è quindi di $3.50, senza considerare strumenti, piattaforma o retry. Per mostrare l'effetto del cambio di fascia con un prompt lungo valido, una richiesta con 120.000 token di input e 500 token di output costa:

(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125

Su 10.000 richieste di questo tipo si arriva a $612.50. Nel conteggio va incluso tutto l'input inviato all'API, non soltanto la domanda visibile all'utente.

L'annuncio ufficiale di Anthropic su Reddit afferma che le richieste fino a 100.000 token costano circa il 90% in meno rispetto a Haiku 4.5, mentre quelle oltre i 100.000 token costano circa il 50% in meno. Sono dichiarazioni relative al lancio, non una garanzia che ogni carico di lavoro costi esattamente quelle percentuali in meno: retry, lunghezza dell'output, comportamento del tokenizer e cache miss continuano a incidere sulla fattura.

Caching e Batch modificano il costo effettivo

Il prompt caching è particolarmente utile quando un'applicazione invia più volte le stesse istruzioni o lo stesso pacchetto di conoscenze. Per Haiku 5.5, la scrittura nella cache di cinque minuti costa 1,25 volte la tariffa standard dell'input, mentre la lettura dalla cache costa un decimo della tariffa standard. Nella fascia di prompt più lunghi restano validi gli stessi rapporti.

OperazioneFino a 100KOltre 100K
Primo milione di token scritto nella cache di cinque minuti$0.125$0.625
Ogni milione di token letti dalla cache$0.01$0.05
Ogni milione di token di input in Batch$0.05$0.25
Ogni milione di token di output in Batch$0.25$1.25

In genere, una cache di cinque minuti raggiunge il punto di pareggio dopo circa due letture, perché il sovrapprezzo iniziale viene recuperato rapidamente. Per esempio, scrivere un prefisso da un milione di token costa $0.125 e ogni lettura $0.01, contro $0.20 per due letture senza cache, prima di aggiungere l'output. Una cache di un'ora costa il doppio della tariffa base dell'input, quindi richiede più letture ripetute per rientrare dell'investimento. Il risultato preciso dipende dal fatto che la chiave della cache resti invariata e che la richiesta rimanga nella stessa fascia di prezzo.

La Batch API dimezza le tariffe di input e output per i job asincroni, come arricchimenti notturni, classificazione in blocco, backfill e sessioni di valutazione. Non è però un'alternativa alla chat sincrona: il compromesso è la latenza. Se il percorso applicativo supporta entrambe le modalità, Batch e caching possono essere combinati; controlla comunque i campi finali di usage invece di dare per scontato che ogni richiesta abbia utilizzato la cache.

Il dato operativo da registrare nei log è cache_read_input_tokens, documentato nello schema di utilizzo della Messages API di Anthropic. Se resta a zero dopo la prima richiesta, verifica l'ordine del prompt, i timestamp, la serializzazione degli strumenti e la posizione dei parametri di controllo della cache. Un modello più economico con una cache costantemente vuota può costare più di un percorso configurato correttamente con la cache, anche se quest'ultimo ha una tariffa nominale più alta.

Haiku 5.5 a confronto con i vecchi Haiku e Sonnet

Il confronto seguente utilizza le tariffe dirette pubblicate prima dell'arrivo di Haiku 5.5. Le tariffe di Haiku 4.5 sono incluse come riferimento e non implicano che tutti i provider applichino prezzi identici.

ModelloInput / MTokOutput / MTokInterpretazione per il budget
Claude Haiku 5.5, <=100K$0.10$0.50Carichi ad alto volume con output brevi
Claude Haiku 5.5, >100K$0.50$2.50Prompt lunghi quando la qualità giustifica la fascia
Claude Haiku 4.5$1.00$5.00Integrazioni esistenti che richiedono un riferimento noto
Claude Sonnet 5.5$2.00$10.00Attività di produzione più impegnative

Haiku 5.5 è il primo modello da testare per generazione di titoli, classificazione, estrazione, routing, riepiloghi brevi e altri task ad alto volume eseguiti da worker. Un utente reale su Reddit ha descritto l'uso tipico di Haiku come adatto a “attività ad alto volume e bassa complessità”, per esempio creare il titolo di una conversazione o estrarre i nomi dei software da un testo (u/jam_pod_). È un caso d'uso più convincente rispetto all'idea di sostituire automaticamente un modello più potente in ogni passaggio di un agente.

Non scegliere basandoti soltanto sul prezzo per token. Se Haiku richiede un secondo tentativo per metà delle richieste, mentre Sonnet produce un risultato accettato al primo tentativo, il divario nominale di due a uno può scomparire. Prima di spostare il traffico in produzione, misura input fatturato, output fatturato, retry e risultati accettati su un campione rappresentativo.

Una regola pratica per stimare i costi in produzione

Prima di affidarti a Haiku 5.5, segui questa sequenza:

  1. Esegui il prompt reale attraverso la documentazione di Anthropic sul conteggio dei token, includendo strumenti, documenti recuperati e cronologia della conversazione.
  2. Dividi il traffico tra richieste con input <=100K e >100K; non fare una media tra le due fasce.
  3. Stima separatamente l'output. Un input breve accompagnato da una risposta generata lunga è dominato dal costo dell'output.
  4. Metti i prefissi stabili sotto il controllo della cache e genera un alert quando le letture dalla cache scendono a zero.
  5. Invia tramite Batch API i job che possono aspettare e mantieni il routing sincrono per le richieste interattive.
  6. Confronta Haiku 5.5 e Sonnet 5.5 in base al costo per risultato accettato, non al costo per milione di token.

Questa regola tiene conto anche della principale incertezza nei dati del giorno del lancio: i prezzi e la disponibilità ufficiali sono chiari, ma non esistono ancora misurazioni indipendenti consolidate su latenza, tasso di errore e qualità con contesti lunghi. La discussione su Reddit pone la stessa domanda in modo diretto: “Cosa significa ‘prompt fino a 100K’?” (u/ShadowBannedAugustus). Per un team che lavora in produzione, la risposta va cercata in un test di fatturazione, non in un'ipotesi.

FAQ sull'API di Claude Haiku 5.5

Qual è il model ID dell'API di Claude Haiku 5.5?

Utilizza claude-haiku-5-5 come alias corrente, come indicato nelle note di rilascio di Claude Code di Anthropic. Quando il routing riproducibile è importante, verifica lo snapshot ID nella documentazione dei modelli API.

Quanto costa una richiesta Haiku 5.5 da 100.000 token?

Per 100.000 token di input e nessun output, il costo dell'input nella fascia più bassa è $0.01. L'output viene fatturato separatamente a $0.50 per milione di token nella stessa fascia; la tariffa superiore si applica quando il prompt supera il limite indicato nella documentazione.

Haiku 5.5 è incluso in Claude Pro o Max?

L'abbonamento Claude e l'utilizzo dell'API Claude sono prodotti di fatturazione separati, come indicato nei prezzi della piattaforma Claude di Anthropic. Per il traffico programmatico devi fare riferimento al listino API.

Lo sconto Batch si somma al prompt caching?

La documentazione sui prezzi di Anthropic presenta Batch come uno sconto del 50% sui costi dei token idonei, mentre il conteggio dei token memorizzati nella cache resta separato. Controlla i campi finali di usage per il tuo percorso, perché l'idoneità alla cache e il supporto del provider possono variare.

Haiku 5.5 è più economico di Haiku 4.5 per ogni richiesta?

Alle tariffe dirette pubblicate, Haiku 5.5 è più economico in entrambe le fasce di input. Il risparmio effettivo può però ridursi a causa di retry, output più lunghi, cache miss o carichi di lavoro che richiedono un modello più potente per completare correttamente il task.