Il prezzo di punta di Sonnet 5 è inferiore a quello di Sonnet 4.6 ($2/$10 introductory through Aug 31, 2026, vs. Sonnet 4.6's $3/$15), e il grafico di lancio di Anthropic lo definisce un "strict improvement" rispetto a Sonnet 4.6. Abbiamo eseguito entrambi i modelli sullo stesso compito a diversi livelli di effort per vedere cosa significhi in pratica. Risultato: nel nostro test, Sonnet 5 costava più di Sonnet 4.6 a ogni livello di effort che abbiamo provato — non meno. Ecco cosa abbiamo scoperto e perché.
Un compito, esecuzioni singole. Tutto quanto segue proviene da un unico compito di coding, una esecuzione per ciascuna configurazione di modello/sforzo. Considerate i numeri specifici come indicativi, non come un benchmark mediato statisticamente — il prompt esatto e un campione dell'output API grezzo sono nell'appendice, se volete riprodurlo sul vostro carico di lavoro.
Sonnet 5 è davvero più economico di Sonnet 4.6? L'abbiamo testato.
Abbiamo assegnato a entrambi i modelli lo stesso compito — costruire un rate limiter token-bucket in Python con i test, eseguire i test, correggere tutto ciò che fallisce — tramite la CLI di Claude Code (claude -p --model <id> --effort <level> --output-format json), quindi costo e durata provengono direttamente dalla risposta dell'API. Eseguito il 2026-07-01.
Configurazione | Costo | Durata | Turni | Risultato |
|---|---|---|---|---|
Sonnet 5, effort | $0.344 | 31.6s | 5 | 6/6 tests passano |
Sonnet 4.6, effort | $0.261 | 36.0s | 6 | 7/7 tests passano |
Sonnet 4.6, effort | $0.253 | 35.3s | 5 | 7/7 tests passano |
Sonnet 5, effort | $0.349 | 36.4s | 5 | 8/8 tests passano |
Sonnet 5 era più veloce con un impegno medium, ma costava più di Sonnet 4.6 in entrambe le configurazioni di Sonnet 4.6 che abbiamo testato — inclusa Sonnet 4.6 in esecuzione con un'impostazione di impegno inferiore. È l'opposto di alcuni resoconti aneddotici della community che sostengono che Sonnet 5 diventi più economico di Sonnet 4.6 quando si confrontano livelli di impegno equivalenti.
La causa probabile: Sonnet 5 funziona con un nuovo tokenizer. La documentazione ufficiale di Anthropic afferma che produce "circa il 30% in più di token" rispetto a Sonnet 4.6 per lo stesso testo, e test indipendenti di Simon Willison hanno rilevato che i contenuti in inglese arrivano in particolare fino a ~1,4x più token. Il prezzo di listino più basso di Sonnet 5 non ha compensato del tutto questo nel nostro test, e dopo il 31 agosto 2026 — quando la tariffa introduttiva di Sonnet 5 scade e entrambi i modelli si attestano allo stesso prezzo di listino di $3/$15 — la differenza del tokenizer da sola suggerisce che Sonnet 5 costerà probabilmente di più per un lavoro equivalente in lingua inglese, non lo stesso, in assenza di altre modifiche ai prezzi. (Ripartizione completa per lingua nella nostra guida ai prezzi di Sonnet 5.)
Cosa è cambiato ancora, oltre al costo
Nei benchmark ufficiali, Sonnet 5 registra miglioramenti concreti: 80,4% contro 67,0% su Terminal-Bench 2.1, 63,2% contro 58,1% su SWE-bench Pro, entrambi secondo la scheda di sistema di Claude Sonnet 5 di Anthropic (vedi la nostra tabella completa dei benchmark inclusa Opus 4.8). Il grafico del comunicato di lancio di Anthropic descrive Sonnet 5 come un "miglioramento rigoroso" rispetto a Sonnet 4.6.
Osservando i nostri quattro output di test, è emersa una differenza comportamentale che la tabella dei benchmark non cattura: Sonnet 5 ha aggiunto cose che non avevamo richiesto. A entrambi i livelli di effort, nei test ha usato un fake clock monkeypatched per evitare chiamate reali a time.sleep(), e a livello di high ha aggiunto la thread-safety al rate limiter senza che fosse richiesto. Sonnet 4.6, a entrambi i livelli di effort, è rimasto più vicino alla descrizione letterale del compito — usando il vero time.sleep() nei test e, a livello di medium, ha aggiunto una tabella riassuntiva per migliorare la leggibilità ma niente alla vera implementazione oltre a quanto richiesto.
Questo è in linea con i feedback reali degli utenti pubblicati entro il primo giorno dal lancio di Sonnet 5: un thread di r/claude lo descriveva come "un miglioramento oggettivo rispetto a Sonnet 4.6 in termini di ragionamento... ma sembra anche MOLTO più nervoso di 4.6." Il nostro test è un campione di una sola attività, ma "aggiunge più facilmente ambito non richiesto" è una versione concreta e specifica di quella stessa osservazione.
Dovresti effettuare l'upgrade?
Aggiorna se il tuo carico di lavoro è principalmente in lingua cinese (il cambiamento del tokenizer influisce appena sul conteggio dei token in cinese), oppure se fai un lavoro agentic/tool-heavy in cui i guadagni di Terminal-Bench e SWE-bench contano più di un modesto aumento dei costi.
Aspetta se il tuo carico di lavoro è ad alto volume e prevalentemente in inglese, e Sonnet 4.6 sta già soddisfacendo il tuo livello di qualità — rifai i tuoi calcoli sui costi invece di fidarti del prezzo di listino, soprattutto una volta che la finestra di prezzo introduttivo si chiude il 31 agosto 2026.
In ogni caso, non dare per scontato che il modello più recente, apparentemente più economico, costi automaticamente meno per attività. Nel nostro test non è stato così.
FAQ
Sonnet 5 è davvero un “miglioramento netto” rispetto a Sonnet 4.6, come afferma Anthropic?
Sui benchmark di capacità pubblicati da Anthropic, sì — non ne abbiamo trovato uno in cui Sonnet 4.6 sia in testa. Sul costo per attività, il nostro test ha rilevato il contrario una volta che si tiene conto della modifica del tokenizer, quindi il "miglioramento netto" non si estende all’efficienza dei costi per ogni workload.
Perché Sonnet 5 sembra "più teso" di Sonnet 4.6?
Anthropic non ha pubblicato dettagli specifici su questo. Dai nostri risultati di test, Sonnet 5 era più propenso ad aggiungere ambito non richiesto (thread-safety, una configurazione del test-clock più difensiva) rispetto a Sonnet 4.6, che è rimasto più vicino alla richiesta letterale. Questo è coerente con — anche se più ristretto di — la descrizione della community.
Sonnet 5 è ora il modello predefinito? Posso ancora usare Sonnet 4.6?
Secondo l'annuncio di lancio di Anthropic, Sonnet 5 ha sostituito Sonnet 4.6 come modello predefinito per gli utenti Free e Pro su claude.ai. Gli utenti Max, Team ed Enterprise, insieme agli utenti API, possono ancora selezionare direttamente Sonnet 4.6.
Dovrei confrontare Sonnet 5 con Sonnet 4.6 o con Opus 4.8?
Decisione completamente diversa. Questa pagina riguarda l’aggiornamento generazionale; se invece stai scegliendo in particolare tra Sonnet 5 e Opus 4.8, abbiamo eseguito un insieme separato di test testa a testa — vedi Sonnet 5 vs Opus 4.8: test reali.
La affermazione "il livello di maggiore sforzo è più economico" che le persone stanno pubblicando online è reale?
Non nel nostro test. Abbiamo eseguito Sonnet 5 a medium e high contro Sonnet 4.6 a low e medium, e Sonnet 5 è costato di più in ogni combinazione. Le singole segnalazioni aneddotiche variano a seconda dell'attività — esegui il tuo confronto sul tuo carico di lavoro reale prima di presumere uno specifico crossover del livello di effort.
Appendice: Prompt Esatto e Output Grezzo
Il compito che abbiamo inviato a entrambi i modelli:
Implementa un rate limiter token-bucket come classe Python `RateLimiter(capacity: int,
refill_rate: float)` con un metodo `allow() -> bool` che restituisce se una richiesta
è consentita in questo momento, consumando un token se sì. Usa un orologio monotono, senza
dipendenze esterne. Salvalo in limiter.py.
Poi scrivi test_limiter.py con almeno 5 casi di test che coprano: burst fino alla capacità
riesce poi blocca, i token si ricaricano nel tempo (usa time.sleep o un orologio simulabile),
il tasso di refill è rispettato (non ricarica completamente all'istante), la capacità non viene mai superata, e
la capacità zero/negativa è gestita in modo sensato.
Esegui i test con pytest e assicurati che passino tutti. Se qualcuno fallisce, correggi il codice e
riesegui finché non passano tutti. Riporta l'output finale di pytest.
La risposta effettiva dell'API per l'esecuzione di Sonnet 5 (medium), limitata ai campi rilevanti per costo e tempi:
{
"duration_ms": 31616,
"num_turns": 5,
"stop_reason": "end_turn",
"total_cost_usd": 0.3438645,
"usage": {
"input_tokens": 4302,
"cache_creation_input_tokens": 60894,
"cache_read_input_tokens": 233420,
"output_tokens": 2172
}
}