AIREITER

Claude "Quasi finito di pensare": significato e come risolvere

Ultimo Aggiornamento: 2026-06-30 14:52:58

Se Claude è bloccato su "almost done thinking" e ti stai chiedendo se qualcosa si sia rotto — non è così. Quello stato significa che Claude è in extended thinking (la sua modalità di ragionamento): sta pianificando la risposta prima di iniziare a scrivere. Qualche secondo, persino 20–30 secondi, è normale. Ciò che non è normale è aspettare minuti senza ricevere nulla. Si tratta di due problemi diversi, e questa guida li distingue e ti fornisce la soluzione per ciascuno.

Cosa significa davvero "quasi ho finito di pensare"

"Quasi finito di pensare" è l'etichetta che Claude mostra mentre esegue il suo passaggio di ragionamento esteso. Invece di rispondere immediatamente token per token, il modello dedica un budget di token di "pensiero" per elaborare un piano, quindi produce la risposta visibile. Questo è lo stesso meccanismo alla base di "pensare con impegno elevato" in Claude Code e degli indicatori di ragionamento nelle app di Claude.

Il modo più chiaro per interpretarlo: la frase è un segnale di avanzamento, non un errore. Come si legge in un thread di r/ClaudeCode, la pausa di ragionamento esteso è "Claude che pianifica prima di eseguire, non un problema del server." Quindi, quando vedi claude almost done thinking, il modello sta lavorando — l’unica domanda è se sta lavorando troppo a lungo.

Una linea approssimativa da tracciare:

  • Secondi fino a ~30s di elaborazione → normale, soprattutto per compiti di ragionamento complesso o di coding.

  • Minuti senza output, ripetutamente → c’è qualcosa che non va; passa alle soluzioni qui sotto.

Perché ci vuole così tanto tempo (o si blocca del tutto)

La lentezza e un vero blocco hanno cause diverse. Tre fattori determinano il caso lento:

  1. Profondità del ragionamento esteso. In una ricerca rapida, Claude può tendere a dedicare più sforzo di ragionamento di quanto il compito richieda — "pensa" intensamente a una domanda che non ne aveva bisogno.

  2. Chiamate di strumenti sequenziali. Nell'uso agentico (Claude Code), la maggior parte del tempo totale non è dedicata al ragionamento del modello — sono le chiamate agli strumenti. Una suddivisione della latenza di Claude Code ha misurato ogni lettura di file, ricerca o esecuzione di test a circa 300–800ms come round-trip sincrono, e osserva che non vengono eseguiti in parallelo per impostazione predefinita — quindi un prompt vago che attiva una dozzina o più di chiamate esplorative accumula quei round-trip in oltre dieci secondi prima che venga svolto qualsiasi lavoro reale.

  3. Rigonfiamento del contesto. L'intera trascrizione viene inviata di nuovo al modello a ogni turno. Man mano che una sessione si riempie, le risposte rallentano e la qualità cala — la stessa analisi ha osservato un rallentamento notevole una volta che una sessione supera circa il 60% della finestra di contesto, anche se il punto esatto varia (è l'effetto "perso nel mezzo" sui dettagli sepolti in profondità nella conversazione).

Il true hang è un problema separato. Un issue tracciato di Claude Code (#32526) descrive nuove sessioni che rimangono bloccate su "thinking" e non producono mai output — nessun errore, nemmeno a un semplice "hello" — mentre una sessione aperta in precedenza continua a funzionare correttamente. Quel report proveniva da una configurazione pesante: molti hook PreToolUse, più server MCP, oltre 80 skill registrate e un provider personalizzato (Bedrock). Se il tuo non restituisce mai nemmeno un token, consideralo un blocco, non lentezza.

Come risolvere il problema

Correzioni rapide (prova queste prima)

  • /clear per eliminare la conversazione e ricominciare da zero — il rimedio più rapido per l’eccesso di contesto.

  • /compact per riassumere e ridurre il contesto. Nota che, per progettazione, comporta una perdita di informazioni, quindi salva prima tutto ciò che è importante in un file.

  • Riavvia la sessione, oppure torna a una sessione più vecchia che sta ancora rispondendo — la soluzione alternativa a cui la maggior parte degli utenti ricorre quando si verifica un blocco.

Controlla il livello di impegno

La leva di velocità più trascurata è l’impegno. Claude tende a impostare per default un ragionamento alto/massimo; allineare l’impegno al compito offre grandi guadagni di velocità senza alcuna perdita di qualità nel lavoro di routine. Un foglio di riferimento pratico:

Attività

Impegno

Perché

Ricerca rapida, riepilogo, formattazione

low

Nessun ragionamento approfondito necessario; quasi istantaneo

Codifica standard, stesura

medium

Bilanciato

Architettura, debugging difficile, matematica

high / xhigh

Vale l'attesa

Se l'opacità ti disturba (Claude nasconde i dettagli del ragionamento per impostazione predefinita), Claude Code può mostrare un riepilogo del ragionamento così puoi almeno vedere cosa sta facendo.

Quando è davvero bloccato, non solo lento

Se ottieni zero output, è un blocco, non una profondità:

  • Riduci il carico all'avvio — disabilita temporaneamente gli hook extra PreToolUse, i server MCP non utilizzati e le skill, quindi riapri la sessione.

  • Controlla il tuo provider — gli ID modello personalizzati e i gateway (Bedrock e simili) compaiono in numerosi report di blocco.

  • Esegui con --verbose per vedere cosa sta effettivamente facendo: una lunga serie di letture di file indica un problema di chiamata allo strumento; una prima risposta lenta senza chiamate agli strumenti indica latenza o contesto.

Avanzato: controlla il ragionamento dall'API

Le app ti offrono un controllo limitato sul thinking. La API ti dà direttamente questo controllo — ed è la soluzione pratica se hai bisogno di una latenza prevedibile. Gli stessi livelli di effort del cheat sheet sopra sono un parametro dell'API, e puoi anche disattivare completamente l'extended thinking:

message = client.messages.create(
    model="claude-opus-4-6",
    max_tokens=4096,
    thinking={"type": "adaptive"},        # Claude decide quanto pensare
    output_config={"effort": "low"},      # low | medium | high | max — limita la profondità
    # oppure, per saltare completamente l'extended thinking:
    # thinking={"type": "disabled"},
    messages=[{"role": "user", "content": "..."}],
)

Sui modelli Claude attuali (Opus 4.6 e superiori) non imposti un budget fisso di token: imposti un livello di sforzo (low per un lavoro rapido, fino a max), oppure disattivi del tutto l’extended thinking. È la stessa leva che le app nascondono, esposta come parametro che controlli tu. (Vedi la documentazione ufficiale sull’extended thinking per il riferimento attuale — i nomi dei parametri possono cambiare tra le versioni dell’SDK, quindi verifica quella che stai usando.)

Qualsiasi endpoint compatibile con Anthropic può effettuare queste chiamate — l'API ufficiale, oppure uno specchio compatibile come AIReiter, dove la richiesta sopra funziona senza modifiche. Quale usi conta meno del punto chiave: il controllo del ragionamento risiede a livello di API, e le app non lo espongono.

Claude sta "peggiorando"?

Questa è la domanda che si cela dietro la maggior parte delle ricerche "perché claude è quasi finito di pensare per sempre", e la risposta onesta è: di solito non è permanente. Gran parte della regressione percepita è dovuta a cambiamenti nel comportamento predefinito — modifiche lato server ai budget di ragionamento, o impostazioni conservative introdotte negli aggiornamenti — piuttosto che al fatto che il modello sia diventato più stupido. C’è molto scambio di opinioni nella comunità su questo, e la conclusione ricorrente è sempre la stessa: l’esperienza si ripristina una volta che riprendi il controllo — imposta il livello di effort, elimina le sessioni ingombranti e fornisci prompt strutturati. Se Claude questa settimana sembra peggiore, cambia queste tre cose prima di concludere che sia rotto.

FAQ

Cosa significa "quasi finito di pensare"?

Significa che Claude è in modalità di ragionamento esteso e sta elaborando un piano prima di scrivere la risposta — uno stato di avanzamento normale, non un errore. Segnala un problema solo quando non si risolve mai.

Perché Claude impiega così tanto tempo a pensare?

Tre cause comuni: un livello di effort predefinito elevato, chiamate sequenziali agli strumenti lente (~300–800ms ciascuna) nelle sessioni agentiche e una finestra di contesto gonfia. Abbassare il livello di effort, ridurre il numero di chiamate agli strumenti e svuotare il contesto aiutano tutti.

Claude si blocca mai a pensare?

Sì — distinto dalla lentezza. Le nuove sessioni possono bloccarsi su "thinking" e non restituire mai l'output, spesso a causa di configurazioni pesanti di hook/MCP/skill o provider personalizzati. Riavvia la sessione oppure torna a una che funziona.

Claude non sta completando la risposta — cosa dovrei fare?

Consideralo un blocco: /clear oppure riavvia, riduci il carico iniziale e controlla il tuo provider. Se è lento invece di essere fermo, abbassa il livello di effort e riduci il contesto.

Posso far pensare più velocemente Claude?

Sì. Imposta effort su low/medium per le attività di routine, mantieni le sessioni brevi e, per un controllo completo, chiama l'API con un livello di effort più basso o con il thinking esteso disabilitato.