Se o Claude estiver parado em "almost done thinking" e você estiver se perguntando se algo quebrou — não quebrou. Esse status significa que o Claude está em extended thinking (seu modo de raciocínio): ele está planejando a resposta antes de começar a escrever. Alguns segundos, até mesmo 20–30 segundos, disso é normal. O que não é normal é esperar minutos sem que nada volte. Esses são dois problemas diferentes, e este guia os separa e oferece a solução para cada um.
O que "quase terminando de pensar" realmente significa
"Quase terminando de pensar" é o rótulo que o Claude mostra enquanto está executando sua etapa de raciocínio estendido. Em vez de responder token por token imediatamente, o modelo gasta um orçamento de tokens de "pensamento" elaborando um plano e, então, produz a resposta visível. Esse é o mesmo mecanismo por trás de "pensando com alto esforço" no Claude Code e dos indicadores de raciocínio nos apps do Claude.
A forma mais clara de interpretar isso: a frase é um sinal de progresso, não um erro. Como uma thread do r/ClaudeCode coloca, a pausa de raciocínio estendido é "Claude planejando antes de executar, não um problema no servidor." Então, quando você vê claude almost done thinking, o modelo está trabalhando — a única questão é se ele está trabalhando tempo demais.
Uma linha geral a ser traçada:
Segundos até ~30s de pensamento → normal, especialmente para tarefas difíceis de raciocínio ou programação.
Minutos sem saída, repetidamente → algo está errado; vá direto para as correções abaixo.
Por que demora tanto (ou trava completamente)
Lentidão e uma verdadeira travamento têm causas diferentes. Três coisas impulsionam o caso de lentidão:
Profundidade de raciocínio estendido. Em uma busca rápida, o Claude pode tender a empregar mais esforço de raciocínio do que a tarefa exige — ele "pensa" bastante sobre uma pergunta que não precisava disso.
Chamadas sequenciais de ferramentas. No uso agentic (Claude Code), a maior parte do tempo de parede não é o raciocínio do modelo — são as chamadas de ferramentas. Uma análise da latência do Claude Code mediu cada leitura de arquivo, busca ou execução de teste em aproximadamente 300–800ms como uma ida e volta síncrona, e observa que elas não são executadas em paralelo por padrão — então um prompt vago que aciona uma dúzia ou mais de chamadas exploratórias acumula essas idas e voltas em mais de dez segundos antes que qualquer trabalho real aconteça.
Inchaço de contexto. Toda a transcrição é reenviada ao modelo a cada turno. À medida que uma sessão se enche, as respostas ficam mais lentas e a qualidade cai — a mesma análise observou uma desaceleração perceptível quando uma sessão ultrapassa aproximadamente 60% da janela de contexto, embora o ponto exato varie (é o efeito de "perdido no meio" em detalhes enterrados profundamente na conversa).
O true hang é uma falha separada. Um problema rastreado do Claude Code (#32526) descreve novas sessões que ficam travadas em "thinking" e nunca produzem saída — nenhum erro, nem mesmo para um simples "hello" — enquanto uma sessão aberta anteriormente continua funcionando normalmente. Esse relato veio de uma configuração pesada: muitos hooks PreToolUse, vários servidores MCP, mais de 80 skills registradas e um provedor personalizado (Bedrock). Se a sua nunca retorna um único token, trate isso como travamento, não lentidão.
Como corrigir isso
Correções rápidas (tente estas primeiro)
/clearpara descartar a conversa e começar do zero — a cura mais rápida para o inchaço de contexto./compactpara resumir e reduzir o contexto. Note que ele é propositalmente com perda de informações, então salve primeiro em um arquivo qualquer coisa importante.Reinicie a sessão ou volte para uma sessão mais antiga que ainda esteja respondendo — a solução alternativa a que a maioria dos usuários recorre quando ocorre uma travada.
Controle o nível de esforço
O fator de velocidade mais negligenciado é esforço. O Claude tende a usar por padrão raciocínio alto/máximo; ajustar o esforço à tarefa gera grandes ganhos de velocidade sem perda de qualidade em trabalhos rotineiros. Uma folha de referência prática:
Tarefa | Esforço | Por quê |
|---|---|---|
Consulta rápida, resumo, formatação |
| Não é necessário raciocínio profundo; quase instantâneo |
Codificação padrão, redação |
| Equilibrado |
Arquitetura, depuração difícil, matemática |
| Vale a pena esperar |
Se a opacidade incomodar você (o Claude oculta os detalhes do raciocínio por padrão), o Claude Code pode exibir um resumo do raciocínio para que você possa pelo menos ver o que ele está fazendo.
Quando está realmente travado, e não apenas lento
Se você obtiver zero de saída, é uma travada, não profundidade:
Reduza a carga de inicialização — desative temporariamente hooks extras de
PreToolUse, servidores MCP não usados e skills, e depois reabra a sessão.Verifique seu provedor — IDs de modelo personalizados e gateways (Bedrock e similares) aparecem em vários relatos de travamento.
Execute com
--verbosepara ver o que ele realmente está fazendo: uma longa sequência de leituras de arquivos aponta para um problema de chamada de ferramenta; uma primeira resposta lenta sem chamadas de ferramenta aponta para latência ou contexto.
Avançado: controle o raciocínio pela API
Os apps dão a você controle limitado sobre o raciocínio. A API fornece esse controle diretamente — e essa é a solução prática se você precisa de latência previsível. Os mesmos níveis de esforço da folha de dicas acima são um parâmetro da API, e você também pode desativar completamente o raciocínio estendido:
message = client.messages.create(
model="claude-opus-4-6",
max_tokens=4096,
thinking={"type": "adaptive"}, # Claude decide quanto pensar
output_config={"effort": "low"}, # low | medium | high | max — limita a profundidade
# ou, para ignorar completamente o pensamento estendido:
# thinking={"type": "disabled"},
messages=[{"role": "user", "content": "..."}],
)Nos modelos atuais do Claude (Opus 4.6 e superiores), você não define um orçamento fixo de tokens — você define um nível de esforço (low para trabalho rápido, até max), ou desativa completamente o pensamento estendido. Esse é o mesmo controle que os aplicativos ocultam, exposto como um parâmetro que você pode controlar. (Consulte a documentação oficial de thinking estendido para a referência atual — os nomes dos parâmetros podem mudar entre versões do SDK, então verifique a versão que você está usando.)
Qualquer endpoint compatível com Anthropic pode fazer essas chamadas — a API oficial, ou um espelho compatível como AIReiter, onde a solicitação acima funciona sem alterações. Qual deles você usa importa menos do que a conclusão: o controle do pensamento fica na camada da API, e os aplicativos não o expõem.
O Claude está "ficando pior"?
Esta é a pergunta que fica por trás da maioria das buscas por "por que o claude está quase terminando de pensar para sempre", e a resposta honesta é: geralmente não é permanente. Grande parte da regressão percebida vem de mudanças no comportamento padrão — ajustes no lado do servidor nos orçamentos de raciocínio, ou padrões conservadores implementados em atualizações — em vez de o modelo ter ficado mais burro. Há muita discussão da comunidade sobre isso, e a conclusão recorrente é a mesma: a experiência melhora quando você retoma o controle — define o nível de esforço, limpa sessões inchadas e fornece prompts estruturados. Se o Claude parecer pior esta semana, mude essas três coisas antes de concluir que ele está quebrado.
FAQ
O que significa "quase terminando de pensar"?
Isso significa que o Claude está no modo de raciocínio estendido, elaborando um plano antes de escrever a resposta — um estado normal de progresso, não um erro. Só sinaliza um problema quando nunca se resolve.
Por que o Claude demora tanto para pensar?
Três causas comuns: um alto nível de esforço padrão, chamadas de ferramentas sequenciais lentas (~300–800ms cada) em sessões agentic e uma janela de contexto inchada. Reduzir o nível de esforço, diminuir o número de chamadas de ferramentas e limpar o contexto ajudam.
Claude alguma vez fica preso pensando?
Sim — distinto de lentidão. Novas sessões podem travar em "thinking" e nunca retornar saída, muitas vezes relacionado a configurações pesadas de hook/MCP/skill ou provedores personalizados. Reinicie a sessão ou retorne a uma que esteja funcionando.
O Claude não está concluindo a resposta — o que devo fazer?
Trate como uma travada: /clear ou reinicie, reduza a carga de inicialização e verifique seu provedor. Se estiver lento em vez de parado, diminua o nível de esforço e reduza o contexto.
Posso fazer o Claude pensar mais rápido?
Sim. Defina o esforço como low/medium para tarefas rotineiras, mantenha as sessões curtas e, para controle total, chame a API com um nível de esforço mais baixo ou com o pensamento estendido desativado.