AIREITER

Claude "Quase Terminando de Pensar": significado e como corrigir

Última Atualização: 2026-06-30 14:53:32

Se o Claude estiver parado em "almost done thinking" e você estiver se perguntando se algo quebrou — não quebrou. Esse status significa que o Claude está em extended thinking (seu modo de raciocínio): ele está planejando a resposta antes de começar a escrever. Alguns segundos, até mesmo 20–30 segundos, disso é normal. O que não é normal é esperar minutos sem que nada volte. Esses são dois problemas diferentes, e este guia os separa e oferece a solução para cada um.

O que "quase terminando de pensar" realmente significa

"Quase terminando de pensar" é o rótulo que o Claude mostra enquanto está executando sua etapa de raciocínio estendido. Em vez de responder token por token imediatamente, o modelo gasta um orçamento de tokens de "pensamento" elaborando um plano e, então, produz a resposta visível. Esse é o mesmo mecanismo por trás de "pensando com alto esforço" no Claude Code e dos indicadores de raciocínio nos apps do Claude.

A forma mais clara de interpretar isso: a frase é um sinal de progresso, não um erro. Como uma thread do r/ClaudeCode coloca, a pausa de raciocínio estendido é "Claude planejando antes de executar, não um problema no servidor." Então, quando você vê claude almost done thinking, o modelo está trabalhando — a única questão é se ele está trabalhando tempo demais.

Uma linha geral a ser traçada:

  • Segundos até ~30s de pensamento → normal, especialmente para tarefas difíceis de raciocínio ou programação.

  • Minutos sem saída, repetidamente → algo está errado; vá direto para as correções abaixo.

Por que demora tanto (ou trava completamente)

Lentidão e uma verdadeira travamento têm causas diferentes. Três coisas impulsionam o caso de lentidão:

  1. Profundidade de raciocínio estendido. Em uma busca rápida, o Claude pode tender a empregar mais esforço de raciocínio do que a tarefa exige — ele "pensa" bastante sobre uma pergunta que não precisava disso.

  2. Chamadas sequenciais de ferramentas. No uso agentic (Claude Code), a maior parte do tempo de parede não é o raciocínio do modelo — são as chamadas de ferramentas. Uma análise da latência do Claude Code mediu cada leitura de arquivo, busca ou execução de teste em aproximadamente 300–800ms como uma ida e volta síncrona, e observa que elas não são executadas em paralelo por padrão — então um prompt vago que aciona uma dúzia ou mais de chamadas exploratórias acumula essas idas e voltas em mais de dez segundos antes que qualquer trabalho real aconteça.

  3. Inchaço de contexto. Toda a transcrição é reenviada ao modelo a cada turno. À medida que uma sessão se enche, as respostas ficam mais lentas e a qualidade cai — a mesma análise observou uma desaceleração perceptível quando uma sessão ultrapassa aproximadamente 60% da janela de contexto, embora o ponto exato varie (é o efeito de "perdido no meio" em detalhes enterrados profundamente na conversa).

O true hang é uma falha separada. Um problema rastreado do Claude Code (#32526) descreve novas sessões que ficam travadas em "thinking" e nunca produzem saída — nenhum erro, nem mesmo para um simples "hello" — enquanto uma sessão aberta anteriormente continua funcionando normalmente. Esse relato veio de uma configuração pesada: muitos hooks PreToolUse, vários servidores MCP, mais de 80 skills registradas e um provedor personalizado (Bedrock). Se a sua nunca retorna um único token, trate isso como travamento, não lentidão.

Como corrigir isso

Correções rápidas (tente estas primeiro)

  • /clear para descartar a conversa e começar do zero — a cura mais rápida para o inchaço de contexto.

  • /compact para resumir e reduzir o contexto. Note que ele é propositalmente com perda de informações, então salve primeiro em um arquivo qualquer coisa importante.

  • Reinicie a sessão ou volte para uma sessão mais antiga que ainda esteja respondendo — a solução alternativa a que a maioria dos usuários recorre quando ocorre uma travada.

Controle o nível de esforço

O fator de velocidade mais negligenciado é esforço. O Claude tende a usar por padrão raciocínio alto/máximo; ajustar o esforço à tarefa gera grandes ganhos de velocidade sem perda de qualidade em trabalhos rotineiros. Uma folha de referência prática:

Tarefa

Esforço

Por quê

Consulta rápida, resumo, formatação

low

Não é necessário raciocínio profundo; quase instantâneo

Codificação padrão, redação

medium

Equilibrado

Arquitetura, depuração difícil, matemática

high / xhigh

Vale a pena esperar

Se a opacidade incomodar você (o Claude oculta os detalhes do raciocínio por padrão), o Claude Code pode exibir um resumo do raciocínio para que você possa pelo menos ver o que ele está fazendo.

Quando está realmente travado, e não apenas lento

Se você obtiver zero de saída, é uma travada, não profundidade:

  • Reduza a carga de inicialização — desative temporariamente hooks extras de PreToolUse, servidores MCP não usados e skills, e depois reabra a sessão.

  • Verifique seu provedor — IDs de modelo personalizados e gateways (Bedrock e similares) aparecem em vários relatos de travamento.

  • Execute com --verbose para ver o que ele realmente está fazendo: uma longa sequência de leituras de arquivos aponta para um problema de chamada de ferramenta; uma primeira resposta lenta sem chamadas de ferramenta aponta para latência ou contexto.

Avançado: controle o raciocínio pela API

Os apps dão a você controle limitado sobre o raciocínio. A API fornece esse controle diretamente — e essa é a solução prática se você precisa de latência previsível. Os mesmos níveis de esforço da folha de dicas acima são um parâmetro da API, e você também pode desativar completamente o raciocínio estendido:

message = client.messages.create(
    model="claude-opus-4-6",
    max_tokens=4096,
    thinking={"type": "adaptive"},        # Claude decide quanto pensar
    output_config={"effort": "low"},      # low | medium | high | max — limita a profundidade
    # ou, para ignorar completamente o pensamento estendido:
    # thinking={"type": "disabled"},
    messages=[{"role": "user", "content": "..."}],
)

Nos modelos atuais do Claude (Opus 4.6 e superiores), você não define um orçamento fixo de tokens — você define um nível de esforço (low para trabalho rápido, até max), ou desativa completamente o pensamento estendido. Esse é o mesmo controle que os aplicativos ocultam, exposto como um parâmetro que você pode controlar. (Consulte a documentação oficial de thinking estendido para a referência atual — os nomes dos parâmetros podem mudar entre versões do SDK, então verifique a versão que você está usando.)

Qualquer endpoint compatível com Anthropic pode fazer essas chamadas — a API oficial, ou um espelho compatível como AIReiter, onde a solicitação acima funciona sem alterações. Qual deles você usa importa menos do que a conclusão: o controle do pensamento fica na camada da API, e os aplicativos não o expõem.

O Claude está "ficando pior"?

Esta é a pergunta que fica por trás da maioria das buscas por "por que o claude está quase terminando de pensar para sempre", e a resposta honesta é: geralmente não é permanente. Grande parte da regressão percebida vem de mudanças no comportamento padrão — ajustes no lado do servidor nos orçamentos de raciocínio, ou padrões conservadores implementados em atualizações — em vez de o modelo ter ficado mais burro. Há muita discussão da comunidade sobre isso, e a conclusão recorrente é a mesma: a experiência melhora quando você retoma o controle — define o nível de esforço, limpa sessões inchadas e fornece prompts estruturados. Se o Claude parecer pior esta semana, mude essas três coisas antes de concluir que ele está quebrado.

FAQ

O que significa "quase terminando de pensar"?

Isso significa que o Claude está no modo de raciocínio estendido, elaborando um plano antes de escrever a resposta — um estado normal de progresso, não um erro. Só sinaliza um problema quando nunca se resolve.

Por que o Claude demora tanto para pensar?

Três causas comuns: um alto nível de esforço padrão, chamadas de ferramentas sequenciais lentas (~300–800ms cada) em sessões agentic e uma janela de contexto inchada. Reduzir o nível de esforço, diminuir o número de chamadas de ferramentas e limpar o contexto ajudam.

Claude alguma vez fica preso pensando?

Sim — distinto de lentidão. Novas sessões podem travar em "thinking" e nunca retornar saída, muitas vezes relacionado a configurações pesadas de hook/MCP/skill ou provedores personalizados. Reinicie a sessão ou retorne a uma que esteja funcionando.

O Claude não está concluindo a resposta — o que devo fazer?

Trate como uma travada: /clear ou reinicie, reduza a carga de inicialização e verifique seu provedor. Se estiver lento em vez de parado, diminua o nível de esforço e reduza o contexto.

Posso fazer o Claude pensar mais rápido?

Sim. Defina o esforço como low/medium para tarefas rotineiras, mantenha as sessões curtas e, para controle total, chame a API com um nível de esforço mais baixo ou com o pensamento estendido desativado.