Si Claude se queda en "almost done thinking" y te preguntas si algo se rompió — no es así. Ese estado significa que Claude está en extended thinking (su modo de razonamiento): está planificando la respuesta antes de empezar a escribir. Unos pocos segundos, incluso 20–30 segundos, de esto es normal. Lo que no es normal es esperar minutos sin recibir nada. Son dos problemas diferentes, y esta guía los separa y te da la solución para cada uno.
Qué significa realmente "casi terminado de pensar"
"Casi terminado de pensar" es la etiqueta que Claude muestra mientras ejecuta su paso de razonamiento extendido. En lugar de responder token por token de inmediato, el modelo dedica un presupuesto de tokens de "pensamiento" a elaborar un plan y luego produce la respuesta visible. Este es el mismo mecanismo detrás de "thinking with high effort" en Claude Code y de los indicadores de razonamiento en las aplicaciones de Claude.
La forma más clara de entenderlo: la frase es una señal de progreso, no un error. Como lo expresa un hilo de r/ClaudeCode, la pausa de razonamiento extendido es "Claude planificando antes de ejecutar, no un problema del servidor." Así que cuando ves que claude casi ha terminado de pensar, el modelo está trabajando: la única pregunta es si está trabajando demasiado tiempo.
Una línea aproximada a trazar:
Segundos a ~30 s de pensamiento → normal, especialmente para tareas difíciles de razonamiento o programación.
Minutos sin salida, repetidamente → algo anda mal; salta a las correcciones abajo.
Por qué tarda tanto (o se queda completamente bloqueado)
La lentitud y un bloqueo real tienen causas diferentes. Tres cosas impulsan el caso de lentitud:
Profundidad de pensamiento extendido. En una consulta rápida, Claude puede tender a dedicar más esfuerzo de razonamiento del que la tarea necesita — "piensa" mucho en una pregunta que no lo requería.
Llamadas secuenciales a herramientas. En uso agentic (Claude Code), la mayor parte del tiempo transcurrido no es el razonamiento del modelo — son las llamadas a herramientas. Un desglose de la latencia de Claude Code midió cada lectura de archivo, búsqueda o ejecución de prueba en aproximadamente 300–800ms como un viaje de ida y vuelta sincrónico, y señala que no se ejecutan en paralelo por defecto — así que un prompt vago que desencadena una docena o más de llamadas exploratorias acumula esos viajes de ida y vuelta en más de diez segundos antes de que ocurra cualquier trabajo real.
Inflado del contexto. La transcripción completa se vuelve a enviar al modelo en cada turno. A medida que una sesión se llena, las respuestas se vuelven más lentas y la calidad disminuye — el mismo análisis observó una desaceleración notable una vez que una sesión supera aproximadamente el 60% de la ventana de contexto, aunque el punto exacto varía (es el efecto de "perderse en el medio" en detalles enterrados profundamente en la conversación).
El bloqueo real es un fallo aparte. Un problema registrado de Claude Code (#32526) describe que las nuevas sesiones se quedan atascadas en "thinking" y nunca producen salida — sin error, ni siquiera ante un simple "hello" — mientras que una sesión abierta previamente sigue funcionando bien. Ese informe provenía de una configuración muy cargada: muchos hooks PreToolUse, varios servidores MCP, más de 80 skills registradas y un proveedor personalizado (Bedrock). Si la tuya nunca devuelve ni un solo token, trátalo como un bloqueo, no como lentitud.
Cómo solucionarlo
Soluciones rápidas (prueba estas primero)
/clearpara descartar la conversación y empezar de cero — la solución más rápida para la saturación del contexto./compactpara resumir y reducir el contexto. Ten en cuenta que es intencionalmente con pérdida, así que guarda primero en un archivo cualquier cosa importante.Reinicia la sesión, o vuelve a una sesión anterior que siga respondiendo — la solución alternativa a la que llega la mayoría de los usuarios cuando ocurre un bloqueo.
Controla el nivel de esfuerzo
La palanca de velocidad más pasada por alto es el esfuerzo. Claude tiende a usar de forma predeterminada un razonamiento alto/máximo; ajustar el esfuerzo a la tarea ofrece grandes mejoras de velocidad sin pérdida de calidad en el trabajo rutinario. Una guía práctica:
Tarea | Esfuerzo | Por qué |
|---|---|---|
Búsqueda rápida, resumen, formato |
| No se necesita razonamiento profundo; casi instantáneo |
Programación estándar, redacción |
| Equilibrado |
Arquitectura, depuración difícil, matemáticas |
| Vale la pena la espera |
Si la opacidad te molesta (Claude oculta el detalle del pensamiento de forma predeterminada), Claude Code puede mostrar un resumen del pensamiento para que al menos puedas ver qué está haciendo.
Cuando está realmente atascado, no solo lento
Si obtienes salida cero, es un bloqueo, no profundidad:
Reduce la carga inicial — deshabilita temporalmente los hooks extra de
PreToolUse, los servidores MCP no utilizados y las skills, y luego vuelve a abrir la sesión.Revisa tu proveedor — los IDs de modelo personalizados y los gateways (Bedrock y similares) aparecen en varios informes de bloqueo.
Ejecuta con
--verbosepara ver qué está haciendo realmente: una larga سلسلة de lecturas de archivos apunta a un problema con una llamada a herramienta; una primera respuesta lenta sin llamadas a herramientas apunta a latencia o contexto.
Avanzado: controlar el pensamiento desde la API
Las apps te dan un control limitado sobre el pensamiento. La API te da ese control directamente — y esa es la solución práctica si necesitas una latencia predecible. Los mismos niveles de esfuerzo de la hoja de referencia anterior son un parámetro de API, y también puedes desactivar por completo el thinking extendido:
message = client.messages.create(
model="claude-opus-4-6",
max_tokens=4096,
thinking={"type": "adaptive"}, # Claude decide cuánto pensar
output_config={"effort": "low"}, # low | medium | high | max — limita la profundidad
# o, para omitir por completo el pensamiento extendido:
# thinking={"type": "disabled"},
messages=[{"role": "user", "content": "..."}],
)En los modelos actuales de Claude (Opus 4.6 y posteriores) no se establece un presupuesto fijo de tokens — se establece un nivel de esfuerzo (low para trabajo rápido, hasta max), o se desactiva por completo el pensamiento extendido. Esa es la misma palanca que ocultan las aplicaciones, expuesta como un parámetro que tú controlas. (Consulta la documentación oficial de pensamiento extendido para la referencia actual — los nombres de los parámetros pueden cambiar entre versiones del SDK, así que verifica la que estés usando.)
Cualquier endpoint compatible con Anthropic puede realizar estas llamadas — la API oficial, o un espejo compatible como AIReiter, donde la solicitud anterior funciona sin cambios. Cuál uses importa menos que la conclusión: el control del pensamiento reside en la capa de la API, y las aplicaciones no lo exponen.
¿Claude "está empeorando"?
Esta es la pregunta que acecha detrás de la mayoría de las búsquedas de "why is claude almost done thinking forever", y la respuesta honesta es: normalmente no es permanente. Gran parte de la regresión percibida se debe a cambios en el comportamiento predeterminado — ajustes del lado del servidor a los presupuestos de razonamiento, o valores predeterminados conservadores implementados en actualizaciones — más que a que el modelo se vuelva más tonto. Hay mucho debate en la comunidad sobre esto, y la conclusión recurrente es la misma: la experiencia se recupera una vez que recuperas el control — establece el nivel de esfuerzo, limpia sesiones infladas y da indicaciones estructuradas. Si Claude se siente peor esta semana, cambia esas tres cosas antes de concluir que está roto.
Preguntas frecuentes
¿Qué significa "casi termina de pensar"?
Significa que Claude está en su modo de razonamiento extendido, elaborando un plan antes de escribir la respuesta — un estado de progreso normal, no un error. Solo indica un problema cuando nunca se resuelve.
¿Por qué Claude tarda tanto en pensar?
Tres causas habituales: un alto nivel de esfuerzo predeterminado, llamadas secuenciales lentas a herramientas (~300–800 ms cada una) en sesiones agentic, y una ventana de contexto sobrecargada. Bajar el nivel de esfuerzo, reducir el número de llamadas a herramientas y limpiar el contexto ayudan.
¿Claude alguna vez se queda atascado pensando?
Sí — distinto de la lentitud. Las nuevas sesiones pueden quedarse bloqueadas en "thinking" y nunca devolver resultados, a menudo relacionado con configuraciones pesadas de hook/MCP/skill o proveedores personalizados. Reinicia la sesión o vuelve a una que esté funcionando.
Claude no está terminando la respuesta — ¿qué debo hacer?
Trátalo como un bloqueo: /clear o reinicia, reduce la carga de inicio y revisa tu proveedor. Si está lento en lugar de detenido, baja el nivel de esfuerzo y reduce el contexto.
¿Puedo hacer que Claude piense más rápido?
Sí. Establece effort en low/medium para tareas rutinarias, mantén las sesiones cortas y, para un control total, llama a la API con un nivel de effort más bajo o con extended thinking deshabilitado.