AIREITER

Claude «Почти закончил думать»: значение и как исправить

Последнее обновление: 2026-06-30 14:54:19

Если Claude находится в состоянии "almost done thinking" и вы задаётесь вопросом, не сломалось ли что-то, — нет, не сломалось. Этот статус означает, что Claude находится в режиме extended thinking (режиме рассуждения): он планирует ответ, прежде чем начать писать. Несколько секунд, даже 20–30 секунд, — это нормально. Ненормально — ждать минуты без какого-либо ответа. Это две разные проблемы, и в этом руководстве они разделены, а для каждой из них приведено решение.

Что на самом деле означает «почти закончил думать»

"Почти закончил думать" — это метка, которую Claude показывает, пока выполняется его проход extended reasoning. Вместо того чтобы сразу отвечать по токену за токеном, модель тратит бюджет токенов "thinking" на выработку плана, а затем выдаёт видимый ответ. Это тот же механизм, что лежит в основе "thinking with high effort" в Claude Code и индикаторов рассуждения в приложениях Claude.

Самый ясный способ понять это: эта фраза — сигнал прогресса, а не ошибки. Как говорится в одной ветке r/ClaudeCode, пауза на расширенное рассуждение — это «Claude планирует перед выполнением, а не проблема на сервере». Так что когда вы видите, что claude почти закончил думать, модель работает — единственный вопрос в том, работает ли она слишком долго.

Грубая граница:

  • Секунды до ~30 с размышления → нормально, особенно для сложных задач на рассуждение или программирование.

  • Минуты без вывода, повторяющиеся → что-то не так; перейдите к исправлениям ниже.

Почему это занимает так много времени (или вообще зависает)

Медленная работа и полный зависание имеют разные причины. На медленный случай влияют три вещи:

  1. Глубина extended-thinking. При быстром поиске Claude может склоняться к тому, чтобы тратить на рассуждения больше усилий, чем требует задача — он «думает» над вопросом, которому это не было нужно.

  2. Последовательные вызовы инструментов. В агентном использовании (Claude Code) большая часть времени по часам — это не рассуждения модели, а вызовы инструментов. Один разбор задержек Claude Code измерял чтение каждого файла, поиск или запуск теста примерно в 300–800ms как синхронный round-trip и отмечает, что по умолчанию они не выполняются параллельно — так что расплывчатый запрос, запускающий дюжину и более исследовательских вызовов, складывает эти round-trip'ы в десять с лишним секунд до того, как начнётся какая-либо реальная работа.

  3. Раздувание контекста. Вся расшифровка разговора отправляется модели заново на каждом ходе. По мере заполнения сессии ответы замедляются, а качество падает — тот же анализ отметил заметное замедление, когда сессия проходит примерно 60% окна контекста, хотя точная точка варьируется (это эффект «lost in the middle» для деталей, спрятанных глубоко в разговоре).

Настоящее зависание — это отдельный сбой. В отслеживаемой проблеме Claude Code (#32526) описано, что новые сеансы застревают на этапе "thinking" и никогда не выдают ответ — без ошибки, даже на простое "hello" — тогда как ранее открытый сеанс продолжает работать нормально. Этот отчет поступил из тяжелой конфигурации: много хуков PreToolUse, несколько MCP servers, более 80 зарегистрированных skills и пользовательский провайдер (Bedrock). Если у вас не возвращается ни один токен, считайте это зависанием, а не медленной работой.

Как это исправить

Быстрые исправления (сначала попробуйте это)

  • /clear чтобы сбросить беседу и начать заново — самый быстрый способ избавиться от разрастания контекста.

  • /compact чтобы кратко суммировать и уменьшить контекст. Учтите, что по замыслу это приводит к потере данных, так что сначала сохраните всё важное в файл.

  • Перезапустите сеанс или вернитесь к более старому сеансу, который всё ещё отвечает — это обходной путь, к которому большинство пользователей прибегают при зависании.

Контролируйте уровень усилий

Самый недооценённый рычаг скорости — это effort. Claude обычно по умолчанию использует высокий/max reasoning; сопоставление effort задаче даёт значительный прирост скорости без потери качества на рутинной работе. Рабочая шпаргалка:

Задача

Сложность

Почему

Быстрый поиск, сводка, форматирование

low

Не требуется глубокое рассуждение; почти мгновенно

Стандартное программирование, составление черновиков

medium

Сбалансировано

Архитектура, сложная отладка, математика

high / xhigh

Стоит подождать

Если вас беспокоит непрозрачность (Claude по умолчанию скрывает детали размышлений), Claude Code может показывать краткое резюме размышлений, чтобы вы хотя бы могли видеть, что он делает.

Когда это действительно застряло, а не просто медленно

Если вы получаете нулевой вывод, это зависание, а не глубина:

  • Уменьшите нагрузку при запуске — временно отключите дополнительные хуки PreToolUse, неиспользуемые серверы MCP и навыки, затем снова откройте сессию.

  • Проверьте своего провайдера — пользовательские ID моделей и шлюзы (Bedrock и подобные) фигурируют во многих отчётах о зависаниях.

  • Запустите с --verbose, чтобы увидеть, что он на самом деле делает: длинная последовательность чтений файлов указывает на проблему с вызовом инструмента; медленный первый ответ без вызовов инструментов указывает на задержку или контекст.

Продвинутый уровень: управление рассуждением через API

Приложения дают вам ограниченный контроль над мышлением. API предоставляет вам этот контроль напрямую — и это практичное решение, если вам нужна предсказуемая задержка. Те же уровни усилий из шпаргалки выше являются параметром API, и вы также можете полностью отключить расширенное мышление:

message = client.messages.create(
    model="claude-opus-4-6",
    max_tokens=4096,
    thinking={"type": "adaptive"},        # Claude решает, сколько думать
    output_config={"effort": "low"},      # low | medium | high | max — ограничивает глубину
    # или, чтобы полностью пропустить расширенное обдумывание:
    # thinking={"type": "disabled"},
    messages=[{"role": "user", "content": "..."}],
)

В текущих моделях Claude (Opus 4.6 и выше) вы не задаёте фиксированный бюджет токенов — вы задаёте уровень усилий (low для быстрой работы, вплоть до max), либо полностью отключаете расширенное мышление. Это тот же самый рычаг, который скрывают приложения, но здесь он доступен как параметр, которым вы управляете. (См. официальную документацию по extended-thinking для актуальной справки — имена параметров могут меняться между версиями SDK, так что проверьте ту, которую используете.)

Любая совместимая с Anthropic конечная точка может выполнять эти вызовы — официальный API или совместимое зеркало, такое как AIReiter, где приведённый выше запрос работает без изменений. То, что вы используете, имеет меньшее значение, чем вывод: управление thinking находится на уровне API, а приложения его не предоставляют.

Клод «становится хуже»?

Это вопрос, который скрывается за большинством поисковых запросов вроде "why is claude almost done thinking forever", и честный ответ таков: обычно это не навсегда. Значительная часть кажущейся деградации связана с изменениями поведения по умолчанию — серверными корректировками бюджетов на размышление или более консервативными настройками по умолчанию, внедрёнными в обновлениях, — а не с тем, что модель поумнела меньше. В сообществе по этому поводу много споров, и повторяющийся вывод один и тот же: опыт восстанавливается, как только вы берёте управление в свои руки — задаёте уровень усилий, очищаете раздутые сессии и формулируете структурированные запросы. Если на этой неделе Claude кажется хуже, измените эти три вещи, прежде чем делать вывод, что он сломан.

FAQ

Что означает «почти закончил думать»?

Это означает, что Claude находится в режиме расширенного рассуждения и вырабатывает план перед тем, как написать ответ — это обычное состояние выполнения, а не ошибка. Проблема возникает только в том случае, если оно так и не завершается.

Почему Claude так долго думает?

Три обычные причины: высокий уровень усилий по умолчанию, медленные последовательные вызовы инструментов (~300–800ms каждый) в агентных сессиях и раздутый контекстный window. Снижение уровня усилий, уменьшение числа вызовов инструментов и очистка контекста — все это помогает.

Claude когда-нибудь застревает в размышлениях?

Да — это отличается от медленной работы. Новые сеансы могут зависать на «thinking» и так и не возвращать результат, часто из-за тяжёлых hook/MCP/skill-настроек или пользовательских провайдеров. Перезапустите сеанс или вернитесь к рабочему.

Claude не завершает ответ — что мне делать?

Относитесь к этому как к зависанию: /clear или перезапустите, уменьшите начальную загрузку и проверьте своего провайдера. Если это медленно, а не зависло, снизьте уровень усилий и сократите контекст.

Могу ли я заставить Claude думать быстрее?

Да. Установите effort на low/medium для рутинных задач, делайте сеансы короткими, а для полного контроля вызывайте API с более низким уровнем effort или с отключённым extended thinking.