Wenn Claude bei "almost done thinking" festhängt und du dich fragst, ob etwas kaputtgegangen ist — ist es nicht. Dieser Status bedeutet, dass Claude sich im extended thinking (seinem Reasoning-Modus) befindet: Es plant die Antwort, bevor es mit dem Schreiben beginnt. Ein paar Sekunden, sogar 20–30 Sekunden, sind dabei normal. Was nicht normal ist, sind minutenlanges Warten ohne jede Rückmeldung. Das sind zwei verschiedene Probleme, und dieser Leitfaden trennt sie voneinander und gibt dir für jedes die passende Lösung.
Was „fast fertig mit dem Nachdenken“ tatsächlich bedeutet
"Fast fertig mit dem Nachdenken" ist die Bezeichnung, die Claude anzeigt, während es seinen erweiterten Reasoning-Durchlauf ausführt. Anstatt sofort Token für Token zu antworten, verbringt das Modell ein Budget an "Thinking"-Tokens damit, einen Plan auszuarbeiten, und erzeugt dann die sichtbare Antwort. Dies ist derselbe Mechanismus, der hinter "thinking with high effort" in Claude Code und den Reasoning-Indikatoren in den Claude-Apps steckt.
Die klarste Art, es zu verstehen: Die Formulierung ist ein Fortschritts-Signal, kein Fehler. Wie ein r/ClaudeCode-Thread es ausdrückt, ist die Pause für erweitertes Denken „Claude plant vor der Ausführung, kein Serverproblem“. Wenn Sie also sehen, dass Claude fast mit dem Nachdenken fertig ist, arbeitet das Modell — die einzige Frage ist, ob es zu lange arbeitet.
Eine grobe Richtlinie:
Sekunden bis zu ~30 Sekunden Nachdenken → normal, besonders bei schwierigen Denk- oder Programmieraufgaben.
Minutenlang keine Ausgabe, wiederholt → etwas stimmt nicht; springe zu den untenstehenden Lösungen.
Warum es so lange dauert (oder ganz hängt)
Langsamkeit und ein echter Hänger haben unterschiedliche Ursachen. Drei Dinge treiben den langsamen Fall an:
Tiefe des Extended Thinking. Bei einer schnellen Abfrage kann Claude dazu neigen, mehr Denkaufwand zu investieren, als die Aufgabe erfordert — es „denkt“ intensiv über eine Frage nach, die das eigentlich nicht gebraucht hätte.
Sequenzielle Tool-Aufrufe. In agentischer Nutzung (Claude Code) entfällt der Großteil der Laufzeit nicht auf das Modelldenken — sondern auf Tool-Aufrufe. Eine Analyse der Claude-Code-Latenz maß jede Dateilesung, Suche oder jeden Testlauf als synchronen Roundtrip mit etwa 300–800ms und merkt an, dass sie standardmäßig nicht parallel ausgeführt werden — daher stapelt ein vager Prompt, der ein Dutzend oder mehr explorative Aufrufe auslöst, diese Roundtrips zu zehn oder mehr Sekunden, bevor überhaupt echte Arbeit beginnt.
Kontextaufblähung. Das gesamte Protokoll wird bei jedem Durchlauf erneut an das Modell gesendet. Wenn eine Sitzung voller wird, verlangsamen sich die Antworten und die Qualität sinkt — dieselbe Analyse beobachtete eine spürbare Verlangsamung, sobald eine Sitzung ungefähr 60% des Kontextfensters überschreitet, obwohl der genaue Punkt variiert (das ist der „lost in the middle“-Effekt bei Details, die tief in der Unterhaltung verborgen sind).
Der echte Hänger ist ein separater Fehler. Ein verfolgtes Claude-Code-Problem (#32526) beschreibt, dass neue Sitzungen bei „thinking“ festhängen und nie Ausgabe erzeugen — kein Fehler, nicht einmal auf ein einfaches „hello“ — während eine zuvor geöffnete Sitzung weiterhin einwandfrei funktioniert. Dieser Bericht stammte aus einem komplexen Setup: viele PreToolUse-Hooks, mehrere MCP-Server, über 80 registrierte Skills und ein benutzerdefinierter (Bedrock-)Provider. Wenn bei Ihnen nie ein einziges Token zurückkommt, behandeln Sie es als Hänger, nicht als Langsamkeit.
Wie man es behebt
Schnelle Lösungen (probieren Sie diese zuerst)
/clear, um die Unterhaltung zu beenden und neu zu beginnen — die schnellste Lösung gegen Kontextaufblähung./compact, um den Kontext zusammenzufassen und zu verkleinern. Beachte, dass dies absichtlich mit Datenverlust einhergeht, also speichere zuerst alles Wichtige in einer Datei.Starte die Sitzung neu oder wechsle zu einer älteren Sitzung zurück, die noch reagiert — die Umgehungslösung, auf die die meisten Nutzer bei einem Hänger zurückgreifen.
Kontrollieren Sie den Aufwandsgrad
Der am häufigsten übersehene Geschwindigkeitshebel ist Aufwand. Claude neigt dazu, standardmäßig auf hohes/maximales Reasoning zu setzen; den Aufwand an die Aufgabe anzupassen, bringt große Geschwindigkeitsgewinne ohne Qualitätsverlust bei routinemäßiger Arbeit. Ein praktisches Cheat Sheet:
Aufgabe | Aufwand | Warum |
|---|---|---|
Schnelles Nachschlagen, Zusammenfassung, Formatierung |
| Kein tiefes Nachdenken erforderlich; nahezu sofort |
Standard-Coding, Entwurf |
| Ausgewogen |
Architektur, schwieriges Debugging, Mathematik |
| Das Warten wert |
Wenn Sie die Opazität stört (Claude blendet Denkdetails standardmäßig aus), kann Claude Code eine Denkzusammenfassung anzeigen, sodass Sie zumindest sehen können, was es tut.
Wenn es wirklich festhängt, nicht nur langsam ist
Wenn Sie null Ausgabe erhalten, ist das ein Hängenbleiben, nicht die Tiefe:
Reduzieren Sie die Startlast — deaktivieren Sie vorübergehend zusätzliche
PreToolUse-Hooks, ungenutzte MCP-Server und Skills und öffnen Sie dann die Sitzung erneut.Überprüfen Sie Ihren Provider — benutzerdefinierte Modell-IDs und Gateways (Bedrock und ähnliche) tauchen in einer Reihe von Berichten über Hänger auf.
Führen Sie es mit
--verboseaus, um zu sehen, was es tatsächlich tut: Eine lange Reihe von Dateizugriffen weist auf ein Tool-Call-Problem hin; eine langsame erste Antwort ohne Tool-Calls weist auf Latenz oder Kontext hin.
Fortgeschritten: Denken über die API steuern
Die Apps geben Ihnen nur begrenzte Kontrolle über das Denken. Die API gibt Ihnen diese Kontrolle direkt — und das ist die praktische Lösung, wenn Sie eine vorhersehbare Latenz benötigen. Die gleichen Aufwandsstufen aus dem Cheat Sheet oben sind ein API-Parameter, und Sie können erweitertes Denken außerdem vollständig deaktivieren:
message = client.messages.create(
model="claude-opus-4-6",
max_tokens=4096,
thinking={"type": "adaptive"}, # Claude entscheidet, wie viel nachzudenken ist
output_config={"effort": "low"}, # low | medium | high | max — begrenzt die Tiefe
# oder, um erweitertes Nachdenken ganz zu überspringen:
# thinking={"type": "disabled"},
messages=[{"role": "user", "content": "..."}],
)Bei aktuellen Claude-Modellen (Opus 4.6 und höher) legen Sie kein festes Token-Budget fest — Sie setzen stattdessen ein Effort-Level (low für schnelle Arbeit bis max) oder deaktivieren Extended Thinking vollständig. Das ist derselbe Hebel, den die Apps verbergen, als von Ihnen steuerbarer Parameter offen gelegt. (Siehe die offizielle Extended-Thinking-Dokumentation für die aktuelle Referenz — Parameternamen können sich zwischen SDK-Versionen ändern, prüfen Sie daher die Version, die Sie verwenden.)
Jeder Anthropic-kompatible Endpunkt kann diese Aufrufe ausführen — die offizielle API oder ein kompatibler Mirror wie AIReiter, bei dem die obige Anfrage unverändert funktioniert. Welche Sie verwenden, ist weniger wichtig als die Kernaussage: Die Kontrolle des Denkprozesses liegt auf der API-Ebene, und die Apps legen sie nicht offen.
Wird Claude „schlechter“?
Dies ist die Frage, die hinter den meisten Suchen nach „why is claude almost done thinking forever“ lauert, und die ehrliche Antwort ist: meist ist es nicht dauerhaft. Ein großer Teil der wahrgenommenen Verschlechterung lässt sich auf Änderungen des Standardverhaltens zurückführen — serverseitige Anpassungen an den Thinking-Budgets oder konservative Standardwerte, die in Updates ausgerollt wurden — und nicht darauf, dass das Modell dümmer geworden ist. Dazu gibt es in der Community viel Hin und Her, und das wiederkehrende Fazit ist dasselbe: Die Erfahrung erholt sich, sobald man die Kontrolle zurücknimmt — das Effort-Level festlegt, aufgeblähte Sessions bereinigt und strukturierte Prompts vorgibt. Wenn Claude sich diese Woche schlechter anfühlt, ändere diese drei Dinge, bevor du zu dem Schluss kommst, dass es kaputt ist.
FAQ
Was bedeutet „fast fertig mit dem Nachdenken“?
Das bedeutet, dass Claude sich im erweiterten Denkmodus befindet und einen Plan ausarbeitet, bevor es die Antwort schreibt — ein normaler Fortschrittszustand, kein Fehler. Es signalisiert nur dann ein Problem, wenn es sich nie auflöst.
Warum braucht Claude so lange zum Nachdenken?
Drei häufige Ursachen: ein hoher Standard-Aufwand, langsame sequentielle Tool-Aufrufe (~300–800 ms jeweils) in agentischen Sitzungen und ein aufgeblähtes Kontextfenster. Das Senken des Aufwands, die Reduzierung der Anzahl der Tool-Aufrufe und das Leeren des Kontexts helfen jeweils.
Bleibt Claude jemals beim Nachdenken stecken?
Ja — unterscheidet sich von Langsamkeit. Neue Sitzungen können bei „thinking“ hängen bleiben und nie eine Ausgabe zurückgeben, oft im Zusammenhang mit umfangreichen Hook/MCP/Skill-Konfigurationen oder benutzerdefinierten Providern. Starten Sie die Sitzung neu oder wechseln Sie zu einer funktionierenden.
Claude beendet die Antwort nicht — was soll ich tun?
Behandle es als Hänger: /clear oder neu starten, die Startlast reduzieren und deinen Provider prüfen. Wenn es langsam statt hängen geblieben ist, senke die Aufwandsstufe und verkleinere den Kontext.
Kann ich Claude dazu bringen, schneller zu denken?
Ja. Setze den Aufwand für Routineaufgaben auf low/medium, halte Sitzungen kurz, und für vollständige Kontrolle rufe die API mit einem niedrigeren Aufwandsniveau oder deaktiviertem Extended Thinking auf.