Token-Verbrauch in Claude Code senken
Ein 12-Schritte-Walkthrough mit Screenshots: /context, /compact und /clear richtig eingesetzt, ein schlankes CLAUDE.md, weniger MCP-Server, Delegation an Subagenten — und günstigere Modelle über DeepSeek.
Kurz zusammengefasst
- Erst /context ausführen — es zeigt exakt, wie viele Tokens Systemprompt, Tools, MCP-Server und Messages fressen, bevor du irgendetwas kürzt.
- /compact, wenn du weitermachst, /clear, wenn du neu startest; was langfristig gemerkt werden soll, gehört in CLAUDE.md, nicht ins Gespräch.
- Startlast reduzieren: weniger MCP-Server, ein schlankes CLAUDE.md — jeder installierte Skill und Agent zahlt trotzdem seine Beschreibung in den Kontext ein.
- Fragen, die nur eine Antwort brauchen, an Subagenten geben und einfache Arbeit an günstige Modelle: Effort senken oder das gesamte CLI zu DeepSeek-Preisen abrechnen lassen.
Context Management in Claude Code
Kanal: Claude — official YouTube channel3:31
How to Optimize Token Usage in Claude Code
Kanal: Greg14:59
Managing context — official Claude Code docs
Docs: code.claude.com/docs
7 Ways To Cut Your Claude Code Token Usage In Half
Kanal: Sean Kochel28:13
How to Reduce Token Usage in Claude Code (2026)
Kanal: The Code City5:09
Die Frames stammen aus dem offiziellen Context-Management-Walkthrough und einer sauberen Aufzeichnung der Pricing-Slides; die Schritttexte folgen diesen Videos und der offiziellen Doku zu Kosten und Kontext.
Community-Faktenquellen (nur namentlich genannt, keine Frames entnommen): „7 Ways To Cut Your Claude Code Token Usage In Half“ von Sean Kochel und „How to Reduce Token Usage in Claude Code (2026)“ von The Code City. Screenshots bleiben Eigentum ihrer Ersteller und sind auf den exakten Timestamp verlinkt.
Die Token-Diät in 12 Schritten
Sehen, wohin die Tokens fließen
- 1
Wisse, was ein Token kostet
Modelle rechnen nach Millionen Tokens ab, Ein- und Ausgabe gleichermaßen. Jedes verschwendete Token — ein aufgeblähter Systemprompt, eine erneut gelesene Datei, eine ausschweifende Antwort — ist bei Opus-Preisen echtes Geld.

Opus 4 listet 15 $ pro Million Input-Tokens, da summieren sich ein paar tausend verschwendete Tokens pro Session schnell.Ansehen ab 1:20 - 2
Vor dem Tippen sehen, was geladen wird
Beim Sessionstart lädt Claude Code Name und Beschreibung jedes installierten Custom Agents und Skills in den Kontext. Allein in dieser Session kosten code-reviewer 355 Tokens und doc-helper 68 — noch bevor der erste Prompt kommt.

Jeder Agent und Skill in dieser Liste zahlt ab dem ersten Turn Eintritt.Ansehen ab 1:00 - 3
Das /context-Dashboard öffnen
Tippe /context für die volle Aufschlüsselung: wie viel Systemprompt, System-Tools, MCP-Server und Messages jeweils verbrauchen — und wie viel Fenster noch frei ist.

21k von 200k Tokens belegt, 11 Prozent — und die Session hat gerade erst angefangen.Ansehen ab 1:30
Ballast abwerfen
- 4
Lange Session mit /compact verdichten
Nahe des Kontextlimits komprimiert Claude Code automatisch, aber warten musst du nicht: /compact presst die Konversation sofort in eine Zusammenfassung.

/compact staucht die ganze Konversation auf Abruf in eine Zusammenfassung.Ansehen ab 1:08 - 5
Nach dem Compact direkt weiterarbeiten
Die Zusammenfassung behält die Details, die zählen — gelesene Dateien, getroffene Entscheidungen, offene Aufgaben — und wirft genau die redundante Tool-Ausgabe weg, die das Fenster gefressen hat.

Direkt nach dem Compact: Plan und offene Fragen überleben, der Lärm nicht.Ansehen ab 1:45 - 6
Zwischen Aufgaben mit /clear leeren
Faustregel: Bleibst du am aktuellen Feature, /compact; beginnst du ein neues, löscht /clear den Verlauf und gibt das ganze Fenster frei. Alles, was langfristig gemerkt werden soll, gehört in CLAUDE.md.

Die Autocomplete-Beschreibung von /clear sagt es selbst: Verlauf löschen und Kontext freigeben.Ansehen ab 1:18
Prompts anders schreiben
- 7
Recherche an einen Subagenten auslagern
Fragen, die nur eine Antwort brauchen — etwa „Wo liegen die Authentifizierungs-Endpunkte?“ — gibst du einem Subagenten, statt im Hauptthread zu graben.

Der Code-reviewer-Subagent prüft den frischen Code, während im Hintergrund ein git diff läuft.Ansehen ab 2:50 - 8
Warum Subagenten Tokens sparen
Ein Subagent läuft in seinem eigenen, isolierten Kontextfenster: Er liest, grept und erkundet nach Bedarf, und nur das Endergebnis fließt in deinen Hauptthread zurück.

Hauptagent und Subagent halten je eigene Kontexte — nur die Antwort wandert zurück.Ansehen ab 2:55 - 9
Einmal sagen, präzise sagen
Nenne Dateien und Änderungsumfang schon im ersten Prompt. Vage Prompts zwingen das Modell, die komplette Codebasis zu durchforsten — und jede Extra-Suchrunde verbrennt Tokens.
Laden und Antworten stutzen
- 10
Ungenutzte MCP-Server abklemmen
Jeder aktive MCP-Server lädt seine kompletten Tool-Definitionen in den Kontext, ob du sie benutzt oder nicht. Deaktiviere, was das Projekt nicht braucht — für leichtere Zwecke sind Skills die günstigere Alternative.
- 11
CLAUDE.md auf Diät halten
Ein schlankes CLAUDE.md enthält: das Projekt in einem Satz, nicht offensichtliche Tool-Einschränkungen, überprüfbare Regeln, Anti-Patterns, die tabu sind, und Verweise auf tiefergehende Docs. Ein fettes CLAUDE.md ist ein chronisches Token-Leck bei jedem einzelnen Turn.
- 12
Günstige Arbeit von günstigen Modellen erledigen lassen
Für einfache Aufgaben den Effort-Level senken — siehe Effort-Guide — oder das gesamte CLI auf einen DeepSeek-Endpoint zeigen lassen, damit jeder Prompt zu DeepSeek-Preisen abrechnet wird, wie im DeepSeek-in-Claude-Code-Guide.
Community-Tools und Plugins gegen den Token-Hunger
Über die Built-ins hinaus zielen der Plugin-Marketplace und einige Community-CLIs direkt auf den Token-Verbrauch. Alles Folgende stammt aus Community-Videos, nicht aus der offiziellen Doku — als Hinweise verstehen, nicht als Empfehlung.
- 1Audit-Plugins wie Token Optimizer fahren eine Truppe aus Audit-Subagenten, die inventarisieren, was deine Skills, MCP-Server und CLAUDE.md pro Session kosten — ein einmaliges Röntgenbild deines Setups. (Quelle: Sean Kochels Video.)
- 2Output-Kompressions-Skills wie Matt Pococks Caveman schneiden den Erzählteil und behalten die technische Substanz: Das README behauptet 75 % Ersparnis, Sean Kochel hat praktisch 30-40 % gemessen — beide Zahlen sind es wert, gekannt zu werden. (Quelle: Sean Kochels Video.)
- 3Handoff-Skills verpacken die Ergebnisse einer Recherche-Session in ein Übergabedokument, das du in eine frische, mit /clear geleerte Session mitnehmen kannst — statt die gesamte Erkundung im Kontext zu behalten. (Quelle: Sean Kochels Video.)
- 4Output-Proxy-CLIs wie RTK sitzen zwischen deinen Tools und Claude und filtern die geschwätzige Ausgabe von git status und git diff auf die relevanten Zeilen, bevor sie überhaupt zu Input-Tokens werden. (Quelle: Sean Kochels Video.)
- 5Tools für verschachtelte Instructions wie Intent Layers erzeugen CLAUDE.md/AGENTS.md auf Verzeichnisebene, sodass eine Session nur die Instruktionen ihres Arbeitsverzeichnisses lädt — gedacht für Verzeichnisse mit über 20k Tokens an Instruktionen. (Quelle: Sean Kochels Video.)
Ein Haken: Diese Tools verbrauchen selbst Tokens. Ein Audit fährt Subagenten, ein Proxy hat eigene Verarbeitungskosten. Ein einmaliges Audit zahlt sich aus; ein Dauergast in deinem Setup nicht unbedingt. Erst /context laufen lassen, dann entscheiden, was bleiben darf.
