Comment réduire la consommation de tokens dans Claude Code
Un parcours en 12 étapes illustrées : /context, /compact et /clear bien utilisés, un CLAUDE.md allégé, moins de serveurs MCP, la délégation aux subagents — et des modèles moins chers via DeepSeek.
En bref
- Lancez d'abord /context : il montre exactement combien de tokens avalent le prompt système, les outils, les serveurs MCP et les messages, avant de commencer à couper.
- /compact pour enchaîner, /clear pour repartir de zéro ; ce qui doit rester en mémoire longue va dans CLAUDE.md, pas dans la conversation.
- Allégez le chargement au démarrage : moins de serveurs MCP, un CLAUDE.md concis — chaque skill et agent installé paie quand même sa description dans le contexte.
- Confiez les questions sans rebond à des subagents et le travail simple aux modèles économiques : baissez l'effort, ou faites facturer le CLI aux prix DeepSeek.
Context Management in Claude Code
Chaîne : Claude — official YouTube channel3:31
How to Optimize Token Usage in Claude Code
Chaîne : Greg14:59
Managing context — official Claude Code docs
Docs : code.claude.com/docs
7 Ways To Cut Your Claude Code Token Usage In Half
Chaîne : Sean Kochel28:13
How to Reduce Token Usage in Claude Code (2026)
Chaîne : The Code City5:09
Les images viennent de la démonstration officielle sur la gestion du contexte et d'un enregistrement épuré des slides de tarification ; le texte des étapes suit ces vidéos et la doc officielle sur coûts et contexte.
Sources communautaires (créditées, aucune image extraite) : « 7 Ways To Cut Your Claude Code Token Usage In Half » de Sean Kochel et « How to Reduce Token Usage in Claude Code (2026) » de The Code City. Les captures restent la propriété de leurs créateurs et renvoient au timestamp exact.
La diète tokens en 12 étapes
Voir où partent les tokens
- 1
Sachez ce que coûte un token
Les modèles se facturent au million de tokens, en entrée comme en sortie. Chaque token gaspillé — prompt système enflé, fichier relu inutilement, réponse bavarde — coûte de l'argent réel aux tarifs d'un Opus.

Opus 4 est affiché à 15 $ le million de tokens d'entrée : quelques milliers de tokens gaspillés par session, et la facture grimpe vite.Voir à 1:20 - 2
Voyez ce qui se charge avant même de taper
Au démarrage de session, Claude Code charge le nom et la description de chaque custom agent et skill installé. Dans cette seule session, code-reviewer coûte 355 tokens et doc-helper 68 — avant votre premier prompt.

Chaque agent et skill de cette liste paie un droit d'entrée dès le premier tour.Voir à 1:00 - 3
Ouvrez le tableau de bord /context
Tapez /context pour la répartition complète : ce que consomment le prompt système, les outils système, les serveurs MCP et les messages, et combien de fenêtre reste libre.

21k de 200k tokens utilisés, soit 11 % — et la session ne fait que débuter.Voir à 1:30
Supprimer le poids mort
- 4
Compactez une longue session avec /compact
Claude Code compacte automatiquement quand la session approche la limite de contexte, mais n'attendez pas : taper /compact comprime la conversation en résumé immédiatement.

/compact tasse toute la conversation en un résumé, à la demande.Voir à 1:08 - 5
Continuez à travailler après le compactage
Le résumé conserve les détails qui comptent — fichiers lus, décisions prises, reste à faire — et jette le bruit : la sortie d'outils redondante qui mangeait la fenêtre.

Juste après compactage : le plan et les questions ouvertes survivent, le bruit non.Voir à 1:45 - 6
Videz entre deux tâches avec /clear
Règle empirique : vous restez sur la fonctionnalité en cours, /compact ; vous en démarrez une nouvelle, /clear efface l'historique et libère toute la fenêtre. Ce qui doit être retenu sur la durée va dans CLAUDE.md.

La description de /clear le dit elle-même : effacer l'historique et libérer le contexte.Voir à 1:18
Changer sa façon de prompter
- 7
Confiez la recherche à un subagent
Les questions qui n'exigent qu'une réponse — « Où sont situés les endpoints d'authentification ? » — vont à un subagent, plutôt que d'explorer dans le fil principal.

Le subagent code-reviewer relit le code fraîchement écrit pendant qu'un git diff tourne en arrière-plan.Voir à 2:50 - 8
Pourquoi les subagents économisent des tokens
Un subagent tourne dans sa propre fenêtre de contexte isolée : il lit, greppe et explore à sa faim, et seul le résultat final remonte dans votre fil principal.

Agent principal et subagent gardent chacun leur contexte — seule la réponse retraverse.Voir à 2:55 - 9
Dites-le une fois, dites-le précisément
Citez les fichiers et le périmètre des changements dès le premier prompt. Un prompt flou force le modèle à fouiller tout le codebase, et chaque tour d'exploration supplémentaire brûle des tokens.
Rationner chargement et réponses
- 10
Débranchez les serveurs MCP inutilisés
Chaque serveur MCP actif charge toutes ses définitions d'outils dans le contexte, que vous y touchiez ou non. Désactivez ceux dont le projet n'a pas besoin — pour les besoins légers, les skills sont une alternative bien moins chère.
- 11
Mettez CLAUDE.md au régime
Un CLAUDE.md maigre contient : le projet en une ligne, les contraintes d'outils non évidentes, des règles vérifiables, les anti-patterns à éviter et des pointeurs vers des docs plus fouillées. Un CLAUDE.md obèse, c'est une hémorragie lente de tokens à chaque tour.
- 12
Laissez le travail bon marché aux modèles bon marché
Baissez le niveau d'effort pour les tâches simples — voir le guide effort — ou pointez tout le CLI vers un endpoint DeepSeek pour que chaque prompt soit facturé aux prix DeepSeek, comme dans le guide DeepSeek dans Claude Code.
Outils communautaires et plugins chasseurs de tokens
Au-delà des commandes intégrées, le marketplace de plugins et quelques CLI communautaires visent frontalement la dépense de tokens. Tout ce qui suit vient de vidéos communautaires, pas de la doc officielle : prenez-les comme des pistes, pas des garanties.
- 1Les plugins d'audit comme Token Optimizer font tourner une escouade de subagents d'audit qui inventorient ce que vos skills, serveurs MCP et CLAUDE.md coûtent par session — une radiographie ponctuelle de votre setup. (Source : la vidéo de Sean Kochel.)
- 2Les skills de compression de sortie comme Caveman de Matt Pocock coupent le récit et gardent la substance technique : le README revendique 75 % d'économie, Sean Kochel a mesuré 30-40 % en pratique — les deux chiffres méritent d'être connus. (Source : la vidéo de Sean Kochel.)
- 3Les skills de passation comme Handoff conditionnent les conclusions d'une session de recherche en un document d'intégration à emporter dans une session fraîche après /clear, au lieu de garder toute l'exploration en contexte. (Source : la vidéo de Sean Kochel.)
- 4Les CLI proxys de sortie comme RTK s'intercalent entre vos outils et Claude et filtrent la sortie bavarde de git status ou git diff jusqu'aux lignes utiles, avant qu'elle ne devienne des tokens d'entrée. (Source : la vidéo de Sean Kochel.)
- 5Les outils d'instructions imbriquées comme Intent Layers génèrent des CLAUDE.md/AGENTS.md par répertoire : une session ne charge que les instructions du dossier où elle travaille — visée sur les répertoires dont les instructions dépassent 20k tokens. (Source : la vidéo de Sean Kochel.)
Un bémol : ces outils consomment aussi des tokens. Un audit fait tourner des subagents ; un proxy ajoute son propre traitement. Un audit ponctuel se rembourse, un résident permanent dans votre setup, pas forcément. Lancez d'abord /context, puis décidez de qui reste.
