Deepseek ArtifactsDeepseek Artifacts
Guide tokens Claude Code · 2026

Comment réduire la consommation de tokens dans Claude Code

Un parcours en 12 étapes illustrées : /context, /compact et /clear bien utilisés, un CLAUDE.md allégé, moins de serveurs MCP, la délégation aux subagents — et des modèles moins chers via DeepSeek.

En bref

  • Lancez d'abord /context : il montre exactement combien de tokens avalent le prompt système, les outils, les serveurs MCP et les messages, avant de commencer à couper.
  • /compact pour enchaîner, /clear pour repartir de zéro ; ce qui doit rester en mémoire longue va dans CLAUDE.md, pas dans la conversation.
  • Allégez le chargement au démarrage : moins de serveurs MCP, un CLAUDE.md concis — chaque skill et agent installé paie quand même sa description dans le contexte.
  • Confiez les questions sans rebond à des subagents et le travail simple aux modèles économiques : baissez l'effort, ou faites facturer le CLI aux prix DeepSeek.

Context Management in Claude Code

Chaîne : Claude — official YouTube channel3:31

Voir

How to Optimize Token Usage in Claude Code

Chaîne : Greg14:59

Voir

Managing context — official Claude Code docs

Docs : code.claude.com/docs

Voir

7 Ways To Cut Your Claude Code Token Usage In Half

Chaîne : Sean Kochel28:13

Voir

How to Reduce Token Usage in Claude Code (2026)

Chaîne : The Code City5:09

Voir

Les images viennent de la démonstration officielle sur la gestion du contexte et d'un enregistrement épuré des slides de tarification ; le texte des étapes suit ces vidéos et la doc officielle sur coûts et contexte.

Sources communautaires (créditées, aucune image extraite) : « 7 Ways To Cut Your Claude Code Token Usage In Half » de Sean Kochel et « How to Reduce Token Usage in Claude Code (2026) » de The Code City. Les captures restent la propriété de leurs créateurs et renvoient au timestamp exact.

La diète tokens en 12 étapes

Voir où partent les tokens

  1. 1

    Sachez ce que coûte un token

    Les modèles se facturent au million de tokens, en entrée comme en sortie. Chaque token gaspillé — prompt système enflé, fichier relu inutilement, réponse bavarde — coûte de l'argent réel aux tarifs d'un Opus.

    Anthropic pricing page listing Claude Opus 4 at 15 dollars per million input tokens, Claude Sonnet 4 at 3 and Claude Haiku 3.5 at 0.80, showing why wasted tokens cost real money
    Opus 4 est affiché à 15 $ le million de tokens d'entrée : quelques milliers de tokens gaspillés par session, et la facture grimpe vite.Voir à 1:20
  2. 2

    Voyez ce qui se charge avant même de taper

    Au démarrage de session, Claude Code charge le nom et la description de chaque custom agent et skill installé. Dans cette seule session, code-reviewer coûte 355 tokens et doc-helper 68 — avant votre premier prompt.

    Claude Code terminal listing the token cost of every custom agent and skill loaded at session start, with code-reviewer at 355 tokens and doc-helper at 68 tokens
    Chaque agent et skill de cette liste paie un droit d'entrée dès le premier tour.Voir à 1:00
  3. 3

    Ouvrez le tableau de bord /context

    Tapez /context pour la répartition complète : ce que consomment le prompt système, les outils système, les serveurs MCP et les messages, et combien de fenêtre reste libre.

    Claude Code /context dashboard showing 21k of 200k tokens used at 11 percent with system prompt, system tools, MCP servers and messages broken down by category
    21k de 200k tokens utilisés, soit 11 % — et la session ne fait que débuter.Voir à 1:30

Supprimer le poids mort

  1. 4

    Compactez une longue session avec /compact

    Claude Code compacte automatiquement quand la session approche la limite de contexte, mais n'attendez pas : taper /compact comprime la conversation en résumé immédiatement.

    Claude Code terminal running the /compact command with the Compacting conversation message over a list of session skills and their token costs
    /compact tasse toute la conversation en un résumé, à la demande.Voir à 1:08
  2. 5

    Continuez à travailler après le compactage

    Le résumé conserve les détails qui comptent — fichiers lus, décisions prises, reste à faire — et jette le bruit : la sortie d'outils redondante qui mangeait la fenêtre.

    Claude Code session right after compacting, showing the conversation compacted notice, the preserved file reads and a What still needs to be done summary
    Juste après compactage : le plan et les questions ouvertes survivent, le bruit non.Voir à 1:45
  3. 6

    Videz entre deux tâches avec /clear

    Règle empirique : vous restez sur la fonctionnalité en cours, /compact ; vous en démarrez une nouvelle, /clear efface l'historique et libère toute la fenêtre. Ce qui doit être retenu sur la durée va dans CLAUDE.md.

    Claude Code terminal with the /clear command typed and its autocomplete description promising to clear conversation history and free up context
    La description de /clear le dit elle-même : effacer l'historique et libérer le contexte.Voir à 1:18

Changer sa façon de prompter

  1. 7

    Confiez la recherche à un subagent

    Les questions qui n'exigent qu'une réponse — « Où sont situés les endpoints d'authentification ? » — vont à un subagent, plutôt que d'explorer dans le fil principal.

    Claude Code spawning the code-reviewer subagent to review the code it just created while a Bash git diff command runs in the background
    Le subagent code-reviewer relit le code fraîchement écrit pendant qu'un git diff tourne en arrière-plan.Voir à 2:50
  2. 8

    Pourquoi les subagents économisent des tokens

    Un subagent tourne dans sa propre fenêtre de contexte isolée : il lit, greppe et explore à sa faim, et seul le résultat final remonte dans votre fil principal.

    Official Claude Code diagram showing a large main agent and a smaller subagent holding isolated context windows so only the answer returns to the main thread
    Agent principal et subagent gardent chacun leur contexte — seule la réponse retraverse.Voir à 2:55
  3. 9

    Dites-le une fois, dites-le précisément

    Citez les fichiers et le périmètre des changements dès le premier prompt. Un prompt flou force le modèle à fouiller tout le codebase, et chaque tour d'exploration supplémentaire brûle des tokens.

Rationner chargement et réponses

  1. 10

    Débranchez les serveurs MCP inutilisés

    Chaque serveur MCP actif charge toutes ses définitions d'outils dans le contexte, que vous y touchiez ou non. Désactivez ceux dont le projet n'a pas besoin — pour les besoins légers, les skills sont une alternative bien moins chère.

  2. 11

    Mettez CLAUDE.md au régime

    Un CLAUDE.md maigre contient : le projet en une ligne, les contraintes d'outils non évidentes, des règles vérifiables, les anti-patterns à éviter et des pointeurs vers des docs plus fouillées. Un CLAUDE.md obèse, c'est une hémorragie lente de tokens à chaque tour.

  3. 12

    Laissez le travail bon marché aux modèles bon marché

    Baissez le niveau d'effort pour les tâches simples — voir le guide effort — ou pointez tout le CLI vers un endpoint DeepSeek pour que chaque prompt soit facturé aux prix DeepSeek, comme dans le guide DeepSeek dans Claude Code.

Outils communautaires et plugins chasseurs de tokens

Au-delà des commandes intégrées, le marketplace de plugins et quelques CLI communautaires visent frontalement la dépense de tokens. Tout ce qui suit vient de vidéos communautaires, pas de la doc officielle : prenez-les comme des pistes, pas des garanties.

  • 1Les plugins d'audit comme Token Optimizer font tourner une escouade de subagents d'audit qui inventorient ce que vos skills, serveurs MCP et CLAUDE.md coûtent par session — une radiographie ponctuelle de votre setup. (Source : la vidéo de Sean Kochel.)
  • 2Les skills de compression de sortie comme Caveman de Matt Pocock coupent le récit et gardent la substance technique : le README revendique 75 % d'économie, Sean Kochel a mesuré 30-40 % en pratique — les deux chiffres méritent d'être connus. (Source : la vidéo de Sean Kochel.)
  • 3Les skills de passation comme Handoff conditionnent les conclusions d'une session de recherche en un document d'intégration à emporter dans une session fraîche après /clear, au lieu de garder toute l'exploration en contexte. (Source : la vidéo de Sean Kochel.)
  • 4Les CLI proxys de sortie comme RTK s'intercalent entre vos outils et Claude et filtrent la sortie bavarde de git status ou git diff jusqu'aux lignes utiles, avant qu'elle ne devienne des tokens d'entrée. (Source : la vidéo de Sean Kochel.)
  • 5Les outils d'instructions imbriquées comme Intent Layers génèrent des CLAUDE.md/AGENTS.md par répertoire : une session ne charge que les instructions du dossier où elle travaille — visée sur les répertoires dont les instructions dépassent 20k tokens. (Source : la vidéo de Sean Kochel.)

Un bémol : ces outils consomment aussi des tokens. Un audit fait tourner des subagents ; un proxy ajoute son propre traitement. Un audit ponctuel se rembourse, un résident permanent dans votre setup, pas forcément. Lancez d'abord /context, puis décidez de qui reste.

Questions sur les tokens, réponses directes

Guides liés