Como reduzir o consumo de tokens no Claude Code
Um passo a passo em 12 etapas com capturas de tela: /context, /compact e /clear bem usados, um CLAUDE.md enxuto, menos servidores MCP, delegação para subagentes — e modelos mais baratos via DeepSeek.
Resumo rápido
- Rode o /context primeiro: ele mostra exatamente quantos tokens o prompt do sistema, as ferramentas, os servidores MCP e as mensagens consomem — antes de você começar a cortar.
- /compact para continuar, /clear para começar algo novo; o que precisa ficar na memória de longo prazo vai no CLAUDE.md, não na conversa.
- Enxugue o que carrega na inicialização: menos servidores MCP e um CLAUDE.md enxuto — cada skill e agente instalado paga a descrição dele no contexto de todo jeito.
- Perguntas que só pedem resposta, deixe com os subagentes; trabalho simples, com modelos baratos: abaixe o effort ou faça o CLI faturar a preços de DeepSeek.
Context Management in Claude Code
Canal: Claude — official YouTube channel3:31
How to Optimize Token Usage in Claude Code
Canal: Greg14:59
Managing context — official Claude Code docs
Docs: code.claude.com/docs
7 Ways To Cut Your Claude Code Token Usage In Half
Canal: Sean Kochel28:13
How to Reduce Token Usage in Claude Code (2026)
Canal: The Code City5:09
Os frames vêm do walkthrough oficial de gerenciamento de contexto e de uma gravação limpa dos slides de preços; o texto dos passos segue esses vídeos e a documentação oficial de custos e contexto.
Fontes de fatos da comunidade (só crédito, nenhum frame usado): «7 Ways To Cut Your Claude Code Token Usage In Half», de Sean Kochel, e «How to Reduce Token Usage in Claude Code (2026)», da The Code City. As capturas continuam propriedade dos criadores e apontam para o timestamp exato.
A dieta de tokens em 12 passos
Ver para onde os tokens vão
- 1
Saiba quanto custa um token
Os modelos cobram por milhão de tokens, na entrada e na saída. Cada token desperdiçado — um prompt de sistema inchado, um arquivo relido, uma resposta que vai por aí enrolando — é dinheiro de verdade nos preços de nível Opus.

Opus 4 aparece a 15 dólares por milhão de tokens de entrada: uns poucos milhares de tokens desperdiçados por sessão somam rápido.Assistir em 1:20 - 2
Veja o que carrega antes de digitar
No início da sessão, o Claude Code carrega o nome e a descrição de cada custom agent e skill instalado. Só nesta sessão, o code-reviewer custa 355 tokens e o doc-helper 68 — antes do seu primeiro prompt.

Cada agente e skill desta lista paga ingresso desde o primeiro turno.Assistir em 1:00 - 3
Abra o painel do /context
Digite /context para ver o detalhamento completo: quanto o prompt do sistema, as ferramentas do sistema, os servidores MCP e as mensagens consomem cada um, e quanto ainda sobra de janela.

21k de 200k tokens usados, 11% — e a sessão mal começou.Assistir em 1:30
Cortar o peso morto
- 4
Compacte uma sessão longa com /compact
O Claude Code compacta automaticamente quando a sessão se aproxima do limite de contexto, mas não precisa esperar: digitar /compact comprime a conversa num resumo imediatamente.

/compact espreme a conversa inteira num resumo, sob demanda.Assistir em 1:08 - 5
Continue trabalhando depois do compact
O resumo mantém os detalhes que importam — arquivos lidos, decisões tomadas, o que falta fazer — e descarta a saída redundante das ferramentas que estava comendo a janela.

Logo após compactar: o plano e as dúvidas em aberto sobrevivem; o ruído, não.Assistir em 1:45 - 6
Limpe entre tarefas com /clear
Regra de bolso: continuando na feature atual, /compact; começando uma nova, o /clear apaga o histórico e libera a janela inteira. O que precisar ser lembrado a longo prazo pertence ao CLAUDE.md.

A própria descrição do /clear no autocomplete diz: limpar o histórico e liberar contexto.Assistir em 1:18
Mudar o jeito de escrever prompts
- 7
Passe a pesquisa para um subagente
Perguntas que só precisam de uma resposta — "Onde ficam os endpoints de autenticação?" — mande para um subagente em vez de fuçar na thread principal.

O subagente code-reviewer revisa o código recém-criado enquanto um git diff roda em segundo plano.Assistir em 2:50 - 8
Por que subagentes economizam tokens
Um subagente roda na própria janela de contexto isolada dele: lê, roda grep e explora à vontade, e só a resposta final volta para a sua thread principal.

Agente principal e subagente seguram contextos separados — só a resposta atravessa de volta.Assistir em 2:55 - 9
Fale uma vez, fale com precisão
Cite os arquivos e o escopo da mudança já no primeiro prompt. Prompts vagos forçam o modelo a vasculhar a base de código inteira, e cada rodada extra de exploração queima mais tokens.
Enxugar o que carrega e o que responde
- 10
Desligue os servidores MCP que não usa
Cada servidor MCP ativo carrega todas as definições de ferramenta dele no contexto, você use ou não. Desative os que o projeto não precisa — para necessidades leves, skills são uma alternativa bem mais barata.
- 11
Mantenha o CLAUDE.md de dieta
Um CLAUDE.md enxuto guarda: o projeto em uma linha, restrições de ferramentas nada óbvias, regras verificáveis, antipadrões proibidos e ponteiros para docs mais profundas. Um inflado é um sangramento lento de tokens a cada turno.
- 12
Deixe o trabalho barato para os modelos baratos
Baixe o nível de effort em tarefas simples — veja o guia de effort — ou aponte o CLI inteiro para um endpoint do DeepSeek para que cada prompt seja cobrado a preços de DeepSeek, como no guia de DeepSeek no Claude Code.
Ferramentas e plugins da comunidade que apararam tokens
Além dos comandos nativos, o marketplace de plugins e alguns CLIs comunitários miram direto no gasto de tokens. Tudo abaixo vem de vídeos da comunidade, não da documentação oficial — trate como ponteiros, não como recomendação.
- 1Plugins de auditoria como o Token Optimizer rodam um esquadrão de subagentes auditores que inventariam quanto seus skills, servidores MCP e CLAUDE.md custam por sessão — um raio-X pontual do seu setup. (Fonte: o vídeo do Sean Kochel.)
- 2Skills de compressão de saída como o Caveman, do Matt Pocock, cortam a narração e mantêm a substância técnica: o README alega 75% de economia, o Sean Kochel mediu 30-40% na prática — vale conhecer os dois números. (Fonte: o vídeo do Sean Kochel.)
- 3Skills de handoff como o Handoff empacotam as conclusões de uma sessão de pesquisa num documento de entrega que você leva para uma sessão nova depois do /clear, em vez de manter toda a exploração no contexto. (Fonte: o vídeo do Sean Kochel.)
- 4CLIs proxy de saída como o RTK ficam entre suas ferramentas e o Claude e filtram a saída verbosa de git status e git diff até as linhas que importam, antes de virar tokens de entrada. (Fonte: o vídeo do Sean Kochel.)
- 5Ferramentas de instruções aninhadas como o Intent Layers geram CLAUDE.md/AGENTS.md por diretório, então a sessão só carrega as instruções do diretório em que trabalha — pensado para diretórios cujas instruções passam de 20k tokens. (Fonte: o vídeo do Sean Kochel.)
Uma ressalva: essas ferramentas também gastam tokens. Uma auditoria roda subagentes; um proxy tem seu próprio processamento. Auditoria pontual se paga; morador fixo no seu setup, nem sempre. Rode o /context primeiro e decida quem fica.
