Deepseek ArtifactsDeepseek Artifacts
Guia de tokens do Claude Code · 2026

Como reduzir o consumo de tokens no Claude Code

Um passo a passo em 12 etapas com capturas de tela: /context, /compact e /clear bem usados, um CLAUDE.md enxuto, menos servidores MCP, delegação para subagentes — e modelos mais baratos via DeepSeek.

Resumo rápido

  • Rode o /context primeiro: ele mostra exatamente quantos tokens o prompt do sistema, as ferramentas, os servidores MCP e as mensagens consomem — antes de você começar a cortar.
  • /compact para continuar, /clear para começar algo novo; o que precisa ficar na memória de longo prazo vai no CLAUDE.md, não na conversa.
  • Enxugue o que carrega na inicialização: menos servidores MCP e um CLAUDE.md enxuto — cada skill e agente instalado paga a descrição dele no contexto de todo jeito.
  • Perguntas que só pedem resposta, deixe com os subagentes; trabalho simples, com modelos baratos: abaixe o effort ou faça o CLI faturar a preços de DeepSeek.

Context Management in Claude Code

Canal: Claude — official YouTube channel3:31

Assistir

How to Optimize Token Usage in Claude Code

Canal: Greg14:59

Assistir

Managing context — official Claude Code docs

Docs: code.claude.com/docs

Assistir

7 Ways To Cut Your Claude Code Token Usage In Half

Canal: Sean Kochel28:13

Assistir

How to Reduce Token Usage in Claude Code (2026)

Canal: The Code City5:09

Assistir

Os frames vêm do walkthrough oficial de gerenciamento de contexto e de uma gravação limpa dos slides de preços; o texto dos passos segue esses vídeos e a documentação oficial de custos e contexto.

Fontes de fatos da comunidade (só crédito, nenhum frame usado): «7 Ways To Cut Your Claude Code Token Usage In Half», de Sean Kochel, e «How to Reduce Token Usage in Claude Code (2026)», da The Code City. As capturas continuam propriedade dos criadores e apontam para o timestamp exato.

A dieta de tokens em 12 passos

Ver para onde os tokens vão

  1. 1

    Saiba quanto custa um token

    Os modelos cobram por milhão de tokens, na entrada e na saída. Cada token desperdiçado — um prompt de sistema inchado, um arquivo relido, uma resposta que vai por aí enrolando — é dinheiro de verdade nos preços de nível Opus.

    Anthropic pricing page listing Claude Opus 4 at 15 dollars per million input tokens, Claude Sonnet 4 at 3 and Claude Haiku 3.5 at 0.80, showing why wasted tokens cost real money
    Opus 4 aparece a 15 dólares por milhão de tokens de entrada: uns poucos milhares de tokens desperdiçados por sessão somam rápido.Assistir em 1:20
  2. 2

    Veja o que carrega antes de digitar

    No início da sessão, o Claude Code carrega o nome e a descrição de cada custom agent e skill instalado. Só nesta sessão, o code-reviewer custa 355 tokens e o doc-helper 68 — antes do seu primeiro prompt.

    Claude Code terminal listing the token cost of every custom agent and skill loaded at session start, with code-reviewer at 355 tokens and doc-helper at 68 tokens
    Cada agente e skill desta lista paga ingresso desde o primeiro turno.Assistir em 1:00
  3. 3

    Abra o painel do /context

    Digite /context para ver o detalhamento completo: quanto o prompt do sistema, as ferramentas do sistema, os servidores MCP e as mensagens consomem cada um, e quanto ainda sobra de janela.

    Claude Code /context dashboard showing 21k of 200k tokens used at 11 percent with system prompt, system tools, MCP servers and messages broken down by category
    21k de 200k tokens usados, 11% — e a sessão mal começou.Assistir em 1:30

Cortar o peso morto

  1. 4

    Compacte uma sessão longa com /compact

    O Claude Code compacta automaticamente quando a sessão se aproxima do limite de contexto, mas não precisa esperar: digitar /compact comprime a conversa num resumo imediatamente.

    Claude Code terminal running the /compact command with the Compacting conversation message over a list of session skills and their token costs
    /compact espreme a conversa inteira num resumo, sob demanda.Assistir em 1:08
  2. 5

    Continue trabalhando depois do compact

    O resumo mantém os detalhes que importam — arquivos lidos, decisões tomadas, o que falta fazer — e descarta a saída redundante das ferramentas que estava comendo a janela.

    Claude Code session right after compacting, showing the conversation compacted notice, the preserved file reads and a What still needs to be done summary
    Logo após compactar: o plano e as dúvidas em aberto sobrevivem; o ruído, não.Assistir em 1:45
  3. 6

    Limpe entre tarefas com /clear

    Regra de bolso: continuando na feature atual, /compact; começando uma nova, o /clear apaga o histórico e libera a janela inteira. O que precisar ser lembrado a longo prazo pertence ao CLAUDE.md.

    Claude Code terminal with the /clear command typed and its autocomplete description promising to clear conversation history and free up context
    A própria descrição do /clear no autocomplete diz: limpar o histórico e liberar contexto.Assistir em 1:18

Mudar o jeito de escrever prompts

  1. 7

    Passe a pesquisa para um subagente

    Perguntas que só precisam de uma resposta — "Onde ficam os endpoints de autenticação?" — mande para um subagente em vez de fuçar na thread principal.

    Claude Code spawning the code-reviewer subagent to review the code it just created while a Bash git diff command runs in the background
    O subagente code-reviewer revisa o código recém-criado enquanto um git diff roda em segundo plano.Assistir em 2:50
  2. 8

    Por que subagentes economizam tokens

    Um subagente roda na própria janela de contexto isolada dele: lê, roda grep e explora à vontade, e só a resposta final volta para a sua thread principal.

    Official Claude Code diagram showing a large main agent and a smaller subagent holding isolated context windows so only the answer returns to the main thread
    Agente principal e subagente seguram contextos separados — só a resposta atravessa de volta.Assistir em 2:55
  3. 9

    Fale uma vez, fale com precisão

    Cite os arquivos e o escopo da mudança já no primeiro prompt. Prompts vagos forçam o modelo a vasculhar a base de código inteira, e cada rodada extra de exploração queima mais tokens.

Enxugar o que carrega e o que responde

  1. 10

    Desligue os servidores MCP que não usa

    Cada servidor MCP ativo carrega todas as definições de ferramenta dele no contexto, você use ou não. Desative os que o projeto não precisa — para necessidades leves, skills são uma alternativa bem mais barata.

  2. 11

    Mantenha o CLAUDE.md de dieta

    Um CLAUDE.md enxuto guarda: o projeto em uma linha, restrições de ferramentas nada óbvias, regras verificáveis, antipadrões proibidos e ponteiros para docs mais profundas. Um inflado é um sangramento lento de tokens a cada turno.

  3. 12

    Deixe o trabalho barato para os modelos baratos

    Baixe o nível de effort em tarefas simples — veja o guia de effort — ou aponte o CLI inteiro para um endpoint do DeepSeek para que cada prompt seja cobrado a preços de DeepSeek, como no guia de DeepSeek no Claude Code.

Ferramentas e plugins da comunidade que apararam tokens

Além dos comandos nativos, o marketplace de plugins e alguns CLIs comunitários miram direto no gasto de tokens. Tudo abaixo vem de vídeos da comunidade, não da documentação oficial — trate como ponteiros, não como recomendação.

  • 1Plugins de auditoria como o Token Optimizer rodam um esquadrão de subagentes auditores que inventariam quanto seus skills, servidores MCP e CLAUDE.md custam por sessão — um raio-X pontual do seu setup. (Fonte: o vídeo do Sean Kochel.)
  • 2Skills de compressão de saída como o Caveman, do Matt Pocock, cortam a narração e mantêm a substância técnica: o README alega 75% de economia, o Sean Kochel mediu 30-40% na prática — vale conhecer os dois números. (Fonte: o vídeo do Sean Kochel.)
  • 3Skills de handoff como o Handoff empacotam as conclusões de uma sessão de pesquisa num documento de entrega que você leva para uma sessão nova depois do /clear, em vez de manter toda a exploração no contexto. (Fonte: o vídeo do Sean Kochel.)
  • 4CLIs proxy de saída como o RTK ficam entre suas ferramentas e o Claude e filtram a saída verbosa de git status e git diff até as linhas que importam, antes de virar tokens de entrada. (Fonte: o vídeo do Sean Kochel.)
  • 5Ferramentas de instruções aninhadas como o Intent Layers geram CLAUDE.md/AGENTS.md por diretório, então a sessão só carrega as instruções do diretório em que trabalha — pensado para diretórios cujas instruções passam de 20k tokens. (Fonte: o vídeo do Sean Kochel.)

Uma ressalva: essas ferramentas também gastam tokens. Uma auditoria roda subagentes; um proxy tem seu próprio processamento. Auditoria pontual se paga; morador fixo no seu setup, nem sempre. Rode o /context primeiro e decida quem fica.

Perguntas sobre tokens, respondidas

Guias relacionados