Deepseek ArtifactsDeepseek Artifacts
Guía de tokens de Claude Code · 2026

Cómo reducir el consumo de tokens en Claude Code

Un recorrido de 12 pasos con capturas: /context, /compact y /clear bien usados, un CLAUDE.md ligero, menos servidores MCP, delegación en subagentes — y modelos más baratos vía DeepSeek.

En resumen

  • Ejecuta primero /context: muestra exactamente cuántos tokens se comen el prompt del sistema, las herramientas, los servidores MCP y los mensajes, antes de empezar a recortar.
  • /compact para continuar, /clear para empezar de cero; lo que deba recordarse a largo plazo va en CLAUDE.md, no en la conversación.
  • Aligera lo que se carga al arrancar: menos servidores MCP y un CLAUDE.md conciso — cada skill y agente instalado paga igualmente su descripción en el contexto.
  • Las preguntas que solo piden una respuesta, a los subagentes; el trabajo simple, a modelos baratos: baja el effort o factura el CLI a precios de DeepSeek.

Context Management in Claude Code

Canal: Claude — official YouTube channel3:31

Ver

How to Optimize Token Usage in Claude Code

Canal: Greg14:59

Ver

Managing context — official Claude Code docs

Docs: code.claude.com/docs

Ver

7 Ways To Cut Your Claude Code Token Usage In Half

Canal: Sean Kochel28:13

Ver

How to Reduce Token Usage in Claude Code (2026)

Canal: The Code City5:09

Ver

Las imágenes vienen del recorrido oficial sobre gestión de contexto y de una grabación limpia de las diapositivas de precios; el texto de los pasos sigue esos vídeos y la documentación oficial de costes y contexto.

Fuentes comunitarias (solo crédito, sin capturas): «7 Ways To Cut Your Claude Code Token Usage In Half» de Sean Kochel y «How to Reduce Token Usage in Claude Code (2026)» de The Code City. Las capturas siguen siendo propiedad de sus creadores y enlazan al timestamp exacto.

La dieta de tokens en 12 pasos

Ver a dónde van los tokens

  1. 1

    Sabe cuánto cuesta un token

    Los modelos se facturan por millón de tokens, tanto en entrada como en salida. Cada token desperdiciado — un prompt del sistema hinchado, un archivo releído, una respuesta que se va por las ramas — es dinero real a precios de nivel Opus.

    Anthropic pricing page listing Claude Opus 4 at 15 dollars per million input tokens, Claude Sonnet 4 at 3 and Claude Haiku 3.5 at 0.80, showing why wasted tokens cost real money
    Opus 4 aparece a 15 dólares por millón de tokens de entrada: unos miles de tokens desperdiciados por sesión se acumulan rápido.Ver en 1:20
  2. 2

    Mira qué se carga antes de escribir

    Al iniciar la sesión, Claude Code carga el nombre y la descripción de cada custom agent y skill instalado. Solo en esta sesión, code-reviewer cuesta 355 tokens y doc-helper 68 — antes de tu primer prompt.

    Claude Code terminal listing the token cost of every custom agent and skill loaded at session start, with code-reviewer at 355 tokens and doc-helper at 68 tokens
    Cada agente y skill de esta lista paga una entrada desde el primer turno.Ver en 1:00
  3. 3

    Abre el panel de /context

    Escribe /context para ver el desglose completo: cuánto consumen el prompt del sistema, las herramientas del sistema, los servidores MCP y los mensajes, y cuánto espacio queda libre.

    Claude Code /context dashboard showing 21k of 200k tokens used at 11 percent with system prompt, system tools, MCP servers and messages broken down by category
    21k de 200k tokens usados, un 11% — y la sesión apenas comienza.Ver en 1:30

Quitar el peso muerto

  1. 4

    Compacta una sesión larga con /compact

    Claude Code compacta automáticamente al acercarse al límite de contexto, pero no hace falta esperar: escribir /compact comprime la conversación en un resumen al instante.

    Claude Code terminal running the /compact command with the Compacting conversation message over a list of session skills and their token costs
    /compact aprieta toda la conversación en un resumen, a demanda.Ver en 1:08
  2. 5

    Sigue trabajando tras el compactado

    El resumen conserva los detalles que importan — archivos leídos, decisiones tomadas, lo que queda por hacer — y descarta la salida redundante de herramientas que se estaba comiendo la ventana.

    Claude Code session right after compacting, showing the conversation compacted notice, the preserved file reads and a What still needs to be done summary
    Justo tras compactar: el plan y las preguntas abiertas sobreviven; el ruido, no.Ver en 1:45
  3. 6

    Limpia entre tareas con /clear

    Regla práctica: si sigues con la funcionalidad actual, /compact; si empiezas una nueva, /clear borra el historial y libera toda la ventana. Lo que deba recordarse a largo plazo pertenece a CLAUDE.md.

    Claude Code terminal with the /clear command typed and its autocomplete description promising to clear conversation history and free up context
    La propia descripción de /clear lo dice: borrar el historial y liberar contexto.Ver en 1:18

Cambiar cómo escribes los prompts

  1. 7

    Delega la investigación en un subagente

    Las preguntas que solo necesitan una respuesta — «¿Dónde están los endpoints de autenticación?» — van a un subagente, en lugar de explorar en el hilo principal.

    Claude Code spawning the code-reviewer subagent to review the code it just created while a Bash git diff command runs in the background
    El subagente code-reviewer revisa el código recién creado mientras un git diff corre en segundo plano.Ver en 2:50
  2. 8

    Por qué los subagentes ahorran tokens

    Un subagente corre en su propia ventana de contexto aislada: lee, hace grep y explora lo que necesite, y solo la respuesta final vuelve a tu hilo principal.

    Official Claude Code diagram showing a large main agent and a smaller subagent holding isolated context windows so only the answer returns to the main thread
    El agente principal y el subagente llevan contextos separados — solo la respuesta cruza de vuelta.Ver en 2:55
  3. 9

    Dilo una vez, dilo con precisión

    Nombra los archivos y el alcance del cambio en tu primer prompt. Los prompts vagos obligan al modelo a registrar toda la base de código, y cada ronda extra de exploración quema más tokens.

Recortar lo que carga y lo que responde

  1. 10

    Desconecta los servidores MCP que no usas

    Cada servidor MCP activo carga todas sus definiciones de herramientas en el contexto, las toques o no. Desactiva los que el proyecto no necesita — para necesidades ligeras, los skills son una alternativa mucho más barata.

  2. 11

    Pon a CLAUDE.md a dieta

    Un CLAUDE.md ligero contiene: el proyecto en una línea, restricciones de herramientas nada obvias, reglas verificables, antipatrones prohibidos y enlaces a documentos más profundos. Uno obeso es un sangrado lento de tokens en cada turno.

  3. 12

    Deja el trabajo barato a los modelos baratos

    Baja el nivel de effort en tareas simples — mira la guía de effort — o apunta todo el CLI a un endpoint de DeepSeek para que cada prompt se facture a precios de DeepSeek, como en la guía de DeepSeek en Claude Code.

Herramientas y plugins de la comunidad que recortan tokens

Más allá de los comandos integrados, el marketplace de plugins y algunas CLI comunitarias atacan de frente el gasto de tokens. Todo lo que sigue sale de vídeos de la comunidad, no de la documentación oficial: tómalo como pistas, no como aval.

  • 1Plugins de auditoría como Token Optimizer despliegan un escuadrón de subagentes auditores que calculan cuánto te cuestan por sesión tus skills, servidores MCP y CLAUDE.md — una radiografía puntual de tu setup. (Fuente: el vídeo de Sean Kochel.)
  • 2Skills de compresión de salida como Caveman, de Matt Pocock, cortan la narración y dejan la sustancia técnica: el README reclama un 75% de ahorro, y Sean Kochel midió un 30-40% en la práctica — ambos números merecen conocerse. (Fuente: el vídeo de Sean Kochel.)
  • 3Skills de traspaso como Handoff empaquetan las conclusiones de una sesión de investigación en un documento de entrega que llevas a una sesión nueva tras /clear, en vez de mantener toda la exploración en el contexto. (Fuente: el vídeo de Sean Kochel.)
  • 4CLI proxy de salida como RTK se interponen entre tus herramientas y Claude y filtran la salida verborreica de git status o git diff hasta las líneas que importan, antes de que se conviertan en tokens de entrada. (Fuente: el vídeo de Sean Kochel.)
  • 5Herramientas de instrucciones anidadas como Intent Layers generan CLAUDE.md/AGENTS.md por directorio, así una sesión solo carga las instrucciones del directorio en el que trabaja — pensado para directorios cuyas instrucciones superan los 20k tokens. (Fuente: el vídeo de Sean Kochel.)

Una advertencia: estas herramientas también gastan tokens. Una auditoría despliega subagentes; un proxy añade su propio procesamiento. Una auditoría puntual se paga sola; un residente permanente en tu setup, no siempre. Ejecuta antes /context y decide qué se queda.

Preguntas sobre tokens, con respuestas

Guías relacionadas