Cómo reducir el consumo de tokens en Claude Code
Un recorrido de 12 pasos con capturas: /context, /compact y /clear bien usados, un CLAUDE.md ligero, menos servidores MCP, delegación en subagentes — y modelos más baratos vía DeepSeek.
En resumen
- Ejecuta primero /context: muestra exactamente cuántos tokens se comen el prompt del sistema, las herramientas, los servidores MCP y los mensajes, antes de empezar a recortar.
- /compact para continuar, /clear para empezar de cero; lo que deba recordarse a largo plazo va en CLAUDE.md, no en la conversación.
- Aligera lo que se carga al arrancar: menos servidores MCP y un CLAUDE.md conciso — cada skill y agente instalado paga igualmente su descripción en el contexto.
- Las preguntas que solo piden una respuesta, a los subagentes; el trabajo simple, a modelos baratos: baja el effort o factura el CLI a precios de DeepSeek.
Context Management in Claude Code
Canal: Claude — official YouTube channel3:31
How to Optimize Token Usage in Claude Code
Canal: Greg14:59
Managing context — official Claude Code docs
Docs: code.claude.com/docs
7 Ways To Cut Your Claude Code Token Usage In Half
Canal: Sean Kochel28:13
How to Reduce Token Usage in Claude Code (2026)
Canal: The Code City5:09
Las imágenes vienen del recorrido oficial sobre gestión de contexto y de una grabación limpia de las diapositivas de precios; el texto de los pasos sigue esos vídeos y la documentación oficial de costes y contexto.
Fuentes comunitarias (solo crédito, sin capturas): «7 Ways To Cut Your Claude Code Token Usage In Half» de Sean Kochel y «How to Reduce Token Usage in Claude Code (2026)» de The Code City. Las capturas siguen siendo propiedad de sus creadores y enlazan al timestamp exacto.
La dieta de tokens en 12 pasos
Ver a dónde van los tokens
- 1
Sabe cuánto cuesta un token
Los modelos se facturan por millón de tokens, tanto en entrada como en salida. Cada token desperdiciado — un prompt del sistema hinchado, un archivo releído, una respuesta que se va por las ramas — es dinero real a precios de nivel Opus.

Opus 4 aparece a 15 dólares por millón de tokens de entrada: unos miles de tokens desperdiciados por sesión se acumulan rápido.Ver en 1:20 - 2
Mira qué se carga antes de escribir
Al iniciar la sesión, Claude Code carga el nombre y la descripción de cada custom agent y skill instalado. Solo en esta sesión, code-reviewer cuesta 355 tokens y doc-helper 68 — antes de tu primer prompt.

Cada agente y skill de esta lista paga una entrada desde el primer turno.Ver en 1:00 - 3
Abre el panel de /context
Escribe /context para ver el desglose completo: cuánto consumen el prompt del sistema, las herramientas del sistema, los servidores MCP y los mensajes, y cuánto espacio queda libre.

21k de 200k tokens usados, un 11% — y la sesión apenas comienza.Ver en 1:30
Quitar el peso muerto
- 4
Compacta una sesión larga con /compact
Claude Code compacta automáticamente al acercarse al límite de contexto, pero no hace falta esperar: escribir /compact comprime la conversación en un resumen al instante.

/compact aprieta toda la conversación en un resumen, a demanda.Ver en 1:08 - 5
Sigue trabajando tras el compactado
El resumen conserva los detalles que importan — archivos leídos, decisiones tomadas, lo que queda por hacer — y descarta la salida redundante de herramientas que se estaba comiendo la ventana.

Justo tras compactar: el plan y las preguntas abiertas sobreviven; el ruido, no.Ver en 1:45 - 6
Limpia entre tareas con /clear
Regla práctica: si sigues con la funcionalidad actual, /compact; si empiezas una nueva, /clear borra el historial y libera toda la ventana. Lo que deba recordarse a largo plazo pertenece a CLAUDE.md.

La propia descripción de /clear lo dice: borrar el historial y liberar contexto.Ver en 1:18
Cambiar cómo escribes los prompts
- 7
Delega la investigación en un subagente
Las preguntas que solo necesitan una respuesta — «¿Dónde están los endpoints de autenticación?» — van a un subagente, en lugar de explorar en el hilo principal.

El subagente code-reviewer revisa el código recién creado mientras un git diff corre en segundo plano.Ver en 2:50 - 8
Por qué los subagentes ahorran tokens
Un subagente corre en su propia ventana de contexto aislada: lee, hace grep y explora lo que necesite, y solo la respuesta final vuelve a tu hilo principal.

El agente principal y el subagente llevan contextos separados — solo la respuesta cruza de vuelta.Ver en 2:55 - 9
Dilo una vez, dilo con precisión
Nombra los archivos y el alcance del cambio en tu primer prompt. Los prompts vagos obligan al modelo a registrar toda la base de código, y cada ronda extra de exploración quema más tokens.
Recortar lo que carga y lo que responde
- 10
Desconecta los servidores MCP que no usas
Cada servidor MCP activo carga todas sus definiciones de herramientas en el contexto, las toques o no. Desactiva los que el proyecto no necesita — para necesidades ligeras, los skills son una alternativa mucho más barata.
- 11
Pon a CLAUDE.md a dieta
Un CLAUDE.md ligero contiene: el proyecto en una línea, restricciones de herramientas nada obvias, reglas verificables, antipatrones prohibidos y enlaces a documentos más profundos. Uno obeso es un sangrado lento de tokens en cada turno.
- 12
Deja el trabajo barato a los modelos baratos
Baja el nivel de effort en tareas simples — mira la guía de effort — o apunta todo el CLI a un endpoint de DeepSeek para que cada prompt se facture a precios de DeepSeek, como en la guía de DeepSeek en Claude Code.
Herramientas y plugins de la comunidad que recortan tokens
Más allá de los comandos integrados, el marketplace de plugins y algunas CLI comunitarias atacan de frente el gasto de tokens. Todo lo que sigue sale de vídeos de la comunidad, no de la documentación oficial: tómalo como pistas, no como aval.
- 1Plugins de auditoría como Token Optimizer despliegan un escuadrón de subagentes auditores que calculan cuánto te cuestan por sesión tus skills, servidores MCP y CLAUDE.md — una radiografía puntual de tu setup. (Fuente: el vídeo de Sean Kochel.)
- 2Skills de compresión de salida como Caveman, de Matt Pocock, cortan la narración y dejan la sustancia técnica: el README reclama un 75% de ahorro, y Sean Kochel midió un 30-40% en la práctica — ambos números merecen conocerse. (Fuente: el vídeo de Sean Kochel.)
- 3Skills de traspaso como Handoff empaquetan las conclusiones de una sesión de investigación en un documento de entrega que llevas a una sesión nueva tras /clear, en vez de mantener toda la exploración en el contexto. (Fuente: el vídeo de Sean Kochel.)
- 4CLI proxy de salida como RTK se interponen entre tus herramientas y Claude y filtran la salida verborreica de git status o git diff hasta las líneas que importan, antes de que se conviertan en tokens de entrada. (Fuente: el vídeo de Sean Kochel.)
- 5Herramientas de instrucciones anidadas como Intent Layers generan CLAUDE.md/AGENTS.md por directorio, así una sesión solo carga las instrucciones del directorio en el que trabaja — pensado para directorios cuyas instrucciones superan los 20k tokens. (Fuente: el vídeo de Sean Kochel.)
Una advertencia: estas herramientas también gastan tokens. Una auditoría despliega subagentes; un proxy añade su propio procesamiento. Una auditoría puntual se paga sola; un residente permanente en tu setup, no siempre. Ejecuta antes /context y decide qué se queda.
