MCP tools add, not cut, your Claude Code input-token bill; every prompt you send through a cleaning tool ends up costing more tokens, and therefore more money. Developers chasing lower API costs often reach for MCP-based cleaners, assuming they’ll shrink the prompt before the model sees it.
Por qué importa el contador de tokens
Claude Code cuenta los tokens en el instante en que tu texto llega a la ventana de contexto del modelo. El modelo comienza a leer el prompt original y luego decide si invocar una herramienta MCP. La herramienta de limpieza se ejecuta después de que el texto original ya forma parte de la conversación, por lo que el contador ya ha registrado esos tokens.
Un flujo típico es el siguiente:
- Se envía tu prompt original: el contador de tokens avanza.
- El modelo lee el prompt y decide llamar a la herramienta de limpieza.
- La herramienta devuelve una versión recortada.
- El contexto ahora contiene tres elementos: el prompt original, los metadatos de la llamada a la herramienta y el prompt limpio.
Se te factura por las tres entradas. La versión "limpia" no reemplaza a la original; simplemente se sitúa junto a ella.
Cuándo ayuda realmente la limpieza mediante MCP
Una herramienta MCP ahorra tokens solo cuando el texto original nunca entra en el contexto principal de Claude Code. Eso ocurre en llamadas descendentes (downstream) como:
- Consultas de generación aumentada por recuperación (RAG) que el modelo reenvía a un motor de búsqueda o base de datos.
- Instrucciones enviadas a subagentes que actúan de forma independiente a la conversación principal.
En esos casos, el modelo reenvía el payload limpio directamente al sistema externo, manteniendo el texto original del usuario fuera del recuento principal de tokens.
Cómo reducir realmente tus tokens de entrada
Si quieres reducir el número de tokens que le proporcionas a Claude Code, limpia el texto antes de que toque al modelo. Aquí tienes tres enfoques prácticos que funcionan hoy en día:
- Teclas de acceso rápido a nivel de sistema – En Windows, usa el script AutoHotkey; en macOS, usa Automator. El script selecciona el texto que estás a punto de enviar, lo pasa a una API externa que devuelve una versión limpia y luego reemplaza el texto en el editor. Como la versión original nunca sale de tu máquina, solo se envía la versión limpia.
- Piping de CLI – Lanza Claude Code desde una terminal y preprocesa tu prompt con un filtro de bash (por ejemplo, un script de
sedo Python) que elimine espacios en blanco innecesarios, comentarios o frases duplicadas. Lo que se envía al modelo es la salida filtrada. - MCP solo para llamadas descendentes – Reserva las herramientas MCP para los pasos de RAG o de subagentes descritos anteriormente. Deja que el modelo gestione el prompt inicial del usuario directamente y permite que la herramienta de limpieza actúe solo sobre el payload que sale de la conversación principal.
Errores comunes que debes evitar
- Asumir que las herramientas MCP recortan el prompt original – Añaden un bloque de tokens de llamada a la herramienta y preservan el texto original, inflando el recuento total.
- Confiar en los hooks de Claude Code – Los hooks pueden inyectar contexto adicional o bloquear prompts, pero no pueden sobrescribir el texto que ya está en la conversación.
- Usar comandos de barra (slash commands) con limpieza en línea – Incluso si un comando ejecuta un script de limpieza, los argumentos originales siguen siendo parte de la línea de comandos que el modelo registra, por lo que también pagas por ellos.
El contador de tokens comienza en el instante en que tus caracteres llegan al endpoint de la API del modelo. Cualquier cosa que limpie después de ese punto solo añade sobrecarga.
Qué significa esto para los desarrolladores
El precio de los tokens aparece como una partida en la mayoría de las facturas de servicios de IA. Pagar de más porque un "limpiador" añade tokens ocultos puede erosionar rápidamente cualquier ahorro que esperabas obtener. Traslada el paso de limpieza al lado del cliente para mantener el recuento de tokens honesto y tu presupuesto predecible.
Conclusión: Las herramientas MCP son útiles para los payloads descendentes, pero no pueden recortar los tokens del prompt que escribes. Limpia antes de enviar, o restringe la limpieza a las llamadas que nunca aparecen en el contexto principal, si quieres una reducción real en los costes de tokens de Claude Code.
