# Auditoría de tokens en Claude Code: contexto, caché, MCP y coste por sesión

> Un total de tokens no explica por qué una sesión consume tanto. Confirma la ruta de pago, separa contexto y caché, mide MCP y compárala con una sesión limpia.

- URL: https://blog.laozhang.ai/es/posts/claude-code-usage-limit-issues
- Published: 2026-08-04
- Updated: 2026-08-04
- Author: AI Free API Team (https://blog.laozhang.ai/es/about)
- Category: Claude Code
- Tags: Claude Code, uso de tokens, ventana de contexto, prompt caching, MCP

---
Una auditoría útil de Claude Code empieza por saber quién es dueño del número. La barra de una suscripción, la estimación local de una sesión, Claude Console y la factura de un proveedor cloud son medidores distintos. Mezclarlos convierte una cifra correcta en una conclusión equivocada.

Mantén abierta la sesión sospechosa. Anota `claude --version` y ejecuta `/usage`, `/context` y `/mcp`. Guarda modelo, effort, ruta de autenticación, session ID, porcentaje de contexto, input/output, cache creation/read y el texto exacto de cualquier límite o error. No adjuntes claves, conversaciones privadas ni código de clientes.

La documentación oficial de [costes](https://code.claude.com/docs/es/costs), [ventana de contexto](https://code.claude.com/docs/es/context-window), [prompt caching](https://code.claude.com/docs/es/prompt-caching) y [MCP](https://code.claude.com/docs/es/mcp) se comprobó el 4 de agosto de 2026. Si la interfaz no coincide, toma como referencia tu versión instalada.

## Asigna cada cifra a su contrato

El bloque Session de `/usage` muestra los tokens de la sesión y una cifra en dólares calculada localmente con precios de lista. Sirve para comparar sesiones, pero no incorpora necesariamente descuentos, promociones o contratos. En Pro y Max el uso está incluido en la suscripción, así que esa estimación no demuestra un cargo adicional.

| Superficie | Qué demuestra | Qué no demuestra |
| --- | --- | --- |
| `/usage` | Mezcla local de tokens, ventanas del plan y atribución reciente | Actividad completa de todos los dispositivos |
| `/context` | Qué ocupa la ventana actual | Quién lo factura |
| Statusline | Contexto y estimación continua | Factura definitiva |
| Claude Console | Gasto del workspace API | Uso restante de la suscripción |
| Factura cloud | Gasto de Bedrock, Google Cloud o Foundry | Consumo de Claude Pro/Max |

Si la ruta no está clara, detén el cálculo. Comprueba inicio de sesión, variables de entorno, base URL y proveedor. La [guía de API key frente a suscripción](https://blog.laozhang.ai/es/posts/claude-code-api-key-vs-subscription-billing) cubre esa decisión.

## Registra un libro de auditoría pequeño

![Libro de auditoría que relaciona medidores de Claude Code con evidencias](https://blog.laozhang.ai/posts/es/claude-code-usage-limit-issues/img/audit-ledger.webp)

No necesitas exportar todo el chat. Registra hora y zona, versión, ruta, modelo, effort, directorio, session ID, categorías principales de `/context`, clases de tokens y atribución MCP. Añade cambios recientes: modelo, effort, servidores, `/compact`, actualización, reanudación de una sesión antigua o pausa larga.

El `/usage` actual puede atribuir uso reciente a skills, subagents, plugins y servidores MCP concretos. También señala contexto largo o cache misses cuando pesan de forma material. Es una aproximación construida con el historial local de esta máquina; no incluye toda la actividad de otros dispositivos o de Claude.ai.

## Distingue contexto acumulado de caché reconstruida

Claude Code arrastra instrucciones, archivos, conversación y resultados de herramientas. Aunque la caché funcione, una sesión larga con tareas no relacionadas procesa más contexto en cada turno. Usa `/context` para encontrar las categorías grandes: CLAUDE.md, memory, nombres de tools MCP y skills pueden estar presentes desde el inicio; después crecen archivos, mensajes y tool results.

La caché abarata un prefijo estable, pero no elimina el contexto. `cache_read_input_tokens` indica reutilización; `cache_creation_input_tokens`, escritura o reconstrucción. El output sigue siendo generación nueva.

Una reconstrucción tras cambiar modelo o effort, modificar tools cargadas, ejecutar `/compact`, actualizar Claude Code, cambiar de ruta o superar el TTL puede ser normal. La señal fuerte es creation alta y read baja repetidas en turnos similares con la misma configuración. Para TTL e invalidadores, abre la [guía de costes por cache miss](https://blog.laozhang.ai/es/posts/claude-code-cache-miss-token-costs).

## Mide MCP en definiciones y resultados

El número de servidores configurados no equivale a un coste fijo. En rutas compatibles, Tool Search aplaza los schemas completos y descubre las tools cuando hacen falta. Un gateway, proveedor cloud, modelo, ajuste o `alwaysLoad` puede cambiar este comportamiento.

Primero usa `/mcp` y `/context` para ver qué está activo y si carga de forma diferida. Después mide la respuesta: una definición pequeña puede devolver un log o una tabla enormes que permanecen en el historial. Claude Code avisa cuando un resultado MCP supera 10.000 tokens y limita por defecto a 25.000. Subir el límite no abarata nada; aplica filtros, paginación, resúmenes o handles. La [guía de sobrecarga MCP](https://blog.laozhang.ai/es/posts/claude-code-mcp-context-overload) ofrece la limpieza profunda.

## Compara con una sesión de control

![Comparación entre una sesión pesada de Claude Code y una sesión de control limpia](https://blog.laozhang.ai/posts/es/claude-code-usage-limit-issues/img/control-session.webp)

1. Mantén proyecto, versión, ruta, modelo y effort.
2. Abre una sesión nueva con solo los MCP necesarios.
3. Guarda `/usage` y `/context` antes de trabajar.
4. Ejecuta una tarea pequeña con final observable.
5. Vuelve a guardar los mismos campos y compara contexto, creation/read, output y atribución MCP.

Si el control es mucho más barato, la sesión original llevaba historial, resultados grandes, tareas mezcladas o contextos paralelos. Usa `/clear` al cambiar de trabajo, `/compact` en una frontera natural y consultas de herramientas más estrechas.

Si el control reproduce el salto, no consumas más repitiéndolo. Una evidencia sólida incluye misma versión, ruta, modelo, effort y tarea; sesión nueva; estado MCP; marcas de tiempo; clases de tokens y error exacto.

## Aplica la corrección más pequeña

| Patrón | Primera corrección | Mala primera decisión |
| --- | --- | --- |
| Historial ajeno domina | Nueva sesión enfocada | Comprar otro plan sin probar |
| Creation sigue alta | Estabilizar modelo, effort, tools y ruta | Compactar cada turno |
| Un MCP domina | Reducir consulta y respuesta | Desactivar todos para siempre |
| Domina output | Limitar el artefacto pedido | Culpar a la caché |
| Dominan agentes | Reducir número y spawn prompt | Tratar contextos hijos como gratis |
| Error exacto `529` | Revisar estado y reintentar de forma limitada | Interpretarlo como cuota personal |
| API `429` | Respetar retry y límites del proveedor | Interpretarlo como fin de Pro/Max |
| El control sigue anómalo | Escalar con el libro | Comprar uso para ocultarlo |

La auditoría termina cuando cada aumento grande tiene propietario: contexto arrastrado, lectura o escritura de caché, definición o resultado MCP, output, agente, ventana del plan o ruta facturada. No hace falta una fórmula universal; hace falta una comparación que justifique la siguiente acción.
