Claude Code 사용량이 빠르게 줄어들 때 먼저 해야 할 일은 절약 팁을 적용하는 것이 아니라 숫자의 주인을 확인하는 것입니다. 구독 사용량 바, 로컬 세션 비용 추정치, Claude Console, 클라우드 청구서는 서로 다른 계약을 측정합니다.
문제 세션을 닫지 말고 claude --version을 기록한 다음 /usage, /context, /mcp를 실행하세요. 모델, effort, 인증 경로, session ID, 컨텍스트 비율, input/output, cache creation/read, 정확한 제한 또는 오류 문구를 남깁니다. API key, 개인 대화, 고객 코드 전체는 지원 자료에 넣지 않습니다.
공식 비용 문서, 컨텍스트 창, 프롬프트 캐싱, MCP 문서는 2026년 8월 4일에 확인했습니다. 화면이 다르면 설치된 버전을 기준으로 판단하세요.
먼저 구독과 청구 계량기를 분리하세요
/usage의 Session 블록은 현재 세션의 토큰 구성과 표준 가격으로 로컬 계산한 비용을 보여 줍니다. 세션 간 비교에는 유용하지만 할인이나 계약 단가를 반영한 최종 청구서는 아닙니다. Pro와 Max 사용량은 구독에 포함되므로 달러 추정치만으로 추가 청구를 증명할 수 없습니다.
| 확인 화면 | 증명할 수 있는 것 | 증명할 수 없는 것 |
|---|---|---|
/usage | 로컬 세션 구성, 플랜 창, 최근 귀속 | 모든 기기의 전체 활동 |
/context | 현재 창을 차지하는 항목 | 어느 공급자가 청구했는지 |
| statusline | 지속적인 컨텍스트와 세션 추정치 | 확정 청구 금액 |
| Claude Console | API workspace 사용량과 비용 | 구독 잔여량 |
| 클라우드 청구서 | Bedrock, Google Cloud, Foundry 비용 | Claude 구독 사용량 |
경로가 불분명하면 비용 계산을 멈추고 로그인, 환경 변수, base URL, 공급자를 확인합니다. 자세한 분기는 API key와 구독 청구 가이드를 참고하세요.
세션이 살아 있을 때 감사 원장을 만드세요

시간과 시간대, 버전, 모델, effort, 경로, 작업 디렉터리, session ID, /context 주요 분류, 토큰 클래스, MCP 귀속을 한 표에 기록합니다. 모델 변경, MCP 연결, /compact, 업데이트, 오래된 세션 재개, 긴 공백도 같이 적으세요.
현재 /usage는 최근 사용량을 skills, subagents, plugins, 개별 MCP server에 귀속시키고 긴 컨텍스트나 cache miss 비중이 눈에 띄면 알려 줍니다. 하지만 이 값은 이 기기의 로컬 기록을 이용한 근사치입니다. 다른 기기와 Claude.ai 활동까지 포함한 조직 회계로 해석하면 안 됩니다.
컨텍스트 증가와 캐시 재생성을 따로 보세요
긴 세션에서는 지시, 파일, 대화, tool result가 다음 요청에 계속 포함됩니다. 캐시가 잘 작동해도 서로 관련 없는 작업을 한 대화에서 이어 가면 매번 처리해야 할 컨텍스트가 커집니다.
먼저 /context에서 큰 항목을 찾습니다. 시작 전부터 CLAUDE.md, memory, MCP tool 이름, skill 설명이 들어갈 수 있고 이후 파일 읽기와 대화가 누적됩니다. 이전 작업이 대부분이라면 목적이 분명한 새 세션이 가장 깨끗한 수정입니다.
그다음 cache_read_input_tokens와 cache_creation_input_tokens를 비교합니다. read는 기존 prefix 재사용, creation은 작성 또는 재생성입니다. 모델이나 effort 변경, prefix에 포함된 tool 변경, /compact, 업데이트, 경로 변경, TTL 만료 뒤 한 번 재생성되는 것은 정상일 수 있습니다. 같은 조건의 비슷한 요청에서 높은 creation과 낮은 read가 반복될 때 조사 가치가 커집니다. 세부 사항은 캐시 미스 비용 가이드를 사용하세요.
MCP는 스키마와 반환값을 두 번 측정하세요
연결된 server 수에 임의의 토큰 값을 곱하면 안 됩니다. 지원되는 경로에서는 Tool Search가 전체 schema를 미루고 필요한 tool만 찾습니다. 다만 gateway, 클라우드, 모델, 설정, alwaysLoad는 upfront loading을 만들 수 있습니다.
/mcp와 /context로 활성 tool과 로딩 방식을 확인한 뒤 실제 반환 크기를 봅니다. 작은 정의도 전체 로그나 테이블을 반환하면 대화 기록이 커집니다. Claude Code는 단일 MCP 결과가 10,000 token을 넘으면 경고하고 기본 최대값은 25,000 token입니다. 상한을 높이기 전에 필터, 페이지네이션, 요약, 파일 핸들을 적용하세요. 깊은 정리는 MCP 컨텍스트 과부하 가이드에 있습니다.
깨끗한 대조 세션으로 재현성을 확인하세요

동일한 프로젝트, 버전, 경로, 모델, effort를 유지합니다. 새 세션을 열고 필요한 MCP만 남긴 뒤 작업 전 /usage와 /context를 저장하세요. 완료 조건이 분명한 작은 작업 하나를 수행하고 같은 필드를 다시 수집합니다.
대조 세션이 가볍다면 원래 세션은 오래된 기록, 큰 tool result, 혼합 작업, 병렬 agent 컨텍스트를 들고 있었을 가능성이 높습니다. 관련 없는 작업 사이에는 /clear, 자연스러운 경계에는 /compact를 사용하고 tool 결과를 좁힙니다.
대조 세션에서도 이상이 재현되면 반복 실험으로 사용량을 더 태우지 마세요. 동일한 조건, 시간, 토큰 클래스, MCP 상태, 정확한 오류를 갖춘 한 번의 재현이 좋은 지원 자료입니다.
증거에 맞는 가장 작은 수정을 고르세요
| 증거 | 첫 수정 | 먼저 하지 말 것 |
|---|---|---|
| 관련 없는 기록이 큼 | 목적별 새 세션 | 즉시 상위 플랜 구매 |
| creation이 계속 높음 | model, effort, tools, route 고정 | 매 턴 compact |
| 특정 MCP가 큼 | query와 반환량 축소 | 모든 MCP 영구 비활성화 |
| output이 지배적 | 결과 형식과 길이 제한 | 캐시 탓하기 |
| agent가 지배적 | 수와 spawn prompt 축소 | 하위 context를 무료로 보기 |
정확한 529 | 상태 확인 후 제한 재시도 | 개인 quota로 해석 |
API 429 | provider retry와 limit 준수 | Pro/Max 소진으로 해석 |
| 대조도 비정상 | 원장과 함께 에스컬레이션 | 추가 사용량으로 증상 숨기기 |
감사의 끝은 완벽한 공식을 만드는 것이 아닙니다. 큰 증가분을 컨텍스트, 캐시 read/write, MCP, output, agent, 플랜 창, 청구 경로 중 하나에 귀속할 수 있으면 안전한 다음 행동을 선택할 수 있습니다.



