본문으로 건너뛰기

Claude Code 토큰 사용량 감사: 컨텍스트·캐시·MCP·세션 비용

4 분 소요Claude Code

하나의 총 토큰 숫자로 빠른 소모를 설명하지 마세요. 결제 경로를 확인하고 컨텍스트, 캐시, MCP, 깨끗한 세션을 같은 조건에서 비교해야 합니다.

컨텍스트, 캐시, MCP, 세션 비용을 나눈 Claude Code 토큰 감사 보드

Claude Code 사용량이 빠르게 줄어들 때 먼저 해야 할 일은 절약 팁을 적용하는 것이 아니라 숫자의 주인을 확인하는 것입니다. 구독 사용량 바, 로컬 세션 비용 추정치, Claude Console, 클라우드 청구서는 서로 다른 계약을 측정합니다.

문제 세션을 닫지 말고 claude --version을 기록한 다음 /usage, /context, /mcp를 실행하세요. 모델, effort, 인증 경로, session ID, 컨텍스트 비율, input/output, cache creation/read, 정확한 제한 또는 오류 문구를 남깁니다. API key, 개인 대화, 고객 코드 전체는 지원 자료에 넣지 않습니다.

공식 비용 문서, 컨텍스트 창, 프롬프트 캐싱, MCP 문서는 2026년 8월 4일에 확인했습니다. 화면이 다르면 설치된 버전을 기준으로 판단하세요.

먼저 구독과 청구 계량기를 분리하세요

/usage의 Session 블록은 현재 세션의 토큰 구성과 표준 가격으로 로컬 계산한 비용을 보여 줍니다. 세션 간 비교에는 유용하지만 할인이나 계약 단가를 반영한 최종 청구서는 아닙니다. Pro와 Max 사용량은 구독에 포함되므로 달러 추정치만으로 추가 청구를 증명할 수 없습니다.

확인 화면증명할 수 있는 것증명할 수 없는 것
/usage로컬 세션 구성, 플랜 창, 최근 귀속모든 기기의 전체 활동
/context현재 창을 차지하는 항목어느 공급자가 청구했는지
statusline지속적인 컨텍스트와 세션 추정치확정 청구 금액
Claude ConsoleAPI workspace 사용량과 비용구독 잔여량
클라우드 청구서Bedrock, Google Cloud, Foundry 비용Claude 구독 사용량

경로가 불분명하면 비용 계산을 멈추고 로그인, 환경 변수, base URL, 공급자를 확인합니다. 자세한 분기는 API key와 구독 청구 가이드를 참고하세요.

세션이 살아 있을 때 감사 원장을 만드세요

Claude Code 계량기와 증거 강도를 정리한 감사 원장

시간과 시간대, 버전, 모델, effort, 경로, 작업 디렉터리, session ID, /context 주요 분류, 토큰 클래스, MCP 귀속을 한 표에 기록합니다. 모델 변경, MCP 연결, /compact, 업데이트, 오래된 세션 재개, 긴 공백도 같이 적으세요.

현재 /usage는 최근 사용량을 skills, subagents, plugins, 개별 MCP server에 귀속시키고 긴 컨텍스트나 cache miss 비중이 눈에 띄면 알려 줍니다. 하지만 이 값은 이 기기의 로컬 기록을 이용한 근사치입니다. 다른 기기와 Claude.ai 활동까지 포함한 조직 회계로 해석하면 안 됩니다.

컨텍스트 증가와 캐시 재생성을 따로 보세요

긴 세션에서는 지시, 파일, 대화, tool result가 다음 요청에 계속 포함됩니다. 캐시가 잘 작동해도 서로 관련 없는 작업을 한 대화에서 이어 가면 매번 처리해야 할 컨텍스트가 커집니다.

먼저 /context에서 큰 항목을 찾습니다. 시작 전부터 CLAUDE.md, memory, MCP tool 이름, skill 설명이 들어갈 수 있고 이후 파일 읽기와 대화가 누적됩니다. 이전 작업이 대부분이라면 목적이 분명한 새 세션이 가장 깨끗한 수정입니다.

그다음 cache_read_input_tokenscache_creation_input_tokens를 비교합니다. read는 기존 prefix 재사용, creation은 작성 또는 재생성입니다. 모델이나 effort 변경, prefix에 포함된 tool 변경, /compact, 업데이트, 경로 변경, TTL 만료 뒤 한 번 재생성되는 것은 정상일 수 있습니다. 같은 조건의 비슷한 요청에서 높은 creation과 낮은 read가 반복될 때 조사 가치가 커집니다. 세부 사항은 캐시 미스 비용 가이드를 사용하세요.

MCP는 스키마와 반환값을 두 번 측정하세요

연결된 server 수에 임의의 토큰 값을 곱하면 안 됩니다. 지원되는 경로에서는 Tool Search가 전체 schema를 미루고 필요한 tool만 찾습니다. 다만 gateway, 클라우드, 모델, 설정, alwaysLoad는 upfront loading을 만들 수 있습니다.

/mcp/context로 활성 tool과 로딩 방식을 확인한 뒤 실제 반환 크기를 봅니다. 작은 정의도 전체 로그나 테이블을 반환하면 대화 기록이 커집니다. Claude Code는 단일 MCP 결과가 10,000 token을 넘으면 경고하고 기본 최대값은 25,000 token입니다. 상한을 높이기 전에 필터, 페이지네이션, 요약, 파일 핸들을 적용하세요. 깊은 정리는 MCP 컨텍스트 과부하 가이드에 있습니다.

깨끗한 대조 세션으로 재현성을 확인하세요

무거운 Claude Code 세션과 깨끗한 대조 세션 비교

동일한 프로젝트, 버전, 경로, 모델, effort를 유지합니다. 새 세션을 열고 필요한 MCP만 남긴 뒤 작업 전 /usage/context를 저장하세요. 완료 조건이 분명한 작은 작업 하나를 수행하고 같은 필드를 다시 수집합니다.

대조 세션이 가볍다면 원래 세션은 오래된 기록, 큰 tool result, 혼합 작업, 병렬 agent 컨텍스트를 들고 있었을 가능성이 높습니다. 관련 없는 작업 사이에는 /clear, 자연스러운 경계에는 /compact를 사용하고 tool 결과를 좁힙니다.

대조 세션에서도 이상이 재현되면 반복 실험으로 사용량을 더 태우지 마세요. 동일한 조건, 시간, 토큰 클래스, MCP 상태, 정확한 오류를 갖춘 한 번의 재현이 좋은 지원 자료입니다.

증거에 맞는 가장 작은 수정을 고르세요

증거첫 수정먼저 하지 말 것
관련 없는 기록이 큼목적별 새 세션즉시 상위 플랜 구매
creation이 계속 높음model, effort, tools, route 고정매 턴 compact
특정 MCP가 큼query와 반환량 축소모든 MCP 영구 비활성화
output이 지배적결과 형식과 길이 제한캐시 탓하기
agent가 지배적수와 spawn prompt 축소하위 context를 무료로 보기
정확한 529상태 확인 후 제한 재시도개인 quota로 해석
API 429provider retry와 limit 준수Pro/Max 소진으로 해석
대조도 비정상원장과 함께 에스컬레이션추가 사용량으로 증상 숨기기

감사의 끝은 완벽한 공식을 만드는 것이 아닙니다. 큰 증가분을 컨텍스트, 캐시 read/write, MCP, output, agent, 플랜 창, 청구 경로 중 하나에 귀속할 수 있으면 안전한 다음 행동을 선택할 수 있습니다.

#Claude Code#토큰 사용량#컨텍스트#프롬프트 캐싱#MCP
Share: