본문으로 건너뛰기

Claude Fable 5.1 API 요금: 캐시와 배치를 반영한 비용 계산법

7 분 소요AI API

Claude Fable 5.1 API는 일반 입력 100만 토큰당 10달러, 출력 50달러입니다. 캐시 쓰기·읽기는 별도 단가로 계산하고, Batch는 토큰 요금에 50% 할인을 적용합니다. 응답의 usage로 비용을 계산하는 예시와 캐시 유지 시간 선택 기준을 정리했습니다.

Claude Fable 5.1 API의 입력, 캐시 쓰기와 읽기, 출력 비용을 나누어 보여 주는 그림

Claude Fable 5.1 API의 기본 요금은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러입니다. 다만 프롬프트 캐싱을 사용하면 입력을 일반 입력, 캐시 쓰기, 캐시 읽기로 나눠 계산해야 합니다. Message Batches의 토큰 요금은 일반 호출의 절반입니다. 단가 확인일은 2026년 9월 19일이며, 아래 계산은 Anthropic 직접 API의 기본 글로벌 추론 요금과 미국 달러를 기준으로 합니다. (공식 요금표)

예산을 잡을 때 가장 먼저 확인할 값은 응답의 usage입니다. input_tokens는 캐시를 제외한 입력만 나타내므로, 이 값과 출력만 계산하면 캐시 쓰기·읽기 비용이 빠집니다. 반대로 캐시 쓰기 합계와 유지 시간별 세부 항목을 모두 더하면 중복 계산이 됩니다.

Fable 5.1 단가는 다섯 항목으로 나눕니다

모델 ID는 claude-fable-5-1입니다. 아래 표에서 MTok는 100만 토큰을 뜻하며, 모든 금액은 USD입니다. Batch 열에는 이미 50% 할인을 반영했습니다. (모델 안내, Batch 요금)

청구 항목일반 호출: USD/MTokBatch: USD/MTok
캐시를 사용하지 않은 입력$10.00$5.00
5분 캐시 쓰기$12.50$6.25
1시간 캐시 쓰기$20.00$10.00
캐시 읽기·갱신$0.25$0.125
출력$50.00$25.00

캐시 읽기는 일반 입력의 2.5% 가격입니다. 이전 Fable 5의 캐시 읽기 단가인 1달러와 비교하면 75% 낮지만, 이 비율은 캐시 읽기 항목에만 해당합니다. 출력이 대부분인 작업이나 캐시를 매번 새로 쓰는 작업의 총비용이 75% 줄어드는 것은 아닙니다. (Fable 5.1 안내)

Fable 5.1은 최대 100만 토큰 문맥에서도 같은 토큰 단가를 적용합니다. 긴 문맥에 별도 할증이 없다는 뜻이지, 긴 문서를 넣어도 총비용이 같다는 뜻은 아닙니다. 입력이 두 배가 되고 나머지 조건이 같다면 해당 입력 비용도 두 배가 됩니다. 모델 선택과 전환 시 고려할 사항은 Fable 5.1 마이그레이션 가이드에서 따로 다룹니다.

usage로 요청 한 건의 토큰 비용 계산하기

일반 호출의 토큰 비용은 다음과 같이 계산할 수 있습니다. 변수는 모두 실제 토큰 수이며, 100만 토큰 단위로 미리 환산한 값이 아닙니다.

text
U = usage.input_tokens W5 = usage.cache_creation.ephemeral_5m_input_tokens W60 = usage.cache_creation.ephemeral_1h_input_tokens R = usage.cache_read_input_tokens O = usage.output_tokens 토큰 비용(USD) = (10×U + 12.5×W5 + 20×W60 + 0.25×R + 50×O) / 1,000,000

cache_creation_input_tokens는 캐시 쓰기의 합계입니다. 유지 시간별 항목이 제공되는 경우 W5 + W60과 같으므로, 위 식에 이 합계를 한 번 더 더하지 않습니다. 쓰기 합계만 저장해 둔 로그에서 5분과 1시간 쓰기가 섞였다면, 합계만으로는 정확한 비용을 복원할 수 없습니다. 유지 시간 설정이나 세부 사용량도 함께 보관해야 합니다. (캐시 사용량 추적)

다음은 다섯 항목을 한 번에 보여 주기 위해 만든 가상의 응답입니다. 실제 API 호출이나 청구서에서 가져온 값은 아닙니다.

json
{ "usage": { "input_tokens": 2000, "cache_creation_input_tokens": 5000, "cache_read_input_tokens": 20000, "cache_creation": { "ephemeral_5m_input_tokens": 4000, "ephemeral_1h_input_tokens": 1000 }, "output_tokens": 1000 } }
항목사용량일반 호출 비용
일반 입력2,000토큰$0.020
5분 캐시 쓰기4,000토큰$0.050
1시간 캐시 쓰기1,000토큰$0.020
캐시 읽기20,000토큰$0.005
출력1,000토큰$0.050
합계입력 27,000토큰 + 출력 1,000토큰$0.145

가상의 usage를 일반 입력, 두 종류의 캐시 쓰기, 캐시 읽기, 출력으로 나누어 총 0.145달러를 계산한 그림

입력 토큰 수를 확인할 때는 2,000 + 5,000 + 20,000 = 27,000으로 합산합니다. 비용을 계산할 때는 이 27,000토큰에 입력 단가 10달러를 일괄 적용하지 않고, 표처럼 항목별 단가를 적용합니다.

출력도 화면에 보이는 답변 길이만으로 추정하면 안 됩니다. 추론 토큰은 청구되는 출력에 포함되므로 응답의 출력 사용량을 기준으로 잡습니다. 이미 포함된 추론 토큰을 별도 항목처럼 다시 더하지 않습니다. 또한 한국어 글자 수를 일정 비율로 토큰 수로 바꾸는 계산은 정확한 견적이 되기 어렵습니다. 요청 전에는 토큰 계산 API로 추정하고, 요청 후에는 실제 usage로 보정하는 편이 낫습니다. (추론 토큰 과금 안내)

캐시는 얼마나 재사용해야 이득일까요?

5분 캐시는 같은 내용을 한 번만 다시 읽어도 해당 입력 부분에서 이득이 생깁니다. 1시간 캐시는 쓰기 비용이 더 높아 두 번 다시 읽어야 일반 입력보다 저렴해집니다. 이 계산은 캐시가 만료되기 전에 동일한 접두부를 실제로 재사용하고, 나머지 입력과 출력은 같다는 조건입니다.

공통 문맥이 10,000토큰인 작업을 생각해 보겠습니다. 캐시를 사용하지 않으면 이 부분의 비용은 매번 0.10달러입니다. 5분 캐시에 처음 쓰는 비용은 0.125달러이고, 이후 읽기는 회당 0.0025달러입니다. 1시간 캐시에 처음 쓰는 비용은 0.20달러입니다.

같은 문맥의 누적 사용 횟수캐시 없음5분 캐시1시간 캐시
1회: 최초 요청$0.1000$0.1250$0.2000
2회: 한 번 재사용$0.2000$0.1275$0.2025
3회: 두 번 재사용$0.3000$0.1300$0.2050

동일한 10,000토큰 접두부를 세 번 사용할 때 캐시 없음, 5분 캐시, 1시간 캐시의 누적 입력 비용 비교

이 표는 공통 문맥의 입력 비용만 비교합니다. 요청별 질문, 도구 결과, 출력 비용은 포함하지 않았습니다. 캐시 적중 시 유지 시간은 갱신되며 새 쓰기 요금 대신 읽기 요금이 발생합니다. 유지 시간은 응답이 끝난 시점이 아니라 캐시를 쓰거나 읽는 요청의 시작 시점부터 계산합니다. (캐시 유지 시간과 요금)

짧은 간격으로 반복 호출한다면 기본 5분 캐시부터 검토할 수 있습니다. 반면 다음 호출까지 5분 이상 비는 경우에는 1시간 캐시가 재쓰기를 줄일 수 있습니다. 그래도 1시간 설정이 항상 저렴한 것은 아닙니다. 실제 호출 간격과 cache_read_input_tokens, 유지 시간별 쓰기 사용량을 비교해 판단해야 합니다.

캐시 설정을 했는데 읽기 사용량이 0인 경우

Fable 5.1의 최소 캐시 길이는 512토큰입니다. 그보다 짧으면 캐시 오류가 발생하는 대신 일반 입력으로 처리됩니다. 최소 길이를 넘겼더라도 앞부분이 달라지거나 캐시가 만료되면 재사용되지 않을 수 있습니다. (캐시 제한 및 무효화 조건)

다음 순서로 확인하면 원인을 좁히기 쉽습니다.

  1. 캐시 대상 접두부가 512토큰 이상인지 확인합니다. 전체 요청이 길어도 캐시 대상으로 지정한 부분은 짧을 수 있습니다.
  2. 이전 요청과 tools, system, messages 앞부분이 같은지 비교합니다. 캐시는 의미가 비슷한 문장을 재사용하는 기능이 아닙니다.
  3. effort 등 캐시에 영향을 주는 설정을 바꾸지 않았는지 확인합니다.
  4. 요청 간격이 유지 시간을 넘지 않았는지 확인한 뒤 쓰기·읽기 사용량을 나란히 봅니다.

최상위 cache_control: {"type":"ephemeral"}로 자동 캐싱을 설정할 수 있으며, 기본 유지 시간은 5분입니다. 1시간 유지 시간을 지정하려면 ttl: "1h"를 사용합니다. 설정을 보냈다는 사실만으로 절감액을 계산하지 말고, 응답의 캐시 읽기 사용량으로 실제 재사용 여부를 확인하세요.

Batch는 기다릴 수 있는 작업에 적용합니다

Message Batches는 비동기로 요청을 처리하며 응답을 스트리밍하지 않습니다. 대부분의 배치는 1시간 안에 끝나지만 최대 24시간이 걸릴 수 있고, 처리하지 못한 요청은 만료될 수 있습니다. 따라서 대화 중 즉시 보여 줄 답변보다는 야간 분류, 문서 요약, 정기 평가처럼 결과를 기다릴 수 있는 작업에 맞습니다. (배치 처리 안내)

Batch에서는 일반 입력, 캐시 쓰기·읽기, 출력의 토큰 요금에 50% 할인을 적용합니다. 앞의 가상 예시와 사용량이 완전히 같다면 0.145달러의 절반인 0.0725달러입니다. 첫 번째 표의 Batch 단가로 계산했다면 이미 할인을 적용한 결과이므로 다시 절반으로 줄이지 않습니다. (Batch 할인과 캐시 요금)

주의할 점은 같은 배치 안에 동일한 문맥을 넣었다고 해서 첫 요청 이후 모든 요청이 캐시를 읽는 것은 아니라는 사실입니다. 요청이 비동기·동시 실행되기 때문에 캐시 적중은 보장되지 않습니다. 1시간 유지 시간이 도움이 될 수는 있지만, 캐시 쓰기 단가도 높아집니다. 예상 비용을 계산할 때는 캐시가 적중했을 때와 적중하지 않았을 때를 나누고, 완료된 결과의 사용량으로 예상치를 갱신하세요.

배치는 요청 수 100,000개 또는 크기 256MB 중 먼저 도달하는 제한을 적용합니다. 결과 순서는 요청 순서와 다를 수 있으므로 custom_id로 원래 작업과 연결해야 합니다. 결과는 배치 생성 후 29일간 보관되므로, 비용 집계와 재시도 판단에 필요한 결과를 별도로 저장하는 것이 좋습니다. (제한 및 결과 조회)

실패한 요청과 다시 실행한 요청은 따로 집계하세요

공식 문서상 Batch의 errored, canceled, expired 결과는 해당 요청에 대해 청구되지 않습니다. 반면 succeeded는 메시지가 생성된 상태이므로, 내용이 업무 기준에 맞지 않더라도 발생한 토큰 사용량은 비용에 포함됩니다. 이를 다시 실행해 성공하면 두 번째 결과의 비용도 추가됩니다. (Batch 결과 유형과 청구)

따라서 결과가 마음에 들지 않은 요청을 모두 “실패했으니 무료”로 분류하면 예산을 적게 잡게 됩니다. 상태, custom_id, 사용량, 재실행 횟수를 함께 저장하고, API 처리 성공과 업무상 통과 여부를 구분하세요. 그래야 문서 한 건을 최종 완료하는 데 든 비용을 계산할 수 있습니다.

실제 청구액에 추가로 반영할 항목

지금까지의 계산은 기본 글로벌 추론의 토큰 비용입니다. 직접 Claude API에서 inference_geo: "us"를 지정하면 모든 토큰 항목에 1.1배 요금이 적용됩니다. Batch와 함께 쓰는 경우 기본 토큰 비용에 0.5 × 1.1을 적용합니다. 앞의 가상 사용량이라면 0.145 × 0.5 × 1.1 = 0.07975달러입니다. 이 10% 할증을 Bedrock이나 Google Cloud 요금에 그대로 대입해서는 안 됩니다. 해당 플랫폼의 지역별 가격을 확인해야 합니다. (데이터 레지던시 요금)

도구를 쓰는 작업에서는 도구 정의, 실행 결과, 누적 대화 내역이 입력 토큰을 늘릴 수 있습니다. 서버 도구에는 별도 사용료도 있습니다. 예를 들어 웹 검색은 토큰 요금 외에 검색 1,000회당 10달러가 부과됩니다. Batch의 토큰 할인율을 이런 도구 사용료에도 자동으로 적용하면 안 됩니다. (도구 요금)

월간 예산을 잡을 때는 성공 요청 한 건의 평균 비용만 곱하기보다, 같은 작업을 완료할 때까지 발생한 모든 요청을 묶어 계산하세요. 캐시를 처음 쓰는 요청과 재사용하는 요청의 비율, 출력량, 성공 후 재실행, 지역 설정, 도구 사용료가 총액을 바꿉니다. 여기서는 환율이나 세금, 개별 계약 조건을 가정하지 않았습니다. 원화 예산이 필요하면 토큰 비용을 먼저 USD로 계산한 다음 실제 결제에 적용할 조건을 별도로 반영하면 됩니다.

자주 묻는 질문

Claude 구독료를 내면 Fable 5.1 API 비용도 포함되나요?

Claude 소비자용 구독과 API 사용량은 별도입니다. API 작업의 예산은 구독료가 아니라 해당 모델의 API 단가와 실제 사용량으로 계산해야 합니다. (API 요금 안내)

100만 토큰 문맥을 사용하면 입력 단가가 올라가나요?

Fable 5.1은 전체 100만 토큰 문맥에서 같은 토큰 단가를 적용합니다. 다만 입력량 자체가 늘어나므로 총비용은 커질 수 있습니다. 반복되는 문맥이 있다면 그 부분의 캐시 적중 여부가 비용에 영향을 줍니다. (모델 안내)

캐시 읽기 비용만 보면 절감 효과를 알 수 있나요?

아닙니다. 최초 쓰기, 만료 후 다시 쓰기, 일반 입력과 출력까지 함께 비교해야 합니다. 같은 작업을 캐시 없이 처리했을 때의 비용과 실제 작업 전체 비용을 비교해야 총절감액을 알 수 있습니다. 읽기 단가의 할인율은 전체 청구액의 할인율과 다릅니다.

비용 집계를 시작한다면 우선 요청별 다섯 토큰 항목과 Batch 사용 여부를 저장하세요. 여기에 추론 지역, 도구 사용료, 재실행 이력을 더하면 단가표를 보는 데서 그치지 않고 실제 작업 비용을 설명할 수 있습니다.

#Claude Fable 5.1#API 요금#프롬프트 캐싱#배치 처리
Share: