2026년 8월 10일 기준으로 Anthropic의 공식 Claude API에서 일반적으로 비교할 최신 모델은 Claude Fable 5, Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5입니다. 이 글은 대부분의 프로덕션 작업에서 Sonnet 5를 첫 평가 후보로 삼을 것을 제안합니다. 품질 기준을 넘지 못한 요청만 Opus 5 또는 Fable 5로 올리고, 단순한 분류·추출·짧은 응답은 Haiku 4.5로 내려도 기준을 유지하는지 확인하세요.
이 글은 Anthropic 직접 API를 대상으로 합니다. Claude 웹·앱 구독, Claude Code 요금제, AWS Bedrock, Google Cloud, Microsoft Foundry의 모델 이름과 가격은 범위가 다릅니다. 승인 고객에게만 제한 제공되는 Mythos 5도 일반 선택표에서 제외합니다. 모델 목록과 정확한 모델 ID(Model ID)는 Anthropic의 Models overview, ID가 가리키는 버전의 성격은 Model IDs and versioning에서 확인할 수 있습니다.
먼저 알아야 할 세 가지 기준
표의 숫자를 보기 전에 서로 다른 개념 세 가지를 구분해야 합니다.
- 컨텍스트 창(context window): 한 요청에서 모델이 참고할 수 있는 전체 범위입니다. 모델이 한 번에 생성할 수 있는 최대 출력과는 다릅니다.
- 입력 토큰과 출력 토큰: 둘의 가격은 서로 다릅니다. 입력과 출력을 더한 총 토큰 수만으로 비용을 비교하면 긴 답변의 영향을 놓칩니다.
- 가장 강한 모델과 가장 적합한 모델: 실제 합격 기준을 통과하는 모델 중 비용과 지연이 가장 낮은 모델이 해당 작업에는 더 나은 선택일 수 있습니다.
여기서 말하는 속도와 용도는 Anthropic의 공식 포지셔닝을 바탕으로 한 출발점입니다. 이 글은 네 모델을 동일 조건에서 독립적으로 벤치마크한 결과가 아니며, 특정 모델을 보편적인 승자로 선언하지 않습니다.
네 모델의 차이와 정확한 API Model ID
Anthropic의 공식 모델 비교는 Fable 5를 널리 공개된 모델 중 가장 높은 역량의 모델, Opus 5를 복잡한 에이전트형 코딩과 기업 작업용 모델, Sonnet 5를 속도와 지능의 균형을 갖춘 모델, Haiku 4.5를 가장 빠르면서 준최전선급 지능을 제공하는 모델로 설명합니다. 아래의 “먼저 검토할 작업”은 이 설명을 실제 선택 순서로 옮긴 제안이며, 독립 성능 측정 결과가 아닙니다.
가격은 Anthropic 직접 API의 공식 Pricing을 기준으로 합니다. Sonnet 5는 2026년 8월 31일까지 입력 $2/MTok, 출력 $10/MTok의 한시 도입가가 적용되고, 2026년 9월 1일부터 표준 $3/$15가 적용됩니다.
| 모델 | 정확한 Model ID | 먼저 검토할 작업 | 공식 상대 속도 | 공식 기본 한도 | 표준 입력/출력 단가 | 주의점 |
|---|---|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 | 실패 비용이 큰 장기 에이전트 작업에서 추가 평가 | 느림 | 컨텍스트 1M, 동기식 최대 출력 128k | MTok당 $10/$50 | 안전 분류기 거부와 데이터 보존 조건 확인 |
| Claude Opus 5 | claude-opus-5 | 고난도 코딩, 복잡한 다단계 에이전트 작업 | 보통 | 컨텍스트 1M, 동기식 최대 출력 128k | MTok당 $5/$25 | Sonnet 5보다 높은 단가를 품질 개선이 상쇄하는지 측정 |
| Claude Sonnet 5 | claude-sonnet-5 | 일반 프로덕션 요청의 기본 후보 | 빠름 | 컨텍스트 1M, 동기식 최대 출력 128k | MTok당 $3/$15 | 2026년 8월 31일까지는 한시적으로 $2/$10 |
| Claude Haiku 4.5 | claude-haiku-4-5-20251001 | 대량 분류·추출, 짧은 응답, 비용·지연 최적화 | 가장 빠름 | 컨텍스트 200k, 최대 출력 64k | MTok당 $1/$5 | 별칭은 claude-haiku-4-5; 긴 작업과 품질 기준을 별도 확인 |
단위 MTok는 100만 토큰을 뜻합니다. 표의 가격은 세금, 도구 사용, data residency, 파트너 클라우드, prompt caching, Batch API를 섞지 않은 Anthropic 직접 API의 표준 단가입니다. 한시 가격과 세부 조건은 배포 당일 공식 가격 문서에서 다시 확인하세요.
Fable 5·Opus 5·Sonnet 5는 적응형 사고(adaptive thinking)를 사용하고, Haiku 4.5는 수동 확장 사고(manual extended thinking)를 지원합니다. Claude API와 Claude Code에서 Opus 5와 Sonnet 5의 기본 effort는 high입니다. 컨텍스트와 출력 한도는 기능, Batch 여부, 요청 방식에 따라 달라질 수 있으므로 표의 수치는 공식 기본 한도로 읽어야 합니다.
날짜가 없는 claude-fable-5, claude-opus-5, claude-sonnet-5도 “앞으로 나올 최신 버전”으로 자동 이동하는 별칭이 아닙니다. 4.6 이후의 날짜 없는 ID는 고정 스냅샷을 가리킨다는 버전 규칙을 따릅니다. 재현성이 필요하다면 선택한 ID와 확인 날짜를 배포 기록에 함께 남기세요.
Messages API 요청에서는 우선 model 값만 정확히 지정하면 됩니다. 다음은 Sonnet 5를 사용하는 최소 요청 본문입니다.
json{ "model": "claude-sonnet-5", "max_tokens": 1024, "messages": [ { "role": "user", "content": "이 고객 문의를 제품, 결제, 배송 중 하나로 분류하고 근거를 한 문장으로 설명해 주세요." } ] }
다른 모델을 평가할 때는 프롬프트와 성공 기준을 그대로 두고 model만 바꾸어야 비교가 흐려지지 않습니다.
토큰 단가를 실제 요청 비용으로 바꾸는 법
요청 한 건의 기본 토큰 비용은 입력과 출력을 따로 계산합니다.
text(입력 토큰 ÷ 1,000,000 × 입력 단가) + (출력 토큰 ÷ 1,000,000 × 출력 단가)
한국어 고객지원 요청 한 건에 입력 8,000토큰, 출력 2,000토큰이 든다고 가정해 보겠습니다. 요청마다 이 토큰 수가 동일하고 재시도가 없다는 계산용 가정이며, 실제 고객지원 트래픽의 실측 평균이 아닙니다.
| 모델 | 입력 비용 | 출력 비용 | 가상 요청 1건 | 같은 요청 1만 건 |
|---|---|---|---|---|
| Fable 5 | 0.008 × $10 = $0.080 | 0.002 × $50 = $0.100 | $0.180 | $1,800 |
| Opus 5 | 0.008 × $5 = $0.040 | 0.002 × $25 = $0.050 | $0.090 | $900 |
| Sonnet 5, 8월 31일까지 | 0.008 × $2 = $0.016 | 0.002 × $10 = $0.020 | $0.036 | $360 |
| Sonnet 5, 9월 1일부터 | 0.008 × $3 = $0.024 | 0.002 × $15 = $0.030 | $0.054 | $540 |
| Haiku 4.5 | 0.008 × $1 = $0.008 | 0.002 × $5 = $0.010 | $0.018 | $180 |
이 표는 생각 토큰, 도구 호출 결과, 캐시 읽기·쓰기, 재시도, 세금과 사람의 수정 시간을 포함하지 않습니다. 실제 청구액은 응답 길이와 기능 사용에 따라 달라집니다. 특히 Claude 4.7 이상은 새 tokenizer 때문에 같은 텍스트에서도 이전 tokenizer보다 토큰이 약 30% 더 나올 수 있다고 공식 가격 문서가 안내합니다. 콘텐츠별 편차가 크므로 모든 예산에 30%를 일괄 가산하지 말고 실제 사용량을 다시 측정하세요.
표시 단가보다 승인된 결과당 비용이 중요합니다
낮은 단가의 모델이 JSON 형식을 자주 깨뜨려 재시도가 늘거나, 답변을 사람이 오래 고쳐야 한다면 실제 비용은 오를 수 있습니다. 반대로 높은 단가의 모델이 모든 요청에 필요하지 않을 수도 있습니다. 최종 비교식은 다음과 같이 잡는 편이 낫습니다.
text(API 비용 + 재시도 비용 + 사람 수정 시간 비용) ÷ 승인된 결과 수
“승인”은 팀의 실제 기준으로 정의해야 합니다. 예를 들어 JSON 스키마 통과, 필수 근거 포함, 금지 표현 없음, 사실 오류 없음처럼 자동·수동으로 확인할 조건을 미리 정할 수 있습니다. 모델별 총비용만 비교하지 말고 승인된 결과 한 건을 얻는 데 든 비용과 시간을 함께 기록하세요.

대량 비동기 작업이라면 Batch API가 입력과 출력 모두 50% 할인되고, 반복되는 긴 시스템 프롬프트가 있다면 prompt-cache hit가 표준 입력가의 10%로 계산된다는 Anthropic 가격 정책도 검토할 수 있습니다. 캐시 쓰기에는 더 높은 배수가 적용됩니다. 작업이 Batch 조건을 충족하는지, 캐시가 실제로 재사용되는지에 따라 총 절감률이 달라지므로 “기능을 켜면 전체 비용이 절반”이라고 계산해서는 안 됩니다.
Sonnet 5에서 시작해 올리거나 내리는 평가법
모델 선택은 한 번의 데모보다 실제 요청으로 만든 작은 평가 세트에서 결정하는 편이 안전합니다. 개인정보를 제거한 대표 요청 20~30개를 쉬움·보통·어려움으로 나누고, 다음 항목을 같은 조건에서 기록하세요.
- 출력이 요구한 JSON 스키마를 통과했는지
- 사실 오류나 근거 없는 내용이 있었는지
- 승인 전에 사람이 수정한 시간
- p95 지연과 요청당 입력·출력 토큰
- 재시도 횟수와 최종 승인 여부
먼저 Sonnet 5로 기준선을 만듭니다. 품질 기준을 통과하지 못한 어려운 사례만 Opus 5와 Fable 5로 다시 평가하세요. 반대로 기준을 안정적으로 통과한 단순 사례만 Haiku 4.5로 내려 비용과 지연이 개선되는지 확인합니다. 모든 요청을 한꺼번에 상위 모델로 올리거나 하위 모델로 내릴 필요는 없습니다.

판단은 다음 세 갈래면 충분합니다.
- 품질 기준 미달: 실패 사례에 한해 Opus 5와 Fable 5를 비교하고, 개선 폭이 추가 비용보다 큰지 확인합니다.
- 기준 충족, 비용·지연이 문제: 단순 요청을 Haiku 4.5로 보내 같은 기준을 유지하는지 확인합니다.
- 기준 충족, 운영 지표도 양호: Sonnet 5를 유지합니다. 더 강한 모델이 존재한다는 이유만으로 바꾸지 않습니다.
이 20~30개라는 규모와 절차는 독자가 시작할 수 있도록 제안한 평가법이며 Anthropic의 공식 benchmark가 아닙니다. 실제 트래픽의 난이도와 실패 비용이 크다면 표본을 늘리고, 프롬프트 변경과 모델 변경을 분리해 측정하세요.
기존 연동은 Model ID만 바꾸기 전에 점검하세요
오래된 ID를 사용 중이라면 먼저 Anthropic의 Model deprecations에서 운영 상태를 확인하세요. 2026년 8월 10일 기준 Anthropic 운영 API에서는 Fable 5, Opus 5, Sonnet 5, Opus 4.8·4.7·4.6, Sonnet 4.6, Haiku 4.5가 active입니다. Opus 4.1은 2026년 8월 5일, Opus 4와 Sonnet 4는 2026년 6월 15일 사용 중단(retired)되었습니다. AWS Bedrock과 Google Cloud는 ID와 수명주기를 별도로 운영하므로 이 날짜를 그대로 적용하면 안 됩니다.
Sonnet 4.6에서 Sonnet 5로 옮길 때
Anthropic은 Sonnet 5 변경 안내에서 Sonnet 4.6의 Model ID를 Sonnet 5로 바꾸는 작업이 drop-in에 가깝다고 설명합니다. 그러나 요청이 완전히 동일하게 받아들여진다는 뜻은 아닙니다.
- 수동 extended thinking 요청을 제거하고 adaptive thinking 동작을 확인합니다.
- 기본값이 아닌
temperature,top_p,top_k조합은 거부될 수 있으므로 요청 구성을 점검합니다. - adaptive thinking이 기본으로 켜지는 점과 기본
effort가high인 점을 예산·지연 평가에 반영합니다. - tokenizer 변경 뒤 실제 입력·출력 토큰 수와 비용을 다시 측정합니다.
더 오래된 Sonnet 버전에서 옮긴다면 중간 버전의 변경 사항까지 추가로 확인해야 합니다. 스테이징에서 400 응답, 구조화 출력 통과율, 토큰 사용량을 확인한 뒤 트래픽을 나누어 전환하세요.
Fable 5는 보존 조건과 거부 응답을 함께 설계하세요
Fable 5는 일반 제공되지만 Mythos 5는 승인된 Project Glasswing 고객에게만 제한 제공된다고 Anthropic의 Fable 5·Mythos 5 소개가 설명합니다. 따라서 Mythos 5를 일반적인 셀프서비스 대안으로 계획하면 안 됩니다. Fable 5 연동은 안전 분류기의 refusal도 정상적인 응답 경로로 처리해야 합니다.
Fable 5 마이그레이션 가이드에 따르면 Opus 4.8의 $5/$25에서 Fable 5의 $10/$50로 토큰 단가가 두 배가 되며, 30일 데이터 보존 요구가 있습니다. 호환되지 않는 ZDR 구성은 400 오류를 반환할 수 있습니다. 기업 계약의 실제 보존 조건은 계정 담당자와 확인하고, 민감한 워크로드는 전환 전에 계약·보안 요구사항을 별도로 검토하세요.
배포 전에 끝내야 할 세 단계
첫째, 배포하는 날 Models overview와 Pricing에서 Model ID, 가격, 컨텍스트와 출력 한도를 다시 확인하세요. 특히 Sonnet 5의 한시 가격 종료일을 영구 단가로 저장하지 마세요.
둘째, 대표 요청 20~30개와 합격 기준을 준비해 Sonnet 5를 기준선으로 실행하세요. 품질 미달 사례만 Opus 5와 Fable 5로 올리고, 단순하고 안정적인 사례만 Haiku 4.5로 내려 승인 결과당 비용과 p95 지연을 기록합니다.
셋째, 기존 연동이라면 사용 중단 예정 여부, thinking 설정, temperature·top_p·top_k, tokenizer 영향, 데이터 보존과 ZDR 조건을 먼저 확인하세요. 이 과정을 거치면 “가장 강한 모델”을 고르는 대신, 자신의 품질 기준을 만족하는 가장 낮은 비용과 지연의 모델을 선택할 수 있습니다.



