# Claude Haiku 5.5 vs Sonnet 5.5 차이: 단가는 20배, 어떤 작업을 옮길까

> Haiku 5.5는 10만 토큰 이하에서 Sonnet 5.5 단가의 1/20입니다. 분류·요약·서브에이전트는 Haiku, 에이전트 코딩은 Sonnet, 자동 검증되는 작업은 Haiku부터 쓰세요.

- URL: https://blog.laozhang.ai/ko/posts/claude-haiku-5-5-vs-sonnet-5-5
- Published: 2026-10-08
- Updated: 2026-10-08
- Author: LaoZhang AI Team (https://blog.laozhang.ai/ko/about)
- Topic: Claude Code
- Tags: Claude, Haiku 5.5, Sonnet 5.5, 모델 비교, Claude API, Claude Code

---
Claude Haiku 5.5(클로드 하이쿠 5.5)는 2026년 10월 7일에 나온 Anthropic의 가장 빠르고 저렴한 모델이고, Claude Sonnet 5.5는 9월 28일에 나온 중간 등급 모델입니다. 프롬프트가 10만 토큰 이하일 때 Haiku 5.5의 가격은 100만 토큰당 입력 $0.10, 출력 $0.50으로, Sonnet 5.5의 입력 $2, 출력 $10과 비교하면 20분의 1입니다([Claude API 가격 문서](https://platform.claude.com/docs/en/about-claude/pricing)). 반면 Anthropic이 [Haiku 5.5 발표 글](https://www.anthropic.com/claude-haiku-5-5)에 실은 벤치마크에서는 Sonnet 5.5가 모든 항목에서 앞서고, 에이전트 코딩을 재는 Terminal-Bench 4.0에서는 39.2% 대 70.6%로 차이가 큽니다.

2026년 10월 8일 기준으로 정리하면 이렇게 나누는 것이 합리적입니다.

- **Haiku 5.5로 옮길 작업**: 분류, 정보 추출, 라우팅, 요약, 대화 압축처럼 대량으로 반복되고 결과를 확인하기 쉬운 일, 그리고 범위가 좁은 서브에이전트 작업.
- **Sonnet 5.5에 둘 작업**: 여러 단계를 스스로 진행하는 에이전트 코딩, 여러 도구를 엮는 업무 자동화, 모델이 기억에 의존해 사실을 답해야 하는 질의.
- **Haiku 먼저, 실패하면 Sonnet**: 테스트나 스키마 검사로 실패를 자동으로 잡아낼 수 있는 중간 난도 작업.

토큰 단가 20배가 그대로 작업 비용 20배가 되지는 않습니다. 프롬프트가 10만 토큰을 넘으면 단가 차이는 4배로 줄고, Artificial Analysis 측정값에서 같은 점수가 나온 설정끼리 비교해도 Haiku 5.5는 작업 1건당 약 4배 저렴한 대신 2.3배 오래 걸렸습니다.

## Haiku 5.5와 Sonnet 5.5 선택 기준: 작업 유형별로 나누기

먼저 쓸 모델은 작업 범위가 얼마나 좁은지, 실패를 자동으로 알아챌 수 있는지로 정합니다. 아래 표의 "바꾸는 조건"은 자기 데이터로 평가했을 때 나타나는 신호입니다.

| 작업 | 먼저 쓸 모델 | 이럴 때 바꿉니다 |
| --- | --- | --- |
| 분류, 태깅, 라우팅, 필드 추출 | Haiku 5.5, effort `low`~`medium` | 정답 샘플에서 오류율이 허용치를 넘으면 `high`로 올리고, 그래도 안 되면 Sonnet 5.5 |
| 요약, 긴 대화 압축 | Haiku 5.5 | 원문에 없는 내용을 지어내거나 핵심을 빠뜨리는 비율이 문제가 되면 Sonnet 5.5 |
| 10만 토큰이 넘는 긴 문서 읽기 | Haiku 5.5도 후보 | 이 구간에서는 단가 차이가 4배뿐이므로 품질과 시간까지 함께 비교 |
| Claude Code 서브에이전트(파일 탐색, 검색, 정해진 범위의 수정) | Haiku 5.5 | 설계 판단과 큰 수정은 메인 세션의 Sonnet 5.5에 맡김 |
| 테스트로 확인할 수 있는 코드 수정 | Haiku 5.5 먼저, 실패분만 Sonnet 5.5 | 재실행이 너무 잦아 시간이 문제가 되면 처음부터 Sonnet 5.5 |
| 여러 단계 에이전트 코딩, 터미널 작업 | Sonnet 5.5 | 더 길고 어려운 작업이면 Opus 5.5 |
| 여러 도구를 엮는 업무 자동화 | Sonnet 5.5 | — |
| 검색 없이 사실을 답해야 하는 질의 | Sonnet 5.5 | Haiku 5.5를 쓰려면 검색 도구나 근거 문서를 함께 제공 |

![대량 반복 작업은 Haiku 5.5, 테스트로 확인되는 작업은 Haiku 먼저, 에이전트 작업과 사실 질의는 Sonnet 5.5로 보내는 작업 유형별 모델 선택표](https://blog.laozhang.ai/posts/ko/claude-haiku-5-5-vs-sonnet-5-5/img/task-routing-map.webp)

이 구분은 Anthropic의 공식 안내와도 맞습니다. 발표 글은 "Terminal-Bench 4.0이 재는 것 같은 복잡한 에이전트 코딩에는 Sonnet 5.5와 Opus 5.5가 여전히 더 나은 선택"이고, Haiku 5.5는 "압축, 요약, 서브에이전트 작업처럼 범위가 좁은 작업"에 맞는다고 씁니다. [모델 선택 문서](https://platform.claude.com/docs/en/about-claude/models/choosing-a-model)는 많은 애플리케이션에서 Haiku 5.5로 구현을 시작하고 부족한 곳만 올리라고 권하면서, 모델을 바꾸기보다 effort를 조정하는 편이 나은 경우가 많다고 덧붙입니다. 품질이 모자랄 때 바로 Sonnet으로 가기 전에 Haiku의 effort를 한 단계 올려 보는 것이 첫 번째 시도입니다.

사양에서는 차이가 거의 없습니다. 두 모델 모두 컨텍스트 창은 100만 토큰, 최대 출력은 12만 8천 토큰(동기 Messages API 기준)이고, 텍스트와 이미지를 입력받으며, 지식 기준 시점(knowledge cutoff)도 2026년 6월로 같습니다. Haiku 5.5는 Haiku 계열 처음으로 적응형 사고(adaptive thinking)와 effort 5단계(`low`, `medium`, `high`, `xhigh`, `max`)를 지원하므로, 이 기능 때문에 Sonnet을 고를 이유는 없습니다. 차이는 가격과 성능, 그리고 아래에서 설명할 API 동작에 있습니다.

## Haiku 5.5 토큰 단가: Sonnet 5.5의 1/20, 10만 토큰 넘으면 1/4

Haiku 5.5는 프롬프트 길이에 따라 두 가지 가격을 적용합니다. Sonnet 5.5는 100만 토큰 창 전체를 표준 가격 하나로 받습니다. 아래는 [Claude API 가격 문서](https://platform.claude.com/docs/en/about-claude/pricing)의 2026년 10월 8일 기준 가격입니다(100만 토큰당 USD).

| 항목 | Haiku 5.5, 프롬프트 10만 토큰 이하 | Haiku 5.5, 프롬프트 10만 토큰 초과 | Sonnet 5.5 |
| --- | --- | --- | --- |
| 입력 | $0.10 | $0.50 | $2 |
| 캐시 쓰기(5분) | $0.125 | $0.625 | $2.50 |
| 캐시 쓰기(1시간) | $0.20 | $1 | $4 |
| 캐시 읽기 | $0.01 | $0.05 | $0.10 |
| 출력 | $0.50 | $2.50 | $10 |
| Batch API 입력 / 출력 | $0.05 / $0.25 | $0.25 / $1.25 | $1 / $5 |

이 표를 읽을 때 알아 둘 점이 세 가지 있습니다.

- **10만 토큰 초과 요금은 그 요청 전체에 붙습니다.** 가격표의 초과 구간 행에는 입력뿐 아니라 캐시와 출력 단가도 들어 있으므로, 프롬프트가 기준을 넘는 요청은 출력까지 높은 단가로 계산됩니다. 다만 캐시된 토큰이나 도구 정의가 10만 토큰 기준에 포함되는지는 공식 문서에 적혀 있지 않습니다. 예산은 캐시 읽기, 캐시 쓰기, 일반 입력을 모두 더한 입력 합계로 잡는 편이 안전합니다.
- **Sonnet 5.5 캐시 읽기는 10월 7일에 $0.20에서 $0.10으로 내렸습니다.** Anthropic은 이 인하로 대부분의 에이전트 작업에서 Sonnet 5.5 비용이 약 20% 줄어든다고 설명합니다.
- **"75% 저렴", "90% 저렴"은 Haiku 4.5와 비교한 수치입니다.** 발표 글에 따르면 Haiku 5.5는 평균적으로 Haiku 4.5보다 약 75% 싸고, 10만 토큰 이하 요청은 90%, 초과 요청은 50% 쌉니다. Sonnet 5.5와 비교한 수치가 아닙니다.

두 모델의 토큰 수 자체는 같은 기준으로 셀 수 있습니다. [Haiku 5.5 변경 사항 문서](https://platform.claude.com/docs/en/models/haiku-5-5/whats-new-haiku-5-5)는 Haiku 5.5가 Claude 4.7 이후 모델과 같은 새 토크나이저를 쓴다고 밝히고, Sonnet 5.5도 그 이후 모델이므로 같은 텍스트는 두 모델에서 사실상 같은 토큰 수가 된다고 보는 것이 합리적입니다. 그래서 토큰 단가를 그대로 비교해도 됩니다. Haiku 4.5에서 넘어오는 경우에는 같은 텍스트가 약 30% 더 많은 토큰으로 계산되므로 기존 예산을 다시 세어야 합니다.

## 작업 1건 비용 계산: 요청 단위와 캐시를 쓰는 에이전트 턴

요청 1건의 비용은 토큰 종류별로 `토큰 수 × 100만 토큰당 단가 ÷ 1,000,000`을 계산해 더하면 됩니다. 출력 토큰에는 사고(thinking) 토큰도 포함되며, 사고 내용이 응답에 표시되지 않아도 과금됩니다. 아래 예시는 캐시가 없는 요청은 입력과 출력만, 캐시를 쓰는 턴은 캐시 읽기·새 입력·출력을 더한 값이며, 두 모델이 같은 수의 토큰을 쓴다고 가정했습니다.

| 예시(요청 1건) | Haiku 5.5 | Sonnet 5.5 | 차이 |
| --- | --- | --- | --- |
| 입력 1만 + 출력 1천 | $0.0015 | $0.030 | 20배 |
| 입력 9만 9천 + 출력 2천 | $0.0109 | $0.218 | 20배 |
| 입력 15만 + 출력 2천(Haiku 초과 구간) | $0.080 | $0.32 | 4배 |
| 분류 100만 건(건당 입력 2천 + 출력 300) | $350 | $7,000 | 20배 |
| 에이전트 1턴: 캐시 읽기 9만 + 새 입력 5천 + 출력 2천 | $0.0024 | $0.039 | 약 16배 |
| 같은 턴에서 캐시 읽기가 11만으로 늘어난 경우 | $0.013 | $0.041 | 약 3.2배 |

몇 가지를 직접 따라가 보면 이렇습니다.

- 15만 토큰 요청에서 Haiku 5.5는 `150,000 × $0.50 + 2,000 × $2.50`을 100만으로 나눈 $0.080이고, Sonnet 5.5는 `150,000 × $2 + 2,000 × $10`을 나눈 $0.32입니다.
- 캐시를 쓰는 에이전트 턴에서 Sonnet 5.5는 `90,000 × $0.10 + 5,000 × $2 + 2,000 × $10`을 나눈 $0.039입니다. 캐시 읽기가 $0.20이던 10월 7일 전에는 같은 턴이 $0.048이었으므로 18.75% 줄었습니다.
- 마지막 행은 입력 합계가 11만 5천 토큰이 되어 Haiku 5.5에 초과 구간 가격이 붙는다고 보고 계산했습니다(`110,000 × $0.05 + 5,000 × $0.50 + 2,000 × $2.50`). 캐시가 쌓이면서 프롬프트가 10만 토큰을 넘는 순간, 16배였던 차이가 3배 남짓으로 줄어듭니다.

첫 턴의 캐시 쓰기 비용은 표에서 뺐습니다. 실제 서비스라면 API 응답의 사용량 필드에서 입력·캐시·출력 토큰을 모아 같은 식에 넣으면 됩니다.

이 계산에는 한계가 하나 있습니다. 같은 작업이라도 모델과 effort에 따라 출력 토큰 수가 크게 달라집니다. Artificial Analysis 지수를 `max` effort로 돌렸을 때 Haiku 5.5는 4억 4천만 토큰, Sonnet 5.5는 4억 2천만 토큰을 생성했습니다([Artificial Analysis의 Haiku 5.5 페이지](https://artificialanalysis.ai/models/claude-haiku-5-5) 기준). 토큰 단가 차이가 곧 작업당 비용 차이는 아니라는 뜻이고, 그래서 다음 비교가 필요합니다.

## 같은 성능 점수면 Haiku 5.5가 4배 싸고 2.3배 느림

Artificial Analysis(AA)는 두 모델을 각각 effort 5단계로 측정해 공개했습니다([AA의 Haiku 5.5 vs Sonnet 5.5 비교 페이지](https://artificialanalysis.ai/models/releases/comparisons/claude-haiku-5-5-vs-claude-sonnet-5-5), 2026년 10월 8일 기준). 아래는 Intelligence Index v4.3.2 점수순으로 정리한 값입니다.

| 모델과 effort | 지수 | 지수 작업 1건 비용 | 출력 속도(토큰/초) | 작업 1건 시간(초) |
| --- | --- | --- | --- | --- |
| Sonnet 5.5 `max` | 56 | $5.46 | 136 | 921 |
| Sonnet 5.5 `xhigh` | 52 | $2.01 | 107 | 431 |
| Sonnet 5.5 `high` | 47 | $0.88 | 104 | 217 |
| Haiku 5.5 `max` | 43 | $0.21 | 243 | 423 |
| Sonnet 5.5 `medium` | 41 | $0.48 | 102 | 126 |
| Haiku 5.5 `xhigh` | 41 | $0.12 | 188 | 291 |
| Haiku 5.5 `high` | 38 | $0.08 | 173 | 194 |
| Sonnet 5.5 `low` | 36 | $0.35 | 101 | 90 |
| Haiku 5.5 `medium` | 34 | $0.05 | 137 | 134 |
| Haiku 5.5 `low` | 29 | $0.02 | 181 | 62 |

이 표에서 판단에 쓸 수 있는 것은 세 가지입니다.

1. **같은 effort로 비교하면** `medium`과 `low`에서 모두 Sonnet 5.5가 7점 높고, 비용은 `medium`에서 약 9.6배($0.48 ÷ $0.05), `low`에서 약 17.5배($0.35 ÷ $0.02)입니다.
2. **같은 점수 41점으로 맞추면** Haiku 5.5 `xhigh`가 $0.12, Sonnet 5.5 `medium`이 $0.48로 Haiku가 4배 저렴합니다. 대신 작업 1건에 291초 대 126초로 약 2.3배 오래 걸립니다. Haiku 5.5 `max`(43점, $0.21)는 Sonnet 5.5 `medium`보다 점수가 높고 비용은 절반이 안 되지만, 시간은 423초로 약 3.4배입니다.
3. **43점보다 높은 품질이 필요하면** 선택지는 Sonnet 5.5뿐입니다. Haiku 5.5는 effort를 끝까지 올려도 Sonnet 5.5 `high`(47점)에 닿지 않습니다.

속도도 조심해서 읽어야 합니다. Haiku 5.5는 출력 속도(초당 토큰)가 더 빠르지만, 첫 토큰이 나오기까지의 시간은 `low`에서 11.99초로 Sonnet 5.5 `low`의 1.05초보다 깁니다(`medium` 12.63초 대 2.05초). 답하기 전에 사고를 먼저 하기 때문입니다. 공식 모델 문서의 "Fastest" 표시는 상대적인 지연 등급이고, 실제 지연은 프롬프트 길이, 출력 길이, effort에 달려 있습니다. 채팅 화면처럼 첫 글자가 빨리 떠야 하는 서비스라면 첫 토큰 시간을 따로 측정하세요.

AA 측정의 조건도 함께 기억해 둘 필요가 있습니다. Sonnet 5.5 실행에는 "with fallback"이라는 표시가 붙어 있는데 그 의미는 페이지에 설명되어 있지 않습니다. 또 AA는 Haiku 5.5 비용을 10만 토큰 이하 가격으로만 계산하므로, 긴 문서를 다루는 작업에서는 Haiku 쪽 비용이 실제보다 낮게 나왔을 수 있습니다. 지수는 10개 평가의 평균이라 작업별 차이를 가립니다.

## Haiku 5.5가 Sonnet 5.5에 근접한 작업, 크게 뒤지는 작업

평균 점수 뒤에 숨은 작업별 차이가 실제 선택을 바꿉니다. 아래는 AA가 공개한 세부 점수 가운데 두 모델의 `high` effort 값입니다.

| 평가 | 재는 것 | Sonnet 5.5 `high` | Haiku 5.5 `high` |
| --- | --- | --- | --- |
| AA-LCR v1.1 | 긴 문맥 읽기와 추론 | 78.0% | 77.3% |
| SciCode | 과학 계산 코딩 | 53.7% | 48.7% |
| Terminal-Bench 4.0 | 터미널에서 진행하는 에이전트 작업 | 43.9% | 21.7% |
| AutomationBench-AA | 업무 자동화 | 59.4% | 33.7% |
| AA-Omniscience | 지식 신뢰도(환각에 감점) | 21 | 6 |

긴 문맥 읽기는 거의 차이가 없고, `max`에서는 두 모델 모두 82.7%로 같습니다. 긴 문서에서 정보를 찾아 답하거나 추출하는 일은 Haiku 5.5로도 충분할 가능성이 큽니다. 다만 그런 작업은 프롬프트가 10만 토큰을 넘기 쉬워 단가 차이가 4배로 줄어든다는 점을 같이 계산해야 합니다.

반대로 업무 자동화와 지식 신뢰도는 차이가 큽니다. AutomationBench-AA는 모든 effort에서 Haiku 5.5가 Sonnet 5.5 `low`(49.4%)에도 못 미치고, AA-Omniscience는 Haiku 5.5가 `max`에서도 11점으로 Sonnet 5.5 `low`의 19점보다 낮습니다. 여러 도구를 엮는 자동화와, 모델이 기억만으로 사실을 답해야 하는 질의는 Sonnet 5.5에 두는 이유입니다. Haiku 5.5에 사실 질의를 맡겨야 한다면 검색 도구나 근거 문서를 주고, Anthropic의 [Haiku 5.5 프롬프트 가이드](https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-haiku-5-5)가 권하는 대로 시스템 프롬프트에 오늘 날짜를 넣으세요.

Anthropic 발표 글의 수치도 같은 방향입니다. Haiku 5.5 대 Sonnet 5.5로 GDPval-AA v2.1 1620 대 1840, OSWorld 2.1(오프라인 부분집합, 부분 점수) 72.4% 대 83.9%, Humanity's Last Exam 도구 없이 45.9% 대 56.9%, FrontierCode 1.1 46.4% 대 52.1%입니다. 이 표는 Anthropic이 직접 측정한 값이고, FrontierCode의 Sonnet 5.5가 `xhigh`라는 것 외에는 열마다 어떤 effort를 썼는지 밝히지 않았습니다.

## Haiku 먼저, 실패하면 Sonnet: Haiku 정답률 10%만 넘어도 싸지는 조건

모든 작업을 Haiku 5.5로 먼저 돌리고, 실패한 작업만 Sonnet 5.5로 다시 보내는 방식의 작업당 기대 비용은 다음과 같습니다.

`기대 비용 = Haiku 작업 비용 + (1 − p) × Sonnet 작업 비용`

여기서 p는 Haiku 5.5가 맞힌 작업의 비율입니다. 앞의 AA `medium` 비용(Haiku $0.05, Sonnet $0.48)을 넣으면 `0.05 + (1 − p) × 0.48`이고, p가 0.05 ÷ 0.48, 약 10%만 넘어도 처음부터 Sonnet 5.5만 쓰는 것보다 쌉니다.

| Haiku 5.5 정답률 p | 작업 1,000건 비용 |
| --- | --- |
| 50% | $290 |
| 70% | $194 |
| 90% | $98 |
| Sonnet 5.5만 사용 | $480 |

![Haiku 5.5 정답률 50%, 70%, 90%일 때 작업 1,000건 비용 $290, $194, $98을 Sonnet 5.5만 쓸 때의 $480과 비교하고 손익분기 약 10%를 표시한 막대그래프](https://blog.laozhang.ai/posts/ko/claude-haiku-5-5-vs-sonnet-5-5/img/escalation-break-even.webp)

손익분기가 이렇게 낮은 것은 AA `medium` 기준으로 Haiku 5.5 1건의 비용이 Sonnet 5.5의 10분의 1 수준이기 때문입니다. 하지만 이 계산이 성립하려면 조건이 있습니다.

- **실패를 자동으로 잡아낼 수 있어야 합니다.** 테스트, 타입 검사, 빌드, JSON 스키마 검증, 정해진 규칙 검사처럼 사람이 보지 않아도 실패가 드러나는 작업이어야 합니다. 그럴듯하지만 틀린 답이 검사를 통과하면 그 비용은 식에 나타나지 않고 나중에 버그나 잘못된 답변으로 돌아옵니다. 지식 신뢰도 점수 차이가 큰 만큼, 검증 수단이 없는 사실 질의에는 이 방식을 쓰지 않는 편이 낫습니다.
- **시간이 늘어납니다.** Sonnet 5.5로 넘어간 작업은 Haiku 5.5의 실행 시간만큼 늦게 끝납니다. 응답 시간이 중요한 서비스라면 정답률이 낮은 작업 유형은 처음부터 Sonnet 5.5로 보내는 규칙을 둡니다.
- **자기 숫자로 다시 계산하세요.** $0.05와 $0.48은 AA 지수 작업의 평균입니다. 자기 로그에서 두 모델의 작업당 비용과 Haiku 5.5의 통과율을 측정해 같은 식에 넣어야 실제 판단이 됩니다.

Haiku 5.5의 정답률을 올리는 방법도 문서에 나와 있습니다. 긴 에이전트 프롬프트를 `low`로 돌리면 일을 끝내기 전에 멈추는 경우가 있는데, Anthropic 테스트에서 `medium`으로 올리자 조기 종료가 대략 절반으로 줄었습니다(대신 시도당 출력 토큰은 두 배 이상 늘었습니다). `low`와 `medium`에서는 코드를 고쳐 놓고 검사 없이 완료라고 보고하는 경우가 있어, 프롬프트 가이드는 "실제 검사를 실행한 뒤에 완료라고 보고하라"는 시스템 프롬프트 문단을 제시합니다. 사고를 끈 상태에서 JSON 출력(structured outputs)을 요청하면 필요한 도구 호출을 건너뛸 수 있으므로, 그런 요청에는 적응형 사고를 켜 두는 것이 좋습니다.

## Sonnet 5.5와 Haiku 5.5를 오갈 때 깨지는 API 설정

모델 ID만 `claude-sonnet-5-5`에서 `claude-haiku-5-5`로 바꾸면 요청은 대부분 그대로 돌아가지만, 몇 가지 기본값과 허용 범위가 다릅니다. 실패한 작업을 Sonnet 5.5로 다시 보내는 구조라면 반대 방향도 함께 확인해야 합니다. 아래는 [Effort 문서](https://platform.claude.com/docs/en/build-with-claude/effort), Haiku 5.5 변경 사항 문서, [Sonnet 5.5 모델 문서](https://platform.claude.com/docs/en/models/sonnet-5-5/overview)를 기준으로 한 차이입니다.

| 항목 | Haiku 5.5 | Sonnet 5.5 | 할 일 |
| --- | --- | --- | --- |
| API 기본 effort | `medium` | `high` | 모델 ID만 바꾸면 effort도 한 단계 달라지므로 `output_config.effort`를 명시 |
| 사고 끄기 | `thinking: {"type": "disabled"}`, `high` 이하에서만 | `"disabled"` 대신 `thinking: {"type": "between_tools"}`, `low`~`high`에서만 | 모델별로 값을 나누고, `xhigh`·`max`에서는 둘 다 적응형 사고로 보내야 400 오류가 나지 않음 |
| 강제 도구 호출(`tool_choice`가 `any` 또는 특정 도구) | 허용, 응답이 thinking 블록 없이 도구 호출로 시작 | 오류 | Sonnet 5.5로 다시 보내는 요청에서는 `auto`로 바꾸고 언제 도구를 쓸지 프롬프트에 적기 |
| `temperature`, `top_p`, `top_k`를 기본값이 아닌 값으로 | 400 오류 | 400 오류 | 요청에서 제거 |
| 응답 블록 순서 | thinking 블록으로 시작할 수 있음 | 도구 호출 사이의 텍스트가 thinking 블록으로 돌아옴 | 첫 블록을 답으로 읽지 말고 `type`으로 골라내기 |
| thinking 블록 재사용 | 만든 계정(또는 연결된 계정)에서만 동작 | 만든 모델과 대화에 묶임 | 다른 모델로 넘길 때는 대화 기록 대신 원래 작업 입력을 새로 보내기 |
| 안전 분류기 거절 | `stop_reason: "refusal"`, 서버 측 대체 처리 없음 | — | 클라이언트에서 거절 응답 처리 |

effort를 명시한 요청은 다음과 같은 모양입니다(Effort 문서의 요청 형식 기준).

```json
{
  "model": "claude-haiku-5-5",
  "max_tokens": 16000,
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "다음 문의를 환불, 배송, 기타 중 하나로 분류하세요: ..." }]
}
```

두 모델 모두 사고 토큰이 `max_tokens`에 포함됩니다. 사고 없이 돌던 시절에 맞춘 작은 `max_tokens`는 사고 블록만 나오고 답이 잘리는 원인이 되므로 여유를 둡니다. 대화 도중 상위 수준의 effort 값을 바꾸면 프롬프트 캐시가 무효화됩니다. 턴마다 effort를 바꾸려면 `mid-conversation-output-config-2026-07-01` 베타 헤더를 쓰는 메시지별 effort 변경을 쓰면 캐시가 유지되지만, Haiku 5.5의 `disabled`나 Sonnet 5.5의 `between_tools` 상태에서는 이 기능을 쓸 수 없습니다. Haiku 4.5에서 넘어오는 코드라면 `budget_tokens` 방식의 수동 사고 설정과 assistant 메시지 미리 채우기(prefill)가 오류를 낸다는 점도 확인하세요.

보안 작업에서는 거절 기준도 다릅니다. Anthropic은 Haiku 5.5의 사이버 보안 세이프가드가 Sonnet 5.5보다 더 넓은 범위의 방어 목적 작업을 허용하지만 침투 테스트는 여전히 막는다고 설명합니다. 소스 코드에서 취약점을 찾는 것 같은 방어 작업이 Sonnet 5.5에서 막혔다면 Haiku 5.5에서는 통과할 여지가 있습니다. 반대로 Haiku 5.5에서 거절된 요청을 그대로 다시 보내면 대개 다시 거절되고, 서버 측 대체 처리도 없습니다. 정당한 보안 업무가 막히는 조직은 Cyber Verification Program에 신청할 수 있습니다.

## Claude Code에서 Haiku 5.5 쓰기: /model, 서브에이전트, effort 기본값

[Claude Code 모델 설정 문서](https://code.claude.com/docs/en/model-config)에 따르면 Haiku 5.5는 Claude Code v2.1.293 이상에서 써야 합니다(`claude update`로 업그레이드). 세션 안에서는 `/model claude-haiku-5-5`, 시작할 때는 `claude --model claude-haiku-5-5`로 고릅니다.

- **별칭 `haiku`는 Anthropic API에서만 Haiku 5.5를 가리킵니다.** Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude Platform on AWS에서는 `haiku`가 Haiku 4.5로, `sonnet`이 Sonnet 4.5나 4.6으로 연결됩니다. 이런 환경에서는 전체 모델 ID를 쓰거나 `ANTHROPIC_DEFAULT_HAIKU_MODEL`을 지정하세요. 이 변수는 Claude Code의 백그라운드 기능에 쓰는 모델도 함께 바꿉니다.
- **Claude Code의 기본 effort는 Haiku 5.5, Sonnet 5.5 모두 `medium`입니다.** API에서 Sonnet 5.5 기본값이 `high`인 것과 다르므로, API에서 비교한 결과를 Claude Code에 그대로 옮기면 조건이 어긋납니다. effort는 `/effort`나 `/model` 화면의 슬라이더로 바꿉니다.
- **두 모델 모두 Claude Code에서는 사고를 끌 수 없습니다.** `MAX_THINKING_TOKENS=0` 같은 설정은 이 모델들에 적용되지 않습니다.
- **Sonnet 5.5로 주 작업을 하고 서브에이전트만 Haiku 5.5로 돌릴 수 있습니다.** `CLAUDE_CODE_SUBAGENT_MODEL=haiku`를 설정하면 모델이 따로 지정되지 않은 서브에이전트가 Haiku를 씁니다. 서브에이전트 정의 파일의 `model` 필드가 있으면 그쪽이 우선하고, 같은 파일의 `effort` 필드로 서브에이전트별 effort도 정할 수 있습니다.

API 키로 과금되는 경우에는 비용 구조도 확인하세요. Claude Code에서 Haiku 5.5는 모든 요금제에서 100만 토큰 창으로 동작하고, 프롬프트가 10만 토큰을 넘는 요청은 더 높은 단가가 붙습니다. 긴 세션은 쌓인 컨텍스트만으로 10만 토큰을 넘기 쉬우므로, 그 구간에서는 Sonnet 5.5와의 단가 차이가 4배까지 줄어듭니다. Anthropic API에 직접 연결된 경우 `/model` 선택 화면에 모델별 가격이 표시됩니다. 종량제와 구독 중 무엇으로 Claude Code를 쓸지는 [Claude API와 Claude Code 차이](https://blog.laozhang.ai/ko/posts/claude-api-vs-claude-code)에서 따로 다룹니다.

## Claude 앱에서 Haiku 5.5를 고르면 사용량이 덜 줄어들까

Claude.ai에서는 Free, Pro, Max, Team, Enterprise 모든 요금제 사용자가 웹, iOS, Android에서 Haiku 5.5를 선택할 수 있고, Sonnet 5.5도 누구나 쓸 수 있습니다. 가벼운 질문이나 요약을 많이 한다면 Haiku 5.5로 바꿔 쓰는 것이 자연스러운 선택입니다.

사용량이 얼마나 덜 줄어드는지는 공개된 숫자가 없습니다. [Claude 고객센터의 사용량 안내](https://support.claude.com/en/articles/11647753-understanding-usage-and-length-limits)는 사용량이 대화 길이와 복잡도, 사용하는 기능, 대화 중인 모델, 선택한 effort에 따라 달라진다고만 밝히고, 모델별 비율이나 메시지 수는 제시하지 않습니다. 가벼운 모델이 한도를 더 천천히 쓴다고 볼 수는 있지만 "몇 배 더 쓸 수 있다"는 식의 수치는 근거가 없습니다. 요금제별 5시간·주간 한도의 구조는 [Claude 요금제별 사용량 한도](https://blog.laozhang.ai/ko/posts/claude-usage-limits-by-plan)에 정리되어 있습니다.

10월 7일 발표 이후 순차 적용 중인 Max·Team 요금제의 월간 API 크레딧(Max 5x $100, Max 20x $200, Team 최대 $500 공유)은 Claude Platform의 어떤 모델에도 쓸 수 있으므로, Haiku 5.5로 대량 작업을 돌리는 데에도 쓸 수 있습니다.

## Haiku 5.5와 Sonnet 5.5 선택에서 자주 걸리는 질문

### Haiku 5.5만으로 코딩해도 충분한가요?

범위가 정해진 수정, 파일 탐색, 테스트로 확인할 수 있는 작은 변경은 충분한 경우가 많습니다. 여러 파일에 걸친 설계 판단이나 터미널에서 여러 단계를 스스로 진행하는 작업은 Sonnet 5.5가 확실히 앞섭니다(Anthropic 측정 Terminal-Bench 4.0 39.2% 대 70.6%). Claude Code라면 주 세션은 Sonnet 5.5, 서브에이전트는 Haiku 5.5로 나누는 구성이 두 모델의 장점을 함께 씁니다.

### Sonnet 5.5로도 부족하면 어떤 모델을 봐야 하나요?

Sonnet 5.5를 `high`나 `xhigh`로 올려도 해결되지 않는 길고 어려운 작업은 Opus 5.5(100만 토큰당 입력 $4, 출력 $20)를 비교할 차례입니다. Opus 5.5와 Fable 5.1 사이의 선택은 [Claude Fable 5.1 vs Opus 5.5](https://blog.laozhang.ai/ko/posts/claude-fable-5-1-vs-opus-5-5)에서, Opus 5.5 비용 계산은 [Claude Opus 5.5 가격과 사용량 초기화권](https://blog.laozhang.ai/ko/posts/claude-opus-5-5-pricing-limit-reset)에서 볼 수 있습니다.

### Haiku 5.5가 Sonnet 5.5보다 응답이 빠른가요?

토큰을 생성하는 속도는 Haiku 5.5가 빠르지만, 첫 토큰이 나오기까지는 Sonnet 5.5가 더 빠를 수 있습니다. AA 측정에서 `low` effort 첫 토큰 시간은 Haiku 5.5 11.99초, Sonnet 5.5 1.05초였습니다. 또 같은 품질을 내려고 Haiku의 effort를 올리면 작업 1건에 걸리는 시간이 Sonnet보다 길어질 수 있습니다. 응답 속도가 핵심이라면 자기 프롬프트로 첫 토큰 시간과 전체 완료 시간을 함께 재 보세요.

## 참고 자료

이 글이 링크한 외부 페이지를 본문에 나온 순서대로 정리했습니다. 마지막 업데이트: 2026-10-08.

- [Claude API 가격 문서](https://platform.claude.com/docs/en/about-claude/pricing) (platform.claude.com)
- [Haiku 5.5 발표 글](https://www.anthropic.com/claude-haiku-5-5) (anthropic.com)
- [모델 선택 문서](https://platform.claude.com/docs/en/about-claude/models/choosing-a-model) (platform.claude.com)
- [Haiku 5.5 변경 사항 문서](https://platform.claude.com/docs/en/models/haiku-5-5/whats-new-haiku-5-5) (platform.claude.com)
- [Artificial Analysis의 Haiku 5.5 페이지](https://artificialanalysis.ai/models/claude-haiku-5-5) (artificialanalysis.ai)
- [AA의 Haiku 5.5 vs Sonnet 5.5 비교 페이지](https://artificialanalysis.ai/models/releases/comparisons/claude-haiku-5-5-vs-claude-sonnet-5-5) (artificialanalysis.ai)
- [Haiku 5.5 프롬프트 가이드](https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-haiku-5-5) (platform.claude.com)
- [Effort 문서](https://platform.claude.com/docs/en/build-with-claude/effort) (platform.claude.com)
- [Sonnet 5.5 모델 문서](https://platform.claude.com/docs/en/models/sonnet-5-5/overview) (platform.claude.com)
- [Claude Code 모델 설정 문서](https://code.claude.com/docs/en/model-config) (code.claude.com)
- [Claude 고객센터의 사용량 안내](https://support.claude.com/en/articles/11647753-understanding-usage-and-length-limits) (support.claude.com)
