소넷 5.5 vs GPT-6 Astra: 추론 강도별 성능과 작업당 비용
소넷 5.5가 Astra를 앞선 결과는 둘 다 max로 돌린 AA 지수 56 대 53이고, 그 설정의 작업당 비용은 소넷이 약 2.3배입니다. low~high에서는 Astra 점수가 높습니다.
목차

"Claude Sonnet 5.5(소넷 5.5)가 GPT-6 Astra를 넘었다"는 말은 한 가지 설정에서만 맞습니다. 2026년 9월 29일 기준 Artificial Analysis(AA)의 지능 지수에서 두 모델을 모두 추론 강도(effort) max로 돌렸을 때 소넷 5.5가 56점, Astra가 53점입니다. 그런데 바로 그 설정에서 AA 지수 작업 하나를 푸는 비용은 소넷 5.5가 $7.60, Astra가 $3.26로 소넷 쪽이 약 2.3배 비쌉니다. 같은 effort 이름끼리 놓으면 low부터 high까지는 Astra 점수가 더 높고 xhigh에서는 52점으로 같습니다.
토큰 단가는 반대입니다. 소넷 5.5는 100만 토큰당 입력 $2, 출력 $10으로 Astra(입력 $10, 출력 $50)의 5분의 1이고, 입력이 272K 토큰을 넘으면 Astra에만 요청 전체 할증이 붙어 차이가 더 벌어집니다. 하지만 AA 측정에서 소넷 5.5 max는 Astra max보다 출력 토큰을 약 7배 썼습니다. 단가가 5분의 1이어도 토큰을 5배 넘게 쓰면 작업 비용은 역전됩니다(입력 272K 이하 요청 기준).
그래서 판단 기준은 "어느 모델이 이겼나"가 아니라 통과한 작업당 비용입니다. 재시도와 실패한 시도까지 포함한 전체 청구 금액을, 미리 정한 합격 기준을 통과한 작업 수로 나눈 값으로, 내 작업에서 쓸 만한 결과 하나를 얻는 데 실제로 얼마가 드는지를 보여 줍니다.
| 지금 상황 | 먼저 할 일 | 근거 |
|---|---|---|
Astra를 low~high로 쓰고 결과에 만족 | Astra 유지, 소넷 5.5는 한 단계 높은 effort로만 시험 | 같은 effort 이름이면 AA 점수는 Astra가 4~10점 높음 |
| 입력이 자주 272K 토큰을 넘는 긴 문서·코드베이스 작업 | 소넷 5.5 시험 우선 | 같은 토큰 수라면 단가 차가 5배에서 약 9.4배로 커짐 |
| 과학 연구형 터미널 작업, 장애 대응(SRE), 알고리즘 문제 | Astra 유지 | Vals에서 Astra가 17~27포인트 앞선 영역 |
| 법률 리서치, 세무·금융 에이전트 같은 문서 업무 | 소넷 5.5 시험 가치 있음 | Vals에서 소넷이 앞섰지만 비용과 소요 시간은 대체로 더 큼 |
| 첫 응답이 빨라야 하는 대화형 서비스 | 소넷 5.5 low/medium 시험 | AA low 기준 첫 답변 토큰까지 소넷 0.92초, Astra 2.42초 |
| "같은 $2/$10 가격대에서 누가 나은가"가 궁금함 | 비교 상대를 GPT-6 Sol로 바꿈 | Sol이 소넷 5.5와 같은 단가이고 Anthropic 발표 표도 Sol과 비교 |
아래 수치는 공식 가격표와 AA, Vals AI의 공개 측정이며, 조건은 각 수치 옆에 있습니다. 두 회사가 각자 발표한 벤치마크 표는 측정 환경이 달라 서로 이어 붙여 비교할 수 없습니다.
"Astra 추월"은 어떤 설정의 결과인가
AA 지능 지수 v4.3.2는 터미널 작업, 지식 업무, 과학 추론 등 10개 평가를 묶은 점수입니다. 두 모델 모두 effort를 low, medium, high, xhigh, max 다섯 단계로 받기 때문에 AA는 단계마다 따로 측정했습니다. 2026년 9월 29일 기준 결과는 다음과 같습니다. 작업당 비용은 AA 지수 작업 하나에 들어간 입력·캐시·추론·답변 토큰을 각 모델의 정가로 계산한 가중 평균입니다.
| 추론 강도 | 소넷 5.5 점수 | 소넷 5.5 작업당 비용 | Astra 점수 | Astra 작업당 비용 | 점수 차 |
|---|---|---|---|---|---|
low | 36 | $0.41 | 46 | $0.82 | Astra +10 |
medium | 41 | $0.59 | 50 | $1.54 | Astra +9 |
high | 47 | $1.08 | 51 | $1.73 | Astra +4 |
xhigh | 52 | $2.74 | 52 | $2.31 | 동점 |
max | 56 | $7.60 | 53 | $3.26 | 소넷 +3 |
출처: Artificial Analysis 모델 릴리스 페이지, 2026년 9월 29일 기준. 소넷 5.5는 출시 전 배포본으로 평가됐고, Anthropic은 그 배포본에 구조화 출력(structured outputs) 요청의 품질을 떨어뜨리는 버그가 있었다고 밝혔습니다. AA는 해당 평가를 다시 돌릴 예정이라 숫자는 바뀔 수 있습니다.

이 표에서 읽을 수 있는 것은 세 가지입니다.
첫째, 헤드라인의 56 대 53은 표의 맨 아랫줄입니다. 소넷 5.5 max는 AA 전체 순위에서 Opus 5.5 max(58점) 다음인 2위이지만, 작업당 비용은 Astra max의 약 2.3배($7.60 ÷ $3.26)입니다. AA는 소넷 5.5 max가 지수 작업 하나에 출력 토큰을 약 19만 3천 개 썼고, 이는 지금까지 측정한 모델 중 가장 많으며 Astra max의 약 7배라고 설명합니다.
둘째, 비슷한 점수를 얻는 비용은 Astra가 낮은 구간이 있습니다. Astra low(46점, $0.82)는 소넷 5.5 high(47점, $1.08)와 점수가 비슷하면서 더 쌉니다. xhigh에서도 둘 다 52점인데 Astra가 $2.31, 소넷이 $2.74입니다. AA도 소넷 5.5가 "지능 대비 작업당 비용" 효율선 밖에 있고, 낮은 effort에서는 같은 성능을 더 싸게 내는 Astra나 GPT-6 Sol 설정이 있다고 정리했습니다.
셋째, 소넷 5.5가 확실히 싼 구간은 low와 medium인데, 그 구간은 점수도 낮습니다. 작업이 쉬워 low로도 합격한다면 소넷 5.5 low의 $0.41은 매력적이지만, 합격률이 떨어져 재시도가 늘면 이 차이는 줄어듭니다.
effort 이름이 같아도 같은 계산량은 아닙니다
두 회사의 high는 서로 맞춰 둔 단계가 아닙니다. 같은 이름끼리 비교하는 것은 읽기 편한 기준일 뿐이고, 실제로는 "비슷한 점수를 얻는 데 얼마가 드나"를 함께 봐야 합니다. 기본값도 다릅니다.
- 소넷 5.5는 API 기본값이
high이고, Claude 앱과 Claude Code의 기본값은medium입니다. AA 표로 보면 앱과 Claude Code에서 아무 설정 없이 쓰는 소넷 5.5는 41점 구간, API 기본값은 47점 구간입니다. - Astra의 기본 effort는 OpenAI 문서에 나와 있지 않습니다. Astra는
none을 받지 않으며(400 오류), Responses API에는 effort와 별개로reasoning.mode를pro로 두는 추론 모드가 있어 토큰 사용량이 더 늘어납니다.
그래서 "API로 기본값끼리 비교했더니"라는 말도 조건이 분명하지 않습니다. 비교할 때는 두 모델의 effort를 항상 명시합니다.
속도는 지표마다 방향이 다릅니다
AA의 low 측정에서 첫 답변 토큰까지 걸린 시간은 소넷 5.5가 0.92초, Astra가 2.42초였고, 출력 속도도 소넷 5.5가 초당 85~139토큰으로 Astra(초당 51~63토큰)보다 빨랐습니다. 반면 긴 작업을 끝까지 마치는 시간은 토큰을 많이 쓰는 쪽이 불리합니다. Vals AI 종합 지수를 끝내는 데 소넷 5.5는 1시간 10분, Astra는 25분 11초가 걸렸습니다. 짧은 대화형 응답과 긴 에이전트 작업에서 체감 속도가 반대로 나올 수 있다는 뜻입니다.
Vals AI 측정: 13개 대 6개, 하지만 큰 격차는 Astra 쪽
Vals AI는 두 모델을 모두 max로 놓고 19개 공통 벤치마크를 비교했습니다(2026년 9월 29일 기준). 소넷 5.5가 13개, Astra가 6개에서 높았습니다. 다만 Vals는 표준오차 ±1 범위가 19개 중 9개에서 겹치며, 이 비교는 쌍별 통계적 유의성 검정이 아니라고 적고 있습니다.
| 영역 | 벤치마크 | 소넷 5.5 | Astra | 차이 |
|---|---|---|---|---|
| 종합 | Vals Index | 69.22% | 66.61% | 소넷 +2.61 |
| 과학 연구형 터미널 작업 | Terminal-Bench Science | 38.57% | 65.71% | Astra +27.14 |
| 장애 대응 | SRE Bench | 30.15% (대체 응답 제외 시 19.08%) | 56.87% | Astra +26.72 |
| 알고리즘 | IOI | 83.06% | 100.00% | Astra +16.94 |
| 터미널 에이전트 | Terminal-Bench 4.0 | 53.03% | 57.07% | Astra +4.04 |
| 보안 | CyberBench v1.1 | 59.58% (소넷 5 대체 응답 제외 시 41.97%) | 41.07% | 소넷 +18.51, 대체 응답 제외 시 +0.90 |
| 세무 | Tax Agent Bench | 73.39% | 63.34% | 소넷 +10.06 |
| 법률 리서치 | Legal Research Bench | 48.08% | 39.42% | 소넷 +8.65 |
| 금융 | Finance Agent (v2) | 58.10% | 53.54% | 소넷 +4.56 |
소넷 5.5가 이긴 항목은 수가 많지만 대부분 차이가 10포인트 안팎이고, Astra가 이긴 항목은 격차가 큽니다. 비용과 시간도 함께 봐야 합니다. Vals Index 전체 비용은 소넷 5.5 $20.80, Astra $19.09로 비슷했지만, 소넷이 앞선 Legal Research Bench에서도 비용은 $14.83 대 $10.58, 소요 시간은 1시간 33분 대 24분 51초로 소넷이 더 들었습니다. Tax Agent Bench도 $9.25 대 $5.80입니다. 소넷이 점수에서 앞서는 문서 업무라도 "더 싸고 빠르다"는 결론은 따라오지 않습니다.
Vals 측정에서 소넷 5.5는 서버 측 대체 응답(fallback)을 켜 둔 상태여서, 소넷 5.5가 거절한 작업 일부를 소넷 5가 대신 풀었습니다. 이렇게 넘어간 작업을 실패로 처리하면 숫자가 달라집니다. Vals Index는 69.22%에서 68.89%로 조금 내려가는 데 그치지만, CyberBench는 116개 작업 중 54개가 소넷 5로 넘어가 59.58%가 41.97%로 떨어집니다. Astra의 41.07%와 거의 같은 수준이라, CyberBench에서 소넷 5.5가 앞선 결과는 대부분 소넷 5의 대리 답변 덕분입니다. SRE Bench도 262개 중 126개가 넘어가 30.15%가 19.08%로 내려갑니다.
Terminal-Bench 4.0은 측정 기관마다 방향이 반대라는 점도 기억해 둘 만합니다. AA에서는 소넷 5.5 max가 64%로 Astra xhigh의 60%보다 높았고, Vals에서는 Astra가 57.07%로 소넷의 53.03%보다 높았습니다. 이 항목 하나로 "터미널 작업은 누가 낫다"고 단정할 근거는 없습니다.
발표 자료의 숫자를 나란히 놓으면 안 되는 이유
Anthropic의 소넷 5.5 발표 페이지에는 Astra가 없습니다. 비교 대상은 소넷 5, Opus 5.5, GPT-6 Sol이고, GPT-6 Sol 점수가 공개되지 않은 일부 항목에는 GPT-5.6 Sol을 넣었습니다. OpenAI의 Astra 발표 페이지에도 소넷 5.5 열은 없습니다.
그래서 Anthropic이 발표한 Terminal-Bench 4.0 70.6%(소넷 5.5)와 OpenAI가 발표한 57.9%(Astra max)를 한 표에 놓으면 서로 다른 측정 환경의 숫자를 섞게 됩니다. 같은 벤치마크를 한 기관이 두 모델에 돌린 AA와 Vals조차 결과가 64% 대 60%, 53.03% 대 57.07%로 엇갈립니다. OSWorld도 두 회사가 쓴 버전이 2.1과 2.0으로 다릅니다.
Anthropic의 "30% 이상 빠르고, 대부분의 작업에서 최대 30% 저렴하다"는 문구는 Astra가 아니라 이전 모델인 소넷 5와 비교한 것입니다. 이마저도 AA에서는 소넷 5.5 max의 작업당 비용이 소넷 5 max보다 약 50% 높게 나와, effort와 작업 종류에 따라 달라지는 주장으로 읽는 편이 맞습니다.
토큰 단가: 5배에서 9배 이상까지
2026년 9월 29일 기준 공식 가격표(표준 처리, 100만 토큰당 USD)입니다.
| 항목 | Claude Sonnet 5.5 | GPT-6 Astra (입력 272K 이하) | GPT-6 Astra (입력 272K 초과) |
|---|---|---|---|
| 새 입력 | $2 | $10 | $20 |
| 캐시 읽기 | $0.20 | $1 | $2 |
| 캐시 쓰기 | $2.50 (5분), $4 (1시간) | $12.50 | $25 |
| 출력 (추론 토큰 포함) | $10 | $50 | $75 |
| Batch | 절반 ($1 / $5) | 절반 | 절반 |
| 기타 | 1M 컨텍스트 전체에서 장문 할증 없음, 미국 한정 추론 1.1배 | Flex 절반, Fast 모드 2배, 데이터 레지던시 +10% | 할증은 요청 전체에 적용 |
Astra의 272K 규칙은 초과분이 아니라 요청 전체를 비싼 단가로 계산합니다. 입력은 2배, 출력은 1.5배가 됩니다. 소넷 5.5는 Anthropic 가격표에 "90만 토큰 요청도 9천 토큰 요청과 같은 단가"라고 적혀 있을 만큼 할증이 없습니다. 그래서 단가 비율은 짧은 요청에서 5배, 272K를 넘는 요청에서는 입력 10배, 출력 7.5배가 됩니다.
청구 토큰 수가 같다고 가정하고 캐시 없이 계산하면 이렇습니다.
| 요청 | 소넷 5.5 | Astra | 차이 |
|---|---|---|---|
| A. 입력 10만 + 출력 2만 | 0.1 × $2 + 0.02 × $10 = $0.40 | 0.1 × $10 + 0.02 × $50 = $2.00 | 5배 |
| B. 입력 30만 + 출력 2만 | 0.3 × $2 + 0.02 × $10 = $0.80 | 0.3 × $20 + 0.02 × $75 = $7.50 | 약 9.4배 |
이 계산은 청구서가 아니라 단가 비교입니다. 실제 작업에서는 두 모델의 토크나이저가 달라 같은 텍스트도 토큰 수가 다르고, 추론 토큰과 재시도 횟수도 모델마다 다릅니다. 앞의 AA 측정처럼 소넷 5.5가 같은 작업에 출력 토큰을 약 7배 쓰면, 272K 이하 요청에서는 5배 단가 차이를 넘어서기 때문에 Astra가 더 싸집니다. 거꾸로 말하면 272K 이하 요청에서 입력과 출력 비율이 비슷하다면, 소넷 5.5의 청구 토큰이 Astra의 5배 미만일 때 소넷이 싸고 5배를 넘으면 Astra가 쌉니다. Astra 쪽 요청이 272K를 넘으면 이 손익분기점이 7.5~10배로 올라가 소넷 5.5에 유리해집니다.

Astra 쪽의 캐시, Batch, Flex, Fast 모드 계산은 GPT-6 Astra API 가격: 272K 기준과 캐시·서비스 티어 계산법에, 소넷 등급 청구서를 사용량과 맞춰 보는 방법은 Claude Sonnet 5 가격 인상 취소: 현재 API 요금과 청구 금액 확인법에 정리되어 있습니다. 소넷 5.5는 소넷 5와 단가가 같습니다.
같은 가격에서 비교하려면 상대는 GPT-6 Sol입니다
"$2/$10짜리 모델 중 누가 나은가"가 진짜 질문이라면 OpenAI 쪽 상대는 Astra가 아니라 GPT-6 Sol입니다. GPT-6 Sol의 272K 이하 단가는 입력 $2, 캐시 읽기 $0.20, 캐시 쓰기 $2.50, 출력 $10으로 소넷 5.5 기본 단가와 똑같습니다. 차이는 272K를 넘을 때 Sol에만 $4 / $0.40 / $5 / $15 장문 요금이 붙는다는 점입니다.
Anthropic 발표 표가 비교한 대상도 이 GPT-6 Sol입니다. Anthropic은 FrontierCode에서 기본값인 high effort의 소넷 5.5가 GPT-6 Sol의 최고 점수와 같은 결과를 작업당 비용 약 5분의 1로 냈다고 발표했습니다(제조사 주장). AA는 소넷 5.5 high가 GPT-6 Sol보다 지능 점수에서 아주 조금 뒤지고 작업당 비용은 사실상 같다고 봤습니다. "Sol"만 적힌 자료를 볼 때는 GPT-6 Sol인지 GPT-5.6 Sol인지 먼저 확인해야 합니다.
OpenAI 모델끼리 고르는 기준은 GPT-6 Sol·Luna·Astra와 Terra 비교: 모델 ID, API 요금, 선택 기준에, 한 단계 위 등급의 교차 비교는 Claude Opus 5.5 vs GPT-6 Sol: 작업당 비용 비교에 있습니다.
작업 유형별로 어떻게 나눠 쓸까
위 측정을 작업 단위의 규칙으로 옮기면 다음과 같습니다. 모두 "먼저 무엇을 시험할지"에 대한 출발점이고, 최종 결정은 아래 테스트 결과로 합니다.
Astra를 유지하는 편이 나은 경우
- 지금 Astra를
low~high로 쓰고 결과에 만족한다면, 소넷 5.5로 같은 effort를 그대로 옮기면 AA 기준으로 점수가 4~10점 떨어집니다. 교체를 시험하려면 소넷 5.5를 한 단계 높여서 비교하고, 그만큼 늘어난 토큰까지 계산에 넣습니다. - 과학 연구 워크플로를 터미널에서 수행하는 작업, 운영 장애 대응, 경시 수준의 알고리즘 문제는 Vals에서 Astra가 17~27포인트 앞섰습니다.
- 수십 분 이상 도는 긴 에이전트 작업에서 완료 시간이 중요하다면 Astra가 유리합니다. 소넷 5.5
max의 토큰 사용량은 시간과 비용을 함께 늘립니다. - Responses API의 hosted shell, 이미지 생성, code interpreter, apply patch 같은 OpenAI 쪽 도구에 워크플로가 묶여 있다면 모델을 바꿀 때 그 도구를 Claude 쪽 도구나 직접 구현으로 대신해야 합니다.
소넷 5.5를 먼저 시험해 볼 경우
- 입력이 272K를 자주 넘는 긴 문서 분석이나 대형 코드베이스 질의. 같은 토큰 수 기준 단가 차가 약 9.4배까지 벌어집니다.
- 이미 Claude Code나 Claude API 전용 기능(1시간 캐시, advisor 도구 등)을 중심으로 돌아가는 팀.
- 법률 리서치, 세무, 금융 에이전트처럼 Vals에서 소넷 5.5가 앞선 문서 업무. 다만 비용과 소요 시간은 더 들 수 있으니 합격률 개선이 그 비용을 상쇄하는지 봐야 합니다.
- 첫 응답 지연이 중요한 대화형 기능.
low나medium에서 합격 기준을 넘는다면 가장 싼 선택이 될 수 있습니다.
나눠 쓰는 경우
짧고 판정이 쉬운 작업(분류, 요약, 정해진 형식의 변환)은 소넷 5.5 low~medium으로 보내고, 실패하거나 어려운 작업만 Astra로 올리는 구성이 가능합니다. 두 모델 모두 Amazon Bedrock에 있어서(Astra는 us-west-2) 계정 관리는 한곳으로 모을 수 있지만, API 형태 차이는 그대로 남습니다.
보안 연구를 한다면 CyberBench 점수만 보고 소넷 5.5를 고르지 않는 편이 좋습니다. Vals CyberBench의 우위는 앞에서 본 것처럼 소넷 5 대체 응답을 빼면 사라지고, Claude 앱에서도 사이버 보안이나 경쟁 AI 모델 개발(frontier LLM) 관련 내용으로 판단되면 대화가 소넷 5로 전환될 수 있습니다. API에서는 stop_reason: "refusal"과 stop_details 분류로 거절이 돌아오며, 서버 측 대체 응답을 켜면 "cyber"와 "frontier_llm" 거절만 소넷 5로 다시 시도합니다.
최고 점수 자체가 목표라면 AA에서 소넷 5.5 max보다 높은 모델은 Opus 5.5 max(58점)입니다. Claude 안에서 상위 모델을 고르는 기준은 Claude Fable 5.1 vs Opus 5.5: 코딩·업무용으로 무엇을 선택할까?를 참고하세요.
구독으로 쓰는 경우
API 단가는 구독 사용량으로 환산되지 않습니다. 2026년 9월 29일 기준 ChatGPT에서는 Astra 기반 GPT-6 Pro를 Pro $100, Pro $200, Business, Enterprise 요금제의 채팅에서 쓸 수 있고, Plus는 채팅이 아니라 ChatGPT Work와 Codex에서만 Astra를 씁니다. Free와 Go에는 Astra가 없습니다. Codex의 Astra 사용량은 5시간당 추정 메시지 수(예: Plus 5~45회)로 안내되며 고정 한도가 아닙니다.
소넷 5.5는 Claude 웹·모바일·데스크톱 앱과 Claude Code에서 선택할 수 있고 앱 기본 effort는 medium입니다. 어느 Claude 요금제에 포함되는지는 공식 페이지에 나와 있지 않습니다. 구독으로 쓴다면 비교 기준은 단가가 아니라 같은 요금으로 몇 번의 합격 결과를 얻느냐입니다.
Astra에서 소넷 5.5로 옮기기 전에 확인할 것
Astra에서 소넷 5.5로 가는 것은 모델명만 바꾸는 일이 아니라 회사가 다른 API로 옮기는 일입니다. 코드와 화면에서 달라지는 점은 다음과 같습니다.
API 형태와 파라미터
- OpenAI Responses/Chat Completions에서 Anthropic Messages API로 바뀝니다. 도구 정의 형식, 응답 블록 구조, 사용량 필드 이름이 모두 다릅니다. Astra는 도구 호출에 Responses API가 필요했습니다.
- effort는 OpenAI의
reasoning.effort(Chat Completions는reasoning_effort) 대신 Anthropic의output_config.effort로 지정합니다. 두 척도는 서로 보정되어 있지 않으므로 값을 그대로 옮기지 말고 다시 맞춥니다. temperature,top_p,top_k에 기본값이 아닌 값을 보내면 소넷 5.5는 400 오류를 냅니다. Astra도 effort가none이 아니면temperature와top_p를 받지 않는데 Astra에는none이 없으므로, Astra용 코드에는 보통 이 값이 이미 없습니다.- 마지막 assistant 턴을 미리 채워 두는 프리필(prefill)은 400 오류입니다. 형식을 맞추려던 프리필이라면 구조화 출력이나 지시문으로 대신합니다.
- 특정 도구 호출을 강제하는
tool_choice(any,tool)는 400 오류입니다.auto를 유지하고 도구 정의에strict: true를 넣거나, 프롬프트에 어떤 경우에 그 도구를 쓰는지 적습니다.
응답과 대화 기록
- 도구 호출 사이에 모델이 쓰는 한두 문장 이상의 메모가
text가 아니라thinking블록으로 옵니다. 기본값display: "omitted"에서는 그 내용이 비어 있어서, 이 메모를 사용자에게 보여 주던 화면이 오류 없이 조용해집니다.display를"summarized"로 바꾸거나(베타"updates"도 있음), 앞단 사고를 끄는thinking: {"type": "between_tools"}를 쓰면 텍스트가 돌아옵니다. between_tools는low,medium,high에서만 됩니다.xhigh나max에서 보내면 400 오류입니다.- 소넷 5.5의 thinking 블록은 만든 모델, 대화, 계정에 묶입니다. 2026년 8월 31일 이후 만든 계정에서는 이전 기록(system, tools, 이전 메시지)을 수정한 뒤 블록을 다시 보내면 기본적으로 400 오류가 납니다. 대화 기록은 뒤에 덧붙이기만 하고, 지시를 바꿀 때는 대화 중간 system 메시지를 씁니다.
캐시
- Anthropic은 캐시 쓰기를 5분($2.50)과 1시간($4) 중에서 명시적으로 지정하고, 소넷 5.5에서 캐시할 수 있는 최소 프롬프트 길이는 512토큰입니다. Astra는
prompt_cache_options.ttl을"30m"으로 두는 방식이라 캐시 설계를 다시 해야 합니다.
거절 처리
- 소넷 5.5의 거절은 HTTP 200에
stop_reason: "refusal"로 옵니다. 오류 코드만 보는 재시도 로직이라면 이 경우를 따로 처리해야 합니다.
소넷 5에서 올라오는 경우의 호환성 깨짐
소넷 5 코드를 소넷 5.5로 올리면서 Astra와 비교하는 경우라면, Anthropic이 공식적으로 밝힌 호환성 깨짐 다섯 가지를 먼저 처리해야 비교가 성립합니다.
thinking: {"type": "disabled"}와 수동budget_tokens는 400 오류입니다.between_tools로 바꿉니다(high이하).- 강제 도구 호출(
tool_choice의any,tool)은 400 오류입니다.auto와strict: true로 바꿉니다. - thinking 블록이 모델과 대화에 묶여, 이전 기록을 수정한 뒤 다시 보내면 400 오류가 날 수 있습니다.
- Claude API와 Google Cloud에서는
computer_20251124컴퓨터 사용 도구를 받지 않습니다.computer_toolset_20260801로 옮깁니다. - advisor 도구에서 Opus 4.8, Opus 4.7, 소넷 5를 조언자로 쓰면 400 오류입니다.
소넷 5.5는 effort 단계도 다시 보정되어 있어서 소넷 5에서 쓰던 effort 설정을 그대로 가져오면 사고량이 달라집니다. Anthropic은 일반 작업은 high, 명확히 정의된 에이전트 코딩은 medium부터 시작하라고 안내합니다.
Anthropic API에 직접 붙을지, 지원 클라우드나 호환 게이트웨이를 거칠지는 Claude 안정 접속은 어떻게 골라야 하나: Anthropic 직결, 지원 클라우드, 아니면 laozhang.ai 호환 게이트웨이?에서 따로 다룹니다. Astra를 처음 연결하는 과정은 GPT-6 Astra API 사용 방법: 프로젝트 권한 확인부터 첫 응답까지를 보세요.
통과한 작업당 비용을 재는 작은 테스트
공개 벤치마크는 방향을 알려 줄 뿐 내 작업의 답은 아닙니다. 트래픽을 옮기기 전에 다음 순서로 작게 재 보면 됩니다.
- 실제 업무에서 작업 20~50개를 고르고, 각 작업의 합격 기준(테스트 통과, 검토자 승인, 정답 일치 등)을 먼저 적습니다.
- 두 모델에 같은 입력과 같은 도구를 주고, effort 조합을 명시합니다. 예를 들어 소넷 5.5
high대 Astramedium과high로 한 번, 그다음 각각 한 단계씩 올려 한 번 더 돌립니다. - 요청마다 청구 사용량을 기록합니다. 새 입력, 캐시 읽기, 캐시 쓰기, 출력(추론 토큰 포함), 재시도 횟수, 전체 소요 시간, 사람이 손본 시간까지 남깁니다. Anthropic 응답은
usage의input_tokens,cache_read_input_tokens,cache_creation_input_tokens,output_tokens로 나뉩니다. OpenAI Responses의usage.input_tokens는 캐시 적중분(input_tokens_details.cached_tokens)을 포함하고,output_tokens는 추론 토큰을 포함합니다. 캐시 쓰기 토큰은 청구 대시보드와 대조해 확인합니다. - 통과한 작업당 비용 = 전체 청구 금액 ÷ 합격한 작업 수로 계산합니다. 실패한 작업과 재시도 비용도 분자에 넣습니다.
- 소넷 5.5가 Astra와 같은 합격 기준을 넘고, 통과한 작업당 비용이나 소요 시간이 더 낮을 때만 옮깁니다.
아래 코드는 2026년 9월 29일 기준 표준 단가와 Astra의 272K 규칙을 반영한 계산기입니다. 캐시 쓰기는 소넷 5.5의 5분 캐시 단가로 넣었습니다.
# 2026년 9월 29일 기준 표준 처리 단가 (USD / 100만 토큰)
PRICES = {
"claude-sonnet-5-5": {"input": 2.00, "cache_read": 0.20, "cache_write": 2.50, "output": 10.00},
"gpt-6-astra": {"input": 10.00, "cache_read": 1.00, "cache_write": 12.50, "output": 50.00},
}
# Astra: 입력 합계가 272K를 넘으면 요청 전체에 장문 단가 적용
ASTRA_LONG = {"input": 20.00, "cache_read": 2.00, "cache_write": 25.00, "output": 75.00}
def request_cost(model, fresh, cache_read, cache_write, output):
"""토큰 수는 청구 사용량에서 가져오고, output에는 추론 토큰을 포함합니다."""
rate = PRICES[model]
if model == "gpt-6-astra" and fresh + cache_read + cache_write > 272_000:
rate = ASTRA_LONG
return (
fresh * rate["input"]
+ cache_read * rate["cache_read"]
+ cache_write * rate["cache_write"]
+ output * rate["output"]
) / 1_000_000
def cost_per_accepted_task(tasks):
"""tasks: [{"requests": [(model, fresh, cache_read, cache_write, output), ...], "accepted": bool}]
재시도와 실패한 작업의 비용도 모두 합산합니다."""
total = sum(request_cost(*req) for task in tasks for req in task["requests"])
accepted = sum(1 for task in tasks if task["accepted"])
return total / accepted if accepted else float("inf")
# 앞의 예시 A와 B 확인
print(request_cost("claude-sonnet-5-5", 100_000, 0, 0, 20_000)) # 0.4
print(request_cost("gpt-6-astra", 100_000, 0, 0, 20_000)) # 2.0
print(request_cost("gpt-6-astra", 300_000, 0, 0, 20_000)) # 7.5Batch나 Flex로 돌린다면 두 모델 모두 단가를 절반으로, Astra Fast 모드라면 2배로 바꿔 넣습니다. 결과가 나오면 표로 정리해 두세요. AA와 Vals 수치는 재측정으로 바뀔 수 있지만, 내 작업으로 잰 통과한 작업당 비용은 다음 모델이 나왔을 때도 같은 방식으로 다시 잴 수 있는 기준이 됩니다.
자주 묻는 질문
소넷 5.5가 GPT-6 Astra보다 5배 싼가요?
토큰 단가는 입력 272K 이하 요청에서 5배, 272K를 넘으면 입력 10배와 출력 7.5배 차이입니다. 하지만 작업 비용은 쓰는 토큰 수에 달려 있습니다. AA 측정에서 두 모델 모두 max일 때 소넷 5.5의 작업당 비용은 $7.60로 Astra $3.26의 약 2.3배였습니다. low와 medium에서는 소넷 5.5가 더 쌌지만 점수도 낮았습니다.
Claude Code에서 쓰는 소넷 5.5는 AA 표의 어느 줄에 해당하나요?
Claude Code와 Claude 앱의 기본 effort는 medium이라 AA 표의 41점 줄입니다. API 기본값은 high(47점)입니다. 헤드라인의 56점은 max로 따로 설정했을 때의 점수입니다.
Astra를 쓰는 팀이 소넷 5.5로 바꾸면 비용이 줄어드나요?
272K를 자주 넘는 긴 입력이 많거나, 소넷 5.5가 낮은 effort에서도 합격 기준을 넘는 작업이라면 줄어들 가능성이 큽니다. 반대로 Astra와 같은 품질을 얻으려고 소넷 5.5를 xhigh나 max로 올려야 한다면 AA 기준으로는 오히려 비싸집니다. 작업 20~50개로 통과한 작업당 비용을 재 보고 결정하는 것이 가장 확실합니다.
같은 가격대에서 소넷 5.5와 비교할 OpenAI 모델은 무엇인가요?
GPT-6 Sol입니다. 272K 이하 단가가 입력 $2, 출력 $10으로 소넷 5.5와 같고, Anthropic 발표 표도 Sol과 비교합니다. Astra는 OpenAI의 최상위 모델로 단가가 5배입니다.





