Gemini 4 Argon·Opus 5.5·GPT-6.1 Sol 비교
Gemini 4 Argon은 2026년 10월 1일 기준 제한 공개라 호출할 수 없습니다. 지금 쓸 수 있는 Opus 5.5와 GPT-6.1 Sol 중 과제당 비용은 Sol이 가장 낮습니다.
목차

2026년 10월 1일 기준으로 세 모델 가운데 오늘 프로젝트에 붙일 수 있는 것은 Claude Opus 5.5와 GPT-6.1 Sol 둘뿐입니다. Gemini 4 Argon은 9월 30일(미국 시간)에 발표됐지만 Google의 Fairwind 프로그램에 속한 보안 방어 조직에만 제한 공개되고 있고, 일반 개발자용 모델 ID와 공개 날짜는 나오지 않았습니다. 검색어에 흔히 쓰이는 "GPT 6.1"은 OpenAI가 9월 29일에 내놓은 GPT-6.1 Sol을 가리킵니다.
가격은 두 층으로 나눠 봐야 합니다. 토큰 단가만 보면 Argon의 출시 초기 가격(입력 $2, 출력 $10)은 GPT-6.1 Sol과 같고 Opus 5.5의 절반입니다. 그런데 Artificial Analysis가 세 모델을 같은 추론 강도(effort) high로 돌린 결과에서는 점수가 53·54·50점으로 거의 붙어 있는 반면, 과제 하나를 끝내는 데 든 비용은 Argon $1.99, Opus $1.82, GPT-6.1 Sol $0.32였습니다. 단가가 같은 Argon과 Sol 사이에 6배 차이가 나고, 단가가 절반인 Argon이 Opus보다 오히려 조금 더 들었습니다.
그래서 지금 내릴 수 있는 결정은 이렇습니다. 기본 모델은 GPT-6.1 Sol로 두고, Sol이 실패하는 터미널·장기 코딩 작업에만 Opus 5.5를 시험합니다. Argon은 열리는 날 자기 작업으로 직접 재 볼 후보로 남겨 둡니다. 아래 수치는 모두 Google 발표와 제3자 측정에서 온 것이며, 누가 어떤 조건으로 잰 값인지 수치마다 함께 적습니다.
오늘 쓸 수 있는 모델과 아직 못 쓰는 모델
| Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol | |
|---|---|---|---|
| 발표·출시 | 2026-09-30 발표 | 2026-09-22 출시 | 2026-09-29 출시 |
| 일반 개발자 API | 없음 (제한 공개) | 사용 가능 | 사용 가능 |
| 모델 ID | 미공개 | claude-opus-5-5 | gpt-6.1-sol |
| 쓸 수 있는 곳 | Fairwind 프로그램 참여 조직 | Claude 앱(Pro·Max·Team·Enterprise), Claude Code, Claude API, AWS·Google Cloud·Azure | OpenAI API, ChatGPT Work와 Codex(Plus·Pro·Business·Enterprise·Edu) |
| 컨텍스트 / 최대 출력 | 발표문에 컨텍스트 수치 없음 / 출력 1M(Google 발표) | 1M / 128K | 1,050,000 / 128,000 |
Google의 발표문은 Argon이 "Fairwind 프로그램을 통해 신뢰할 수 있는 사이버 방어 조직에 배포되고 있다"고 쓰고, 개발자·기업·소비자에게는 "가능한 한 빨리" 열되 유료 API 고객과 Google AI Ultra 구독자부터 시작한다고만 밝혔습니다. 날짜, 모델 ID, 속도 제한, 컨텍스트 창 크기는 발표문에 없습니다. Gemini API 가격 페이지에도 2026년 10월 1일 기준으로 Gemini 3.8 Flash와 3.1 Pro Preview 등은 올라와 있지만 Argon이나 Gemini 4 항목은 없습니다. 가격 속보를 보고 "전환을 검토"하더라도, 지금은 전환할 엔드포인트 자체가 없는 상태입니다.
Fairwind는 Google이 보안 방어 조직을 대상으로 운영하는 프로그램입니다. 어떤 조직이 대상인지는 Gemini 3.8 Flash Cyber 신청 가이드: Fairwind 자격과 준비 조건에 정리돼 있는데, 이 가이드는 3.8 Flash Cyber를 기준으로 쓰인 것이어서 Argon 신청 절차로 그대로 읽을 수는 없습니다.
GPT-6.1 Sol에도 조건이 하나 있습니다. ChatGPT에서는 일반 채팅이 아니라 Work와 Codex에서만 제공되고 Free·Go 요금제는 제외되며, API에서 도구 호출을 쓰려면 Responses API여야 합니다. 이전 모델에서 옮겨 올 때 걸리는 지점은 GPT-6.1 Sol 가격과 사용법: 모델 ID만 바꾸면 안 되는 이유에서 다룹니다.
토큰 단가: Argon은 초기에만 Sol과 같고, 이후에는 Opus와 같습니다
1M 토큰당 정가입니다.
| 항목 | Argon 출시 초기 | Argon 초기 기간 이후 | GPT-6.1 Sol (입력 272K 이하) | GPT-6.1 Sol (272K 초과) | Opus 5.5 |
|---|---|---|---|---|---|
| 입력 | $2 | $4 | $2 | $4 | $4 |
| 캐시된 입력 | $0.10 (입력가의 95% 할인) | 미공개 | $0.10 | $0.20 | $0.20 |
| 출력 | $10 | $20 | $10 | $15 | $20 |
| 캐시 쓰기 | 미공개 | 미공개 | $2.50 | $5 | $5 (5분 캐시) |
| Batch 할인 | 미공개 | 미공개 | 50% | 50% | 50% |
Argon의 $2 / $10는 Google이 "출시 초기 가격(introductory price)"이라고 부른 값이고, 같은 발표문의 각주에 "초기 기간이 끝나면 입력 $4, 출력 $20가 적용된다"고 적혀 있습니다. 초기 기간이 언제 끝나는지, 95% 캐시 할인이 그 뒤에도 유지되는지, 캐시 쓰기 요금과 Batch 할인, 긴 프롬프트 구간이 따로 있는지는 공개되지 않았습니다. 초기 기간 이후의 캐시 가격을 $0.20로 적은 기사는 할인율이 유지된다는 가정 위에서 계산한 것입니다.
새 입력을 U, 캐시 읽기를 R, 출력(추론 토큰 포함)을 O라고 하고 단위를 100만 토큰으로 두면 요청 한 건의 비용은 다음과 같습니다.
- Argon 출시 초기: 2U + 0.10R + 10O
- GPT-6.1 Sol, 입력 272K 이하: 2U + 0.10R + 10O
- GPT-6.1 Sol, 입력 272K 초과: 4U + 0.20R + 15O
- Opus 5.5: 4U + 0.20R + 20O
- Argon 초기 기간 이후: 4U + 20O에 미공개 캐시 요금
새 입력 100K 토큰에 출력 20K 토큰인 요청을 넣어 보면 Argon 초기 가격은 0.1 × 2 + 0.02 × 10 = $0.40, GPT-6.1 Sol도 $0.40, Opus 5.5는 0.1 × 4 + 0.02 × 20 = $0.80, 초기 기간이 끝난 Argon도 $0.80입니다. 토큰 수가 같다는 전제에서는 "Argon은 Sol과 같고 Opus의 절반"이 맞지만, 이 관계에는 기한이 붙어 있습니다. 초기 기간이 끝나면 새 입력과 출력에서 Argon은 Opus와 같은 가격이 되고, 그때도 $2 / $10로 남는 것은 GPT-6.1 Sol의 272K 이하 요청뿐입니다. Sol 쪽도 입력이 272K를 넘으면 요청 전체가 높은 구간으로 계산된다는 점은 같이 봐야 합니다.
Opus와 Sol 두 모델 사이의 캐시·긴 요청 계산은 Claude Opus 5.5 vs GPT-6 Sol·6.1 Sol 비용에 더 자세히 있습니다.
작업당 비용: 단가가 같아도 6배 차이가 납니다
같은 토큰 수를 쓰는 모델은 없습니다. 같은 과제를 풀 때 추론과 출력에 토큰을 얼마나 쓰는지가 모델마다 다르고, 청구서는 단가가 아니라 단가에 토큰 수를 곱한 값으로 나옵니다. Artificial Analysis의 Intelligence Index v4.3.2는 10개 평가를 묶은 종합 지수이고, 과제 하나를 끝내는 데 든 평균 비용을 함께 공개합니다. 세 모델을 같은 high 단계로 맞춘 값은 다음과 같습니다.
| 모델 (추론 강도 high) | 지수 점수 | 과제당 비용 | 적용 단가 |
|---|---|---|---|
| Gemini 4 Argon | 53 | $1.99 | $2 / $10 (출시 초기 가격) |
| Claude Opus 5.5 | 54 | $1.82 | $4 / $20 |
| GPT-6.1 Sol | 50 | $0.32 | $2 / $10 |
출처는 Artificial Analysis이며 Argon은 2026년 10월 1일, Opus와 Sol은 9월 30일 기준 값입니다. 이 지수의 오차는 약 1점이어서 53점과 54점은 사실상 동점이고, 50점과 53점의 차이도 크지 않습니다.
이 표에서 읽을 수 있는 것은 세 가지입니다.
- Argon은 GPT-6.1 Sol의 6.2배가 듭니다. $1.99 ÷ $0.32입니다. 두 모델의 단가가 같으므로 이 차이는 전부 토큰 사용량에서 나옵니다. Argon이 지수 전체를 도는 데 쓴 출력 토큰은 1억 1천만 개였습니다.
- Argon은 Opus보다 조금 더 듭니다. 단가는 절반인데 과제당 비용은 $1.99 대 $1.82입니다. 토큰 단가로 계산한 "절반 가격"이 작업 단위에서는 사라집니다.
- 초기 기간이 끝나면 격차가 더 벌어집니다. 토큰 구성이 그대로이고 모든 토큰이 두 배 단가로 청구된다고 가정하면 Argon의 과제당 비용은 약 $4가 됩니다. 캐시 요금이 공개되지 않았으므로 추정치이지만, 방향은 분명합니다.
추론 강도를 바꾸면 선택지가 더 생깁니다. GPT-6.1 Sol을 max로 올리면 52점에 $0.72로, Argon high와 1점 차이이면서 비용은 36%입니다. Opus 5.5는 xhigh에서 56점에 $3.46, max에서 58점에 $5.98까지 올라갑니다. Argon은 high 한 단계만 공개돼 있어서 낮은 강도에서 얼마나 싸지는지, 높은 강도에서 얼마나 오르는지는 아직 알 수 없습니다.

"Opus 58점 대 Argon 53점"이라는 비교가 돌아다니는데, 이것은 Opus의 max와 Argon의 high를 맞댄 숫자입니다. 그 조합에서는 Opus의 과제당 비용이 $5.98로 Argon의 3배입니다. 점수 차이를 인용할 때는 어느 단계끼리의 비교인지와 그 단계의 비용을 같이 봐야 합니다.
한 가지 한계가 있습니다. 이 수치는 Artificial Analysis의 과제 묶음에서 나온 평균이지 실제 청구서가 아니고, 점수당 비용이 좋다는 것이 내 작업을 통과한다는 뜻도 아닙니다. 다만 "단가가 같으니 비용도 같다"는 추론이 성립하지 않는다는 것은 이 표만으로 충분히 확인됩니다.
Google 표의 수치와 제3자 측정은 따로 읽어야 합니다
Google 발표 표: Opus 5.5와는 14 대 4, GPT-6.1 Sol은 열이 없습니다
Google이 발표문에 실은 벤치마크 표의 비교 대상은 GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5입니다. GPT-6.1 Sol 열은 없으므로 이 표로는 Argon과 Sol을 비교할 수 없습니다. Opus 5.5와 점수가 함께 있는 18개 항목 가운데 Argon이 14개, Opus가 4개에서 앞섭니다. 차이가 큰 항목과 Opus가 앞선 항목만 추리면 다음과 같습니다(단위 %).
| 벤치마크 | Gemini 4 Argon | Claude Opus 5.5 | 앞선 쪽 |
|---|---|---|---|
| Vals Index | 68.9 | 67.0 | Argon |
| AutomationBench | 51.3 | 42.5 | Argon |
| Vals Finance Agent v2 | 65.4 | 58.6 | Argon |
| Harvey Legal Agent | 19.6 | 3.8 | Argon |
| DeepSWE v1.1 | 77.9 | 74.2 | Argon |
| LABBench 2 | 88.8 | 73.1 | Argon |
| GraphWalks 256k~1M | 84.2 | 66.8 | Argon |
| LVBench | 91.7 | 83.7 | Argon |
| FrontierSWE v2 | 55.0 | 62.3 | Opus |
| Terminal-bench 4.0 | 57.4 | 66.4 | Opus |
| PostTrainBench | 45.3 | 49.3 | Opus |
| Terminal-Bench Science 0.1 | 57.6 | 63.3 | Opus |
패턴은 비교적 뚜렷합니다. Argon은 금융·법률 같은 지식 업무, 긴 컨텍스트, 영상·차트 이해에서 앞서고, Opus 5.5는 터미널에서 오래 돌아가는 에이전트 코딩과 ML 후처리 학습, 과학 계산 터미널 작업에서 앞섭니다. 코딩 에이전트용 모델을 고르는 팀이라면 "14 대 4"보다 Opus가 앞선 4개 항목이 자기 작업과 얼마나 닮았는지가 더 중요합니다.
이 표는 Google이 직접 돌리거나 모은 수치이고 독립적으로 재현된 것이 아닙니다. Kingy AI는 Google의 평가 방법 문서를 읽고, 모델을 최고 추론 단계로 돌렸다는 점과 DeepSWE에 mini-swe 하네스를 썼다는 점, Terminal-Bench Science에서 검증 시간 제한이 6배였다는 점, LVBench에서 모델마다 영상 프레임 수가 달랐다는 점을 지적했습니다. 이는 Kingy AI의 해석이며, 표의 1~2점 차이를 순위로 받아들이기 전에 감안할 조건입니다.
프롬프트 인젝션 방어에 대해 Google은 Argon이 "선두"라고만 적었습니다. VentureBeat가 발표문의 Gray Swan 차트에서 옮긴 공격 성공률은 Argon 0.7%, Opus 5.5 1.0%이고, 여기에도 GPT-6.1 Sol의 값은 없습니다.
Vals와 Arena: 독립 측정에서 Argon이 1위이지만 조건을 봐야 합니다
Vals AI의 Vals Index는 금융·코딩·법률·세무 과제를 묶은 지수이고, 여기서 Argon은 41개 모델 중 1위입니다.
| 모델 | Vals Index | 테스트당 비용 |
|---|---|---|
| Gemini 4 Argon | 68.90% | $15.68 |
| Claude Sonnet 5.5 | 67.04% | $21.34 |
| Claude Opus 5.5 | 66.97% | $32.14 |
| GPT-6.1 Sol | 61.15% | $3.24 |
읽을 때 세 가지를 붙여야 합니다. 첫째, Vals는 Argon을 초기 가격이 아니라 $4 / $20로 계산했고 추론 강도는 high로 돌렸습니다. Kingy AI에 따르면 Opus와 Sonnet 행은 max 단계입니다. 둘째, Argon과 Opus의 차이는 약 2점이고 OrcaRouter가 리더보드에서 읽은 오차 범위는 ±0.9~1.0입니다. 셋째, GPT-6.1 Sol의 61.15%와 $3.24는 Vals 페이지가 아니라 Kingy AI가 Vals 리더보드에서 옮겨 적은 2차 수치입니다. 그 수치대로라면 Sol은 Argon보다 약 8점 낮고 테스트당 비용은 5분의 1 수준입니다.
Vals는 Argon의 약점도 함께 적었습니다. 컴퓨터 조작을 재는 CUA-bench에서는 4.83%로 8개 모델 중 7위였고, 긴 에이전트 과제에서 비용이 올라가 CUA-bench는 테스트당 $193.78, Code Migration은 $57.82였습니다. 지수 평균으로는 Claude 세 모델보다 싸지만, 오래 도는 작업 하나의 비용은 평균과 크게 다를 수 있습니다.
사람이 두 답변 중 나은 쪽을 고르는 Arena에서는 Kingy AI가 옮긴 9월 30일 텍스트 순위 기준으로 Argon high가 1,525점(±9, 4,942표)으로 1위, Opus 5.5 high가 1,504점(±10)입니다. GPT-6.1 Sol은 그 표에 없었습니다. Arena 점수는 선호 투표이지 과제를 맞혔는지를 재는 값이 아닙니다.
세 측정을 합치면 "Argon이 Opus 5.5보다 나은가"에 대한 답은 이렇게 정리됩니다. 지식 업무와 긴 컨텍스트에서는 Google 표와 Vals가 같은 방향으로 Argon의 우위를 보여 줍니다. 종합 지수에서는 같은 강도일 때 Opus와 동점입니다. 터미널 기반 코딩에서는 Google 자신의 표에서도 Opus가 앞섭니다. GPT-6.1 Sol은 어느 측정에서도 두 모델보다 몇 점 낮지만, 비용은 Argon의 5분의 1에서 6분의 1 수준입니다.
출력 1M 토큰은 답변 길이가 아니라 추론 여유입니다
Google은 Argon의 출력 토큰 한도를 기존 64K에서 "업계 최고 수준인 1M"으로 늘렸다고 발표했습니다. 발표문이 설명하는 용도는 모델이 "깊이 생각하고 한 번의 실행에서 수십만 토큰을 생성할" 여유입니다. 즉 추론 토큰을 포함한 상한이지, 눈에 보이는 답변이 100만 토큰까지 나온다는 약속은 아닙니다.
Vals AI의 모델 페이지에는 수치가 다르게 적혀 있습니다. 컨텍스트 창 1M, 최대 출력 262k입니다. Artificial Analysis도 컨텍스트 창을 1M으로 표기합니다. 1M은 Google이 발표한 상한이고 262k는 Vals가 평가에 쓴 엔드포인트의 값인데, 공개 API 문서가 아직 없어서 일반 개발자에게 어느 쪽이 적용될지는 정해지지 않았습니다. 긴 문서 생성이나 대규모 코드 변환을 Argon의 출력 한도에 맞춰 설계하는 것은 API 문서가 나온 뒤로 미루는 편이 안전합니다. 비교 기준으로 Opus 5.5와 GPT-6.1 Sol의 최대 출력은 각각 128K입니다.
출력 한도가 커지면 비용 구조도 달라집니다. 출력과 추론 토큰은 가장 비싼 항목이고, 앞에서 본 과제당 비용 차이가 바로 여기서 나옵니다. 한 번에 수십만 토큰을 쓰는 실행은 출시 초기 가격으로도 한 건에 몇 달러가 됩니다. 출력 500K 토큰이면 0.5 × $10 = $5이고, 초기 기간 이후에는 $10입니다.
지금 쓸 모델과 Argon이 열리면 시험할 것
이번 주에 정해야 한다면 선택지는 Opus 5.5와 GPT-6.1 Sol이고, 기준은 다음과 같습니다.
- 기본값은 GPT-6.1 Sol입니다. 같은 강도에서 종합 점수가 3~4점 낮은 대신 과제당 비용이 Opus의 약 6분의 1($0.32 대 $1.82)입니다. 대부분의 코딩·문서·분석 작업은 여기서 시작해 실패율을 재는 편이 비용 면에서 유리합니다.
- Opus 5.5는 Sol이 실패하는 작업에 씁니다. 터미널에서 오래 도는 에이전트 코딩, 대형 저장소 수정처럼 Google 표에서조차 Opus가 앞선 유형이 우선 후보입니다. 강도를 올릴수록 점수와 비용이 함께 올라가므로(high $1.82, max $5.98) 단계도 작업별로 정합니다. Claude 안에서 더 싼 대안을 찾는다면 Sonnet 5.5 vs Opus 5.5 차이: 작업당 비용과 선택 기준이 기준이 됩니다.
- Argon을 기다리느라 일정을 미룰 이유는 없습니다. 공개 날짜가 없고, 종합 지수에서는 지금 쓸 수 있는 Opus와 동점이며, 작업당 비용은 Sol의 6배입니다. 다만 금융·법률 문서 처리, 수십만 토큰 이상의 긴 컨텍스트, 영상 이해가 핵심인 제품이라면 Argon이 앞선 영역이므로, 모델 호출부를 교체하기 쉽게 만들어 두는 것이 실질적인 준비입니다.

Argon이 유료 API에 열리면 전환을 결정하기 전에 다음 순서로 확인합니다.
- 가격 페이지의 실제 조건. 초기 기간 종료일, 캐시 쓰기와 저장 요금, Batch 할인, 긴 프롬프트 구간. 예산은 $2 / $10가 아니라 $4 / $20 기준으로도 한 번 계산해 둡니다.
- API 문서의 출력 한도. 1M인지 262k인지, 추론 토큰이 한도와 청구에 어떻게 포함되는지.
- 자기 작업에서의 토큰 사용량. 지금 쓰는 모델에서 실패하거나 비싼 과제 20~30개를 골라 같은 입력으로 돌리고, 통과율과 함께 요청당 출력 토큰 수를 기록합니다. Argon의 비용은 단가가 아니라 이 숫자가 결정합니다.
- 추론 강도별 차이. high 이외의 단계가 제공되면 낮은 단계에서 통과율이 얼마나 유지되는지를 봅니다. 공개된 측정은 모두 high 하나뿐입니다.
- 오래 도는 과제의 건당 비용. Vals에서 테스트당 $193.78까지 올라간 유형이 있었으므로, 에이전트 작업에는 요청별 출력 토큰 상한이나 예산 한도를 걸고 시작합니다.
Sol 계열 안에서 어느 모델로 갈지는 GPT-6.1 Sol·Astra·GPT-6 Sol 비교와 전환 기준에서, 최상위 모델이 필요 없는 작업의 더 싼 선택지는 AI API 가격 비교: 5개사 등급별 요금과 가장 싼 모델에서 이어 볼 수 있습니다.





