Gemini 3.8 Flash와 Claude Fable 5.1 비교: 어떤 모델부터 시험할까
대량 작업은 Gemini 3.8 Flash부터, 가장 어려운 장시간 작업은 Claude Fable 5.1을 도전 모델로 시험하는 것이 합리적입니다. 단, 최종 선택은 동일한 작업의 성공률과 총비용으로 내려야 합니다.
목차

두 모델 중 하나를 당장 첫 시험 대상으로 골라야 한다면 Gemini 3.8 Flash를 기본 후보로 두고, Claude Fable 5.1은 어려운 작업을 위한 상향 전환 후보로 두는 방법이 예산을 통제하기 쉽습니다. Gemini의 현재 입력·출력 토큰 단가는 같은 토큰 수를 가정했을 때 Fable 5.1의 약 13분의 1입니다.
그러나 이 숫자만으로 승자가 정해지지는 않습니다. Fable 5.1이 실패와 재시도, 사람의 수정 시간을 크게 줄인다면 비싼 호출이 오히려 더 저렴한 완료 방식이 될 수 있습니다. 반대로 가격이 높다는 이유만으로 장시간 코딩이나 조사 작업을 더 잘 끝낸다고 가정해서도 안 됩니다. Google과 Anthropic이 같은 도구, 같은 추론 설정, 같은 예산과 합격 기준으로 두 모델을 직접 비교한 자료는 없습니다.
따라서 필요한 질문은 “어느 모델이 더 좋은가”가 아니라 다음 두 가지입니다. 어느 모델을 어떤 작업에 먼저 넣을 것인가, 그리고 무엇이 확인되면 다른 모델로 올리거나 되돌릴 것인가입니다.
이름이 비슷한 제한 모델부터 분리하세요
이 비교에서 사용하는 공개 API 모델 ID는 정확히 다음 두 개입니다.
gemini-3.8-flash
claude-fable-5-1Google은 Gemini 3.8 Flash 모델 문서에서 이 모델을 GA이자 Stable로 표시합니다. Anthropic은 Fable 5.1 개요에서 Claude Fable 5.1을 Active (latest)로 표시합니다. 둘 다 2026년 9월에 공개된 현재 모델이지만 제품 이름이 비슷한 제한 경로가 함께 발표되어 혼동하기 쉽습니다.
Gemini 3.8 Flash Cyber는 Fairwind Program에서 승인된 방어 조직을 위한 모델입니다. 일반 gemini-3.8-flash의 보안 옵션이나 별도 공개 요금제가 아닙니다. Claude Mythos 5.1도 Project Glasswing 참여자에게만 제공되는 제한 모델입니다. 이런 모델의 기능이나 접근 조건을 공개 Flash와 Fable 비교에 가져오면 실제로 호출할 수 없는 제품을 선택하게 됩니다.
공식 사양은 선택 범위를 알려 줄 뿐입니다
2026년 9월 4일 기준으로 공개 문서가 확인해 주는 차이는 다음과 같습니다.
| 항목 | Gemini 3.8 Flash | Claude Fable 5.1 |
|---|---|---|
| 입력 컨텍스트 | 1,048,576토큰 | 1M토큰 |
| 최대 출력 | 65,536토큰 | 128K토큰 |
| 입력 형식 | 텍스트, 이미지, 비디오, 오디오, PDF | 텍스트, 이미지 |
| 출력 형식 | 텍스트 | 텍스트 |
| 추론 설정 | low, medium, high; 기본 medium | adaptive thinking 항상 사용; low~max, 기본 high |
| 표준 입력/출력 가격 | 2026년 말까지 MTok당 $0.75/$3.75 | MTok당 $10/$50 |
Gemini는 비디오·오디오·PDF를 직접 입력으로 받는 작업에서 후보 수를 줄여 줍니다. 하지만 이미지나 오디오를 생성하거나 Live API를 지원하지는 않습니다. Fable은 텍스트 출력 상한이 더 높지만, 128K를 쓸 수 있다는 사실이 한 번에 긴 결과를 만드는 것이 항상 좋은 설계라는 뜻은 아닙니다. 대형 변경이나 보고서를 나눠 검증하는 편이 실패 복구에는 더 유리할 수 있습니다.
두 모델 모두 약 1M 입력 컨텍스트를 제공하므로 “컨텍스트가 더 길다”는 말만으로 선택하기 어렵습니다. 실제로는 긴 입력에서 필요한 내용을 찾아 쓰는지, 도구를 반복 호출할 때 목표를 유지하는지, 제한 시간 안에 끝나는지를 직접 확인해야 합니다.
같은 토큰을 넣으면 가격 차이는 명확합니다
Google의 Gemini API 가격표에 따르면 Gemini 3.8 Flash는 2026년 12월 31일까지 입력 $0.75/MTok, 출력 $3.75/MTok입니다. 2027년 1월 1일부터는 $1.50/$7.50으로 올라갑니다. Anthropic의 Claude 가격표는 Fable 5.1을 입력 $10/MTok, 출력 $50/MTok으로 제시합니다.
예를 들어 한 번에 입력 80,000토큰과 출력 6,000토큰을 똑같이 사용한다고 가정하면 다음과 같습니다.
Gemini 3.8 Flash = 0.08 × $0.75 + 0.006 × $3.75 = $0.0825
Claude Fable 5.1 = 0.08 × $10 + 0.006 × $50 = $1.10현재 할인 가격에서는 정확히 약 13.33배 차이입니다. 2027년 Gemini 가격을 적용하면 약 6.67배가 됩니다. 이 계산은 요금표를 확인하는 데는 유용하지만, 모델 선택에는 절반짜리 답입니다. 두 모델의 tokenizer, 추론 토큰, 도구 호출 횟수, 출력 길이와 재시도 횟수는 같지 않습니다. Gemini도 복잡한 작업에서 더 많은 추론 단계와 도구 호출을 사용할 수 있다고 Google이 설명합니다.
캐시도 한 줄로 합치면 안 됩니다. Fable 5.1은 5분 캐시 쓰기 $12.50/MTok, 1시간 쓰기 $20/MTok, 캐시 읽기 $0.25/MTok입니다. Gemini는 캐시와 저장 비용 구조가 다릅니다. 정적 프롬프트가 얼마나 자주 재사용되고 언제 무효화되는지 모르면 캐시 단가만 비교해도 실제 청구액을 예측할 수 없습니다.
API 비용이 아니라 합격한 작업의 비용을 재세요
팀에서 모델마다 같은 평가표를 만들어야 합니다. 기본 식은 어렵지 않습니다.
합격한 작업 1건의 비용 =
(모든 시도의 모델 요금 + 도구 요금 + 실패 복구 비용 + 사람의 검토·수정 비용)
÷ 합격한 작업 수여기서 사람의 시간을 빼면 Fable의 잠재적 장점을 놓치고, 실패한 시도를 빼면 Gemini의 저렴한 호출을 과대평가할 수 있습니다. 반대로 “비싼 모델이 재시도를 줄일 것”이라고 측정 전에 가정하면 Fable을 편드는 평가가 됩니다.
테스트 과제는 데모용 질문보다 최근 실패 사례에서 뽑는 편이 낫습니다. 평범한 코드 변경, 여러 파일을 건드리는 수정, 큰 문서 묶음, 여러 도구를 쓰는 작업, 오래 실행되는 조사와 위험도가 높은 작업을 나눠 넣으세요. 과제마다 허용 도구, 최대 시간, 최대 시도 수, 자동 실패 조건, 사람이 승인할 수 있는 결과를 실행 전에 고정합니다.
그리고 각 실행에서 다음 값을 남깁니다.
- 정확한 모델 ID와 추론 수준
- 입력·출력·캐시 토큰과 별도 기능 요금
- 처음부터 끝까지 걸린 시간과 도구 호출 수
- 첫 시도 통과, 재시도 후 통과, 최종 실패
- 사람이 검토하고 수정한 시간
- 오류 종류와 되돌리기 여부
Gemini의 기본값은 medium, Fable의 기본값은 high입니다. 이 두 값을 마치 같은 계산량처럼 취급할 수는 없습니다. 먼저 각 모델의 기본 설정으로 실제 도입 비용을 보고, 다음에 동일한 합격 기준을 만족하는 가장 저렴한 설정을 찾으세요. 인터넷의 Gemini high와 Fable medium 점수를 가져와 전체 능력 순위로 바꾸는 것보다 훨씬 유용합니다.

Gemini를 일상 기본 모델로 시험하기 좋은 경우
처리량이 크고 작업 한 건의 가치가 낮거나, 텍스트 외에 PDF·오디오·비디오 입력이 필요하거나, 분류·추출·1차 코드 검토가 대부분이라면 Gemini부터 시험하기 좋습니다. 낮은 호출 단가 덕분에 더 넓은 실제 표본을 모을 수 있고, 실패한 어려운 작업만 별도 경로로 보낼 수 있습니다.
Gemini 3.8 Flash는 함수 호출, 코드 실행, 파일 검색, 구조화 출력, URL context, Search와 Maps grounding을 지원합니다. computer use는 Preview입니다. thinking_level은 low, medium, high만 허용하며 minimal은 오류를 냅니다. 3.7에서 옮길 계획이라면 Gemini 3.8 Flash 마이그레이션 안내에서 호환 필드와 되돌리기 절차를 따로 확인하는 편이 안전합니다.
다만 이름에 Flash가 들어간다고 p95 지연 시간이 자동으로 더 짧다고 결론 내리면 안 됩니다. 입력 크기, 추론 수준, 도구 대기, 출력 길이를 포함한 자사 환경의 시간을 재야 합니다.
Fable을 올려 쓸 조건은 좁고 명확해야 합니다
Anthropic은 Fable 5.1을 가장 어려운 추론과 장시간 에이전트 작업에 두면서도, 대부분의 작업은 Opus 5부터 시작하라고 안내합니다. Fable은 “최신이므로 기본”이 아니라 기존 모델이 높은 effort에서도 합격하지 못하는 작업을 위한 선택입니다.
따라서 다음과 같은 표본에서 먼저 가치를 증명하게 하세요. 긴 시간 동안 목표를 유지해야 하는 다단계 코딩, 한 번의 잘못된 도구 실행이 큰 손실로 이어지는 작업, 사람의 검토 시간이 API 요금보다 비싼 분석, 또는 65,536토큰보다 긴 단일 출력이 실제로 필요한 작업입니다. 성공률이나 수정 시간이 개선되지 않으면 비싼 모델을 유지할 이유가 없습니다.
통합 제약도 시험 전에 확인해야 합니다. Fable 5.1의 adaptive thinking은 끌 수 없고 수동 budget_tokens를 받지 않습니다. tool_choice의 any나 특정 tool을 강제하면 HTTP 400이 발생합니다. auto와 none은 사용할 수 있지만, 도구 입력 형식을 보장하려면 strict tool use나 structured output을 별도로 설계해야 합니다. 이전 Claude 모델은 Fable 5.1이 만든 thinking block을 그대로 이어받지 못하며, 앞선 메시지나 system, 도구 배열을 수정하면 이후 thinking block이 무효가 될 수 있습니다. 자세한 내용은 Anthropic의 Fable 5.1 마이그레이션 문서에서 확인할 수 있습니다.
Claude 계열 안에서 Opus와 Fable의 캐시 비용까지 판단해야 한다면 Fable 5.1과 Opus 5 비용 비교가 더 직접적인 다음 자료입니다.
배포 결정은 기본·상향·되돌리기 세 줄이면 됩니다
평가가 끝나면 긴 보고서보다 세 가지 규칙을 코드와 운영 문서에 남기세요.
- 평범한 작업을 맡길 기본 모델과 그 추론 설정
- 위험도, 실패 유형, 작업 시간 또는 예상 가치에 따라 다른 모델로 올릴 조건
- 성공률, p95 지연 시간, 합격한 작업당 비용 또는 사람의 수정 시간이 기준을 벗어날 때 되돌릴 조건

예를 들어 Gemini를 기본으로 쓰고 첫 실패나 고위험 표본을 Fable에 보내는 정책은 합리적인 출발점입니다. Fable이 특정 작업군에서 총비용을 낮추거나 Gemini가 반복해서 내는 치명적 오류를 해결했을 때만 그 작업군의 트래픽을 늘립니다. 결과가 반대라면 순서를 바꾸면 됩니다. 중요한 것은 브랜드 충성도가 아니라 언제든 되돌릴 수 있는 기준입니다.
마지막으로 민감한 데이터를 다룬다면 모델 성능과 별도로 보존 정책을 확인해야 합니다. Anthropic은 현재 Fable 5.1을 Covered Model로 분류하고 Claude API의 기본 보존 기간을 30일로 설명합니다. zero-data-retention은 명시적으로 승인된 계약이 필요합니다. 가격과 Gemini의 할인 기간도 바뀌므로, 2027년 전환 전에는 같은 계산표로 다시 비교하세요.
이렇게 하면 결론은 단순해집니다. 싼 모델을 무조건 쓰거나 비싼 모델을 막연히 신뢰하지 않습니다. Gemini로 넓은 작업을 저렴하게 확인하고, Fable이 어려운 실패 사례에서 실제로 값을 하는지 측정한 뒤, 통과한 작업의 비용이 더 낮은 쪽에 그 작업만 맡기면 됩니다.





