본문으로 건너뛰기

Gemini API 모델 비교: 3.6 Flash·3.5 Flash-Lite·3.1 Pro 선택법

9 분 소요AI 개발

새 범용 프로젝트는 3.6 Flash, 비용 중심의 대량 처리는 3.5 Flash-Lite, 복잡한 추론과 도구 작업은 미리보기 변경 위험을 감수할 때 3.1 Pro Preview부터 검토하세요. 가격과 모델 수명은 배포 전에 다시 확인해야 합니다.

기본 선택, 비용 우선, 복잡한 작업에 맞춰 Gemini API 모델 ID를 고르는 의사결정 지도

2026년 8월 10일 현재 Gemini Developer API에서 새 범용 서비스를 시작한다면 gemini-3.6-flash를 첫 기본값으로 삼는 편이 합리적이다. 비용이 가장 중요한 분류·추출·대량 변환 작업은 gemini-3.5-flash-lite, 복잡한 추론이나 도구 사용은 변경 위험을 감수할 수 있을 때 gemini-3.1-pro-preview를 후보로 올리면 된다. 이는 독립 벤치마크로 정한 품질 순위가 아니라 모델 상태, 공개 단가, 컨텍스트 한도와 작업 성격을 묶은 출발점이다.

Google은 gemini-3.6-flashgemini-3.5-flash-lite를 2026년 7월 21일 공개된 프로덕션용 안정 버전(GA)으로 안내한다. 출시 상태는 Gemini API 변경 기록에서 확인할 수 있다. 반면 gemini-3.1-pro-preview는 정식 안정 버전이 아니어서 동작이나 제공 조건이 바뀌고 종료될 위험을 따로 관리해야 하는 미리보기 버전이며, 현재 상태와 한도는 Gemini 공식 모델 디렉터리에서 확인할 수 있다.

결론만 적용하지 말고 다음 순서로 결정하는 것이 안전하다.

  1. 정확한 모델 ID와 stable/preview 상태를 고정한다.
  2. 월간 입력·출력 token으로 예상 비용을 계산한다.
  3. 실제 서비스의 작은 대표 요청으로 출력 적합성과 실패 양상을 확인한다.
  4. 변경 기록과 종료 공지를 확인한 뒤 배포 기본값을 정한다.

안정성과 작업 복잡도에 따라 Gemini API 모델을 선택하고 3.5 Flash에서 3.6 Flash로 이동하는 지도

안정 버전을 우선하되, 비용이나 작업 복잡도가 기본값을 바꿀 만큼 중요한지 확인하는 선택 지도다.

비교표를 읽기 전에 알아야 할 세 가지

모델 이름 옆의 상태와 가격 숫자는 서로 다른 질문에 답한다. 이 차이를 먼저 이해해야 “더 비싼 모델이 무조건 낫다”거나 “stable이면 영구 지원된다”는 잘못된 결론을 피할 수 있다.

stable ID는 일반적으로 이름이 가리키는 모델이 바뀌지 않는 고정 식별자다. preview는 미리보기라서 변경될 수 있고, Google 정책상 최소 2주 전 공지 후 중단될 수 있다. latest 별칭은 stable, preview, experimental 모델 가운데 다른 대상으로 교체될 수 있으므로 재현 가능한 프로덕션 배포의 고정 버전처럼 쓰면 안 된다. 이 버전 차이는 Gemini 모델 버전 패턴 안내에 명시돼 있다.

여기서 가격은 Gemini Developer API의 Standard 유료 요금, 미화 기준 100만 token당 목록 가격이다. 출력 단가에는 모델이 내부 추론에 사용한 thinking tokens, 즉 추론 token도 포함된다. 이 과금 범위와 모델별 목록 단가는 Gemini Developer API 가격표에서 확인할 수 있다. 표의 숫자는 무료 등급이나 프로젝트별 요청 한도, Batch, Flex, Priority, context caching, Grounding, 세금, 지역 차이, 재시도와 후처리 비용을 포함한 총비용이 아니다. Vertex AI나 제3자 API 중계 서비스의 가격에도 그대로 적용할 수 없다.

또한 여기서 “멀티모달”은 텍스트뿐 아니라 이미지·영상·오디오·PDF를 입력으로 받을 수 있다는 뜻이다. 비교하는 세 범용 모델의 출력은 텍스트다. 이미지 생성, 오디오 생성, Live API는 전용 모델과 별도 사용 조건을 확인해야 하며, 같은 비교표에 섞어서는 안 된다. 현재 모델의 입력·출력 범위는 공식 모델 디렉터리에서 구분할 수 있다.

세 모델의 계약을 한눈에 비교하기

gemini-3.6-flash는 stable 모델이며 텍스트·이미지·영상·오디오·PDF를 입력받아 텍스트를 출력한다. 입력 한도는 1,048,576 token, 출력 한도는 65,536 token이다. 정확한 기능과 한도는 3.6 Flash 모델 페이지에 공개돼 있다.

gemini-3.5-flash-lite 역시 stable이고 같은 입력 형식과 텍스트 출력을 지원하며, 입력 1,048,576 token과 출력 65,536 token 한도를 갖는다. 이 계약은 3.5 Flash-Lite 모델 페이지에서 확인할 수 있다. 이름의 “Lite”만 보고 모든 요청에서 더 빠르거나 충분히 좋다고 단정할 수는 없다. 공식 사양은 실제 서비스의 지연 시간이나 결과 품질을 보장하는 독립 실측이 아니기 때문이다.

gemini-3.1-pro-preview는 preview이며 입력 1,048,576 token, 출력 65,536 token을 지원한다. bash 또는 custom-tool 중심 작업에는 gemini-3.1-pro-preview-customtools라는 별도 모델 ID가 있지만, 일반 Pro 호출을 무조건 대체하는 ID는 아니다. 두 ID의 현재 상태와 적용 범위는 Gemini 공식 모델 디렉터리에서 확인해야 한다.

정확한 모델 ID상태Standard 입력 / 100만 tokenStandard 출력 / 100만 token입력 / 출력 한도먼저 검토할 작업주된 위험
gemini-3.6-flashstable GA$1.50$7.501,048,576 / 65,536새 범용 앱, 코드, 함수 호출, 에이전트형 작업실제 품질·지연은 자체 요청으로 확인 필요
gemini-3.5-flash-litestable GA$0.30$2.501,048,576 / 65,536대량 분류, 추출, 간단한 변환, 비용 민감 처리어려운 지시에서 수정 비용이 커질 수 있음
gemini-3.1-pro-previewpreviewprompt 200k 이하 $2, 초과 $4prompt 200k 이하 $12, 초과 $181,048,576 / 65,536복잡한 추론, 난도 높은 코드·도구 작업 후보preview 변경·종료, 200k 경계의 단가 상승

표의 “먼저 검토할 작업”은 보편적인 성능 우승 선언이 아니다. 같은 모델도 프롬프트 길이, 도구 정의, 출력 형식, 안전 설정과 후처리 요구에 따라 실제 비용과 성공률이 달라진다. 따라서 표는 후보를 줄이는 데 쓰고, 최종 선택은 자신의 대표 요청으로 확정해야 한다.

작업에 맞춰 기본값을 바꾸는 기준

새 프로젝트는 3.6 Flash에서 시작한다

안정 버전이 필요하고 작업이 한 범주로 좁혀지지 않았다면 gemini-3.6-flash가 가장 단순한 출발점이다. 멀티모달 입력과 긴 컨텍스트를 쓰는 범용 애플리케이션의 기본 후보로 검토할 수 있고, 미리보기 모델의 변경·종료 위험을 기본값에 들이지 않아도 된다.

다만 “기본값”은 모든 요청을 3.6에 보내라는 뜻이 아니다. 다음 중 하나가 확인되면 일부 작업을 Flash-Lite로 낮추거나 Pro Preview로 올릴 근거가 생긴다.

  • 출력 형식이 단순하고 요청량이 커서 token 단가 차이가 월 비용을 크게 바꾼다.
  • 작은 모델에서 스키마 오류나 누락이 자주 발생해 재시도·후처리 비용이 절감액을 넘어선다.
  • 복잡한 도구 호출이나 긴 의사결정에서 대표 요청의 성공 기준을 반복해서 충족하지 못한다.
  • preview 변경을 감당할 수 있는 격리된 작업이며, Pro 후보가 실제 수정 횟수를 의미 있게 줄인다.

비용이 병목이면 3.5 Flash-Lite를 작은 작업부터 적용한다

gemini-3.5-flash-lite는 입력과 출력 단가가 모두 낮아 요청량이 큰 파이프라인에서 검토 가치가 크다. 특히 짧은 분류, 필드 추출, 정해진 형식으로의 변환처럼 성공 조건을 자동으로 검사할 수 있는 작업부터 적용하기 좋다.

반대로 결과를 사람이 길게 수정해야 하거나, 한 번의 누락이 후속 자동화를 망가뜨리는 작업이라면 token 가격만 비교하면 안 된다. 다음 식에 재시도와 수정 비용까지 더해야 실제 선택이 보인다.

월 비용 = 입력 token ÷ 1,000,000 × 입력 단가 + 출력 token ÷ 1,000,000 × 출력 단가

예를 들어 한 달에 입력 1,000만 token과 출력 200만 token을 쓰고 모든 요청이 Standard 조건이라면 다음과 같다.

  • 3.6 Flash: 10 × $1.50 + 2 × $7.50 = $30
  • 3.5 Flash-Lite: 10 × $0.30 + 2 × $2.50 = $8
  • 3.1 Pro Preview: 각 요청의 prompt가 200k 이하일 때 10 × $2 + 2 × $12 = $44

이 계산은 목록 가격만 비교한다. Flash-Lite에서 형식 오류 때문에 10%를 재호출하거나 사람이 결과를 고쳐야 한다면 그 비용도 포함해야 한다. 반대로 간단한 작업에서 결과 차이가 없다면 낮은 단가가 그대로 절감 효과가 된다.

입력 token과 출력 및 thinking tokens를 Standard 단가에 적용하고 Pro의 200k prompt 경계를 나누는 비용 계산 흐름도

출력 과금에는 thinking tokens가 포함된다. Pro Preview는 월간 합계가 아니라 각 요청의 prompt가 200k를 넘는지 먼저 나눠 계산해야 한다.

복잡한 작업은 Pro Preview의 이득과 수명 위험을 함께 본다

gemini-3.1-pro-preview는 복잡한 추론이나 도구 사용에서 확인할 후보지만, 이름에 Pro가 있다는 이유만으로 전체 트래픽을 옮길 근거는 되지 않는다. 우선 실패 비용이 큰 대표 작업만 분리해 다음을 비교한다.

  • 필요한 사실과 제약을 빠뜨리지 않는가
  • 함수 이름과 인자를 유효한 형식으로 반환하는가
  • 한 번의 응답으로 끝나는가, 추가 응답 왕복과 도구 호출이 필요한가
  • 출력 token과 thinking tokens를 포함한 비용이 어느 정도인가
  • preview ID 변경이나 종료 때 즉시 되돌릴 stable 대안이 있는가

한 요청의 prompt가 200k token을 넘으면 Pro Preview의 입력·출력 단가가 모두 높아진다. 큰 문서를 무조건 한 요청에 넣기 전에 필요한 부분만 검색해 전달하거나 작업을 나누는 편이 나은지 확인해야 한다. 단, 문맥을 쪼개면서 정답에 필요한 연결 정보까지 잃는다면 단가 절감보다 품질 손실이 클 수 있다.

gemini-3.1-pro-preview-customtools는 bash나 사용자 정의 도구를 집중적으로 쓰는 작업에 해당할 때만 따로 확인한다. 일반 채팅, 요약, 추출 요청에 이름만 보고 적용하지 말고, 공식 모델 페이지의 대상 범위와 실제 도구 정의를 맞춰야 한다.

3.5 Flash 사용자는 언제 3.6으로 옮겨야 하나

기존 gemini-3.5-flash는 여전히 stable이며 Standard 입력 $1.50, 출력 $9다. gemini-3.6-flash는 입력 $1.50로 같고 출력은 $7.50이며, Google은 코드·에이전트형 작업 개선과 더 적은 token, turn, tool call 사용을 설명한다. 이 비교와 마이그레이션 안내는 Google의 최신 모델 문서에 있다. 다만 이는 Google이 보고한 개선이며, 모든 한국어 작업에서 3.6이 더 좋거나 더 빠르다는 독립 보장은 아니다.

다음 조건이면 3.6으로 옮길 우선순위가 높다.

  • 같은 입력 단가에서 출력 목록 단가를 낮추고 싶다.
  • 코드 생성, 함수 호출, 여러 단계의 도구 사용이 핵심이다.
  • 기존 3.5에서 긴 응답이나 반복 turn 때문에 비용이 커진다.
  • 새 모델의 출력 형식과 안전 동작을 검증할 테스트 환경이 있다.

반대로 현재 3.5가 중요한 업무에서 안정적으로 동작하고 회귀 테스트가 없다면 ID만 바로 교체하지 않는다. 두 모델을 작은 비율로 비교하되 “문장이 더 마음에 든다” 같은 모호한 기준 대신 실제 서비스 조건을 사용한다. 예를 들어 JSON 스키마 통과율, 필수 필드 누락, 도구 호출 성공, 평균 출력 token, 재시도율, 사람이 고치는 시간처럼 관찰 가능한 항목을 기록한다.

마이그레이션은 다음 순서면 충분하다.

  1. 현재 요청과 설정을 보존하고 모델 ID만 gemini-3.6-flash로 바꾼다.
  2. 짧은 요청, 긴 문맥, 구조화된 출력, 도구 오류 같은 대표 사례를 실행한다.
  3. 정상 응답뿐 아니라 token 사용량, 후속 수정, 실패 유형을 비교한다.
  4. 허용 기준을 충족하면 트래픽을 늘리고, 충족하지 않으면 3.5로 되돌릴 수 있게 한다.

비밀키 없이 재현 가능한 최소 호출

Google은 최신 기능과 모델 접근에 Interactions API를 권장하며, 기존 generateContent도 계속 문서화하고 있다. 현재 Google Gen AI SDK와 정확한 모델 ID를 사용하라는 안내는 최신 모델 시작 문서에서 확인할 수 있다. 아래 예시는 널리 문서화된 generateContent 방식으로 gemini-3.6-flash 한 번을 호출한다.

키는 실행 환경의 비밀 변수로 미리 주입하고, 소스 파일·Git 저장소·로그에는 값을 남기지 않는다. 아래 명령은 키 값을 출력하지 않고 환경 변수의 존재 여부만 확인한다.

bash
python -m pip install -U google-genai test -n "${GEMINI_API_KEY:-}" || { echo "GEMINI_API_KEY가 설정되지 않았습니다." >&2; exit 1; }

그다음 app.py를 실행한다.

python
from google import genai MODEL_ID = "gemini-3.6-flash" client = genai.Client() # GEMINI_API_KEY 환경 변수를 읽는다. response = client.models.generate_content( model=MODEL_ID, contents="다음 고객 문의를 배송, 환불, 제품 질문 중 하나로만 분류해 주세요: 주문을 취소하고 싶어요.", ) print(response.text)

이 코드는 품질 비교를 대신하지 않는다. MODEL_ID를 서비스 설정의 명시적인 값으로 두고, 실제 작업을 대표하는 입력으로 정상 응답, 허용 가능한 출력, token 사용량과 수정 비용을 확인하는 시작점이다. 요청 시점의 사용 가능한 모델을 확인하려면 같은 SDK에서 목록을 조회할 수 있다.

python
from google import genai client = genai.Client() for model in client.models.list(): print(model.name)

목록에 이름이 보인다는 사실만으로 해당 프로젝트의 무료 한도, 지역 가용성, SLA나 실제 실행 품질까지 증명되지는 않는다. 배포 권한과 요금 계정 조건은 별도로 확인해야 한다.

latest와 종료된 ID 때문에 생기는 오류를 먼저 찾기

모델을 바꾼 뒤 갑자기 결과가 달라지거나 호출이 실패한다면 프롬프트부터 고치기 전에 ID와 플랫폼을 확인한다.

  • 설정에 latest 별칭이 들어 있다면 실제 대상이 교체될 수 있다. 재현성이 필요하면 검증한 정확한 stable ID로 고정한다.
  • 코드나 환경 변수에 종료된 gemini-3-pro-preview가 남아 있는지 검색한다. 이 구형 preview는 2026년 3월 9일 종료됐다.
  • gemini-3.6-flash, gemini-3.5-flash-lite, gemini-3.5-flash, gemini-3.1-pro-preview에는 2026년 8월 10일 확인 당시 공지된 종료일이 없다. 하지만 이는 영구 지원 약속이 아니다. 현재 상태는 Gemini API 지원 종료 목록에서 다시 확인한다.
  • Gemini Developer API 가격을 Vertex AI 또는 API 중계 서비스의 청구서와 직접 비교하지 않는다. 플랫폼, 서비스 등급, 캐싱과 부가 기능이 다르면 같은 모델 이름도 총비용이 다를 수 있다.
  • 모델 목록 조회가 성공해도 실제 요청 권한과 기능 실행을 확인한 것은 아니다. 작고 안전한 대표 요청을 별도로 호출한다.

범용 텍스트 모델 비교에서 빠져나가야 하는 경우

목표가 텍스트 응답이 아니라면 이 표에서 모델을 고르는 것부터 잘못된 출발일 수 있다.

  • 이미지를 생성하거나 편집해야 한다면 이미지 생성용 모델을 찾는다.
  • 실시간 음성·영상 대화가 필요하다면 Live API와 해당 모델의 지연·세션 계약을 확인한다.
  • 음성 합성이 목적이면 오디오 생성 또는 TTS용 모델을 확인한다.
  • 문서 검색용 벡터가 필요하면 embedding 모델과 차원, 입력 한도, 가격을 비교한다.
  • 검색 기반 응답이나 URL 문맥을 쓰려면 Grounding, URL context의 지원 범위와 별도 비용을 확인한다.

이 기능들은 범용 Flash·Pro 모델과 이름이나 입력 형식 일부를 공유하더라도 모델 ID, 출력 형식, 가격, 가용성과 안전 조건이 다르다. 필요한 결과가 무엇인지 먼저 정한 뒤 공식 모델 디렉터리에서 해당 작업의 전용 모델로 이동한다.

배포 전 10분 점검

최종 선택은 “가장 유명한 모델”이 아니라 현재 서비스가 감당할 수 있는 기본값이어야 한다. 배포 전에 다음 항목을 한 번에 확인한다.

  • models.list에서 정확한 ID가 현재 프로젝트에 노출되는가
  • stable과 preview 중 어느 수명 위험을 선택했는가
  • 코드와 설정에 latest 또는 종료된 preview ID가 남아 있지 않은가
  • 월간 입력·출력 token과 thinking tokens를 포함해 Standard 비용을 계산했는가
  • Pro Preview 요청 중 prompt 200k 초과분을 높은 단가로 분리했는가
  • 실제 대표 요청이 형식, 필수 정보, 도구 호출과 안전 조건을 충족하는가
  • 재시도, 긴 출력, 사람의 수정 시간을 비용에 포함했는가
  • 이미지 생성, Live, TTS, embedding 작업을 범용 텍스트 모델에 억지로 맡기지 않았는가
  • 변경 기록과 지원 종료 목록을 배포 당일 다시 확인했는가
  • 문제가 생기면 되돌릴 stable ID와 설정이 준비돼 있는가

새 범용 프로젝트라면 gemini-3.6-flash로 작은 대표 요청을 먼저 실행한다. 비용이 목표를 넘으면 자동 검증 가능한 단순 작업부터 gemini-3.5-flash-lite로 분리한다. 복잡한 추론이나 도구 작업이 기준을 충족하지 못할 때만 gemini-3.1-pro-preview를 검토하고, preview 교체와 종료에 대비한 되돌리기 경로를 함께 둔다. 마지막으로 배포 직전 변경 기록, 모델 목록, 지원 종료 공지를 다시 확인하면 모델 이름이 아니라 실제 계약을 기준으로 선택할 수 있다.

#Gemini API#gemini-3.6-flash#gemini-3.5-flash-lite#gemini-3.1-pro-preview#모델 비교
Share: