본문으로 건너뛰기

GLM-5.3-Flash 사용 가이드: Ox Alpha 정체, API 가격, 로컬 실행

5 분 소요AI 모델 가이드

공식 API로 실제 작업을 먼저 확인하세요. 약 305.8 GiB FP8 가중치에 실행 환경과 캐시 여유까지 담을 수 있을 때만 로컬 배포를 검토하는 편이 안전합니다.

Ox Alpha 정체, API 가격, 호출 검증, 로컬 메모리 판단을 담은 GLM-5.3-Flash 한국어 가이드

Ox Alpha는 별도의 정식 모델이 아니다. Z.ai는 OpenCode와 OpenRouter에서 이 이름으로 익명 테스트한 모델이 GLM-5.3-Flash였다고 밝혔다. 정식 Z.ai API에는 glm-5.3-flash, 공식 오픈 가중치에는 zai-org/GLM-5.3-Flash를 사용한다.

개인과 소규모 팀은 API부터 검증하는 편이 현실적이다. 공식 FP8 가중치 파일만 약 305.8 GiB이기 때문이다. 18B active parameters는 토큰마다 활성화되는 MoE 계산량이지, 전체 모델이 18B 크기라는 뜻이 아니다.

Ox Alpha 공개 뒤에는 정식 ID를 사용한다

GLM-5.3-Flash 공식 문서는 이 모델을 320B total, 18B active의 MoE이자 GLM-5 계열 첫 native multimodal 모델로 설명한다. 텍스트, 이미지, 영상, 파일을 입력으로 받고 텍스트를 출력한다. context는 1M tokens, 최대 output은 128K tokens다.

Z.ai는 sparse attention과 linear attention을 함께 사용해 GLM-5.3보다 attention compute와 KV cache를 줄였다고 보고한다. 이는 가격 구조를 이해하는 제조사 설명이다. 특정 코드베이스의 정확도, latency, tool calling 성공률을 보장하지는 않는다.

사용 위치에 맞는 이름을 고른다.

사용 방법첫 식별자피할 오류
Z.ai 공식 APIglm-5.3-flashox-alpha preview 이름 유지
공식 오픈 가중치zai-org/GLM-5.3-Flashrepo 이름을 모든 API에 전송
제3자 gateway해당 provider의 현재 IDZ.ai 가격과 quota가 같다고 가정

같은 기반 모델이어도 provider가 다르면 endpoint, parameter, context, 실패 과금이 달라질 수 있다.

장기 예산에는 정상가를 넣는다

2026년 9월 3일 확인한 Z.ai 가격표는 1M tokens당 다음 금액을 표시한다.

항목정상가현재 50% 할인가
uncached input$0.15$0.075
cached input$0.03$0.015
output$0.50$0.25

할인은 2026년 9월 9일 24:00 UTC+8에 끝난다. 지속적인 비용을 비교할 때는 정상가를 쓰고, 할인가는 행사 기간 청구 내역을 확인할 때만 적용한다.

1M uncached input과 200K output을 쓰는 작업은 재시도와 도구 비용 전 정상가 $0.25다.

$0.15 + 0.2 × $0.50 = $0.25

할인 기간에는 $0.125다. 하지만 실제 선택 지표는 통과한 작업 한 건의 총비용이다. 실패한 호출, 재시도, 사람의 리뷰 시간, 잘못된 도구 실행을 복구한 비용을 함께 계산해야 한다.

첫 API 호출은 응답 내용까지 확인한다

일반 앱은 Z.ai API 안내에 나온 https://api.z.ai/api/paas/v4를 사용한다. Coding Plan의 https://api.z.ai/api/coding/paas/v4는 지원되는 coding tool용이며, 임의의 웹사이트, bot, SaaS에서 쓰는 일반 API quota가 아니다.

key, endpoint, model ID를 한 번에 확인하는 요청은 다음과 같다.

bash
curl -sS https://api.z.ai/api/paas/v4/chat/completions \ -H "Authorization: Bearer $ZAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm-5.3-flash", "messages": [ {"role": "user", "content": "Return exactly: GLM53_FLASH_OK"} ], "temperature": 1, "top_p": 0.95, "reasoning_effort": "low", "stream": false }'

HTTP 200만 보고 성공으로 끝내지 않는다. choices[0].message.content가 있고 요청한 문자열을 포함하는지 확인한다. 401이면 Authorization header와 key 발급 플랫폼을 먼저 본다. model not found라면 ox-alpha, Hugging Face repo 이름, 다른 provider의 alias가 들어갔는지 확인한다.

reasoning_effortlow, high, max를 지원한다. 공식 설명에 따르면 생략하거나 다른 값을 넣으면 max로 돌아간다. 비용과 latency를 비교할 때 같은 level을 고정해야 한다.

이미지는 messages[].content[] 안에 type: image_url block을 넣고 image_url.url에 URL 또는 Base64 Data URL을 전달한다. 이미지를 이해할 수 있다는 뜻이지 이미지나 영상을 생성한다는 뜻은 아니다. 출력은 텍스트다.

GLM-5.3-Flash 식별자, 공식 가격, 첫 API 호출과 305.8 GiB 가중치 판단을 정리한 한국어 표

로컬 실행은 305.8 GiB에서 계산을 시작한다

공식 Hugging Face 모델 카드는 MIT license와 SGLang, vLLM, Transformers, KTransformers, Unsloth 지원을 안내한다. 2026년 9월 3일 공식 repo API 기준으로 FP8 .safetensors 62개가 328,337,455,672 bytes, 약 305.8 GiB였다.

이 값은 가중치 파일만 담는 하한이다. 실행할 때는 model metadata, vision encoder workspace, 임시 buffer, KDA state, KV cache, CUDA graph, 동시 요청 여유가 더 필요하다. 1M context는 짧은 테스트보다 훨씬 큰 cache를 사용한다. CPU RAM이나 disk offload로 process가 시작돼도 first-token latency와 throughput이 실용적이라는 보장은 없다.

현재 vLLM recipe도 runtime과 KV cache 이전의 native FP8 가중치를 약 306 GiB로 설명하며 첫 예시는 고성능 GPU 4장의 tensor parallel이다. SGLang recipe는 H100, H200, B200, B300, GB200, GB300별 설정과 검증 상태를 제공한다.

다운로드 전에 확인할 항목은 네 가지다.

  • 전체 GPU 메모리에 가중치와 충분한 실행 여유가 들어가는가
  • 필요한 context와 동시 요청 수는 얼마인가
  • 이미지와 영상을 위한 vision workspace가 필요한가
  • 단순 부팅이 목표인가, throughput·monitoring·upgrade·failover도 필요한가

가중치만으로 메모리가 부족하면 API를 사용한다. 충분하다면 정확한 GPU 세대에 맞는 공식 recipe를 고르고, 짧은 context와 단일 요청부터 시작한다. 다른 가속기의 FP8 KV cache나 speculative decoding 설정을 그대로 복사하지 않는다.

API 검증에서 비용 계산과 로컬 실행 준비까지 이어지는 GLM-5.3-Flash 한국어 결정 흐름

작은 실제 작업으로 다음 투자를 결정한다

실제 backlog에서 6~10개를 고른다. 긴 context 분석, tool call, 이미지 이해, 자동 test가 있는 코드 수정을 포함하면 좋다. repository state, prompt, reasoning_effort, timeout, retry 상한과 acceptance command를 고정하고 first-pass 통과, 전체 시간, tokens, review 시간과 실패 유형을 기록한다.

hosted API는 모델이 실제 업무를 받을 가치가 있는지 빠르게 확인하는 방법이다. self-hosting은 데이터 통제, 지속적으로 높은 사용률, 예측 가능한 capacity의 가치가 장비와 운영 비용보다 클 때 검토한다. 놀고 있는 GPU 비용도 계산에 포함한다.

고위험 text-only engineering에서 GLM-5.3를 품질 기준으로 함께 볼 필요가 있다면 GLM-5.3와 GLM-5.3-Flash 비교 가이드를 사용하면 된다. Flash만 도입할 때는 API 응답 본문과 weight 외 실행 여유를 포함한 메모리 계획, 이 두 결과가 첫 go/no-go 기준이다.

#GLM-5.3-Flash#Ox Alpha#Z.ai#AI API#로컬 실행
Share: