Ox Alpha был временным именем, а не отдельной моделью для долгосрочной конфигурации. Z.ai подтвердил, что под ним на OpenCode и OpenRouter тестировалась GLM-5.3-Flash. В официальном API теперь нужен glm-5.3-flash, а репозиторий весов называется zai-org/GLM-5.3-Flash.
Для первого знакомства разумнее использовать API. Открытые веса дают контроль над инфраструктурой, но только FP8-файлы занимают около 305,8 ГиБ. Показатель 18 млрд активных параметров описывает вычисления MoE на один токен, а не полный объём модели в видеопамяти.
После Ox Alpha осталось два постоянных идентификатора
В официальном описании GLM-5.3-Flash названа первой нативно мультимодальной моделью семейства GLM-5. Она принимает текст, изображения, видео и файлы, а возвращает текст. Заявленный контекст — 1 млн токенов, максимальный вывод — 128 тыс. токенов.
Модель имеет 320 млрд параметров всего и 18 млрд активных. Z.ai также сообщает о сочетании sparse и linear attention и о меньших затратах на attention и KV cache по сравнению с GLM-5.3. Это объяснение архитектуры от разработчика, а не гарантия скорости или качества в вашем проекте.
Выбирайте имя по месту запуска:
| Способ | Идентификатор | Что проверить |
|---|---|---|
| API Z.ai | glm-5.3-flash | endpoint и ключ принадлежат Z.ai |
| Локальные веса | zai-org/GLM-5.3-Flash | точная версия checkpoint и лицензия |
| Сторонний провайдер | ID на его актуальной странице | собственные цена, лимиты и параметры |
Старое ox-alpha не стоит оставлять в production-конфигурации. Сторонний gateway может давать тот же model family, но с другим endpoint, лимитом контекста и правилами оплаты.
Обычная цена важнее скидки первой недели
На 3 сентября 2026 года официальный прайс Z.ai указывает стоимость за 1 млн токенов:
| Операция | Обычная цена | Цена со скидкой 50% |
|---|---|---|
| Input без cache hit | $0,15 | $0,075 |
| Cached input | $0,03 | $0,015 |
| Output | $0,50 | $0,25 |
Акция заканчивается 9 сентября 2026 года в 24:00 UTC+8. Для постоянного бюджета используйте обычную цену, а скидку учитывайте только в счетах за период акции.
Задача с 1 млн обычных входных и 200 тыс. выходных токенов стоит до повторов $0,25 по прайсу: $0,15 + 0,2 × $0,50. Во время акции получится $0,125. К этой сумме нужно добавить неудачные повторы, инструменты и время ревью. Поэтому полезная метрика — стоимость принятой задачи, а не одного запроса.
Первый запрос должен подтвердить не только HTTP 200
Для обычного приложения документация API задаёт базовый адрес https://api.z.ai/api/paas/v4. У Coding Plan другой endpoint — https://api.z.ai/api/coding/paas/v4; он предназначен для поддерживаемых coding tools, а не для произвольного сайта, бота или SaaS.
Минимальная проверка:
bashcurl -sS https://api.z.ai/api/paas/v4/chat/completions \ -H "Authorization: Bearer $ZAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm-5.3-flash", "messages": [ {"role": "user", "content": "Return exactly: GLM53_FLASH_OK"} ], "temperature": 1, "top_p": 0.95, "reasoning_effort": "low", "stream": false }'
Успех — это непустое choices[0].message.content с заданной строкой. При 401 сначала проверьте Authorization header и происхождение ключа. При «model not found» ищите старое имя ox-alpha, ID репозитория Hugging Face или псевдоним другого провайдера.
Параметр reasoning_effort принимает low, high и max. По официальному описанию пропущенное или неизвестное значение приводит к max. При сравнении цены и задержки фиксируйте один уровень: иначе изменение глубины рассуждения будет выглядеть как изменение качества модели.
Для изображения используется массив messages[].content[] с блоком type: image_url. Мультимодальный вход не означает генерацию изображений: ответ модели текстовый.

Локальный запуск начинается с подсчёта файлов
Официальная карточка модели указывает лицензию MIT и поддерживаемые варианты SGLang, vLLM, Transformers, KTransformers и Unsloth. Список файлов репозитория на 3 сентября содержал 62 FP8-файла .safetensors общим размером 328 337 455 672 байта, или примерно 305,8 ГиБ.
Это нижняя граница только для весов. Сервису нужны также память для runtime, vision encoder, временных buffers, KDA state, KV cache и одновременных запросов. Контекст в 1M токенов требует гораздо больше cache, чем короткий тест. Offload в RAM или на диск может обеспечить старт процесса, но оставить неприемлемые latency и throughput.
Актуальный recipe vLLM тоже называет около 306 ГиБ FP8 до runtime и KV cache; первый пример использует tensor parallel на четырёх мощных GPU. Документация SGLang предлагает отдельные настройки для H100, H200, B200, B300, GB200 и GB300 и отмечает, какие комбинации проверены.
До загрузки ответьте:
- помещаются ли веса и рабочий запас в суммарную GPU memory;
- какой реальный context и concurrency нужны;
- будут ли изображения и видео;
- достаточно ли экспериментального старта или требуются мониторинг, обновления и failover.
Если веса уже не помещаются, начните с API. Если помещаются, выберите инструкцию именно для своей GPU, запустите короткий context и один запрос, затем увеличивайте нагрузку. Не переносите параметры FP8 KV cache или speculative decoding с другого поколения ускорителей.

Решение даёт небольшой тест на реальных задачах
Возьмите 6–10 задач из рабочего backlog: длинный анализ, tool call, изображение и изменение кода с автоматической проверкой. Зафиксируйте prompt, состояние репозитория, reasoning_effort, timeout, число повторов и критерии приёмки. Сравнивайте first-pass success, общее время, токены, минуты ревью и причины отказа.
API удобнее для быстрой проверки спроса и качества. Локальный сервер имеет смысл, когда требования к данным, высокая постоянная загрузка или предсказуемая ёмкость действительно компенсируют оборудование и сопровождение. Простой ускорителей тоже стоит денег.
Если нужен отдельный контроль качества для сложных текстовых задач, используйте сравнение GLM-5.3 и GLM-5.3-Flash. Для решения только о Flash достаточно двух доказательств: API возвращает ожидаемое содержимое, а расчёт памяти учитывает не только weight files.



