Ox Alpha ya no es un modelo misterioso ni un identificador que convenga guardar en producción. Z.ai confirmó que el modelo probado con ese nombre en OpenCode y OpenRouter era GLM-5.3-Flash. En el API oficial se usa glm-5.3-flash; para los pesos abiertos, el repositorio es zai-org/GLM-5.3-Flash.
Para una persona o un equipo pequeño, la mejor primera comprobación suele ser el API alojada. Solo los archivos de pesos FP8 ocupan unos 305,8 GiB. La cifra de 18B parámetros activos describe cuánto MoE se activa por token, no un modelo de 18B que quepa en una GPU doméstica.
El nombre de preview no es el ID de producción
La documentación oficial de GLM-5.3-Flash presenta un MoE con 320B parámetros totales y 18B activos. Es el primer modelo multimodal nativo de la familia GLM-5: acepta texto, imágenes, vídeo y archivos, y produce texto. El contexto documentado es de 1M tokens y el máximo de salida, 128K tokens.
Z.ai también informa de una arquitectura híbrida de sparse y linear attention, con menos cálculo de attention y menor KV cache que GLM-5.3. Es una explicación y una medición del proveedor; no garantiza la latencia, la exactitud ni el comportamiento de agentes en tu sistema.
Cada acceso necesita su propio identificador:
| Dónde se ejecuta | Identificador inicial | Error habitual |
|---|---|---|
| API de Z.ai | glm-5.3-flash | conservar ox-alpha |
| Pesos oficiales | zai-org/GLM-5.3-Flash | enviar el nombre del repo a cualquier API |
| Proveedor externo | su ID vigente | heredar precio y límites de Z.ai |
Un gateway puede cambiar parámetros, límite de contexto y tratamiento de errores. Compartir el modelo base no hace idénticos dos servicios.
El presupuesto debe sobrevivir al fin de la promoción
A 3 de septiembre de 2026, la tarifa oficial de Z.ai muestra precios en USD por 1M tokens:
| Concepto | Precio de lista | Precio actual con 50% |
|---|---|---|
| Input sin cache hit | $0,15 | $0,075 |
| Cached input | $0,03 | $0,015 |
| Output | $0,50 | $0,25 |
La promoción termina el 9 de septiembre de 2026 a las 24:00 UTC+8. Una decisión a largo plazo debe usar la tarifa de lista; el descuento sirve para conciliar el consumo del periodo promocional.
Una tarea con 1M tokens de entrada sin caché y 200K de salida cuesta $0,25 antes de reintentos y herramientas:
$0,15 + 0,2 × $0,50 = $0,25
Durante el descuento serían $0,125. Para producción importa más el coste por tarea aceptada: todas las llamadas, reintentos, revisión humana y recuperación de fallos. Tres intentos y una corrección manual reducen rápidamente la ventaja aparente del token barato.
Una primera llamada debe validar el contenido
Una aplicación general usa el endpoint https://api.z.ai/api/paas/v4 que aparece en la introducción del API. Coding Plan utiliza https://api.z.ai/api/coding/paas/v4, pero está reservado para herramientas de programación compatibles; no es una cuota para cualquier web, bot, SDK o SaaS.
Esta petición comprueba key, endpoint e ID del modelo:
bashcurl -sS https://api.z.ai/api/paas/v4/chat/completions \ -H "Authorization: Bearer $ZAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm-5.3-flash", "messages": [ {"role": "user", "content": "Return exactly: GLM53_FLASH_OK"} ], "temperature": 1, "top_p": 0.95, "reasoning_effort": "low", "stream": false }'
No basta con HTTP 200. Verifica que exista choices[0].message.content y contenga la marca pedida. Un 401 apunta primero al header Authorization o a una key de otra plataforma. Ante “model not found”, busca ox-alpha, el nombre del repo de Hugging Face o un alias que solo acepte otro proveedor.
reasoning_effort admite low, high y max. Según la documentación oficial, si se omite o recibe otro valor, vuelve a max. Fija el mismo nivel al medir coste y latencia para no atribuir al modelo una diferencia causada por el parámetro.
Para imágenes, messages[].content[] incluye un bloque type: image_url y la URL o Data URL Base64 en image_url.url. Aceptar contenido multimodal no significa generar imágenes o vídeo: la salida documentada es texto.

El cálculo local empieza en 305,8 GiB
La ficha oficial en Hugging Face marca licencia MIT y enlaza soporte para SGLang, vLLM, Transformers, KTransformers y Unsloth. El 3 de septiembre, el API del repositorio enumeraba 62 archivos FP8 .safetensors con 328.337.455.672 bytes en total, unos 305,8 GiB.
Ese dato solo responde si caben los pesos. Un servidor necesita memoria adicional para metadata, buffers, encoder visual, KDA state, KV cache, CUDA graphs y concurrencia. Un contexto cercano a 1M consume mucha más caché que una prueba corta. Descargar parte a RAM o disco puede permitir el arranque y, a la vez, producir una latencia inicial o un rendimiento inútiles.
La receta actual de vLLM también parte de unos 306 GiB FP8 antes de runtime y KV cache; su primer ejemplo usa tensor parallel en cuatro GPU de gama alta. La receta de SGLang ofrece configuraciones para H100, H200, B200, B300, GB200 y GB300, con estado de validación para cada combinación.
Antes de descargar, responde:
- ¿La memoria GPU total admite pesos y margen de ejecución?
- ¿El contexto real será 8K, 128K o cercano a 1M, y cuántas peticiones coincidirán?
- ¿Habrá imágenes o vídeo que necesiten espacio visual adicional?
- ¿Basta con arrancar o hacen falta throughput, observabilidad, actualizaciones y failover?
Si los pesos ya superan la capacidad, usa el API. Si caben, elige la receta de la generación exacta de GPU y comienza con contexto corto y una petición. No copies opciones de FP8 KV cache, tensor parallel o speculative decoding desde otro acelerador y conviertas un boot correcto en promesa de producción.

Decide con pocas tareas reales
Selecciona entre 6 y 10 tareas del trabajo real: un análisis largo, un agente con herramientas, una entrada visual y un cambio de código con aceptación automática. Mantén iguales el prompt, el estado del repositorio, reasoning_effort, timeout, reintentos y comandos de verificación. Registra éxito al primer intento, duración, tokens, minutos de revisión y tipo de fallo.
El API alojada permite descubrir pronto si el modelo merece tráfico. La infraestructura propia cobra sentido cuando el control de datos, una utilización alta y estable o una capacidad previsible compensan hardware y mantenimiento. Las GPU inactivas también forman parte del coste.
Si aún necesitas comparar tareas de texto con un modelo mayor, consulta la prueba de GLM-5.3 frente a GLM-5.3-Flash. Para adoptar solo Flash, dos resultados permiten avanzar: la respuesta del API contiene lo esperado y el plan local reserva memoria más allá de los weight files.



