Si la tarea contiene imágenes, vídeo o archivos, empieza por glm-5.3-flash: el contrato oficial actual de glm-5.3 solo acepta texto. En ingeniería de texto compleja y de larga duración, prueba Flash como candidato económico y GLM-5.3 como techo de calidad.
Ese orden no declara un ganador universal. Las especificaciones eliminan rutas incompatibles; las pruebas de aceptación de tu sistema deciden cuál merece tráfico real.
La modalidad decide quién puede participar
Según la documentación de GLM-5.3, el modelo acepta texto, dispone de 1M tokens de contexto y hasta 128K tokens de salida. El razonamiento siempre está activo y admite low, high y max.
La documentación de GLM-5.3-Flash mantiene esos límites y añade imagen, vídeo y archivos. El ID exacto del API es glm-5.3-flash.
| Necesidad | Primera ruta |
|---|---|
| Leer una captura, gráfico, vídeo o documento sin transcripción manual | Flash |
| Procesar mucho volumen con verificación automática | Flash |
| Ingeniería de texto donde un fallo contamina el estado posterior | Ambas; GLM-5.3 como control |
| Ruta oficial con pesos descargables | Ambas; revisar licencia y capacidad |
Z.ai publica para Flash 320B parámetros totales y 18B activos. También informa de unas reducciones de 3,01 veces en el cálculo de attention y 4,44 veces en KV cache frente a GLM-5.3. Son cifras del proveedor sobre el diseño, no una medición independiente de tu latencia o calidad.

El presupuesto debe sobrevivir al descuento
La tarifa oficial de Z.ai se expresa en USD por 1M tokens:
| Ruta | Input | Cached input | Output |
|---|---|---|---|
| GLM-5.3 | $1,40 | $0,26 | $4,40 |
| Flash, precio de lista | $0,15 | $0,03 | $0,50 |
| Flash, promoción | $0,075 | $0,015 | $0,25 |
La promoción del 50% termina el 9 de septiembre de 2026 a las 24:00 UTC+8. Usa el precio de lista para una decisión estable.
Con 1M tokens de entrada no almacenada y 200K de salida, el coste antes de reintentos es aproximadamente $2,28 con GLM-5.3, $0,25 con el precio de lista de Flash y $0,125 durante la promoción. En esta forma de tráfico, la diferencia estable ronda 9,1 veces.
La métrica operativa correcta es más amplia:
coste por tarea aceptada = llamadas + reintentos + revisión humana + recuperación del fallo
Si Flash supera las pruebas a la primera, mantiene su ventaja. Si necesita tres intentos y una corrección manual, la distancia disminuye. El flagship debe justificar la prima con menos defectos o menor riesgo, no solo con su etiqueta.
Pesos abiertos no significan infraestructura gratis
La ficha oficial de GLM-5.3-Flash ofrece pesos 321B bajo MIT y rutas con vLLM, SGLang, Transformers, KTransformers y Unsloth.
La ficha oficial de GLM-5.3 publica ahora una ruta de pesos 753B y guías para los mismos frameworks principales; su licencia figura como GLM-5.3, no MIT. Por tanto, controlar el despliegue ya no selecciona Flash por sí solo. Compara licencia, modalidad, tamaño, memoria, cuantización, capacidad de pico, monitorización y mantenimiento dentro del TCO completo.

Una prueba corta produce una decisión útil
Selecciona entre 6 y 10 tareas reales: un bug que toca varios archivos, análisis de repositorio, un agente con herramientas, un documento largo y una tarea visual. En la parte textual congela commit, prompt, permisos, timeout, reasoning_effort, reintentos máximos y comandos de aceptación.
Registra aceptación al primer intento, defectos blocker/major, reintentos, latencia inicial, duración total, tokens y minutos de revisión. Define límites antes de ver resultados: un blocker irrecuperable impide promover la ruta; más de dos reintentos escala la tarea; duplicar el tiempo de revisión elimina una ventaja basada solo en tokens.
Una política inicial razonable es una cascada: Flash para trabajo compatible y verificable; GLM-5.3 para casos de texto difíciles que Flash no supera. Cuando necesites ampliar proveedores, usa la comparativa separada de GLM-5.3, Kimi K3 y DeepSeek V4.



