La respuesta corta depende del trabajo que no puedes simplificar. Para sesiones largas sobre repositorios y terminal sin entrada visual, empieza con GLM-5.3. Si las capturas, gráficos o vídeos forman parte de la evidencia, empieza con Kimi K3. Si necesitas muchos intentos baratos, usa DeepSeek V4 Flash como primera línea y reserva V4 Pro para los casos de texto difíciles o caros de fallar.
No es un podio. Es una forma de comprar una prueba útil. Antes de comparar calidad hay que alinear identificadores, modos de razonamiento, entrada visual y facturación; después se decide con tareas propias.
Lo que realmente se contrata
glm-5.3 es una ruta de texto con contexto de 1M tokens, salida máxima de 128K y razonamiento siempre activo. Permite esfuerzo low, high o max, pero no desactivar el razonamiento. Z.ai documenta sus endpoints compatibles en la ficha oficial de GLM-5.3.
kimi-k3 comparte el contexto de 1M y el razonamiento permanente, pero incorpora visión nativa. Moonshot lo publica como modelo MoE de pesos abiertos, 2,8T parámetros totales y 104B activos. Para una integración real, la guía de API de Kimi K3 aporta un límite decisivo: en conversaciones y herramientas hay que devolver el mensaje completo del assistant, no solo el content final.
DeepSeek V4 exige una compra más precisa. deepseek-v4-flash corresponde a Flash-0731 y deepseek-v4-pro a Pro-0813. Ambas rutas tienen contexto de 1M, salida máxima de 384K, thinking activable o desactivable, tres niveles de esfuerzo, tool calls, Responses API y API Anthropic. La visión pertenece a otro endpoint experimental, deepseek-v4-flash-vision-exp, según la tabla actual de modelos.
Por tanto, no se debe escribir “V4 tiene visión” y asignarla a Pro. Tampoco se debe comparar Kimi en max con DeepSeek sin thinking como si solo hubiese cambiado el nombre del modelo. Esas son configuraciones distintas.
Una matriz para decidir la primera prueba
| Necesidad que no puede faltar | Primera ruta razonable | Riesgo que hay que medir |
|---|---|---|
| Plan largo, terminal y cambios en muchos archivos, todo en texto | GLM-5.3 | Si mantiene el plan y reduce el trabajo de revisión en el repositorio real |
| Capturas, vídeo o diagramas dentro del mismo ciclo de agente | Kimi K3 | Contrato de mensajes, coste de salida y consistencia multimodal |
| Muchas variantes de bajo riesgo o búsqueda repetida | DeepSeek V4 Flash | Cuánto ruido y retrabajo produce la cobertura barata |
| Texto difícil con alto coste de fallo | DeepSeek V4 Pro | Si la mejora aceptada compensa su tarifa superior a Flash |
Los pesos abiertos de Kimi pueden añadir una quinta decisión: self-hosting. Esa ruta requiere evaluar la licencia Kimi K3, hardware, operaciones y rendimiento del motor. El precio de la API alojada no calcula ese TCO.

El precio cambia con caché, moneda y horario
A 28 de agosto de 2026, Z.ai muestra GLM-5.3 a $1,40 de entrada, $0,26 de entrada en caché y $4,40 de salida por millón de tokens.
La plataforma china de Kimi muestra K3 a ¥20 de entrada, ¥2 de entrada en caché y ¥100 de salida por MTok. También exige una recarga mínima de 10 yuanes para desbloquear K3; el cupón de registro no sirve. Son condiciones de esa cuenta en CNY, no un precio universal para cualquier proveedor internacional.
DeepSeek aplica franjas laborables. V4 Flash cuesta $0,22 de entrada y $0,66 de salida fuera de pico; en pico, $0,44 y $1,32. V4 Pro cuesta $0,66/$1,98 fuera de pico y $1,32/$3,96 en pico. Las franjas pico son lunes a viernes, 01:00–04:00 y 06:00–10:00 UTC. La entrada con cache hit es aún más barata.
Para una carga fija de 1M tokens de entrada sin caché y 200K de salida, antes de reintentos:
- GLM-5.3: $2,28;
- DeepSeek V4 Flash: $0,352 fuera de pico / $0,704 en pico;
- DeepSeek V4 Pro: $1,056 fuera de pico / $2,112 en pico;
- Kimi K3 en la plataforma china: ¥40, o unos ¥22 si toda la entrada obtiene tarifa de caché.
El cálculo no incluye límites, cola, latencia, reintentos ni minutos del reviewer. Una ruta barata que genera dos parches rechazados puede costar más por tarea aceptada. La comparación de compra debe usar el gasto real de cada ejecución y volver a consultar las páginas oficiales antes de fijar presupuesto.
El benchmark independiente no elimina la prueba propia
Las tablas de lanzamiento de los proveedores usan harness, herramientas, effort, presupuesto y datasets diferentes. Copiar sus mejores cifras en una hoja no crea igualdad de condiciones.
El benchmark de seguridad de Aikido ofrece un ejemplo más controlado: congeló 32 vulnerabilidades recientes, prompts, herramientas y política de evaluación, y ejecutó tres veces cada modelo. En esa tarea de descubrimiento de vulnerabilidades, DeepSeek V4 Pro-0813 obtuvo el mayor recall combinado. Kimi K3 tuvo la mejor precisión combinada entre los modelos de pesos abiertos probados. GLM-5.3 combinó recall y consistencia fuertes.
El resultado solo pertenece a ese workload. La repetición ayuda a explorar vulnerabilidades por rutas distintas, pero también añade falsos positivos y trabajo de filtrado. Un flujo de frontend, documentos o automatización puede penalizar esa variación. Además, Aikido colaboró con Z.ai como partner temprano de evaluación de GLM-5.3, un contexto que debe conservarse.

Diseña una prueba de promoción
Elige entre seis y diez tareas reales: un bug entre varios archivos, un refactor medio, un agente con varias herramientas, un análisis de contexto largo, una petición deliberadamente ambigua y, si aplica, una tarea visual. Congela snapshot, prompt, permisos, timeout, presupuesto de turnos/tokens y comando de aceptación.
Registra para cada ejecución:
- resultado aceptado y test automático;
- defectos blocker, major y minor;
- archivos omitidos, bucles de herramientas, formato y reintentos;
- latencia inicial y total;
- entrada normal, entrada en caché, salida y coste de reintento;
- minutos de revisión y facilidad de rollback.
Escribe antes los límites. Un blocker puede impedir la promoción a default. Tres reintentos en una tarea rutinaria pueden dejar la ruta solo para exploración. Si la revisión duplica el baseline actual, el precio de tokens no basta para cambiar.
El reparto final queda claro: GLM-5.3 como challenger textual de largo horizonte; Kimi K3 para visión dentro del bucle; DeepSeek V4 Flash para cobertura económica; Pro para control de texto difícil. Si solo necesitas migrar identificadores dentro de DeepSeek, usa la guía específica de DeepSeek V4. Para cambiar de proveedor, manda la aceptación de tu propia prueba, no el ranking de lanzamiento.



