Las filtraciones de Gemini 4 y del supuesto Claude Fable 5.2 ya ofrecen material para compararlos con GPT-6 Astra, sobre todo en resultados visuales producidos mediante código. Un mando de Xbox en SVG, escenas de un pelícano en bicicleta y una demostración de un cohete permiten discutir detalle, composición y realismo. La señal más interesante es que los probadores describen mejoras visibles, aunque algunas llegan acompañadas de más espera y un coste que juzgan elevado.
A 20 de septiembre de 2026, nuestra lectura provisional es esta: Gemini merece atención por sus demostraciones visuales; el próximo Fable, por el salto que describen sus probadores y su posible coste; Astra sirve como referencia documentada para decidir hoy. No son todavía tres productos probados bajo unas mismas condiciones. Los nombres de los candidatos ocultos proceden de quienes publicaron las pruebas; en particular, un probador aclara que «Fable 5.2» es su suposición. Aquí analizamos esas fuentes, sin presentar sus resultados como pruebas propias.
El mando de Xbox: Gemini se acerca a Astra en un caso concreto
La comparación publicada por Lumina es uno de los ejemplos más útiles porque permite mirar algo concreto: un mando de Xbox dibujado en SVG. El montaje incluye resultados etiquetados como Gemini 4 Pro, Gemini Flash 3.8, Meta Muse Spark 1.3 y Astra Pro. En las imágenes atribuidas a Gemini 4 y Astra se distinguen cuerpos detallados, botones, controles y sombreado.
El propio autor considera que Gemini y Astra están casi perfectos en esa tarea y señala una pequeña diferencia en el logotipo de Astra. La conclusión interesante no es que Gemini gane en todo, sino que la muestra atribuida a Gemini alcanza un nivel de acabado próximo al de Astra en un objeto reconocible, donde proporciones, controles y volumen se pueden inspeccionar.
Hay un coste de tiempo que cambia la lectura. El relato asociado sitúa la generación en unos 20 minutos dentro de Arena, bajo la etiqueta Gemini 3.7 Flash. El autor también dice que no logró repetir un resultado parecido al día siguiente. Es una pista prometedora para trabajos en los que importa el acabado, pero todavía no describe un rendimiento estable que puedas presupuestar para decenas de entregas.
Para una ilustración de interfaz que se prepara una sola vez, esperar más podría resultar aceptable si evita correcciones manuales. Para ajustar una interfaz conversando con el modelo a cada paso, veinte minutos tendrían un peso muy distinto. Esa diferencia entre trabajo puntual e iteración continua resulta más útil que convertir una imagen en un ganador absoluto.
Además, Lumina aclaró que no tenía acceso a Fable 5.2. Su montaje aporta una comparación visual Gemini–Astra; no añade por sí solo un tercer resultado de Fable.
Fable: un salto aparente con una contrapartida importante
El testimonio de JAZII del 18 de septiembre compara lo que considera el próximo Fable con Astra usando, según explica, las mismas instrucciones y un nivel alto de razonamiento. Lo describe como una mejora grande respecto al Fable actual y dice que le parece mejor que Astra. También lo considera más lento y caro.
Esa combinación merece más atención que una frase de victoria: el supuesto avance podría consistir en invertir más recursos para entregar un resultado mejor. Si reduce las reparaciones posteriores, puede compensar en una tarea difícil; si el resultado ya era suficiente con la versión anterior, pagar y esperar más sería una desventaja. Son implicaciones de lo que cuenta el probador, no un mecanismo interno demostrado ni una tabla de tarifas.
En una respuesta posterior, JAZII precisa que el nombre no está confirmado y que Fable 5.2 es su hipótesis. Conviene conservar esa distinción sin descartar el resto del testimonio: puede haber observado un cambio de comportamiento real aunque la denominación que le atribuye no sea la definitiva. Su impresión de que el lanzamiento no sería inmediato tampoco equivale a un calendario de Anthropic.

Ilustración conceptual: no reproduce resultados de las pruebas citadas.
El cohete y el límite de comparar por realismo
Bhavy publicó otra prueba, denominada Rocket, después de ver afirmaciones sobre peticiones de Fable 5.1 y Opus 5 que supuestamente acababan atendidas por versiones nuevas. Ejecutó el mismo test en ambos y describió el resultado como mucho mejor y más realista. Otros participantes no compartían esa valoración o preferían Opus.
La prueba principal enfrenta el supuesto Fable con Opus. La preferencia frente a Astra aparece en una respuesta del autor; no añade una ejecución de Astra con condiciones equivalentes al test original. Aun así, la publicación sirve para localizar qué está llamando la atención: el aspecto final y la sensación de realismo de una demostración.
Para quien desarrolla prototipos visuales, esa mejora puede tener valor por sí misma. Para quien mantiene una aplicación, queda otra pregunta: si el código funciona al integrarlo, admite cambios y conserva las funciones existentes. Una demostración de un cohete no resuelve esas cuestiones ni constituye una validación de su física.
Tres pelícanos en bicicleta: detalle y preferencia no son lo mismo
La comparación de Chetaslua del 18 de septiembre muestra tres pelícanos montados en bicicleta. El autor presenta los candidatos con ajustes máximos; en la imagen aparecen las etiquetas Updated Fable 5.1 —supuestamente dirigido a 5.2—, Opus 5.2 Next y GPT Astra Max.
Lo que se puede observar en el montaje publicado es una diferencia de composición: las dos primeras propuestas incluyen escenarios costeros más desarrollados; la de Astra utiliza una composición más contenida, de tipo viñeta circular. Eso ayuda a entender por qué un lector puede percibir las primeras como más completas y otro preferir la claridad de la tercera.
Más elementos no siempre significan mejor respuesta. Si se pedía una escena rica y ambientada, el paisaje adicional puede ser una ventaja. Si se necesitaba una ilustración compacta para una tarjeta de interfaz, la composición sencilla podría encajar mejor. Sin conocer las instrucciones completas y todos los intentos, la imagen permite comparar estilos visibles, pero no resolver cuál cumplió mejor el encargo.
También conviene distinguir el resultado de la modalidad: estas demostraciones gráficas o de código no establecen que los modelos de texto tengan generación nativa de imágenes. Lo interesante para esta comparación es su capacidad aparente para describir o construir una escena mediante el procedimiento utilizado por el autor.
Qué señales se repiten y cuáles pesan menos
La cobertura de TMTPost del 19 de septiembre reúne otras demostraciones atribuidas a Gemini 4 Pro: un gato en SVG, una pagoda de vóxeles, un helicóptero H145 y una web monocroma. El medio cita aproximadamente ocho minutos para la pagoda, diez para el helicóptero y catorce para la web. Son tiempos publicados por esa fuente, no mediciones nuestras ni una latencia típica de Gemini 4.
Estas muestras refuerzan una hipótesis concreta: el trabajo visual más elaborado podría ser una de las mejoras tempranas más perceptibles, con una espera que obliga a distinguir entre pedir una pieza terminada e iterar de forma rápida. No bastan para generalizar a depuración de repositorios, investigación o documentos largos, donde cuentan errores que una captura no muestra.
El mismo artículo recoge una tabla filtrada de puntuaciones extraordinarias, pero también señala discrepancias entre la tabla y una captura del sistema, cifras del comparador Astra que no coinciden con las oficiales y falta de respaldo de Google, Arena o los responsables de las evaluaciones. Esa tabla aporta menos confianza que un ejemplo cuyo resultado podemos inspeccionar. No la usamos para asignar posiciones a los tres candidatos.
Por su parte, un usuario de Gemini 3.8 Flash en Reddit relata una mejora de calidad, aproximadamente la mitad de velocidad de generación de tokens y un menor consumo de tokens. No demuestra que estuviera utilizando Gemini 4, pero plantea una distinción útil: generar más despacio no significa necesariamente gastar más tokens ni tardar el doble en terminar. Para saberlo harían falta el tiempo total y el consumo completo de cada tarea.
Qué elegir según el trabajo que tienes delante
Las fuentes permiten preparar decisiones distintas, aunque todavía no permitan sumar todas las muestras en una clasificación única.
| Tu prioridad | Qué sugieren las primeras pruebas | Qué falta para decidir un cambio |
|---|---|---|
| SVG, ilustraciones y prototipos visuales | El supuesto Gemini 4 alcanza un acabado próximo a Astra en el mando; las muestras atribuidas al nuevo Fable y Opus elaboran más algunas escenas | Repetir tus instrucciones y comprobar si el detalle añadido ayuda al diseño |
| Tareas difíciles que hoy exigen muchas correcciones | El testimonio de JAZII apunta a un salto del próximo Fable, con más espera y coste | Medir si disminuye el trabajo de reparación lo suficiente para compensar |
| Programación diaria e iteración rápida | Las demostraciones muestran resultados llamativos, pero algunas tardan varios minutos | Tiempo de respuesta, integración y mantenimiento en un proyecto real |
| Una integración que debes entregar ahora | Astra ofrece un identificador y precios documentados | Confirmar acceso de la cuenta y superar tus propias pruebas de aceptación |
En el último caso, GPT-6 se refiere aquí a GPT-6 Astra, identificado como gpt-6-astra en la ficha oficial de OpenAI. Sus tarifas Standard de contexto corto son 10 USD por millón de tokens de entrada y 50 USD por millón de salida; el contexto largo, la caché y otras modalidades cambian el cálculo. Consulta el desglose de precios de Astra y la comprobación de acceso a la API antes de presupuestar una integración.
Para una suscripción personal, estas tarifas de API no dicen cuánto pagarás ni qué límites de uso tendrás. Tampoco se puede deducir la tarifa del próximo Fable de que un probador lo considere caro. Si vas a contratar solo por una versión rumoreada, espera a que tu producto y tu cuenta identifiquen qué recibirás.
Cómo aprovechar las filtraciones sin convertirlas en una apuesta a ciegas
La siguiente prueba debería partir de una necesidad real: un componente visual que todavía queda tosco, un error de código difícil o un documento que exige demasiada revisión. Guarda las instrucciones, los archivos y el resultado actual. Define después qué mejora justificaría pagar más o esperar más tiempo.

Cuando puedas evaluar un candidato, conserva la versión identificada por el servicio, las herramientas disponibles, el tiempo total y todos los intentos. El coste útil es el de llegar a un resultado aceptado, no el de la captura más vistosa. Los niveles llamados high o max por distintos productos tampoco garantizan presupuestos equivalentes.
Las piezas que faltan están acotadas. Google anunció el inicio del preentrenamiento de Gemini 4 en julio, y el catálogo de Anthropic consultado documenta Fable 5.1; esas fuentes no autentican las versiones ocultas de estas demostraciones. Eso limita la certeza sobre el nombre y el acceso, pero no impide analizar los resultados publicados.
De momento, las filtraciones dan motivos para seguir de cerca a Gemini y al próximo Fable, especialmente en trabajo visual. Para migrar, exige que la mejora aparezca en tu tarea y compense la espera, el coste y las correcciones. Astra es una referencia con la que puedes empezar esa evaluación si tienes acceso; los nuevos candidatos deberán demostrar qué aportan cuando puedas probarlos en condiciones identificables.



