Saltar al contenido principal

Gemini 4 Argon vs Claude Opus 5.5 vs GPT-6.1 Sol: cuál usar hoy

Argon aún no está en la API pública: hoy solo puedes integrar Opus 5.5 y GPT-6.1 Sol. A igual nivel de razonamiento, cuesta 6,2 veces más por tarea que Sol.

LaoZhang AI TeamPublicado16 min de lectura
En esta página
Argon vs Opus 5.5 vs GPT-6.1 Sol: Gemini 4 Argon sin API pública, Claude Opus 5.5 y GPT-6.1 Sol ya en la API, a 1 de octubre de 2026

De los tres, hoy solo puedes integrar dos. Claude Opus 5.5 y GPT-6.1 Sol están en sus API y en sus aplicaciones de pago. Gemini 4 Argon, que Google anunció el 30 de septiembre de 2026, solo llega de momento a un grupo de equipos de ciberdefensa dentro del programa Fairwind: no tiene identificador de modelo público, no aparece en la lista de precios de la API de Gemini y Google no ha dado fecha de apertura. Si tienes que elegir modelo esta semana, la decisión real es entre Opus 5.5 y GPT-6.1 Sol, y Argon es algo que conviene dejar preparado para probar.

El segundo dato que cambia la lectura de los titulares es el precio. Argon se anuncia a 2 $ por millón de tokens de entrada y 10 $ por millón de salida, lo mismo que GPT-6.1 Sol y la mitad que Opus 5.5. Pero con el mismo nivel de razonamiento, Artificial Analysis mide 1,99 $ por tarea en Argon, 1,82 $ en Opus 5.5 y 0,32 $ en GPT-6.1 Sol, con 53, 54 y 50 puntos. La tarifa de Argon se parece a la de Sol; su coste por tarea se parece al de Opus. Y el precio anunciado es de lanzamiento: después pasa a 4 $ y 20 $.

Una aclaración de nombres: «GPT 6.1» es GPT-6.1 Sol, el modelo que OpenAI publicó el 29 de septiembre de 2026, y no GPT-6 Astra, que es el que Google eligió para su tabla. Las cifras de rendimiento y de coste por tarea que aparecen a continuación proceden de Google y de mediciones de terceros, y cada una lleva indicado quién la obtuvo y en qué condiciones.

Cuál de los tres puedes integrar hoy

Gemini 4 ArgonClaude Opus 5.5GPT-6.1 Sol
Estado a 1 de octubre de 2026Acceso limitado a equipos de ciberdefensa del programa FairwindDisponible desde el 22 de septiembre de 2026Disponible desde el 29 de septiembre de 2026
API públicaNo. Sin identificador, sin límites de uso y sin fechaSí, claude-opus-5-5Sí, gpt-6.1-sol
Dónde se usaSolo dentro de Fairwind y en equipos internos de GoogleAplicaciones de Claude (Pro, Max, Team, Enterprise), Claude Code, API de Claude, AWS, Google Cloud y AzureAPI de OpenAI; ChatGPT Work y Codex en Plus, Pro, Business, Enterprise y Edu
Contexto y salida máximaContexto sin cifra en el anuncio; salida de «1M» según Google, 262.000 según Vals1M de contexto, 128.000 tokens de salida1.050.000 de contexto, 128.000 tokens de salida
Tarifa por millón de tokens (entrada / salida)2 $ / 10 $ de lanzamiento; después 4 $ / 20 $4 $ / 20 $2 $ / 10 $ hasta 272.000 tokens de entrada; por encima, 4 $ / 15 $

Tabla de acceso a 1 de octubre de 2026: Gemini 4 Argon con acceso limitado y sin API pública, Claude Opus 5.5 y GPT-6.1 Sol disponibles en sus API

En el anuncio de Google, Argon «se está desplegando para un conjunto de ciberdefensores de confianza» a través de Fairwind. La empresa dice que participa en el proceso voluntario del Gobierno de Estados Unidos para el acceso previo al lanzamiento y que ampliará el acceso de forma gradual, «lo antes posible», empezando por los clientes de pago de la API y los suscriptores de Google AI Ultra. No hay más calendario que ese. A 1 de octubre de 2026, la página de precios de la API de Gemini lista Gemini 3.8 Flash y Gemini 3.1 Pro Preview, entre otros, pero ninguna entrada de Argon ni de Gemini 4; esa página no describe los contratos de Vertex AI, de modo que la ausencia solo vale para la API para desarrolladores.

Fairwind es el programa de Google para defensores de confianza, y dentro de él Argon se entrega sin las restricciones de ciberseguridad que tendrá la versión general. Si trabajas en un equipo de seguridad, la guía sobre Gemini 3.8 Flash Cyber y Fairwind explica qué es el programa y quién puede entrar; se escribió para aquel modelo, y Google no ha publicado un procedimiento de solicitud específico para Argon.

En GPT-6.1 Sol hay dos detalles de acceso que conviene tener presentes: dentro de ChatGPT está en Work y en Codex, no en el chat normal ni en los planes Free y Go, y las llamadas a herramientas exigen la Responses API. El resto de cambios está en la guía de GPT-6.1 Sol.

Mismo precio por token, coste por tarea muy distinto

La tarifa, con los mismos tokens

La factura de cada modelo se puede escribir con tres cantidades, todas en millones de tokens: U es la entrada nueva, R la entrada leída de caché y O la salida, que incluye los tokens de razonamiento.

Modelo y tramoCoste en dólaresLo que no entra en la fórmula
Gemini 4 Argon, precio de lanzamiento2·U + 0,10·R + 10·OEscritura de caché, lotes y tramo de contexto largo sin publicar
Gemini 4 Argon, precio posterior4·U + 20·OTarifa de caché posterior sin publicar
GPT-6.1 Sol, hasta 272.000 tokens de entrada2·U + 0,10·R + 10·OEscritura de caché a 2,50 $ por millón
GPT-6.1 Sol, por encima de 272.0004·U + 0,20·R + 15·OEscritura de caché a 5 $ por millón
Claude Opus 5.5, en todo el contexto de 1M4·U + 0,20·R + 20·OEscritura de caché de 5 minutos a 5 $ por millón

Las tarifas de Opus proceden de la página de precios de la API de Claude, a 25 de septiembre de 2026, y las de GPT-6.1 Sol de la de OpenAI, a 30 de septiembre de 2026. Los 0,10 $ de la caché de Argon salen del descuento del 95 % sobre la entrada que indica Google.

Un ejemplo para comprobarlo: una solicitud con 100.000 tokens de entrada nueva y 20.000 de salida, sin caché. Con Argon a precio de lanzamiento son 0,1 × 2 + 0,02 × 10 = 0,40 $. Con GPT-6.1 Sol, lo mismo, 0,40 $. Con Opus 5.5, 0,1 × 4 + 0,02 × 20 = 0,80 $, y con Argon cuando termine el periodo de lanzamiento, también 0,80 $.

Así que, a igualdad de tokens, Argon cuesta hoy lo mismo que GPT-6.1 Sol y la mitad que Opus 5.5. El problema es que ninguna tarea real consume los mismos tokens en tres modelos distintos.

El coste por tarea que mide Artificial Analysis

Artificial Analysis ejecuta su Intelligence Index, un conjunto de diez evaluaciones en la versión 4.3.2, y publica cuánto costó cada modelo por tarea del índice. Los proveedores permiten elegir el nivel de razonamiento (effort), es decir, cuántos tokens dedica el modelo a pensar antes de responder, y de Argon solo hay una configuración publicada, High. La comparación justa es, por tanto, la de los tres en ese mismo nivel:

Nivel alto de razonamiento (high)Puntuación en el índiceCoste por tarea del índiceTarifa aplicada (entrada / salida)
Claude Opus 5.5541,82 $4 $ / 20 $
Gemini 4 Argon531,99 $2 $ / 10 $, de lanzamiento
GPT-6.1 Sol500,32 $2 $ / 10 $

Datos de Argon a 1 de octubre de 2026; los de Opus 5.5 y GPT-6.1 Sol, a 30 de septiembre de 2026. Artificial Analysis repite estas mediciones con el tiempo y la incertidumbre de la puntuación compuesta ronda un punto.

Tarifa por millón de tokens y coste por tarea en nivel alto según Artificial Analysis: Opus 5.5 1,82 $, Gemini 4 Argon 1,99 $ y GPT-6.1 Sol 0,32 $

De la tabla salen tres conclusiones:

  • Argon y Opus 5.5 empatan en puntuación. 53 frente a 54 queda dentro del margen de la medición. Los tres puntos que separan a GPT-6.1 Sol de Argon son una diferencia pequeña.
  • Argon cuesta 6,2 veces más por tarea que GPT-6.1 Sol (1,99 ÷ 0,32) con la misma tarifa. La diferencia no está en el precio del token, sino en cuántos tokens gasta cada modelo para terminar: Argon generó 110 millones de tokens de salida en el índice.
  • Argon cuesta algo más por tarea que Opus 5.5 (1,99 $ frente a 1,82 $), aunque el token de Opus vale el doble. La ventaja de tarifa se consume entera en tokens.

Subir el nivel de razonamiento de Sol tampoco altera el cuadro. En su nivel máximo, GPT-6.1 Sol obtiene 52 puntos a 0,72 $ por tarea: un punto menos que Argon en high por el 36 % de su coste. Opus 5.5 en su nivel máximo llega a 58 puntos, pero a 5,98 $ por tarea. La cifra «Opus 58 frente a Argon 53» pone el nivel máximo de uno contra el nivel alto del otro; no existe todavía una cifra de Argon por encima de high con la que compararlo.

Qué pasa cuando termine el precio de lanzamiento

Google no ha dicho cuánto dura el periodo de lanzamiento. Tampoco ha publicado si el descuento del 95 % en caché se mantiene después; los 0,20 $ por millón que calcula VentureBeat son una suposición que el propio medio presenta como tal.

Si Argon consumiera los mismos tokens con la tarifa posterior de 4 $ y 20 $, y toda su factura se duplicara, el coste por tarea del índice pasaría de 1,99 $ a unos 4 $. Eso es aproximadamente 2,2 veces lo de Opus 5.5 en high y 12 veces lo de GPT-6.1 Sol en high. Es una proyección aritmética, no una factura, y depende de una tarifa de caché que aún no existe; sirve para una cosa: un presupuesto calculado con el precio de lanzamiento no es el presupuesto del año que viene.

Esto ya se ve en Vals AI, que evaluó Argon con la tarifa posterior y el nivel de razonamiento alto. En su índice, Argon cuesta 15,68 $ por prueba y Opus 5.5, 32,14 $; según la consulta de esa clasificación que publica Kingy AI, GPT-6.1 Sol queda en 3,24 $. La misma fuente señala que la fila de Opus corresponde al nivel máximo, no al alto, de modo que la mitad de coste de Argon frente a Opus en Vals no contradice el empate de Artificial Analysis: son niveles distintos. Vals advierte además de que el coste de Argon se dispara en tareas largas de agente: 193,78 $ por prueba en CUA-bench y 57,82 $ en Code Migration.

Para el detalle de la factura entre los dos modelos que ya puedes usar, con el umbral de 272.000 tokens y la caché, está la comparativa Claude Opus 5.5 vs GPT-6 Sol y 6.1 Sol.

Lo que dice Google y lo que miden terceros

La tabla de Google no incluye GPT-6.1 Sol

La tabla del anuncio compara Argon con GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. GPT-6.1 Sol no aparece en ninguna fila, así que de esa tabla no se puede extraer nada sobre él. Son resultados que publica el propio fabricante y que nadie ha reproducido de forma independiente.

Frente a Opus 5.5, Argon queda por delante en 14 de las 18 filas en las que ambos tienen puntuación, y Opus en cuatro. Las cuatro son relevantes si lo tuyo es código y agentes en terminal:

Prueba (tabla de Google, en %)Gemini 4 ArgonClaude Opus 5.5
Terminal-bench 4.057,466,4
FrontierSWE v255,062,3
Terminal-Bench Science 0.157,663,3
PostTrainBench45,349,3
DeepSWE v1.177,974,2
Vibe Code Bench91,990,3
AutomationBench51,342,5
Vals Finance Agent v265,458,6
Harvey Legal Agent19,63,8
LABBench 288,873,1
GraphWalks 256k–1M84,266,8
LVBench91,783,7

Las ventajas más amplias de Argon están en trabajo de análisis (finanzas, legal, automatización), en ciencia y en contexto muy largo. En programación el reparto es mixto: gana en DeepSWE y Vibe Code Bench por poco y pierde con claridad en Terminal-bench 4.0 y FrontierSWE.

La metodología de Google está en un PDF aparte. Según la lectura que hace Kingy AI de ese documento, las pruebas usan el nivel de razonamiento más alto, DeepSWE se ejecutó con el arnés mini-swe, la prueba de ciencia en terminal tuvo seis veces más tiempo de verificación y LVBench dio a cada modelo un número distinto de fotogramas de vídeo. Es la interpretación de un tercero, pero basta para no tratar cada fila como una comparación en condiciones idénticas.

Sobre seguridad, el texto de Google afirma que Argon lidera en resistencia a la inyección de instrucciones. VentureBeat recoge del gráfico del anuncio una tasa de éxito de ataque del 0,7 % en Argon y del 1,0 % en Opus 5.5; la cifra de Sol que figura allí, 27,0 %, es de GPT-6 Sol, el modelo anterior, y no hay dato de GPT-6.1 Sol.

Las mediciones independientes

Hay tres fuentes ajenas a Google, y miden cosas distintas:

  • Artificial Analysis, con el mismo nivel de razonamiento: Opus 5.5 con 54 puntos, Argon con 53 y GPT-6.1 Sol con 50. Empate entre los dos primeros.
  • Vals Index, un conjunto de tareas de finanzas, código, legal y fiscal: Argon es primero de 41 modelos con un 68,90 %, por delante de Claude Sonnet 5.5 (67,04 %) y Claude Opus 5.5 (66,97 %). La distancia con Opus es de unos dos puntos. GPT-6.1 Sol figura con un 61,15 % en la consulta de Kingy AI. Vals también señala un punto débil: 4,83 % en CUA-bench, séptimo de ocho.
  • Arena, votos de preferencia entre respuestas: según Kingy AI, en la clasificación de texto del 30 de septiembre de 2026 Argon High es primero con 1.525 ±9 puntos y Opus 5.5 High tiene 1.504 ±10. GPT-6.1 Sol no estaba en esa tabla. Son preferencias de usuarios, no tareas resueltas.

¿Argon es realmente mejor que Opus 5.5, o solo en la tabla de Google? En trabajo de análisis y documentos, las mediciones de terceros apuntan en la misma dirección que Google, con una ventaja pequeña. En agentes de terminal, la propia tabla de Google pone a Opus por delante. Y en el índice general de Artificial Analysis, con el mismo nivel de razonamiento, no hay diferencia.

GPT-6.1 Sol queda por debajo de los otros dos en puntuación, entre tres y ocho puntos según la fuente, a una fracción del coste. Si dudas entre los modelos de OpenAI, la comparativa GPT-6.1 Sol vs Astra vs GPT-6 Sol entra en cuándo compensa Astra.

Qué significa la salida de 1M de tokens

Google dice que amplía el límite de salida de Argon a 1M de tokens, desde los 64.000 anteriores, y lo explica como margen para que el modelo «piense en profundidad y genere cientos de miles de tokens en una sola trayectoria». Es decir, ese límite incluye el razonamiento; no es una promesa de un millón de tokens de respuesta visible.

Vals, que sí ha evaluado un punto de acceso real, indica un contexto de 1M y una salida máxima de 262.000 tokens. Artificial Analysis recoge 1M de contexto, entrada de texto e imagen y salida de texto. El anuncio de Google, por su parte, no da ninguna cifra de ventana de contexto. Hasta que exista documentación de la API, la contradicción entre 1M y 262.000 queda sin resolver, y no conviene diseñar un flujo que dependa de respuestas de cientos de miles de tokens.

Hay una consecuencia práctica aunque el límite sea el mayor: la salida es la partida más cara, 10 $ por millón ahora y 20 $ después. Una sola trayectoria de 300.000 tokens de salida cuesta 3 $ con el precio de lanzamiento y 6 $ con el posterior, solo en salida. Las cifras de CUA-bench y Code Migration que publica Vals muestran hasta dónde sube la factura en trayectorias largas.

Qué usar ahora y qué probar cuando Argon se abra

Esta semana

  • Empieza por GPT-6.1 Sol si el volumen pesa en tu presupuesto o si puedes medir la calidad con tus propias pruebas. A 0,32 $ por tarea del índice en nivel alto, y 0,72 $ en el máximo, tienes margen para subir el nivel de razonamiento antes de acercarte al coste de los otros dos.
  • Elige Claude Opus 5.5 si cada fallo te cuesta horas de revisión o si tu trabajo son agentes en terminal y cambios largos en repositorios, que es donde conserva ventaja incluso en la tabla de Google. Con el nivel máximo alcanza 58 puntos, la cifra más alta de las tres familias, a 5,98 $ por tarea. Antes de fijarlo, mira si Sonnet 5.5 gasta menos por tarea en tu caso; el detalle de tarifas y límites está en Claude Opus 5.5: precio de la API y restablecimiento de límites.
  • No pares un proyecto para esperar a Argon. No hay fecha, no hay límites de uso publicados y la ventaja medida por terceros es de uno o dos puntos donde existe. Lo razonable es construir con uno de los dos modelos disponibles y dejar el cambio de modelo aislado en una capa de tu código.

El día que Argon llegue a la API

Estas comprobaciones deciden si te conviene, y ninguna se puede hacer todavía:

  1. Coste por tarea aceptada en tus propias tareas, no por token. Ejecuta el mismo lote en Argon, Opus 5.5 y GPT-6.1 Sol y divide el gasto entre las tareas que dan por buenas tus pruebas.
  2. Tokens de salida por tarea. Es la variable que explica el 6,2x frente a Sol. Fija un máximo de salida y vigila cuánto razonamiento consume.
  3. Niveles de razonamiento por debajo de high. Opus baja de 1,82 $ a 1,34 $ por tarea en el nivel medio con 51 puntos; si Argon ofrece niveles equivalentes, puede que su punto útil sea otro.
  4. Fecha de fin del precio de lanzamiento y tarifa de caché posterior. Calcula el presupuesto con 4 $ y 20 $ desde el principio.
  5. Salida máxima real, 1M o 262.000, y los límites de uso de tu nivel de cuenta.
  6. Tu tipo de tarea frente a los puntos débiles conocidos: agentes de terminal, FrontierSWE y uso de ordenador (CUA-bench).

Si lo que buscas es el precio más bajo y no el modelo más capaz, los tres quedan fuera de la respuesta; la comparativa de precios de API de IA cubre ese caso. Y para entender de dónde venían las expectativas sobre este modelo, Gemini 4 vs GPT-6 vs Fable 5.2 reúne lo que decían las filtraciones antes del anuncio.

Preguntas frecuentes

¿Ya se puede usar Gemini 4 Argon?

Solo si tu organización forma parte del programa Fairwind de Google. A 1 de octubre de 2026 no hay API pública, identificador de modelo ni fecha. Google ha dicho que abrirá primero a los clientes de pago de la API y a los suscriptores de Google AI Ultra.

¿Gemini 4 Argon cuesta lo mismo que GPT-6.1 Sol?

Por token, sí mientras dure el precio de lanzamiento: 2 $ de entrada, 0,10 $ de entrada en caché y 10 $ de salida por millón. Por tarea, no: con el nivel alto de razonamiento, Artificial Analysis mide 1,99 $ en Argon y 0,32 $ en GPT-6.1 Sol. Después del lanzamiento la tarifa de Argon sube a 4 $ y 20 $, la misma que Opus 5.5.

¿Gemini 4 Argon es mejor que Claude Opus 5.5?

Depende de la tarea. En la tabla de Google gana en 14 de 18 pruebas, sobre todo en análisis, ciencia y contexto largo, y pierde en Terminal-bench 4.0, FrontierSWE v2, PostTrainBench y Terminal-Bench Science. En Vals Index queda unos dos puntos por delante, y en Artificial Analysis, con el mismo nivel de razonamiento, empatan: 53 frente a 54.

¿Merece la pena esperar a Argon en lugar de construir con Opus 5.5 o GPT-6.1 Sol?

No, si tienes que entregar algo este mes. Sin fecha ni límites publicados, esperar es parar. Construye con el modelo disponible que encaje en tu coste por tarea y repite la prueba con Argon cuando llegue a la API, con la tarifa de 4 $ y 20 $ en el cálculo.

Ilustración de un encargo de interiorismo para elegir entre FLUX.2 Flex y Pro
Precios y planes de API

FLUX.2 Flex o Pro: cómo elegir y calcular el coste de un encargo

FLUX.2 Pro permite empezar con un coste menor; Flex añade controles para trabajos que exigen más precisión. Aprende a presupuestar un encargo contando resolución, referencias e intentos, con precios de BFL en dólares.

8 min