Gemini 4 Argon vs Claude Opus 5.5 vs GPT-6.1 Sol: cuál usar hoy
Argon aún no está en la API pública: hoy solo puedes integrar Opus 5.5 y GPT-6.1 Sol. A igual nivel de razonamiento, cuesta 6,2 veces más por tarea que Sol.
En esta página

De los tres, hoy solo puedes integrar dos. Claude Opus 5.5 y GPT-6.1 Sol están en sus API y en sus aplicaciones de pago. Gemini 4 Argon, que Google anunció el 30 de septiembre de 2026, solo llega de momento a un grupo de equipos de ciberdefensa dentro del programa Fairwind: no tiene identificador de modelo público, no aparece en la lista de precios de la API de Gemini y Google no ha dado fecha de apertura. Si tienes que elegir modelo esta semana, la decisión real es entre Opus 5.5 y GPT-6.1 Sol, y Argon es algo que conviene dejar preparado para probar.
El segundo dato que cambia la lectura de los titulares es el precio. Argon se anuncia a 2 $ por millón de tokens de entrada y 10 $ por millón de salida, lo mismo que GPT-6.1 Sol y la mitad que Opus 5.5. Pero con el mismo nivel de razonamiento, Artificial Analysis mide 1,99 $ por tarea en Argon, 1,82 $ en Opus 5.5 y 0,32 $ en GPT-6.1 Sol, con 53, 54 y 50 puntos. La tarifa de Argon se parece a la de Sol; su coste por tarea se parece al de Opus. Y el precio anunciado es de lanzamiento: después pasa a 4 $ y 20 $.
Una aclaración de nombres: «GPT 6.1» es GPT-6.1 Sol, el modelo que OpenAI publicó el 29 de septiembre de 2026, y no GPT-6 Astra, que es el que Google eligió para su tabla. Las cifras de rendimiento y de coste por tarea que aparecen a continuación proceden de Google y de mediciones de terceros, y cada una lleva indicado quién la obtuvo y en qué condiciones.
Cuál de los tres puedes integrar hoy
| Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol | |
|---|---|---|---|
| Estado a 1 de octubre de 2026 | Acceso limitado a equipos de ciberdefensa del programa Fairwind | Disponible desde el 22 de septiembre de 2026 | Disponible desde el 29 de septiembre de 2026 |
| API pública | No. Sin identificador, sin límites de uso y sin fecha | Sí, claude-opus-5-5 | Sí, gpt-6.1-sol |
| Dónde se usa | Solo dentro de Fairwind y en equipos internos de Google | Aplicaciones de Claude (Pro, Max, Team, Enterprise), Claude Code, API de Claude, AWS, Google Cloud y Azure | API de OpenAI; ChatGPT Work y Codex en Plus, Pro, Business, Enterprise y Edu |
| Contexto y salida máxima | Contexto sin cifra en el anuncio; salida de «1M» según Google, 262.000 según Vals | 1M de contexto, 128.000 tokens de salida | 1.050.000 de contexto, 128.000 tokens de salida |
| Tarifa por millón de tokens (entrada / salida) | 2 $ / 10 $ de lanzamiento; después 4 $ / 20 $ | 4 $ / 20 $ | 2 $ / 10 $ hasta 272.000 tokens de entrada; por encima, 4 $ / 15 $ |

En el anuncio de Google, Argon «se está desplegando para un conjunto de ciberdefensores de confianza» a través de Fairwind. La empresa dice que participa en el proceso voluntario del Gobierno de Estados Unidos para el acceso previo al lanzamiento y que ampliará el acceso de forma gradual, «lo antes posible», empezando por los clientes de pago de la API y los suscriptores de Google AI Ultra. No hay más calendario que ese. A 1 de octubre de 2026, la página de precios de la API de Gemini lista Gemini 3.8 Flash y Gemini 3.1 Pro Preview, entre otros, pero ninguna entrada de Argon ni de Gemini 4; esa página no describe los contratos de Vertex AI, de modo que la ausencia solo vale para la API para desarrolladores.
Fairwind es el programa de Google para defensores de confianza, y dentro de él Argon se entrega sin las restricciones de ciberseguridad que tendrá la versión general. Si trabajas en un equipo de seguridad, la guía sobre Gemini 3.8 Flash Cyber y Fairwind explica qué es el programa y quién puede entrar; se escribió para aquel modelo, y Google no ha publicado un procedimiento de solicitud específico para Argon.
En GPT-6.1 Sol hay dos detalles de acceso que conviene tener presentes: dentro de ChatGPT está en Work y en Codex, no en el chat normal ni en los planes Free y Go, y las llamadas a herramientas exigen la Responses API. El resto de cambios está en la guía de GPT-6.1 Sol.
Mismo precio por token, coste por tarea muy distinto
La tarifa, con los mismos tokens
La factura de cada modelo se puede escribir con tres cantidades, todas en millones de tokens: U es la entrada nueva, R la entrada leída de caché y O la salida, que incluye los tokens de razonamiento.
| Modelo y tramo | Coste en dólares | Lo que no entra en la fórmula |
|---|---|---|
| Gemini 4 Argon, precio de lanzamiento | 2·U + 0,10·R + 10·O | Escritura de caché, lotes y tramo de contexto largo sin publicar |
| Gemini 4 Argon, precio posterior | 4·U + 20·O | Tarifa de caché posterior sin publicar |
| GPT-6.1 Sol, hasta 272.000 tokens de entrada | 2·U + 0,10·R + 10·O | Escritura de caché a 2,50 $ por millón |
| GPT-6.1 Sol, por encima de 272.000 | 4·U + 0,20·R + 15·O | Escritura de caché a 5 $ por millón |
| Claude Opus 5.5, en todo el contexto de 1M | 4·U + 0,20·R + 20·O | Escritura de caché de 5 minutos a 5 $ por millón |
Las tarifas de Opus proceden de la página de precios de la API de Claude, a 25 de septiembre de 2026, y las de GPT-6.1 Sol de la de OpenAI, a 30 de septiembre de 2026. Los 0,10 $ de la caché de Argon salen del descuento del 95 % sobre la entrada que indica Google.
Un ejemplo para comprobarlo: una solicitud con 100.000 tokens de entrada nueva y 20.000 de salida, sin caché. Con Argon a precio de lanzamiento son 0,1 × 2 + 0,02 × 10 = 0,40 $. Con GPT-6.1 Sol, lo mismo, 0,40 $. Con Opus 5.5, 0,1 × 4 + 0,02 × 20 = 0,80 $, y con Argon cuando termine el periodo de lanzamiento, también 0,80 $.
Así que, a igualdad de tokens, Argon cuesta hoy lo mismo que GPT-6.1 Sol y la mitad que Opus 5.5. El problema es que ninguna tarea real consume los mismos tokens en tres modelos distintos.
El coste por tarea que mide Artificial Analysis
Artificial Analysis ejecuta su Intelligence Index, un conjunto de diez evaluaciones en la versión 4.3.2, y publica cuánto costó cada modelo por tarea del índice. Los proveedores permiten elegir el nivel de razonamiento (effort), es decir, cuántos tokens dedica el modelo a pensar antes de responder, y de Argon solo hay una configuración publicada, High. La comparación justa es, por tanto, la de los tres en ese mismo nivel:
| Nivel alto de razonamiento (high) | Puntuación en el índice | Coste por tarea del índice | Tarifa aplicada (entrada / salida) |
|---|---|---|---|
| Claude Opus 5.5 | 54 | 1,82 $ | 4 $ / 20 $ |
| Gemini 4 Argon | 53 | 1,99 $ | 2 $ / 10 $, de lanzamiento |
| GPT-6.1 Sol | 50 | 0,32 $ | 2 $ / 10 $ |
Datos de Argon a 1 de octubre de 2026; los de Opus 5.5 y GPT-6.1 Sol, a 30 de septiembre de 2026. Artificial Analysis repite estas mediciones con el tiempo y la incertidumbre de la puntuación compuesta ronda un punto.

De la tabla salen tres conclusiones:
- Argon y Opus 5.5 empatan en puntuación. 53 frente a 54 queda dentro del margen de la medición. Los tres puntos que separan a GPT-6.1 Sol de Argon son una diferencia pequeña.
- Argon cuesta 6,2 veces más por tarea que GPT-6.1 Sol (1,99 ÷ 0,32) con la misma tarifa. La diferencia no está en el precio del token, sino en cuántos tokens gasta cada modelo para terminar: Argon generó 110 millones de tokens de salida en el índice.
- Argon cuesta algo más por tarea que Opus 5.5 (1,99 $ frente a 1,82 $), aunque el token de Opus vale el doble. La ventaja de tarifa se consume entera en tokens.
Subir el nivel de razonamiento de Sol tampoco altera el cuadro. En su nivel máximo, GPT-6.1 Sol obtiene 52 puntos a 0,72 $ por tarea: un punto menos que Argon en high por el 36 % de su coste. Opus 5.5 en su nivel máximo llega a 58 puntos, pero a 5,98 $ por tarea. La cifra «Opus 58 frente a Argon 53» pone el nivel máximo de uno contra el nivel alto del otro; no existe todavía una cifra de Argon por encima de high con la que compararlo.
Qué pasa cuando termine el precio de lanzamiento
Google no ha dicho cuánto dura el periodo de lanzamiento. Tampoco ha publicado si el descuento del 95 % en caché se mantiene después; los 0,20 $ por millón que calcula VentureBeat son una suposición que el propio medio presenta como tal.
Si Argon consumiera los mismos tokens con la tarifa posterior de 4 $ y 20 $, y toda su factura se duplicara, el coste por tarea del índice pasaría de 1,99 $ a unos 4 $. Eso es aproximadamente 2,2 veces lo de Opus 5.5 en high y 12 veces lo de GPT-6.1 Sol en high. Es una proyección aritmética, no una factura, y depende de una tarifa de caché que aún no existe; sirve para una cosa: un presupuesto calculado con el precio de lanzamiento no es el presupuesto del año que viene.
Esto ya se ve en Vals AI, que evaluó Argon con la tarifa posterior y el nivel de razonamiento alto. En su índice, Argon cuesta 15,68 $ por prueba y Opus 5.5, 32,14 $; según la consulta de esa clasificación que publica Kingy AI, GPT-6.1 Sol queda en 3,24 $. La misma fuente señala que la fila de Opus corresponde al nivel máximo, no al alto, de modo que la mitad de coste de Argon frente a Opus en Vals no contradice el empate de Artificial Analysis: son niveles distintos. Vals advierte además de que el coste de Argon se dispara en tareas largas de agente: 193,78 $ por prueba en CUA-bench y 57,82 $ en Code Migration.
Para el detalle de la factura entre los dos modelos que ya puedes usar, con el umbral de 272.000 tokens y la caché, está la comparativa Claude Opus 5.5 vs GPT-6 Sol y 6.1 Sol.
Lo que dice Google y lo que miden terceros
La tabla de Google no incluye GPT-6.1 Sol
La tabla del anuncio compara Argon con GPT-6 Astra, Claude Fable 5.1 y Claude Opus 5.5. GPT-6.1 Sol no aparece en ninguna fila, así que de esa tabla no se puede extraer nada sobre él. Son resultados que publica el propio fabricante y que nadie ha reproducido de forma independiente.
Frente a Opus 5.5, Argon queda por delante en 14 de las 18 filas en las que ambos tienen puntuación, y Opus en cuatro. Las cuatro son relevantes si lo tuyo es código y agentes en terminal:
| Prueba (tabla de Google, en %) | Gemini 4 Argon | Claude Opus 5.5 |
|---|---|---|
| Terminal-bench 4.0 | 57,4 | 66,4 |
| FrontierSWE v2 | 55,0 | 62,3 |
| Terminal-Bench Science 0.1 | 57,6 | 63,3 |
| PostTrainBench | 45,3 | 49,3 |
| DeepSWE v1.1 | 77,9 | 74,2 |
| Vibe Code Bench | 91,9 | 90,3 |
| AutomationBench | 51,3 | 42,5 |
| Vals Finance Agent v2 | 65,4 | 58,6 |
| Harvey Legal Agent | 19,6 | 3,8 |
| LABBench 2 | 88,8 | 73,1 |
| GraphWalks 256k–1M | 84,2 | 66,8 |
| LVBench | 91,7 | 83,7 |
Las ventajas más amplias de Argon están en trabajo de análisis (finanzas, legal, automatización), en ciencia y en contexto muy largo. En programación el reparto es mixto: gana en DeepSWE y Vibe Code Bench por poco y pierde con claridad en Terminal-bench 4.0 y FrontierSWE.
La metodología de Google está en un PDF aparte. Según la lectura que hace Kingy AI de ese documento, las pruebas usan el nivel de razonamiento más alto, DeepSWE se ejecutó con el arnés mini-swe, la prueba de ciencia en terminal tuvo seis veces más tiempo de verificación y LVBench dio a cada modelo un número distinto de fotogramas de vídeo. Es la interpretación de un tercero, pero basta para no tratar cada fila como una comparación en condiciones idénticas.
Sobre seguridad, el texto de Google afirma que Argon lidera en resistencia a la inyección de instrucciones. VentureBeat recoge del gráfico del anuncio una tasa de éxito de ataque del 0,7 % en Argon y del 1,0 % en Opus 5.5; la cifra de Sol que figura allí, 27,0 %, es de GPT-6 Sol, el modelo anterior, y no hay dato de GPT-6.1 Sol.
Las mediciones independientes
Hay tres fuentes ajenas a Google, y miden cosas distintas:
- Artificial Analysis, con el mismo nivel de razonamiento: Opus 5.5 con 54 puntos, Argon con 53 y GPT-6.1 Sol con 50. Empate entre los dos primeros.
- Vals Index, un conjunto de tareas de finanzas, código, legal y fiscal: Argon es primero de 41 modelos con un 68,90 %, por delante de Claude Sonnet 5.5 (67,04 %) y Claude Opus 5.5 (66,97 %). La distancia con Opus es de unos dos puntos. GPT-6.1 Sol figura con un 61,15 % en la consulta de Kingy AI. Vals también señala un punto débil: 4,83 % en CUA-bench, séptimo de ocho.
- Arena, votos de preferencia entre respuestas: según Kingy AI, en la clasificación de texto del 30 de septiembre de 2026 Argon High es primero con 1.525 ±9 puntos y Opus 5.5 High tiene 1.504 ±10. GPT-6.1 Sol no estaba en esa tabla. Son preferencias de usuarios, no tareas resueltas.
¿Argon es realmente mejor que Opus 5.5, o solo en la tabla de Google? En trabajo de análisis y documentos, las mediciones de terceros apuntan en la misma dirección que Google, con una ventaja pequeña. En agentes de terminal, la propia tabla de Google pone a Opus por delante. Y en el índice general de Artificial Analysis, con el mismo nivel de razonamiento, no hay diferencia.
GPT-6.1 Sol queda por debajo de los otros dos en puntuación, entre tres y ocho puntos según la fuente, a una fracción del coste. Si dudas entre los modelos de OpenAI, la comparativa GPT-6.1 Sol vs Astra vs GPT-6 Sol entra en cuándo compensa Astra.
Qué significa la salida de 1M de tokens
Google dice que amplía el límite de salida de Argon a 1M de tokens, desde los 64.000 anteriores, y lo explica como margen para que el modelo «piense en profundidad y genere cientos de miles de tokens en una sola trayectoria». Es decir, ese límite incluye el razonamiento; no es una promesa de un millón de tokens de respuesta visible.
Vals, que sí ha evaluado un punto de acceso real, indica un contexto de 1M y una salida máxima de 262.000 tokens. Artificial Analysis recoge 1M de contexto, entrada de texto e imagen y salida de texto. El anuncio de Google, por su parte, no da ninguna cifra de ventana de contexto. Hasta que exista documentación de la API, la contradicción entre 1M y 262.000 queda sin resolver, y no conviene diseñar un flujo que dependa de respuestas de cientos de miles de tokens.
Hay una consecuencia práctica aunque el límite sea el mayor: la salida es la partida más cara, 10 $ por millón ahora y 20 $ después. Una sola trayectoria de 300.000 tokens de salida cuesta 3 $ con el precio de lanzamiento y 6 $ con el posterior, solo en salida. Las cifras de CUA-bench y Code Migration que publica Vals muestran hasta dónde sube la factura en trayectorias largas.
Qué usar ahora y qué probar cuando Argon se abra
Esta semana
- Empieza por GPT-6.1 Sol si el volumen pesa en tu presupuesto o si puedes medir la calidad con tus propias pruebas. A 0,32 $ por tarea del índice en nivel alto, y 0,72 $ en el máximo, tienes margen para subir el nivel de razonamiento antes de acercarte al coste de los otros dos.
- Elige Claude Opus 5.5 si cada fallo te cuesta horas de revisión o si tu trabajo son agentes en terminal y cambios largos en repositorios, que es donde conserva ventaja incluso en la tabla de Google. Con el nivel máximo alcanza 58 puntos, la cifra más alta de las tres familias, a 5,98 $ por tarea. Antes de fijarlo, mira si Sonnet 5.5 gasta menos por tarea en tu caso; el detalle de tarifas y límites está en Claude Opus 5.5: precio de la API y restablecimiento de límites.
- No pares un proyecto para esperar a Argon. No hay fecha, no hay límites de uso publicados y la ventaja medida por terceros es de uno o dos puntos donde existe. Lo razonable es construir con uno de los dos modelos disponibles y dejar el cambio de modelo aislado en una capa de tu código.
El día que Argon llegue a la API
Estas comprobaciones deciden si te conviene, y ninguna se puede hacer todavía:
- Coste por tarea aceptada en tus propias tareas, no por token. Ejecuta el mismo lote en Argon, Opus 5.5 y GPT-6.1 Sol y divide el gasto entre las tareas que dan por buenas tus pruebas.
- Tokens de salida por tarea. Es la variable que explica el 6,2x frente a Sol. Fija un máximo de salida y vigila cuánto razonamiento consume.
- Niveles de razonamiento por debajo de high. Opus baja de 1,82 $ a 1,34 $ por tarea en el nivel medio con 51 puntos; si Argon ofrece niveles equivalentes, puede que su punto útil sea otro.
- Fecha de fin del precio de lanzamiento y tarifa de caché posterior. Calcula el presupuesto con 4 $ y 20 $ desde el principio.
- Salida máxima real, 1M o 262.000, y los límites de uso de tu nivel de cuenta.
- Tu tipo de tarea frente a los puntos débiles conocidos: agentes de terminal, FrontierSWE y uso de ordenador (CUA-bench).
Si lo que buscas es el precio más bajo y no el modelo más capaz, los tres quedan fuera de la respuesta; la comparativa de precios de API de IA cubre ese caso. Y para entender de dónde venían las expectativas sobre este modelo, Gemini 4 vs GPT-6 vs Fable 5.2 reúne lo que decían las filtraciones antes del anuncio.
Preguntas frecuentes
¿Ya se puede usar Gemini 4 Argon?
Solo si tu organización forma parte del programa Fairwind de Google. A 1 de octubre de 2026 no hay API pública, identificador de modelo ni fecha. Google ha dicho que abrirá primero a los clientes de pago de la API y a los suscriptores de Google AI Ultra.
¿Gemini 4 Argon cuesta lo mismo que GPT-6.1 Sol?
Por token, sí mientras dure el precio de lanzamiento: 2 $ de entrada, 0,10 $ de entrada en caché y 10 $ de salida por millón. Por tarea, no: con el nivel alto de razonamiento, Artificial Analysis mide 1,99 $ en Argon y 0,32 $ en GPT-6.1 Sol. Después del lanzamiento la tarifa de Argon sube a 4 $ y 20 $, la misma que Opus 5.5.
¿Gemini 4 Argon es mejor que Claude Opus 5.5?
Depende de la tarea. En la tabla de Google gana en 14 de 18 pruebas, sobre todo en análisis, ciencia y contexto largo, y pierde en Terminal-bench 4.0, FrontierSWE v2, PostTrainBench y Terminal-Bench Science. En Vals Index queda unos dos puntos por delante, y en Artificial Analysis, con el mismo nivel de razonamiento, empatan: 53 frente a 54.
¿Merece la pena esperar a Argon en lugar de construir con Opus 5.5 o GPT-6.1 Sol?
No, si tienes que entregar algo este mes. Sin fecha ni límites publicados, esperar es parar. Construye con el modelo disponible que encaje en tu coste por tarea y repite la prueba con Argon cuando llegue a la API, con la tarifa de 4 $ y 20 $ en el cálculo.





