Saltar al contenido principal

Claude Sonnet 5.5 vs GPT-6 Astra: cuándo cambiar y qué pagas

Sonnet 5.5 solo supera a GPT-6 Astra en esfuerzo max, donde cuesta unas 2,3 veces más por tarea. Su tarifa es 5 veces menor y la brecha crece pasados 272K.

LaoZhang AI TeamPublicado15 min de lectura
En esta página
Claude Sonnet 5.5 frente a GPT-6 Astra en esfuerzo max: 56 frente a 53 puntos y 7,60 $ frente a 3,26 $ por tarea en el índice de Artificial Analysis

No cambies de GPT-6 Astra a Claude Sonnet 5.5 solo por el titular. El «Sonnet 5.5 supera a Astra» sale del índice de Artificial Analysis con los dos modelos en esfuerzo max (56 frente a 53 puntos), y en ese ajuste Sonnet gasta unas 2,3 veces más por tarea del índice (7,60 $ frente a 3,26 $) porque genera unas 7 veces más tokens de salida. Con la misma etiqueta de esfuerzo, Astra puntúa más de low a high y empata en xhigh.

Sonnet 5.5 sí merece una prueba como sustituto cuando la tarifa pesa en tu factura: cobra la quinta parte por token (2 $ / 10 $ frente a 10 $ / 50 $ por millón de tokens de entrada y salida) y, cuando una petición supera los 272K tokens de entrada, Astra factura toda la petición a tarifa de contexto largo, así que en una petición de 300K tokens de entrada y 20K de salida la diferencia llega a unas 9,4 veces. Quédate con Astra para agentes de terminal, ciencia y operaciones, para tareas largas en las que el tiempo cuenta y para flujos que dependen de herramientas alojadas de OpenAI. Y si lo que buscas es un modelo potente al precio de Sonnet, el equivalente de OpenAI no es Astra sino GPT-6 Sol, que cobra exactamente lo mismo. Precios de la API directa en dólares, a 29 de septiembre de 2026.

Qué mide de verdad el «supera a Astra»

Los dos modelos aceptan cinco niveles de esfuerzo de razonamiento (effort): low, medium, high, xhigh y max. Cuanto más alto, más piensa el modelo, más tokens de salida genera y más tarda. Por eso una sola cifra no dice nada si no lleva al lado el esfuerzo con que se midió.

Artificial Analysis (AA) publica su índice de inteligencia para cada nivel. Estos son los datos de la versión 4.3.2 a 29 de septiembre de 2026; el coste por tarea es lo que le costó a AA, a precios de lista, resolver cada tarea de su batería de 10 evaluaciones:

EsfuerzoSonnet 5.5: puntosSonnet 5.5: coste por tareaGPT-6 Astra: puntosGPT-6 Astra: coste por tarea
low360,41 $460,82 $
medium410,59 $501,54 $
high471,08 $511,73 $
xhigh522,74 $522,31 $
max567,60 $533,26 $

Fuente: Artificial Analysis, índice v4.3.2. AA evaluó una versión de Sonnet 5.5 anterior al lanzamiento que tenía un fallo con las salidas estructuradas; Anthropic lo corrigió en la versión pública y AA prevé repetir esas pruebas, así que las cifras de Sonnet pueden moverse.

De la tabla salen cuatro lecturas:

  • El titular compara max con max. Es el único nivel en el que Sonnet va por delante, y ahí cada tarea le cuesta 2,3 veces lo que a Astra. AA mide unos 193.000 tokens de salida por tarea para Sonnet 5.5 en max, la cifra más alta que ha registrado y unas 7 veces la de Astra en max.
  • A puntuación parecida, Astra sale más barato. Astra en low saca 46 puntos por 0,82 $; Sonnet necesita high para llegar a 47, por 1,08 $. En xhigh empatan a 52, con 2,31 $ para Astra y 2,74 $ para Sonnet.
  • Sonnet solo es más barato por tarea en low y medium, donde saca 36 y 41 puntos, menos que cualquier ajuste de Astra. AA lo resume así: Sonnet 5.5 queda fuera de la frontera de mejor relación entre inteligencia y coste por tarea, y en esfuerzos bajos hay configuraciones de Astra o de GPT-6 Sol que rinden lo mismo por menos.
  • El ajuste por defecto no es el del titular. En la API, Sonnet 5.5 usa high por defecto (47 puntos en AA); en las apps de Claude y en Claude Code, medium (41). OpenAI no documenta cuál es el esfuerzo por defecto de Astra, y Astra no acepta none.

Barras de puntos y coste por tarea de Sonnet 5.5 y GPT-6 Astra en cada nivel de esfuerzo: Astra puntúa más de low a high, empatan en xhigh y Sonnet solo gana en max, con 7,60 $ por tarea frente a 3,26 $

Una advertencia sobre las etiquetas: high en Anthropic y high en OpenAI son nombres que cada proveedor calibra a su manera, no la misma cantidad de cálculo. Comparar por etiqueta sirve de referencia; lo que cuenta es la pareja de puntuación y coste.

Vals: 13 de 19 pruebas, con letra pequeña

Vals AI enfrentó a los dos modelos en max en 19 pruebas compartidas (datos a 29 de septiembre de 2026). Sonnet 5.5 queda por delante en 13 y Astra en 6, pero en 9 de las 19 los márgenes de error de ±1 desviación típica se solapan, y Vals avisa de que el recuento no es una prueba de significación estadística.

En el Vals Index, Sonnet saca 69,22 % frente al 66,61 % de Astra. En esa misma batería, a Sonnet le costó 20,80 $ frente a 19,09 $ y tardó 1 h 10 min frente a 25 min 11 s. Sonnet se evaluó con respaldo automático a Sonnet 5 en el servidor cuando rechazaba una tarea; si esas tareas se cuentan como fallos, su índice baja a 68,89 %.

Cifras de proveedores que no se pueden juntar

Si ves «70,6 % frente a 57,9 % en Terminal-Bench 4.0», no lo tomes como una comparación: el 70,6 % sale de la página de Anthropic y el 57,9 % de la de OpenAI, cada uno con su propio entorno de pruebas. La tabla de lanzamiento de Anthropic compara Sonnet 5.5 con GPT-6 Sol, no con Astra, y la de OpenAI no incluye a Sonnet. Las mediciones independientes ni siquiera coinciden en quién gana esa prueba: AA da 64 % a Sonnet en max frente a 60 % de Astra en xhigh, y Vals da 53,03 % a Sonnet frente a 57,07 % de Astra.

Lo mismo pasa con «más de un 30 % más rápido y hasta un 30 % más barato»: Anthropic lo dice respecto a Sonnet 5, no respecto a Astra. Y depende del esfuerzo: AA midió en max un coste por tarea de Sonnet 5.5 alrededor de un 50 % superior al de Sonnet 5 en max.

Cuánto pagas: 5 veces en la tarifa, otra cosa en la factura

Tarifas de la API directa por millón de tokens, a 29 de septiembre de 2026 (Anthropic, OpenAI):

ConceptoClaude Sonnet 5.5GPT-6 Astra (hasta 272K de entrada)GPT-6 Astra (más de 272K de entrada)
Entrada2 $10 $20 $
Entrada leída de caché0,20 $1 $2 $
Escritura en caché2,50 $ (5 min) / 4 $ (1 h)12,50 $25 $
Salida10 $50 $75 $
Batch1 $ / 5 $5 $ / 25 $10 $ / 37,50 $

Sonnet 5.5 no tiene recargo por contexto largo en toda su ventana de un millón de tokens: una petición de 900.000 tokens paga por token lo mismo que una de 9.000. Astra, en cambio, pasa toda la petición a la tarifa larga en cuanto la entrada supera 272K: el doble en entrada y caché y 1,5 veces en salida. Otros ajustes: Astra ofrece modo Fast al doble de precio (sin garantía de latencia) y Flex a mitad de precio; Sonnet 5.5 no tiene modo rápido. La residencia de datos suma un 10 % en Astra y la inferencia solo en EE. UU. multiplica por 1,1 en Sonnet.

Con los mismos recuentos de tokens, sin caché ni herramientas, la cuenta queda así:

PeticiónSonnet 5.5GPT-6 AstraRelación
100K entrada + 20K salida0,1 × 2 + 0,02 × 10 = 0,40 $0,1 × 10 + 0,02 × 50 = 2,00 $5 veces
250K entrada + 20K salida0,25 × 2 + 0,02 × 10 = 0,70 $0,25 × 10 + 0,02 × 50 = 3,50 $5 veces
300K entrada + 20K salida0,3 × 2 + 0,02 × 10 = 0,80 $0,3 × 20 + 0,02 × 75 = 7,50 $unas 9,4 veces

Fíjate en el salto entre la segunda y la tercera fila: 50.000 tokens más de entrada llevan a Astra de 3,50 $ a 7,50 $, mientras Sonnet solo sube 10 céntimos. Si tus peticiones rondan ese umbral (repositorios enteros, contratos largos, historiales de agente), la tarifa pesa mucho más que en peticiones cortas. El detalle de las tarifas largas de Astra está en Precio de la API de GPT-6 Astra: coste real, contexto largo y acceso.

Coste por petición con 20K tokens de salida: con 100K y 250K de entrada Astra cuesta 5 veces más que Sonnet 5.5, y con 300K pasa a 7,50 $ frente a 0,80 $ al superar el umbral de 272K

Estas cuentas son aritmética con recuentos idénticos, no una factura. En la práctica los dos modelos no gastan los mismos tokens para la misma tarea: los tokenizadores son distintos, los tokens de razonamiento se cobran como salida y los reintentos se suman. El caso más claro es el de la tabla de AA: con una tarifa 5 veces menor, Sonnet en max acaba costando 2,3 veces más por tarea porque escribe unas 7 veces más. La relación de 5 a 1 solo se mantiene en tu factura si los dos modelos producen una cantidad de salida parecida, algo más probable en esfuerzos bajos y en respuestas cortas.

Cuál usar según el tipo de trabajo

Ninguno de los dos gana en todo. Este reparto sale de las mediciones de AA y Vals citadas arriba y de las tarifas; tómalo como punto de partida para tu propia prueba:

Tipo de trabajoPunto de partidaPor qué
Peticiones con más de 272K tokens de entradaPrueba Sonnet 5.5Por token, Astra cobra 10 veces más en entrada y 7,5 veces más en salida en ese tramo
Chat y tareas cortas sensibles a la latenciaPrueba Sonnet 5.5 en low o mediumEn low, AA mide 0,92 s hasta el primer token de respuesta frente a 2,42 s de Astra; comprueba que la calidad te basta, porque en low saca 36 puntos frente a 46
Agentes de terminal, flujos científicos y operaciones (SRE)Quédate con AstraEn Vals, Astra saca 65,71 % frente a 38,57 % en Terminal-Bench Science y 56,87 % frente a 30,15 % en SRE Bench
Programación competitiva y algoritmosQuédate con AstraEn Vals, IOI: 100 % frente a 83,06 %
Agentes legales, fiscales y financierosPrueba Sonnet 5.5 si buscas calidadEn Vals, Tax Agent Bench 73,39 % frente a 63,34 % y Legal Research Bench 48,08 % frente a 39,42 %; en max, a Sonnet le costó más por prueba que a Astra (9,25 $ frente a 5,80 $ en la fiscal)
Tareas largas de agente en maxQuédate con Astra o baja el esfuerzo de SonnetEn Vals, la migración de código tardó 3 h 20 min con Sonnet (75,83 $) frente a 58 min 30 s con Astra (44,36 $)
Flujos con herramientas alojadas de OpenAI (hosted_shell, image_generation, code_interpreter)Quédate con AstraEsas herramientas son de la API Responses de OpenAI; con Claude tendrías que rehacerlas
Investigación en ciberseguridadNo cambies por esa pruebaLa ventaja de Sonnet en CyberBench (59,58 % frente a 41,07 %) cae a 41,97 %, casi lo mismo que Astra, si las tareas resueltas por el respaldo a Sonnet 5 cuentan como fallos
Quieres calidad alta al precio de SonnetCompara también con GPT-6 SolGPT-6 Sol cobra 2 $ / 10 $, como Sonnet 5.5; AA sitúa a Sonnet en high muy cerca de GPT-6 Sol en inteligencia con prácticamente el mismo coste por tarea

Repartir también es una opción razonable: los documentos largos van a Sonnet 5.5 y los agentes de terminal se quedan en Astra. Ambos están en Amazon Bedrock (Astra, en us-west-2), lo que ahorra gestionar otra cuenta de proveedor, aunque no evita las diferencias de API que verás más abajo.

Sobre ciberseguridad hay un detalle más: en las apps de Claude, cuando Sonnet 5.5 detecta contenido de ciberseguridad o de desarrollo de modelos de IA de frontera, puede pasar la conversación a Sonnet 5; las peticiones de biología peligrosa se bloquean.

Si la duda real es qué modelo de OpenAI elegir a igual precio, GPT-6 Sol, Luna y Astra frente a Terra: precios y cuál probar primero lo compara dentro de la misma API. Si lo que necesitas es la puntuación más alta, AA pone por delante a Claude Opus 5.5 en max con 58 puntos; la comparación con su rival de OpenAI está en Claude Opus 5.5 vs GPT-6 Sol: cuál probar primero y qué pagas.

Suscripción o API

Las tarifas de la API no dicen nada de lo que incluye una suscripción. En ChatGPT, GPT-6 Pro (que funciona con Astra) está en el chat de los planes Pro de 100 $ y 200 $, Business y Enterprise; Plus tiene Astra en ChatGPT Work y en Codex, pero no GPT-6 Pro en el chat; Free y Go no tienen Astra. Para Codex, OpenAI publica estimaciones de mensajes locales cada 5 horas (por ejemplo, de 5 a 45 en Plus), no límites fijos. En Claude, Sonnet 5.5 aparece en la web, las apps móvil y de escritorio, Cowork y Claude Code, con esfuerzo medium por defecto; Anthropic no publica qué planes lo incluyen.

Qué cambia en tu código antes de mover tráfico

Pasar de Astra a Sonnet 5.5 no es cambiar un nombre de modelo: cambias de proveedor y de API. Si ya usas Sonnet 5, el salto a 5.5 también trae cambios incompatibles.

Si vienes de GPT-6 Astra

  • Otra API. Pasas de Responses o Chat Completions de OpenAI a la API Messages de Anthropic, con otro formato de herramientas y otro tokenizador. Las herramientas alojadas de OpenAI no tienen traslado directo.
  • Parámetros de muestreo. Con Astra ya tienes que prescindir de temperature y top_p, porque siempre razona (no admite none). En Sonnet 5.5, cualquier valor de temperature, top_p o top_k distinto del predeterminado devuelve un error 400. Si tus prompts ya funcionan sin ellos, se trasladan con menos trabajo.
  • Uso forzado de herramientas. tool_choice con any o con una herramienta concreta devuelve 400 en Sonnet 5.5. Usa auto con strict: true o salidas estructuradas, y pide en el prompt que llame a la herramienta.
  • Prefill. Terminar la conversación con un turno del asistente prerrellenado devuelve 400; la conversación debe acabar con un mensaje del usuario.
  • Caché. Anthropic cobra escrituras explícitas de 5 minutos o 1 hora y admite prompts de caché desde 512 tokens; en Astra la duración se fija con prompt_cache_options.ttl en "30m". Recalcula tu tasa de aciertos de caché con el nuevo esquema antes de comparar precios.
  • Texto entre llamadas a herramientas. Sonnet 5.5 devuelve las notas de progreso entre herramientas como bloques thinking, vacíos con el valor por defecto display: "omitted". Si tu interfaz muestra ese texto al usuario, se quedará en silencio sin dar error hasta que cambies thinking.display o uses between_tools.
  • Esfuerzo. Las escalas no equivalen entre proveedores. Anthropic recomienda empezar en high, bajar a medium para programación con agentes en tareas bien definidas y usar medium o low para chat.

Si necesitas poner Astra en marcha para la comparación, sigue Cómo acceder a GPT-6 Astra por API y comprobar la primera respuesta; para el lado de Claude, cómo elegir un acceso estable a Claude repasa la API directa, las nubes compatibles y la pasarela de laozhang.ai.

Si ya usas Sonnet 5

Anthropic lista cinco cambios incompatibles al pasar a Sonnet 5.5 (guía de migración):

  1. thinking: {"type": "disabled"} y los presupuestos manuales con budget_tokens devuelven 400. Para quitar el razonamiento inicial se usa thinking: {"type": "between_tools"}, que solo funciona en low, medium y high.
  2. El uso forzado de herramientas devuelve 400 (ver arriba).
  3. Los bloques de razonamiento quedan ligados al modelo, a la conversación y a la cuenta. En cuentas creadas desde el 31 de agosto de 2026, reenviar un bloque después de editar el historial anterior (prompt de sistema, herramientas o mensajes previos) devuelve 400. Mantén las conversaciones en modo solo añadir.
  4. En la API de Claude y en Google Cloud se rechaza la herramienta computer_20251124; hay que pasar a computer_toolset_20260801.
  5. La herramienta advisor no acepta Opus 4.8, Opus 4.7 ni Sonnet 5 como asesores.

Los precios y el tokenizador son los mismos que en Sonnet 5, así que tu conciliación de facturas sigue valiendo; el cálculo detallado está en Anthropic cancela la subida de Sonnet 5: tarifas y cálculo del coste. Lo que no debes arrastrar es el nivel de esfuerzo: Anthropic los ha recalibrado en 5.5 y recomienda repetir el barrido.

Cómo probarlo con tus propias tareas

La cifra que decide es el coste por tarea aceptada: todo lo que pagas en una prueba dividido entre las tareas que cumplen tu criterio de aceptación. Incluye los reintentos y el trabajo que una persona tiene que rehacer, que es donde un modelo barato puede salir caro.

  1. Elige entre 20 y 50 tareas reales con una regla de aceptación clara: pasa los tests, el revisor no cambia nada de fondo, el extracto coincide con el documento.
  2. Fija una pareja de esfuerzos y decláralo. Por ejemplo, Sonnet 5.5 en high frente a Astra en medium y en high; después sube un nivel en ambos. Mismas entradas, mismas herramientas.
  3. Guarda el uso facturado de cada llamada. En Anthropic: input_tokens, cache_creation_input_tokens, cache_read_input_tokens y output_tokens. En OpenAI: input_tokens, input_tokens_details.cached_tokens, output_tokens y output_tokens_details.reasoning_tokens. Apunta también los reintentos, el tiempo total y los minutos de corrección humana.
  4. Calcula el coste total de cada modelo y divídelo entre sus tareas aceptadas.
  5. Cambia solo si Sonnet 5.5 supera el mismo listón con menor coste por tarea aceptada. Si lo supera en unos tipos de tarea y no en otros, reparte.

Para una primera estimación antes de la prueba, este cálculo reproduce las tarifas de la tabla (sin caché, precios estándar):

python
# USD por millón de tokens, API directa, a 29 de septiembre de 2026
def coste_sonnet_55(entrada, salida):
    return (entrada * 2 + salida * 10) / 1_000_000

def coste_astra(entrada, salida):
    if entrada > 272_000:  # toda la petición pasa a la tarifa larga
        return (entrada * 20 + salida * 75) / 1_000_000
    return (entrada * 10 + salida * 50) / 1_000_000

print(coste_sonnet_55(300_000, 20_000))  # 0.8
print(coste_astra(300_000, 20_000))      # 7.5

La cuenta supone la misma salida para los dos. Si en tu prueba Sonnet necesita, por ejemplo, el triple de tokens de salida que Astra para la misma tarea, pasa el triple a coste_sonnet_55; en max, las mediciones de AA apuntan a unas 7 veces.

Preguntas frecuentes

¿Vale la pena pagar GPT-6 Astra si Sonnet 5.5 cuesta cinco veces menos?

Por token, Astra cuesta 5 veces más en peticiones de hasta 272K tokens de entrada y entre 7,5 y 10 veces más por encima, según el peso de la entrada y de la salida. Por tarea, la diferencia puede desaparecer o invertirse: en el índice de AA, Astra llega a la misma puntuación o más con menos coste por tarea, y Sonnet solo sale más barato por tarea en low y medium, con puntuaciones más bajas. Vale la pena en agentes de terminal, ciencia y operaciones, y cuando el tiempo de respuesta de tareas largas importa.

¿Qué es mejor para programar, Opus 5.5 o Sonnet 5.5?

En el índice de AA, Opus 5.5 en max saca 58 puntos frente a 56 de Sonnet 5.5 en max, y Sonnet usa en ese nivel alrededor de un 60 % más tokens de salida por tarea. En Terminal-Bench 4.0, AA da ventaja a Sonnet (64 % frente a 60 %). AA añade que, en los esfuerzos altos, Sonnet queda por detrás de Opus 5.5 en la relación entre inteligencia y coste por tarea. Para la programación diaria en esfuerzos más bajos, decide con la misma prueba de coste por tarea aceptada.

¿En qué planes de Claude está Sonnet 5.5?

Anthropic confirma que Sonnet 5.5 está en la web, las apps y Claude Code, con esfuerzo medium por defecto, pero no publica una lista de planes que lo incluyan. En la API está disponible para todos los clientes como claude-sonnet-5-5.

¿Por qué Claude cambió a Sonnet 5 en mitad de mi conversación?

Cuando Sonnet 5.5 marca una petición como de ciberseguridad o de desarrollo de modelos de IA de frontera, la app puede pasar la conversación a Sonnet 5. En la API, los rechazos llegan con stop_reason: "refusal" y un objeto stop_details que indica la categoría.

Ilustración de un encargo de interiorismo para elegir entre FLUX.2 Flex y Pro
Precios y planes de API

FLUX.2 Flex o Pro: cómo elegir y calcular el coste de un encargo

FLUX.2 Pro permite empezar con un coste menor; Flex añade controles para trabajos que exigen más precisión. Aprende a presupuestar un encargo contando resolución, referencias e intentos, con precios de BFL en dólares.

8 min
Expedientes de Gemini 4, GPT-6 Astra y Fable 5.2 que distinguen anuncios, documentación e información por confirmar
Comparativas de modelos

Gemini 4 vs GPT-6 vs Fable 5.2: qué revelan las filtraciones

Las primeras demostraciones atribuidas a Gemini 4 y al próximo Fable apuntan a mejoras en detalle visual y código, con posibles costes de tiempo y dinero. Contrastamos los casos frente a Astra y explicamos qué decisiones permiten adelantar.

9 min