Saltar al contenido principal

Precio de la API de GPT-6 Astra: coste real, contexto largo y acceso

8 min de lecturaGuías de API

La cifra de entrada y salida no basta: separa lecturas y escrituras de caché, aplica el salto de 272K a toda la petición y comprueba modalidad, región y herramientas antes de aprobar un piloto.

Panel de GPT-6 Astra con tarifas de contexto corto y largo, fórmula de coste, modalidades, límites en la UE y pasos de un piloto

El precio publicado para GPT-6 Astra en la API directa de OpenAI parte de 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida en Standard y contexto corto. Pero esas dos cifras no bastan para presupuestar una aplicación: la tarifa oficial también distingue entrada en caché, escritura en caché, contexto largo y modalidad de procesamiento.

Además, el acceso se está ampliando de forma gradual. OpenAI anunció un despliegue inicial para un conjunto limitado de organizaciones y una ampliación posterior, mientras que la documentación ya identifica el modelo de API como gpt-6-astra. La única comprobación válida para una implantación es que el proyecto que va a pagar la factura pueda ejecutar una petición real; la existencia del modelo en el catálogo no garantiza acceso para todas las cuentas. La guía oficial de GPT-6 Astra mantiene tanto el estado del despliegue como los detalles técnicos.

La tabla que debe entrar en el presupuesto

Estas son las tarifas Standard publicadas el 4 de septiembre de 2026, en USD por millón de tokens:

Tipo de tokenHasta 272K tokens de entradaMás de 272K tokens de entrada
Entrada no almacenada en caché10,00 USD20,00 USD
Entrada en caché1,00 USD2,00 USD
Escritura en caché12,50 USD25,00 USD
Salida50,00 USD75,00 USD

La columna de contexto largo no se aplica solo al fragmento que rebasa el umbral. Si la petición supera 272.000 tokens de entrada, OpenAI recalcula toda la petición con el precio largo: duplica las tarifas de entrada, entrada en caché y escritura en caché, y multiplica por 1,5 la salida. Esta regla y las cuatro categorías de facturación figuran en la ficha oficial de GPT-6 Astra.

El umbral no es lo mismo que la capacidad máxima. La misma ficha indica una ventana de contexto de 1.050.000 tokens, con hasta 922.000 tokens de entrada y 128.000 de salida. Que una petición quepa en la ventana no significa que conserve el precio corto.

Una fórmula que no oculta la caché

Para una petición, separa cuatro contadores y elige primero la columna correcta de la tabla:

text
subtotal_tokens = ( entrada_no_cache × tarifa_entrada + entrada_cache × tarifa_cache + escritura_cache × tarifa_escritura + salida × tarifa_salida ) / 1.000.000 coste_estimado = subtotal_tokens × factor_modalidad × factor_regional + herramientas + almacenamiento + otros cargos aplicables

El factor_modalidad es 1 para Standard, 0,5 para Batch o Flex y 2 para Fast. El factor_regional solo es 1,10 cuando la petición usa un endpoint regional elegible sujeto al recargo; no debe añadirse por el mero hecho de que la empresa esté en España. Impuestos, acuerdos contractuales y créditos tampoco están incluidos en la tabla pública.

No mezcles lectura y escritura de caché. La escritura cuesta 1,25 veces la entrada no cacheada y se paga cuando se crea el prefijo reutilizable; las coincidencias posteriores usan la tarifa de entrada en caché. Para calcular un flujo completo hay que incluir tanto la primera ejecución como el número esperado de reutilizaciones.

Ejemplo 1: petición corta con una lectura de caché

Una ejecución Standard con 20.000 tokens de entrada no cacheada, 80.000 en caché y 5.000 de salida cuesta:

text
20.000 × 10 / 1.000.000 = 0,20 USD 80.000 × 1 / 1.000.000 = 0,08 USD 5.000 × 50 / 1.000.000 = 0,25 USD Total 0,53 USD

El mismo perfil costaría 0,265 USD con Batch o Flex y 1,06 USD con Fast, antes de región, herramientas e impuestos.

Ejemplo 2: crear el prefijo y volver a usarlo

Supón un prefijo de 100.000 tokens que se escribe en caché, más 10.000 tokens nuevos y una salida de 2.000 tokens. La primera ejecución Standard de contexto corto cuesta 1,45 USD:

text
100.000 × 12,50 / 1.000.000 = 1,25 USD escritura en caché 10.000 × 10,00 / 1.000.000 = 0,10 USD entrada nueva 2.000 × 50,00 / 1.000.000 = 0,10 USD salida

Si la siguiente petición vuelve a leer esos 100.000 tokens y mantiene la misma entrada nueva y salida, su coste baja a 0,30 USD. La ventaja depende de que haya coincidencias reales de caché; no conviene proyectarla sobre todo el tráfico sin medirlas.

Ejemplo 3: cruzar 272K cambia toda la cuenta

Con 300.000 tokens de entrada no cacheada y 20.000 de salida, Standard cuesta 7,50 USD:

text
300.000 × 20 / 1.000.000 = 6,00 USD 20.000 × 75 / 1.000.000 = 1,50 USD Total 7,50 USD

Aplicar por error la tarifa corta daría 4,00 USD. Esa diferencia de 3,50 USD en una sola petición muestra por qué el total de tokens de entrada debe ser una dimensión explícita del presupuesto, no una nota al pie.

Guía visual de precios de GPT-6 Astra con cálculo por tipo de token, caché, contexto largo, región, herramientas y decisión del piloto

Standard, Batch, Flex o Fast no son la misma compra

OpenAI publica Batch y Flex al 50% de Standard y Fast al doble de la tarifa aplicable en su tabla oficial por modalidad. La elección depende de cuándo necesita el resultado y de lo que puede hacer el proyecto, no solo del precio.

  • Standard — 1×. Es la referencia para tráfico interactivo sin una prima específica de velocidad.
  • Batch — 0,5×. Tramita lotes asíncronos mediante Batch API cuando una ventana de finalización de hasta 24 horas es aceptable.
  • Flex — 0,5×. Se solicita con service_tier: "flex" para evaluaciones o trabajos de menor prioridad que toleran más espera y disponibilidad ocasionalmente limitada.
  • Fast — 2×. Se solicita con service_tier: "fast" cuando la menor latencia esperada justifica la prima.

La documentación de Batch API describe un proceso asíncrono separado: Batch no es otro valor de service_tier. La guía de Flex usa "flex" y advierte de tiempos más lentos y posibles faltas puntuales de recursos. En un reintento que deba volver al comportamiento configurado por el proyecto, la guía admite service_tier: "auto" o retirar el parámetro.

Fast acepta service_tier: "fast"; el valor anterior "priority" conserva el mismo comportamiento en modelos compatibles. La guía oficial de Fast también aclara que el servicio puede reflejar service_tier: "default" cuando una solicitud se procesa finalmente como Standard. Para GPT-6 Astra, OpenAI no ofrece un SLA de latencia en Fast, así que pagar el doble no equivale a comprar una duración garantizada.

La decisión europea cambia si se exige residencia de datos

Los endpoints de tratamiento regional con residencia de datos aplican un recargo del 10% a los modelos elegibles lanzados a partir del 5 de marzo de 2026. GPT-6 Astra entra en esa banda temporal, pero la elegibilidad concreta depende de la región, la cuenta y el contrato; la página de precios delimita el recargo regional.

Hay otra restricción importante para equipos en España: GPT-6 Astra no admite service_tier: "fast" ni service_tier: "priority" con residencia de datos de la UE. La guía de GPT-6 Astra indica usar Standard en ese caso. Por tanto, no es correcto elaborar un presupuesto «Fast + residencia UE» multiplicando simplemente 2 × 1,10: esa combinación no está disponible.

Una estimación europea debe distinguir, como mínimo, dos escenarios:

  • procesamiento habitual sin añadir automáticamente un recargo regional;
  • endpoint regional elegible, con factor 1,10 y una modalidad compatible.

Herramientas y almacenamiento quedan fuera del subtotal de tokens

El endpoint de API no añade por sí mismo una cuota independiente de los recursos consumidos, pero algunas herramientas sí tienen precio propio. La tarifa oficial de herramientas fija la búsqueda web en 10 USD por 1.000 llamadas, además de los tokens del contenido de búsqueda cobrados al precio del modelo. File Search puede añadir llamadas y almacenamiento, y los contenedores alojados se facturan aparte.

Por eso, una petición con herramientas necesita dos registros: los tokens del modelo y los eventos facturables ajenos a esos tokens. Si una ejecución realiza varias búsquedas o mantiene archivos, multiplicar solo entrada y salida infravalora el coste. Tampoco hay que cargar el precio de una herramienta a solicitudes que no la invocan.

Comprobar acceso antes de migrar tráfico

GPT-6 Astra admite texto e imagen como entrada, texto como salida y aparece documentado para Responses, Chat Completions y Batch. Para llamadas con herramientas, OpenAI indica usar Responses API. Un test mínimo contra el proyecto que se utilizará en producción separa el acceso real de la disponibilidad anunciada:

bash
curl https://api.openai.com/v1/responses \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-6-astra", "input": "Responde únicamente con: OK" }'

Una respuesta correcta confirma que ese proyecto pudo invocar el modelo en ese momento. Un fallo no demuestra por sí solo que GPT-6 Astra no exista o que ningún cliente tenga acceso: primero hay que separar autenticación, permisos del proyecto, disponibilidad del modelo y configuración de la solicitud. La ficha del modelo marca además el nivel Free de API como no compatible y remite los límites a los niveles de uso; este artículo no intenta convertir esa información variable en una tabla de RPM o TPM.

Si se migra desde otro modelo, la guía oficial de actualización pide usar model: "gpt-6-astra", empezar con reasoning.effort: "low" cuando la aplicación venía de none o minimal, y retirar temperature, top_p y top_logprobs; Chat Completions tampoco admite logprobs en esta migración. Para una caché procedente de GPT-5.5 o anterior, el ajuste documentado es prompt_cache_options.ttl: "30m". Estos cambios deben validarse antes de atribuir un error al acceso o al precio.

Flujo de decisión para comprobar acceso a GPT-6 Astra, elegir banda de contexto y modalidad, sumar cargos y evaluar el piloto

Un piloto que decide por coste de resultado aceptado

El piloto debe usar tareas reales y mantener constantes los factores que puedan falsear la comparación. Un procedimiento práctico es:

  1. Verificar una petición mínima en el proyecto y en la región que se usarán después.
  2. Separar casos cortos y casos que superen 272.000 tokens de entrada; no promediar ambos con una sola tarifa.
  3. Ejecutar el mismo conjunto con el modelo actual y con gpt-6-astra, usando la misma modalidad y el mismo criterio de aceptación.
  4. Registrar entrada no cacheada, lecturas y escrituras de caché, salida, herramientas, reintentos, latencia y resultados aceptados.
  5. Calcular coste por resultado aceptado = coste total / resultados aceptados y fijar antes de la prueba el máximo que justifica continuar.

Como referencia aritmética, GPT-6 Astra cuesta actualmente 2,5 veces GPT-5.6 Sol por token cuando se comparan la misma mezcla de tokens, la misma banda de contexto y la misma modalidad, según las filas de precio publicadas por OpenAI. Para igualar la factura solo mediante volumen, Astra tendría que consumir alrededor del 40% de la carga facturable; también podría compensar la prima si reduce suficientes reintentos o eleva la tasa de resultados aceptados, pero eso es una hipótesis que debe medir el piloto, no una propiedad garantizada por la tarifa. La comparación en español de GPT-5.6 Sol, Terra y Luna ofrece contexto adicional para escoger una referencia, mientras que los precios vigentes siempre deben comprobarse en OpenAI.

La decisión final puede ser sencilla: avanzar solo si el proyecto tiene acceso, la modalidad elegida es compatible con la política regional y el coste por resultado aceptado queda dentro del límite. Si una de esas tres condiciones falla, conservar el modelo actual y repetir la evaluación más adelante es una conclusión válida.

#GPT-6 Astra#gpt-6-astra#API de OpenAI#precio por millón de tokens#contexto largo
Share: