El precio publicado para GPT-6 Astra en la API directa de OpenAI parte de 10 USD por millón de tokens de entrada y 50 USD por millón de tokens de salida en Standard y contexto corto. Pero esas dos cifras no bastan para presupuestar una aplicación: la tarifa oficial también distingue entrada en caché, escritura en caché, contexto largo y modalidad de procesamiento.
Además, el acceso se está ampliando de forma gradual. OpenAI anunció un despliegue inicial para un conjunto limitado de organizaciones y una ampliación posterior, mientras que la documentación ya identifica el modelo de API como gpt-6-astra. La única comprobación válida para una implantación es que el proyecto que va a pagar la factura pueda ejecutar una petición real; la existencia del modelo en el catálogo no garantiza acceso para todas las cuentas. La guía oficial de GPT-6 Astra mantiene tanto el estado del despliegue como los detalles técnicos.
La tabla que debe entrar en el presupuesto
Estas son las tarifas Standard publicadas el 4 de septiembre de 2026, en USD por millón de tokens:
| Tipo de token | Hasta 272K tokens de entrada | Más de 272K tokens de entrada |
|---|---|---|
| Entrada no almacenada en caché | 10,00 USD | 20,00 USD |
| Entrada en caché | 1,00 USD | 2,00 USD |
| Escritura en caché | 12,50 USD | 25,00 USD |
| Salida | 50,00 USD | 75,00 USD |
La columna de contexto largo no se aplica solo al fragmento que rebasa el umbral. Si la petición supera 272.000 tokens de entrada, OpenAI recalcula toda la petición con el precio largo: duplica las tarifas de entrada, entrada en caché y escritura en caché, y multiplica por 1,5 la salida. Esta regla y las cuatro categorías de facturación figuran en la ficha oficial de GPT-6 Astra.
El umbral no es lo mismo que la capacidad máxima. La misma ficha indica una ventana de contexto de 1.050.000 tokens, con hasta 922.000 tokens de entrada y 128.000 de salida. Que una petición quepa en la ventana no significa que conserve el precio corto.
Una fórmula que no oculta la caché
Para una petición, separa cuatro contadores y elige primero la columna correcta de la tabla:
textsubtotal_tokens = ( entrada_no_cache × tarifa_entrada + entrada_cache × tarifa_cache + escritura_cache × tarifa_escritura + salida × tarifa_salida ) / 1.000.000 coste_estimado = subtotal_tokens × factor_modalidad × factor_regional + herramientas + almacenamiento + otros cargos aplicables
El factor_modalidad es 1 para Standard, 0,5 para Batch o Flex y 2 para Fast. El factor_regional solo es 1,10 cuando la petición usa un endpoint regional elegible sujeto al recargo; no debe añadirse por el mero hecho de que la empresa esté en España. Impuestos, acuerdos contractuales y créditos tampoco están incluidos en la tabla pública.
No mezcles lectura y escritura de caché. La escritura cuesta 1,25 veces la entrada no cacheada y se paga cuando se crea el prefijo reutilizable; las coincidencias posteriores usan la tarifa de entrada en caché. Para calcular un flujo completo hay que incluir tanto la primera ejecución como el número esperado de reutilizaciones.
Ejemplo 1: petición corta con una lectura de caché
Una ejecución Standard con 20.000 tokens de entrada no cacheada, 80.000 en caché y 5.000 de salida cuesta:
text20.000 × 10 / 1.000.000 = 0,20 USD 80.000 × 1 / 1.000.000 = 0,08 USD 5.000 × 50 / 1.000.000 = 0,25 USD Total 0,53 USD
El mismo perfil costaría 0,265 USD con Batch o Flex y 1,06 USD con Fast, antes de región, herramientas e impuestos.
Ejemplo 2: crear el prefijo y volver a usarlo
Supón un prefijo de 100.000 tokens que se escribe en caché, más 10.000 tokens nuevos y una salida de 2.000 tokens. La primera ejecución Standard de contexto corto cuesta 1,45 USD:
text100.000 × 12,50 / 1.000.000 = 1,25 USD escritura en caché 10.000 × 10,00 / 1.000.000 = 0,10 USD entrada nueva 2.000 × 50,00 / 1.000.000 = 0,10 USD salida
Si la siguiente petición vuelve a leer esos 100.000 tokens y mantiene la misma entrada nueva y salida, su coste baja a 0,30 USD. La ventaja depende de que haya coincidencias reales de caché; no conviene proyectarla sobre todo el tráfico sin medirlas.
Ejemplo 3: cruzar 272K cambia toda la cuenta
Con 300.000 tokens de entrada no cacheada y 20.000 de salida, Standard cuesta 7,50 USD:
text300.000 × 20 / 1.000.000 = 6,00 USD 20.000 × 75 / 1.000.000 = 1,50 USD Total 7,50 USD
Aplicar por error la tarifa corta daría 4,00 USD. Esa diferencia de 3,50 USD en una sola petición muestra por qué el total de tokens de entrada debe ser una dimensión explícita del presupuesto, no una nota al pie.

Standard, Batch, Flex o Fast no son la misma compra
OpenAI publica Batch y Flex al 50% de Standard y Fast al doble de la tarifa aplicable en su tabla oficial por modalidad. La elección depende de cuándo necesita el resultado y de lo que puede hacer el proyecto, no solo del precio.
- Standard — 1×. Es la referencia para tráfico interactivo sin una prima específica de velocidad.
- Batch — 0,5×. Tramita lotes asíncronos mediante Batch API cuando una ventana de finalización de hasta 24 horas es aceptable.
- Flex — 0,5×. Se solicita con
service_tier: "flex"para evaluaciones o trabajos de menor prioridad que toleran más espera y disponibilidad ocasionalmente limitada. - Fast — 2×. Se solicita con
service_tier: "fast"cuando la menor latencia esperada justifica la prima.
La documentación de Batch API describe un proceso asíncrono separado: Batch no es otro valor de service_tier. La guía de Flex usa "flex" y advierte de tiempos más lentos y posibles faltas puntuales de recursos. En un reintento que deba volver al comportamiento configurado por el proyecto, la guía admite service_tier: "auto" o retirar el parámetro.
Fast acepta service_tier: "fast"; el valor anterior "priority" conserva el mismo comportamiento en modelos compatibles. La guía oficial de Fast también aclara que el servicio puede reflejar service_tier: "default" cuando una solicitud se procesa finalmente como Standard. Para GPT-6 Astra, OpenAI no ofrece un SLA de latencia en Fast, así que pagar el doble no equivale a comprar una duración garantizada.
La decisión europea cambia si se exige residencia de datos
Los endpoints de tratamiento regional con residencia de datos aplican un recargo del 10% a los modelos elegibles lanzados a partir del 5 de marzo de 2026. GPT-6 Astra entra en esa banda temporal, pero la elegibilidad concreta depende de la región, la cuenta y el contrato; la página de precios delimita el recargo regional.
Hay otra restricción importante para equipos en España: GPT-6 Astra no admite service_tier: "fast" ni service_tier: "priority" con residencia de datos de la UE. La guía de GPT-6 Astra indica usar Standard en ese caso. Por tanto, no es correcto elaborar un presupuesto «Fast + residencia UE» multiplicando simplemente 2 × 1,10: esa combinación no está disponible.
Una estimación europea debe distinguir, como mínimo, dos escenarios:
- procesamiento habitual sin añadir automáticamente un recargo regional;
- endpoint regional elegible, con factor 1,10 y una modalidad compatible.
Herramientas y almacenamiento quedan fuera del subtotal de tokens
El endpoint de API no añade por sí mismo una cuota independiente de los recursos consumidos, pero algunas herramientas sí tienen precio propio. La tarifa oficial de herramientas fija la búsqueda web en 10 USD por 1.000 llamadas, además de los tokens del contenido de búsqueda cobrados al precio del modelo. File Search puede añadir llamadas y almacenamiento, y los contenedores alojados se facturan aparte.
Por eso, una petición con herramientas necesita dos registros: los tokens del modelo y los eventos facturables ajenos a esos tokens. Si una ejecución realiza varias búsquedas o mantiene archivos, multiplicar solo entrada y salida infravalora el coste. Tampoco hay que cargar el precio de una herramienta a solicitudes que no la invocan.
Comprobar acceso antes de migrar tráfico
GPT-6 Astra admite texto e imagen como entrada, texto como salida y aparece documentado para Responses, Chat Completions y Batch. Para llamadas con herramientas, OpenAI indica usar Responses API. Un test mínimo contra el proyecto que se utilizará en producción separa el acceso real de la disponibilidad anunciada:
bashcurl https://api.openai.com/v1/responses \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-6-astra", "input": "Responde únicamente con: OK" }'
Una respuesta correcta confirma que ese proyecto pudo invocar el modelo en ese momento. Un fallo no demuestra por sí solo que GPT-6 Astra no exista o que ningún cliente tenga acceso: primero hay que separar autenticación, permisos del proyecto, disponibilidad del modelo y configuración de la solicitud. La ficha del modelo marca además el nivel Free de API como no compatible y remite los límites a los niveles de uso; este artículo no intenta convertir esa información variable en una tabla de RPM o TPM.
Si se migra desde otro modelo, la guía oficial de actualización pide usar model: "gpt-6-astra", empezar con reasoning.effort: "low" cuando la aplicación venía de none o minimal, y retirar temperature, top_p y top_logprobs; Chat Completions tampoco admite logprobs en esta migración. Para una caché procedente de GPT-5.5 o anterior, el ajuste documentado es prompt_cache_options.ttl: "30m". Estos cambios deben validarse antes de atribuir un error al acceso o al precio.

Un piloto que decide por coste de resultado aceptado
El piloto debe usar tareas reales y mantener constantes los factores que puedan falsear la comparación. Un procedimiento práctico es:
- Verificar una petición mínima en el proyecto y en la región que se usarán después.
- Separar casos cortos y casos que superen 272.000 tokens de entrada; no promediar ambos con una sola tarifa.
- Ejecutar el mismo conjunto con el modelo actual y con
gpt-6-astra, usando la misma modalidad y el mismo criterio de aceptación. - Registrar entrada no cacheada, lecturas y escrituras de caché, salida, herramientas, reintentos, latencia y resultados aceptados.
- Calcular
coste por resultado aceptado = coste total / resultados aceptadosy fijar antes de la prueba el máximo que justifica continuar.
Como referencia aritmética, GPT-6 Astra cuesta actualmente 2,5 veces GPT-5.6 Sol por token cuando se comparan la misma mezcla de tokens, la misma banda de contexto y la misma modalidad, según las filas de precio publicadas por OpenAI. Para igualar la factura solo mediante volumen, Astra tendría que consumir alrededor del 40% de la carga facturable; también podría compensar la prima si reduce suficientes reintentos o eleva la tasa de resultados aceptados, pero eso es una hipótesis que debe medir el piloto, no una propiedad garantizada por la tarifa. La comparación en español de GPT-5.6 Sol, Terra y Luna ofrece contexto adicional para escoger una referencia, mientras que los precios vigentes siempre deben comprobarse en OpenAI.
La decisión final puede ser sencilla: avanzar solo si el proyecto tiene acceso, la modalidad elegida es compatible con la política regional y el coste por resultado aceptado queda dentro del límite. Si una de esas tres condiciones falla, conservar el modelo actual y repetir la evaluación más adelante es una conclusión válida.



