Saltar al contenido principal

GPT-5.6 Sol vs Terra vs Luna: precios de la API y cuál elegir

8 min de lecturaComparativas de modelos

Elige dos candidatos, calcula su factura y compáralos con tareas propias para decidir qué modelo desplegar.

Tres rutas de elección desde una misma petición hacia GPT-5.6 Sol, Terra y Luna

Si tu prioridad son tareas difíciles de razonamiento o programación, gpt-5.6-sol es el primer candidato lógico. Si buscas equilibrar capacidad y coste, prueba gpt-5.6-terra. Si procesas mucho volumen, el presupuesto manda y la tarea tolera una capacidad menor, evalúa gpt-5.6-luna. Es el posicionamiento oficial de OpenAI para sus modelos, no un resultado de rendimiento ni una garantía para tu carga.

Esta comparación se refiere a la API de OpenAI, no a planes de ChatGPT, créditos de Codex ni modelos especializados de imagen, audio, Realtime o embeddings. Precios y asignación de alias comprobados el 10 de agosto de 2026. La decisión útil no termina en el precio por token: debe incluir aciertos, reintentos, latencia y corrección humana.

La primera elección reduce candidatos; una prueba representativa confirma cuál conviene.

La respuesta corta: empieza con dos candidatos, no con un ganador

Usa esta regla para reducir la comparación:

  • Sol + Terra si un fallo obliga a revisar código, rehacer un análisis o repetir una cadena larga de herramientas.
  • Terra + Luna si la tarea es repetitiva, tiene criterios claros y se ejecutará a gran escala.
  • Sol + Luna si quieres medir directamente cuánto valor añade la máxima capacidad frente al precio mínimo.

Un ID de la API no es el nombre de un plan de ChatGPT. Tampoco el modelo con la tarifa más baja completa necesariamente la tarea por menos dinero: dos reintentos y diez minutos de corrección pueden borrar el ahorro. Y una ventana de contexto grande solo indica cuánto puede admitir una solicitud; no demuestra que enviar todos los documentos sea la opción más precisa o barata.

El alias gpt-5.6 apunta actualmente a gpt-5.6-sol, según la guía oficial de GPT-5.6. Para una evaluación reproducible o un despliegue controlado, fija uno de los IDs explícitos: gpt-5.6-sol, gpt-5.6-terra o gpt-5.6-luna. Vuelve a comprobar el alias antes de desplegar porque su destino puede cambiar.

Qué comparten los tres modelos y qué no demuestra esa igualdad

Los tres aceptan texto e imágenes como entrada y producen texto. Sus fichas indican una ventana de contexto de 1.050.000 tokens, un máximo de 922.000 tokens de entrada, hasta 128.000 tokens de salida y una fecha de corte de conocimiento del 16 de febrero de 2026: consulta las especificaciones de Sol, Terra y Luna. También admiten Responses API, Chat Completions y Batch, como recoge la comparación oficial.

Esas cifras compartidas no implican la misma calidad, latencia ni capacidad de proceso. La diferencia que importa es si cada nivel resuelve tus casos con suficiente consistencia para justificar su coste.

Antes de leer la tarifa, distingue sus cuatro componentes:

  • Entrada: tokens nuevos que envías al modelo.
  • Entrada en caché: tokens reutilizados desde una caché válida; tienen una tarifa menor.
  • Escritura de caché: coste de guardar contenido reutilizable para solicitudes posteriores.
  • Salida: tokens generados por el modelo.

Además, 272.000 tokens de entrada es el umbral de contexto largo según las tarifas oficiales de OpenAI. Si una petición lo supera, cambia la tarifa de toda la solicitud, no solo la parte que rebasa el umbral.

Comparación directa de capacidades y precios Standard

Las siguientes son tarifas de la API directa de OpenAI para el nivel Standard, expresadas en USD por cada millón de tokens y comprobadas el 10-08-2026 en la tabla oficial de precios de la API. Se aplican a solicitudes de hasta 272.000 tokens de entrada.

Modelo y orientación de OpenAIID explícitoInterfaces y límitesStandard: entrada / caché / escritura / salida
Sol: razonamiento complejo y programacióngpt-5.6-solResponses, Chat Completions y Batch; contexto 1.050.000; entrada 922.000; salida 128.0005 / 0,50 / 6,25 / 30 USD
Terra: equilibrio entre capacidad y costegpt-5.6-terraResponses, Chat Completions y Batch; contexto 1.050.000; entrada 922.000; salida 128.0002 / 0,20 / 2,50 / 12 USD
Luna: gran volumen sensible al preciogpt-5.6-lunaResponses, Chat Completions y Batch; contexto 1.050.000; entrada 922.000; salida 128.0000,20 / 0,02 / 0,25 / 1,20 USD

La columna de caché factura tokens ya reutilizados; la de escritura factura el acto de guardar contenido para reutilizarlo. No presupongas que todo el prompt obtendrá la tarifa de caché: registra las categorías reales que devuelve usage.

Qué ocurre por encima de 272.000 tokens

Al superar 272.000 tokens de entrada, la tarifa de contexto largo de OpenAI se aplica a la solicitud completa: la entrada cuesta 2 veces la tarifa normal y la salida 1,5 veces; la escritura de caché equivale a 1,25 veces la entrada sin caché. Este salto hace que dividir, recuperar solo fragmentos relevantes o resumir pueda ser útil, pero solo si conserva la información necesaria para acertar.

Standard, Fast, Batch y Flex no resuelven la misma urgencia

Un nivel de servicio decide cómo se procesa la petición y qué relación asumes entre precio, latencia y tolerancia a colas. Para GPT-5.6, Batch y Flex cuestan actualmente la mitad de Standard, mientras que Fast cuesta el doble, según la tabla oficial de niveles y precios. Los endpoints aptos para procesamiento regional de modelos lanzados desde el 05-03-2026 añaden un 10 %. La disponibilidad, las colas, los requisitos regionales y los cargos de herramientas pueden alterar la elección final.

Fast es el nombre público vigente. El changelog de OpenAI indica que sustituyó a Priority Processing el 30-07-2026. Una petición compatible todavía puede usar el valor priority y la respuesta puede mostrarlo; ese valor devuelto no cambia el nombre comercial actual.

Diagrama de decisión desde dificultad, coste, latencia y tolerancia a colas hasta dos candidatos y una prueba

La urgencia elige el nivel de servicio; la dificultad y el presupuesto reducen los modelos candidatos.

Dos cálculos para no equivocarte con la factura

Estos ejemplos calculan facturación, no el coste real de una tarea. Suponen Standard, sin caché, herramientas ni recargo regional.

Caso corto: 100.000 tokens de entrada y 10.000 de salida

La fórmula es:

coste = (tokens de entrada / 1.000.000 × tarifa de entrada) + (tokens de salida / 1.000.000 × tarifa de salida)

  • Sol: 0,1 × 5 + 0,01 × 30 = 0,80 USD.
  • Terra: 0,1 × 2 + 0,01 × 12 = 0,32 USD.
  • Luna: 0,1 × 0,20 + 0,01 × 1,20 = 0,032 USD.

Contexto largo: 300.000 tokens de entrada y 20.000 de salida

Aquí toda la entrada usa 2 veces su tarifa y toda la salida 1,5 veces:

  • Sol: 0,3 × 10 + 0,02 × 45 = 3,90 USD.
  • Terra: 0,3 × 4 + 0,02 × 18 = 1,56 USD.
  • Luna: 0,3 × 0,40 + 0,02 × 1,80 = 0,156 USD.

La factura de una ejecución puede ser pequeña y, aun así, el proceso salir caro. Multiplica por el número de intentos y añade el coste de las herramientas. Después separa el tiempo de corrección humana para no atribuir al modelo un ahorro que en realidad paga el equipo.

Prueba Sol, Terra y Luna con la misma llamada de Responses API

OpenAI recomienda Responses API para flujos de GPT-5.6 con razonamiento, herramientas o varios turnos en su guía del modelo más reciente. En la llamada, model selecciona el ID, input contiene la tarea y service_tier solicita el nivel de servicio. La referencia oficial para crear una respuesta documenta esos campos y su comportamiento.

Instala el SDK oficial con npm install openai, exporta tu clave como variable de entorno y cambia solo OPENAI_MODEL para repetir exactamente la misma entrada:

js
import OpenAI from "openai"; const client = new OpenAI({ apiKey: process.env.OPENAI_API_KEY }); const model = process.env.OPENAI_MODEL ?? "gpt-5.6-terra"; const response = await client.responses.create({ model, input: "Resume los tres riesgos principales de este contrato y cita la cláusula correspondiente.", service_tier: "standard", }); console.log({ model, text: response.output_text, usage: response.usage, effectiveServiceTier: response.service_tier, });

usage es el objeto que debes conservar para contar tokens y categorías facturadas. response.service_tier permite inspeccionar el nivel efectivo; es especialmente importante si solicitas Fast mediante un valor compatible como priority.

No elijas por una sola respuesta vistosa. Prepara de 10 a 20 casos representativos y define de antemano qué significa «aceptado»: por ejemplo, compila sin cambios, extrae todos los campos obligatorios o cita únicamente cláusulas existentes. Mantén iguales la entrada, las herramientas, el nivel de servicio y el criterio de aceptación.

Decide por coste de resultado aceptado

El precio por millón de tokens es una entrada del cálculo, no el resultado. Para cada candidato registra:

MétricaQué anotarPor qué cambia la decisión
Tareas aceptadasNúmero y porcentaje que cumplen el criterioMide el resultado útil, no solo respuestas generadas
ReintentosIntentos extra por casoMultiplican tokens, latencia y operaciones
Tokens totalesEntrada, caché, escritura y salida desde usagePermite aplicar cada tarifa correcta
Latencia observadaTiempo por caso y percentiles relevantesDistingue ahorro económico de demora operativa
Corrección humanaMinutos hasta dejar el resultado utilizableRevela trabajo que la factura de la API no muestra

Calcula:

coste por resultado aceptado = (coste total de API + coste del tiempo de corrección) / resultados aceptados

Si no puedes asignar un coste fiable al tiempo humano, no inventes una cifra. Presenta los minutos de corrección como una métrica separada y compara ambos ejes.

Entradas, caché, salida, reintentos y corrección humana convergen en el coste por resultado aceptado

La tarifa del modelo es solo una parte: reintentos y corrección deciden el coste operativo.

Ejemplo de lectura de resultados

Imagina que Luna cuesta menos en tokens, pero acepta 12 de 20 casos y exige ocho reintentos; Terra acepta 18 y requiere dos; Sol también acepta 18, sin una mejora material en corrección. Esa observación no convierte a Terra en ganador universal. Solo indicaría que, para ese conjunto y esos criterios, Terra merece el despliegue provisional: Luna pierde ahorro al repetir y Sol no recupera su sobrecoste con más resultados aceptados.

Si cambian el tipo de documentos, las herramientas, el tamaño del contexto o el nivel de servicio, la conclusión deja de ser transferible. Conserva el conjunto de casos y repite la evaluación.

Elección provisional y condición de reevaluación

Elige dos candidatos con la regla inicial y ejecútalos en Playground o mediante Responses API sobre 10-20 casos reales. Documenta aceptación, reintentos, tokens, latencia y corrección. Selecciona el modelo con el mejor coste por resultado aceptado dentro de tu requisito de latencia, no el que encabeza una tabla genérica.

Fija el ID explícito al desplegar. Decide entre Batch, Flex, Standard o Fast solo después de saber si tu carga tolera colas o necesita menor latencia. Revisa de nuevo el alias, las tarifas y las condiciones regionales antes del lanzamiento, y repite la prueba cuando cambie la carga o el proveedor actualice esos elementos.

Esta comparación deja de ser la herramienta adecuada si la tarea principal es generar imágenes o audio, trabajar en tiempo real, crear embeddings o escoger un plan de ChatGPT. En esos casos, parte del catálogo y la documentación específica del producto correspondiente, no de Sol, Terra y Luna.

#GPT-5.6#API de OpenAI#gpt-5.6-sol#gpt-5.6-terra#gpt-5.6-luna
Share: