# Comparativa de precios de API de IA: qué modelo sale más barato

> GPT-6 Luna y DeepSeek Flash en horario valle son las API de IA más baratas por token; la proporción de salida, la caché y el contexto largo cambian el orden.

- URL: https://blog.laozhang.ai/es/posts/cheapest-llm-models
- Published: 2026-07-02
- Updated: 2026-09-26
- Author: LaoZhang AI Team (https://blog.laozhang.ai/es/about)
- Category: Precios de API
- Tags: Precios API IA, OpenAI API, Claude API, Gemini API, DeepSeek API, Grok API

---
A 26 de septiembre de 2026, la API más barata por token entre OpenAI, Anthropic, Google, xAI y DeepSeek es GPT-6 Luna: 0,10 $ por millón de tokens de entrada y 0,50 $ por millón de salida. Le siguen DeepSeek Flash si llamas en horario valle (0,15 $ y 0,60 $; el doble en hora punta) y Gemini 3.1 Flash-Lite (0,25 $ y 1,50 $). En el nivel intermedio, GPT-6 Sol y Claude Sonnet 5 comparten tarifa (2 $ de entrada y 10 $ de salida) y Grok 4.7 tiene la salida más barata del grupo, 6 $. En el tope de gama, Claude Opus 5.5 (4 $ y 20 $) cuesta menos de la mitad que GPT-6 Astra o Claude Fable 5.1 (10 $ y 50 $).

Esas cifras son el punto de partida, no la factura. El orden cambia con cinco cosas: cuánta salida generas frente a la entrada, qué parte de la entrada acierta en caché, si tus prompts superan los 200K o 272K tokens, a qué hora llamas a DeepSeek y si la tarea puede esperar a un procesamiento por lotes. Y el precio actual de Gemini 3.8 Flash termina el 31 de diciembre de 2026: desde el 1 de enero de 2027 se duplica.

## Precios oficiales por nivel

Todas las cifras de las tablas son USD por millón de tokens, con procesamiento estándar, contexto corto y contratadas directamente con el propietario del modelo. Los niveles agrupan por precio, no por calidad: un modelo ligero puede bastar para clasificar tickets y quedarse corto para refactorizar código.

### Modelos ligeros

| Modelo | Entrada | Salida | Acierto de caché | Qué cambia el precio |
|---|---|---|---|---|
| GPT-6 Luna | 0,10 | 0,50 | 0,01 | Con más de 272K tokens de entrada, toda la solicitud pasa a 0,20 / 0,75 |
| DeepSeek Flash (valle / punta) | 0,15 / 0,30 | 0,60 / 1,20 | 0,003 / 0,006 | La hora punta de los días laborables dobla todas las tarifas |
| Gemini 3.1 Flash-Lite | 0,25 (audio: 0,50) | 1,50 | 0,025 | Tiene nivel gratuito, con otras condiciones de uso de datos |
| Gemini 3.5 Flash-Lite | 0,30 | 2,50 | — | La salida cuesta bastante más que en 3.1 Flash-Lite |
| Claude Haiku 4.5 | 1 | 5 | 0,10 | Escribir en caché cuesta 1,25 (5 minutos) o 2 (1 hora) |

En DeepSeek, el nombre de modelo actual es `deepseek-flash`, servido por DeepSeek-V4.1-Flash. Si tu código todavía llama a `deepseek-v4-flash`, la API lo acepta, pero lo atiende el modelo nuevo y lo factura con estas tarifas de Flash.

### Nivel intermedio

| Modelo | Entrada | Salida | Acierto de caché | Qué cambia el precio |
|---|---|---|---|---|
| Gemini 3.8 Flash | 0,75 | 3,75 | 0,075 | Precio válido hasta el 31 de diciembre de 2026; desde el 1 de enero de 2027, 1,50 / 7,50. La salida incluye los tokens de razonamiento |
| DeepSeek V4-Pro (valle / punta) | 0,66 / 1,32 | 1,98 / 3,96 | 0,022 / 0,044 | Hora punta, igual que en Flash |
| Grok 4.7 | 2 | 6 | 0,50 | Contexto de 500K; con prompts de 200K tokens o más, toda la solicitud pasa a 4 / 12 (caché: 1) |
| GPT-6 Sol | 2 | 10 | 0,20 | Con más de 272K tokens de entrada, toda la solicitud pasa a 4 / 15 |
| Claude Sonnet 5 | 2 | 10 | 0,20 | Contexto de 1M al precio estándar; el tokenizador genera en torno a un 30 % más de tokens por el mismo texto |
| Gemini 3.1 Pro Preview | 2 | 12 | — | Con prompts de más de 200K, 4 / 18 |

Sonnet 5 sigue en 2 $ y 10 $ porque Anthropic canceló la subida que había anunciado; el detalle está en [Anthropic cancela la subida de Sonnet 5: tarifas y cálculo del coste](https://blog.laozhang.ai/es/posts/claude-sonnet-5-pricing).

### Tope de gama

| Modelo | Entrada | Salida | Acierto de caché | Qué cambia el precio |
|---|---|---|---|---|
| Claude Opus 5.5 | 4 | 20 | 0,20 | El modo rápido (vista previa, solo en la API de Claude) cuesta 8 / 40 |
| GPT-6 Astra | 10 | 50 | 1 | Con más de 272K tokens de entrada, toda la solicitud pasa a 20 / 75 |
| Claude Fable 5.1 | 10 | 50 | 0,25 | Misma tarifa base que Astra, pero la lectura de caché cuesta la cuarta parte |

Si lo que quieres saber es cuánto vale la API de GPT, la página de precios de OpenAI lista tres modelos GPT-6: Luna (0,10 $ / 0,50 $), Sol (2 $ / 10 $) y Astra (10 $ / 50 $). Para decidir entre ellos por tipo de tarea, mira [GPT-6 Sol, Luna y Astra frente a Terra: precios y cuál probar primero](https://blog.laozhang.ai/es/posts/gpt-6-sol-vs-terra-vs-luna-vs-astra).

## Cuánto pagarías al mes: dos cargas de ejemplo

La cuenta básica es la misma para todos los proveedores:

`coste mensual = millones de tokens de entrada × precio de entrada + millones de tokens de salida × precio de salida`

Para ver cómo pesa la proporción entre entrada y salida, compara dos meses con perfiles opuestos. El mes A es un servicio que lee mucho y responde poco (atención al cliente con documentación, respuestas sobre una base de conocimiento, clasificación): 300 millones de tokens de entrada y 30 millones de salida. El mes B genera mucho a partir de instrucciones cortas (redacción larga, generación de código): 20 millones de entrada y 40 millones de salida. Las cifras usan precio de lista estándar, sin caché, sin reintentos, sin herramientas y con prompts por debajo de 200K tokens.

| Modelo | Mes A: 300 M entrada + 30 M salida (USD) | Mes B: 20 M entrada + 40 M salida (USD) |
|---|---|---|
| GPT-6 Luna | 45 | 22 |
| DeepSeek Flash (valle / punta) | 63 / 126 | 27 / 54 |
| Gemini 3.1 Flash-Lite | 120 | 65 |
| Gemini 3.5 Flash-Lite | 165 | 106 |
| DeepSeek V4-Pro (valle / punta) | 257,40 / 514,80 | 92,40 / 184,80 |
| Gemini 3.8 Flash (2026 / desde 2027) | 337,50 / 675 | 165 / 330 |
| Claude Haiku 4.5 | 450 | 220 |
| Grok 4.7 | 780 | 280 |
| GPT-6 Sol | 900 | 440 |
| Claude Sonnet 5 | 900 | 440 |
| Gemini 3.1 Pro Preview | 960 | 520 |
| Claude Opus 5.5 | 1.800 | 880 |
| GPT-6 Astra | 4.500 | 2.200 |
| Claude Fable 5.1 | 4.500 | 2.200 |

Por ejemplo, Gemini 3.1 Flash-Lite en el mes A: 300 × 0,25 + 30 × 1,50 = 75 + 45 = 120 $.

Lo interesante no es la columna, sino dónde se cruzan las filas:

- **DeepSeek Flash en hora punta frente a Gemini 3.1 Flash-Lite.** En el mes A, Flash-Lite sale más barato (120 $ frente a 126 $) porque su entrada cuesta menos. En el mes B gana DeepSeek (54 $ frente a 65 $) porque su salida cuesta 1,20 $ y la de Flash-Lite 1,50 $.
- **Claude Haiku 4.5 frente a DeepSeek V4-Pro en hora punta.** Con mucha entrada, Haiku cuesta menos (450 $ frente a 514,80 $). Con mucha salida se invierte (220 $ frente a 184,80 $).
- **Grok 4.7 frente a Sol y Sonnet 5.** Grok es más barato en los dos meses, pero la diferencia pasa de un 13 % en el mes A (780 $ frente a 900 $) a un 36 % en el mes B (280 $ frente a 440 $), porque ahí manda la salida.
- **Gemini 3.8 Flash en 2027.** Con la tarifa que entra en vigor el 1 de enero, pasa a costar más que Claude Haiku 4.5 en los dos perfiles.

![Coste mensual de tres parejas de modelos en el mes A, con mucha entrada, y en el mes B, con mucha salida: DeepSeek Flash en punta frente a Gemini 3.1 Flash-Lite, Haiku 4.5 frente a V4-Pro en punta y Grok 4.7 frente a Sol y Sonnet 5](https://blog.laozhang.ai/posts/es/cheapest-llm-models/img/monthly-cost-crossover.webp)

Para saber en qué perfil estás, no hace falta adivinar: cada respuesta de estas API devuelve el recuento de tokens de entrada y de salida, y el panel de uso de cada proveedor los suma por día. Con una semana de tráfico real tienes tu proporción y puedes rehacer la tabla con tus cifras.

## Las condiciones que cambian el precio real

### Prompts largos: 272K, 200K o sin recargo

Aquí es donde dos modelos con la misma tarifa dejan de costar lo mismo. En OpenAI, si la entrada supera los 272K tokens, **toda la solicitud** se cobra al doble en entrada y caché y a 1,5 veces en salida, no solo la parte que excede. En Gemini 3.1 Pro Preview, a partir de 200K tokens la tarifa sube a 4 $ y 18 $. Grok 4.7 también cambia de tarifa desde 200K tokens de prompt: toda la solicitud pasa a 4 $ de entrada, 1 $ de caché y 12 $ de salida. En Anthropic, los modelos Claude 4.6 y posteriores cobran la ventana completa de 1M tokens al precio estándar: una solicitud de 900K tokens paga lo mismo por token que una de 9K.

Con una solicitud de 400K tokens de entrada y 5K de salida, sin caché:

| Modelo | Cálculo | Coste por solicitud |
|---|---|---|
| Claude Sonnet 5 | 0,4 × 2 + 0,005 × 10 | 0,85 $ |
| GPT-6 Sol | 0,4 × 4 + 0,005 × 15 | 1,675 $ |
| Gemini 3.1 Pro Preview | 0,4 × 4 + 0,005 × 18 | 1,69 $ |

![Coste de una solicitud de 400K tokens de entrada y 5K de salida: 0,85 $ con Claude Sonnet 5, 1,675 $ con GPT-6 Sol por superar 272K y 1,69 $ con Gemini 3.1 Pro Preview por superar 200K](https://blog.laozhang.ai/posts/es/cheapest-llm-models/img/long-prompt-cost.webp)

Si calculas Sol con la tarifa corta, te sale 0,85 $, lo mismo que Sonnet 5; la factura real es casi el doble. Grok 4.7 quedaría en 0,4 × 4 + 0,005 × 12 = 1,66 $. Si trabajas con contratos largos, repositorios enteros o transcripciones, esta regla pesa más que la tarifa de lista. Los detalles del umbral en OpenAI están en [Precio de la API de GPT-6 Astra: coste real, contexto largo y acceso](https://blog.laozhang.ai/es/posts/gpt-6-astra-api-pricing). La página de precios de DeepSeek no distingue tramos por longitud dentro de su contexto de 1M.

### Caché: lo que pagas por la parte que se repite

Si tus solicitudes comparten un bloque fijo (instrucciones de sistema, documentación, ejemplos), la parte que acierta en caché se cobra mucho más barata. En OpenAI, el acierto de caché cuesta la décima parte de la entrada normal; en Grok 4.7, la cuarta parte (0,50 $ frente a 2 $). En Anthropic también es 0,1 veces la entrada en la mayoría de modelos, 0,05 veces en Opus 5.5 y 0,025 veces en Fable 5.1; por eso Fable, con la misma tarifa base que Astra, lee la caché a 0,25 $ frente a 1 $.

La otra cara es la escritura. OpenAI y Anthropic cobran por escribir en caché más que la entrada normal: Sol, 2,50 $ frente a 2 $; Sonnet 5, 2,50 $ para cinco minutos o 4 $ para una hora. En Gemini 3.8 Flash, la caché de contexto cuesta 0,075 $ por millón más un almacenamiento de 0,50 $ por millón de tokens y hora. Si el bloque apenas se repite, pagas la escritura y no recuperas nada.

DeepSeek solo distingue acierto y fallo de caché, sin tarifa de escritura aparte. Si en el mes A el 80 % de la entrada acertara en caché y llamaras a DeepSeek Flash en horario valle: 240 × 0,003 + 60 × 0,15 + 30 × 0,60 = 0,72 + 9 + 18 = 27,72 $, frente a 63 $ sin caché. La salida pasa a ser casi dos tercios de la factura.

### La hora a la que llamas a DeepSeek

DeepSeek cobra la mitad fuera de su hora punta, que va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, salvo festivos chinos. Los fines de semana y los festivos chinos son valle todo el día. Pasado a hora peninsular española:

| Periodo | Hora punta (días laborables) |
|---|---|
| Horario de verano, hasta el 25 de octubre de 2026 | 03:00–06:00 y 08:00–12:00 |
| Horario de invierno | 02:00–05:00 y 07:00–11:00 |

En Canarias, una hora menos. La mañana de oficina en España cae casi entera en hora punta, así que los trabajos que puedas lanzar por la tarde, por la noche o en fin de semana pagan la mitad. Si quieres afinar el cálculo con aciertos de caché y tareas por lotes, consulta [Precio de DeepSeek V4 por horas: cálculo API para España](https://blog.laozhang.ai/es/posts/deepseek-v4).

### Procesamiento por lotes, Flex y modos rápidos

Si la tarea puede esperar, OpenAI, Anthropic y Google cobran la mitad por el procesamiento por lotes (Batch). En OpenAI, Flex también cuesta la mitad a cambio de más latencia y menos disponibilidad. Con Batch, Sol y Sonnet 5 bajan a 1 $ y 5 $, Gemini 3.1 Pro Preview a 1 $ y 6 $, y Gemini 3.8 Flash a 0,375 $ y 1,875 $ hasta final de año. En el mes B, Sol por lotes costaría 220 $ en lugar de 440 $.

En sentido contrario, el modo Fast de OpenAI (antes llamado Priority) cobra el doble de la tarifa estándar, y el modo rápido de Claude Opus 5.5 sube a 8 $ y 40 $. Grok 4.7 no admite Batch, su modo Priority cobra el doble y el endpoint regional de Estados Unidos suma un 10 %. La página de precios de DeepSeek no incluye tarifa por lotes: su descuento para lo que puede esperar es el horario valle.

### Tokens que no valen lo mismo

Un millón de tokens no es la misma cantidad de texto en todos los modelos. Anthropic indica que los modelos Claude 4.7 y posteriores usan un tokenizador que produce aproximadamente un 30 % más de tokens para el mismo texto; Haiku 4.5 usa el anterior. La diferencia exacta frente a GPT, Gemini o Grok depende del idioma y del tipo de contenido, y la única forma de conocerla es enviar la misma muestra a cada modelo y comparar el recuento que devuelve. En Gemini 3.8 Flash, además, los tokens de razonamiento se cobran como salida.

### Residencia de datos en OpenAI

Si necesitas que los datos se procesen en una región concreta, los endpoints de procesamiento regional de OpenAI suman un 10 % en los modelos publicados desde el 5 de marzo de 2026 que lo admiten. Tenlo en cuenta si comparas Sol con otros modelos para un cliente que exige residencia de datos.

## Qué modelo probar primero según tu carga

| Tu caso | Prueba primero | Cuándo cambiar |
|---|---|---|
| Clasificar, extraer o responder corto a gran volumen | GPT-6 Luna y DeepSeek Flash | Si la calidad no llega, sube a Gemini 3.8 Flash o Haiku 4.5 |
| Mucha entrada repetida (misma documentación en cada llamada) | DeepSeek Flash en valle con caché, o Luna con caché | Si el bloque cambia en cada llamada, la caché no compensa |
| Generar mucho texto o código en el nivel intermedio | Grok 4.7 frente a Sol o Sonnet 5 | Si Grok falla en tus pruebas, la diferencia de salida deja de importar |
| Documentos de más de 272K tokens | Claude Sonnet 5 | Si tus prompts no pasan de 272K, Sol y Sonnet cuestan lo mismo |
| Tareas difíciles donde manda la calidad | Claude Opus 5.5 antes que Astra o Fable 5.1 | Si Opus no resuelve lo que necesitas, compara Astra y Fable con tu tasa de caché |
| Trabajos que pueden esperar horas | Batch en OpenAI, Claude o Gemini; horario valle en DeepSeek | Si el usuario espera la respuesta en el momento |

Qué IA merece la pena pagar no se decide solo con la tarifa. Un modelo más barato que necesita dos intentos por respuesta útil, o cuyas respuestas tienes que corregir a mano, puede salir más caro que uno que acierta a la primera. Antes de recargar crédito en serio, pasa 20–50 tareas reales por los dos candidatos, cuenta cuántas respuestas aceptarías sin tocar y divide la factura de la prueba entre ese número. El método completo para dos proveedores está en [Claude API vs OpenAI API: cómo comparar precios por carga real](https://blog.laozhang.ai/es/posts/claude-api-vs-openai-api-pricing).

## Nivel gratuito, intermediarios y calculadoras

En la página de precios de Gemini, 3.8 Flash y 3.1 Flash-Lite tienen entrada y salida gratuitas en el nivel gratuito. La condición es que Google usa el contenido de ese nivel para mejorar sus productos; en el nivel de pago, no. Sirve para prototipos, no para datos de clientes ni para calcular el coste de producción. La fundamentación con la Búsqueda de Google (Grounding with Google Search) incluye 5.000 solicitudes gratis al mes compartidas entre los modelos Gemini 3.x y después cuesta 14 $ por cada 1.000. Los límites de uso de los niveles gratuitos de otros proveedores están en [Mejores API de IA gratis: cuál elegir y cuándo empezar a pagar](https://blog.laozhang.ai/es/posts/free-ai-api-tiers-compared).

Los precios de Gemini de estas tablas son los de la API de Gemini con clave de Google AI Studio; Vertex AI tiene su propia tabla. Si quieres crear tu clave y entender la facturación desde España, sigue [Comprar una clave de API de Gemini en España: precio, facturación y acceso seguro](https://blog.laozhang.ai/es/posts/gemini-api-pricing).

OpenRouter y otros intermediarios venden acceso a estos mismos modelos con su propio precio, que es otro contrato: puede incluir comisión, redondear de otra forma, tratar la caché de otra manera o cobrar las llamadas fallidas. Compáralos con la tabla oficial y revisa el identificador de modelo, la unidad de cobro, los reembolsos y la política de datos, como se explica en [Proveedor API LLM más barato: precio, calidad, latencia y riesgo de gateway](https://blog.laozhang.ai/es/posts/cheapest-llm-api-provider).

Con las calculadoras pasa algo parecido: dan una cifra por modelo, pero no siempre la condición. Si una calculadora te muestra GPT-5.x o Claude Sonnet 4.6 como opción actual, o una sola tarifa para DeepSeek sin distinguir la hora, contrasta la fila con la página oficial antes de fiarte del resultado. Y una suscripción de chat mensual es otro producto: el uso de la API se factura aparte, por tokens.

## Antes de recargar crédito

Estos precios pueden cambiar en cualquier momento. El día que vayas a pagar, abre la página oficial del modelo elegido y comprueba cuatro cosas:

1. El identificador exacto del modelo que vas a poner en el código.
2. Las tarifas de entrada, salida y acierto de caché en tu modalidad (estándar, lotes o Flex).
3. Las condiciones con fecha o umbral: el cambio de Gemini 3.8 Flash el 1 de enero de 2027, los 272K de OpenAI, los 200K de Gemini 3.1 Pro y la hora punta de DeepSeek.
4. Un límite de gasto mensual en la consola del proveedor, sobre todo si vas a lanzar agentes o trabajos por lotes.

## Preguntas frecuentes

### ¿Qué API de IA es la más barata ahora mismo?

Por precio de lista, GPT-6 Luna: 0,10 $ por millón de tokens de entrada y 0,50 $ de salida. DeepSeek Flash en horario valle (0,15 $ y 0,60 $) queda cerca, pero en hora punta cuesta el doble. Gemini 3.1 Flash-Lite es la opción más barata de Google y tiene nivel gratuito.

### ¿Cuánto vale la API de GPT?

GPT-6 Luna cuesta 0,10 $ de entrada y 0,50 $ de salida por millón de tokens, GPT-6 Sol 2 $ y 10 $, y GPT-6 Astra 10 $ y 50 $. Por lotes o con Flex pagas la mitad; con el modo Fast, el doble; y con más de 272K tokens de entrada, toda la solicitud sube al doble en entrada y a 1,5 veces en salida.

### ¿Por qué GPT-6 Sol y Claude Sonnet 5 no cuestan lo mismo si tienen la misma tarifa?

Porque la tarifa de 2 $ y 10 $ solo coincide en prompts cortos. Por encima de 272K tokens de entrada, Sol cobra 4 $ y 15 $ por toda la solicitud, mientras que Sonnet 5 mantiene el precio estándar hasta 1M. Además, el tokenizador de Sonnet 5 genera más tokens por el mismo texto que los Claude anteriores, así que conviene medir tu propio texto con los dos.

### ¿Los precios de OpenRouter sirven para esta comparativa?

Sirven para comparar lo que pagarías a ese intermediario, no lo que cobra el propietario del modelo. Si una fila de OpenRouter o de otro revendedor sale más barata que la oficial, revisa qué modelo exacto sirve, cómo cobra la caché y los fallos, y qué hace con tus datos antes de mover tráfico.
