# Proveedor de API LLM más barato: dónde comprar el mismo modelo

> DeepSeek V4 Pro sale a mitad de precio en DeepSeek directo en horas valle; en GPT, Claude o Gemini el dueño marca el suelo y los routers suman su comisión.

- URL: https://blog.laozhang.ai/es/posts/cheapest-llm-api-provider
- Published: 2026-07-01
- Updated: 2026-09-26
- Author: LaoZhang AI Team (https://blog.laozhang.ai/es/about)
- Category: Precios de API
- Tags: API LLM, Precios API, DeepSeek V4, OpenRouter, Proveedores de inferencia

---
No existe un proveedor que sea el más barato para todos los modelos. Lo que sí existe es la vía más barata para **un modelo concreto**, y a 26 de septiembre de 2026 las reglas son bastante claras. Con un modelo de pesos abiertos como DeepSeek V4 Pro, la API directa de DeepSeek en horas valle (0,66 $ de entrada y 1,98 $ de salida por millón de tokens) cuesta la mitad que Together, que cobra justo la tarifa de hora punta oficial; si el trabajo no puede esperar a la franja valle, DeepInfra (1,30 $ / 2,60 $) es la opción más barata entre las que publican precio. Con modelos cerrados (GPT-6, Claude, Gemini, Grok) nadie más puede alojar los pesos: el precio del dueño es el suelo, y un router que lo traslada "sin margen" te cobra aparte al recargar saldo.

Todo lo que viene después sirve para aplicar esa lógica al modelo que ya has elegido. Si todavía no sabes qué modelo te conviene, empieza por la [comparativa de precios de API de IA: qué modelo sale más barato](https://blog.laozhang.ai/es/posts/cheapest-llm-models) y vuelve aquí con uno o dos candidatos.

## Cuatro vías para comprar el mismo modelo

Cada vía vende una cosa distinta, y eso explica por qué el mismo nombre de modelo aparece con precios diferentes.

| Vía | Qué te vende | Cuándo sale más barata | Dónde se encarece |
| --- | --- | --- | --- |
| Directo con el dueño del modelo (OpenAI, Anthropic, Google, xAI, DeepSeek) | Su propia inferencia, con su tabla de precios, su caché y sus descuentos | Casi siempre en modelos cerrados; en DeepSeek, además, fuera de hora punta | Cuentas y facturas separadas por cada proveedor que uses |
| Proveedor de alojamiento para modelos de pesos abiertos (Together, DeepInfra, Fireworks) | Su propio despliegue de los pesos publicados, con precio propio | Cuando su tarifa queda por debajo de la del dueño o no tiene franjas horarias | Puede servir una instantánea antigua o cobrar la caché más cara que el dueño |
| Router o agregador (OpenRouter) | Una sola API que reenvía tu petición a un proveedor de la lista | Cuando te ahorra integrar y mantener varias cuentas | Comisión al comprar créditos, aunque el precio por token se traslade tal cual |
| Pasarela o revendedor de prepago (laozhang.ai y similares) | Un endpoint compatible y un saldo único para muchos modelos | Cuando necesitas un solo punto de pago y acceso, o el directo no te sirve | Tabla de precios propia, a veces con multiplicadores por grupo |

La primera pregunta, por tanto, no es "¿qué proveedor es más barato?", sino "¿quién puede venderme este modelo?". En los modelos cerrados solo hay dos respuestas: el dueño o alguien que revende su API. En los de pesos abiertos entran también los alojadores, y ahí es donde aparecen las diferencias de precio reales.

## El mismo modelo, cuatro facturas: DeepSeek V4

DeepSeek es el mejor ejemplo porque su modelo se vende en las cuatro vías y porque la API directa tiene dos tarifas según la hora. La hora punta de DeepSeek va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes, salvo festivos oficiales de China; el resto del tiempo todo cuesta la mitad. En la España peninsular eso equivale a 03:00–06:00 y 08:00–12:00 mientras rige el horario de verano, y a 02:00–05:00 y 07:00–11:00 desde el 25 de octubre de 2026. El cálculo por franjas y lotes está desarrollado en el [precio de DeepSeek V4 por horas: cálculo API para España](https://blog.laozhang.ai/es/posts/deepseek-v4).

Precios por millón de tokens a 26 de septiembre de 2026, tomados de la [tabla oficial de DeepSeek](https://api-docs.deepseek.com/quick_start/pricing), la [de Together](https://www.together.ai/pricing) y la [de DeepInfra](https://deepinfra.com/pricing):

| Modelo y vía | Entrada (acierto de caché) | Entrada (sin caché) | Salida |
| --- | ---: | ---: | ---: |
| DeepSeek V4 Pro, directo, hora punta | 0,044 $ | 1,32 $ | 3,96 $ |
| DeepSeek V4 Pro, directo, horas valle | 0,022 $ | 0,66 $ | 1,98 $ |
| DeepSeek V4 Pro 0813, Together | 0,13 $ | 1,32 $ | 3,96 $ |
| DeepSeek-V4-Pro, DeepInfra | 0,10 $ | 1,30 $ | 2,60 $ |
| DeepSeek V4.1 Flash, directo, hora punta | 0,006 $ | 0,30 $ | 1,20 $ |
| DeepSeek V4.1 Flash, directo, horas valle | 0,003 $ | 0,15 $ | 0,60 $ |
| DeepSeek V4.1 Flash, Together | 0,006 $ | 0,30 $ | 1,20 $ |

Las filas de Together para V4 Pro y V4.1 Flash coinciden exactamente con la hora punta de DeepSeek, y su página no muestra descuento por franja horaria. Es decir: en Together pagas siempre lo que DeepSeek cobra en su hora más cara.

### Cuánto cambia la factura en un mes

Supón un servicio que consume 100 millones de tokens de entrada y 20 millones de salida al mes, sin caché. La fórmula es la misma para todas las vías:

`coste = (millones de entrada × precio de entrada) + (millones de salida × precio de salida)`

| Vía | DeepSeek V4 Pro | DeepSeek V4.1 Flash |
| --- | ---: | ---: |
| Directo, todo en hora punta | 211,20 $ | 54,00 $ |
| Directo, todo en horas valle | 105,60 $ | 27,00 $ |
| Together | 211,20 $ | 54,00 $ |
| DeepInfra | 182,00 $ | — |

Por ejemplo, V4 Pro en DeepInfra: 100 × 1,30 + 20 × 2,60 = 182,00 $. La conclusión cambia según tu reloj. Si el trabajo se puede programar fuera de hora punta (lotes nocturnos, resúmenes, clasificación de fondo), DeepSeek directo gana con claridad. Si el tráfico es interactivo y cae en horario laboral europeo, buena parte coincide con la franja 08:00–12:00, y ahí DeepInfra ahorra unos 29 $ al mes frente al directo en punta, sobre todo por su salida más barata.

![Factura mensual de DeepSeek V4 Pro con 100 millones de tokens de entrada y 20 de salida: 211,20 $ directo en hora punta, 105,60 $ en horas valle, 211,20 $ en Together y 182,00 $ en DeepInfra](https://blog.laozhang.ai/posts/es/cheapest-llm-api-provider/img/deepseek-v4-monthly-bill.webp)

### La caché también cambia de ganador

Los precios con acierto de caché no son iguales en todas las vías. Con el mismo volumen, pero con un 60 % de la entrada servida desde caché:

- DeepSeek directo en punta: 40 × 1,32 + 60 × 0,044 + 20 × 3,96 = 134,64 $
- DeepSeek directo en valle: 67,32 $
- Together: 40 × 1,32 + 60 × 0,13 + 20 × 3,96 = 139,80 $
- DeepInfra: 40 × 1,30 + 60 × 0,10 + 20 × 2,60 = 110,00 $

El cálculo supone que cada proveedor reconoce la misma proporción de aciertos, y eso no está garantizado: cada uno gestiona su propia caché. Mide la tasa real en tus registros de uso antes de dar por buena cualquier cifra.

## Modelos cerrados: el precio del dueño es el suelo

GPT, Claude, Gemini y Grok no tienen pesos públicos, así que ningún alojador puede servirlos por su cuenta. Cualquier router o pasarela que los ofrezca revende, en último término, la API del dueño. Estos son los precios directos por millón de tokens a 26 de septiembre de 2026:

| Modelo (dueño) | Entrada | Entrada en caché | Salida |
| --- | ---: | ---: | ---: |
| GPT-6 Luna (OpenAI) | 0,10 $ | 0,01 $ | 0,50 $ |
| GPT-6 Sol (OpenAI) | 2 $ | 0,20 $ | 10 $ |
| Claude Haiku 4.5 (Anthropic) | 1 $ | 0,10 $ | 5 $ |
| Claude Sonnet 5 (Anthropic) | 2 $ | 0,20 $ | 10 $ |
| Gemini 3.1 Flash-Lite (Google) | 0,25 $ | — | 1,50 $ |
| Gemini 3.8 Flash (Google) | 0,75 $ | 0,075 $ | 3,75 $ |
| grok-4.7 (xAI) | 2 $ | 0,50 $ | 6 $ |

OpenAI cobra la mitad en sus modos Batch y Flex, y Google la mitad en Batch para Gemini 3.8 Flash. Con un modelo cerrado, lo más barato que puedes conseguir suele ser el precio de lista del dueño con su descuento por lotes, cuando la tarea admite esperar. Un router que traslada ese precio te cuesta lo mismo por token más su comisión; una pasarela aplica su propia tabla, y solo la consola de cada una dice si queda por encima o por debajo para el mismo ID de modelo. Para comparar niveles entre OpenAI y Anthropic tienes el [precio de la API de Claude vs OpenAI: qué nivel sale más barato](https://blog.laozhang.ai/es/posts/claude-api-vs-openai-api-pricing), y para xAI el [precio de la API de Grok: tarifas de grok-4.7, 4.3 y Build](https://blog.laozhang.ai/es/posts/xai-grok-api-pricing).

Fíjate también en la fecha de Gemini 3.8 Flash: su tarifa actual rige hasta el 31 de diciembre de 2026 y después sube a 1,50 $ de entrada y 7,50 $ de salida. Un cálculo que hoy da ventaja a ese modelo puede invertirse en enero sin que cambies una línea de código.

## Routers: "sin margen" no significa gratis

OpenRouter declara en su FAQ que traslada el precio de los proveedores sin sobreprecio en la inferencia, pero cobra una comisión al comprar créditos: **5,5 % en el plan Standard** y 8 % en Business, según su [página de precios](https://openrouter.ai/pricing). Una recarga de 500 $ lleva 27,50 $ de comisión. En la práctica equivale a pagar un 5,5 % más por cada token:

`coste real en el router = coste de inferencia × 1,055`

Aplicado al ejemplo anterior, si OpenRouter enviara tus peticiones de V4 Pro a un proveedor con la tarifa de DeepInfra, los 182,00 $ de inferencia te costarían 192,01 $ con la comisión. Sigue siendo menos que DeepSeek directo en hora punta, pero un 82 % más que el directo en horas valle. Qué proveedor concreto atiende cada modelo y a qué precio lo ves en la página del modelo dentro de OpenRouter; no lo supongas.

Hay dos matices que cambian el cálculo:

- **Con tu propia clave (BYOK)**, pagas la inferencia directamente al proveedor y OpenRouter no cobra comisión durante los primeros 25.000 $ mensuales de inferencia a precio de lista en los planes Standard y Business; por encima, cobra un 5 %. Te sirve si quieres el enrutado de OpenRouter pero conservar la tarifa, y los descuentos, de tu cuenta directa.
- **El plan Free** no tiene comisión, pero se limita a más de 25 modelos gratuitos y 50 peticiones al día, y no admite BYOK. Vale para probar, no para producción.

El router compensa cuando lo que te ahorra en integración, cuentas y cambio de modelo vale más que ese 5,5 %. Si solo vas a usar un modelo de un solo dueño, rara vez lo compensa.

## Trampas que hacen parecer barata una vía

**El proveedor cobra lo mismo que la hora punta oficial.** Es el caso de Together con DeepSeek V4 Pro y V4.1 Flash. Parece un precio "igual que el oficial", pero pierdes la mitad de descuento que DeepSeek da en horas valle.

**Una instantánea antigua con un nombre parecido.** DeepSeek sirve hoy V4.1-Flash detrás del ID `deepseek-flash`, y el antiguo nombre `deepseek-v4-flash` se retiró y ahora responde con V4.1-Flash. Mientras tanto, los alojadores siguen vendiendo pesos anteriores: Together ofrece DeepSeek V4 Flash 0731 a 0,14 $ / 0,28 $ y DeepInfra lo tiene a 0,06 $ / 0,18 $. DeepInfra lista además un "DeepSeek-V4-Flash" a 0,09 $ / 0,18 $ cuya versión exacta no se deduce del nombre. Son filas más baratas, pero no son necesariamente el mismo modelo que la API oficial. Antes de comparar precios, confirma la fecha o el sufijo de versión en la ficha del endpoint.

**Una comisión encima de precios "sin margen".** El precio por token del router puede ser idéntico al del proveedor y la factura final no. Suma siempre la comisión de recarga, y los cargos por pago con criptomonedas si los usas.

**Rankings hechos por el propio proveedor.** Una lista de "los cinco proveedores más baratos" publicada por uno de ellos, que se incluye en la lista, no demuestra nada. Para comparar el mismo modelo entre alojadores, sirve más una fuente que mida varios endpoints a la vez, como la clasificación de proveedores de Artificial Analysis, y después tu propia prueba con tus prompts.

**Cifras que no puedes comprobar.** Si el precio de Groq, SiliconFlow, Mistral o cualquier otro proveedor no aparece en su página oficial para el modelo y la fecha que te interesan, no lo metas en la hoja de cálculo. Lo mismo vale para cualquier "desde 0,00X $ por millón" sin ficha de modelo detrás.

## Coste por respuesta aceptada: la cifra que compara de verdad

Los precios por token solo son el punto de partida. La cifra útil es:

`coste por respuesta aceptada = factura total / respuestas que pasan tu control de calidad`

Si dos vías sirven de verdad el mismo modelo con la misma versión y precisión, la tasa de aceptación debería ser casi idéntica y ganará la de menor factura. Si en la misma prueba una vía acepta claramente menos respuestas, has encontrado una diferencia: otra instantánea, otra cuantización, más tiempos de espera agotados o más errores que obligan a reintentar.

Un ejemplo con cifras supuestas: 10.000 tareas al mes. La vía A factura 40 $ y aprueban 5.000 respuestas: 0,008 $ por respuesta aceptada. La vía B factura 54 $ y aprueban 9.000: 0,006 $. La más cara en la tabla es la más barata en producción, y eso sin contar el coste de repetir las 5.000 tareas fallidas en otro sitio.

En la hoja de cálculo, para cada vía, anota:

- tokens de entrada, de salida y de caché facturados por tarea;
- reintentos y errores (y si se cobran);
- latencia típica y en el peor 5 % de peticiones;
- respuestas aceptadas sobre el total;
- comisiones, recargas y cambios de tarifa con fecha.

## Pasarelas de prepago: cuándo tiene sentido laozhang.ai

Las pasarelas de prepago revenden acceso a muchos modelos a través de un endpoint compatible. laozhang.ai es la pasarela API de este blog y funciona así, según su documentación pública:

- un único endpoint, `https://api.laozhang.ai/v1`, compatible con el formato de OpenAI, además del formato Messages de Anthropic (`/v1/messages`) y el de Gemini;
- saldo prepago; cada petición se cobra por tokens o por llamada según el modelo, y algunos grupos de claves aplican un multiplicador de precio;
- no guarda por defecto el contenido de prompts y respuestas; conserva metadatos operativos (hora, modelo, consumo, estado y latencia) para facturación, seguridad y soporte;
- la opera YingTu Technology Pte. Ltd., empresa de Singapur, que declara no ser el operador oficial de los modelos; los pagos van por Stripe;
- el registro requiere una cuenta de Gmail y pasa por una revisión de acceso.

Tiene sentido cuando necesitas muchos modelos con una sola clave y un solo saldo, o cuando la cuenta directa con el dueño no te resulta práctica. No es, por definición, la vía más barata: su tabla es propia y los multiplicadores dependen del grupo. Compara el precio del mismo ID de modelo en su página de modelos y precios, o en la consola de tu cuenta, con la fila directa, y aplica las mismas comprobaciones que a cualquier otra pasarela. Para el caso concreto de Claude hay una comparación más detallada en [cómo elegir un acceso estable a Claude: Anthropic directo, nube compatible o la pasarela de laozhang.ai](https://blog.laozhang.ai/es/posts/claude-gateway-laozhang-ai).

## Créditos gratis y cuantización

Los créditos gratuitos sirven para probar una vía, no para compararla en producción. Fireworks, por ejemplo, da 1 $ de crédito inicial y factura a mes vencido; OpenRouter tiene su plan Free con 50 peticiones al día. Con eso puedes lanzar tu batería de prompts y medir aceptación, pero no latencia bajo carga ni límites reales. Si lo que buscas es arrancar sin pagar, las opciones están en [mejores API de IA gratis: cuál elegir y cuándo empezar a pagar](https://blog.laozhang.ai/es/posts/free-ai-api-tiers-compared).

Sobre la cuantización, la tabla de precios de un alojador rara vez dice con qué precisión sirve los pesos. Si un modelo de pesos abiertos sale sospechosamente barato, pregunta la precisión o mírala en la ficha del endpoint, y compara salidas contra la API del dueño con los mismos prompts. Lo mismo aplica a modelos de gama económica como GLM-5.3-Flash, que Together ofrece a 0,15 $ / 0,50 $; los detalles de ese modelo están en la [guía de GLM-5.3-Flash: Ox Alpha, precio de la API y ejecución local](https://blog.laozhang.ai/es/posts/glm-5-3-flash-guide).

## Lista de comprobación antes de mover tráfico de producción

1. **Identifica el modelo exacto**: nombre, versión o fecha de la instantánea, y quién es el dueño de los pesos.
2. **Anota la fila oficial del dueño** con su fecha, incluidas franjas horarias, caché y descuentos por lotes.
3. **Anota la fila de cada vía alternativa** para el mismo ID, y comprueba que el sufijo de versión coincide.
4. **Suma las comisiones**: recarga del router, multiplicador del grupo en la pasarela, cargos por método de pago.
5. **Calcula el mes con tu volumen real**, separando entrada con y sin caché, salida y la parte del tráfico que cae en hora punta.
6. **Lanza la misma batería de prompts** en cada vía candidata y compara la tasa de aceptación; si difiere con el mismo modelo, averigua por qué.
7. **Revisa facturación de errores, límites y retención de datos**. Si tus prompts llevan datos personales, código privado o información de clientes, revisa antes la [retención de datos en API LLM vs Zero Data Retention: guía de decisión](https://blog.laozhang.ai/es/posts/llm-api-data-retention-vs-zero-data-retention).
8. **Mueve solo una parte del tráfico** con un límite de gasto y una vuelta atrás preparada, y programa una revisión antes de cualquier fecha de cambio de tarifa conocida.

Si una vía no supera los pasos 3 o 6, su precio no es comparable, por bajo que sea.

![Lista de ocho pasos antes de mover tráfico de producción a otra vía, con el paso 3, mismo ID y versión, y el paso 6, misma batería de prompts, como filtros eliminatorios](https://blog.laozhang.ai/posts/es/cheapest-llm-api-provider/img/production-switch-checklist.webp)

## Preguntas frecuentes

### ¿Cuál es el proveedor de API LLM más barato?

Depende del modelo, no del proveedor. A 26 de septiembre de 2026, para DeepSeek V4 Pro la opción más barata con precio publicado es DeepSeek directo en horas valle (0,66 $ / 1,98 $ por millón de tokens); fuera de esa franja, DeepInfra (1,30 $ / 2,60 $). Para GPT, Claude, Gemini o Grok, el precio de lista del dueño, con su descuento por lotes cuando la tarea lo permite, es el suelo habitual.

### ¿Sale más barato un router como OpenRouter que ir directo?

Por token, cuesta lo mismo que el proveedor al que te envía, porque OpenRouter declara no añadir margen a la inferencia. Pero la compra de créditos lleva una comisión del 5,5 % en el plan Standard, así que en la factura final es algo más caro. Compensa si te ahorra integraciones y cuentas; con BYOK, la comisión no se aplica hasta 25.000 $ mensuales de inferencia a precio de lista.

### ¿Por qué el mismo modelo tiene precios tan distintos en cada proveedor?

Porque cada alojador pone su propio precio a su despliegue, algunos venden instantáneas antiguas bajo nombres parecidos y el dueño puede tener descuentos por horario que el alojador no replica. Compara solo filas con la misma versión exacta.

### ¿Los créditos gratis sirven para elegir proveedor?

Sirven para medir calidad con tus prompts, no para medir coste ni comportamiento bajo carga. Úsalos para la batería de pruebas y haz el cálculo mensual con las tarifas de pago.

### ¿Cada cuánto conviene revisar los precios?

Antes de cada migración, antes de subir mucho el volumen y cuando haya una fecha de cambio anunciada, como el fin de la tarifa promocional de Gemini 3.8 Flash el 31 de diciembre de 2026. Las filas de los alojadores cambian con cada nueva instantánea, así que guarda la fecha junto a cada precio de tu hoja de cálculo.
