Mejores API de IA gratis: cuál elegir y cuándo empezar a pagar
A septiembre de 2026, Gemini es la API gratis más amplia para texto; Groq u OpenRouter, el plan B. Si tu app llega a usuarios del EEE, Gemini exige facturación.
En esta página

A 26 de septiembre de 2026, la mejor API de IA gratis para empezar casi cualquier proyecto de texto es la API de Gemini con una clave de Google AI Studio: los modelos Flash y Flash-Lite, Gemini 2.5 Pro y Gemma 4 no cobran tokens, no necesitas cuenta de facturación y, si estás en España, Google aplica a esa cuota gratuita las mismas condiciones de datos que al uso de pago. Como segunda opción, Groq publica límites claros por modelo y OpenRouter te deja probar muchos modelos con una sola clave.
Hay dos condiciones que cambian esa respuesta. La primera: si vas a poner tu aplicación a disposición de usuarios del Espacio Económico Europeo, Suiza o Reino Unido, las condiciones de Gemini te obligan a usar los servicios de pago. La segunda: ninguna de estas API es ilimitada. Todas cortan con un error 429 al pasar de cierto número de peticiones, y la única forma de no depender de cuotas ajenas es ejecutar un modelo abierto en tu propia máquina.
Qué significa "gratis" en cada proveedor
"Gratis" no describe lo mismo en todos los proveedores, y eso decide cuál te conviene más que el propio modelo:
- Capa gratuita recurrente. La cuota se renueva cada día o cada mes sin que pagues nada. Es el caso de Gemini, Groq, los modelos
:freede OpenRouter, Cloudflare Workers AI, Mistral y SambaNova. Sirve para un proyecto personal que va a durar meses. - Crédito de prueba único. Recibes un saldo que se gasta o caduca, a veces solo después de añadir una tarjeta. Cerebras y Anthropic funcionan así. Sirve para evaluar un modelo concreto, no para mantener nada en marcha. Las claves de prueba de Cohere están a medio camino: su cupo se renueva cada mes, pero están pensadas solo para evaluar.
- Límites de modelos gratuitos dentro de un router. OpenRouter no ejecuta los modelos: los enruta a otros proveedores. Su límite gratuito es de OpenRouter, pero la disponibilidad y la política de datos dependen de quién sirve cada modelo.
- Ejecución local. Con herramientas como Ollama descargas un modelo abierto y lo ejecutas en tu ordenador. No hay límite de peticiones ni coste por token, pero la calidad y la velocidad dependen de tu hardware.
Por eso "¿cuál es la mejor?" tiene respuesta solo cuando sabes qué vas a enviar, cuántas peticiones al día necesitas y quién va a usar lo que construyas.

Comparativa de capas gratuitas
Datos de la documentación oficial de cada proveedor, comprobados el 26 de septiembre de 2026. Los modelos incluidos cambian a menudo; el límite que cuenta es el que ves en tu propia cuenta.
| Proveedor | Qué es gratis | Qué pagas | Límite publicado | Dónde falla primero |
|---|---|---|---|---|
| API de Gemini (Google AI Studio) | Familia Flash y Flash-Lite (por ejemplo gemini-3.8-flash), Gemini 2.5 Pro, 2.5 Flash, Gemma 4, Gemini Embedding 2 | Nada: basta un proyecto sin facturación | No se publica por modelo; lo ves en AI Studio. Por proyecto, no por clave; el cupo diario se reinicia a medianoche del Pacífico | Apps para usuarios del EEE; Gemini 3.1 Pro Preview, generación de imágenes y vídeo no entran |
| Groq | openai/gpt-oss-120b, openai/gpt-oss-20b, qwen/qwen3.8-27b, Whisper | Nada en el plan Free | 30 peticiones por minuto, 1.000 al día, 8.000 tokens por minuto y 200.000 al día por modelo; se comparte en toda la organización | Pocos modelos de chat en el plan gratuito |
| OpenRouter | Variantes de modelos con ID terminado en :free | Nada; una compra única de 10 créditos sube el tope diario | 20 por minuto y 50 al día; 1.000 al día si has comprado 10 créditos en total. Más cuentas o claves no suben el límite | 50 peticiones diarias se acaban en una mañana con un agente de código |
| Cloudflare Workers AI | Modelos del catálogo de Workers AI | Nada dentro del plan Workers Free | 10.000 Neurons al día, reinicio a las 00:00 UTC | Algunos modelos, como Kimi K2.6, GLM-5.3 o DeepSeek V4, exigen método de pago |
| Mistral | Modo gratuito de La Plateforme | Nada dentro del uso mensual incluido | El uso mensual incluido aparece en la página Limits de tu cuenta | Cantidades no publicadas: dependen de la cuenta |
| SambaNova Cloud | DeepSeek-V3.1, Llama 3.3 70B, gpt-oss-120b | Nada; el nivel Free se aplica si no tienes método de pago vinculado | 20 peticiones por minuto, 20 al día, 200.000 tokens al día | 20 peticiones diarias solo dan para probar |
| NVIDIA NIM (build.nvidia.com) | Endpoints alojados por NVIDIA para prototipos | Nada; hay que unirse al NVIDIA Developer Program | No publicado en su documentación | Pensado para prototipos; para producción NVIDIA remite a su licencia AI Enterprise |
| Cohere | Command A, Command R y otros con clave de prueba | Nada | 1.000 llamadas al mes; 20 por minuto en chat | La clave de prueba es para evaluar, no para producción |
| Hugging Face Inference Providers | Crédito mensual para cuentas gratuitas | Nada | USD 0,10 al mes | Da para unas cuantas pruebas, no para una carga real |
Fuentes: precios de Gemini, límites de Gemini, límites de Groq, límites de OpenRouter, precios de Workers AI, niveles de Mistral, límites de SambaNova, NVIDIA NIM, límites de Cohere, créditos de Hugging Face.
"Free of charge" en la tabla de precios de Gemini significa que no pagas por token, no que no haya tope. Google ya no publica en su documentación las cifras gratuitas de peticiones por minuto o por día de cada modelo: remite a AI Studio y advierte de que la capacidad real puede variar. Una cifra fija de RPM para Gemini que no salga de tu propio panel es, como mucho, una foto antigua. El detalle está en los límites de la cuota gratuita de Gemini y por qué más claves comparten un solo límite.
Lo que ya no es gratis o nunca lo fue
| Proveedor | Situación a 26 de septiembre de 2026 |
|---|---|
| Cerebras | Sin capa gratuita permanente. La prueba da USD 5 en créditos solo después de añadir una tarjeta verificada, y caducan a los 30 días. Sin tarjeta, ni el Playground ni la API se activan (documentación de Cerebras). |
| GitHub Models | Cerrado por completo desde el 30 de julio de 2026: ni catálogo, ni playground, ni API de inferencia (aviso de GitHub). |
| DeepSeek | Sin capa gratuita pública. Es barato de pago: deepseek-flash cuesta USD 0,15 por millón de tokens de entrada y USD 0,60 de salida en horario valle (precios de DeepSeek). |
| Anthropic (Claude) | Los usuarios nuevos reciben una pequeña cantidad de crédito para probar la API; no hay cuota que se renueve. Cómo seguir después lo explica cómo comprar acceso a Claude API. |
| OpenAI | No hay crédito de registro universal. Las condiciones del nivel Free están en API de OpenAI gratis: nivel Free, tokens diarios y límites. |
Cuál elegir según tu caso
La regla corta: elige primero por lo que vas a enviar y por quién usará el resultado, después por volumen, y solo al final por el modelo.
| Tu situación | Empieza por | Por qué | Cuándo deja de servir |
|---|---|---|---|
| Proyecto personal, aprendizaje o prototipo que solo usas tú | API de Gemini | Flash, Flash-Lite y 2.5 Pro gratis, sin facturación | Cuando otras personas del EEE vayan a usar la app |
| Quieres saber de antemano cuántas peticiones tienes | Groq | 1.000 peticiones al día con gpt-oss-120b, límites y cabeceras claras | Cuando necesites un modelo que no está en el plan Free |
| Automatización con n8n o scripts de volumen bajo y constante | Groq o Gemini | Cupos diarios que se renuevan solos | Cuando un flujo en bucle agote el cupo diario a media jornada |
| Probar varios modelos abiertos con una sola clave, o conectar Cursor u otro agente | OpenRouter :free | Una clave compatible con la API de OpenAI y muchos modelos | 50 peticiones al día; un agente hace varias por cada tarea |
| Ya despliegas en Cloudflare | Workers AI | La IA vive junto a tu Worker | Algunos modelos grandes exigen método de pago |
| Evaluar un modelo concreto antes de pagarlo (Claude, Cohere, Cerebras) | Su crédito de prueba | Es la única forma de medir ese modelo | Cuando se gasta o caduca el crédito |
| Datos personales, de clientes o confidenciales | Ejecución local o una API de pago | Ninguna capa gratuita está pensada para eso | Local: cuando tu equipo no mueve el modelo que necesitas |
Un matiz sobre los agentes de código: Cursor, Cline y herramientas similares envían muchas peticiones seguidas en cada tarea, así que agotan antes los cupos diarios que una prueba manual. Si ese es tu uso, mira Claude Code con OpenRouter y DeepSeek para ver la configuración y los primeros errores habituales.
Para generar imágenes, la cuestión es distinta: los modelos de imagen de Gemini (Nano Banana) no entran en la cuota gratuita y cada proveedor tiene sus propias reglas. Lo cubre API gratis de IA para generar imágenes en 2026.
Gemini desde España: gratis para probar, de pago para publicar
España está en la lista de regiones donde se puede usar la API de Gemini (regiones disponibles). Lo que cambia respecto a un desarrollador de fuera de Europa son dos cláusulas de las condiciones adicionales de la API de Gemini:
- Tus datos. Fuera del EEE, Suiza y Reino Unido, lo que envías con la cuota gratuita (y lo que responde el modelo) se usa para mejorar productos de Google, y revisores humanos pueden leerlo. Por eso las propias condiciones piden no enviar información sensible, confidencial ni personal. Para usuarios que están en el EEE, Suiza o Reino Unido, en cambio, se aplican a AI Studio y a la cuota gratuita las condiciones de datos de los servicios de pago, aunque no pagues.
- Publicar una aplicación. Las mismas condiciones dicen que solo puedes usar los servicios de pago cuando pones un cliente de la API a disposición de usuarios del EEE, Suiza o Reino Unido. La API pasa a ser de pago cuando la llamas desde un proyecto de Cloud con una cuenta de facturación activa.
Leído de forma práctica (es una interpretación de esas cláusulas, no una aclaración de Google): desde España puedes aprender, prototipar y hacer pruebas internas con la cuota gratuita sin que tus peticiones se usen para entrenar. En cuanto tu aplicación la vayan a usar otras personas en Europa, aunque sea gratis para ellas, tiene que funcionar en un proyecto con facturación. Si tu caso está en la frontera (una herramienta interna de empresa, una demo pública), consulta las condiciones con quien lleve la parte legal antes de publicar.
Con facturación, cada token se cobra según la tabla de precios. Como referencia, gemini-3.8-flash cuesta USD 0,75 por millón de tokens de entrada y USD 3,75 de salida hasta el 31 de diciembre de 2026, y USD 1,50 y USD 7,50 a partir del 1 de enero de 2027 (precios de Gemini).
Con las demás capas gratuitas, la regla prudente es la misma que pide Google fuera de Europa: no envíes nada que no publicarías. En OpenRouter, además, cada modelo gratuito lo sirve un proveedor distinto con su propia política de datos, que conviene leer en la ficha del modelo antes de usarlo.
Primera petición y qué hacer ante un 429
Gemini, Groq y OpenRouter aceptan el SDK de OpenAI cambiando solo la base URL, la clave y el nombre del modelo. Eso permite escribir un cliente que pase al siguiente proveedor cuando uno responde con un 429 (demasiadas peticiones).
Guarda las claves en variables de entorno, nunca en el código:
pip install openai
export GEMINI_API_KEY="pega-aquí-tu-clave-de-ai-studio"
export GROQ_API_KEY="pega-aquí-tu-clave-de-groq"
export OPENROUTER_API_KEY="pega-aquí-tu-clave-de-openrouter"import os
from openai import OpenAI, RateLimitError
# (nombre, base URL, variable de entorno, modelo)
PROVEEDORES = [
("gemini", "https://generativelanguage.googleapis.com/v1beta/openai/",
"GEMINI_API_KEY", "gemini-3.8-flash"),
("groq", "https://api.groq.com/openai/v1",
"GROQ_API_KEY", "openai/gpt-oss-120b"),
("openrouter", "https://openrouter.ai/api/v1",
"OPENROUTER_API_KEY", "openai/gpt-oss-120b:free"),
]
def preguntar(mensaje: str) -> str:
for nombre, base_url, variable, modelo in PROVEEDORES:
clave = os.environ.get(variable)
if not clave:
continue # sin clave para este proveedor, pasa al siguiente
# max_retries=0: el SDK no reintenta solo y el 429 llega aquí al momento
cliente = OpenAI(base_url=base_url, api_key=clave, max_retries=0)
try:
respuesta = cliente.chat.completions.create(
model=modelo,
messages=[{"role": "user", "content": mensaje}],
)
return f"({nombre}) {respuesta.choices[0].message.content}"
except RateLimitError as error:
espera = error.response.headers.get("retry-after")
print(f"{nombre}: 429, retry-after={espera}. Pruebo el siguiente.")
raise RuntimeError("Todas las cuotas gratuitas están agotadas por ahora.")
print(preguntar("Explica en una frase qué es un error 429."))Los modelos de Gemini y Groq son los que figuran en su documentación a 26 de septiembre de 2026. openai/gpt-oss-120b:free es una variante gratuita de OpenRouter, y esas variantes entran y salen con frecuencia: si recibes un error de modelo no encontrado, busca una vigente en su catálogo filtrando por modelos gratuitos. Y recuerda la sección anterior: este patrón vale para un prototipo tuyo; si la app va a tener usuarios en Europa, el proyecto de Gemini debe tener facturación.
Un 429 no siempre significa lo mismo, así que conviene saber dónde mirar en cada caso:
- Gemini. Los límites activos de tu proyecto están en Google AI Studio. Se aplican por proyecto: crear más claves en el mismo proyecto no te da más cupo. El contador diario se reinicia a medianoche del Pacífico, que en la España peninsular suele caer a las 9:00 (a las 8:00 en Canarias), salvo en las semanas en que el cambio de hora de EE. UU. y el europeo no coinciden.
- Groq. Cada respuesta trae las cabeceras
x-ratelimit-remaining-requests(peticiones que te quedan hoy) yx-ratelimit-remaining-tokens(tokens por minuto). Cuando te pasas, el 429 incluyeretry-aftercon los segundos que debes esperar. Los tokens que salen de caché no cuentan para los límites. - OpenRouter. Consulta cuánto te queda con tu clave:
curl https://openrouter.ai/api/v1/key \
-H "Authorization: Bearer $OPENROUTER_API_KEY"El campo free_model_daily_requests indica used, limit y remaining, contados por día UTC. Ahí no aparece el límite por minuto. Ten en cuenta que un 429 puede venir de OpenRouter o del proveedor que sirve el modelo, y que con saldo negativo en la cuenta pueden fallar incluso los modelos gratuitos.
Si el 429 aparece a los pocos segundos, has chocado con el límite por minuto: espera lo que diga retry-after o espacia las peticiones. Si aparece todos los días a la misma hora, se te acaba el cupo diario y lo que necesitas es otro proveedor o empezar a pagar.

Cuándo dejar lo gratuito
Lo gratuito deja de compensar antes de lo que parece. Estas señales indican que toca pasar al pago:
- Otras personas van a usar lo que has construido. Con usuarios del EEE, en Gemini es obligatorio; en los demás proveedores, un cupo diario compartido convierte cualquier pico de uso en errores para tus usuarios.
- Diseñas la aplicación alrededor del límite. Colas artificiales, cambiar de proveedor a mitad de conversación o recortar respuestas para no gastar tokens son síntomas de que el prototipo ya no se parece al producto.
- Necesitas un modelo que no está en ninguna capa gratuita, como Gemini 3.1 Pro Preview o los modelos grandes de Workers AI.
- Tus datos no deberían salir de un contrato de pago o de tu propia máquina.
- Pierdes más tiempo gestionando cuotas que programando.
El siguiente paso depende de qué te falte:
- Seguir con el mismo modelo. Si Gemini te sirve, vincula una cuenta de facturación al proyecto: pasas al nivel de pago (Tier 1), con límites más altos y sin cambiar de código. En Groq, el Developer Plan tiene sus propios límites, más altos.
- Pagar lo mínimo. DeepSeek, por ejemplo, cobra una fracción de dólar por millón de tokens en
deepseek-flash. La comparación de precio, calidad y latencia está en proveedor API LLM más barato. - Varios proveedores con una sola clave y un solo saldo. Una pasarela de pago compatible con la API de OpenAI, como laozhang.ai, cobra por uso desde un saldo prepagado. Es un servicio de pago y no incluye las cuotas gratuitas de los proveedores originales; tiene sentido cuando ya pagas a varios y quieres centralizar facturación y claves.
- Privacidad total o cero coste por token. Ejecutar un modelo abierto en local elimina las cuotas y el envío de datos a terceros, a cambio de depender de tu hardware.
Preguntas frecuentes
¿La API de Gemini es gratis?
Sí para la familia Flash y Flash-Lite, Gemini 2.5 Pro, Gemma 4 y Gemini Embedding 2, con límites que ves en Google AI Studio. No lo es para Gemini 3.1 Pro Preview, los modelos de imagen, Veo ni el modo Batch. Desde España, la cuota gratuita sirve para probar, pero una aplicación para usuarios del EEE debe funcionar con facturación.
¿Necesito tarjeta para usar una API de IA gratis?
No en Gemini (basta un proyecto sin facturación), ni en los modelos :free de OpenRouter, ni en el nivel Free de SambaNova, que se aplica precisamente cuando no hay método de pago. Sí en Cerebras: sus créditos de prueba solo se activan tras añadir una tarjeta verificada.
¿Hay alguna API de IA gratis sin límites?
No. Todas las capas gratuitas tienen límites por minuto, por día o por mes, y responden con un error 429 al superarlos. Lo único sin cuota es ejecutar un modelo abierto en tu propio equipo, donde el límite lo pone el hardware.
¿Usan mis datos para entrenar si uso la API gratis?
Depende del proveedor y de dónde estés. En la cuota gratuita de Gemini, fuera del EEE, Suiza y Reino Unido, Google usa lo que envías para mejorar sus productos y puede revisarlo gente; dentro de esas zonas se aplican las condiciones de datos de pago. En los demás proveedores, lee su política antes de enviar nada sensible.
¿Cerebras sigue siendo gratis?
No. Cerebras no tiene capa gratuita permanente: ofrece USD 5 de prueba que exigen tarjeta verificada y caducan a los 30 días.
¿DeepSeek tiene API gratis?
No tiene capa gratuita pública, pero es de las API de pago más baratas: deepseek-flash cuesta USD 0,15 por millón de tokens de entrada y USD 0,60 de salida en horario valle.





