Saltar al contenido principal

Mejores API de IA gratis: cuál elegir y cuándo empezar a pagar

A septiembre de 2026, Gemini es la API gratis más amplia para texto; Groq u OpenRouter, el plan B. Si tu app llega a usuarios del EEE, Gemini exige facturación.

LaoZhang AI TeamPublicadoActualizado 13 min de lectura
En esta página
API de IA gratis: Gemini sin tarjeta como primera opción, Groq con 1.000 peticiones al día y OpenRouter con 50 al día como plan B

A 26 de septiembre de 2026, la mejor API de IA gratis para empezar casi cualquier proyecto de texto es la API de Gemini con una clave de Google AI Studio: los modelos Flash y Flash-Lite, Gemini 2.5 Pro y Gemma 4 no cobran tokens, no necesitas cuenta de facturación y, si estás en España, Google aplica a esa cuota gratuita las mismas condiciones de datos que al uso de pago. Como segunda opción, Groq publica límites claros por modelo y OpenRouter te deja probar muchos modelos con una sola clave.

Hay dos condiciones que cambian esa respuesta. La primera: si vas a poner tu aplicación a disposición de usuarios del Espacio Económico Europeo, Suiza o Reino Unido, las condiciones de Gemini te obligan a usar los servicios de pago. La segunda: ninguna de estas API es ilimitada. Todas cortan con un error 429 al pasar de cierto número de peticiones, y la única forma de no depender de cuotas ajenas es ejecutar un modelo abierto en tu propia máquina.

Qué significa "gratis" en cada proveedor

"Gratis" no describe lo mismo en todos los proveedores, y eso decide cuál te conviene más que el propio modelo:

  • Capa gratuita recurrente. La cuota se renueva cada día o cada mes sin que pagues nada. Es el caso de Gemini, Groq, los modelos :free de OpenRouter, Cloudflare Workers AI, Mistral y SambaNova. Sirve para un proyecto personal que va a durar meses.
  • Crédito de prueba único. Recibes un saldo que se gasta o caduca, a veces solo después de añadir una tarjeta. Cerebras y Anthropic funcionan así. Sirve para evaluar un modelo concreto, no para mantener nada en marcha. Las claves de prueba de Cohere están a medio camino: su cupo se renueva cada mes, pero están pensadas solo para evaluar.
  • Límites de modelos gratuitos dentro de un router. OpenRouter no ejecuta los modelos: los enruta a otros proveedores. Su límite gratuito es de OpenRouter, pero la disponibilidad y la política de datos dependen de quién sirve cada modelo.
  • Ejecución local. Con herramientas como Ollama descargas un modelo abierto y lo ejecutas en tu ordenador. No hay límite de peticiones ni coste por token, pero la calidad y la velocidad dependen de tu hardware.

Por eso "¿cuál es la mejor?" tiene respuesta solo cuando sabes qué vas a enviar, cuántas peticiones al día necesitas y quién va a usar lo que construyas.

Los cuatro tipos de gratis en las API de IA: cuota recurrente, crédito de prueba único, modelos gratis dentro de un router y ejecución local

Comparativa de capas gratuitas

Datos de la documentación oficial de cada proveedor, comprobados el 26 de septiembre de 2026. Los modelos incluidos cambian a menudo; el límite que cuenta es el que ves en tu propia cuenta.

ProveedorQué es gratisQué pagasLímite publicadoDónde falla primero
API de Gemini (Google AI Studio)Familia Flash y Flash-Lite (por ejemplo gemini-3.8-flash), Gemini 2.5 Pro, 2.5 Flash, Gemma 4, Gemini Embedding 2Nada: basta un proyecto sin facturaciónNo se publica por modelo; lo ves en AI Studio. Por proyecto, no por clave; el cupo diario se reinicia a medianoche del PacíficoApps para usuarios del EEE; Gemini 3.1 Pro Preview, generación de imágenes y vídeo no entran
Groqopenai/gpt-oss-120b, openai/gpt-oss-20b, qwen/qwen3.8-27b, WhisperNada en el plan Free30 peticiones por minuto, 1.000 al día, 8.000 tokens por minuto y 200.000 al día por modelo; se comparte en toda la organizaciónPocos modelos de chat en el plan gratuito
OpenRouterVariantes de modelos con ID terminado en :freeNada; una compra única de 10 créditos sube el tope diario20 por minuto y 50 al día; 1.000 al día si has comprado 10 créditos en total. Más cuentas o claves no suben el límite50 peticiones diarias se acaban en una mañana con un agente de código
Cloudflare Workers AIModelos del catálogo de Workers AINada dentro del plan Workers Free10.000 Neurons al día, reinicio a las 00:00 UTCAlgunos modelos, como Kimi K2.6, GLM-5.3 o DeepSeek V4, exigen método de pago
MistralModo gratuito de La PlateformeNada dentro del uso mensual incluidoEl uso mensual incluido aparece en la página Limits de tu cuentaCantidades no publicadas: dependen de la cuenta
SambaNova CloudDeepSeek-V3.1, Llama 3.3 70B, gpt-oss-120bNada; el nivel Free se aplica si no tienes método de pago vinculado20 peticiones por minuto, 20 al día, 200.000 tokens al día20 peticiones diarias solo dan para probar
NVIDIA NIM (build.nvidia.com)Endpoints alojados por NVIDIA para prototiposNada; hay que unirse al NVIDIA Developer ProgramNo publicado en su documentaciónPensado para prototipos; para producción NVIDIA remite a su licencia AI Enterprise
CohereCommand A, Command R y otros con clave de pruebaNada1.000 llamadas al mes; 20 por minuto en chatLa clave de prueba es para evaluar, no para producción
Hugging Face Inference ProvidersCrédito mensual para cuentas gratuitasNadaUSD 0,10 al mesDa para unas cuantas pruebas, no para una carga real

Fuentes: precios de Gemini, límites de Gemini, límites de Groq, límites de OpenRouter, precios de Workers AI, niveles de Mistral, límites de SambaNova, NVIDIA NIM, límites de Cohere, créditos de Hugging Face.

"Free of charge" en la tabla de precios de Gemini significa que no pagas por token, no que no haya tope. Google ya no publica en su documentación las cifras gratuitas de peticiones por minuto o por día de cada modelo: remite a AI Studio y advierte de que la capacidad real puede variar. Una cifra fija de RPM para Gemini que no salga de tu propio panel es, como mucho, una foto antigua. El detalle está en los límites de la cuota gratuita de Gemini y por qué más claves comparten un solo límite.

Lo que ya no es gratis o nunca lo fue

ProveedorSituación a 26 de septiembre de 2026
CerebrasSin capa gratuita permanente. La prueba da USD 5 en créditos solo después de añadir una tarjeta verificada, y caducan a los 30 días. Sin tarjeta, ni el Playground ni la API se activan (documentación de Cerebras).
GitHub ModelsCerrado por completo desde el 30 de julio de 2026: ni catálogo, ni playground, ni API de inferencia (aviso de GitHub).
DeepSeekSin capa gratuita pública. Es barato de pago: deepseek-flash cuesta USD 0,15 por millón de tokens de entrada y USD 0,60 de salida en horario valle (precios de DeepSeek).
Anthropic (Claude)Los usuarios nuevos reciben una pequeña cantidad de crédito para probar la API; no hay cuota que se renueve. Cómo seguir después lo explica cómo comprar acceso a Claude API.
OpenAINo hay crédito de registro universal. Las condiciones del nivel Free están en API de OpenAI gratis: nivel Free, tokens diarios y límites.

Cuál elegir según tu caso

La regla corta: elige primero por lo que vas a enviar y por quién usará el resultado, después por volumen, y solo al final por el modelo.

Tu situaciónEmpieza porPor quéCuándo deja de servir
Proyecto personal, aprendizaje o prototipo que solo usas túAPI de GeminiFlash, Flash-Lite y 2.5 Pro gratis, sin facturaciónCuando otras personas del EEE vayan a usar la app
Quieres saber de antemano cuántas peticiones tienesGroq1.000 peticiones al día con gpt-oss-120b, límites y cabeceras clarasCuando necesites un modelo que no está en el plan Free
Automatización con n8n o scripts de volumen bajo y constanteGroq o GeminiCupos diarios que se renuevan solosCuando un flujo en bucle agote el cupo diario a media jornada
Probar varios modelos abiertos con una sola clave, o conectar Cursor u otro agenteOpenRouter :freeUna clave compatible con la API de OpenAI y muchos modelos50 peticiones al día; un agente hace varias por cada tarea
Ya despliegas en CloudflareWorkers AILa IA vive junto a tu WorkerAlgunos modelos grandes exigen método de pago
Evaluar un modelo concreto antes de pagarlo (Claude, Cohere, Cerebras)Su crédito de pruebaEs la única forma de medir ese modeloCuando se gasta o caduca el crédito
Datos personales, de clientes o confidencialesEjecución local o una API de pagoNinguna capa gratuita está pensada para esoLocal: cuando tu equipo no mueve el modelo que necesitas

Un matiz sobre los agentes de código: Cursor, Cline y herramientas similares envían muchas peticiones seguidas en cada tarea, así que agotan antes los cupos diarios que una prueba manual. Si ese es tu uso, mira Claude Code con OpenRouter y DeepSeek para ver la configuración y los primeros errores habituales.

Para generar imágenes, la cuestión es distinta: los modelos de imagen de Gemini (Nano Banana) no entran en la cuota gratuita y cada proveedor tiene sus propias reglas. Lo cubre API gratis de IA para generar imágenes en 2026.

Gemini desde España: gratis para probar, de pago para publicar

España está en la lista de regiones donde se puede usar la API de Gemini (regiones disponibles). Lo que cambia respecto a un desarrollador de fuera de Europa son dos cláusulas de las condiciones adicionales de la API de Gemini:

  1. Tus datos. Fuera del EEE, Suiza y Reino Unido, lo que envías con la cuota gratuita (y lo que responde el modelo) se usa para mejorar productos de Google, y revisores humanos pueden leerlo. Por eso las propias condiciones piden no enviar información sensible, confidencial ni personal. Para usuarios que están en el EEE, Suiza o Reino Unido, en cambio, se aplican a AI Studio y a la cuota gratuita las condiciones de datos de los servicios de pago, aunque no pagues.
  2. Publicar una aplicación. Las mismas condiciones dicen que solo puedes usar los servicios de pago cuando pones un cliente de la API a disposición de usuarios del EEE, Suiza o Reino Unido. La API pasa a ser de pago cuando la llamas desde un proyecto de Cloud con una cuenta de facturación activa.

Leído de forma práctica (es una interpretación de esas cláusulas, no una aclaración de Google): desde España puedes aprender, prototipar y hacer pruebas internas con la cuota gratuita sin que tus peticiones se usen para entrenar. En cuanto tu aplicación la vayan a usar otras personas en Europa, aunque sea gratis para ellas, tiene que funcionar en un proyecto con facturación. Si tu caso está en la frontera (una herramienta interna de empresa, una demo pública), consulta las condiciones con quien lleve la parte legal antes de publicar.

Con facturación, cada token se cobra según la tabla de precios. Como referencia, gemini-3.8-flash cuesta USD 0,75 por millón de tokens de entrada y USD 3,75 de salida hasta el 31 de diciembre de 2026, y USD 1,50 y USD 7,50 a partir del 1 de enero de 2027 (precios de Gemini).

Con las demás capas gratuitas, la regla prudente es la misma que pide Google fuera de Europa: no envíes nada que no publicarías. En OpenRouter, además, cada modelo gratuito lo sirve un proveedor distinto con su propia política de datos, que conviene leer en la ficha del modelo antes de usarlo.

Primera petición y qué hacer ante un 429

Gemini, Groq y OpenRouter aceptan el SDK de OpenAI cambiando solo la base URL, la clave y el nombre del modelo. Eso permite escribir un cliente que pase al siguiente proveedor cuando uno responde con un 429 (demasiadas peticiones).

Guarda las claves en variables de entorno, nunca en el código:

bash
pip install openai
export GEMINI_API_KEY="pega-aquí-tu-clave-de-ai-studio"
export GROQ_API_KEY="pega-aquí-tu-clave-de-groq"
export OPENROUTER_API_KEY="pega-aquí-tu-clave-de-openrouter"
python
import os
from openai import OpenAI, RateLimitError

# (nombre, base URL, variable de entorno, modelo)
PROVEEDORES = [
    ("gemini", "https://generativelanguage.googleapis.com/v1beta/openai/",
     "GEMINI_API_KEY", "gemini-3.8-flash"),
    ("groq", "https://api.groq.com/openai/v1",
     "GROQ_API_KEY", "openai/gpt-oss-120b"),
    ("openrouter", "https://openrouter.ai/api/v1",
     "OPENROUTER_API_KEY", "openai/gpt-oss-120b:free"),
]


def preguntar(mensaje: str) -> str:
    for nombre, base_url, variable, modelo in PROVEEDORES:
        clave = os.environ.get(variable)
        if not clave:
            continue  # sin clave para este proveedor, pasa al siguiente
        # max_retries=0: el SDK no reintenta solo y el 429 llega aquí al momento
        cliente = OpenAI(base_url=base_url, api_key=clave, max_retries=0)
        try:
            respuesta = cliente.chat.completions.create(
                model=modelo,
                messages=[{"role": "user", "content": mensaje}],
            )
            return f"({nombre}) {respuesta.choices[0].message.content}"
        except RateLimitError as error:
            espera = error.response.headers.get("retry-after")
            print(f"{nombre}: 429, retry-after={espera}. Pruebo el siguiente.")
    raise RuntimeError("Todas las cuotas gratuitas están agotadas por ahora.")


print(preguntar("Explica en una frase qué es un error 429."))

Los modelos de Gemini y Groq son los que figuran en su documentación a 26 de septiembre de 2026. openai/gpt-oss-120b:free es una variante gratuita de OpenRouter, y esas variantes entran y salen con frecuencia: si recibes un error de modelo no encontrado, busca una vigente en su catálogo filtrando por modelos gratuitos. Y recuerda la sección anterior: este patrón vale para un prototipo tuyo; si la app va a tener usuarios en Europa, el proyecto de Gemini debe tener facturación.

Un 429 no siempre significa lo mismo, así que conviene saber dónde mirar en cada caso:

  • Gemini. Los límites activos de tu proyecto están en Google AI Studio. Se aplican por proyecto: crear más claves en el mismo proyecto no te da más cupo. El contador diario se reinicia a medianoche del Pacífico, que en la España peninsular suele caer a las 9:00 (a las 8:00 en Canarias), salvo en las semanas en que el cambio de hora de EE. UU. y el europeo no coinciden.
  • Groq. Cada respuesta trae las cabeceras x-ratelimit-remaining-requests (peticiones que te quedan hoy) y x-ratelimit-remaining-tokens (tokens por minuto). Cuando te pasas, el 429 incluye retry-after con los segundos que debes esperar. Los tokens que salen de caché no cuentan para los límites.
  • OpenRouter. Consulta cuánto te queda con tu clave:
bash
curl https://openrouter.ai/api/v1/key \
  -H "Authorization: Bearer $OPENROUTER_API_KEY"

El campo free_model_daily_requests indica used, limit y remaining, contados por día UTC. Ahí no aparece el límite por minuto. Ten en cuenta que un 429 puede venir de OpenRouter o del proveedor que sirve el modelo, y que con saldo negativo en la cuenta pueden fallar incluso los modelos gratuitos.

Si el 429 aparece a los pocos segundos, has chocado con el límite por minuto: espera lo que diga retry-after o espacia las peticiones. Si aparece todos los días a la misma hora, se te acaba el cupo diario y lo que necesitas es otro proveedor o empezar a pagar.

Cadena de respaldo ante un error 429 de Gemini a Groq y OpenRouter, con dónde ver el límite en cada proveedor y cómo distinguir el límite por minuto del cupo diario

Cuándo dejar lo gratuito

Lo gratuito deja de compensar antes de lo que parece. Estas señales indican que toca pasar al pago:

  • Otras personas van a usar lo que has construido. Con usuarios del EEE, en Gemini es obligatorio; en los demás proveedores, un cupo diario compartido convierte cualquier pico de uso en errores para tus usuarios.
  • Diseñas la aplicación alrededor del límite. Colas artificiales, cambiar de proveedor a mitad de conversación o recortar respuestas para no gastar tokens son síntomas de que el prototipo ya no se parece al producto.
  • Necesitas un modelo que no está en ninguna capa gratuita, como Gemini 3.1 Pro Preview o los modelos grandes de Workers AI.
  • Tus datos no deberían salir de un contrato de pago o de tu propia máquina.
  • Pierdes más tiempo gestionando cuotas que programando.

El siguiente paso depende de qué te falte:

  1. Seguir con el mismo modelo. Si Gemini te sirve, vincula una cuenta de facturación al proyecto: pasas al nivel de pago (Tier 1), con límites más altos y sin cambiar de código. En Groq, el Developer Plan tiene sus propios límites, más altos.
  2. Pagar lo mínimo. DeepSeek, por ejemplo, cobra una fracción de dólar por millón de tokens en deepseek-flash. La comparación de precio, calidad y latencia está en proveedor API LLM más barato.
  3. Varios proveedores con una sola clave y un solo saldo. Una pasarela de pago compatible con la API de OpenAI, como laozhang.ai, cobra por uso desde un saldo prepagado. Es un servicio de pago y no incluye las cuotas gratuitas de los proveedores originales; tiene sentido cuando ya pagas a varios y quieres centralizar facturación y claves.
  4. Privacidad total o cero coste por token. Ejecutar un modelo abierto en local elimina las cuotas y el envío de datos a terceros, a cambio de depender de tu hardware.

Preguntas frecuentes

¿La API de Gemini es gratis?

Sí para la familia Flash y Flash-Lite, Gemini 2.5 Pro, Gemma 4 y Gemini Embedding 2, con límites que ves en Google AI Studio. No lo es para Gemini 3.1 Pro Preview, los modelos de imagen, Veo ni el modo Batch. Desde España, la cuota gratuita sirve para probar, pero una aplicación para usuarios del EEE debe funcionar con facturación.

¿Necesito tarjeta para usar una API de IA gratis?

No en Gemini (basta un proyecto sin facturación), ni en los modelos :free de OpenRouter, ni en el nivel Free de SambaNova, que se aplica precisamente cuando no hay método de pago. Sí en Cerebras: sus créditos de prueba solo se activan tras añadir una tarjeta verificada.

¿Hay alguna API de IA gratis sin límites?

No. Todas las capas gratuitas tienen límites por minuto, por día o por mes, y responden con un error 429 al superarlos. Lo único sin cuota es ejecutar un modelo abierto en tu propio equipo, donde el límite lo pone el hardware.

¿Usan mis datos para entrenar si uso la API gratis?

Depende del proveedor y de dónde estés. En la cuota gratuita de Gemini, fuera del EEE, Suiza y Reino Unido, Google usa lo que envías para mejorar sus productos y puede revisarlo gente; dentro de esas zonas se aplican las condiciones de datos de pago. En los demás proveedores, lee su política antes de enviar nada sensible.

¿Cerebras sigue siendo gratis?

No. Cerebras no tiene capa gratuita permanente: ofrece USD 5 de prueba que exigen tarjeta verificada y caducan a los 30 días.

¿DeepSeek tiene API gratis?

No tiene capa gratuita pública, pero es de las API de pago más baratas: deepseek-flash cuesta USD 0,15 por millón de tokens de entrada y USD 0,60 de salida en horario valle.