# 免费 AI API 推荐：国内外平台怎么选，额度用完会怎样

> 截至 2026 年 9 月 26 日，人在国内先用智谱 GLM-4.7-Flash 和百炼新人额度，在 Gemini 可用地区先用其免费额度；百炼实名后超额会自动扣费。

- URL: https://blog.laozhang.ai/zh/posts/free-ai-api-tiers-compared
- Published: 2026-07-02
- Updated: 2026-09-26
- Author: LaoZhang AI Team (https://blog.laozhang.ai/zh/about)
- Category: API 指南
- Tags: 免费 AI API, 免费大模型 API, 智谱 GLM, 阿里云百炼, Gemini API, OpenRouter, Groq

---
截至 2026 年 9 月 26 日，没有哪一家免费 AI API 适合所有人，先看你人在哪里、数据敏不敏感、每天要调用多少次。

- **人在中国大陆**：先注册智谱开放平台，用 GLM-4.7-Flash。它按模型长期免费，不是限时的新人福利。需要对比千问系列时，再开通阿里云百炼领新人额度（仅北京地域，每个模型通常 100 万 Token，90 天有效）；开通后第一件事是打开“免费额度用完即停”。
- **人在 Gemini API 可用地区**：Google AI Studio 里的 Gemini API 免费额度，是目前不花钱能调用到的较强模型档，Flash 系列和 Gemini 2.5 Pro 都在免费范围内。代价是免费额度下提交的内容会被 Google 用于改进产品，敏感数据不要放进去。
- **需要固定、公开的限额**：Groq 免费计划把每个模型的 RPM、每日请求数都写在文档里；想用一个 key 试多家模型，用 OpenRouter 以 `:free` 结尾的模型。

DeepSeek 没有公开的免费档，只是付费价格很低；GitHub Models 已经下线；Cerebras 也不再有永久免费档。下面按“免费”的类型、国内和海外两条线、额度用完后的后果依次说明，最后给一段能在几家之间切换的代码。

## “免费”有四种，先分清再比较

平台都说自己免费，但免费的方式不同，决定了它适合拿来做什么。

| 免费类型 | 典型例子 | 对你意味着什么 |
|---|---|---|
| 指定模型长期免费 | 智谱 GLM-4.7-Flash、硅基流动的小模型、OpenRouter 的 `:free` 模型 | 只要平台不调整政策就一直免费，但通常不是该平台最强的模型 |
| 持续的免费额度，按时间重置 | Gemini API、Groq、Cloudflare Workers AI | 每分钟、每天有上限，额度会重置，适合长期开发和个人项目 |
| 新人一次性额度 | 阿里云百炼、Anthropic 新用户的少量赠金 | 有有效期，用完或过期就没了；要特别留意用完后是停用还是开始扣费 |
| 很便宜的付费 | DeepSeek | 不免费，但在免费额度不够时是成本最低的补充之一 |

只想跑通一个 Demo，新人额度就够了；要长期挂在 Cline、Cherry Studio、n8n 这类工具后面，应该选前两类；用户多起来以后，四类都撑不住，需要转付费。

![四类免费 AI API 对比：指定模型长期免费、按时间重置的持续额度、新人一次性额度和很便宜的付费，各自的例子与适合场景](https://blog.laozhang.ai/posts/zh/free-ai-api-tiers-compared/img/free-api-four-types.webp)

## 截至 2026 年 9 月 26 日的免费情况

下表只写官方页面公开的信息。额度常常调整，以控制台当日显示为准。

| 平台 | 免费形式 | 官方公开的额度 | 门槛与限制 | 适合 |
|---|---|---|---|---|
| 智谱开放平台 | GLM-4.7-Flash（200K 上下文）、视觉模型 GLM-4.6V-Flash 输入输出免费 | 并发和速率上限未在价格页公布 | 国内平台；GLM-5.3-Flash 是付费模型 | 国内开发者的日常主力 |
| 阿里云百炼 | 新人免费额度 | 每个模型通常 100 万 Token，输入输出共用，90 天 | 仅华北 2（北京）地域；实名后超额自动转按量付费 | 对比千问等多个模型 |
| 硅基流动 | 部分模型免费 | 免费的是 Qwen3-8B、GLM-4-9B 等小模型和 bge 向量模型 | 旗舰模型收费；免费模型的限速未公布 | 翻译、分类、向量检索 |
| Gemini API | 免费额度 | 逐模型限额只在 AI Studio 显示，不在文档公开 | 可用地区不含中国大陆和香港；免费额度的内容用于改进 Google 产品 | 海外个人项目、原型 |
| Groq | 免费计划 | `openai/gpt-oss-120b` 等：30 RPM、每天 1,000 次请求、每天 20 万 Token | 按组织计算；模型选择少 | 需要速度和固定限额的原型 |
| OpenRouter | `:free` 模型 | 每天 50 次；累计购买满 10 credits 后每天 1,000 次，均为 20 RPM | 哪些模型带 `:free` 经常变 | 一个 key 试多家模型 |
| Cloudflare Workers AI | 每日免费分配 | 每天 10,000 Neurons | Neurons 不等于 Token；部分强模型要求付费 | 已经在用 Workers 的项目 |
| Mistral | Free mode | 每月包含用量，具体数字在账户的 Limits 页 | 数字不公开 | 试 Mistral 模型 |
| Cohere | 试用 key | 每月 1,000 次调用，Chat 每模型每分钟 20 次 | 仅用于评估 | 试 Command 系列和 Rerank |
| SambaNova Cloud | 未绑定支付方式时的免费档 | 每模型每天 20 次请求 | 只够测试 | 试 DeepSeek-V3.1、Llama 3.3 70B |
| Hugging Face | 每月推理赠金 | 免费用户每月 $0.10 | 只能走 HF 代为路由的调用 | 试接口，不够跑任务 |
| NVIDIA build.nvidia.com | 开发者计划成员免费调用 NIM 接口 | 未公布具体限额 | 条款写明用于原型开发 | 试 NVIDIA 托管的模型 |

图片生成接口的免费情况差别很大，单独整理在[2026 免费 AI 生图 API：现在哪里还算真正免费？](https://blog.laozhang.ai/zh/posts/free-ai-image-generation-api)里，这里只讲文本大模型。

还有几家常被写进“免费清单”，但现在的情况是：

- **GitHub Models**：2026 年 7 月 30 日全面下线，playground、模型目录、推理 API 和自带 key 功能都不再对任何用户开放。
- **Cerebras**：官方明确“没有永久免费档”。试用需要先绑定已验证的支付方式，拿到 $5 额度，30 天后过期。
- **DeepSeek**：价格页只有付费价格，没有公开的免费额度。
- **Claude API**：新用户会拿到少量测试赠金，金额没有公布，没有按月重置的免费档；服务地区不含中国大陆和香港。充值和买 key 的细节见[Claude API Key 怎么购买：官方充值、国内可用路线与共享密钥避坑](https://blog.laozhang.ai/zh/posts/claude-api-key-free-tier)。
- **OpenAI API**：没有面向所有人的注册赠金，只有符合条件、愿意与 OpenAI 共享流量数据的组织每天能拿到一些免费 token，前提是账户有正余额；服务地区同样不含中国大陆和香港。详见[OpenAI API 免费额度还有吗？赠金、数据共享与每月上限](https://blog.laozhang.ai/zh/posts/openai-api-free-tier)。

## 人在国内：智谱打底，百炼对比，硅基流动补小模型

Gemini、OpenAI、Claude 三家的服务地区名单都不包括中国大陆和香港，条款要求只能在可用地区使用。在国内做项目，先把国内平台用好，比折腾海外账号更省事。

### 智谱 GLM-4.7-Flash：长期免费，注意名字

智谱开放平台 BigModel 的价格页写得很直接：文本模型 GLM-4.7-Flash（200K 上下文）和视觉模型 GLM-4.6V-Flash，输入、输出、缓存都免费。它不是新人额度，没有 90 天之类的期限，适合长期挂在编程插件、自动化流程或个人项目后面。

名字有个坑：**GLM-5.3-Flash 是付费模型**，每百万 Token 输入 0.8 元、输出 2.8 元。名字里带 Flash 不代表免费，配置时模型 ID 要写 `glm-4.7-flash`。价格页没有公布免费模型的并发和速率上限，高频调用时要做好限流后重试。

### 阿里云百炼：90 天新人额度，先关掉自动扣费

想免费调用千问，路径是百炼的新人免费额度。按官方文档：

- 首次开通百炼时自动发放，免费额度只发给**华北 2**（北京）地域的模型，其他地域没有。
- 每个模型单独计额，通常 100 万 Token，输入和输出共用；带日期后缀的快照版本（如 `qwen-max-2026-05-17`）和不带日期的版本算两个模型，各有一份额度。
- 有效期 90 天，从开通、模型发布或申请通过之日起算（取较晚者），不能延期，同一实名主体只能领一次。
- 只抵扣实时调用，Batch、模型调优、模型部署都不能用免费额度。
- 主账号和 RAM 子账号共用同一份额度。

最需要注意的是用完之后：**未实名的账号用完即停**，已实名的账号**默认自动转按量付费**，费用从阿里云账户扣除，可能导致欠费；账户一旦欠费，其他模型即使还有免费额度也调不通。只想免费试用的话，在控制台“免费额度”页给模型打开“免费额度用完即停”，额度耗尽后接口返回 HTTP 403，错误码 `AllocationQuota.FreeTierOnly`，不会继续扣费。这个开关需要一点时间生效，刚切换时不要马上大批量调用。

文档还专门提醒：用 Cline、CodeBuddy 这类 IDE 插件调用时，插件会带上完整代码上下文和对话历史，一次对话可能消耗几千 Token，100 万 Token 的额度会比预想中用得快。

剩余额度可以在控制台的“免费额度”页看到，页面列出每个模型的剩余量和到期时间；余量降到 20% 和完全用完时，会通过短信、站内信、邮件提醒。

### 硅基流动：免费的是小模型

硅基流动 SiliconFlow 价格页标“免费”的对话模型，是 Qwen3-8B、Qwen3.5-4B、Qwen2.5-7B-Instruct、GLM-4-9B-0414、GLM-Z1-9B-0414、DeepSeek-R1-0528-Qwen3-8B（蒸馏版）、Hunyuan-MT-7B 等，另有 Xing4.0-29B；向量模型 bge-m3、重排模型 bge-reranker-v2-m3 也免费。DeepSeek、千问大参数版本、GLM-5.x 这些旗舰模型都要付费。

这些小模型做翻译、分类、摘要、做知识库的向量化足够，写复杂代码或长推理会明显吃力。价格页没有公布免费模型的限速。

腾讯混元、百度千帆、火山方舟也有各自的新人额度，额度大小和有效期以各自控制台当日显示为准。

## 人在海外可用地区：Gemini 打底，Groq 和 OpenRouter 补位

### Gemini API：模型强，但数据会被使用

Gemini API 的免费额度覆盖 Gemini 3.8 Flash、3.7 Flash、3.5 Flash、3.5 Flash-Lite、3.1 Flash-Lite、2.5 Pro、2.5 Flash 等模型，Gemma 4 和 Gemini Embedding 2 也免费。Gemini 3.1 Pro 预览版、所有 Nano Banana 图片模型、Veo 视频模型不在免费范围，Batch 和 Flex 也从不免费。

限额有三点要知道：

- 每个模型的免费 RPM、每日请求数，官方文档已不再列出，只能在 Google AI Studio 里查看，官方也说明这些限额不保证。
- 限额按项目计算，不按 API key 计算，同一个项目里多建几个 key 不会多出额度。
- 每日请求数在太平洋时间午夜重置，对应北京时间下午 3 点或 4 点，随夏令时变化。

数据条款是选 Gemini 前必须考虑的一条。Gemini API 的附加条款写明：使用免费额度时，Google 会用你提交的内容和生成结果来改进产品，可能有人工审阅，并要求不要提交敏感、机密或个人信息。只有项目绑定了有效的结算账号，才算付费服务，适用付费服务的数据条款。

可用地区名单包括美国、日本、韩国、新加坡、台湾等，不包括中国大陆、香港、澳门。在 Colab 里调用时，看的是 Colab 实例所在的位置。更细的限额和多 key 问题见[Gemini API 免费层速率限制 2026：哪些还免费、去哪看实时限额、为什么多个 Key 共享同一额度](https://blog.laozhang.ai/zh/posts/gemini-api-free-tier)。

### Groq：限额写得最清楚

Groq 免费计划的限额直接写在文档里。`openai/gpt-oss-120b`、`openai/gpt-oss-20b`、`qwen/qwen3.8-27b` 都是每分钟 30 次请求、每天 1,000 次请求、每分钟 8,000 Token、每天 20 万 Token，按组织计算；命中缓存的 Token 不计入限额。超限返回 429，并带 `retry-after` 头告诉你等几秒。

它的短板是模型少，免费表里目前只有这几款对话模型。每天 20 万 Token 对个人脚本够用；编程插件每次都会带上大段上下文，消耗会快得多。

### OpenRouter：一个 key 试多家模型

OpenRouter 上 ID 以 `:free` 结尾的模型不收费，但次数有限：

- 累计购买不到 10 credits：每分钟 20 次，每天 50 次。
- 累计购买满 10 credits：每分钟 20 次，每天 1,000 次。

也就是说，要把每天 50 次提到 1,000 次，需要实际花一笔钱充值。多注册账号或多建 key 不会提高上限，账户余额为负时，免费模型也可能报错。调用 `GET https://openrouter.ai/api/v1/key`，返回里的 `free_model_daily_requests` 会显示当天已用、上限和剩余次数，按 UTC 日期计，北京时间早上 8 点重置。

哪些模型带 `:free` 会经常变化，每个免费模型背后的上游服务商数据政策也不同，用之前在模型页确认。拿它接 Claude Code 之类编程工具的配置方法，见[Claude Code 连接 OpenRouter 和 DeepSeek：路线选择、配置与首错排查](https://blog.laozhang.ai/zh/posts/claude-code-openrouter-deepseek)。

### 其他几家：适合试一下，不适合长期依赖

Cloudflare Workers AI 每天免费 10,000 Neurons，UTC 零点重置。Neurons 是 Cloudflare 自己的计量单位，不同模型每次调用消耗的 Neurons 不同，不能直接换算成 Token；Kimi K2.6、GLM-5.3、DeepSeek V4 等较强的模型要求付费账户才能调用。

Mistral 的 Free mode 可以建 API key，每月包含一定用量，具体数字在账户的 Limits 页，公开文档没有写。Cohere 试用 key 每月 1,000 次调用，SambaNova 免费档每模型每天 20 次，Hugging Face 免费用户每月 $0.10 推理赠金，这几家都只够验证接口能不能跑通。NVIDIA 开发者计划成员可以免费调用 build.nvidia.com 上的 NIM 接口，用途写明是原型开发，正式上线需要企业许可。

## 额度用完会发生什么

免费额度出问题，往往不是模型不好用，而是额度悄悄用完后开始扣费，或者接口突然全部报错。

![阿里云百炼免费额度用完后的三种结果：开了用完即停返回 403，未实名用完即停，已实名自动转按量付费；对照 Gemini API、Groq、OpenRouter 免费档只会被限流](https://blog.laozhang.ai/posts/zh/free-ai-api-tiers-compared/img/quota-exhausted-outcomes.webp)

| 平台 | 触顶或过期后的表现 | 扣费风险 |
|---|---|---|
| 阿里云百炼 | 未实名：直接停用；已实名：自动转按量付费；开了“用完即停”则返回 403 `AllocationQuota.FreeTierOnly` | 已实名且没开开关时会扣费，还可能欠费 |
| 智谱 | GLM-4.7-Flash 本身免费 | 模型 ID 写成付费模型（如 GLM-5.3-Flash）就按价格扣余额 |
| 硅基流动 | 免费模型不计费 | 切到旗舰模型就开始计费 |
| Gemini API | 超出任一项限额即报限流错误 | 项目没绑结算账号时只会被限流；绑定后整个项目按付费服务计费 |
| Groq | 返回 429 和 `retry-after` | 免费计划下表现为限流 |
| OpenRouter `:free` | 当天次数用完后被限流；余额为负时也可能报错 | 调用非 `:free` 模型会从余额扣费 |
| Cloudflare Workers AI | Workers Free 超过每天 10,000 Neurons 后请求报错 | 升级 Workers Paid 后，超出部分按每 1,000 Neurons $0.011 计费 |

两个习惯能省掉大部分麻烦：一是只在确实需要付费时才绑卡或完成付费设置，免费试用阶段保持“用完即停”；二是把模型 ID 写在配置里而不是散落在代码中，避免误切到同名的付费版本。

## 一段代码在几家免费接口之间切换

智谱、百炼、Gemini、Groq、OpenRouter 都提供 OpenAI 兼容接口，用官方 `openai` Python 包改 `base_url` 就能切换。下面的脚本按顺序尝试，前一家限流或额度用尽就换下一家。key 全部从环境变量读取，不要写进代码。

```python
import os
from openai import OpenAI, APIStatusError

PROVIDERS = {
    "zhipu": {
        "base_url": "https://open.bigmodel.cn/api/paas/v4",
        "key_env": "ZHIPU_API_KEY",
        "model": "glm-4.7-flash",
    },
    "bailian": {
        # 北京地域专属域名，格式为
        # https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
        # WorkspaceId 在百炼控制台“业务空间详情”页查看；key 必须是北京地域创建的
        "base_url": os.environ.get("BAILIAN_BASE_URL"),
        "key_env": "DASHSCOPE_API_KEY",
        "model": "qwen3.8-max",  # 先在模型广场确认该模型显示免费额度
    },
    "gemini": {
        "base_url": "https://generativelanguage.googleapis.com/v1beta/openai/",
        "key_env": "GEMINI_API_KEY",
        "model": "gemini-3.8-flash",
    },
    "groq": {
        "base_url": "https://api.groq.com/openai/v1",
        "key_env": "GROQ_API_KEY",
        "model": "openai/gpt-oss-20b",
    },
    "openrouter": {
        "base_url": "https://openrouter.ai/api/v1",
        "key_env": "OPENROUTER_API_KEY",
        # 在 OpenRouter 模型页挑一个 ID 以 :free 结尾的模型
        "model": os.environ.get("OPENROUTER_FREE_MODEL"),
    },
}

# 国内可以设为 zhipu,bailian；海外可用地区可以设为 gemini,groq,openrouter
ORDER = os.environ.get("PROVIDER_ORDER", "zhipu,bailian").split(",")


def ask(prompt: str) -> str:
    last_error = None
    for name in ORDER:
        cfg = PROVIDERS[name.strip()]
        api_key = os.environ.get(cfg["key_env"])
        if not api_key or not cfg["base_url"] or not cfg["model"]:
            continue  # 这家没配置，跳过
        client = OpenAI(api_key=api_key, base_url=cfg["base_url"])
        try:
            resp = client.chat.completions.create(
                model=cfg["model"],
                messages=[{"role": "user", "content": prompt}],
            )
            return f"[{name}] {resp.choices[0].message.content}"
        except APIStatusError as e:
            # 429：限流或当天次数用完；403：百炼“用完即停”触发
            if e.status_code in (429, 403):
                last_error = e
                continue
            raise
    raise RuntimeError(f"所有免费接口都不可用：{last_error}")


if __name__ == "__main__":
    print(ask("用一句话解释什么是向量数据库。"))
```

运行前把各平台控制台生成的 key 设成环境变量（如 `ZHIPU_API_KEY`、`GEMINI_API_KEY`），用百炼时另设 `BAILIAN_BASE_URL`，保存为 `ask.py` 后执行 `python ask.py`。几点说明：

- 百炼返回 401 且错误码是 `invalid_api_key`，通常是 key 和 `base_url` 不在同一个地域，而不是 key 失效。
- 百炼旧域名 `dashscope.aliyuncs.com` 目前仍能用，官方建议迁移到带 WorkspaceId 的专属域名。
- 硅基流动、Mistral 等平台的兼容地址以各自文档为准，确认后按同样格式加进 `PROVIDERS` 即可。

## 免费额度不够用时怎么办

出现下面任一情况，就该认真考虑付费了：限流已经影响到用户体验；数据不能交给免费档的条款；百炼 90 天到期；免费模型的能力撑不起任务，需要旗舰模型。

下一步通常有三种选择：

- **换成便宜的付费模型**。DeepSeek 的 `deepseek-flash` 在非高峰时段每百万 Token 输入 $0.15（未命中缓存）、输出 $0.6，高峰时段翻倍为 $0.3 和 $1.2；高峰是 UTC 周一到周五 01:00–04:00 和 06:00–10:00，即北京时间 9 点到 12 点、14 点到 18 点，中国节假日除外。Gemini 3.8 Flash 付费价格在 2026 年 12 月 31 日前为每百万 Token 输入 $0.75、输出 $3.75，之后调整为 $1.50 和 $7.50。各家价格和质量的横向比较见[最便宜的 LLM API Provider：按价格、质量、延迟和网关风险比较](https://blog.laozhang.ai/zh/posts/cheapest-llm-api-provider)。
- **给官方平台充值**。已经在用的平台直接转按量付费，改动最小；Gemini 项目绑定结算后，数据也不再用于改进产品。
- **用 OpenAI 兼容的 API 网关**。如果你需要的官方 API 在所在地区不提供服务，或者想用一个 key 接多家模型，可以考虑付费网关，例如 [laozhang.ai](https://laozhang.ai/)（`base_url` 为 `https://api.laozhang.ai/v1`，预付费按量计费）。它是付费服务，不继承各家官方的免费额度，接入前先看清计费和数据处理说明。

如果需求是“完全不限量”，唯一的办法是用 Ollama 之类的工具在自己的电脑或服务器上跑开源模型：不按调用计费，但要承担显卡和电费，能跑多大的模型取决于你的硬件。

## 常见问题

### 有没有真正不限量的免费大模型 API？

没有。智谱 GLM-4.7-Flash 这类长期免费的模型，平台没有公布并发和速率上限，不等于不限量；Gemini、Groq、OpenRouter 都有每分钟和每天的上限。“每月免费上亿 Token”的做法，通常是把多家免费接口聚合起来轮流用，任何一家调整政策都会受影响。真正不按调用计量的，只有本地部署开源模型。

### 千问有免费 API 吗？

有，通过阿里云百炼的新人免费额度：在华北 2（北京）地域开通后，每个千问模型通常有 100 万 Token，90 天有效，不是永久。已实名的账号用完后会自动转为按量付费，只想免费试用就先打开“免费额度用完即停”。

### DeepSeek 有免费 API 吗？

官方价格页没有公开的免费额度，账户里有“赠送余额”字段，但没有公布发放规则。DeepSeek 的优势是付费价格低，非高峰时段 `deepseek-flash` 每百万 Token 输入 $0.15、输出 $0.6。硅基流动免费提供的 DeepSeek-R1-0528-Qwen3-8B 是基于 Qwen3-8B 的蒸馏小模型，不是 DeepSeek 满血版。

### 多注册几个账号、多建几个 key，能拿到更多免费额度吗？

基本不行。Gemini 的限额按项目计算，同项目多个 key 共享额度；OpenRouter 明确说多账号、多 key 不影响上限；百炼的新人额度同一实名主体只能领一次。与其堆账号，不如按上面的代码把两三家平台串起来，或者直接付费。

### 免费 API 能用在正式上线的产品里吗？

小流量的个人项目可以，但要做好限流后重试和备用接口。面向用户的产品不建议依赖免费档：限额随时可能调整，Gemini 免费额度的内容会被用于改进产品，NVIDIA 的免费接口明确只用于原型开发，Cohere 的试用 key 只用于评估。上线前换到付费档，才有稳定的限额和更合适的数据条款。
