免费 AI API 推荐:国内外平台怎么选,额度用完会怎样
截至 2026 年 9 月 26 日,人在国内先用智谱 GLM-4.7-Flash 和百炼新人额度,在 Gemini 可用地区先用其免费额度;百炼实名后超额会自动扣费。
文章目录

截至 2026 年 9 月 26 日,没有哪一家免费 AI API 适合所有人,先看你人在哪里、数据敏不敏感、每天要调用多少次。
- 人在中国大陆:先注册智谱开放平台,用 GLM-4.7-Flash。它按模型长期免费,不是限时的新人福利。需要对比千问系列时,再开通阿里云百炼领新人额度(仅北京地域,每个模型通常 100 万 Token,90 天有效);开通后第一件事是打开“免费额度用完即停”。
- 人在 Gemini API 可用地区:Google AI Studio 里的 Gemini API 免费额度,是目前不花钱能调用到的较强模型档,Flash 系列和 Gemini 2.5 Pro 都在免费范围内。代价是免费额度下提交的内容会被 Google 用于改进产品,敏感数据不要放进去。
- 需要固定、公开的限额:Groq 免费计划把每个模型的 RPM、每日请求数都写在文档里;想用一个 key 试多家模型,用 OpenRouter 以
:free结尾的模型。
DeepSeek 没有公开的免费档,只是付费价格很低;GitHub Models 已经下线;Cerebras 也不再有永久免费档。下面按“免费”的类型、国内和海外两条线、额度用完后的后果依次说明,最后给一段能在几家之间切换的代码。
“免费”有四种,先分清再比较
平台都说自己免费,但免费的方式不同,决定了它适合拿来做什么。
| 免费类型 | 典型例子 | 对你意味着什么 |
|---|---|---|
| 指定模型长期免费 | 智谱 GLM-4.7-Flash、硅基流动的小模型、OpenRouter 的 :free 模型 | 只要平台不调整政策就一直免费,但通常不是该平台最强的模型 |
| 持续的免费额度,按时间重置 | Gemini API、Groq、Cloudflare Workers AI | 每分钟、每天有上限,额度会重置,适合长期开发和个人项目 |
| 新人一次性额度 | 阿里云百炼、Anthropic 新用户的少量赠金 | 有有效期,用完或过期就没了;要特别留意用完后是停用还是开始扣费 |
| 很便宜的付费 | DeepSeek | 不免费,但在免费额度不够时是成本最低的补充之一 |
只想跑通一个 Demo,新人额度就够了;要长期挂在 Cline、Cherry Studio、n8n 这类工具后面,应该选前两类;用户多起来以后,四类都撑不住,需要转付费。

截至 2026 年 9 月 26 日的免费情况
下表只写官方页面公开的信息。额度常常调整,以控制台当日显示为准。
| 平台 | 免费形式 | 官方公开的额度 | 门槛与限制 | 适合 |
|---|---|---|---|---|
| 智谱开放平台 | GLM-4.7-Flash(200K 上下文)、视觉模型 GLM-4.6V-Flash 输入输出免费 | 并发和速率上限未在价格页公布 | 国内平台;GLM-5.3-Flash 是付费模型 | 国内开发者的日常主力 |
| 阿里云百炼 | 新人免费额度 | 每个模型通常 100 万 Token,输入输出共用,90 天 | 仅华北 2(北京)地域;实名后超额自动转按量付费 | 对比千问等多个模型 |
| 硅基流动 | 部分模型免费 | 免费的是 Qwen3-8B、GLM-4-9B 等小模型和 bge 向量模型 | 旗舰模型收费;免费模型的限速未公布 | 翻译、分类、向量检索 |
| Gemini API | 免费额度 | 逐模型限额只在 AI Studio 显示,不在文档公开 | 可用地区不含中国大陆和香港;免费额度的内容用于改进 Google 产品 | 海外个人项目、原型 |
| Groq | 免费计划 | openai/gpt-oss-120b 等:30 RPM、每天 1,000 次请求、每天 20 万 Token | 按组织计算;模型选择少 | 需要速度和固定限额的原型 |
| OpenRouter | :free 模型 | 每天 50 次;累计购买满 10 credits 后每天 1,000 次,均为 20 RPM | 哪些模型带 :free 经常变 | 一个 key 试多家模型 |
| Cloudflare Workers AI | 每日免费分配 | 每天 10,000 Neurons | Neurons 不等于 Token;部分强模型要求付费 | 已经在用 Workers 的项目 |
| Mistral | Free mode | 每月包含用量,具体数字在账户的 Limits 页 | 数字不公开 | 试 Mistral 模型 |
| Cohere | 试用 key | 每月 1,000 次调用,Chat 每模型每分钟 20 次 | 仅用于评估 | 试 Command 系列和 Rerank |
| SambaNova Cloud | 未绑定支付方式时的免费档 | 每模型每天 20 次请求 | 只够测试 | 试 DeepSeek-V3.1、Llama 3.3 70B |
| Hugging Face | 每月推理赠金 | 免费用户每月 $0.10 | 只能走 HF 代为路由的调用 | 试接口,不够跑任务 |
| NVIDIA build.nvidia.com | 开发者计划成员免费调用 NIM 接口 | 未公布具体限额 | 条款写明用于原型开发 | 试 NVIDIA 托管的模型 |
图片生成接口的免费情况差别很大,单独整理在2026 免费 AI 生图 API:现在哪里还算真正免费?里,这里只讲文本大模型。
还有几家常被写进“免费清单”,但现在的情况是:
- GitHub Models:2026 年 7 月 30 日全面下线,playground、模型目录、推理 API 和自带 key 功能都不再对任何用户开放。
- Cerebras:官方明确“没有永久免费档”。试用需要先绑定已验证的支付方式,拿到 $5 额度,30 天后过期。
- DeepSeek:价格页只有付费价格,没有公开的免费额度。
- Claude API:新用户会拿到少量测试赠金,金额没有公布,没有按月重置的免费档;服务地区不含中国大陆和香港。充值和买 key 的细节见Claude API Key 怎么购买:官方充值、国内可用路线与共享密钥避坑。
- OpenAI API:没有面向所有人的注册赠金,只有符合条件、愿意与 OpenAI 共享流量数据的组织每天能拿到一些免费 token,前提是账户有正余额;服务地区同样不含中国大陆和香港。详见OpenAI API 免费额度还有吗?赠金、数据共享与每月上限。
人在国内:智谱打底,百炼对比,硅基流动补小模型
Gemini、OpenAI、Claude 三家的服务地区名单都不包括中国大陆和香港,条款要求只能在可用地区使用。在国内做项目,先把国内平台用好,比折腾海外账号更省事。
智谱 GLM-4.7-Flash:长期免费,注意名字
智谱开放平台 BigModel 的价格页写得很直接:文本模型 GLM-4.7-Flash(200K 上下文)和视觉模型 GLM-4.6V-Flash,输入、输出、缓存都免费。它不是新人额度,没有 90 天之类的期限,适合长期挂在编程插件、自动化流程或个人项目后面。
名字有个坑:GLM-5.3-Flash 是付费模型,每百万 Token 输入 0.8 元、输出 2.8 元。名字里带 Flash 不代表免费,配置时模型 ID 要写 glm-4.7-flash。价格页没有公布免费模型的并发和速率上限,高频调用时要做好限流后重试。
阿里云百炼:90 天新人额度,先关掉自动扣费
想免费调用千问,路径是百炼的新人免费额度。按官方文档:
- 首次开通百炼时自动发放,免费额度只发给华北 2(北京)地域的模型,其他地域没有。
- 每个模型单独计额,通常 100 万 Token,输入和输出共用;带日期后缀的快照版本(如
qwen-max-2026-05-17)和不带日期的版本算两个模型,各有一份额度。 - 有效期 90 天,从开通、模型发布或申请通过之日起算(取较晚者),不能延期,同一实名主体只能领一次。
- 只抵扣实时调用,Batch、模型调优、模型部署都不能用免费额度。
- 主账号和 RAM 子账号共用同一份额度。
最需要注意的是用完之后:未实名的账号用完即停,已实名的账号默认自动转按量付费,费用从阿里云账户扣除,可能导致欠费;账户一旦欠费,其他模型即使还有免费额度也调不通。只想免费试用的话,在控制台“免费额度”页给模型打开“免费额度用完即停”,额度耗尽后接口返回 HTTP 403,错误码 AllocationQuota.FreeTierOnly,不会继续扣费。这个开关需要一点时间生效,刚切换时不要马上大批量调用。
文档还专门提醒:用 Cline、CodeBuddy 这类 IDE 插件调用时,插件会带上完整代码上下文和对话历史,一次对话可能消耗几千 Token,100 万 Token 的额度会比预想中用得快。
剩余额度可以在控制台的“免费额度”页看到,页面列出每个模型的剩余量和到期时间;余量降到 20% 和完全用完时,会通过短信、站内信、邮件提醒。
硅基流动:免费的是小模型
硅基流动 SiliconFlow 价格页标“免费”的对话模型,是 Qwen3-8B、Qwen3.5-4B、Qwen2.5-7B-Instruct、GLM-4-9B-0414、GLM-Z1-9B-0414、DeepSeek-R1-0528-Qwen3-8B(蒸馏版)、Hunyuan-MT-7B 等,另有 Xing4.0-29B;向量模型 bge-m3、重排模型 bge-reranker-v2-m3 也免费。DeepSeek、千问大参数版本、GLM-5.x 这些旗舰模型都要付费。
这些小模型做翻译、分类、摘要、做知识库的向量化足够,写复杂代码或长推理会明显吃力。价格页没有公布免费模型的限速。
腾讯混元、百度千帆、火山方舟也有各自的新人额度,额度大小和有效期以各自控制台当日显示为准。
人在海外可用地区:Gemini 打底,Groq 和 OpenRouter 补位
Gemini API:模型强,但数据会被使用
Gemini API 的免费额度覆盖 Gemini 3.8 Flash、3.7 Flash、3.5 Flash、3.5 Flash-Lite、3.1 Flash-Lite、2.5 Pro、2.5 Flash 等模型,Gemma 4 和 Gemini Embedding 2 也免费。Gemini 3.1 Pro 预览版、所有 Nano Banana 图片模型、Veo 视频模型不在免费范围,Batch 和 Flex 也从不免费。
限额有三点要知道:
- 每个模型的免费 RPM、每日请求数,官方文档已不再列出,只能在 Google AI Studio 里查看,官方也说明这些限额不保证。
- 限额按项目计算,不按 API key 计算,同一个项目里多建几个 key 不会多出额度。
- 每日请求数在太平洋时间午夜重置,对应北京时间下午 3 点或 4 点,随夏令时变化。
数据条款是选 Gemini 前必须考虑的一条。Gemini API 的附加条款写明:使用免费额度时,Google 会用你提交的内容和生成结果来改进产品,可能有人工审阅,并要求不要提交敏感、机密或个人信息。只有项目绑定了有效的结算账号,才算付费服务,适用付费服务的数据条款。
可用地区名单包括美国、日本、韩国、新加坡、台湾等,不包括中国大陆、香港、澳门。在 Colab 里调用时,看的是 Colab 实例所在的位置。更细的限额和多 key 问题见Gemini API 免费层速率限制 2026:哪些还免费、去哪看实时限额、为什么多个 Key 共享同一额度。
Groq:限额写得最清楚
Groq 免费计划的限额直接写在文档里。openai/gpt-oss-120b、openai/gpt-oss-20b、qwen/qwen3.8-27b 都是每分钟 30 次请求、每天 1,000 次请求、每分钟 8,000 Token、每天 20 万 Token,按组织计算;命中缓存的 Token 不计入限额。超限返回 429,并带 retry-after 头告诉你等几秒。
它的短板是模型少,免费表里目前只有这几款对话模型。每天 20 万 Token 对个人脚本够用;编程插件每次都会带上大段上下文,消耗会快得多。
OpenRouter:一个 key 试多家模型
OpenRouter 上 ID 以 :free 结尾的模型不收费,但次数有限:
- 累计购买不到 10 credits:每分钟 20 次,每天 50 次。
- 累计购买满 10 credits:每分钟 20 次,每天 1,000 次。
也就是说,要把每天 50 次提到 1,000 次,需要实际花一笔钱充值。多注册账号或多建 key 不会提高上限,账户余额为负时,免费模型也可能报错。调用 GET https://openrouter.ai/api/v1/key,返回里的 free_model_daily_requests 会显示当天已用、上限和剩余次数,按 UTC 日期计,北京时间早上 8 点重置。
哪些模型带 :free 会经常变化,每个免费模型背后的上游服务商数据政策也不同,用之前在模型页确认。拿它接 Claude Code 之类编程工具的配置方法,见Claude Code 连接 OpenRouter 和 DeepSeek:路线选择、配置与首错排查。
其他几家:适合试一下,不适合长期依赖
Cloudflare Workers AI 每天免费 10,000 Neurons,UTC 零点重置。Neurons 是 Cloudflare 自己的计量单位,不同模型每次调用消耗的 Neurons 不同,不能直接换算成 Token;Kimi K2.6、GLM-5.3、DeepSeek V4 等较强的模型要求付费账户才能调用。
Mistral 的 Free mode 可以建 API key,每月包含一定用量,具体数字在账户的 Limits 页,公开文档没有写。Cohere 试用 key 每月 1,000 次调用,SambaNova 免费档每模型每天 20 次,Hugging Face 免费用户每月 $0.10 推理赠金,这几家都只够验证接口能不能跑通。NVIDIA 开发者计划成员可以免费调用 build.nvidia.com 上的 NIM 接口,用途写明是原型开发,正式上线需要企业许可。
额度用完会发生什么
免费额度出问题,往往不是模型不好用,而是额度悄悄用完后开始扣费,或者接口突然全部报错。

| 平台 | 触顶或过期后的表现 | 扣费风险 |
|---|---|---|
| 阿里云百炼 | 未实名:直接停用;已实名:自动转按量付费;开了“用完即停”则返回 403 AllocationQuota.FreeTierOnly | 已实名且没开开关时会扣费,还可能欠费 |
| 智谱 | GLM-4.7-Flash 本身免费 | 模型 ID 写成付费模型(如 GLM-5.3-Flash)就按价格扣余额 |
| 硅基流动 | 免费模型不计费 | 切到旗舰模型就开始计费 |
| Gemini API | 超出任一项限额即报限流错误 | 项目没绑结算账号时只会被限流;绑定后整个项目按付费服务计费 |
| Groq | 返回 429 和 retry-after | 免费计划下表现为限流 |
OpenRouter :free | 当天次数用完后被限流;余额为负时也可能报错 | 调用非 :free 模型会从余额扣费 |
| Cloudflare Workers AI | Workers Free 超过每天 10,000 Neurons 后请求报错 | 升级 Workers Paid 后,超出部分按每 1,000 Neurons $0.011 计费 |
两个习惯能省掉大部分麻烦:一是只在确实需要付费时才绑卡或完成付费设置,免费试用阶段保持“用完即停”;二是把模型 ID 写在配置里而不是散落在代码中,避免误切到同名的付费版本。
一段代码在几家免费接口之间切换
智谱、百炼、Gemini、Groq、OpenRouter 都提供 OpenAI 兼容接口,用官方 openai Python 包改 base_url 就能切换。下面的脚本按顺序尝试,前一家限流或额度用尽就换下一家。key 全部从环境变量读取,不要写进代码。
import os
from openai import OpenAI, APIStatusError
PROVIDERS = {
"zhipu": {
"base_url": "https://open.bigmodel.cn/api/paas/v4",
"key_env": "ZHIPU_API_KEY",
"model": "glm-4.7-flash",
},
"bailian": {
# 北京地域专属域名,格式为
# https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
# WorkspaceId 在百炼控制台“业务空间详情”页查看;key 必须是北京地域创建的
"base_url": os.environ.get("BAILIAN_BASE_URL"),
"key_env": "DASHSCOPE_API_KEY",
"model": "qwen3.8-max", # 先在模型广场确认该模型显示免费额度
},
"gemini": {
"base_url": "https://generativelanguage.googleapis.com/v1beta/openai/",
"key_env": "GEMINI_API_KEY",
"model": "gemini-3.8-flash",
},
"groq": {
"base_url": "https://api.groq.com/openai/v1",
"key_env": "GROQ_API_KEY",
"model": "openai/gpt-oss-20b",
},
"openrouter": {
"base_url": "https://openrouter.ai/api/v1",
"key_env": "OPENROUTER_API_KEY",
# 在 OpenRouter 模型页挑一个 ID 以 :free 结尾的模型
"model": os.environ.get("OPENROUTER_FREE_MODEL"),
},
}
# 国内可以设为 zhipu,bailian;海外可用地区可以设为 gemini,groq,openrouter
ORDER = os.environ.get("PROVIDER_ORDER", "zhipu,bailian").split(",")
def ask(prompt: str) -> str:
last_error = None
for name in ORDER:
cfg = PROVIDERS[name.strip()]
api_key = os.environ.get(cfg["key_env"])
if not api_key or not cfg["base_url"] or not cfg["model"]:
continue # 这家没配置,跳过
client = OpenAI(api_key=api_key, base_url=cfg["base_url"])
try:
resp = client.chat.completions.create(
model=cfg["model"],
messages=[{"role": "user", "content": prompt}],
)
return f"[{name}] {resp.choices[0].message.content}"
except APIStatusError as e:
# 429:限流或当天次数用完;403:百炼“用完即停”触发
if e.status_code in (429, 403):
last_error = e
continue
raise
raise RuntimeError(f"所有免费接口都不可用:{last_error}")
if __name__ == "__main__":
print(ask("用一句话解释什么是向量数据库。"))运行前把各平台控制台生成的 key 设成环境变量(如 ZHIPU_API_KEY、GEMINI_API_KEY),用百炼时另设 BAILIAN_BASE_URL,保存为 ask.py 后执行 python ask.py。几点说明:
- 百炼返回 401 且错误码是
invalid_api_key,通常是 key 和base_url不在同一个地域,而不是 key 失效。 - 百炼旧域名
dashscope.aliyuncs.com目前仍能用,官方建议迁移到带 WorkspaceId 的专属域名。 - 硅基流动、Mistral 等平台的兼容地址以各自文档为准,确认后按同样格式加进
PROVIDERS即可。
免费额度不够用时怎么办
出现下面任一情况,就该认真考虑付费了:限流已经影响到用户体验;数据不能交给免费档的条款;百炼 90 天到期;免费模型的能力撑不起任务,需要旗舰模型。
下一步通常有三种选择:
- 换成便宜的付费模型。DeepSeek 的
deepseek-flash在非高峰时段每百万 Token 输入 $0.15(未命中缓存)、输出 $0.6,高峰时段翻倍为 $0.3 和 $1.2;高峰是 UTC 周一到周五 01:00–04:00 和 06:00–10:00,即北京时间 9 点到 12 点、14 点到 18 点,中国节假日除外。Gemini 3.8 Flash 付费价格在 2026 年 12 月 31 日前为每百万 Token 输入 $0.75、输出 $3.75,之后调整为 $1.50 和 $7.50。各家价格和质量的横向比较见最便宜的 LLM API Provider:按价格、质量、延迟和网关风险比较。 - 给官方平台充值。已经在用的平台直接转按量付费,改动最小;Gemini 项目绑定结算后,数据也不再用于改进产品。
- 用 OpenAI 兼容的 API 网关。如果你需要的官方 API 在所在地区不提供服务,或者想用一个 key 接多家模型,可以考虑付费网关,例如 laozhang.ai(
base_url为https://api.laozhang.ai/v1,预付费按量计费)。它是付费服务,不继承各家官方的免费额度,接入前先看清计费和数据处理说明。
如果需求是“完全不限量”,唯一的办法是用 Ollama 之类的工具在自己的电脑或服务器上跑开源模型:不按调用计费,但要承担显卡和电费,能跑多大的模型取决于你的硬件。
常见问题
有没有真正不限量的免费大模型 API?
没有。智谱 GLM-4.7-Flash 这类长期免费的模型,平台没有公布并发和速率上限,不等于不限量;Gemini、Groq、OpenRouter 都有每分钟和每天的上限。“每月免费上亿 Token”的做法,通常是把多家免费接口聚合起来轮流用,任何一家调整政策都会受影响。真正不按调用计量的,只有本地部署开源模型。
千问有免费 API 吗?
有,通过阿里云百炼的新人免费额度:在华北 2(北京)地域开通后,每个千问模型通常有 100 万 Token,90 天有效,不是永久。已实名的账号用完后会自动转为按量付费,只想免费试用就先打开“免费额度用完即停”。
DeepSeek 有免费 API 吗?
官方价格页没有公开的免费额度,账户里有“赠送余额”字段,但没有公布发放规则。DeepSeek 的优势是付费价格低,非高峰时段 deepseek-flash 每百万 Token 输入 $0.15、输出 $0.6。硅基流动免费提供的 DeepSeek-R1-0528-Qwen3-8B 是基于 Qwen3-8B 的蒸馏小模型,不是 DeepSeek 满血版。
多注册几个账号、多建几个 key,能拿到更多免费额度吗?
基本不行。Gemini 的限额按项目计算,同项目多个 key 共享额度;OpenRouter 明确说多账号、多 key 不影响上限;百炼的新人额度同一实名主体只能领一次。与其堆账号,不如按上面的代码把两三家平台串起来,或者直接付费。
免费 API 能用在正式上线的产品里吗?
小流量的个人项目可以,但要做好限流后重试和备用接口。面向用户的产品不建议依赖免费档:限额随时可能调整,Gemini 免费额度的内容会被用于改进产品,NVIDIA 的免费接口明确只用于原型开发,Cohere 的试用 key 只用于评估。上线前换到付费档,才有稳定的限额和更合适的数据条款。





