跳转到主要内容

免费 AI API 推荐:国内外平台怎么选,额度用完会怎样

截至 2026 年 9 月 26 日,人在国内先用智谱 GLM-4.7-Flash 和百炼新人额度,在 Gemini 可用地区先用其免费额度;百炼实名后超额会自动扣费。

LaoZhang AI Team发布于更新于 23 分钟阅读
文章目录
免费 AI API 国内外怎么选:国内先智谱和百炼,Gemini 可用地区先 Gemini API,要固定限额选 Groq,一个 key 试多家用 OpenRouter

截至 2026 年 9 月 26 日,没有哪一家免费 AI API 适合所有人,先看你人在哪里、数据敏不敏感、每天要调用多少次。

  • 人在中国大陆:先注册智谱开放平台,用 GLM-4.7-Flash。它按模型长期免费,不是限时的新人福利。需要对比千问系列时,再开通阿里云百炼领新人额度(仅北京地域,每个模型通常 100 万 Token,90 天有效);开通后第一件事是打开“免费额度用完即停”。
  • 人在 Gemini API 可用地区:Google AI Studio 里的 Gemini API 免费额度,是目前不花钱能调用到的较强模型档,Flash 系列和 Gemini 2.5 Pro 都在免费范围内。代价是免费额度下提交的内容会被 Google 用于改进产品,敏感数据不要放进去。
  • 需要固定、公开的限额:Groq 免费计划把每个模型的 RPM、每日请求数都写在文档里;想用一个 key 试多家模型,用 OpenRouter 以 :free 结尾的模型。

DeepSeek 没有公开的免费档,只是付费价格很低;GitHub Models 已经下线;Cerebras 也不再有永久免费档。下面按“免费”的类型、国内和海外两条线、额度用完后的后果依次说明,最后给一段能在几家之间切换的代码。

“免费”有四种,先分清再比较

平台都说自己免费,但免费的方式不同,决定了它适合拿来做什么。

免费类型典型例子对你意味着什么
指定模型长期免费智谱 GLM-4.7-Flash、硅基流动的小模型、OpenRouter 的 :free 模型只要平台不调整政策就一直免费,但通常不是该平台最强的模型
持续的免费额度,按时间重置Gemini API、Groq、Cloudflare Workers AI每分钟、每天有上限,额度会重置,适合长期开发和个人项目
新人一次性额度阿里云百炼、Anthropic 新用户的少量赠金有有效期,用完或过期就没了;要特别留意用完后是停用还是开始扣费
很便宜的付费DeepSeek不免费,但在免费额度不够时是成本最低的补充之一

只想跑通一个 Demo,新人额度就够了;要长期挂在 Cline、Cherry Studio、n8n 这类工具后面,应该选前两类;用户多起来以后,四类都撑不住,需要转付费。

四类免费 AI API 对比:指定模型长期免费、按时间重置的持续额度、新人一次性额度和很便宜的付费,各自的例子与适合场景

截至 2026 年 9 月 26 日的免费情况

下表只写官方页面公开的信息。额度常常调整,以控制台当日显示为准。

平台免费形式官方公开的额度门槛与限制适合
智谱开放平台GLM-4.7-Flash(200K 上下文)、视觉模型 GLM-4.6V-Flash 输入输出免费并发和速率上限未在价格页公布国内平台;GLM-5.3-Flash 是付费模型国内开发者的日常主力
阿里云百炼新人免费额度每个模型通常 100 万 Token,输入输出共用,90 天仅华北 2(北京)地域;实名后超额自动转按量付费对比千问等多个模型
硅基流动部分模型免费免费的是 Qwen3-8B、GLM-4-9B 等小模型和 bge 向量模型旗舰模型收费;免费模型的限速未公布翻译、分类、向量检索
Gemini API免费额度逐模型限额只在 AI Studio 显示,不在文档公开可用地区不含中国大陆和香港;免费额度的内容用于改进 Google 产品海外个人项目、原型
Groq免费计划openai/gpt-oss-120b 等:30 RPM、每天 1,000 次请求、每天 20 万 Token按组织计算;模型选择少需要速度和固定限额的原型
OpenRouter:free 模型每天 50 次;累计购买满 10 credits 后每天 1,000 次,均为 20 RPM哪些模型带 :free 经常变一个 key 试多家模型
Cloudflare Workers AI每日免费分配每天 10,000 NeuronsNeurons 不等于 Token;部分强模型要求付费已经在用 Workers 的项目
MistralFree mode每月包含用量,具体数字在账户的 Limits 页数字不公开试 Mistral 模型
Cohere试用 key每月 1,000 次调用,Chat 每模型每分钟 20 次仅用于评估试 Command 系列和 Rerank
SambaNova Cloud未绑定支付方式时的免费档每模型每天 20 次请求只够测试试 DeepSeek-V3.1、Llama 3.3 70B
Hugging Face每月推理赠金免费用户每月 $0.10只能走 HF 代为路由的调用试接口,不够跑任务
NVIDIA build.nvidia.com开发者计划成员免费调用 NIM 接口未公布具体限额条款写明用于原型开发试 NVIDIA 托管的模型

图片生成接口的免费情况差别很大,单独整理在2026 免费 AI 生图 API:现在哪里还算真正免费?里,这里只讲文本大模型。

还有几家常被写进“免费清单”,但现在的情况是:

  • GitHub Models:2026 年 7 月 30 日全面下线,playground、模型目录、推理 API 和自带 key 功能都不再对任何用户开放。
  • Cerebras:官方明确“没有永久免费档”。试用需要先绑定已验证的支付方式,拿到 $5 额度,30 天后过期。
  • DeepSeek:价格页只有付费价格,没有公开的免费额度。
  • Claude API:新用户会拿到少量测试赠金,金额没有公布,没有按月重置的免费档;服务地区不含中国大陆和香港。充值和买 key 的细节见Claude API Key 怎么购买:官方充值、国内可用路线与共享密钥避坑。
  • OpenAI API:没有面向所有人的注册赠金,只有符合条件、愿意与 OpenAI 共享流量数据的组织每天能拿到一些免费 token,前提是账户有正余额;服务地区同样不含中国大陆和香港。详见OpenAI API 免费额度还有吗?赠金、数据共享与每月上限。

人在国内:智谱打底,百炼对比,硅基流动补小模型

Gemini、OpenAI、Claude 三家的服务地区名单都不包括中国大陆和香港,条款要求只能在可用地区使用。在国内做项目,先把国内平台用好,比折腾海外账号更省事。

智谱 GLM-4.7-Flash:长期免费,注意名字

智谱开放平台 BigModel 的价格页写得很直接:文本模型 GLM-4.7-Flash(200K 上下文)和视觉模型 GLM-4.6V-Flash,输入、输出、缓存都免费。它不是新人额度,没有 90 天之类的期限,适合长期挂在编程插件、自动化流程或个人项目后面。

名字有个坑:GLM-5.3-Flash 是付费模型,每百万 Token 输入 0.8 元、输出 2.8 元。名字里带 Flash 不代表免费,配置时模型 ID 要写 glm-4.7-flash。价格页没有公布免费模型的并发和速率上限,高频调用时要做好限流后重试。

阿里云百炼:90 天新人额度,先关掉自动扣费

想免费调用千问,路径是百炼的新人免费额度。按官方文档:

  • 首次开通百炼时自动发放,免费额度只发给华北 2(北京)地域的模型,其他地域没有。
  • 每个模型单独计额,通常 100 万 Token,输入和输出共用;带日期后缀的快照版本(如 qwen-max-2026-05-17)和不带日期的版本算两个模型,各有一份额度。
  • 有效期 90 天,从开通、模型发布或申请通过之日起算(取较晚者),不能延期,同一实名主体只能领一次。
  • 只抵扣实时调用,Batch、模型调优、模型部署都不能用免费额度。
  • 主账号和 RAM 子账号共用同一份额度。

最需要注意的是用完之后:未实名的账号用完即停,已实名的账号默认自动转按量付费,费用从阿里云账户扣除,可能导致欠费;账户一旦欠费,其他模型即使还有免费额度也调不通。只想免费试用的话,在控制台“免费额度”页给模型打开“免费额度用完即停”,额度耗尽后接口返回 HTTP 403,错误码 AllocationQuota.FreeTierOnly,不会继续扣费。这个开关需要一点时间生效,刚切换时不要马上大批量调用。

文档还专门提醒:用 Cline、CodeBuddy 这类 IDE 插件调用时,插件会带上完整代码上下文和对话历史,一次对话可能消耗几千 Token,100 万 Token 的额度会比预想中用得快。

剩余额度可以在控制台的“免费额度”页看到,页面列出每个模型的剩余量和到期时间;余量降到 20% 和完全用完时,会通过短信、站内信、邮件提醒。

硅基流动:免费的是小模型

硅基流动 SiliconFlow 价格页标“免费”的对话模型,是 Qwen3-8B、Qwen3.5-4B、Qwen2.5-7B-Instruct、GLM-4-9B-0414、GLM-Z1-9B-0414、DeepSeek-R1-0528-Qwen3-8B(蒸馏版)、Hunyuan-MT-7B 等,另有 Xing4.0-29B;向量模型 bge-m3、重排模型 bge-reranker-v2-m3 也免费。DeepSeek、千问大参数版本、GLM-5.x 这些旗舰模型都要付费。

这些小模型做翻译、分类、摘要、做知识库的向量化足够,写复杂代码或长推理会明显吃力。价格页没有公布免费模型的限速。

腾讯混元、百度千帆、火山方舟也有各自的新人额度,额度大小和有效期以各自控制台当日显示为准。

人在海外可用地区:Gemini 打底,Groq 和 OpenRouter 补位

Gemini API:模型强,但数据会被使用

Gemini API 的免费额度覆盖 Gemini 3.8 Flash、3.7 Flash、3.5 Flash、3.5 Flash-Lite、3.1 Flash-Lite、2.5 Pro、2.5 Flash 等模型,Gemma 4 和 Gemini Embedding 2 也免费。Gemini 3.1 Pro 预览版、所有 Nano Banana 图片模型、Veo 视频模型不在免费范围,Batch 和 Flex 也从不免费。

限额有三点要知道:

  • 每个模型的免费 RPM、每日请求数,官方文档已不再列出,只能在 Google AI Studio 里查看,官方也说明这些限额不保证。
  • 限额按项目计算,不按 API key 计算,同一个项目里多建几个 key 不会多出额度。
  • 每日请求数在太平洋时间午夜重置,对应北京时间下午 3 点或 4 点,随夏令时变化。

数据条款是选 Gemini 前必须考虑的一条。Gemini API 的附加条款写明:使用免费额度时,Google 会用你提交的内容和生成结果来改进产品,可能有人工审阅,并要求不要提交敏感、机密或个人信息。只有项目绑定了有效的结算账号,才算付费服务,适用付费服务的数据条款。

可用地区名单包括美国、日本、韩国、新加坡、台湾等,不包括中国大陆、香港、澳门。在 Colab 里调用时,看的是 Colab 实例所在的位置。更细的限额和多 key 问题见Gemini API 免费层速率限制 2026:哪些还免费、去哪看实时限额、为什么多个 Key 共享同一额度。

Groq:限额写得最清楚

Groq 免费计划的限额直接写在文档里。openai/gpt-oss-120b、openai/gpt-oss-20b、qwen/qwen3.8-27b 都是每分钟 30 次请求、每天 1,000 次请求、每分钟 8,000 Token、每天 20 万 Token,按组织计算;命中缓存的 Token 不计入限额。超限返回 429,并带 retry-after 头告诉你等几秒。

它的短板是模型少,免费表里目前只有这几款对话模型。每天 20 万 Token 对个人脚本够用;编程插件每次都会带上大段上下文,消耗会快得多。

OpenRouter:一个 key 试多家模型

OpenRouter 上 ID 以 :free 结尾的模型不收费,但次数有限:

  • 累计购买不到 10 credits:每分钟 20 次,每天 50 次。
  • 累计购买满 10 credits:每分钟 20 次,每天 1,000 次。

也就是说,要把每天 50 次提到 1,000 次,需要实际花一笔钱充值。多注册账号或多建 key 不会提高上限,账户余额为负时,免费模型也可能报错。调用 GET https://openrouter.ai/api/v1/key,返回里的 free_model_daily_requests 会显示当天已用、上限和剩余次数,按 UTC 日期计,北京时间早上 8 点重置。

哪些模型带 :free 会经常变化,每个免费模型背后的上游服务商数据政策也不同,用之前在模型页确认。拿它接 Claude Code 之类编程工具的配置方法,见Claude Code 连接 OpenRouter 和 DeepSeek:路线选择、配置与首错排查。

其他几家:适合试一下,不适合长期依赖

Cloudflare Workers AI 每天免费 10,000 Neurons,UTC 零点重置。Neurons 是 Cloudflare 自己的计量单位,不同模型每次调用消耗的 Neurons 不同,不能直接换算成 Token;Kimi K2.6、GLM-5.3、DeepSeek V4 等较强的模型要求付费账户才能调用。

Mistral 的 Free mode 可以建 API key,每月包含一定用量,具体数字在账户的 Limits 页,公开文档没有写。Cohere 试用 key 每月 1,000 次调用,SambaNova 免费档每模型每天 20 次,Hugging Face 免费用户每月 $0.10 推理赠金,这几家都只够验证接口能不能跑通。NVIDIA 开发者计划成员可以免费调用 build.nvidia.com 上的 NIM 接口,用途写明是原型开发,正式上线需要企业许可。

额度用完会发生什么

免费额度出问题,往往不是模型不好用,而是额度悄悄用完后开始扣费,或者接口突然全部报错。

阿里云百炼免费额度用完后的三种结果:开了用完即停返回 403,未实名用完即停,已实名自动转按量付费;对照 Gemini API、Groq、OpenRouter 免费档只会被限流

平台触顶或过期后的表现扣费风险
阿里云百炼未实名:直接停用;已实名:自动转按量付费;开了“用完即停”则返回 403 AllocationQuota.FreeTierOnly已实名且没开开关时会扣费,还可能欠费
智谱GLM-4.7-Flash 本身免费模型 ID 写成付费模型(如 GLM-5.3-Flash)就按价格扣余额
硅基流动免费模型不计费切到旗舰模型就开始计费
Gemini API超出任一项限额即报限流错误项目没绑结算账号时只会被限流;绑定后整个项目按付费服务计费
Groq返回 429 和 retry-after免费计划下表现为限流
OpenRouter :free当天次数用完后被限流;余额为负时也可能报错调用非 :free 模型会从余额扣费
Cloudflare Workers AIWorkers Free 超过每天 10,000 Neurons 后请求报错升级 Workers Paid 后,超出部分按每 1,000 Neurons $0.011 计费

两个习惯能省掉大部分麻烦:一是只在确实需要付费时才绑卡或完成付费设置,免费试用阶段保持“用完即停”;二是把模型 ID 写在配置里而不是散落在代码中,避免误切到同名的付费版本。

一段代码在几家免费接口之间切换

智谱、百炼、Gemini、Groq、OpenRouter 都提供 OpenAI 兼容接口,用官方 openai Python 包改 base_url 就能切换。下面的脚本按顺序尝试,前一家限流或额度用尽就换下一家。key 全部从环境变量读取,不要写进代码。

python
import os
from openai import OpenAI, APIStatusError

PROVIDERS = {
    "zhipu": {
        "base_url": "https://open.bigmodel.cn/api/paas/v4",
        "key_env": "ZHIPU_API_KEY",
        "model": "glm-4.7-flash",
    },
    "bailian": {
        # 北京地域专属域名,格式为
        # https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
        # WorkspaceId 在百炼控制台“业务空间详情”页查看;key 必须是北京地域创建的
        "base_url": os.environ.get("BAILIAN_BASE_URL"),
        "key_env": "DASHSCOPE_API_KEY",
        "model": "qwen3.8-max",  # 先在模型广场确认该模型显示免费额度
    },
    "gemini": {
        "base_url": "https://generativelanguage.googleapis.com/v1beta/openai/",
        "key_env": "GEMINI_API_KEY",
        "model": "gemini-3.8-flash",
    },
    "groq": {
        "base_url": "https://api.groq.com/openai/v1",
        "key_env": "GROQ_API_KEY",
        "model": "openai/gpt-oss-20b",
    },
    "openrouter": {
        "base_url": "https://openrouter.ai/api/v1",
        "key_env": "OPENROUTER_API_KEY",
        # 在 OpenRouter 模型页挑一个 ID 以 :free 结尾的模型
        "model": os.environ.get("OPENROUTER_FREE_MODEL"),
    },
}

# 国内可以设为 zhipu,bailian;海外可用地区可以设为 gemini,groq,openrouter
ORDER = os.environ.get("PROVIDER_ORDER", "zhipu,bailian").split(",")


def ask(prompt: str) -> str:
    last_error = None
    for name in ORDER:
        cfg = PROVIDERS[name.strip()]
        api_key = os.environ.get(cfg["key_env"])
        if not api_key or not cfg["base_url"] or not cfg["model"]:
            continue  # 这家没配置,跳过
        client = OpenAI(api_key=api_key, base_url=cfg["base_url"])
        try:
            resp = client.chat.completions.create(
                model=cfg["model"],
                messages=[{"role": "user", "content": prompt}],
            )
            return f"[{name}] {resp.choices[0].message.content}"
        except APIStatusError as e:
            # 429:限流或当天次数用完;403:百炼“用完即停”触发
            if e.status_code in (429, 403):
                last_error = e
                continue
            raise
    raise RuntimeError(f"所有免费接口都不可用:{last_error}")


if __name__ == "__main__":
    print(ask("用一句话解释什么是向量数据库。"))

运行前把各平台控制台生成的 key 设成环境变量(如 ZHIPU_API_KEY、GEMINI_API_KEY),用百炼时另设 BAILIAN_BASE_URL,保存为 ask.py 后执行 python ask.py。几点说明:

  • 百炼返回 401 且错误码是 invalid_api_key,通常是 key 和 base_url 不在同一个地域,而不是 key 失效。
  • 百炼旧域名 dashscope.aliyuncs.com 目前仍能用,官方建议迁移到带 WorkspaceId 的专属域名。
  • 硅基流动、Mistral 等平台的兼容地址以各自文档为准,确认后按同样格式加进 PROVIDERS 即可。

免费额度不够用时怎么办

出现下面任一情况,就该认真考虑付费了:限流已经影响到用户体验;数据不能交给免费档的条款;百炼 90 天到期;免费模型的能力撑不起任务,需要旗舰模型。

下一步通常有三种选择:

  • 换成便宜的付费模型。DeepSeek 的 deepseek-flash 在非高峰时段每百万 Token 输入 $0.15(未命中缓存)、输出 $0.6,高峰时段翻倍为 $0.3 和 $1.2;高峰是 UTC 周一到周五 01:00–04:00 和 06:00–10:00,即北京时间 9 点到 12 点、14 点到 18 点,中国节假日除外。Gemini 3.8 Flash 付费价格在 2026 年 12 月 31 日前为每百万 Token 输入 $0.75、输出 $3.75,之后调整为 $1.50 和 $7.50。各家价格和质量的横向比较见最便宜的 LLM API Provider:按价格、质量、延迟和网关风险比较。
  • 给官方平台充值。已经在用的平台直接转按量付费,改动最小;Gemini 项目绑定结算后,数据也不再用于改进产品。
  • 用 OpenAI 兼容的 API 网关。如果你需要的官方 API 在所在地区不提供服务,或者想用一个 key 接多家模型,可以考虑付费网关,例如 laozhang.ai(base_url 为 https://api.laozhang.ai/v1,预付费按量计费)。它是付费服务,不继承各家官方的免费额度,接入前先看清计费和数据处理说明。

如果需求是“完全不限量”,唯一的办法是用 Ollama 之类的工具在自己的电脑或服务器上跑开源模型:不按调用计费,但要承担显卡和电费,能跑多大的模型取决于你的硬件。

常见问题

有没有真正不限量的免费大模型 API?

没有。智谱 GLM-4.7-Flash 这类长期免费的模型,平台没有公布并发和速率上限,不等于不限量;Gemini、Groq、OpenRouter 都有每分钟和每天的上限。“每月免费上亿 Token”的做法,通常是把多家免费接口聚合起来轮流用,任何一家调整政策都会受影响。真正不按调用计量的,只有本地部署开源模型。

千问有免费 API 吗?

有,通过阿里云百炼的新人免费额度:在华北 2(北京)地域开通后,每个千问模型通常有 100 万 Token,90 天有效,不是永久。已实名的账号用完后会自动转为按量付费,只想免费试用就先打开“免费额度用完即停”。

DeepSeek 有免费 API 吗?

官方价格页没有公开的免费额度,账户里有“赠送余额”字段,但没有公布发放规则。DeepSeek 的优势是付费价格低,非高峰时段 deepseek-flash 每百万 Token 输入 $0.15、输出 $0.6。硅基流动免费提供的 DeepSeek-R1-0528-Qwen3-8B 是基于 Qwen3-8B 的蒸馏小模型,不是 DeepSeek 满血版。

多注册几个账号、多建几个 key,能拿到更多免费额度吗?

基本不行。Gemini 的限额按项目计算,同项目多个 key 共享额度;OpenRouter 明确说多账号、多 key 不影响上限;百炼的新人额度同一实名主体只能领一次。与其堆账号,不如按上面的代码把两三家平台串起来,或者直接付费。

免费 API 能用在正式上线的产品里吗?

小流量的个人项目可以,但要做好限流后重试和备用接口。面向用户的产品不建议依赖免费档:限额随时可能调整,Gemini 免费额度的内容会被用于改进产品,NVIDIA 的免费接口明确只用于原型开发,Cohere 的试用 key 只用于评估。上线前换到付费档,才有稳定的限额和更合适的数据条款。