跳转到主要内容

AI API 价格对比:国内外大模型谁最便宜、月费怎么算

美元标价最低的是 GPT-6 Luna,人民币里 qwen3.8-flash 低于 DeepSeek Flash;输出占比、峰谷时段、长上下文和 Gemini 年底调价会改写排名。

LaoZhang AI Team发布于更新于 18 分钟阅读
文章目录
AI API 价格对比封面:美元最低的 GPT-6 Luna、人民币最低的 qwen3.8-flash 与中档 Grok 4.7 的每百万 tokens 输入输出价

截至 2026 年 9 月 26 日,只看官方标价,美元计费里最便宜的是 OpenAI gpt-6-luna:每百万 tokens 输入 $0.10、输出 $0.50;紧随其后的是 DeepSeek Flash 的空闲时段价和 Gemini 3.1 Flash-Lite。人民币计费里,阿里云百炼的通义千问 qwen3.8-flash(输入 0.8 元、输出 2.7 元)比 DeepSeek Flash 空闲时段(1 元 / 4 元)还低。中档里 GPT-6 Sol 与 Claude Sonnet 5 同为 $2 / $10,Grok 4.7 输入同价、输出只要 $6。

表头数字只是起点。输出占总量多少、是否在 DeepSeek 的高峰时段调用、单次提示是否超过 200K 或 272K、缓存能命中多少、任务能不能等 Batch,以及 Gemini 3.8 Flash 在 2027 年 1 月 1 日的调价,都会让排名换位。算月费时用"输入百万 tokens × 输入单价 + 输出百万 tokens × 输出单价"逐个套,再把这些条件叠上去。

美元官方价:轻量、中档、旗舰分层对照

下表是各家官方定价页的标准按量价,单位为每百万 tokens,短上下文,不含 Batch。DeepSeek 分空闲与高峰两档,表中写成"空闲 / 高峰"。

档位模型输入缓存命中输入输出会改变实际单价的条件
轻量OpenAI gpt-6-luna$0.10$0.01$0.50单次输入超过 272K 时整单改按 $0.20 / $0.75;Batch 与 Flex 半价
轻量DeepSeek deepseek-flash$0.15 / $0.30$0.003 / $0.006$0.60 / $1.20高峰为北京时间工作日 9:00–12:00、14:00–18:00,价格是空闲的两倍
轻量Gemini gemini-3.1-flash-lite$0.25(音频 $0.50)$0.025$1.50Batch 半价;有免费层
轻量Gemini gemini-3.5-flash-lite$0.30未列出$2.50Batch 半价
轻量Gemini gemini-3.8-flash$0.75$0.075$3.75限时价到 2026 年 12 月 31 日,2027 年 1 月 1 日起 $1.50 / $7.50;缓存另收存储费;输出含思考 token
中档DeepSeek deepseek-v4-pro$0.66 / $1.32$0.022 / $0.044$1.98 / $3.96与 Flash 同一套峰谷时段
中档Claude Haiku 4.5$1$0.10$5Batch $0.50 / $2.50
中档xAI grok-4.7$2$0.50$6提示达到 200K 时整单 $4 / $12(缓存 $1);上下文 500K;不支持 Batch
中档OpenAI gpt-6-sol$2$0.20$10输入超过 272K 整单 $4 / $15
中档Claude Sonnet 5$2$0.20$101M 上下文内不加价;新分词器同样文本 token 更多
中档Gemini gemini-3.1-pro-preview$2未列出$12提示超过 200K 时 $4 / $18;仍是预览版
旗舰Claude Opus 5.5$4$0.20$20Fast mode $8 / $40
旗舰OpenAI gpt-6-astra$10$1$50输入超过 272K 整单 $20 / $75
旗舰Claude Fable 5.1$10$0.25$50缓存命中只收输入价的 2.5%

来源:OpenAI API 定价、Claude 定价、Gemini API 定价(Developer API,不是 Vertex AI)、xAI 定价、DeepSeek 模型与价格。

几处容易看漏的地方:

  • OpenAI 的 Batch 与 Flex 都是标准价的一半,比如 Sol 为 $1 / $5;Batch 是异步提交,Flex 用更慢、可能排不上队换价格。反过来,Fast mode(2026 年 7 月 30 日由 Priority 改名)是标准价的两倍。
  • Anthropic、Google 的 Batch 同样打五折:Sonnet 5 为 $1 / $5,Gemini 3.1 Flash-Lite 为 $0.125 / $0.75。
  • OpenAI 的数据驻留(区域处理)端点,对 2026 年 3 月 5 日及以后发布的可用模型加收 10%;xAI 的美国区域端点同样按 1.1 倍计费,Priority 处理按标准价的 2 倍计。
  • DeepSeek 旧模型名 deepseek-v4-flash 仍能调用,但已由 DeepSeek-V4.1-Flash 提供服务,按 Flash 价计费;旧价 $0.14 / $0.28 不再适用。

单个模型的更多细节:GPT-6 Astra API 定价与成本计算、GPT-6 Sol、Luna、Astra 与 Terra 怎么选、Claude Sonnet 5 现行 API 价格与预算重算、Claude Opus 5.5 价格与用量重置、Claude Fable 5.1 API 价格。

国内模型人民币标价

用人民币充值的读者,直接看 DeepSeek 与阿里云百炼的人民币价目更准确。单位同样是每百万 tokens。

模型时段或地域缓存命中输入缓存未命中输入输出免费额度
DeepSeek deepseek-flash空闲时段0.02 元1 元4 元未标注
DeepSeek deepseek-flash高峰时段0.04 元2 元8 元未标注
DeepSeek deepseek-v4-pro空闲时段0.15 元4.5 元13.5 元未标注
DeepSeek deepseek-v4-pro高峰时段0.30 元9 元27 元未标注
通义千问 qwen3.8-flash华北2(北京)按缓存规则折算0.8 元2.7 元100 万 Token,90 天
通义千问 qwen3.8-max华北2(北京)按缓存规则折算12 元36 元100 万 Token,90 天
通义千问 qwen3.8-max-prime华北2(北京)—24 元72 元无

来源:DeepSeek 模型与价格、阿里云百炼模型调用计费。

DeepSeek 的高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00,不含法定节假日;其余时间(包括周末和节假日全天)都是空闲时段,价格减半。换句话说,白天上班时间跑的调用按高峰价扣费,夜间和周末跑的批量任务按空闲价扣费。

百炼这一页只展示原价,活动优惠要到控制台看;免费额度只在华北2(北京)地域提供,从开通之日起 90 天有效。qwen3.8-max 支持 Batch 调用半价,也支持上下文缓存折扣,但两者不能同时生效。页面对缓存的说明是:命中的输入 token 与创建显式缓存的 token 另按不同单价计,给出的例子是创建按标准输入价的 125%、命中按 10%,具体以百炼的上下文缓存说明为准。

人民币价与上一节的美元价不要自己换成同一币种来排名:汇率、充值方式和发票口径都会影响最后付出的钱,放在一起看时各自按原币种比较。表中的国内模型只有 DeepSeek 和通义千问;Kimi、智谱 GLM、MiniMax、豆包等请以各自开放平台定价页当日显示为准。

哪些计费条件会改写排名

输出占比

多数模型的输出单价是输入的 3 倍(Grok 4.7、DeepSeek V4-Pro)到 8 倍多(Gemini 3.5 Flash-Lite)。客服问答、检索增强(RAG)这类读得多、写得少的任务,主要看输入价;长文生成、写代码这类写得多的任务,主要看输出价。Grok 4.7 与 GPT-6 Sol 输入同为 $2,但输出 $6 对 $10,任务越偏输出,Grok 越占便宜。

Gemini 3.8 Flash 的限时价

$0.75 / $3.75 是写明截止日的限时价,2026 年 12 月 31 日之后翻倍为 $1.50 / $7.50,上下文缓存和存储费也一起翻倍。如果你按它做全年预算,2027 年的账单要按新价重算。

长上下文加价:272K 与 200K

OpenAI 的规则是:单次请求输入超过 272K tokens,整单输入和缓存价按 2 倍、输出按 1.5 倍计,不是只对超出的部分加价。Grok 4.7 的门槛更低,提示达到 200K 时整单改按 $4 / $12;Gemini 3.1 Pro Preview 在提示超过 200K 时同样切到高价。Claude 4.6 及之后的模型(包括 Fable 5.1、Opus 5.5、Sonnet 5)在 1M 上下文内都按标准价计。

以一次 40 万输入 + 5,000 输出 tokens 的请求为例:

  • GPT-6 Sol:0.4 × $4 + 0.005 × $15 = $1.675(误按短上下文价算会得到 $0.85)
  • Claude Sonnet 5:0.4 × $2 + 0.005 × $10 = $0.85
  • Gemini 3.1 Pro Preview:0.4 × $4 + 0.005 × $18 = $1.69
  • Grok 4.7:0.4 × $4 + 0.005 × $12 = $1.66

Sol 和 Sonnet 5 的短上下文标价一模一样,到了这种长文档请求就差出将近一倍。

一次 40 万输入加 5,000 输出的请求在 GPT-6 Sol、Claude Sonnet 5、Gemini 3.1 Pro Preview 上的长上下文计价与费用

DeepSeek 的高峰时段

同一个模型,高峰价是空闲价的两倍。能放到夜间或周末跑的离线任务,在 DeepSeek 上天然便宜一半;必须白天实时响应的业务,要按高峰价估算。

缓存命中与 Batch

缓存命中价通常是输入价的十分之一(GPT-6 各型号、Sonnet 5、Haiku 4.5、Gemini 3.8 Flash),Opus 5.5 是 5%,Fable 5.1 是 2.5%,DeepSeek Flash 只有 2%;Grok 4.7 则是四分之一($0.50)。系统提示、工具定义、固定知识库片段越长、复用越多,缓存省得越多;但缓存只降输入,输出一分不减。写入缓存另有价格(例如 Sol $2.50、Sonnet 5 的 5 分钟缓存写入 $2.50),Gemini 还按小时收存储费。

Batch 适合能等的任务,OpenAI、Anthropic、Google 的 Batch 价都是标准价的一半;Grok 4.7 不支持 Batch。百炼的 qwen3.8-max 也有 Batch 半价,但不能与缓存折扣叠加。

同一段文字,token 数不一样

每百万 tokens 的价格只能在同一种计数方式里直接比较。Anthropic 说明 Claude 4.7 及之后的模型换了新分词器,同样的文本大约多出 30% 的 token,具体因内容而异。所以 Sol 与 Sonnet 5 标价相同,处理同一批中文材料时账单未必相同。要比较真实花费,用自己的文本分别调用一次,看返回的用量字段。

按月估算:两种负载下的费用

公式:月费 = 月输入(百万 tokens)× 输入单价 + 月输出(百万 tokens)× 输出单价。

下面两组是按标准价、无缓存、短上下文算出的估算,不是实测账单,也没有计入重试、工具调用费和分词器差异。

  • 输入为主:每月 3 亿输入 + 3,000 万输出 tokens,像客服或 RAG 问答。以 Sol 为例:300 × $2 + 30 × $10 = $900。
  • 输出为主:每月 2,000 万输入 + 4,000 万输出 tokens,像长文生成或代码生成。以 Sol 为例:20 × $2 + 40 × $10 = $440。
模型输入为主输出为主
GPT-6 Luna$45$22
DeepSeek Flash(空闲 / 高峰)$63 / $126$27 / $54
Gemini 3.1 Flash-Lite$120$65
Gemini 3.5 Flash-Lite$165$106
DeepSeek V4-Pro(空闲 / 高峰)$257.40 / $514.80$92.40 / $184.80
Gemini 3.8 Flash(2026 年价 / 2027 年价)$337.50 / $675$165 / $330
Claude Haiku 4.5$450$220
Grok 4.7$780$280
GPT-6 Sol$900$440
Claude Sonnet 5$900$440
Gemini 3.1 Pro Preview$960$520
Claude Opus 5.5$1,800$880
GPT-6 Astra$4,500$2,200
Claude Fable 5.1$4,500$2,200

换一种负载,排名就会动:

  • DeepSeek Flash 如果在高峰时段跑,输入为主时($126)比 Gemini 3.1 Flash-Lite($120)贵,输出为主时($54)反而比它($65)便宜。
  • DeepSeek V4-Pro 空闲时段在输入为主时比 Gemini 3.5 Flash-Lite 贵,在输出为主时比它便宜($92.40 对 $106)。
  • Grok 4.7 在输入为主时比 2027 年价的 Gemini 3.8 Flash 贵($780 对 $675),在输出为主时便宜($280 对 $330)。
  • 不变的是 Luna 两组都最低,Grok 4.7 两组都低于 Sol 和 Sonnet 5。

输入为主和输出为主两种月负载下三组模型的月费对比,同一组里谁更便宜会随负载换位

同样两组用量,按人民币标价算:

模型输入为主输出为主
通义千问 qwen3.8-flash321 元124 元
DeepSeek Flash(空闲 / 高峰)420 元 / 840 元180 元 / 360 元
DeepSeek V4-Pro(空闲 / 高峰)1,755 元 / 3,510 元630 元 / 1,260 元
通义千问 qwen3.8-max4,680 元1,680 元

例如 qwen3.8-flash 输入为主:300 × 0.8 + 30 × 2.7 = 321 元。

缓存会把输入为主的负载拉低很多。仍以 DeepSeek Flash 空闲时段、输入为主为例,假设 3 亿输入里有 80% 命中缓存:240 × 0.02 + 60 × 1 + 30 × 4 = 184.8 元,不到无缓存时 420 元的一半,其中 120 元是输出,缓存管不到。

两家按任务算成本的完整方法,可以参考 Claude API 和 OpenAI API 定价怎么比(其中价格是 5 月的数据,方法仍适用);DeepSeek 峰谷账单的细算见 DeepSeek V4 峰谷定价。

免费额度和中转价,不要算进官方价

准备买 API key 时,常见的报价有三种:官方按量价(上面的表)、官方免费额度、第三方中转或聚合平台的售价。三者不是同一份合同。

免费额度方面,Gemini Developer API 的免费层对 3.8 Flash 和 3.1 Flash-Lite 的输入输出都不收费,但免费层提交的内容会被用于改进 Google 的产品,付费层不会。百炼给 qwen3.8-flash 和 qwen3.8-max 各 100 万 Token、90 天的新开通额度,仅限北京地域。各家免费层的限速和条款,可以看 免费 AI API 推荐:国内外平台怎么选,额度用完会怎样。免费额度适合试接口、跑样例,不适合写进生产预算。

中转站、代理平台的报价常常比官方低,或者换算成人民币更好付款,但那是平台自己的价格和服务条款。付款前要确认:调用的模型 ID 是否就是官方那一个、按什么单位计费、失败请求扣不扣钱、能否退款、日志和数据怎么处理、限速多少。比较方法见 最便宜的 LLM API Provider:按价格、质量、延迟和网关风险比较。在中国大陆申请和付费 Gemini key 的路线,见 Gemini API Key 购买前先看。

先测哪一两个

  • 预算最紧、任务是分类、抽取、短答:美元计费先测 GPT-6 Luna 和 DeepSeek Flash(尽量放在空闲时段跑);人民币计费先测 qwen3.8-flash 和 DeepSeek Flash。
  • 想用 Google 生态或需要音视频、图片输入:从 Gemini 3.1 Flash-Lite 开始;想用 3.8 Flash,就按 2027 年的 $1.50 / $7.50 做预算。
  • 中档通用任务或写代码:输出多的任务先比 Grok 4.7 和 DeepSeek V4-Pro,但 Grok 4.7 的提示一旦达到 200K 就整单加价;需要 Sol 或 Sonnet 5 时,经常处理超过 272K 的长文档就先看 Sonnet 5,因为它在 1M 内不加价。
  • 旗舰:Opus 5.5 的 $4 / $20 不到 Astra 和 Fable 5.1($10 / $50)的一半,可以先用它做质量基线。

标价低不等于做得了你的任务。每个候选模型用同一批 20 到 50 条真实样例跑一遍,记下输入输出 tokens、重试次数和能直接用的结果数量,用"总花费 ÷ 合格结果数"来比,比表头数字更接近生产成本。这些价格随时可能调整,充值前打开对应的官方定价页再看一眼。

常见问题

Claude API 多少钱?

每百万 tokens 输入 / 输出:Haiku 4.5 为 $1 / $5,Sonnet 5 为 $2 / $10,Opus 5.5 为 $4 / $20,Fable 5.1 为 $10 / $50。Batch 打五折,Fable 5.1、Opus 5.5、Sonnet 5 在 1M 上下文内不加价。Sonnet 5 原定涨到 $3 / $15 的计划已经取消,详见 Claude Sonnet 5 取消涨价。

DeepSeek API 高峰和空闲价差多少?

空闲价是高峰价的一半。deepseek-flash 缓存未命中输入空闲 1 元、高峰 2 元,输出空闲 4 元、高峰 8 元;deepseek-v4-pro 分别是 4.5 元 / 9 元和 13.5 元 / 27 元。高峰为北京时间工作日 9:00–12:00 和 14:00–18:00。

GPT-6 Sol 和 Claude Sonnet 5 一样贵吗?

短上下文标价相同,都是 $2 / $10,缓存命中也都是 $0.20。单次输入超过 272K 后,Sol 整单按 $4 / $15 计,Sonnet 5 仍按 $2 / $10,所以长文档请求 Sonnet 5 便宜得多。另外 Claude 4.7 及之后的新分词器,对同样文本计出的 token 比旧版 Claude 多约 30%,和 OpenAI 相比差多少要用自己的文本实测。

为什么不同价格网站上的数字对不上?

常见原因有:列的是旧一代模型;混入了中转平台的售价;把 DeepSeek 的空闲价和高峰价、Gemini 的限时价和正式价、长上下文价和短上下文价混在一起;或者做过汇率换算。对照时先确认模型 ID、币种和计费条件是否一致。

Kimi、智谱 GLM 的 API 价格在哪看?

上面的表格没有收录它们。Kimi、智谱 GLM、MiniMax 等国内模型的价格,请以各自开放平台定价页当日显示为准,并同样留意是否分时段、分阶梯或另计缓存。

Gemini API vs OpenAI vs Claude 开发者对比指南
模型对比

Gemini API vs OpenAI vs Claude:开发者决策完整指南(2026年2月)

2026年2月三大主流 AI API 深度对比。涵盖 GPT-5、Gemini 2.5 Pro 和 Claude Opus 4.6 的官方验证定价,从独立开发者到企业团队的真实成本计算,SWE-bench 和 AIME 基准测试分析,并排代码示例,以及帮助你为项目选择最佳 API 的实用决策框架。

22 分钟
Claude Sonnet 5 取消涨价后的标准 API 价格与预算核算说明
API 价格与套餐

Claude Sonnet 5 取消涨价:现行 API 价格与预算重算

Claude Sonnet 5 的 9 月涨价计划已取消,标准 API 输入、输出仍为每百万 token 2 美元和 10 美元。本文列出缓存与 Batch 价格,说明如何下调旧预算,并用 API 用量字段核对实际费用。

10 分钟