AI API 价格对比:国内外大模型谁最便宜、月费怎么算
美元标价最低的是 GPT-6 Luna,人民币里 qwen3.8-flash 低于 DeepSeek Flash;输出占比、峰谷时段、长上下文和 Gemini 年底调价会改写排名。
文章目录

截至 2026 年 9 月 26 日,只看官方标价,美元计费里最便宜的是 OpenAI gpt-6-luna:每百万 tokens 输入 $0.10、输出 $0.50;紧随其后的是 DeepSeek Flash 的空闲时段价和 Gemini 3.1 Flash-Lite。人民币计费里,阿里云百炼的通义千问 qwen3.8-flash(输入 0.8 元、输出 2.7 元)比 DeepSeek Flash 空闲时段(1 元 / 4 元)还低。中档里 GPT-6 Sol 与 Claude Sonnet 5 同为 $2 / $10,Grok 4.7 输入同价、输出只要 $6。
表头数字只是起点。输出占总量多少、是否在 DeepSeek 的高峰时段调用、单次提示是否超过 200K 或 272K、缓存能命中多少、任务能不能等 Batch,以及 Gemini 3.8 Flash 在 2027 年 1 月 1 日的调价,都会让排名换位。算月费时用"输入百万 tokens × 输入单价 + 输出百万 tokens × 输出单价"逐个套,再把这些条件叠上去。
美元官方价:轻量、中档、旗舰分层对照
下表是各家官方定价页的标准按量价,单位为每百万 tokens,短上下文,不含 Batch。DeepSeek 分空闲与高峰两档,表中写成"空闲 / 高峰"。
| 档位 | 模型 | 输入 | 缓存命中输入 | 输出 | 会改变实际单价的条件 |
|---|---|---|---|---|---|
| 轻量 | OpenAI gpt-6-luna | $0.10 | $0.01 | $0.50 | 单次输入超过 272K 时整单改按 $0.20 / $0.75;Batch 与 Flex 半价 |
| 轻量 | DeepSeek deepseek-flash | $0.15 / $0.30 | $0.003 / $0.006 | $0.60 / $1.20 | 高峰为北京时间工作日 9:00–12:00、14:00–18:00,价格是空闲的两倍 |
| 轻量 | Gemini gemini-3.1-flash-lite | $0.25(音频 $0.50) | $0.025 | $1.50 | Batch 半价;有免费层 |
| 轻量 | Gemini gemini-3.5-flash-lite | $0.30 | 未列出 | $2.50 | Batch 半价 |
| 轻量 | Gemini gemini-3.8-flash | $0.75 | $0.075 | $3.75 | 限时价到 2026 年 12 月 31 日,2027 年 1 月 1 日起 $1.50 / $7.50;缓存另收存储费;输出含思考 token |
| 中档 | DeepSeek deepseek-v4-pro | $0.66 / $1.32 | $0.022 / $0.044 | $1.98 / $3.96 | 与 Flash 同一套峰谷时段 |
| 中档 | Claude Haiku 4.5 | $1 | $0.10 | $5 | Batch $0.50 / $2.50 |
| 中档 | xAI grok-4.7 | $2 | $0.50 | $6 | 提示达到 200K 时整单 $4 / $12(缓存 $1);上下文 500K;不支持 Batch |
| 中档 | OpenAI gpt-6-sol | $2 | $0.20 | $10 | 输入超过 272K 整单 $4 / $15 |
| 中档 | Claude Sonnet 5 | $2 | $0.20 | $10 | 1M 上下文内不加价;新分词器同样文本 token 更多 |
| 中档 | Gemini gemini-3.1-pro-preview | $2 | 未列出 | $12 | 提示超过 200K 时 $4 / $18;仍是预览版 |
| 旗舰 | Claude Opus 5.5 | $4 | $0.20 | $20 | Fast mode $8 / $40 |
| 旗舰 | OpenAI gpt-6-astra | $10 | $1 | $50 | 输入超过 272K 整单 $20 / $75 |
| 旗舰 | Claude Fable 5.1 | $10 | $0.25 | $50 | 缓存命中只收输入价的 2.5% |
来源:OpenAI API 定价、Claude 定价、Gemini API 定价(Developer API,不是 Vertex AI)、xAI 定价、DeepSeek 模型与价格。
几处容易看漏的地方:
- OpenAI 的 Batch 与 Flex 都是标准价的一半,比如 Sol 为 $1 / $5;Batch 是异步提交,Flex 用更慢、可能排不上队换价格。反过来,Fast mode(2026 年 7 月 30 日由 Priority 改名)是标准价的两倍。
- Anthropic、Google 的 Batch 同样打五折:Sonnet 5 为 $1 / $5,Gemini 3.1 Flash-Lite 为 $0.125 / $0.75。
- OpenAI 的数据驻留(区域处理)端点,对 2026 年 3 月 5 日及以后发布的可用模型加收 10%;xAI 的美国区域端点同样按 1.1 倍计费,Priority 处理按标准价的 2 倍计。
- DeepSeek 旧模型名
deepseek-v4-flash仍能调用,但已由 DeepSeek-V4.1-Flash 提供服务,按 Flash 价计费;旧价 $0.14 / $0.28 不再适用。
单个模型的更多细节:GPT-6 Astra API 定价与成本计算、GPT-6 Sol、Luna、Astra 与 Terra 怎么选、Claude Sonnet 5 现行 API 价格与预算重算、Claude Opus 5.5 价格与用量重置、Claude Fable 5.1 API 价格。
国内模型人民币标价
用人民币充值的读者,直接看 DeepSeek 与阿里云百炼的人民币价目更准确。单位同样是每百万 tokens。
| 模型 | 时段或地域 | 缓存命中输入 | 缓存未命中输入 | 输出 | 免费额度 |
|---|---|---|---|---|---|
DeepSeek deepseek-flash | 空闲时段 | 0.02 元 | 1 元 | 4 元 | 未标注 |
DeepSeek deepseek-flash | 高峰时段 | 0.04 元 | 2 元 | 8 元 | 未标注 |
DeepSeek deepseek-v4-pro | 空闲时段 | 0.15 元 | 4.5 元 | 13.5 元 | 未标注 |
DeepSeek deepseek-v4-pro | 高峰时段 | 0.30 元 | 9 元 | 27 元 | 未标注 |
通义千问 qwen3.8-flash | 华北2(北京) | 按缓存规则折算 | 0.8 元 | 2.7 元 | 100 万 Token,90 天 |
通义千问 qwen3.8-max | 华北2(北京) | 按缓存规则折算 | 12 元 | 36 元 | 100 万 Token,90 天 |
通义千问 qwen3.8-max-prime | 华北2(北京) | — | 24 元 | 72 元 | 无 |
来源:DeepSeek 模型与价格、阿里云百炼模型调用计费。
DeepSeek 的高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00,不含法定节假日;其余时间(包括周末和节假日全天)都是空闲时段,价格减半。换句话说,白天上班时间跑的调用按高峰价扣费,夜间和周末跑的批量任务按空闲价扣费。
百炼这一页只展示原价,活动优惠要到控制台看;免费额度只在华北2(北京)地域提供,从开通之日起 90 天有效。qwen3.8-max 支持 Batch 调用半价,也支持上下文缓存折扣,但两者不能同时生效。页面对缓存的说明是:命中的输入 token 与创建显式缓存的 token 另按不同单价计,给出的例子是创建按标准输入价的 125%、命中按 10%,具体以百炼的上下文缓存说明为准。
人民币价与上一节的美元价不要自己换成同一币种来排名:汇率、充值方式和发票口径都会影响最后付出的钱,放在一起看时各自按原币种比较。表中的国内模型只有 DeepSeek 和通义千问;Kimi、智谱 GLM、MiniMax、豆包等请以各自开放平台定价页当日显示为准。
哪些计费条件会改写排名
输出占比
多数模型的输出单价是输入的 3 倍(Grok 4.7、DeepSeek V4-Pro)到 8 倍多(Gemini 3.5 Flash-Lite)。客服问答、检索增强(RAG)这类读得多、写得少的任务,主要看输入价;长文生成、写代码这类写得多的任务,主要看输出价。Grok 4.7 与 GPT-6 Sol 输入同为 $2,但输出 $6 对 $10,任务越偏输出,Grok 越占便宜。
Gemini 3.8 Flash 的限时价
$0.75 / $3.75 是写明截止日的限时价,2026 年 12 月 31 日之后翻倍为 $1.50 / $7.50,上下文缓存和存储费也一起翻倍。如果你按它做全年预算,2027 年的账单要按新价重算。
长上下文加价:272K 与 200K
OpenAI 的规则是:单次请求输入超过 272K tokens,整单输入和缓存价按 2 倍、输出按 1.5 倍计,不是只对超出的部分加价。Grok 4.7 的门槛更低,提示达到 200K 时整单改按 $4 / $12;Gemini 3.1 Pro Preview 在提示超过 200K 时同样切到高价。Claude 4.6 及之后的模型(包括 Fable 5.1、Opus 5.5、Sonnet 5)在 1M 上下文内都按标准价计。
以一次 40 万输入 + 5,000 输出 tokens 的请求为例:
- GPT-6 Sol:0.4 × $4 + 0.005 × $15 = $1.675(误按短上下文价算会得到 $0.85)
- Claude Sonnet 5:0.4 × $2 + 0.005 × $10 = $0.85
- Gemini 3.1 Pro Preview:0.4 × $4 + 0.005 × $18 = $1.69
- Grok 4.7:0.4 × $4 + 0.005 × $12 = $1.66
Sol 和 Sonnet 5 的短上下文标价一模一样,到了这种长文档请求就差出将近一倍。

DeepSeek 的高峰时段
同一个模型,高峰价是空闲价的两倍。能放到夜间或周末跑的离线任务,在 DeepSeek 上天然便宜一半;必须白天实时响应的业务,要按高峰价估算。
缓存命中与 Batch
缓存命中价通常是输入价的十分之一(GPT-6 各型号、Sonnet 5、Haiku 4.5、Gemini 3.8 Flash),Opus 5.5 是 5%,Fable 5.1 是 2.5%,DeepSeek Flash 只有 2%;Grok 4.7 则是四分之一($0.50)。系统提示、工具定义、固定知识库片段越长、复用越多,缓存省得越多;但缓存只降输入,输出一分不减。写入缓存另有价格(例如 Sol $2.50、Sonnet 5 的 5 分钟缓存写入 $2.50),Gemini 还按小时收存储费。
Batch 适合能等的任务,OpenAI、Anthropic、Google 的 Batch 价都是标准价的一半;Grok 4.7 不支持 Batch。百炼的 qwen3.8-max 也有 Batch 半价,但不能与缓存折扣叠加。
同一段文字,token 数不一样
每百万 tokens 的价格只能在同一种计数方式里直接比较。Anthropic 说明 Claude 4.7 及之后的模型换了新分词器,同样的文本大约多出 30% 的 token,具体因内容而异。所以 Sol 与 Sonnet 5 标价相同,处理同一批中文材料时账单未必相同。要比较真实花费,用自己的文本分别调用一次,看返回的用量字段。
按月估算:两种负载下的费用
公式:月费 = 月输入(百万 tokens)× 输入单价 + 月输出(百万 tokens)× 输出单价。
下面两组是按标准价、无缓存、短上下文算出的估算,不是实测账单,也没有计入重试、工具调用费和分词器差异。
- 输入为主:每月 3 亿输入 + 3,000 万输出 tokens,像客服或 RAG 问答。以 Sol 为例:300 × $2 + 30 × $10 = $900。
- 输出为主:每月 2,000 万输入 + 4,000 万输出 tokens,像长文生成或代码生成。以 Sol 为例:20 × $2 + 40 × $10 = $440。
| 模型 | 输入为主 | 输出为主 |
|---|---|---|
| GPT-6 Luna | $45 | $22 |
| DeepSeek Flash(空闲 / 高峰) | $63 / $126 | $27 / $54 |
| Gemini 3.1 Flash-Lite | $120 | $65 |
| Gemini 3.5 Flash-Lite | $165 | $106 |
| DeepSeek V4-Pro(空闲 / 高峰) | $257.40 / $514.80 | $92.40 / $184.80 |
| Gemini 3.8 Flash(2026 年价 / 2027 年价) | $337.50 / $675 | $165 / $330 |
| Claude Haiku 4.5 | $450 | $220 |
| Grok 4.7 | $780 | $280 |
| GPT-6 Sol | $900 | $440 |
| Claude Sonnet 5 | $900 | $440 |
| Gemini 3.1 Pro Preview | $960 | $520 |
| Claude Opus 5.5 | $1,800 | $880 |
| GPT-6 Astra | $4,500 | $2,200 |
| Claude Fable 5.1 | $4,500 | $2,200 |
换一种负载,排名就会动:
- DeepSeek Flash 如果在高峰时段跑,输入为主时($126)比 Gemini 3.1 Flash-Lite($120)贵,输出为主时($54)反而比它($65)便宜。
- DeepSeek V4-Pro 空闲时段在输入为主时比 Gemini 3.5 Flash-Lite 贵,在输出为主时比它便宜($92.40 对 $106)。
- Grok 4.7 在输入为主时比 2027 年价的 Gemini 3.8 Flash 贵($780 对 $675),在输出为主时便宜($280 对 $330)。
- 不变的是 Luna 两组都最低,Grok 4.7 两组都低于 Sol 和 Sonnet 5。

同样两组用量,按人民币标价算:
| 模型 | 输入为主 | 输出为主 |
|---|---|---|
| 通义千问 qwen3.8-flash | 321 元 | 124 元 |
| DeepSeek Flash(空闲 / 高峰) | 420 元 / 840 元 | 180 元 / 360 元 |
| DeepSeek V4-Pro(空闲 / 高峰) | 1,755 元 / 3,510 元 | 630 元 / 1,260 元 |
| 通义千问 qwen3.8-max | 4,680 元 | 1,680 元 |
例如 qwen3.8-flash 输入为主:300 × 0.8 + 30 × 2.7 = 321 元。
缓存会把输入为主的负载拉低很多。仍以 DeepSeek Flash 空闲时段、输入为主为例,假设 3 亿输入里有 80% 命中缓存:240 × 0.02 + 60 × 1 + 30 × 4 = 184.8 元,不到无缓存时 420 元的一半,其中 120 元是输出,缓存管不到。
两家按任务算成本的完整方法,可以参考 Claude API 和 OpenAI API 定价怎么比(其中价格是 5 月的数据,方法仍适用);DeepSeek 峰谷账单的细算见 DeepSeek V4 峰谷定价。
免费额度和中转价,不要算进官方价
准备买 API key 时,常见的报价有三种:官方按量价(上面的表)、官方免费额度、第三方中转或聚合平台的售价。三者不是同一份合同。
免费额度方面,Gemini Developer API 的免费层对 3.8 Flash 和 3.1 Flash-Lite 的输入输出都不收费,但免费层提交的内容会被用于改进 Google 的产品,付费层不会。百炼给 qwen3.8-flash 和 qwen3.8-max 各 100 万 Token、90 天的新开通额度,仅限北京地域。各家免费层的限速和条款,可以看 免费 AI API 推荐:国内外平台怎么选,额度用完会怎样。免费额度适合试接口、跑样例,不适合写进生产预算。
中转站、代理平台的报价常常比官方低,或者换算成人民币更好付款,但那是平台自己的价格和服务条款。付款前要确认:调用的模型 ID 是否就是官方那一个、按什么单位计费、失败请求扣不扣钱、能否退款、日志和数据怎么处理、限速多少。比较方法见 最便宜的 LLM API Provider:按价格、质量、延迟和网关风险比较。在中国大陆申请和付费 Gemini key 的路线,见 Gemini API Key 购买前先看。
先测哪一两个
- 预算最紧、任务是分类、抽取、短答:美元计费先测 GPT-6 Luna 和 DeepSeek Flash(尽量放在空闲时段跑);人民币计费先测 qwen3.8-flash 和 DeepSeek Flash。
- 想用 Google 生态或需要音视频、图片输入:从 Gemini 3.1 Flash-Lite 开始;想用 3.8 Flash,就按 2027 年的 $1.50 / $7.50 做预算。
- 中档通用任务或写代码:输出多的任务先比 Grok 4.7 和 DeepSeek V4-Pro,但 Grok 4.7 的提示一旦达到 200K 就整单加价;需要 Sol 或 Sonnet 5 时,经常处理超过 272K 的长文档就先看 Sonnet 5,因为它在 1M 内不加价。
- 旗舰:Opus 5.5 的 $4 / $20 不到 Astra 和 Fable 5.1($10 / $50)的一半,可以先用它做质量基线。
标价低不等于做得了你的任务。每个候选模型用同一批 20 到 50 条真实样例跑一遍,记下输入输出 tokens、重试次数和能直接用的结果数量,用"总花费 ÷ 合格结果数"来比,比表头数字更接近生产成本。这些价格随时可能调整,充值前打开对应的官方定价页再看一眼。
常见问题
Claude API 多少钱?
每百万 tokens 输入 / 输出:Haiku 4.5 为 $1 / $5,Sonnet 5 为 $2 / $10,Opus 5.5 为 $4 / $20,Fable 5.1 为 $10 / $50。Batch 打五折,Fable 5.1、Opus 5.5、Sonnet 5 在 1M 上下文内不加价。Sonnet 5 原定涨到 $3 / $15 的计划已经取消,详见 Claude Sonnet 5 取消涨价。
DeepSeek API 高峰和空闲价差多少?
空闲价是高峰价的一半。deepseek-flash 缓存未命中输入空闲 1 元、高峰 2 元,输出空闲 4 元、高峰 8 元;deepseek-v4-pro 分别是 4.5 元 / 9 元和 13.5 元 / 27 元。高峰为北京时间工作日 9:00–12:00 和 14:00–18:00。
GPT-6 Sol 和 Claude Sonnet 5 一样贵吗?
短上下文标价相同,都是 $2 / $10,缓存命中也都是 $0.20。单次输入超过 272K 后,Sol 整单按 $4 / $15 计,Sonnet 5 仍按 $2 / $10,所以长文档请求 Sonnet 5 便宜得多。另外 Claude 4.7 及之后的新分词器,对同样文本计出的 token 比旧版 Claude 多约 30%,和 OpenAI 相比差多少要用自己的文本实测。
为什么不同价格网站上的数字对不上?
常见原因有:列的是旧一代模型;混入了中转平台的售价;把 DeepSeek 的空闲价和高峰价、Gemini 的限时价和正式价、长上下文价和短上下文价混在一起;或者做过汇率换算。对照时先确认模型 ID、币种和计费条件是否一致。
Kimi、智谱 GLM 的 API 价格在哪看?
上面的表格没有收录它们。Kimi、智谱 GLM、MiniMax 等国内模型的价格,请以各自开放平台定价页当日显示为准,并同样留意是否分时段、分阶梯或另计缓存。





