# AI API 价格对比：国内外大模型谁最便宜、月费怎么算

> 美元标价最低的是 GPT-6 Luna，人民币里 qwen3.8-flash 低于 DeepSeek Flash；输出占比、峰谷时段、长上下文和 Gemini 年底调价会改写排名。

- URL: https://blog.laozhang.ai/zh/posts/cheapest-llm-models
- Published: 2026-07-02
- Updated: 2026-09-26
- Author: LaoZhang AI Team (https://blog.laozhang.ai/zh/about)
- Category: AI API 定价
- Tags: API 价格对比, OpenAI API, Claude API, Gemini API, DeepSeek API, 通义千问

---
截至 2026 年 9 月 26 日，只看官方标价，美元计费里最便宜的是 OpenAI `gpt-6-luna`：每百万 tokens 输入 $0.10、输出 $0.50；紧随其后的是 DeepSeek Flash 的空闲时段价和 Gemini 3.1 Flash-Lite。人民币计费里，阿里云百炼的通义千问 `qwen3.8-flash`（输入 0.8 元、输出 2.7 元）比 DeepSeek Flash 空闲时段（1 元 / 4 元）还低。中档里 GPT-6 Sol 与 Claude Sonnet 5 同为 $2 / $10，Grok 4.7 输入同价、输出只要 $6。

表头数字只是起点。输出占总量多少、是否在 DeepSeek 的高峰时段调用、单次提示是否超过 200K 或 272K、缓存能命中多少、任务能不能等 Batch，以及 Gemini 3.8 Flash 在 2027 年 1 月 1 日的调价，都会让排名换位。算月费时用"输入百万 tokens × 输入单价 + 输出百万 tokens × 输出单价"逐个套，再把这些条件叠上去。

## 美元官方价：轻量、中档、旗舰分层对照

下表是各家官方定价页的标准按量价，单位为每百万 tokens，短上下文，不含 Batch。DeepSeek 分空闲与高峰两档，表中写成"空闲 / 高峰"。

| 档位 | 模型 | 输入 | 缓存命中输入 | 输出 | 会改变实际单价的条件 |
|---|---|---|---|---|---|
| 轻量 | OpenAI `gpt-6-luna` | $0.10 | $0.01 | $0.50 | 单次输入超过 272K 时整单改按 $0.20 / $0.75；Batch 与 Flex 半价 |
| 轻量 | DeepSeek `deepseek-flash` | $0.15 / $0.30 | $0.003 / $0.006 | $0.60 / $1.20 | 高峰为北京时间工作日 9:00–12:00、14:00–18:00，价格是空闲的两倍 |
| 轻量 | Gemini `gemini-3.1-flash-lite` | $0.25（音频 $0.50） | $0.025 | $1.50 | Batch 半价；有免费层 |
| 轻量 | Gemini `gemini-3.5-flash-lite` | $0.30 | 未列出 | $2.50 | Batch 半价 |
| 轻量 | Gemini `gemini-3.8-flash` | $0.75 | $0.075 | $3.75 | 限时价到 2026 年 12 月 31 日，2027 年 1 月 1 日起 $1.50 / $7.50；缓存另收存储费；输出含思考 token |
| 中档 | DeepSeek `deepseek-v4-pro` | $0.66 / $1.32 | $0.022 / $0.044 | $1.98 / $3.96 | 与 Flash 同一套峰谷时段 |
| 中档 | Claude Haiku 4.5 | $1 | $0.10 | $5 | Batch $0.50 / $2.50 |
| 中档 | xAI `grok-4.7` | $2 | $0.50 | $6 | 提示达到 200K 时整单 $4 / $12（缓存 $1）；上下文 500K；不支持 Batch |
| 中档 | OpenAI `gpt-6-sol` | $2 | $0.20 | $10 | 输入超过 272K 整单 $4 / $15 |
| 中档 | Claude Sonnet 5 | $2 | $0.20 | $10 | 1M 上下文内不加价；新分词器同样文本 token 更多 |
| 中档 | Gemini `gemini-3.1-pro-preview` | $2 | 未列出 | $12 | 提示超过 200K 时 $4 / $18；仍是预览版 |
| 旗舰 | Claude Opus 5.5 | $4 | $0.20 | $20 | Fast mode $8 / $40 |
| 旗舰 | OpenAI `gpt-6-astra` | $10 | $1 | $50 | 输入超过 272K 整单 $20 / $75 |
| 旗舰 | Claude Fable 5.1 | $10 | $0.25 | $50 | 缓存命中只收输入价的 2.5% |

来源：[OpenAI API 定价](https://developers.openai.com/api/docs/pricing)、[Claude 定价](https://platform.claude.com/docs/en/about-claude/pricing)、[Gemini API 定价](https://ai.google.dev/gemini-api/docs/pricing)（Developer API，不是 Vertex AI）、[xAI 定价](https://docs.x.ai/developers/pricing)、[DeepSeek 模型与价格](https://api-docs.deepseek.com/zh-cn/quick_start/pricing)。

几处容易看漏的地方：

- OpenAI 的 Batch 与 Flex 都是标准价的一半，比如 Sol 为 $1 / $5；Batch 是异步提交，Flex 用更慢、可能排不上队换价格。反过来，Fast mode（2026 年 7 月 30 日由 Priority 改名）是标准价的两倍。
- Anthropic、Google 的 Batch 同样打五折：Sonnet 5 为 $1 / $5，Gemini 3.1 Flash-Lite 为 $0.125 / $0.75。
- OpenAI 的数据驻留（区域处理）端点，对 2026 年 3 月 5 日及以后发布的可用模型加收 10%；xAI 的美国区域端点同样按 1.1 倍计费，Priority 处理按标准价的 2 倍计。
- DeepSeek 旧模型名 `deepseek-v4-flash` 仍能调用，但已由 DeepSeek-V4.1-Flash 提供服务，按 Flash 价计费；旧价 $0.14 / $0.28 不再适用。

单个模型的更多细节：[GPT-6 Astra API 定价与成本计算](https://blog.laozhang.ai/zh/posts/gpt-6-astra-api-pricing)、[GPT-6 Sol、Luna、Astra 与 Terra 怎么选](https://blog.laozhang.ai/zh/posts/gpt-6-sol-vs-terra-vs-luna-vs-astra)、[Claude Sonnet 5 现行 API 价格与预算重算](https://blog.laozhang.ai/zh/posts/claude-sonnet-5-pricing)、[Claude Opus 5.5 价格与用量重置](https://blog.laozhang.ai/zh/posts/claude-opus-5-5-pricing-limit-reset)、[Claude Fable 5.1 API 价格](https://blog.laozhang.ai/zh/posts/claude-fable-5-1-api-pricing)。

## 国内模型人民币标价

用人民币充值的读者，直接看 DeepSeek 与阿里云百炼的人民币价目更准确。单位同样是每百万 tokens。

| 模型 | 时段或地域 | 缓存命中输入 | 缓存未命中输入 | 输出 | 免费额度 |
|---|---|---|---|---|---|
| DeepSeek `deepseek-flash` | 空闲时段 | 0.02 元 | 1 元 | 4 元 | 未标注 |
| DeepSeek `deepseek-flash` | 高峰时段 | 0.04 元 | 2 元 | 8 元 | 未标注 |
| DeepSeek `deepseek-v4-pro` | 空闲时段 | 0.15 元 | 4.5 元 | 13.5 元 | 未标注 |
| DeepSeek `deepseek-v4-pro` | 高峰时段 | 0.30 元 | 9 元 | 27 元 | 未标注 |
| 通义千问 `qwen3.8-flash` | 华北2（北京） | 按缓存规则折算 | 0.8 元 | 2.7 元 | 100 万 Token，90 天 |
| 通义千问 `qwen3.8-max` | 华北2（北京） | 按缓存规则折算 | 12 元 | 36 元 | 100 万 Token，90 天 |
| 通义千问 `qwen3.8-max-prime` | 华北2（北京） | — | 24 元 | 72 元 | 无 |

来源：[DeepSeek 模型与价格](https://api-docs.deepseek.com/zh-cn/quick_start/pricing)、[阿里云百炼模型调用计费](https://help.aliyun.com/zh/model-studio/model-pricing)。

DeepSeek 的高峰时段是北京时间周一至周五 9:00–12:00、14:00–18:00，不含法定节假日；其余时间（包括周末和节假日全天）都是空闲时段，价格减半。换句话说，白天上班时间跑的调用按高峰价扣费，夜间和周末跑的批量任务按空闲价扣费。

百炼这一页只展示原价，活动优惠要到控制台看；免费额度只在华北2（北京）地域提供，从开通之日起 90 天有效。`qwen3.8-max` 支持 Batch 调用半价，也支持上下文缓存折扣，但两者不能同时生效。页面对缓存的说明是：命中的输入 token 与创建显式缓存的 token 另按不同单价计，给出的例子是创建按标准输入价的 125%、命中按 10%，具体以百炼的上下文缓存说明为准。

人民币价与上一节的美元价不要自己换成同一币种来排名：汇率、充值方式和发票口径都会影响最后付出的钱，放在一起看时各自按原币种比较。表中的国内模型只有 DeepSeek 和通义千问；Kimi、智谱 GLM、MiniMax、豆包等请以各自开放平台定价页当日显示为准。

## 哪些计费条件会改写排名

### 输出占比

多数模型的输出单价是输入的 3 倍（Grok 4.7、DeepSeek V4-Pro）到 8 倍多（Gemini 3.5 Flash-Lite）。客服问答、检索增强（RAG）这类读得多、写得少的任务，主要看输入价；长文生成、写代码这类写得多的任务，主要看输出价。Grok 4.7 与 GPT-6 Sol 输入同为 $2，但输出 $6 对 $10，任务越偏输出，Grok 越占便宜。

### Gemini 3.8 Flash 的限时价

$0.75 / $3.75 是写明截止日的限时价，2026 年 12 月 31 日之后翻倍为 $1.50 / $7.50，上下文缓存和存储费也一起翻倍。如果你按它做全年预算，2027 年的账单要按新价重算。

### 长上下文加价：272K 与 200K

OpenAI 的规则是：单次请求输入超过 272K tokens，整单输入和缓存价按 2 倍、输出按 1.5 倍计，不是只对超出的部分加价。Grok 4.7 的门槛更低，提示达到 200K 时整单改按 $4 / $12；Gemini 3.1 Pro Preview 在提示超过 200K 时同样切到高价。Claude 4.6 及之后的模型（包括 Fable 5.1、Opus 5.5、Sonnet 5）在 1M 上下文内都按标准价计。

以一次 40 万输入 + 5,000 输出 tokens 的请求为例：

- GPT-6 Sol：0.4 × $4 + 0.005 × $15 = $1.675（误按短上下文价算会得到 $0.85）
- Claude Sonnet 5：0.4 × $2 + 0.005 × $10 = $0.85
- Gemini 3.1 Pro Preview：0.4 × $4 + 0.005 × $18 = $1.69
- Grok 4.7：0.4 × $4 + 0.005 × $12 = $1.66

Sol 和 Sonnet 5 的短上下文标价一模一样，到了这种长文档请求就差出将近一倍。

![一次 40 万输入加 5,000 输出的请求在 GPT-6 Sol、Claude Sonnet 5、Gemini 3.1 Pro Preview 上的长上下文计价与费用](https://blog.laozhang.ai/posts/zh/cheapest-llm-models/img/long-context-400k.webp)

### DeepSeek 的高峰时段

同一个模型，高峰价是空闲价的两倍。能放到夜间或周末跑的离线任务，在 DeepSeek 上天然便宜一半；必须白天实时响应的业务，要按高峰价估算。

### 缓存命中与 Batch

缓存命中价通常是输入价的十分之一（GPT-6 各型号、Sonnet 5、Haiku 4.5、Gemini 3.8 Flash），Opus 5.5 是 5%，Fable 5.1 是 2.5%，DeepSeek Flash 只有 2%；Grok 4.7 则是四分之一（$0.50）。系统提示、工具定义、固定知识库片段越长、复用越多，缓存省得越多；但缓存只降输入，输出一分不减。写入缓存另有价格（例如 Sol $2.50、Sonnet 5 的 5 分钟缓存写入 $2.50），Gemini 还按小时收存储费。

Batch 适合能等的任务，OpenAI、Anthropic、Google 的 Batch 价都是标准价的一半；Grok 4.7 不支持 Batch。百炼的 `qwen3.8-max` 也有 Batch 半价，但不能与缓存折扣叠加。

### 同一段文字，token 数不一样

每百万 tokens 的价格只能在同一种计数方式里直接比较。Anthropic 说明 Claude 4.7 及之后的模型换了新分词器，同样的文本大约多出 30% 的 token，具体因内容而异。所以 Sol 与 Sonnet 5 标价相同，处理同一批中文材料时账单未必相同。要比较真实花费，用自己的文本分别调用一次，看返回的用量字段。

## 按月估算：两种负载下的费用

公式：月费 = 月输入（百万 tokens）× 输入单价 + 月输出（百万 tokens）× 输出单价。

下面两组是按标准价、无缓存、短上下文算出的估算，不是实测账单，也没有计入重试、工具调用费和分词器差异。

- 输入为主：每月 3 亿输入 + 3,000 万输出 tokens，像客服或 RAG 问答。以 Sol 为例：300 × $2 + 30 × $10 = $900。
- 输出为主：每月 2,000 万输入 + 4,000 万输出 tokens，像长文生成或代码生成。以 Sol 为例：20 × $2 + 40 × $10 = $440。

| 模型 | 输入为主 | 输出为主 |
|---|---|---|
| GPT-6 Luna | $45 | $22 |
| DeepSeek Flash（空闲 / 高峰） | $63 / $126 | $27 / $54 |
| Gemini 3.1 Flash-Lite | $120 | $65 |
| Gemini 3.5 Flash-Lite | $165 | $106 |
| DeepSeek V4-Pro（空闲 / 高峰） | $257.40 / $514.80 | $92.40 / $184.80 |
| Gemini 3.8 Flash（2026 年价 / 2027 年价） | $337.50 / $675 | $165 / $330 |
| Claude Haiku 4.5 | $450 | $220 |
| Grok 4.7 | $780 | $280 |
| GPT-6 Sol | $900 | $440 |
| Claude Sonnet 5 | $900 | $440 |
| Gemini 3.1 Pro Preview | $960 | $520 |
| Claude Opus 5.5 | $1,800 | $880 |
| GPT-6 Astra | $4,500 | $2,200 |
| Claude Fable 5.1 | $4,500 | $2,200 |

换一种负载，排名就会动：

- DeepSeek Flash 如果在高峰时段跑，输入为主时（$126）比 Gemini 3.1 Flash-Lite（$120）贵，输出为主时（$54）反而比它（$65）便宜。
- DeepSeek V4-Pro 空闲时段在输入为主时比 Gemini 3.5 Flash-Lite 贵，在输出为主时比它便宜（$92.40 对 $106）。
- Grok 4.7 在输入为主时比 2027 年价的 Gemini 3.8 Flash 贵（$780 对 $675），在输出为主时便宜（$280 对 $330）。
- 不变的是 Luna 两组都最低，Grok 4.7 两组都低于 Sol 和 Sonnet 5。

![输入为主和输出为主两种月负载下三组模型的月费对比，同一组里谁更便宜会随负载换位](https://blog.laozhang.ai/posts/zh/cheapest-llm-models/img/workload-rank-swap.webp)

同样两组用量，按人民币标价算：

| 模型 | 输入为主 | 输出为主 |
|---|---|---|
| 通义千问 qwen3.8-flash | 321 元 | 124 元 |
| DeepSeek Flash（空闲 / 高峰） | 420 元 / 840 元 | 180 元 / 360 元 |
| DeepSeek V4-Pro（空闲 / 高峰） | 1,755 元 / 3,510 元 | 630 元 / 1,260 元 |
| 通义千问 qwen3.8-max | 4,680 元 | 1,680 元 |

例如 qwen3.8-flash 输入为主：300 × 0.8 + 30 × 2.7 = 321 元。

缓存会把输入为主的负载拉低很多。仍以 DeepSeek Flash 空闲时段、输入为主为例，假设 3 亿输入里有 80% 命中缓存：240 × 0.02 + 60 × 1 + 30 × 4 = 184.8 元，不到无缓存时 420 元的一半，其中 120 元是输出，缓存管不到。

两家按任务算成本的完整方法，可以参考 [Claude API 和 OpenAI API 定价怎么比](https://blog.laozhang.ai/zh/posts/claude-api-vs-openai-api-pricing)（其中价格是 5 月的数据，方法仍适用）；DeepSeek 峰谷账单的细算见 [DeepSeek V4 峰谷定价](https://blog.laozhang.ai/zh/posts/deepseek-v4)。

## 免费额度和中转价，不要算进官方价

准备买 API key 时，常见的报价有三种：官方按量价（上面的表）、官方免费额度、第三方中转或聚合平台的售价。三者不是同一份合同。

免费额度方面，Gemini Developer API 的免费层对 3.8 Flash 和 3.1 Flash-Lite 的输入输出都不收费，但免费层提交的内容会被用于改进 Google 的产品，付费层不会。百炼给 `qwen3.8-flash` 和 `qwen3.8-max` 各 100 万 Token、90 天的新开通额度，仅限北京地域。各家免费层的限速和条款，可以看 [免费 AI API 推荐：国内外平台怎么选，额度用完会怎样](https://blog.laozhang.ai/zh/posts/free-ai-api-tiers-compared)。免费额度适合试接口、跑样例，不适合写进生产预算。

中转站、代理平台的报价常常比官方低，或者换算成人民币更好付款，但那是平台自己的价格和服务条款。付款前要确认：调用的模型 ID 是否就是官方那一个、按什么单位计费、失败请求扣不扣钱、能否退款、日志和数据怎么处理、限速多少。比较方法见 [最便宜的 LLM API Provider：按价格、质量、延迟和网关风险比较](https://blog.laozhang.ai/zh/posts/cheapest-llm-api-provider)。在中国大陆申请和付费 Gemini key 的路线，见 [Gemini API Key 购买前先看](https://blog.laozhang.ai/zh/posts/gemini-api-pricing)。

## 先测哪一两个

- 预算最紧、任务是分类、抽取、短答：美元计费先测 GPT-6 Luna 和 DeepSeek Flash（尽量放在空闲时段跑）；人民币计费先测 qwen3.8-flash 和 DeepSeek Flash。
- 想用 Google 生态或需要音视频、图片输入：从 Gemini 3.1 Flash-Lite 开始；想用 3.8 Flash，就按 2027 年的 $1.50 / $7.50 做预算。
- 中档通用任务或写代码：输出多的任务先比 Grok 4.7 和 DeepSeek V4-Pro，但 Grok 4.7 的提示一旦达到 200K 就整单加价；需要 Sol 或 Sonnet 5 时，经常处理超过 272K 的长文档就先看 Sonnet 5，因为它在 1M 内不加价。
- 旗舰：Opus 5.5 的 $4 / $20 不到 Astra 和 Fable 5.1（$10 / $50）的一半，可以先用它做质量基线。

标价低不等于做得了你的任务。每个候选模型用同一批 20 到 50 条真实样例跑一遍，记下输入输出 tokens、重试次数和能直接用的结果数量，用"总花费 ÷ 合格结果数"来比，比表头数字更接近生产成本。这些价格随时可能调整，充值前打开对应的官方定价页再看一眼。

## 常见问题

### Claude API 多少钱？

每百万 tokens 输入 / 输出：Haiku 4.5 为 $1 / $5，Sonnet 5 为 $2 / $10，Opus 5.5 为 $4 / $20，Fable 5.1 为 $10 / $50。Batch 打五折，Fable 5.1、Opus 5.5、Sonnet 5 在 1M 上下文内不加价。Sonnet 5 原定涨到 $3 / $15 的计划已经取消，详见 [Claude Sonnet 5 取消涨价](https://blog.laozhang.ai/zh/posts/claude-sonnet-5-pricing)。

### DeepSeek API 高峰和空闲价差多少？

空闲价是高峰价的一半。`deepseek-flash` 缓存未命中输入空闲 1 元、高峰 2 元，输出空闲 4 元、高峰 8 元；`deepseek-v4-pro` 分别是 4.5 元 / 9 元和 13.5 元 / 27 元。高峰为北京时间工作日 9:00–12:00 和 14:00–18:00。

### GPT-6 Sol 和 Claude Sonnet 5 一样贵吗？

短上下文标价相同，都是 $2 / $10，缓存命中也都是 $0.20。单次输入超过 272K 后，Sol 整单按 $4 / $15 计，Sonnet 5 仍按 $2 / $10，所以长文档请求 Sonnet 5 便宜得多。另外 Claude 4.7 及之后的新分词器，对同样文本计出的 token 比旧版 Claude 多约 30%，和 OpenAI 相比差多少要用自己的文本实测。

### 为什么不同价格网站上的数字对不上？

常见原因有：列的是旧一代模型；混入了中转平台的售价；把 DeepSeek 的空闲价和高峰价、Gemini 的限时价和正式价、长上下文价和短上下文价混在一起；或者做过汇率换算。对照时先确认模型 ID、币种和计费条件是否一致。

### Kimi、智谱 GLM 的 API 价格在哪看？

上面的表格没有收录它们。Kimi、智谱 GLM、MiniMax 等国内模型的价格，请以各自开放平台定价页当日显示为准，并同样留意是否分时段、分阶梯或另计缓存。
