Grok API 价格:每百万 token 多少钱、月费怎么算
grok-4.7 每百万 token 输入 $2、输出 $6,grok-4.3 为 $1.25 / $2.50;官方未列免费 API 额度,grok-4.7 不支持批量接口。
文章目录

截至 2026 年 9 月 26 日(xAI 价格页最近更新于 9 月 21 日),Grok API 的旗舰模型是 grok-4.7:每百万 token 输入 $2、缓存输入 $0.50、输出 $6,上下文 500K。想省钱且需要更长上下文,用 grok-4.3:输入 $1.25、缓存输入 $0.20、输出 $2.50,上下文 1M。写代码的智能体任务可以看 grok-build-0.1:输入 $1、输出 $2,上下文 256K。
单价之外,有几条规则会直接改变账单:提示达到 20 万 token 时整次请求改按长上下文价,价格翻倍;批量接口只给 grok-4.3 和 grok-4.20 系列打八折,grok-4.7 根本不支持批量接口;优先处理按两倍计费;美国区域端点按 1.1 倍计费;网页搜索、代码执行等工具按每千次另收费。xAI 官方文档没有列出免费 API 额度,SuperGrok 和 X 的订阅也与 API 分开计费。
各模型现价
下表是 xAI 官方价格页的文本模型行,单位都是美元 / 每百万 token,走全球端点 https://api.x.ai/v1。
| 模型 | 上下文 | 输入 | 缓存输入 | 输出 | 提示 ≥ 200K 时(输入 / 缓存 / 输出) | 批量接口 |
|---|---|---|---|---|---|---|
grok-4.7 | 500K | $2.00 | $0.50 | $6.00 | $4.00 / $1.00 / $12.00 | 不支持 |
grok-4.3 | 1M | $1.25 | $0.20 | $2.50 | $2.50 / $0.40 / $5.00 | 八折 |
grok-build-0.1 | 256K | $1.00 | $0.20 | $2.00 | $2.00 / $0.40 / $4.00 | 无折扣 |
grok-4.6 | 500K | $2.00 | $0.50 | $6.00 | $4.00 / $1.00 / $12.00 | 无折扣 |
grok-4.5 | 500K | $2.00 | $0.30 | $6.00 | $4.00 / $0.60 / $12.00 | 无折扣 |
grok-4.20-0309-reasoning、grok-4.20-0309-non-reasoning、grok-4.20-multi-agent-0309 | 1M | $1.25 | $0.20 | $2.50 | $2.50 / $0.40 / $5.00 | 八折 |
来源:xAI API Pricing、模型页。
怎么选:
- grok-4.7 是 xAI 当前的旗舰,官方定位是写代码、调用工具的智能体任务和通用知识工作,推理强度可选 low、medium、high、xhigh,默认 high。它的输入价和 GPT-6 Sol、Claude Sonnet 5 相同,输出价更低。
- grok-4.3 每一项单价都只有 grok-4.7 的 40% 到 62.5%,上下文却是它的两倍。对质量要求不需要旗舰、或者文档很长的任务,它是预算上最划算的一行。模型 ID、别名和迁移细节见 Grok 4.3 API 指南:模型 ID、价格、迁移与测试计划。
- grok-build-0.1 是 xAI 专门做的编程模型,面向软件工程和工作流类智能体任务,单价在表里最低;上下文只有 256K,超长的仓库上下文放不进去。
- grok-4.6 与 grok-4.7 价格完全相同,还留在 4.6 上不会更省钱。grok-4.5 的缓存输入是 $0.30,比 4.7 低,其余相同。
表里已经没有 Grok 3、Grok 4.1 Fast 这类旧型号,xAI 在 2026 年 5 月 15 日做过一轮模型退役;第三方页面如果还在写它们的价格,不要拿来做预算。另外,价格页列出的 Grok 4.7 Fast(两倍价格、更快的推理基础设施)只在 Cursor 和 Grok Build 里提供,公开 API 调用不到它。
六条改变账单的规则
单价表只回答“每百万 token 多少钱”。实际账单还取决于请求有多长、走哪个端点、要不要等、用了哪些工具。

提示达到 20 万 token:整次请求按长上下文价
xAI 的规则是:一次请求的提示达到 200K token,这次请求的所有 token都按长上下文价计费,包括输出。它不是只对超出部分加价。
用一次 30 万 token 输入、1 万 token 输出的长文档请求算一下:
| 模型 | 算式 | 费用 |
|---|---|---|
| grok-4.7,按长上下文价 | 0.3 × $4 + 0.01 × $12 | $1.32 |
| grok-4.7,误按普通价估算 | 0.3 × $2 + 0.01 × $6 | $0.66 |
| grok-4.3,按长上下文价 | 0.3 × $2.50 + 0.01 × $5 | $0.80 |
| grok-build-0.1 | 上下文只有 256K | 放不下 |
临界点附近的跳变最明显:grok-4.7 的提示从 19.9 万 token 增加到 20 万,单次输入费从约 $0.40(0.199 × $2)变成 $0.80(0.2 × $4)。长文档问答、整仓库代码分析这类任务,先把检索窗口压在 20 万以内,往往比换模型更省钱;确实需要超长上下文时,grok-4.3 的长上下文价(输入 $2.50、输出 $5)远低于 grok-4.7 的($4 / $12),窗口也更大。
批量接口:grok-4.7 不能用,只有 grok-4.3 和 grok-4.20 打八折
批量接口(Batch API)异步处理请求,大多数在 24 小时内完成,不占用每分钟的速率限额。折扣按模型不同:
- grok-4.3 和三款 grok-4.20 模型:八折,输入、输出、缓存、推理 token 都打折。
- grok-4.7:不支持批量接口,模型页的 Batch API 一栏写的是 Not supported。它的请求只能走实时接口。
- grok-4.6、grok-4.5、grok-build-0.1:价格页把它们列为没有批量折扣。
- 图片和视频生成可以走批量接口,但按标准价计费。
常见的“批量五折”说法不适用于 xAI。需要批量省钱的离线任务(隔夜分类、摘要、数据抽取),要用 grok-4.3 或 grok-4.20 系列;grok-4.7 这条路走不通。
优先处理:两倍价格
优先处理(Priority Processing)让请求获得更高的调度优先级、延迟更低,所有 token 按标准价的 2 倍计费;缓存折扣先扣,再乘 2。只有响应里返回 "service_tier": "priority" 时才按优先价收费,如果请求实际按默认档处理,就按标准价收费。它只支持 Chat Completions 和 Responses 接口,不能和批量接口叠加。
美国区域端点:1.1 倍
需要推理在美国境内完成时,可以走 https://us.api.x.ai/v1,所有 token 按全球价的 1.1 倍计费,长上下文价同样乘 1.1。目前只有 grok-4.7 和 grok-4.6 可用。grok-4.7 在这个端点的价格是:提示 20 万 token 以下输入 $2.20、缓存 $0.55、输出 $6.60;达到 20 万以上为 $4.40 / $1.10 / $13.20。没有数据驻留要求的话,用默认的全球端点即可。
服务端工具按次另收
调用 xAI 提供的服务端工具时,token 照常计费,工具调用再单独收费:
| 工具 | 价格 | 注意 |
|---|---|---|
网页搜索 web_search | $5 / 千次调用 | 图片搜索也按网页搜索计 |
X 搜索 x_search | $5 / 千条帖子,$10 / 千个用户资料 | 按返回条目计,父帖和引用帖也算 |
代码执行 code_execution | $5 / 千次调用 | 沙箱里运行 Python |
附件检索 attachment_search | $10 / 千次调用 | 在消息附件里搜索 |
知识库检索 collections_search | $2.50 / 千次调用 | 查询你上传的文档集合 |
| 远程 MCP 工具 | 不收调用费 | 只收 token |
X 搜索最容易被低估:它按返回的帖子条数收费,一次搜索返回 20 条帖子,就是 20 / 1,000 × $5 = $0.10。工具由模型自主决定调用几次,问题越复杂调用越多,所以智能体任务要在代码里限制工具次数。
存储、下载和违规费
- 文件存储 $0.025 / GiB / 天,知识库集合存储 $0.10 / GiB / 天,下载 $0.20 / GiB。长期不删的集合会按天累计。
- 请求被判定违反使用规范时,已经生成的内容照常收费;在 Responses API 里生成前就拦下的,每次收 $0.05 违规费。
月费怎么估:公式和算例
先按下面的公式估算,上线小样本后再用实际日志校正:
月费 ≈ 新输入 token(百万) × 输入价
+ 缓存命中 token(百万) × 缓存输入价
+ 输出 token(百万) × 输出价
+ 工具调用次数 / 1,000 × 工具单价
+ 存储、下载
然后:提示 ≥ 200K 的请求改用长上下文价;
美国端点 × 1.1;优先处理 × 2;批量(仅 grok-4.3 / grok-4.20)× 0.8推理 token 同样计费,而且不会出现在最终回答里。grok-4.7 默认推理强度是 high,推理强度越高,一般消耗的推理 token 越多;估算时要用真实请求返回的 usage 数据,而不是只按最终回答的字数。
算例一:客服对话
假设每月 10 万次对话,每次 1,000 token 新输入、2,000 token 固定的系统提示(每次都命中缓存)、400 token 输出。一个月合计:新输入 1 亿、缓存输入 2 亿、输出 4,000 万 token。
| 方案 | 算式 | 月费 |
|---|---|---|
| grok-4.7 | 100 × $2 + 200 × $0.50 + 40 × $6 | $540 |
| grok-4.3 | 100 × $1.25 + 200 × $0.20 + 40 × $2.50 | $265 |
| grok-4.3 走批量 | $265 × 0.8 | $212 |
| grok-build-0.1 | 100 × $1 + 200 × $0.20 + 40 × $2 | $220 |
| grok-4.7 走美国端点 | $540 × 1.1 | $594 |
| grok-4.7 开优先处理 | $540 × 2 | $1,080 |
算式里的数字单位是百万 token,不含工具和重试。几点结论:
- 缓存的作用很大。如果系统提示没有命中缓存,这 2 亿 token 按 $2 计,grok-4.7 的月费会从 $540 涨到 $840。
- 在 grok-4.7 上,输出占了 $240,接近一半。限制回答长度比压缩输入更有效。
- 实时客服等不了 24 小时,批量那一行只适合工单归类、质检这类可以隔天出结果的任务。

算例二:研究型智能体
假设每月 1,000 个研究任务,每个任务累计 6 万 token 输入、3,000 token 输出、5 次网页搜索(搜索抓回的内容已经算在 6 万输入里,它们按输入 token 计费)。
- grok-4.7:60 × $2 + 3 × $6 = $138 token 费,加 5,000 次搜索 × $5 / 1,000 = $25,合计 $163。
- grok-4.3:60 × $1.25 + 3 × $2.50 = $82.50,加同样的 $25 搜索费,合计 $107.50。
这类任务输入远多于输出,输入单价决定大头;搜索费在 grok-4.3 上已经占到将近四分之一。换成 X 搜索时要按返回条数重新算。
算例三:一次 30 万 token 的长文档
单次费用见上文长上下文一节:grok-4.7 实付 $1.32,是按普通价估算的两倍;grok-4.3 为 $0.80。假设每天 100 次、一个月 3,000 次:grok-4.7 是 $1.32 × 3,000 = $3,960,按普通价误估只有 $1,980;grok-4.3 是 $0.80 × 3,000 = $2,400。
和 ChatGPT、Claude API 比,谁更便宜
用同一组 token 量比较:每月 1 亿 token 输入、2,000 万 token 输出,不考虑缓存。OpenAI 与 Claude 的单价取自两家官方价格页(OpenAI、Claude,截至 2026 年 9 月 26 日,标准处理、短上下文)。
| 模型 | 输入 / 输出(每百万 token) | 月费 |
|---|---|---|
| GPT-6 Luna | $0.10 / $0.50 | $20 |
| grok-build-0.1 | $1 / $2 | $140 |
| grok-4.3 | $1.25 / $2.50 | $175 |
| grok-4.7 | $2 / $6 | $320 |
| GPT-6 Sol | $2 / $10 | $400 |
| Claude Sonnet 5 | $2 / $10 | $400 |
grok-4.7 和 GPT-6 Sol、Claude Sonnet 5 输入价相同,差距全在输出:$6 对 $10。任务越偏输出,Grok 越占便宜;把上例的输出换成 5,000 万 token,grok-4.7 是 $500,Sol 和 Sonnet 5 是 $700。只看价格,GPT-6 Luna 远低于所有 Grok 模型,但它属于低价档,不是同一能力层级的替代品。
这张表只比标价。各家分词方式不同,同一段中文切出来的 token 数并不相等;而且同价不等于同能力,最终要用你的任务样本测质量和实际 token 用量。OpenAI 和 Claude 两家的档位对比见 Claude 与 OpenAI API 价格对比:按任务算谁更省,加上 Gemini、DeepSeek、通义千问的五家总览见 AI API 价格对比:国内外大模型谁最便宜、月费怎么算。
免费额度、订阅和购买方式
免费额度:xAI 的价格页、模型页和速率限制页都没有列出免费 API 额度或赠送 token。速率限制里的 Tier 0 是累计消费 $0 时的默认限额档位,不是免费用量。文档没列出不代表 xAI 从不做活动,但即使某个账户收到过赠送额度,那也只是该账户的状态,不是公开的免费档。想找真正可以免费调用的平台,可以看 免费 AI API 推荐:国内外平台怎么选,额度用完会怎样。
订阅和 API 是两套账:x.ai 上的 Free、SuperGrok、Business、Enterprise 是 Grok 网页版和 App 的套餐,和 API 分开计费;官方没有说订阅包含 API 额度。Grok Build 有自己的免费档,那也是编程工具的套餐,不是 API 额度。网页版出现“使用人数过多”之类的提示属于消费端问题,和 API 余额无关,排查方法见 Grok 显示使用人数过多?先判断状态、入口和付费识别。
官方购买路径:在 xAI 控制台(console.x.ai)创建 API 密钥,给团队预充值后按量扣费;也可以按发票结算。预充值和已支付的发票都计入累计消费,累计消费决定速率限制档位:
| 档位 | 自 2026 年 1 月 1 日起累计 API 消费 | grok-4.7 每分钟 token 上限 |
|---|---|---|
| Tier 0 | $0(默认) | 5,000 万 |
| Tier 1 | $50 | 5,300 万 |
| Tier 2 | $250 | 6,000 万 |
| Tier 3 | $1,000 | 7,400 万 |
| Tier 4 | $5,000 | 1 亿 |
档位达到后不会降级。缓存命中的 token 虽然便宜,仍然计入每分钟 token 上限;超限返回 429。来源:xAI Rate Limits。另外,xAI 写明模型可用范围会因地区和账户限制而不同,你的团队能用哪些模型以控制台模型页显示为准。
中转和第三方平台:OpenRouter 等平台和各类中转服务会挂出自己的 Grok 价格,那是你和该平台之间的合同,价格、可用模型和数据条款都由对方决定,和 xAI 官方价不是一回事。要比较这类网关,看 最便宜的 LLM API Provider:按价格、质量、延迟和网关风险比较。还有一个常见混淆:Groq(groq.com)是另一家做推理加速的公司,和 xAI 的 Grok 没有关系。
上线前怎么控住花费
- 固定模型 ID。成本测试写死
grok-4.7或grok-4.3,不要用会随版本移动的别名;别名换到新模型后,计费价格可能跟着变。 - 逐请求记账。xAI 每个响应的 usage 里都带
cost_in_usd_ticks,是这次请求已扣除缓存折扣、并包含工具调用费的实际扣款,1 美元 = 10,000,000,000 ticks。把它写进日志,按天累计,超过阈值就在代码里停掉,不用等月底账单。 - 限制输出和推理。设置最大输出长度;不需要深度推理的请求把 grok-4.7 的推理强度从默认的 high 调低,减少推理 token。
- 看住 20 万 token 这条线。在发送前统计提示长度,快到 200K 时截断检索内容或改用 grok-4.3。
- 给工具调用设上限。智能体每轮最多调用几次搜索、X 搜索最多返回多少条,都要在代码里定死。
- 先小额预充值跑真实样本。用接近生产的提示、工具和输出格式跑一批,把实际花费和上面的公式对一遍,对得上再放量。
用 OpenAI SDK 读取单次成本的写法:
import os
from openai import OpenAI
client = OpenAI(api_key=os.getenv("XAI_API_KEY"), base_url="https://api.x.ai/v1")
completion = client.chat.completions.create(
model="grok-4.7",
messages=[{"role": "user", "content": "Say hello"}],
)
cost_usd = completion.usage.cost_in_usd_ticks / 1e10流式输出时,OpenAI SDK 要在请求里设 stream_options={"include_usage": True},成本只出现在最后一个分块。来源:xAI Cost Tracking。
常见问题
Grok API 现在多少钱?
截至 2026 年 9 月 26 日,旗舰 grok-4.7 每百万 token 输入 $2、缓存输入 $0.50、输出 $6;grok-4.3 为 $1.25 / $0.20 / $2.50;编程模型 grok-build-0.1 为 $1 / $0.20 / $2。提示达到 20 万 token 时,整次请求按两倍的长上下文价计费。
Grok API 有免费额度吗?
xAI 官方文档没有列出免费 API 额度。速率限制的 Tier 0 只是默认限额,不是免费用量;要调用 API,需要在控制台预充值或按发票付费。
买了 SuperGrok 或 X 会员,能直接用 API 吗?
不能当作 API 额度用。SuperGrok 等订阅是网页版和 App 的套餐,API 在 xAI 控制台单独计费,官方没有说订阅包含 API 额度。
Grok API 比 ChatGPT API 便宜吗?
和同档的 GPT-6 Sol 比,grok-4.7 输入价相同($2),输出更便宜($6 对 $10),输出越多差距越大;grok-4.3 和 grok-build-0.1 更低。OpenAI 的低价档 GPT-6 Luna($0.10 / $0.50)比所有 Grok 模型都便宜,但不是同一能力层级。
Grok API 的批量接口能打几折?
只有 grok-4.3 和 grok-4.20 系列打八折。grok-4.7 不支持批量接口,grok-4.6、grok-4.5 和 grok-build-0.1 没有批量折扣。批量任务一般在 24 小时内完成,适合不需要实时返回的工作。





