跳转到主要内容

Claude Sonnet 5 取消涨价:现行 API 价格与预算重算

10 分钟阅读AI API 定价

Claude Sonnet 5 的 9 月涨价计划已取消,标准 API 输入、输出仍为每百万 token 2 美元和 10 美元。本文列出缓存与 Batch 价格,说明如何下调旧预算,并用 API 用量字段核对实际费用。

Claude Sonnet 5 取消涨价后的标准 API 价格与预算核算说明

Claude Sonnet 5 取消的是原定于 2026 年 9 月 1 日实施的 API 涨价。 Anthropic 在 8 月 10 日的更新中将上线费率改为标准费率:输入每百万 token 2 美元、输出每百万 token 10 美元,原计划的 3 美元和 15 美元不再适用。若你的预算一直沿用上线价,这次调整不会再把单价降低一次。官方变更记录

截至 2026 年 9 月 6 日,下面的价格适用于 Anthropic 标准 Claude API,单位均为美元。token(词元)是模型计量文本等输入的单位,不能直接按汉字数计算;Claude Pro、Max 的订阅月费也不在这套价格中。

现在该用哪张价目表

Sonnet 5 的输入并非全部按 2 美元计费。普通输入、缓存写入和缓存读取各有单价,输出另计。以下为官方模型价格表中的标准费率。

计费项目每百万 token 价格核算时如何使用
未缓存输入2 美元按普通输入数量计算
写入 5 分钟缓存2.50 美元按本次写入该时长缓存的数量计算
写入 1 小时缓存4 美元与 5 分钟写入分别计算
读取缓存0.20 美元只计实际命中的缓存输入
输出10 美元按输出数量计算

如果任务适合异步处理,Batch API 的基础输入、输出价格分别为每百万 token 1 美元和 5 美元,比标准输入、输出价格低 50%。这不能直接解释为整张账单减半:工具调用等其他收费项目需分别核对,也不能把标准请求的用量套进 Batch 价格。Batch 官方价格

官方价格文档还说明,Claude 4.6 及之后的模型使用百万 token 上下文时按标准每 token 费率计费。对 Sonnet 5 而言,更长的上下文会增加实际输入数量,但不应再套用旧模型的长上下文加价规则。上下文与模型计费说明

按旧涨价方案做的预算,下调多少才对

先看预算使用的基准。原计划是从 2/10 美元涨到 3/15 美元,涨幅为 50%;取消后从旧预算的 3/15 回到 2/10,则是比旧预算低三分之一,约 33.3%。分母不同,不能说“取消 50% 涨价,所以预算便宜 50%”。上线公告目前也已将 2/10 美元列为长期标准定价。Sonnet 5 官方公告

举一个假设的月度预算:使用同一 Sonnet 5 模型,产生 1,200 万个未缓存输入 token、200 万个输出 token,不使用 Batch,不含工具费用及税费。

预算口径输入费用输出费用合计
原定 9 月涨价后的费率12 × 3 = 36 美元2 × 15 = 30 美元66 美元
当前标准费率12 × 2 = 24 美元2 × 10 = 20 美元44 美元

这个预算可减少 22 美元,即 22 ÷ 66 ≈ 33.3%。如果你原本就预算了 44 美元,则无需因为取消涨价再扣除三分之一。

只有在计费 token 数量和基础输入、输出项目保持一致时,才可以直接将旧预算乘以 2/3。预算中包含缓存、工具费用、地区附加费或其他服务费用时,应按对应单价逐项重算,不能把总额整体打折。

用 usage 核算费用,先分清缓存字段

实际请求返回的 usage 比按文本长度猜 token 数更适合对账,但需要正确拆分。根据缓存用量字段说明input_tokens 是未缓存输入;缓存读取和创建数量另有字段,并未包含在其中。

响应字段代表的用量对应标准单价,美元/百万 token
input_tokens未缓存输入2
cache_read_input_tokens缓存读取输入0.20
cache_creation.ephemeral_5m_input_tokens5 分钟缓存写入2.50
cache_creation.ephemeral_1h_input_tokens1 小时缓存写入4
output_tokens输出10

cache_creation_input_tokens 是缓存创建总数。5 分钟和 1 小时的创建明细已经属于这个总数,不能把总数和明细再加一遍。如果日志只留下创建总数,而请求混用了两种有效期,就无法准确算出缓存写入费用;需要补查有效期明细。

按标准请求计算时,可以使用下面的公式。五类数量都使用原始 token 数,最后统一除以 1,000,000:

text
基础 token 费用(美元)= (未缓存输入 × 2 + 5 分钟缓存写入 × 2.5 + 1 小时缓存写入 × 4 + 缓存读取 × 0.2 + 输出 × 10) ÷ 1,000,000

例如,假设某一统计周期的未缓存输入为 800 万、5 分钟缓存写入为 300 万、1 小时缓存写入为 100 万、缓存读取为 2,000 万、输出为 200 万。这些是假设用量,不是实际账单。

对应费用为 8 × 2 + 3 × 2.5 + 1 × 4 + 20 × 0.2 + 2 × 10 = 51.50 美元。其中 400 万个缓存创建 token 已分别按两种有效期计价,无需再收费一次。该例未使用 Batch,结果仅覆盖上述标准 token 费用,不含地区附加费、工具费用及税费。

按 API 用量字段拆分 Sonnet 5 输入、缓存和输出费用的计算示例

单价没涨,为什么迁移后费用仍可能变高

从 Sonnet 4.6 迁移到 Sonnet 5 时,不能只比较 3/15 和 2/10 美元。Sonnet 5 使用新的分词器(tokenizer);官方说明,同样的文本可能产生约 30% 更多的 token,但变化取决于内容,不能认定所有中文、代码或长文档都增加 30%。默认启用的自适应思考及推理强度设置也可能影响消耗。Sonnet 5 变化说明

如果仅为估算,假设输入和输出 token 都恰好增加 30%,且只比较未缓存输入、输出费用,那么新费用约为旧费用的 1.3 × 2/3 ≈ 86.7%,也就是约低 13.3%。这只是给定假设下的计算,不能用来承诺真实业务的节省比例:输出长度、思考设置和缓存命中都可能变化。

对准备迁移的应用,可用目标模型的 count_tokens 检查具有代表性的输入,并带上实际使用的系统指令、工具定义、图片或 PDF。它估算输入 token,不预测未来输出,也不直接给出最终账单。token 计数接口说明

对已经运行的应用,直接使用目标模型返回的实际 usage不要再给这些数量乘以 1.3:新的分词方式已经反映在返回的 token 数量中,再乘一次会重复放大费用。

迁移到 Sonnet 5 时的分词变化、用量核对和预算更新说明

对账时依次核对这几项

如果你想确认 9 月费用是否正确,先在 Claude Console 的 Usage 和 Cost 中选定同一时间范围、模型和组织,再与应用日志核对。官方用量与费用工具支持历史核查,普通对账可以从控制台开始,无需为此新建管理密钥。官方用量与费用说明

  1. 确认账单由谁出具。 本文的 2/10 美元是 Anthropic 标准 API 费率。Bedrock、Google 云端服务或其他供应商的账单,需要按对应服务和合同核对;云平台的区域或多区域端点可能存在 10% 溢价,不能把所有渠道都视为同价。云平台定价说明
  2. 把数量变化与单价变化分开。 在同一模型、同一请求类型下比较未缓存输入、输出、缓存创建和读取。如果总费用上升,先判断是否是用量增加或缓存命中减少;有需要可继续看Claude Code 缓存未命中的费用排查
  3. 核对是否混入其他收费项目。 标准 API、Batch、工具调用及地区附加费应分别计算。只有同一计费口径下的费用,才适合与旧预算比较。
  4. 区分 Claude Code 的显示金额和 API 账单。 Claude Code 的 /usage 会话美元金额属于本地估算,Pro、Max 包含的使用量与 API 计费分开。API 费用应以 Console 为准;若不清楚当前使用哪种付款方式,可先看Claude Code API Key 与订阅计费的区别Claude Code 费用说明

更新预算表时,将原定的 3/15 美元替换为当前 2/10 美元,再填入对应模型的实际用量与缓存分类。这样才能判断差额究竟来自取消涨价,还是来自业务调用量和调用方式的变化。

#Claude Sonnet 5#Claude API#API 价格#提示词缓存#成本预算
分享文章: