截至 2026 年 8 月 10 日,如果你要为一个新的 Claude API 项目选模型,最稳妥的起点通常不是“能力最强”的那一档,而是 Claude Sonnet 5。先用它建立质量、P95 延迟和单个可接受结果成本的基线:轻任务再测试 Haiku 4.5,复杂任务不达标再测试 Opus 5,只有 Opus 仍过不了验收线时才把 Fable 5 加入候选。
Anthropic 当前模型总览列出的四个公开自助型号及精确模型 ID(Model ID)如下。这里的“当前”是日期快照,不代表以后不会变化;AWS、Google Cloud 等合作伙伴平台使用的 ID 也可能不同。
textClaude Fable 5 claude-fable-5 Claude Opus 5 claude-opus-5 Claude Sonnet 5 claude-sonnet-5 Claude Haiku 4.5 claude-haiku-4-5-20251001
Haiku 4.5 另有短别名 claude-haiku-4-5,但配置文件和示例建议优先写完整 ID。还要特别注意:从 Claude 4.6 开始,无日期的 ID 也是固定快照,并不会自动漂移到未来版本;这一规则可在 Anthropic 的模型 ID 与版本说明中核对。
先看一张能直接做决定的对照表
下表中的“能力定位”和“相对时延”来自 Anthropic 的官方描述,不是本站独立跑分,也不是对你的工作负载作出的性能保证。MTok 表示一百万 token;价格是 Anthropic 自营 API 的标准输入价 / 输出价,不含提示缓存、Batch、工具调用、数据驻留、税费或合作伙伴平台加价,当前价格应以官方定价页为准。
| 模型 | 官方定位 | 相对时延 | 上下文窗口 / 最大同步输出 | 标准价格(输入 / 输出,每 MTok) | 先用它验证什么 |
|---|---|---|---|---|---|
| Claude Fable 5 | 广泛发布型号中的最高能力档 | slower | 1M / 128k | $10 / $50 | 最高难度任务的增益,能否覆盖其在相同输入、输出 token 假设下为 Opus 5 两倍的单价和额外边界 |
| Claude Opus 5 | 复杂代理编程与企业级任务 | moderate | 1M / 128k | $5 / $25 | 复杂代理或推理任务的验收通过率,是否显著高于基线 |
| Claude Sonnet 5 | 速度与智能的平衡档 | fast | 1M / 128k | $3 / $15 | 能否成为大多数生产请求的默认基线 |
| Claude Haiku 4.5 | 最快、接近前沿智能 | fastest | 200k / 64k | $1 / $5 | 边界清楚的轻任务,能否在更低成本和更低相对时延下通过验收 |
这里的 slower、moderate、fast、fastest 只是官方相对标签,不能换算成毫秒,更不构成 SLA。上下文窗口也不等于你应该把所有历史记录一次塞满:输入越长,延迟、token 成本和信息干扰通常越值得单独测量。
Sonnet 5 还有一个容易影响预算表的时间条件:按官方定价说明,2026 年 8 月 31 日之前其介绍价为输入 $2 / 输出 $10 每 MTok;2026 年 9 月 1 日起恢复输入 $3 / 输出 $15 的标准价。不要把介绍价当成长期单价写进年度预算。
从 Sonnet 5 起步,按验收结果换档
模型选择真正要回答的是“哪个型号能以可接受的总成本完成我的任务”,而不是“哪个型号在抽象意义上最聪明”。在比较之前,先给同一组真实请求定义至少三个门槛:任务是否通过、P95 延迟是否可接受、单个可接受结果的成本是多少。然后按下面的顺序换档。
Sonnet 5:先建立混合型生产任务的基线
Sonnet 5 适合先覆盖日常代码协助、文档理解、工具调用和多步骤业务流程。这个建议来自它在速度、能力和价格之间的官方定位,不代表它一定在每个任务上胜出。
先用一组脱敏的真实请求跑出基线。如果质量已经达到上线标准,就没有必要仅为了追求更高型号而升档;接下来只需判断是否有一部分结构清楚、失败代价低的请求可以交给 Haiku 4.5。
Haiku 4.5:轻任务通过验收时再降档
中文客服意图分类、批量结构化抽取、高并发短文本处理,可以成为 Haiku 4.5 的首测候选。关键不是任务名称,而是边界是否清楚、输出能否自动校验、失败是否容易回退。
如果 Haiku 在同一评测集上达到质量门槛,同时降低了 P95 延迟或单任务成本,就把这部分流量拆出来;如果人工修复明显增加,即使 token 单价更低,也不一定更省。
Opus 5:Sonnet 基线过不了复杂任务时升档
多文件代理修改、复杂故障推理和长周期企业工作流更值得测试 Opus 5。Anthropic 将其描述为面向深度推理和长周期代理工作的升级,并给出 1M 上下文窗口、128k 最大同步输出和默认开启 thinking;这是Opus 5 官方能力说明中的产品定位,不是本站测出的胜率。
升档的判据应是“同一评测集上的可接受结果明显增加”,而不是输出看起来更长。把额外 token、延迟和失败后的人工修复都计入,才能知道更贵的请求是否真的更划算。
Fable 5:只处理最高难度且失败代价高的少数任务
Fable 5 已广泛可用,适合在 Opus 5 仍不能满足高价值任务时单独测试。Anthropic 同时说明,Mythos 5 只面向获批的 Project Glasswing 客户,因此 Mythos 不属于普通自助 API 的四型号比较范围;Fable 集成还需要处理安全分类器拒绝以及独立的账单和数据保留条件,详见Fable 5 与 Mythos 5 官方介绍。
不要把最高价型号默认铺到全部流量。只有同一评测集证明 Fable 对最高难度样本有足够增益,并且预算、拒绝处理与数据条件都能接受时,才值得灰度加入。

“思考模式”会改变行为,也会改变 token 用量
Fable 5、Opus 5 与 Sonnet 5 使用自适应思考,Haiku 4.5 使用手动扩展思考;Opus 5 和 Sonnet 5 在 Claude API 与 Claude Code 中的 effort 默认值为 high。这些差异可在官方模型总览中核对。
effort 是控制思考力度的请求参数,不应被理解为一个简单的“智力开关”。更高的思考投入可能改变输出行为和 token 用量,迁移时应把它与质量、延迟和成本一起测试。具体请求参数以对应型号的迁移文档为准,不要把旧模型的 thinking 配置原样复制后直接全量上线。
下面只展示模型 ID 在请求中的位置,不绑定某个 SDK 版本,也不包含真实密钥:
json{ "model": "claude-sonnet-5", "max_tokens": 2048, "messages": [ { "role": "user", "content": "请把这段故障日志归纳为原因、证据和下一步。" } ] }
首测时只替换 model,保持评测输入、成功标准和记录口径一致。等型号差异明确后,再逐项调整 effort、最大输出和其他参数,避免一次改变太多变量而无法判断原因。
用 token 算清单次成本,不要只比较输入单价
对未使用缓存、Batch、工具和数据驻留的简单工作负载,可以先用这个公式估算:
text成本 = 输入 token / 1,000,000 × 输入单价 + 输出 token / 1,000,000 × 输出单价
假设一次或一批请求合计使用 1M 输入 token、0.1M 输出 token,按标准价计算:
| 模型 | 计算 | 估算成本 |
|---|---|---|
| Fable 5 | 1 × $10 + 0.1 × $50 | $15.00 |
| Opus 5 | 1 × $5 + 0.1 × $25 | $7.50 |
| Sonnet 5 | 1 × $3 + 0.1 × $15 | $4.50 |
| Haiku 4.5 | 1 × $1 + 0.1 × $5 | $1.50 |
Sonnet 5 在介绍期按 $2 / $10 计算则为 $3.00。这个例子只是教你复算,不代表真实业务的月账单;模型可能生成不同长度的输出,失败重试和人工修复也会改变“一个可接受结果”的最终成本。
官方定价页还说明,Batch API可让输入与输出各减 50%,提示缓存命中的读取价格是标准输入价的 10%,而缓存写入使用更高倍率。折扣只有在工作负载符合条件且实现正确时才成立,生成 token、工具和其他费用仍要计算。
另一个迁移时常被忽略的变量是 tokenizer,即把文本切分成 token 的规则。Anthropic 定价文档说明 Claude 4.7 及后续型号使用的新 tokenizer,对相同文本产生的 token 数大约多 30%,但实际变化取决于内容与工作负载;这不是固定 30% 的涨价。升级前应对自己的中文、代码和结构化数据分别重算,而不是沿用旧型号的 token 预算。
升级前先排除会直接报错或改账单的条件

迁移检查要先处理会让请求直接失败的事项,再谈质量优化。
从 Sonnet 4.6 升级到 Sonnet 5
Anthropic 将 Sonnet 5 描述为可通过替换模型 ID 从 Sonnet 4.6 升级,但它拒绝手动扩展思考,也拒绝非默认的 temperature、top_p 或 top_k;自适应思考默认开启,tokenizer 也会改变 token 数。升级前应按Sonnet 5 官方迁移说明逐项清理请求参数。这一结论只适用于从 Sonnet 4.6 出发,版本更老时还要检查额外迁移步骤。
建议先做四件事:
- 把
model改为claude-sonnet-5,删除手动扩展思考配置。 - 删除非默认
temperature、top_p、top_k,确认不再返回 400。 - 用真实输入重新统计 token,调整限额和预算告警。
- 在相同请求上复核输出格式、工具调用、P95 延迟和单个可接受结果成本。
从 Opus 4.8 升级到 Fable 5
Fable 5 的 token 单价为 $10 / $50,是 Opus 4.8 的两倍;同时要求 30 天数据保留,不兼容的零数据保留(ZDR)配置可能返回 400。请在迁移前阅读官方 Fable 5 迁移指南,并与账号团队确认适用于你的企业条款。这里不对法律或合规适用性作一刀切判断。
如果当前系统依赖 ZDR,先确认账号与项目配置,再发送灰度请求;不要先替换全量模型 ID 后才处理保留策略或拒绝响应。
固定快照、退休型号与云平台要分别核对
截至 2026 年 8 月 10 日,Anthropic API 型号生命周期页面将 Fable 5、Opus 5、Sonnet 5、Opus 4.8 / 4.7 / 4.6、Sonnet 4.6 和 Haiku 4.5 标为 active;Opus 4.1 已于 2026 年 8 月 5 日 retired,Opus 4 与 Sonnet 4 已于 2026 年 6 月 15 日 retired。
这些状态只适用于 Anthropic 自营 API。Amazon Bedrock、Google Cloud 等平台有自己的型号命名和生命周期,迁移时必须分别查对应平台文档,不能直接照搬本文 ID 或退休日期。
当天完成一次最小评测,再决定灰度比例
选择不应停在参数表。可以从真实流量抽取一组脱敏请求,当天完成一次小范围、可比较的评测:
- 先用 Sonnet 5 跑完整组,记录任务通过率、人工修复时间、输入与输出 token、P95 延迟、拒绝或 400,以及单个可接受结果成本。
- 对边界清楚、追求吞吐的请求加入 Haiku 4.5;对 Sonnet 未通过的复杂请求加入 Opus 5。
- 只有最高难度样本在 Opus 5 上仍失败,而且预算与数据保留边界都允许时,才加入 Fable 5。
- 使用同一组输入和同一验收标准比较,先修复参数与迁移错误,再判断模型差异。
- 核对模型 ID、thinking 与采样参数、tokenizer、数据保留、退休状态和云平台差异后,才逐步扩大流量。
最终不要只记录“哪个模型更好”,而要记录哪个型号以多大成本产出了可接受结果。复制 ID 或更新预算前,再打开 Anthropic 的模型总览和定价页确认当前状态;本文是 2026 年 8 月 10 日的快照,不替代发布当日复核。



