跳转到主要内容

2026 Claude API 最新模型怎么选:Fable 5、Opus 5、Sonnet 5 与 Haiku 4.5

13 分钟阅读AI 模型

多数团队不必从最贵的 Claude 模型开始。本文用当前公开型号、成本算例和迁移清单,帮你在 2026 年 8 月 10 日这个时间点选出首测组合。

Claude API 四档模型选择器,对比 Haiku 4.5、Sonnet 5、Opus 5 与 Fable 5 的任务复杂度、相对时延和输入输出价格

截至 2026 年 8 月 10 日,如果你要为一个新的 Claude API 项目选模型,最稳妥的起点通常不是“能力最强”的那一档,而是 Claude Sonnet 5。先用它建立质量、P95 延迟和单个可接受结果成本的基线:轻任务再测试 Haiku 4.5,复杂任务不达标再测试 Opus 5,只有 Opus 仍过不了验收线时才把 Fable 5 加入候选。

Anthropic 当前模型总览列出的四个公开自助型号及精确模型 ID(Model ID)如下。这里的“当前”是日期快照,不代表以后不会变化;AWS、Google Cloud 等合作伙伴平台使用的 ID 也可能不同。

text
Claude Fable 5 claude-fable-5 Claude Opus 5 claude-opus-5 Claude Sonnet 5 claude-sonnet-5 Claude Haiku 4.5 claude-haiku-4-5-20251001

Haiku 4.5 另有短别名 claude-haiku-4-5,但配置文件和示例建议优先写完整 ID。还要特别注意:从 Claude 4.6 开始,无日期的 ID 也是固定快照,并不会自动漂移到未来版本;这一规则可在 Anthropic 的模型 ID 与版本说明中核对。

先看一张能直接做决定的对照表

下表中的“能力定位”和“相对时延”来自 Anthropic 的官方描述,不是本站独立跑分,也不是对你的工作负载作出的性能保证。MTok 表示一百万 token;价格是 Anthropic 自营 API 的标准输入价 / 输出价,不含提示缓存、Batch、工具调用、数据驻留、税费或合作伙伴平台加价,当前价格应以官方定价页为准。

模型官方定位相对时延上下文窗口 / 最大同步输出标准价格(输入 / 输出,每 MTok)先用它验证什么
Claude Fable 5广泛发布型号中的最高能力档slower1M / 128k$10 / $50最高难度任务的增益,能否覆盖其在相同输入、输出 token 假设下为 Opus 5 两倍的单价和额外边界
Claude Opus 5复杂代理编程与企业级任务moderate1M / 128k$5 / $25复杂代理或推理任务的验收通过率,是否显著高于基线
Claude Sonnet 5速度与智能的平衡档fast1M / 128k$3 / $15能否成为大多数生产请求的默认基线
Claude Haiku 4.5最快、接近前沿智能fastest200k / 64k$1 / $5边界清楚的轻任务,能否在更低成本和更低相对时延下通过验收

这里的 slower、moderate、fast、fastest 只是官方相对标签,不能换算成毫秒,更不构成 SLA。上下文窗口也不等于你应该把所有历史记录一次塞满:输入越长,延迟、token 成本和信息干扰通常越值得单独测量。

Sonnet 5 还有一个容易影响预算表的时间条件:按官方定价说明,2026 年 8 月 31 日之前其介绍价为输入 $2 / 输出 $10 每 MTok;2026 年 9 月 1 日起恢复输入 $3 / 输出 $15 的标准价。不要把介绍价当成长期单价写进年度预算。

从 Sonnet 5 起步,按验收结果换档

模型选择真正要回答的是“哪个型号能以可接受的总成本完成我的任务”,而不是“哪个型号在抽象意义上最聪明”。在比较之前,先给同一组真实请求定义至少三个门槛:任务是否通过、P95 延迟是否可接受、单个可接受结果的成本是多少。然后按下面的顺序换档。

Sonnet 5:先建立混合型生产任务的基线

Sonnet 5 适合先覆盖日常代码协助、文档理解、工具调用和多步骤业务流程。这个建议来自它在速度、能力和价格之间的官方定位,不代表它一定在每个任务上胜出。

先用一组脱敏的真实请求跑出基线。如果质量已经达到上线标准,就没有必要仅为了追求更高型号而升档;接下来只需判断是否有一部分结构清楚、失败代价低的请求可以交给 Haiku 4.5。

Haiku 4.5:轻任务通过验收时再降档

中文客服意图分类、批量结构化抽取、高并发短文本处理,可以成为 Haiku 4.5 的首测候选。关键不是任务名称,而是边界是否清楚、输出能否自动校验、失败是否容易回退。

如果 Haiku 在同一评测集上达到质量门槛,同时降低了 P95 延迟或单任务成本,就把这部分流量拆出来;如果人工修复明显增加,即使 token 单价更低,也不一定更省。

Opus 5:Sonnet 基线过不了复杂任务时升档

多文件代理修改、复杂故障推理和长周期企业工作流更值得测试 Opus 5。Anthropic 将其描述为面向深度推理和长周期代理工作的升级,并给出 1M 上下文窗口、128k 最大同步输出和默认开启 thinking;这是Opus 5 官方能力说明中的产品定位,不是本站测出的胜率。

升档的判据应是“同一评测集上的可接受结果明显增加”,而不是输出看起来更长。把额外 token、延迟和失败后的人工修复都计入,才能知道更贵的请求是否真的更划算。

Fable 5:只处理最高难度且失败代价高的少数任务

Fable 5 已广泛可用,适合在 Opus 5 仍不能满足高价值任务时单独测试。Anthropic 同时说明,Mythos 5 只面向获批的 Project Glasswing 客户,因此 Mythos 不属于普通自助 API 的四型号比较范围;Fable 集成还需要处理安全分类器拒绝以及独立的账单和数据保留条件,详见Fable 5 与 Mythos 5 官方介绍

不要把最高价型号默认铺到全部流量。只有同一评测集证明 Fable 对最高难度样本有足够增益,并且预算、拒绝处理与数据条件都能接受时,才值得灰度加入。

从 Sonnet 5 基线出发,按质量、时延、预算和数据边界决定测试 Haiku 4.5、Opus 5 或 Fable 5

“思考模式”会改变行为,也会改变 token 用量

Fable 5、Opus 5 与 Sonnet 5 使用自适应思考,Haiku 4.5 使用手动扩展思考;Opus 5 和 Sonnet 5 在 Claude API 与 Claude Code 中的 effort 默认值为 high。这些差异可在官方模型总览中核对。

effort 是控制思考力度的请求参数,不应被理解为一个简单的“智力开关”。更高的思考投入可能改变输出行为和 token 用量,迁移时应把它与质量、延迟和成本一起测试。具体请求参数以对应型号的迁移文档为准,不要把旧模型的 thinking 配置原样复制后直接全量上线。

下面只展示模型 ID 在请求中的位置,不绑定某个 SDK 版本,也不包含真实密钥:

json
{ "model": "claude-sonnet-5", "max_tokens": 2048, "messages": [ { "role": "user", "content": "请把这段故障日志归纳为原因、证据和下一步。" } ] }

首测时只替换 model,保持评测输入、成功标准和记录口径一致。等型号差异明确后,再逐项调整 effort、最大输出和其他参数,避免一次改变太多变量而无法判断原因。

用 token 算清单次成本,不要只比较输入单价

对未使用缓存、Batch、工具和数据驻留的简单工作负载,可以先用这个公式估算:

text
成本 = 输入 token / 1,000,000 × 输入单价 + 输出 token / 1,000,000 × 输出单价

假设一次或一批请求合计使用 1M 输入 token、0.1M 输出 token,按标准价计算:

模型计算估算成本
Fable 51 × $10 + 0.1 × $50$15.00
Opus 51 × $5 + 0.1 × $25$7.50
Sonnet 51 × $3 + 0.1 × $15$4.50
Haiku 4.51 × $1 + 0.1 × $5$1.50

Sonnet 5 在介绍期按 $2 / $10 计算则为 $3.00。这个例子只是教你复算,不代表真实业务的月账单;模型可能生成不同长度的输出,失败重试和人工修复也会改变“一个可接受结果”的最终成本。

官方定价页还说明,Batch API可让输入与输出各减 50%,提示缓存命中的读取价格是标准输入价的 10%,而缓存写入使用更高倍率。折扣只有在工作负载符合条件且实现正确时才成立,生成 token、工具和其他费用仍要计算。

另一个迁移时常被忽略的变量是 tokenizer,即把文本切分成 token 的规则。Anthropic 定价文档说明 Claude 4.7 及后续型号使用的新 tokenizer,对相同文本产生的 token 数大约多 30%,但实际变化取决于内容与工作负载;这不是固定 30% 的涨价。升级前应对自己的中文、代码和结构化数据分别重算,而不是沿用旧型号的 token 预算。

升级前先排除会直接报错或改账单的条件

升级 Claude API 前检查模型 ID、thinking 与采样参数、tokenizer、数据保留和平台生命周期

迁移检查要先处理会让请求直接失败的事项,再谈质量优化。

从 Sonnet 4.6 升级到 Sonnet 5

Anthropic 将 Sonnet 5 描述为可通过替换模型 ID 从 Sonnet 4.6 升级,但它拒绝手动扩展思考,也拒绝非默认的 temperaturetop_ptop_k;自适应思考默认开启,tokenizer 也会改变 token 数。升级前应按Sonnet 5 官方迁移说明逐项清理请求参数。这一结论只适用于从 Sonnet 4.6 出发,版本更老时还要检查额外迁移步骤。

建议先做四件事:

  1. model 改为 claude-sonnet-5,删除手动扩展思考配置。
  2. 删除非默认 temperaturetop_ptop_k,确认不再返回 400。
  3. 用真实输入重新统计 token,调整限额和预算告警。
  4. 在相同请求上复核输出格式、工具调用、P95 延迟和单个可接受结果成本。

从 Opus 4.8 升级到 Fable 5

Fable 5 的 token 单价为 $10 / $50,是 Opus 4.8 的两倍;同时要求 30 天数据保留,不兼容的零数据保留(ZDR)配置可能返回 400。请在迁移前阅读官方 Fable 5 迁移指南,并与账号团队确认适用于你的企业条款。这里不对法律或合规适用性作一刀切判断。

如果当前系统依赖 ZDR,先确认账号与项目配置,再发送灰度请求;不要先替换全量模型 ID 后才处理保留策略或拒绝响应。

固定快照、退休型号与云平台要分别核对

截至 2026 年 8 月 10 日,Anthropic API 型号生命周期页面将 Fable 5、Opus 5、Sonnet 5、Opus 4.8 / 4.7 / 4.6、Sonnet 4.6 和 Haiku 4.5 标为 active;Opus 4.1 已于 2026 年 8 月 5 日 retired,Opus 4 与 Sonnet 4 已于 2026 年 6 月 15 日 retired。

这些状态只适用于 Anthropic 自营 API。Amazon Bedrock、Google Cloud 等平台有自己的型号命名和生命周期,迁移时必须分别查对应平台文档,不能直接照搬本文 ID 或退休日期。

当天完成一次最小评测,再决定灰度比例

选择不应停在参数表。可以从真实流量抽取一组脱敏请求,当天完成一次小范围、可比较的评测:

  1. 先用 Sonnet 5 跑完整组,记录任务通过率、人工修复时间、输入与输出 token、P95 延迟、拒绝或 400,以及单个可接受结果成本。
  2. 对边界清楚、追求吞吐的请求加入 Haiku 4.5;对 Sonnet 未通过的复杂请求加入 Opus 5。
  3. 只有最高难度样本在 Opus 5 上仍失败,而且预算与数据保留边界都允许时,才加入 Fable 5。
  4. 使用同一组输入和同一验收标准比较,先修复参数与迁移错误,再判断模型差异。
  5. 核对模型 ID、thinking 与采样参数、tokenizer、数据保留、退休状态和云平台差异后,才逐步扩大流量。

最终不要只记录“哪个模型更好”,而要记录哪个型号以多大成本产出了可接受结果。复制 ID 或更新预算前,再打开 Anthropic 的模型总览定价页确认当前状态;本文是 2026 年 8 月 10 日的快照,不替代发布当日复核。

#Claude API#Claude Sonnet 5#Claude Opus 5#Claude Fable 5#Claude Haiku 4.5
分享文章: