跳转到主要内容

Claude Fable 5.1 迁移指南:价格、缓存、effort 与 Mythos

8 分钟阅读API 指南

基础输入输出价没有下降;真正变化的是缓存读取和迁移合同。这里把每种 token、默认 effort、400 错误与 Mythos 权限拆开计算。

Claude Fable 5.1 迁移总览,包含价格表、缓存读取降价、默认 high、三项兼容风险与 Mythos 访问条件

Claude Fable 5.1 值不值得从 Fable 5 升级,不能只看“缓存降价 75%”。对 API 团队更准确的结论是:基础输入与输出单价不变,缓存读取从每百万 token 1 美元降到 0.25 美元;同时有三类兼容性变化需要先改代码。

如果你的长会话会反复读取大段稳定前缀,5.1 可能显著降低输入成本;如果大部分 token 每次都不同,账单不会因为版本号改变而自动下降。省略 output_config.effort 仍按 high 运行,也不等于系统替你选择了最省钱的档位。

本文价格与能力按 2026 年 9 月 3 日可见的 Claude Platform 一手文档核对。上线当天仍应重新检查价格、数据保留和平台可用性。

价格表没有降,缓存读取这一行变了

Anthropic 当前价格页把五类 token 分开计价:

Claude Fable 5.1 / Mythos 5.1每百万 token 价格
普通输入$10
5 分钟缓存写入$12.50
1 小时缓存写入$20
缓存读取(命中或刷新)$0.25
输出$50

Batch 的输入与输出分别是 $5 和 $25/MTok。美国限定推理 inference_geo: "us" 会在各 token 类别上叠加 1.1 倍;云平台或转售渠道还可能有自己的价目,所以不能把表中数字直接当作任何账单的最终金额。

“缓存降价 75%”的比较对象是 Fable 5 的缓存读取费 $1,而不是全部请求。换一个基准看,$0.25 只相当于普通输入 $10 的 2.5%,也就是读取已缓存 token 比重新处理便宜 97.5%。这两个百分比都正确,但回答的是不同问题。

用前缀复用次数判断缓存是否真省钱

假设一个稳定前缀正好有 100 万 token,暂不计变化的尾部和输出。

使用 5 分钟缓存时,第一次写入收费 $12.50,第二次命中收费 $0.25,两次共 $12.75。不用缓存则是 $10 × 2 = $20。只要第二次请求能在 TTL 内复用完整前缀,这个例子已经省下 $7.25。

1 小时缓存的首次写入是 $20。两次使用合计 $20.25,略高于两次普通输入的 $20;第三次命中后合计 $20.50,而三次普通输入是 $30。因此 1 小时档在这个简化场景中要到第三次使用才转为更便宜。

实际费用应按 usage 分项计算:

text
成本 = 普通输入 × 10 + 5m 缓存写入 × 12.5 + 1h 缓存写入 × 20 + 缓存读取 × 0.25 + 输出 × 50

每一项 token 数先除以 1,000,000。不要用总输入 token 乘一个“平均折扣”;那会掩盖缓存未命中、TTL 过期和变化前缀。若你的问题是 Claude Code 会话为何突然变贵,可另看缓存未命中与 token 成本诊断

Fable 5.1 缓存回本次数、价格类别、effort 档位与迁移灰度判断图

默认 effort 是 high,但最好明确写出来

Effort 文档明确说明,API 不传 effort 与设置 high 的行为完全相同。Fable 5.1 支持 lowmediumhighxhighmax 五档;adaptive thinking 始终开启,effort 控制模型对整个响应投入多少工作,包括思考、正文和工具调用。

python
response = client.messages.create( model="claude-fable-5-1", max_tokens=16000, output_config={"effort": "high"}, messages=[{"role": "user", "content": "Review this migration plan."}], )

high 是稳妥起点,不是所有请求的永恒最优值。对分类、格式转换或短摘要,可以从 mediumlow 做 eval;对长时间代理编码,再比较 highxhighmax 的质量、输出 token、工具轮次和延迟。effort 是行为信号,不是严格 token 预算,因此必须用自己的任务样本测量。

5.1 还支持 beta 的 per-message effort:在会话中用一个空内容的 system message 更新 output_config.effort,可以保持此前的 prompt cache。反过来,在下一次请求直接修改顶层 effort 会让缓存前缀重新开始。需要动态档位时,先读官方说明并核对当前 beta header,不要只改一个字段就假定缓存仍命中。

改 model ID 前先排除三类 400 或状态丢失

官方迁移指南把 Fable 5 到 5.1 的变化写得比“替换模型名”更严格。

第一,5.1 不支持强制工具调用。tool_choiceany,或指定 {type: "tool", name: "..."},会返回 400 invalid_request_error。允许的值是 autonone。如果你要 schema 合法的 JSON,可在 auto 下使用 strict: true,或改用 structured outputs;如果业务必须调用某个工具,应在指令中清楚说明适用条件并验证结果。

第二,Fable 5.1 能读取旧模型的 thinking blocks,但旧模型不能反向读取 5.1 生成的 blocks。若路由器会在一段会话里降级到旧模型,不能假定之前的推理状态完整保留。

第三,自建 Messages 历史若修改 earlier turns、重建 system prompt 或 tools 数组,可能让之后的 5.1 thinking blocks 失效。最安全的迁移基线是让历史只追加,不改写已发送的前缀;需要清理上下文时使用服务端 context editing/compaction,或按官方迁移步骤处理 blocks。不同账户的前缀绑定执行时间有差异,因此先用非生产会话观察 400 与 input_transformations

另外,thinking: {type: "disabled"} 和手工 budget_tokens 都不适用于 Fable 5.1;forced tool use 也不能通过关闭思考来绕过。

从清理 tool_choice、保留追加式历史到小流量验证的 Fable 5.1 迁移操作清单

Mythos 5.1 不是更贵但公开可买的上位档

Fable 5.1 新功能页称 Fable 5.1 与 Mythos 5.1 共享能力、规格和价格。差异主要是访问与安全边界:

  • claude-fable-5-1 面向 Claude API 与官方列出的合作平台客户开放;
  • claude-mythos-5-1 只提供给获批的 Project Glasswing 客户;
  • 两者都要求 30 天数据保留,除非 Anthropic 明确另行授权;
  • 两者当前都不支持 Priority Tier。

所以没有账户级审批证据时,不要把 Mythos 写进生产方案,也不要因为某个云目录出现 model ID 就认为已经有权限。需要判断申请证据与平台边界时,转到Claude Mythos API 权限指南

一次小流量迁移应该留下哪些可观察结果

先复制一组真实但不含敏感数据的请求,保留 Fable 5 基线。把 model 改为 claude-fable-5-1,明确设置 effort,并删除强制 tool_choice。随后至少记录普通输入、缓存写入、缓存读取、输出 token、请求延迟、工具轮次、拒绝与 400。

灰度结果只有在三件事同时成立时才支持扩大流量:任务通过现有 eval;缓存命中比例达到成本假设;错误处理能识别 stop_reason: "refusal" 和真实的兼容性错误。任何一项失败,都应回滚 model ID,修复请求合同后再测,而不是用更高 effort 掩盖配置问题。

最终决策可以很简单:重复前缀多、兼容性检查通过,就用 Fable 5.1 做小流量迁移;重复前缀少,先按能力而不是“75%”宣传语做 eval;没有 Glasswing 审批,Mythos 不进入可执行选项。

#Claude Fable 5.1#Claude Mythos 5.1#Prompt Caching#Effort#Claude API
分享文章: