截至 2026 年 7 月 21 日,这场比较没有一个脱离任务和工具的通用冠军。终端操作、命令恢复和多工具实现,可以先试 GPT-5.6 Sol 加 Codex;长时程编码、大上下文阅读和跨文件诊断,可以先试 Claude Fable 5 加 Claude Code。但“先试”不等于“切换默认路线”:真正的决定标准,是哪条路线在同一个仓库里交付更多被接受的补丁,并减少重试、评审和回滚成本。
| 你的任务 | 第一轮候选 | 晋升前必须证明 |
|---|---|---|
| 终端密集修复、命令恢复、多工具实现 | Sol 加 Codex | 首轮通过更多,且没有用额外人工提示换取成功 |
| 长时程重构、大上下文跨文件诊断 | Fable 加 Claude Code | 最终补丁保持关键约束,而不只是分析更长 |
| API 批量任务、成本敏感流水线 | 先测 Sol API | 计入失败重跑与评审后,每个被接受补丁仍更便宜 |
| 已稳定运行的生产流程 | 保留当前默认路线 | 挑战者连续两个评估周期获胜,并完成回滚演练 |
最重要的停止规则也应写在第一屏:不能证明实际生效模型、没有预先写好的验收测试、或无法恢复旧路线,就不要替换生产默认模型。

先拆开模型、工具、计费与生效模型
“GPT-5.6 Sol 对比 Fable 5”经常把四个变量混在一起。模型负责推理与生成,编码工具负责提供仓库上下文、命令、权限和测试反馈,计费路线决定套餐还是按 Token 付费,生效模型则回答最后究竟是谁生成了补丁。
| 层级 | OpenAI 路线 | Anthropic 路线 | 必须保存的证据 |
|---|---|---|---|
| 模型 | GPT-5.6 Sol | Claude Fable 5 | 精确模型 ID,不用营销简称 |
| 编码工具 | Codex | Claude Code | 客户端版本、工具、权限、上下文装配 |
| 计费 | ChatGPT 套餐或 OpenAI API | Claude 套餐或 Claude API | 实际账户、套餐或 Token 账单 |
| 生效模型 | 请求与响应中显示的模型 | Fable,或应用安全路由后的 Opus 4.8 | 运行日志、用量与模型匹配结果 |
因此,产品路线的准确写法是“Sol-in-Codex”与“Fable-in-Claude-Code”。同一个模型通过裸 API 只拿到手工拼接的文件片段,与它在编码 agent 中读取仓库说明、运行测试并根据失败修复,并不是同一个实验。比较完整产品路线时可以保留 harness 差异,但必须把差异记录下来;比较纯模型能力时,才应尽量统一工具和上下文。
这也解释了标题 slug 中为什么保留 Opus 4.8。Anthropic 说明,Claude 应用中被安全系统标记的部分网络安全或生物相关请求,可能从 Fable 自动切到 Opus 4.8;用户可以关闭该应用内开关。Claude API 不会仅因选择 Fable 就自动改用 Opus,只有开发者显式配置 Fallback API 才会使用备用模型。此时 Opus 是需要单独归因的生效路线,不是这篇文章的第三个主角。
2026 年 7 月 21 日的官方访问与 API 合同
先核对合同,再谈能力。OpenAI 当前说明,Free 与 Go 用户在 ChatGPT Work 和 Codex 中获得的是 GPT-5.6 Terra;Plus、Pro、Business 与 Enterprise 用户可以选择 Sol、Terra 和 Luna。换句话说,“免费使用 GPT-5.6 家族”不能改写成“免费使用 Sol API”。相关入口以 GPT-5.6 官方发布页 和 Codex 模型说明 为准。
Anthropic 的 Fable 5 官方页 当前列出 Pro、Max、Team 与 Enterprise,并说明 Fable 可通过 Claude Platform 和合作平台使用;该套餐列表没有列 Claude Free。套餐额度、地区和限速都可能变化,部署前仍要在实际账户中确认,不能用第三方页面上的“免费”标签代替官方合同。
| 合同项目 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|
| API 模型 ID | gpt-5.6-sol | claude-fable-5 |
| 标准输入价 | $5 / 百万 Token | $10 / 百万 Token |
| 标准输出价 | $30 / 百万 Token | $50 / 百万 Token |
| 额外计费信息 | 缓存输入 $0.50/M、cache write $6.25/M;Batch/Flex 为 $2.50/$15,Priority 为 $10/$60 | 100 万 Token 默认上下文,最多 128k 输出;同一负载的实际 Token 需按新 tokenizer 重新计数 |
| 数据边界 | 以实际 OpenAI 账户与 API 路线条款为准 | Fable 要求 30 天数据保留,不提供零数据保留 |
OpenAI API 数字来自 官方定价页,但报价时必须写清 Standard、Batch/Flex 或 Priority,不能只说“Sol 的价格”。Fable 的模型 ID、价格、上下文和输出上限来自 Anthropic 模型文档。Anthropic 的 Token counting 文档 还说明,Fable 使用随 Opus 4.7 引入的新 tokenizer;官方估计,同一文本相对 4.7 之前的模型可能多约 30% Token,但具体工作负载会变化。因此迁移预算必须用真实请求重新计数,不能只把旧 Token 数乘旧单价。
按标准 API 价,一次包含 20 万输入 Token、4 万输出 Token、且不考虑缓存的运行,Sol 的模型费用约为 $2.20,Fable 约为 $4.00。这个例子只比较计量价格,不包含失败重跑、CI、浏览器或沙箱费用,也不代表 Codex 与 Claude Code 订阅会话的账单。
官方跑分给出的不是同一个赢家
OpenAI 的 GPT-5.6 发布表 中,四个编码项目出现了明显反转。它们适合用来选择第一批 pilot,不适合求平均后宣布“编码冠军”。
| OpenAI 发布表中的项目 | GPT-5.6 Sol | Claude Fable 5 | 可提出的本地假设 |
|---|---|---|---|
| Artificial Analysis Coding Agent Index v1.1 | 80.0 | 77.2 | Sol 值得先进入通用 coding-agent pilot |
| SWE-Bench Pro | 64.6% | 80.0% | Fable 值得先进入真实 issue 修复 pilot |
| DeepSWE v1.1 | 72.7% | 69.7% | Sol 值得验证 agentic coding 流程 |
| Terminal-Bench 2.1 | 88.8% | 83.1% | Sol 值得先进入终端恢复任务 |
这些数字是模型提供方发布的比较,不是独立机构在完全相同 Codex 与 Claude Code 配置下做的控制实验。OpenAI 对第一项注明 Sol 使用 max reasoning,其他行也没有公开足以锁定双方客户端版本、权限、上下文装配和重试预算的全部信息。结论只能是“哪条路线先测哪类任务”,不能是“哪条路线一定赢你的仓库”。
不要把四项直接平均。它们衡量的任务不同,harness 与方法边界也不同。Fable 在 SWE-Bench Pro 的领先可能对应仓库问题解决优势;Sol 在 Terminal-Bench 的领先可能对应命令与恢复优势。真正有用的做法,是把每一行转成可被本地实验推翻的假设。
原创决策工具:同仓库 accepted-work 计分卡
这篇对比的核心不是再造一个总分,而是提供一张可以直接用于采购和路由评审的计分卡。它把“模型回答了”改成“团队愿意合并并承担后果的工作”。
在第一条路线运行前,先冻结以下字段:
- 仓库 commit SHA、干净 worktree、依赖锁文件与运行时镜像。
- 完整任务、仓库内规则、初始上下文、网络和命令权限。
- 请求模型、生效模型、客户端版本、推理设置与工具配置。
- 在看到任何补丁之前写好的测试、人工评审规则和安全否决项。
- 相同时间盒,以及“首轮加一次修复”的统一修复预算。
- 第二条路线从新的干净状态启动,不能看到第一条路线的补丁与评审意见。

每个任务只需一行记录,但字段不能省略:
| 记录字段 | 怎样填写 | 为什么影响决定 |
|---|---|---|
| 任务与初始 SHA | 真实队列任务、相同起点 | 防止给某一路线更容易的题 |
| 请求/生效模型 | 两者都保存并核对 | 自动路由或 fallback 不能错算给请求模型 |
| 首轮结果 | 测试通过/失败、核心方案是否被改写 | 区分真正自主完成与人工救活 |
| 重试与干预 | 次数、追加提示、人工命令 | 暴露隐藏的 Token 和操作成本 |
| 计量费用 | 所有首轮与重试的模型账单 | 不能只算成功的那一次 |
| CI/工具费用 | 外部测试、浏览器、沙箱等增量收费 | 补全模型账单外的直接成本 |
| 评审分钟 | 从开始阅读到接受或拒绝 | 让“便宜但难审”的路线现形 |
| 合并后结果 | 缺陷、回滚、安全或数据事件 | 防止首轮速度掩盖延迟成本 |
只有同时通过预先声明的测试、遵守仓库约束、没有重大安全或数据回归,并且不需要人类重写核心方案,才计为一个 accepted patch。生产比较使用这条公式:
每个被接受补丁的总成本 =(全部模型运行费 + 外部工具/CI 费 + 评审人工费)÷ 被接受补丁数
如果某条路线接受数为零,应把该批次标为失败并停止,不要做除零,也不要用生成文件数美化结果。订阅路线无法拆出每任务模型金额时,记录套餐、credits、限额和节流,并照常计算评审、CI 与回滚;“套餐已包含”不等于任务成本为零。
一条可复用的成本盈亏线
假设团队采用的 loaded reviewer cost 是 每小时 120 美元,那么 1 分钟评审价值 2 美元。由此得到一个容易在评审会上使用的规则:
“每增加 1 美元模型支出,至少要节省 30 秒评审时间,才刚好达到人工成本盈亏平衡。
这不是 OpenAI 或 Anthropic 的定价结论,而是可替换参数的编辑部计算。若你的评审成本是每小时 60 美元,1 美元增量需要节省 1 分钟;若是每小时 180 美元,只需节省 20 秒。它还没有计入接受率、缺陷和回滚,所以只能作为快速门槛,不能覆盖质量否决项。
例如,路线 A 的全部模型费为 22 美元,接受 8 个补丁,评审 90 分钟;路线 B 花 40 美元,接受 9 个补丁,评审 40 分钟。按每小时 120 美元计算:
- 路线 A:
($22 + $180) ÷ 8 = $25.25/accepted patch - 路线 B:
($40 + $80) ÷ 9 = $13.33/accepted patch
路线 B 的模型账单更高,但被接受工作更便宜。API 单价因此只适合决定谁先进入成本 pilot,不足以决定生产默认模型。
怎样从 pilot 晋升到生产
测试前就写阈值,避免看到结果后临时挑对某个模型有利的指标。建议把结果分为默认路线、专家路线、fallback 与 rollback 四种,而不是强迫二选一。

| 决定 | 证据门槛 |
|---|---|
| 晋升默认路线 | 连续两个评估周期接受率不低于基线,关键任务的总成本或时间达到预设改善,能证明生效模型,无严重回归,并完成回滚演练 |
| 保留专家路线 | 只在终端恢复、长上下文重构等一类任务稳定获胜 |
| 保留 fallback | 旧选择器、提示、凭证、权限和运行手册仍可立即使用 |
| 立即 rollback | 严重安全或数据问题,接受率持续下降,成本/评审超阈值,生效模型无法解释,或访问合同不再满足 |
如果 Sol 只在终端任务获胜,就让它成为终端专家;如果 Fable 只在跨文件重构获胜,就让它承担这类任务。专家路由不是失败,而是比“全公司只用一个模型”更符合四项跑分已经呈现的任务差异。
以下情况应在当批任务直接停止,而不是继续花预算寻找漂亮案例:
- 无法确认请求模型与生效模型是否一致。
- 两条路线没有相同的初始代码、验收测试或人工预算。
- 挑战路线产生零个被接受补丁,或需要人类重写核心方案。
- 数据保留、权限、安全或合规条件不满足。
- 旧路线已经无法恢复,因而不存在可执行的 rollback。
- 价格、套餐或路由行为变化,却没有重新核对官方合同。
最后把选择压缩成三步:按任务形状选择第一轮候选;按同仓库 accepted work 和总成本决定是否晋升;始终保留可验证的 fallback 与 rollback。这样得到的答案可能是 Sol、Fable,也可能是按任务分流或暂不切换——这四种都是有效结论。
常见问题
“Codex 5.6”是模型正式名称吗?
不是。模型是 GPT-5.6 Sol,Codex 是运行模型并提供仓库工具的编码产品。讨论整条路线时应写“GPT-5.6 Sol 加 Codex”。
GPT-5.6 Sol 和 Claude Fable 5 哪个 API 更便宜?
按 2026 年 7 月 21 日的标准 API 标价,Sol 的输入与输出单价都更低。但生产选择应比较包含重试、CI、评审和回滚的每个 accepted patch 总成本,而不是只看一次请求。
Fable 的 100 万上下文是否一定更适合大仓库?
不是。它让 Fable 成为长上下文任务的合理第一轮候选,但最终仍要检查跨文件不变量、测试通过率、人工评审时间,以及 30 天数据保留是否适合项目。
为什么比较 Fable 时还要记录 Opus 4.8?
因为 Claude 应用中部分被安全系统标记的请求可能切换到 Opus 4.8。该运行应归到实际生效的 Opus 路线;Claude API 只有显式配置 Fallback API 才会使用备用模型。
什么时候应该切换团队默认模型?
只有挑战者在重复的同仓库任务中达到预先声明的接受率和成本阈值、没有严重回归、能证明生效模型,并完成回滚演练时才切换。若优势只存在于一种任务,就保留为专家路线;若优势不明确,就继续使用现有默认路线。



