跳转到主要内容

GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选

GPT-6.1 Sol 与 GPT-6 Sol 同价、各档更强,改好推理强度和工具调用就能换;Astra 单价高 5 倍,只在顶档能力、最难科学任务和 Ultrafast 上值得。

LaoZhang AI Team发布于21 分钟阅读
文章目录
GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 的 API 输入输出单价和缓存输入价格对照

截至 2026 年 9 月 30 日,三款模型的关系可以这样理解:GPT-6.1 Sol 是 9 月 29 日发布的 GPT-6 Sol 升级版,API 标价和 GPT-6 Sol 一样,只有缓存输入从每百万 Token $0.20 降到 $0.10;GPT-6 Astra 仍是 OpenAI 能力最强的型号,普通输入和输出单价都是 6.1 Sol 的 5 倍。

按你现在用的型号,结论分三种:

  • 在用 gpt-6-sol:换到 gpt-6.1-sol。 在 Artificial Analysis 智能指数(以下简称 AA)里,同一推理强度下 6.1 Sol 高出 4~8 分,每道题的成本持平或更低。直接改模型名之前,先查请求里的 none/minimal 推理强度、Chat Completions 里的工具调用和 temperature 这类采样参数,这三处在 6.1 Sol 上都会出问题。
  • 在用 Astra 的 low 到 xhigh:拿同一批任务在 6.1 Sol 上高一档试跑。 AA 里分数对齐后,6.1 Sol 每道题的成本约为 Astra 的 1/5 到 1/3。
  • 继续用 Astra: 任务只有 Astra max 才做得出来、属于最难的科学研究类工作、需要 API 的 Ultrafast,或者一次失败的返工代价远高于 API 费用。

GPT-6 Sol 没有进入弃用列表,也没有公布停用日期。请求没改好之前继续用它,不会突然失效。

三个型号的关系和标价

下表是 OpenAI 直连 API 的 Standard 档、单次输入不超过 272K Token 时的单价(美元 / 每百万 Token),来自 GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 的模型页。

项目GPT-6.1 SolGPT-6 SolGPT-6 Astra
模型 IDgpt-6.1-solgpt-6-solgpt-6-astra
发布日期2026 年 9 月 29 日2026 年 9 月 22 日2026 年 9 月 3 日
OpenAI 的定位接近 Astra 的表现,成本更低模型页指向更新的 6.1 Sol能力最强,用于最难的推理、编码和专业工作
输入$2.00$2.00$10.00
缓存输入$0.10$0.20$1.00
缓存写入$2.50$2.50$12.50
输出$10.00$10.00$50.00
可用推理强度low 到 maxnone 到 maxlow 到 max
知识截止2026 年 4 月 30 日2026 年 4 月 20 日2026 年 4 月 30 日

三款的上下文窗口都是 1,050,000 Token,单次最多输出 128,000 Token。计费规则也相同:单次输入超过 272K Token 时,整次请求的输入和缓存按 2 倍、输出按 1.5 倍计价,6.1 Sol 变成 $4 / $0.20 / $5 / $15,Astra 变成 $20 / $2 / $25 / $75,倍数关系不变。Batch 和 Flex 是 Standard 的一半,Fast 是 2 倍,区域处理(数据驻留)另加 10%,见 OpenAI API 定价页。Astra 在长上下文、缓存写入和各服务档位下的完整算法,可以看 GPT-6 Astra API 定价与成本计算。

API 里只有 Astra 能用的是 Ultrafast。定价页的 Ultrafast 表里只有 gpt-6-astra:输入 $60、输出 $300,是 Standard 的 6 倍,只支持全球处理和美国数据驻留。OpenAI 的发布文章说 GPT-6.1 Sol Ultrafast 同时推出,但 API 定价页没有它的价格,ChatGPT 的模型说明页写的是 6.1 Sol 的 Ultrafast“稍后推出”。现在需要 Ultrafast,只能用 Astra。

至于 GPT-6 Sol,API 定价页的旗舰表已经换成 6.1 Sol 那一行,GPT-6 Sol 的价格仍在它自己的模型页上,页面注明“更新的 Sol 模型见 GPT-6.1 Sol”;弃用页里没有它。AA 的文章标题说 6.1 Sol“7 天就取代了 GPT-6 Sol”,指的是推荐位置,不是下线。

GPT-6 Luna 和 GPT-5.6 Terra 在整个阵容里的位置,见 GPT-6 Sol、Luna、Astra 与 Terra 怎么选;那篇写于 6.1 Sol 发布之前,其中 Sol 一行的价格除缓存输入外仍然适用。

“五分之一的价格”要放进你的请求里算

“价格是 Astra 的五分之一”只对普通输入、缓存写入和输出成立;缓存输入是十分之一。智能体任务往往反复发送相同的上下文前缀,缓存命中多,所以实际倍数落在 5 到 10 之间,缓存占比越高、输出越少,越接近 10。

用一次假设的调用算一遍:输入 200,000 Token,其中 150,000 命中缓存、50,000 未命中,输出 20,000 Token,Standard 档,不计缓存写入。Token 数换算成百万为单位代入单价:

  • GPT-6.1 Sol:0.05 × $2 + 0.15 × $0.10 + 0.02 × $10 = $0.100 + $0.015 + $0.200 = $0.315
  • GPT-6 Sol:0.05 × $2 + 0.15 × $0.20 + 0.02 × $10 = $0.100 + $0.030 + $0.200 = $0.330
  • GPT-6 Astra:0.05 × $10 + 0.15 × $1 + 0.02 × $50 = $0.50 + $0.15 + $1.00 = $1.65

这一笔 Astra 是 6.1 Sol 的约 5.2 倍。

6.1 Sol 对 GPT-6 Sol 的差距就小得多,这里只省 $0.015,全部来自缓存输入。AA 还测到,同一推理强度下 6.1 Sol 的输出 Token 比 GPT-6 Sol 多约 10%~30%。在上面这笔调用里,输出只要多 7.5%(1,500 Token,$0.015),缓存省下的钱就抵消了;多 20% 时 6.1 Sol 要 $0.355,比 GPT-6 Sol 还贵 $0.025。所以从 GPT-6 Sol 换过来,单次请求不一定更便宜,真正的收益是同档分数更高,可以把推理强度降一档,下一节的 AA 数据会说明这一点。

这笔账还假设三个模型用的 Token 一样多,实际通常不一样。OpenAI 说 Astra 在多项评测里比前代模型用更少的输出 Token 拿到更好的结果,AA 则测得 6.1 Sol 比 GPT-6 Sol 输出更多。所以比较三者,最终要看完成一个任务花多少钱,而不是每个 Token 多少钱。

差距有多大:先分清是谁测的

下面的数字分三类:OpenAI 自己公布的、AA 独立测的,以及用 AA 数据算出来的对照。它们都不是在你的任务上跑出来的,条件随每组数字给出。

AA 智能指数:按推理强度逐档对照

AA 智能指数 v4.3.2 由 10 项评测组成,三个模型的五档推理强度都有完整结果。每格是“指数得分 / 每任务成本”。每任务成本是 AA 跑一道指数题的加权平均花费,反映的是这套测试的工作量,不是你的账单。

推理强度GPT-6.1 SolGPT-6 SolGPT-6 Astra
low42 / $0.1334 / $0.1346 / $0.82
medium48 / $0.2140 / $0.2550 / $1.54
high50 / $0.3243 / $0.3851 / $1.73
xhigh51 / $0.3944 / $0.5252 / $2.31
max52 / $0.7248 / $1.0553 / $3.26

数据来自 AA 的 GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 发布页,截至 2026 年 9 月 30 日,之后可能更新。

从这张表能读出三件事:

  1. 对 GPT-6 Sol 是全面提升。 同一档位,6.1 Sol 分别高 8、8、7、7、4 分,每任务成本持平或更低。6.1 Sol medium 得 48 分、花 $0.21,已经和 GPT-6 Sol max 的 48 分持平,成本是后者的 1/5。原来为了质量把 GPT-6 Sol 开到 max 的,换过来可以从 medium 或 high 试起。
  2. 对 Astra,同名档位只差 1~4 分。 Astra 在 low 领先 4 分,medium 领先 2 分,high 到 max 都只领先 1 分。
  3. 按分数对齐,6.1 Sol 便宜 3~5 倍。 6.1 Sol high(50 分,$0.32)对应 Astra medium(50 分,$1.54),约 4.8 倍;xhigh(51 分,$0.39)对应 Astra high(51 分,$1.73),约 4.4 倍;max(52 分,$0.72)对应 Astra xhigh(52 分,$2.31),约 3.2 倍。Astra max 的 53 分,6.1 Sol 没有哪一档够得着。

AA 智能指数同分档位下 GPT-6.1 Sol 与 GPT-6 Astra 的每任务成本对比,以及 6.1 Sol 各推理强度比 GPT-6 Sol 高出的分数

输出速度方面,AA 测得 6.1 Sol 各档每秒约 59~66 个 Token,Astra 约 44~51 个。不过完成一个任务要多久,还取决于它输出多少 Token。

指数差 1 分,是 10 项评测平均后的结果,单项差距可能大得多,下面 OpenAI 公布的 Terminal-Bench Science 就是一例。

AA 编码智能体指数:xhigh 比 max 更好

在 AA 的编码智能体指数(Coding Agent Index)里,6.1 Sol xhigh 比 Astra 高 1 分,每任务成本不到 Astra 的 15%;比 GPT-6 Sol max 高 6 分。更值得注意的是,6.1 Sol xhigh 比它自己的 max 还高 3 分,max 反而比 Astra 低 2 分。跑编码智能体时,不要默认开满,先试 xhigh。

同一篇 AA 文章还提到,6.1 Sol 在 Terminal-Bench 4.0 上比 GPT-6 Sol 高 12 分,AA-Omniscience 幻觉率从 60% 降到 54%。

OpenAI 公布的对比

以下来自 OpenAI 的 GPT-6.1 Sol 发布文章,测试在研究环境或 API 中进行,OpenAI 注明可能与正式版 ChatGPT 略有差异:

  • 编程(DeepSWE v1.1):6.1 Sol 以约五分之一的成本达到与 Astra 相当的水平;用更低的推理强度和成本,比 GPT-6 Sol 的最高分高 6.4 个百分点。
  • 计算机使用(OSWorld 2.0,部分奖励得分):最高推理强度下比 GPT-6 Sol 高 7 个百分点、成本不到一半;与 Astra 相差 2.1 个百分点以内,单任务成本约为 Astra 的七分之一。
  • 科学研究(Terminal-Bench Science 0.1):平均单任务成本 6.1 Sol $5.47、Astra $23.80,但 Astra 以 68.1% 排第一,OpenAI 明确说最具挑战性的科学研究任务应使用 Astra。
  • 事实错误率(xhigh,刻意挑选的高难度提示):6.1 Sol 4.1%、GPT-6 Sol 4.5%、Astra 4.0%。
  • 搜索工具出错却未告知用户的比例(max,对抗性测试):6.1 Sol 2.1%、GPT-6 Sol 4.9%、Astra 1.5%。

这些是厂商自报结果,和 AA 的方向一致:6.1 Sol 大幅领先 GPT-6 Sol,离 Astra 很近,但在最难的一端 Astra 仍然领先。

推理强度怎么对档

把上面的数据落到具体配置上,可以从下表开始试。OpenAI 在 Codex 文档里说过,不同代模型的推理强度并不一一对应,所以这只是试跑的起点,每一行都要用你的任务确认。

你现在用先试 GPT-6.1 Sol 的依据
GPT-6 Sol none 或 minimallow6.1 Sol 不支持这两档,OpenAI 迁移指南建议从 low 开始
GPT-6 Sol low 到 xhigh同档,再试低一档AA 同档高 7~8 分,成本不高于 GPT-6 Sol
GPT-6 Sol maxmedium 或 highAA 中 6.1 Sol medium 与 GPT-6 Sol max 同为 48 分
Astra lowmediumAA 中 6.1 Sol medium 48 分、$0.21,高于 Astra low 的 46 分、$0.82
Astra mediumhigh同为 50 分
Astra highxhigh同为 51 分
Astra xhighmax;编码智能体先试 xhigh同为 52 分;编码智能体指数里 xhigh 高于 max
Astra max不换6.1 Sol 最高 52 分,没有对应档

API 里的档位写在 reasoning.effort(Responses)或 reasoning_effort(Chat Completions)里,取值是 low、medium、high、xhigh、max,不写时 6.1 Sol 默认 medium。Codex 和 ChatGPT 工作模式的界面用另一套名称,从 Light 到 Ultra(CLI 里 Light 显示为 Low),其中 Ultra 会把任务拆给多个子代理并行处理,Max 和 Ultra 是否出现取决于你的设置。两套名称不要混用,写配置时以 API 取值为准。

把 gpt-6-sol 换成 gpt-6.1-sol 前要检查的地方

只用 Responses API、推理强度为 low 及以上的请求,通常改一个模型名就能跑。下面这些情况例外,依据是 OpenAI 的 GPT-6 使用与迁移指南:

  1. 推理强度 none 或 minimal。 6.1 Sol 和 Astra 都不支持,请求会失败。改成 low;如果原来用 none 是为了压延迟,要重新测响应时间。
  2. Chat Completions 里的工具调用。 GPT-6 Sol 在 Chat Completions 里只有 reasoning_effort 为 none 时才能调函数;6.1 Sol 的 Chat Completions 完全不支持工具调用。带工具的请求要先迁到 Responses API,不带工具的 Chat Completions 请求可以照常用。
  3. 采样参数。 推理强度不是 none 时,要删掉 temperature、top_p、top_logprobs;Chat Completions 还要删 logprobs,Responses 要从 include 里去掉 message.output_text.logprobs。原来在 GPT-6 Sol 上用 none 配这些参数的,改成 low 后必须一起删。
  4. 输出量和预算。 6.1 Sol 的输出 Token 比 GPT-6 Sol 多约 10%~30%。如果你给输出设了较紧的上限,或者按 Token 设了预算告警,先放宽再观察。
  5. 图片输入的旧评测。 OpenAI 在 9 月 25 日修复了一个图像编码问题,它曾拉低 GPT-6 Sol 和 Luna 在 API 与 Codex(包括计算机使用)中的看图能力。9 月 25 日之前用 GPT-6 Sol 做的看图对比低估了它,拿来和 6.1 Sol 比之前要重跑。
  6. 速度档与数据驻留。 API 里 6.1 Sol 有 Standard、Batch、Flex 和 Fast,没有 Ultrafast。它支持美国和欧盟数据驻留,欧盟数据驻留下没有 Fast,这一点和 GPT-6 Sol 一样。
  7. 安全研究类任务。 OpenAI 把 6.1 Sol 的网络安全能力评为 Critical、生物与化学评为 High,套用和 Astra 相同的一整套安全防护,见 GPT-6.1 Sol 系统卡补充。做漏洞研究、渗透测试一类工作,从 GPT-6 Sol 迁过来前先用真实任务跑一遍。

检查完之后,先把一小部分流量切过去,对比通过率、输出 Token 和耗时,再决定全量切换。逐项改请求的具体写法,见 GPT-6.1 Sol 怎么用:价格变化、迁移改动与可用入口。

什么时候仍该用 Astra

6.1 Sol 离 Astra 很近,但下面几种情况,多付的钱仍然有回报:

  • 任务只有 Astra max 才能完成。 AA 里 Astra max 的 53 分在 6.1 Sol 那边没有对应档。如果你的任务在 Astra xhigh 上已经常常失败、只能靠 max,6.1 Sol 很可能也做不下来。
  • 最难的科学研究任务。 Terminal-Bench Science 上 Astra 排第一,OpenAI 自己也说这类任务应该用 Astra。
  • 完整的端到端长流程。 OpenAI 的 Codex 文档把 Astra 推荐给需要跨代码、应用和资料持续推理与判断的完整工作流,并说它更会在关键处提问、在接受新要求的同时守住原始目标;6.1 Sol 则推荐给注重成本、重复执行的长时间任务。
  • 需要 API 的 Ultrafast。 目前只有 Astra 有公布价格。
  • 失败很贵。 一次失败的人工检查、返工或线上事故成本远高于 API 费用时,Astra 的通过率哪怕只高一点,也可能更划算,下一节给出算法。
  • 要在 ChatGPT 聊天里用。 6.1 Sol 只在工作模式和 Codex 里,不在聊天中;Astra 以 GPT-6 Pro 的形式出现在部分付费套餐的聊天里。

如果你想找的是 Astra 的跨厂商替代,可以看 Sonnet 5.5 对比 GPT-6 Astra:值不值得换。

在自己的任务上确认:算每个合格结果的成本

API 单价差 5 倍,但决定选谁的往往不是这 5 倍,而是失败的代价。用这个式子比较:

每个合格结果的成本 = (每次尝试的 API 费用 + 每次尝试的人工检查与返工成本) ÷ 通过率

继续用前面那笔调用(6.1 Sol $0.315,Astra $1.65,假设两边 Token 用量相同):

  • 只看 API 费用: 只要 6.1 Sol 的通过率高于 Astra 的 19%(0.315 ÷ 1.65),它就更便宜。按这个标准,几乎所有任务都该用 6.1 Sol。
  • 加上人工成本: 假设每次尝试都要人工检查,折合 $5。Astra 每次尝试共 $6.65,6.1 Sol 共 $5.315,盈亏点变成 5.315 ÷ 6.65 ≈ 80%。也就是说,Astra 能过 90% 的任务,6.1 Sol 至少要过 72% 才划算。

检查越贵,Astra 在通过率上的每一点优势越值钱;验收能自动完成、失败重跑就行的任务,6.1 Sol 几乎总是赢。

只算 API 费用与每次加 $5 人工检查两种情况下,GPT-6.1 Sol 相对 Astra 的通过率盈亏点从 19% 升到 80%

具体做法:

  1. 挑一批有代表性的真实任务,包括你最难的那类,先写好通过标准,能自动判定的尽量自动判定。
  2. Astra 用现在的档位跑一遍作为基线;6.1 Sol 按前面的对档表跑,再加高一档。
  3. 每次记录 API 返回的 usage(输入、缓存命中、输出 Token)、是否通过、耗时。
  4. 按任务类型分别代入上式。6.1 Sol 通过率不明显落后的类型切过去,其余留在 Astra,两者可以分流并用。

从 GPT-6 Sol 迁到 6.1 Sol 也可以用同一套流程,重点是确认请求没有报错、输出量增加后账单仍可接受,并试试低一档能不能守住原来的通过率。同一思路在跨厂商比较中的用法,见 Claude Opus 5.5 对比 GPT-6 Sol:先看任务,再算每次合格交付的成本。

Codex 和 ChatGPT 工作模式里怎么选

上面的 API 单价不能换算成套餐额度。Codex 和 ChatGPT 工作模式里,模型消耗的是 ChatGPT 积分,OpenAI 的模型说明页把各模型的积分消耗指向套餐定价页。想知道哪个更省额度,要用那里的数字比较,不能拿 API 单价推算。

可用范围按官方说明:

  • GPT-6.1 Sol: 首批覆盖 Plus、Pro、Business、Enterprise 和 Edu,可在 Codex(桌面应用、CLI)和 ChatGPT 工作模式(网页、手机)中使用。Enterprise 和 Edu 默认关闭,需要管理员开启;Free 和 Go 首批不包含。6.1 Sol、GPT-6 Sol 和 Luna 只在工作模式和 Codex 里,不在聊天中。
  • GPT-6 Astra: Plus 可在工作模式和 Codex 中使用;Pro、Business 和 Enterprise 还能在聊天里用由 Astra 驱动的 GPT-6 Pro;Free 和 Go 没有 Astra。OpenAI 同时推出了每月 $500 的新 Pro 档位,Astra Ultrafast 在其中的工作模式和 Codex 里开放。

在 CLI 里指定模型:

bash
codex -m gpt-6.1-sol
codex -m gpt-6-astra

OpenAI 文档里示意的桌面应用 Power 预设是 Luna、GPT-6 Sol 和 Astra 的几种组合,实际选项因套餐和灰度而异;要用 6.1 Sol,在高级(Advanced)里指定模型。选中某个模型不会自动获得使用权限,是否可用取决于套餐、客户端和工作区设置。OpenAI 给 Codex 的建议和 API 一致:注重成本、重复执行的长任务用 6.1 Sol,最难的端到端工作留给 Astra。

不直连 OpenAI 的话,Microsoft Foundry 和 Amazon Bedrock 的文档也已列出 GPT-6.1 Sol,价格以各平台为准,不能直接套用上面的 OpenAI 直连单价。直连 OpenAI 时,Astra 的访问条件与首次调用排查见 GPT-6 Astra API 怎么开通。

Sonnet 5.5 对比 GPT-6 Astra 封面:官方单价便宜 5 倍,max 档指数 56 比 53,但每任务成本 $7.60 比 $3.26
模型对比

Sonnet 5.5 对比 GPT-6 Astra:值不值得换

“超越 Astra”只在两边都开 max 时成立,这一档 Sonnet 5.5 每任务反而贵约 2.3 倍。high 及以下能过验收的任务换过去更省,max 级长任务先别换。

21 分钟
桌面白板上的决策分支图:从你的任务出发分流到 GPT Image 2.5、Nano Banana Pro 与两家各测一轮三个去向,标注商品改图、多轮改图、4K、联网搜索等任务
模型对比

Nano Banana Pro 还是 GPT Image 2.5

改商品图要保外形或多轮改图,先用 GPT Image 2.5;4K 正方形、联网核对、多参考图或手办风格先用 Nano Banana Pro。Pro 1K 一张 $0.134。

23 分钟
Gemini 4、GPT-6 Astra 与 Fable 5.2 的公开资料状态对照
模型对比

Gemini 4 vs GPT-6 vs Fable 5.2:泄露演示透露了哪些实力变化?

这轮泄露最值得关注的是视觉代码生成:疑似 Gemini 4 的手柄 SVG 已被测试者评价为接近 Astra,疑似新 Fable 则出现更丰富的场景细节,但也有更慢、更贵的反馈。本文逐项分析原帖与演示,区分可期待的进步、测试条件和仍待确认的型号。

16 分钟