GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选
GPT-6.1 Sol 与 GPT-6 Sol 同价、各档更强,改好推理强度和工具调用就能换;Astra 单价高 5 倍,只在顶档能力、最难科学任务和 Ultrafast 上值得。
文章目录

截至 2026 年 9 月 30 日,三款模型的关系可以这样理解:GPT-6.1 Sol 是 9 月 29 日发布的 GPT-6 Sol 升级版,API 标价和 GPT-6 Sol 一样,只有缓存输入从每百万 Token $0.20 降到 $0.10;GPT-6 Astra 仍是 OpenAI 能力最强的型号,普通输入和输出单价都是 6.1 Sol 的 5 倍。
按你现在用的型号,结论分三种:
- 在用
gpt-6-sol:换到gpt-6.1-sol。 在 Artificial Analysis 智能指数(以下简称 AA)里,同一推理强度下 6.1 Sol 高出 4~8 分,每道题的成本持平或更低。直接改模型名之前,先查请求里的none/minimal推理强度、Chat Completions 里的工具调用和temperature这类采样参数,这三处在 6.1 Sol 上都会出问题。 - 在用 Astra 的
low到xhigh:拿同一批任务在 6.1 Sol 上高一档试跑。 AA 里分数对齐后,6.1 Sol 每道题的成本约为 Astra 的 1/5 到 1/3。 - 继续用 Astra: 任务只有 Astra
max才做得出来、属于最难的科学研究类工作、需要 API 的 Ultrafast,或者一次失败的返工代价远高于 API 费用。
GPT-6 Sol 没有进入弃用列表,也没有公布停用日期。请求没改好之前继续用它,不会突然失效。
三个型号的关系和标价
下表是 OpenAI 直连 API 的 Standard 档、单次输入不超过 272K Token 时的单价(美元 / 每百万 Token),来自 GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 的模型页。
| 项目 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| 模型 ID | gpt-6.1-sol | gpt-6-sol | gpt-6-astra |
| 发布日期 | 2026 年 9 月 29 日 | 2026 年 9 月 22 日 | 2026 年 9 月 3 日 |
| OpenAI 的定位 | 接近 Astra 的表现,成本更低 | 模型页指向更新的 6.1 Sol | 能力最强,用于最难的推理、编码和专业工作 |
| 输入 | $2.00 | $2.00 | $10.00 |
| 缓存输入 | $0.10 | $0.20 | $1.00 |
| 缓存写入 | $2.50 | $2.50 | $12.50 |
| 输出 | $10.00 | $10.00 | $50.00 |
| 可用推理强度 | low 到 max | none 到 max | low 到 max |
| 知识截止 | 2026 年 4 月 30 日 | 2026 年 4 月 20 日 | 2026 年 4 月 30 日 |
三款的上下文窗口都是 1,050,000 Token,单次最多输出 128,000 Token。计费规则也相同:单次输入超过 272K Token 时,整次请求的输入和缓存按 2 倍、输出按 1.5 倍计价,6.1 Sol 变成 $4 / $0.20 / $5 / $15,Astra 变成 $20 / $2 / $25 / $75,倍数关系不变。Batch 和 Flex 是 Standard 的一半,Fast 是 2 倍,区域处理(数据驻留)另加 10%,见 OpenAI API 定价页。Astra 在长上下文、缓存写入和各服务档位下的完整算法,可以看 GPT-6 Astra API 定价与成本计算。
API 里只有 Astra 能用的是 Ultrafast。定价页的 Ultrafast 表里只有 gpt-6-astra:输入 $60、输出 $300,是 Standard 的 6 倍,只支持全球处理和美国数据驻留。OpenAI 的发布文章说 GPT-6.1 Sol Ultrafast 同时推出,但 API 定价页没有它的价格,ChatGPT 的模型说明页写的是 6.1 Sol 的 Ultrafast“稍后推出”。现在需要 Ultrafast,只能用 Astra。
至于 GPT-6 Sol,API 定价页的旗舰表已经换成 6.1 Sol 那一行,GPT-6 Sol 的价格仍在它自己的模型页上,页面注明“更新的 Sol 模型见 GPT-6.1 Sol”;弃用页里没有它。AA 的文章标题说 6.1 Sol“7 天就取代了 GPT-6 Sol”,指的是推荐位置,不是下线。
GPT-6 Luna 和 GPT-5.6 Terra 在整个阵容里的位置,见 GPT-6 Sol、Luna、Astra 与 Terra 怎么选;那篇写于 6.1 Sol 发布之前,其中 Sol 一行的价格除缓存输入外仍然适用。
“五分之一的价格”要放进你的请求里算
“价格是 Astra 的五分之一”只对普通输入、缓存写入和输出成立;缓存输入是十分之一。智能体任务往往反复发送相同的上下文前缀,缓存命中多,所以实际倍数落在 5 到 10 之间,缓存占比越高、输出越少,越接近 10。
用一次假设的调用算一遍:输入 200,000 Token,其中 150,000 命中缓存、50,000 未命中,输出 20,000 Token,Standard 档,不计缓存写入。Token 数换算成百万为单位代入单价:
- GPT-6.1 Sol:0.05 × $2 + 0.15 × $0.10 + 0.02 × $10 = $0.100 + $0.015 + $0.200 = $0.315
- GPT-6 Sol:0.05 × $2 + 0.15 × $0.20 + 0.02 × $10 = $0.100 + $0.030 + $0.200 = $0.330
- GPT-6 Astra:0.05 × $10 + 0.15 × $1 + 0.02 × $50 = $0.50 + $0.15 + $1.00 = $1.65
这一笔 Astra 是 6.1 Sol 的约 5.2 倍。
6.1 Sol 对 GPT-6 Sol 的差距就小得多,这里只省 $0.015,全部来自缓存输入。AA 还测到,同一推理强度下 6.1 Sol 的输出 Token 比 GPT-6 Sol 多约 10%~30%。在上面这笔调用里,输出只要多 7.5%(1,500 Token,$0.015),缓存省下的钱就抵消了;多 20% 时 6.1 Sol 要 $0.355,比 GPT-6 Sol 还贵 $0.025。所以从 GPT-6 Sol 换过来,单次请求不一定更便宜,真正的收益是同档分数更高,可以把推理强度降一档,下一节的 AA 数据会说明这一点。
这笔账还假设三个模型用的 Token 一样多,实际通常不一样。OpenAI 说 Astra 在多项评测里比前代模型用更少的输出 Token 拿到更好的结果,AA 则测得 6.1 Sol 比 GPT-6 Sol 输出更多。所以比较三者,最终要看完成一个任务花多少钱,而不是每个 Token 多少钱。
差距有多大:先分清是谁测的
下面的数字分三类:OpenAI 自己公布的、AA 独立测的,以及用 AA 数据算出来的对照。它们都不是在你的任务上跑出来的,条件随每组数字给出。
AA 智能指数:按推理强度逐档对照
AA 智能指数 v4.3.2 由 10 项评测组成,三个模型的五档推理强度都有完整结果。每格是“指数得分 / 每任务成本”。每任务成本是 AA 跑一道指数题的加权平均花费,反映的是这套测试的工作量,不是你的账单。
| 推理强度 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
low | 42 / $0.13 | 34 / $0.13 | 46 / $0.82 |
medium | 48 / $0.21 | 40 / $0.25 | 50 / $1.54 |
high | 50 / $0.32 | 43 / $0.38 | 51 / $1.73 |
xhigh | 51 / $0.39 | 44 / $0.52 | 52 / $2.31 |
max | 52 / $0.72 | 48 / $1.05 | 53 / $3.26 |
数据来自 AA 的 GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 发布页,截至 2026 年 9 月 30 日,之后可能更新。
从这张表能读出三件事:
- 对 GPT-6 Sol 是全面提升。 同一档位,6.1 Sol 分别高 8、8、7、7、4 分,每任务成本持平或更低。6.1 Sol
medium得 48 分、花 $0.21,已经和 GPT-6 Solmax的 48 分持平,成本是后者的 1/5。原来为了质量把 GPT-6 Sol 开到max的,换过来可以从medium或high试起。 - 对 Astra,同名档位只差 1~4 分。 Astra 在
low领先 4 分,medium领先 2 分,high到max都只领先 1 分。 - 按分数对齐,6.1 Sol 便宜 3~5 倍。 6.1 Sol
high(50 分,$0.32)对应 Astramedium(50 分,$1.54),约 4.8 倍;xhigh(51 分,$0.39)对应 Astrahigh(51 分,$1.73),约 4.4 倍;max(52 分,$0.72)对应 Astraxhigh(52 分,$2.31),约 3.2 倍。Astramax的 53 分,6.1 Sol 没有哪一档够得着。

输出速度方面,AA 测得 6.1 Sol 各档每秒约 59~66 个 Token,Astra 约 44~51 个。不过完成一个任务要多久,还取决于它输出多少 Token。
指数差 1 分,是 10 项评测平均后的结果,单项差距可能大得多,下面 OpenAI 公布的 Terminal-Bench Science 就是一例。
AA 编码智能体指数:xhigh 比 max 更好
在 AA 的编码智能体指数(Coding Agent Index)里,6.1 Sol xhigh 比 Astra 高 1 分,每任务成本不到 Astra 的 15%;比 GPT-6 Sol max 高 6 分。更值得注意的是,6.1 Sol xhigh 比它自己的 max 还高 3 分,max 反而比 Astra 低 2 分。跑编码智能体时,不要默认开满,先试 xhigh。
同一篇 AA 文章还提到,6.1 Sol 在 Terminal-Bench 4.0 上比 GPT-6 Sol 高 12 分,AA-Omniscience 幻觉率从 60% 降到 54%。
OpenAI 公布的对比
以下来自 OpenAI 的 GPT-6.1 Sol 发布文章,测试在研究环境或 API 中进行,OpenAI 注明可能与正式版 ChatGPT 略有差异:
- 编程(DeepSWE v1.1):6.1 Sol 以约五分之一的成本达到与 Astra 相当的水平;用更低的推理强度和成本,比 GPT-6 Sol 的最高分高 6.4 个百分点。
- 计算机使用(OSWorld 2.0,部分奖励得分):最高推理强度下比 GPT-6 Sol 高 7 个百分点、成本不到一半;与 Astra 相差 2.1 个百分点以内,单任务成本约为 Astra 的七分之一。
- 科学研究(Terminal-Bench Science 0.1):平均单任务成本 6.1 Sol $5.47、Astra $23.80,但 Astra 以 68.1% 排第一,OpenAI 明确说最具挑战性的科学研究任务应使用 Astra。
- 事实错误率(
xhigh,刻意挑选的高难度提示):6.1 Sol 4.1%、GPT-6 Sol 4.5%、Astra 4.0%。 - 搜索工具出错却未告知用户的比例(
max,对抗性测试):6.1 Sol 2.1%、GPT-6 Sol 4.9%、Astra 1.5%。
这些是厂商自报结果,和 AA 的方向一致:6.1 Sol 大幅领先 GPT-6 Sol,离 Astra 很近,但在最难的一端 Astra 仍然领先。
推理强度怎么对档
把上面的数据落到具体配置上,可以从下表开始试。OpenAI 在 Codex 文档里说过,不同代模型的推理强度并不一一对应,所以这只是试跑的起点,每一行都要用你的任务确认。
| 你现在用 | 先试 GPT-6.1 Sol 的 | 依据 |
|---|---|---|
GPT-6 Sol none 或 minimal | low | 6.1 Sol 不支持这两档,OpenAI 迁移指南建议从 low 开始 |
GPT-6 Sol low 到 xhigh | 同档,再试低一档 | AA 同档高 7~8 分,成本不高于 GPT-6 Sol |
GPT-6 Sol max | medium 或 high | AA 中 6.1 Sol medium 与 GPT-6 Sol max 同为 48 分 |
Astra low | medium | AA 中 6.1 Sol medium 48 分、$0.21,高于 Astra low 的 46 分、$0.82 |
Astra medium | high | 同为 50 分 |
Astra high | xhigh | 同为 51 分 |
Astra xhigh | max;编码智能体先试 xhigh | 同为 52 分;编码智能体指数里 xhigh 高于 max |
Astra max | 不换 | 6.1 Sol 最高 52 分,没有对应档 |
API 里的档位写在 reasoning.effort(Responses)或 reasoning_effort(Chat Completions)里,取值是 low、medium、high、xhigh、max,不写时 6.1 Sol 默认 medium。Codex 和 ChatGPT 工作模式的界面用另一套名称,从 Light 到 Ultra(CLI 里 Light 显示为 Low),其中 Ultra 会把任务拆给多个子代理并行处理,Max 和 Ultra 是否出现取决于你的设置。两套名称不要混用,写配置时以 API 取值为准。
把 gpt-6-sol 换成 gpt-6.1-sol 前要检查的地方
只用 Responses API、推理强度为 low 及以上的请求,通常改一个模型名就能跑。下面这些情况例外,依据是 OpenAI 的 GPT-6 使用与迁移指南:
- 推理强度
none或minimal。 6.1 Sol 和 Astra 都不支持,请求会失败。改成low;如果原来用none是为了压延迟,要重新测响应时间。 - Chat Completions 里的工具调用。 GPT-6 Sol 在 Chat Completions 里只有
reasoning_effort为none时才能调函数;6.1 Sol 的 Chat Completions 完全不支持工具调用。带工具的请求要先迁到 Responses API,不带工具的 Chat Completions 请求可以照常用。 - 采样参数。 推理强度不是
none时,要删掉temperature、top_p、top_logprobs;Chat Completions 还要删logprobs,Responses 要从include里去掉message.output_text.logprobs。原来在 GPT-6 Sol 上用none配这些参数的,改成low后必须一起删。 - 输出量和预算。 6.1 Sol 的输出 Token 比 GPT-6 Sol 多约 10%~30%。如果你给输出设了较紧的上限,或者按 Token 设了预算告警,先放宽再观察。
- 图片输入的旧评测。 OpenAI 在 9 月 25 日修复了一个图像编码问题,它曾拉低 GPT-6 Sol 和 Luna 在 API 与 Codex(包括计算机使用)中的看图能力。9 月 25 日之前用 GPT-6 Sol 做的看图对比低估了它,拿来和 6.1 Sol 比之前要重跑。
- 速度档与数据驻留。 API 里 6.1 Sol 有 Standard、Batch、Flex 和 Fast,没有 Ultrafast。它支持美国和欧盟数据驻留,欧盟数据驻留下没有 Fast,这一点和 GPT-6 Sol 一样。
- 安全研究类任务。 OpenAI 把 6.1 Sol 的网络安全能力评为 Critical、生物与化学评为 High,套用和 Astra 相同的一整套安全防护,见 GPT-6.1 Sol 系统卡补充。做漏洞研究、渗透测试一类工作,从 GPT-6 Sol 迁过来前先用真实任务跑一遍。
检查完之后,先把一小部分流量切过去,对比通过率、输出 Token 和耗时,再决定全量切换。逐项改请求的具体写法,见 GPT-6.1 Sol 怎么用:价格变化、迁移改动与可用入口。
什么时候仍该用 Astra
6.1 Sol 离 Astra 很近,但下面几种情况,多付的钱仍然有回报:
- 任务只有 Astra
max才能完成。 AA 里 Astramax的 53 分在 6.1 Sol 那边没有对应档。如果你的任务在 Astraxhigh上已经常常失败、只能靠max,6.1 Sol 很可能也做不下来。 - 最难的科学研究任务。 Terminal-Bench Science 上 Astra 排第一,OpenAI 自己也说这类任务应该用 Astra。
- 完整的端到端长流程。 OpenAI 的 Codex 文档把 Astra 推荐给需要跨代码、应用和资料持续推理与判断的完整工作流,并说它更会在关键处提问、在接受新要求的同时守住原始目标;6.1 Sol 则推荐给注重成本、重复执行的长时间任务。
- 需要 API 的 Ultrafast。 目前只有 Astra 有公布价格。
- 失败很贵。 一次失败的人工检查、返工或线上事故成本远高于 API 费用时,Astra 的通过率哪怕只高一点,也可能更划算,下一节给出算法。
- 要在 ChatGPT 聊天里用。 6.1 Sol 只在工作模式和 Codex 里,不在聊天中;Astra 以 GPT-6 Pro 的形式出现在部分付费套餐的聊天里。
如果你想找的是 Astra 的跨厂商替代,可以看 Sonnet 5.5 对比 GPT-6 Astra:值不值得换。
在自己的任务上确认:算每个合格结果的成本
API 单价差 5 倍,但决定选谁的往往不是这 5 倍,而是失败的代价。用这个式子比较:
每个合格结果的成本 = (每次尝试的 API 费用 + 每次尝试的人工检查与返工成本) ÷ 通过率
继续用前面那笔调用(6.1 Sol $0.315,Astra $1.65,假设两边 Token 用量相同):
- 只看 API 费用: 只要 6.1 Sol 的通过率高于 Astra 的 19%(0.315 ÷ 1.65),它就更便宜。按这个标准,几乎所有任务都该用 6.1 Sol。
- 加上人工成本: 假设每次尝试都要人工检查,折合 $5。Astra 每次尝试共 $6.65,6.1 Sol 共 $5.315,盈亏点变成 5.315 ÷ 6.65 ≈ 80%。也就是说,Astra 能过 90% 的任务,6.1 Sol 至少要过 72% 才划算。
检查越贵,Astra 在通过率上的每一点优势越值钱;验收能自动完成、失败重跑就行的任务,6.1 Sol 几乎总是赢。

具体做法:
- 挑一批有代表性的真实任务,包括你最难的那类,先写好通过标准,能自动判定的尽量自动判定。
- Astra 用现在的档位跑一遍作为基线;6.1 Sol 按前面的对档表跑,再加高一档。
- 每次记录 API 返回的 usage(输入、缓存命中、输出 Token)、是否通过、耗时。
- 按任务类型分别代入上式。6.1 Sol 通过率不明显落后的类型切过去,其余留在 Astra,两者可以分流并用。
从 GPT-6 Sol 迁到 6.1 Sol 也可以用同一套流程,重点是确认请求没有报错、输出量增加后账单仍可接受,并试试低一档能不能守住原来的通过率。同一思路在跨厂商比较中的用法,见 Claude Opus 5.5 对比 GPT-6 Sol:先看任务,再算每次合格交付的成本。
Codex 和 ChatGPT 工作模式里怎么选
上面的 API 单价不能换算成套餐额度。Codex 和 ChatGPT 工作模式里,模型消耗的是 ChatGPT 积分,OpenAI 的模型说明页把各模型的积分消耗指向套餐定价页。想知道哪个更省额度,要用那里的数字比较,不能拿 API 单价推算。
可用范围按官方说明:
- GPT-6.1 Sol: 首批覆盖 Plus、Pro、Business、Enterprise 和 Edu,可在 Codex(桌面应用、CLI)和 ChatGPT 工作模式(网页、手机)中使用。Enterprise 和 Edu 默认关闭,需要管理员开启;Free 和 Go 首批不包含。6.1 Sol、GPT-6 Sol 和 Luna 只在工作模式和 Codex 里,不在聊天中。
- GPT-6 Astra: Plus 可在工作模式和 Codex 中使用;Pro、Business 和 Enterprise 还能在聊天里用由 Astra 驱动的 GPT-6 Pro;Free 和 Go 没有 Astra。OpenAI 同时推出了每月 $500 的新 Pro 档位,Astra Ultrafast 在其中的工作模式和 Codex 里开放。
在 CLI 里指定模型:
codex -m gpt-6.1-sol
codex -m gpt-6-astraOpenAI 文档里示意的桌面应用 Power 预设是 Luna、GPT-6 Sol 和 Astra 的几种组合,实际选项因套餐和灰度而异;要用 6.1 Sol,在高级(Advanced)里指定模型。选中某个模型不会自动获得使用权限,是否可用取决于套餐、客户端和工作区设置。OpenAI 给 Codex 的建议和 API 一致:注重成本、重复执行的长任务用 6.1 Sol,最难的端到端工作留给 Astra。
不直连 OpenAI 的话,Microsoft Foundry 和 Amazon Bedrock 的文档也已列出 GPT-6.1 Sol,价格以各平台为准,不能直接套用上面的 OpenAI 直连单价。直连 OpenAI 时,Astra 的访问条件与首次调用排查见 GPT-6 Astra API 怎么开通。





