跳转到主要内容

Gemini Argon、Opus 5.5、GPT-6.1 对比

截至 2026 年 10 月 1 日,Gemini 4 Argon 尚未公开开放,能用的是 Opus 5.5 和 GPT-6.1 Sol;它首发价同 Sol,单任务成本约 6 倍。

LaoZhang AI Team发布于17 分钟阅读
文章目录
三款模型怎么选:Gemini 4 Argon 未公开开放,Claude Opus 5.5 与 GPT-6.1 Sol 今天可用,附每百万 token 输入输出价格

截至 2026 年 10 月 1 日,三款模型里今天能接进项目的只有两款:Claude Opus 5.5 和 GPT-6.1 Sol(常被简写成“GPT 6.1”,下文都指这一款)。Gemini 4 Argon 在 9 月 30 日发布,但 Google 的公告写的是先向 Fairwind 计划里的一批可信安全防御团队开放,面向开发者、企业和消费者的时间只有“尽快”两个字,没有日期,也没有模型 ID。

所以这周要定方案的话,选择其实在 Opus 5.5 和 GPT-6.1 Sol 之间;Argon 是一个需要提前准备测试、但还不能写进排期的选项。它的首发价和 GPT-6.1 Sol 一样,是 Opus 5.5 的一半;可按 Artificial Analysis 在同一档推理强度下的测量,Argon 跑完一个任务的花费是 $1.99,Opus 5.5 是 $1.82,GPT-6.1 Sol 是 $0.32,三者的综合得分是 53、54、50。单价相同不等于账单相同,这是这次对比里最容易看错的地方。

下面出现的分数和成本都来自 Google 公告或第三方评测机构,每个数字旁边都写了是谁测的、用的哪一档。

今天能用的是哪两款

Gemini 4 ArgonClaude Opus 5.5GPT-6.1 Sol
发布日期2026 年 9 月 30 日2026 年 9 月 22 日2026 年 9 月 29 日
现在谁能用Fairwind 计划内的可信安全防御团队Claude API、Claude Code、Claude 应用的付费方案,以及 AWS、Google Cloud、AzureOpenAI API;ChatGPT Work 与 Codex(Plus、Pro、Business、Enterprise、Edu)
模型 ID未公布claude-opus-5-5gpt-6.1-sol
上下文公告未写;Artificial Analysis 与 Vals 都标 1M1M1,050,000
最大输出公告称 1M,Vals 标 262k128K128,000
输入/输出(每百万 token)首发价 $2/$10,之后 $4/$20$4/$20输入不超过 272K 时 $2/$10,超过后 $4/$15
缓存读取(每百万 token)首发期 $0.10$0.20$0.10,超过 272K 后 $0.20

Gemini 4 Argon、Claude Opus 5.5、GPT-6.1 Sol 的开放状态对照:谁能用、模型 ID、上下文与最大输出

Argon 的开放顺序在公告里是这样排的:先是 Fairwind 名单,同时 Google 参与美国政府的自愿性预发布模型审查,然后逐步扩大;面向公众的第一批是付费 API 客户和 Google AI Ultra 订阅用户。截至 10 月 1 日,Gemini API 价格页上列着 Gemini 3.8 Flash、3.1 Pro Preview 等型号,没有 Argon 或 Gemini 4 这一行。公告同样没有给出速率限制。

Fairwind 是 Google 面向安全防御方的准入计划,公告还提到名单内的团队拿到的是不带网络安全护栏的 Argon。它的性质和资格门槛可以看「Gemini 3.8 Flash Cyber 怎么申请 Fairwind:资格、限制与准备清单」;那篇是为 3.8 Flash Cyber 写的,Argon 的申请步骤 Google 还没有单独公布。

另外两款的细节不在这里展开:Opus 5.5 的计费规则见「Claude Opus 5.5 价格与用量重置:API 账单怎么算,重置卡怎么用」,GPT-6.1 Sol 的入口和迁移改动见「GPT-6.1 Sol 怎么用:价格变化、迁移改动与可用入口」。

牌价:首发期与 Sol 同价,之后与 Opus 同价

Google 给 Argon 定了两个价格。首发价是每百万输入 token $2、输出 $10,缓存输入按输入价打 95% 的折扣,折下来是 $0.10。公告脚注写明,首发期结束后适用 $4/$20。首发期持续多久没有公布,之后缓存折扣是否保留、缓存写入费、批量折扣、长输入是否加价,也都没有公布。

把三家的标准档牌价写成算式,设新输入为 U、缓存读取为 R、输出(含推理 token)为 O,单位都是百万 token:

模型与档位费用(美元)
Gemini 4 Argon 首发期2U + 0.10R + 10O
Gemini 4 Argon 首发期后4U + 20O,缓存价未公布
GPT-6.1 Sol,输入不超过 272K2U + 0.10R + 10O,缓存写入另计每百万 $2.50
GPT-6.1 Sol,输入超过 272K4U + 0.20R + 15O,整个请求都按这一档
Claude Opus 5.54U + 0.20R + 20O,5 分钟缓存写入另计每百万 $5

代入一个例子:一次请求用 10 万新输入、2 万输出,没有缓存。首发期的 Argon 是 0.1 × 2 + 0.02 × 10 = $0.40,GPT-6.1 Sol 同样是 $0.40,Opus 5.5 是 0.1 × 4 + 0.02 × 20 = $0.80;首发期过后,Argon 也变成 $0.80。

也就是说,token 数量相同时,首发期的 Argon 等于 GPT-6.1 Sol、等于 Opus 的一半;首发期一过,它在新输入和输出上就和 Opus 一个价。Opus 的单价在整个 1M 窗口内不变,GPT-6.1 Sol 超过 272K 输入会跳档,Argon 有没有类似的长输入档还不知道。如果你的预算要管到明年,Argon 应该按 $4/$20 来算,$2/$10 只能当作试用期的优惠。

OpenAI 与 Anthropic 的现行单价可在 GPT-6.1 Sol 型号页和 Claude 价格页核对。

跑完一个任务要花多少

牌价算式有个前提:三款模型消耗的 token 一样多。实际上不会一样,推理 token 的多少差别尤其大。Artificial Analysis 的智能指数(Intelligence Index v4.3.2,由 10 项评测组成)同时公布综合得分和跑完指数的平均单任务成本,正好能看出这一层差别。三款模型都取 high 这一档:

模型(high 档)综合得分单任务成本每百万 token 输入/输出
Gemini 4 Argon53$1.99$2/$10(首发价)
Claude Opus 5.554$1.82$4/$20
GPT-6.1 Sol50$0.32$2/$10

数据出自 Artificial Analysis 的 Argon 页面(10 月 1 日)及其 Opus 5.5、GPT-6.1 Sol 的对比页(9 月 30 日)。这个综合分的不确定度大约是 1 分,所以 53 对 54 实际上是平手,50 到 53 的差距也不大。

同为 high 档时三款模型的综合得分与单任务成本:Gemini 4 Argon 53 分 $1.99,Claude Opus 5.5 54 分 $1.82,GPT-6.1 Sol 50 分 $0.32

从这张表能读出三件事:

  1. Argon 与 GPT-6.1 Sol 牌价相同,单任务成本却是 1.99 ÷ 0.32 ≈ 6.2 倍。差出来的不是单价,是用掉的 token:Artificial Analysis 记录 Argon 跑完整个指数输出了 1.1 亿 token。
  2. Argon 的单价只有 Opus 的一半,单任务成本反而略高($1.99 对 $1.82)。在这套评测里,半价被更多的 token 抵消了。
  3. 这个 $1.99 是按首发价算的。假设 token 用量不变、全部按翻倍后的单价计费,首发期结束后大约是 $4,到时会是 Opus high 档的两倍多。缓存价未公布,这只是一个粗略的推算。

推理强度换一档,位置也会变。Artificial Analysis 目前只发布了 Argon 的 high 档,另外两款各有五档:

推理强度Opus 5.5 得分/成本GPT-6.1 Sol 得分/成本
low42/$0.5542/$0.13
medium51/$1.3448/$0.21
high54/$1.8250/$0.32
xhigh56/$3.4651/$0.39
max58/$5.9852/$0.72

GPT-6.1 Sol 开到 max 是 52 分、$0.72,和 Argon high 的 53 分只差 1 分,成本是它的 36%。Opus 开到 max 是 58 分,比 Argon high 高 5 分,但成本是 $5.98。“Opus 58 对 Argon 53”这组常被引用的数字,是 Opus 的 max 档对 Argon 的 high 档,两边不在同一档上,不能直接当作模型差距。

Vals 的结果从另一个方向印证了成本要看任务。Vals 的 Argon 页面显示,在覆盖金融、编码、法律、税务的 Vals Index 上,Argon 以 68.90% 排在 41 个模型的第一位,每个测试 $15.68;Claude Sonnet 5.5 是 67.04%、$21.34,Opus 5.5 是 66.97%、$32.14。这里 Vals 给 Argon 用的是 $4/$20 的首发期后价格,推理强度同样是 high,所以这是按贵的那个价算出来的,Argon 每个测试的花费仍只有 Opus 的一半左右。据 Kingy AI 的说明,榜上 Opus 与 Sonnet 这两行跑的是 max 档,和 Argon 的 high 档并不对等。但 Vals 也写明,Argon 的成本在长流程代理任务上会明显升高:CUA-bench 每个测试 $193.78,Code Migration 每个测试 $57.82;它在 CUA-bench 上的得分只有 4.83%,8 个模型里排第 7。

GPT-6.1 Sol 在 Vals Index 上的成绩是 61.15%、每个测试 $3.24,这组数字出自 Kingy AI 对 Vals 榜单的转述。按它算,Sol 比 Argon 低约 8 个百分点,成本不到后者的四分之一。

把两家评测合起来看:Argon 和 Opus 5.5 的综合水平接近,谁更省钱取决于评测内容和任务长度;GPT-6.1 Sol 分数低一截,但便宜得多。这些都是评测集上的平均值,换成你自己的任务,需要看的是通过验收的那部分结果各花了多少钱。Opus 与 Sol 两款之间更细的成本账见「Claude Opus 5.5 对比 GPT-6 Sol 与 6.1 Sol:先看任务,再算合格交付成本」。

Google 的跑分表该怎么读

Google 公告里的跑分表有四列:Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。表里没有 GPT-6.1 Sol,所以 Argon 与 Sol 的差距无法从这张表得出,只能看前面的第三方数据。

Argon 与 Opus 5.5 都有成绩的 18 项里,Argon 领先 14 项,Opus 领先 4 项。领先的方向很有规律:

评测(Google 公告,%)ArgonOpus 5.5领先方
Terminal-bench 4.057.466.4Opus
FrontierSWE v255.062.3Opus
Terminal-Bench Science 0.157.663.3Opus
PostTrainBench45.349.3Opus
DeepSWE v1.177.974.2Argon
Vibe Code Bench91.990.3Argon
AutomationBench51.342.5Argon
Vals Finance Agent v265.458.6Argon
Harvey Legal Agent19.63.8Argon
GraphWalks 256k–1M84.266.8Argon
LVBench91.783.7Argon
LABBench 288.873.1Argon
RiemannBench76.069.6Argon
Agent's Last Exam39.538.2Argon

Opus 领先的四项是两个终端类评测、FrontierSWE 和归在机器学习工程下的 PostTrainBench;Argon 的优势在金融与法律类知识工作、长上下文(GraphWalks 在 256k 到 1M 区间差 17 个百分点)、LVBench 这样的多模态理解,以及科学与数学类的 LABBench 2 和 RiemannBench。编码这一类两边各有胜负:DeepSWE 和 Vibe Code Bench 是 Argon 高,Terminal-bench 和 FrontierSWE 是 Opus 高,其中 Terminal-bench 差 9 个百分点。

读这张表要记住两点。第一,它是厂商自己跑或自己汇总的成绩,没有独立复现。Kingy AI 读过 Google 的评测方法文件后指出几处设置并不对等,例如 Argon 的 Terminal-Bench Science 用了 6 倍的验证超时,LVBench 上各模型拿到的视频帧数不同;这是 Kingy 一家的解读。第二,独立机构的数字和它大体一致但差距更小:Vals Index 上 Argon 比 Opus 高约 2 个百分点,Artificial Analysis 同档下两者平手。

人工盲评方面,据 Kingy AI 转述,Arena 在 9 月 30 日的文本榜上 Argon High 以 1,525 分排第一,Opus 5.5 High 为 1,504 分,GPT-6.1 Sol 不在那张表里。Arena 反映的是投票者的偏好,不是任务做对了没有。提示注入方面,Google 的原话是 Argon“处于领先”;VentureBeat 的报道转述了公告中 Gray Swan 间接提示注入图表的攻击成功率,Argon 为 0.7%,Opus 5.5 为 1.0%,图中没有 GPT-6.1 Sol。

1M 输出上限是怎么回事

Google 在公告里说,Argon 的输出 token 上限从此前的 64K 提高到 1M,理由是让模型有余量深入思考,在一条轨迹里生成几十万 token。Vals 的模型页写的却是“1M 上下文、最大输出 262k”。

两个数字目前无法对上:1M 是 Google 宣布的上限,从措辞看包含推理 token;262k 是 Vals 对它所测端点的标注。公开的 API 文档还不存在,所以不要按“一次能返回 100 万 token 的正文”来设计流程。可以确定的只有一点:这个上限是给长推理留的空间,而三家的推理 token 都算在输出里,前面 Argon 单任务成本偏高正是同一件事的另一面。相比之下,Opus 5.5 和 GPT-6.1 Sol 的最大输出都是 128K,写在各自的官方文档里。

现在先用什么,Argon 开放后先测什么

Argon 没有公开日期,手头的项目不必等它。在 Opus 5.5 和 GPT-6.1 Sol 之间,可以按下面的条件分:

  • 量大、单个任务出错可以重跑:先用 GPT-6.1 Sol。high 档每任务 $0.32,开到 max 也只有 $0.72,分数与 Argon high 相差 1 到 3 分。
  • 终端里的长流程编码、仓库级改动、机器学习工程任务:先用 Opus 5.5。这是连 Google 自己的表格都显示 Opus 领先的范围,而且 Opus 今天就能调用。
  • 金融、法律文档处理,或几十万 token 以上的长上下文检索:这是 Argon 数字最好看的范围,也是开放后最值得第一时间试的。在那之前,先用上面两款把流程和验收标准搭起来,到时只需要换模型重跑。
  • 只用订阅、不走 API:Argon 会先给 Google AI Ultra 订阅用户,其余方案的时间未定;眼下可选的仍是 Claude 和 ChatGPT 的付费方案。

如果你打算在 Argon 开放当天就评估它,现在可以准备的是一组自己的任务:20 到 50 个有明确验收标准的真实案例,记录好当前模型在每个案例上的通过情况、输入输出 token 和费用。Argon 上线后按这个顺序看:

  1. 先确认合同条件。模型 ID、速率限制、最大输出、缓存写入和批量价格,这些在公告里都是空白。
  2. 用同一档推理强度跑同一批任务,分别记下通过率和每个通过任务的平均费用,不要只比单次调用的价格。
  3. 把费用按 $4/$20 再算一遍。如果只有在首发价下才划算,那么首发期结束时就得再迁移一次。
  4. 单独看长任务。Vals 的数据提示 Argon 在长流程代理任务上成本上升很快,给单任务设一个输出 token 或费用上限再跑。
  5. 留意输出长度。如果任务需要很长的可见输出,实测能返回多少,不要假定 1M。

Argon 是否值得切换,最终取决于第 2 步和第 3 步的结果:在你的任务上通过率明显更高,并且按 $4/$20 计算仍然不比现有方案贵,才有迁移的理由。只在 OpenAI 自家型号之间比较的话,可以看「GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选」;预算更紧、想在 Anthropic 内部降一档,见「Sonnet 5.5 和 Opus 5.5 怎么选:半价未必更省」。

GPT-6.1 Sol、GPT-6 Sol 与 GPT-6 Astra 的 API 输入输出单价和缓存输入价格对照
模型对比

GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选

GPT-6.1 Sol 与 GPT-6 Sol 同价、各档更强,改好推理强度和工具调用就能换;Astra 单价高 5 倍,只在顶档能力、最难科学任务和 Ultrafast 上值得。

21 分钟
Sonnet 5.5 对比 GPT-6 Astra 封面:官方单价便宜 5 倍,max 档指数 56 比 53,但每任务成本 $7.60 比 $3.26
模型对比

Sonnet 5.5 对比 GPT-6 Astra:值不值得换

“超越 Astra”只在两边都开 max 时成立,这一档 Sonnet 5.5 每任务反而贵约 2.3 倍。high 及以下能过验收的任务换过去更省,max 级长任务先别换。

21 分钟