Gemini Argon、Opus 5.5、GPT-6.1 对比
截至 2026 年 10 月 1 日,Gemini 4 Argon 尚未公开开放,能用的是 Opus 5.5 和 GPT-6.1 Sol;它首发价同 Sol,单任务成本约 6 倍。
文章目录

截至 2026 年 10 月 1 日,三款模型里今天能接进项目的只有两款:Claude Opus 5.5 和 GPT-6.1 Sol(常被简写成“GPT 6.1”,下文都指这一款)。Gemini 4 Argon 在 9 月 30 日发布,但 Google 的公告写的是先向 Fairwind 计划里的一批可信安全防御团队开放,面向开发者、企业和消费者的时间只有“尽快”两个字,没有日期,也没有模型 ID。
所以这周要定方案的话,选择其实在 Opus 5.5 和 GPT-6.1 Sol 之间;Argon 是一个需要提前准备测试、但还不能写进排期的选项。它的首发价和 GPT-6.1 Sol 一样,是 Opus 5.5 的一半;可按 Artificial Analysis 在同一档推理强度下的测量,Argon 跑完一个任务的花费是 $1.99,Opus 5.5 是 $1.82,GPT-6.1 Sol 是 $0.32,三者的综合得分是 53、54、50。单价相同不等于账单相同,这是这次对比里最容易看错的地方。
下面出现的分数和成本都来自 Google 公告或第三方评测机构,每个数字旁边都写了是谁测的、用的哪一档。
今天能用的是哪两款
| Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol | |
|---|---|---|---|
| 发布日期 | 2026 年 9 月 30 日 | 2026 年 9 月 22 日 | 2026 年 9 月 29 日 |
| 现在谁能用 | Fairwind 计划内的可信安全防御团队 | Claude API、Claude Code、Claude 应用的付费方案,以及 AWS、Google Cloud、Azure | OpenAI API;ChatGPT Work 与 Codex(Plus、Pro、Business、Enterprise、Edu) |
| 模型 ID | 未公布 | claude-opus-5-5 | gpt-6.1-sol |
| 上下文 | 公告未写;Artificial Analysis 与 Vals 都标 1M | 1M | 1,050,000 |
| 最大输出 | 公告称 1M,Vals 标 262k | 128K | 128,000 |
| 输入/输出(每百万 token) | 首发价 $2/$10,之后 $4/$20 | $4/$20 | 输入不超过 272K 时 $2/$10,超过后 $4/$15 |
| 缓存读取(每百万 token) | 首发期 $0.10 | $0.20 | $0.10,超过 272K 后 $0.20 |

Argon 的开放顺序在公告里是这样排的:先是 Fairwind 名单,同时 Google 参与美国政府的自愿性预发布模型审查,然后逐步扩大;面向公众的第一批是付费 API 客户和 Google AI Ultra 订阅用户。截至 10 月 1 日,Gemini API 价格页上列着 Gemini 3.8 Flash、3.1 Pro Preview 等型号,没有 Argon 或 Gemini 4 这一行。公告同样没有给出速率限制。
Fairwind 是 Google 面向安全防御方的准入计划,公告还提到名单内的团队拿到的是不带网络安全护栏的 Argon。它的性质和资格门槛可以看「Gemini 3.8 Flash Cyber 怎么申请 Fairwind:资格、限制与准备清单」;那篇是为 3.8 Flash Cyber 写的,Argon 的申请步骤 Google 还没有单独公布。
另外两款的细节不在这里展开:Opus 5.5 的计费规则见「Claude Opus 5.5 价格与用量重置:API 账单怎么算,重置卡怎么用」,GPT-6.1 Sol 的入口和迁移改动见「GPT-6.1 Sol 怎么用:价格变化、迁移改动与可用入口」。
牌价:首发期与 Sol 同价,之后与 Opus 同价
Google 给 Argon 定了两个价格。首发价是每百万输入 token $2、输出 $10,缓存输入按输入价打 95% 的折扣,折下来是 $0.10。公告脚注写明,首发期结束后适用 $4/$20。首发期持续多久没有公布,之后缓存折扣是否保留、缓存写入费、批量折扣、长输入是否加价,也都没有公布。
把三家的标准档牌价写成算式,设新输入为 U、缓存读取为 R、输出(含推理 token)为 O,单位都是百万 token:
| 模型与档位 | 费用(美元) |
|---|---|
| Gemini 4 Argon 首发期 | 2U + 0.10R + 10O |
| Gemini 4 Argon 首发期后 | 4U + 20O,缓存价未公布 |
| GPT-6.1 Sol,输入不超过 272K | 2U + 0.10R + 10O,缓存写入另计每百万 $2.50 |
| GPT-6.1 Sol,输入超过 272K | 4U + 0.20R + 15O,整个请求都按这一档 |
| Claude Opus 5.5 | 4U + 0.20R + 20O,5 分钟缓存写入另计每百万 $5 |
代入一个例子:一次请求用 10 万新输入、2 万输出,没有缓存。首发期的 Argon 是 0.1 × 2 + 0.02 × 10 = $0.40,GPT-6.1 Sol 同样是 $0.40,Opus 5.5 是 0.1 × 4 + 0.02 × 20 = $0.80;首发期过后,Argon 也变成 $0.80。
也就是说,token 数量相同时,首发期的 Argon 等于 GPT-6.1 Sol、等于 Opus 的一半;首发期一过,它在新输入和输出上就和 Opus 一个价。Opus 的单价在整个 1M 窗口内不变,GPT-6.1 Sol 超过 272K 输入会跳档,Argon 有没有类似的长输入档还不知道。如果你的预算要管到明年,Argon 应该按 $4/$20 来算,$2/$10 只能当作试用期的优惠。
OpenAI 与 Anthropic 的现行单价可在 GPT-6.1 Sol 型号页和 Claude 价格页核对。
跑完一个任务要花多少
牌价算式有个前提:三款模型消耗的 token 一样多。实际上不会一样,推理 token 的多少差别尤其大。Artificial Analysis 的智能指数(Intelligence Index v4.3.2,由 10 项评测组成)同时公布综合得分和跑完指数的平均单任务成本,正好能看出这一层差别。三款模型都取 high 这一档:
| 模型(high 档) | 综合得分 | 单任务成本 | 每百万 token 输入/输出 |
|---|---|---|---|
| Gemini 4 Argon | 53 | $1.99 | $2/$10(首发价) |
| Claude Opus 5.5 | 54 | $1.82 | $4/$20 |
| GPT-6.1 Sol | 50 | $0.32 | $2/$10 |
数据出自 Artificial Analysis 的 Argon 页面(10 月 1 日)及其 Opus 5.5、GPT-6.1 Sol 的对比页(9 月 30 日)。这个综合分的不确定度大约是 1 分,所以 53 对 54 实际上是平手,50 到 53 的差距也不大。

从这张表能读出三件事:
- Argon 与 GPT-6.1 Sol 牌价相同,单任务成本却是 1.99 ÷ 0.32 ≈ 6.2 倍。差出来的不是单价,是用掉的 token:Artificial Analysis 记录 Argon 跑完整个指数输出了 1.1 亿 token。
- Argon 的单价只有 Opus 的一半,单任务成本反而略高($1.99 对 $1.82)。在这套评测里,半价被更多的 token 抵消了。
- 这个 $1.99 是按首发价算的。假设 token 用量不变、全部按翻倍后的单价计费,首发期结束后大约是 $4,到时会是 Opus high 档的两倍多。缓存价未公布,这只是一个粗略的推算。
推理强度换一档,位置也会变。Artificial Analysis 目前只发布了 Argon 的 high 档,另外两款各有五档:
| 推理强度 | Opus 5.5 得分/成本 | GPT-6.1 Sol 得分/成本 |
|---|---|---|
| low | 42/$0.55 | 42/$0.13 |
| medium | 51/$1.34 | 48/$0.21 |
| high | 54/$1.82 | 50/$0.32 |
| xhigh | 56/$3.46 | 51/$0.39 |
| max | 58/$5.98 | 52/$0.72 |
GPT-6.1 Sol 开到 max 是 52 分、$0.72,和 Argon high 的 53 分只差 1 分,成本是它的 36%。Opus 开到 max 是 58 分,比 Argon high 高 5 分,但成本是 $5.98。“Opus 58 对 Argon 53”这组常被引用的数字,是 Opus 的 max 档对 Argon 的 high 档,两边不在同一档上,不能直接当作模型差距。
Vals 的结果从另一个方向印证了成本要看任务。Vals 的 Argon 页面显示,在覆盖金融、编码、法律、税务的 Vals Index 上,Argon 以 68.90% 排在 41 个模型的第一位,每个测试 $15.68;Claude Sonnet 5.5 是 67.04%、$21.34,Opus 5.5 是 66.97%、$32.14。这里 Vals 给 Argon 用的是 $4/$20 的首发期后价格,推理强度同样是 high,所以这是按贵的那个价算出来的,Argon 每个测试的花费仍只有 Opus 的一半左右。据 Kingy AI 的说明,榜上 Opus 与 Sonnet 这两行跑的是 max 档,和 Argon 的 high 档并不对等。但 Vals 也写明,Argon 的成本在长流程代理任务上会明显升高:CUA-bench 每个测试 $193.78,Code Migration 每个测试 $57.82;它在 CUA-bench 上的得分只有 4.83%,8 个模型里排第 7。
GPT-6.1 Sol 在 Vals Index 上的成绩是 61.15%、每个测试 $3.24,这组数字出自 Kingy AI 对 Vals 榜单的转述。按它算,Sol 比 Argon 低约 8 个百分点,成本不到后者的四分之一。
把两家评测合起来看:Argon 和 Opus 5.5 的综合水平接近,谁更省钱取决于评测内容和任务长度;GPT-6.1 Sol 分数低一截,但便宜得多。这些都是评测集上的平均值,换成你自己的任务,需要看的是通过验收的那部分结果各花了多少钱。Opus 与 Sol 两款之间更细的成本账见「Claude Opus 5.5 对比 GPT-6 Sol 与 6.1 Sol:先看任务,再算合格交付成本」。
Google 的跑分表该怎么读
Google 公告里的跑分表有四列:Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。表里没有 GPT-6.1 Sol,所以 Argon 与 Sol 的差距无法从这张表得出,只能看前面的第三方数据。
Argon 与 Opus 5.5 都有成绩的 18 项里,Argon 领先 14 项,Opus 领先 4 项。领先的方向很有规律:
| 评测(Google 公告,%) | Argon | Opus 5.5 | 领先方 |
|---|---|---|---|
| Terminal-bench 4.0 | 57.4 | 66.4 | Opus |
| FrontierSWE v2 | 55.0 | 62.3 | Opus |
| Terminal-Bench Science 0.1 | 57.6 | 63.3 | Opus |
| PostTrainBench | 45.3 | 49.3 | Opus |
| DeepSWE v1.1 | 77.9 | 74.2 | Argon |
| Vibe Code Bench | 91.9 | 90.3 | Argon |
| AutomationBench | 51.3 | 42.5 | Argon |
| Vals Finance Agent v2 | 65.4 | 58.6 | Argon |
| Harvey Legal Agent | 19.6 | 3.8 | Argon |
| GraphWalks 256k–1M | 84.2 | 66.8 | Argon |
| LVBench | 91.7 | 83.7 | Argon |
| LABBench 2 | 88.8 | 73.1 | Argon |
| RiemannBench | 76.0 | 69.6 | Argon |
| Agent's Last Exam | 39.5 | 38.2 | Argon |
Opus 领先的四项是两个终端类评测、FrontierSWE 和归在机器学习工程下的 PostTrainBench;Argon 的优势在金融与法律类知识工作、长上下文(GraphWalks 在 256k 到 1M 区间差 17 个百分点)、LVBench 这样的多模态理解,以及科学与数学类的 LABBench 2 和 RiemannBench。编码这一类两边各有胜负:DeepSWE 和 Vibe Code Bench 是 Argon 高,Terminal-bench 和 FrontierSWE 是 Opus 高,其中 Terminal-bench 差 9 个百分点。
读这张表要记住两点。第一,它是厂商自己跑或自己汇总的成绩,没有独立复现。Kingy AI 读过 Google 的评测方法文件后指出几处设置并不对等,例如 Argon 的 Terminal-Bench Science 用了 6 倍的验证超时,LVBench 上各模型拿到的视频帧数不同;这是 Kingy 一家的解读。第二,独立机构的数字和它大体一致但差距更小:Vals Index 上 Argon 比 Opus 高约 2 个百分点,Artificial Analysis 同档下两者平手。
人工盲评方面,据 Kingy AI 转述,Arena 在 9 月 30 日的文本榜上 Argon High 以 1,525 分排第一,Opus 5.5 High 为 1,504 分,GPT-6.1 Sol 不在那张表里。Arena 反映的是投票者的偏好,不是任务做对了没有。提示注入方面,Google 的原话是 Argon“处于领先”;VentureBeat 的报道转述了公告中 Gray Swan 间接提示注入图表的攻击成功率,Argon 为 0.7%,Opus 5.5 为 1.0%,图中没有 GPT-6.1 Sol。
1M 输出上限是怎么回事
Google 在公告里说,Argon 的输出 token 上限从此前的 64K 提高到 1M,理由是让模型有余量深入思考,在一条轨迹里生成几十万 token。Vals 的模型页写的却是“1M 上下文、最大输出 262k”。
两个数字目前无法对上:1M 是 Google 宣布的上限,从措辞看包含推理 token;262k 是 Vals 对它所测端点的标注。公开的 API 文档还不存在,所以不要按“一次能返回 100 万 token 的正文”来设计流程。可以确定的只有一点:这个上限是给长推理留的空间,而三家的推理 token 都算在输出里,前面 Argon 单任务成本偏高正是同一件事的另一面。相比之下,Opus 5.5 和 GPT-6.1 Sol 的最大输出都是 128K,写在各自的官方文档里。
现在先用什么,Argon 开放后先测什么
Argon 没有公开日期,手头的项目不必等它。在 Opus 5.5 和 GPT-6.1 Sol 之间,可以按下面的条件分:
- 量大、单个任务出错可以重跑:先用 GPT-6.1 Sol。high 档每任务 $0.32,开到 max 也只有 $0.72,分数与 Argon high 相差 1 到 3 分。
- 终端里的长流程编码、仓库级改动、机器学习工程任务:先用 Opus 5.5。这是连 Google 自己的表格都显示 Opus 领先的范围,而且 Opus 今天就能调用。
- 金融、法律文档处理,或几十万 token 以上的长上下文检索:这是 Argon 数字最好看的范围,也是开放后最值得第一时间试的。在那之前,先用上面两款把流程和验收标准搭起来,到时只需要换模型重跑。
- 只用订阅、不走 API:Argon 会先给 Google AI Ultra 订阅用户,其余方案的时间未定;眼下可选的仍是 Claude 和 ChatGPT 的付费方案。
如果你打算在 Argon 开放当天就评估它,现在可以准备的是一组自己的任务:20 到 50 个有明确验收标准的真实案例,记录好当前模型在每个案例上的通过情况、输入输出 token 和费用。Argon 上线后按这个顺序看:
- 先确认合同条件。模型 ID、速率限制、最大输出、缓存写入和批量价格,这些在公告里都是空白。
- 用同一档推理强度跑同一批任务,分别记下通过率和每个通过任务的平均费用,不要只比单次调用的价格。
- 把费用按 $4/$20 再算一遍。如果只有在首发价下才划算,那么首发期结束时就得再迁移一次。
- 单独看长任务。Vals 的数据提示 Argon 在长流程代理任务上成本上升很快,给单任务设一个输出 token 或费用上限再跑。
- 留意输出长度。如果任务需要很长的可见输出,实测能返回多少,不要假定 1M。
Argon 是否值得切换,最终取决于第 2 步和第 3 步的结果:在你的任务上通过率明显更高,并且按 $4/$20 计算仍然不比现有方案贵,才有迁移的理由。只在 OpenAI 自家型号之间比较的话,可以看「GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选」;预算更紧、想在 Anthropic 内部降一档,见「Sonnet 5.5 和 Opus 5.5 怎么选:半价未必更省」。





