# Gemini Argon、Opus 5.5、GPT-6.1 对比

> 截至 2026 年 10 月 1 日，Gemini 4 Argon 尚未公开开放，能用的是 Opus 5.5 和 GPT-6.1 Sol；它首发价同 Sol，单任务成本约 6 倍。

- URL: https://blog.laozhang.ai/zh/posts/gemini-4-argon-vs-claude-opus-5-5-vs-gpt-6-1-sol
- Published: 2026-10-01
- Updated: 2026-10-01
- Author: LaoZhang AI Team (https://blog.laozhang.ai/zh/about)
- Category: AI 开发工具
- Tags: Gemini 4 Argon, Claude Opus 5.5, GPT-6.1 Sol, 模型对比, API 价格, 编码代理

---
截至 2026 年 10 月 1 日，三款模型里今天能接进项目的只有两款：Claude Opus 5.5 和 GPT-6.1 Sol（常被简写成“GPT 6.1”，下文都指这一款）。Gemini 4 Argon 在 9 月 30 日发布，但 [Google 的公告](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/)写的是先向 Fairwind 计划里的一批可信安全防御团队开放，面向开发者、企业和消费者的时间只有“尽快”两个字，没有日期，也没有模型 ID。

所以这周要定方案的话，选择其实在 Opus 5.5 和 GPT-6.1 Sol 之间；Argon 是一个需要提前准备测试、但还不能写进排期的选项。它的首发价和 GPT-6.1 Sol 一样，是 Opus 5.5 的一半；可按 Artificial Analysis 在同一档推理强度下的测量，Argon 跑完一个任务的花费是 $1.99，Opus 5.5 是 $1.82，GPT-6.1 Sol 是 $0.32，三者的综合得分是 53、54、50。单价相同不等于账单相同，这是这次对比里最容易看错的地方。

下面出现的分数和成本都来自 Google 公告或第三方评测机构，每个数字旁边都写了是谁测的、用的哪一档。

## 今天能用的是哪两款

| | Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol |
| --- | --- | --- | --- |
| 发布日期 | 2026 年 9 月 30 日 | 2026 年 9 月 22 日 | 2026 年 9 月 29 日 |
| 现在谁能用 | Fairwind 计划内的可信安全防御团队 | Claude API、Claude Code、Claude 应用的付费方案，以及 AWS、Google Cloud、Azure | OpenAI API；ChatGPT Work 与 Codex（Plus、Pro、Business、Enterprise、Edu） |
| 模型 ID | 未公布 | `claude-opus-5-5` | `gpt-6.1-sol` |
| 上下文 | 公告未写；Artificial Analysis 与 Vals 都标 1M | 1M | 1,050,000 |
| 最大输出 | 公告称 1M，Vals 标 262k | 128K | 128,000 |
| 输入／输出（每百万 token） | 首发价 $2／$10，之后 $4／$20 | $4／$20 | 输入不超过 272K 时 $2／$10，超过后 $4／$15 |
| 缓存读取（每百万 token） | 首发期 $0.10 | $0.20 | $0.10，超过 272K 后 $0.20 |

![Gemini 4 Argon、Claude Opus 5.5、GPT-6.1 Sol 的开放状态对照：谁能用、模型 ID、上下文与最大输出](https://blog.laozhang.ai/posts/zh/gemini-4-argon-vs-claude-opus-5-5-vs-gpt-6-1-sol/img/model-access-status.webp)

Argon 的开放顺序在公告里是这样排的：先是 Fairwind 名单，同时 Google 参与美国政府的自愿性预发布模型审查，然后逐步扩大；面向公众的第一批是付费 API 客户和 Google AI Ultra 订阅用户。截至 10 月 1 日，[Gemini API 价格页](https://ai.google.dev/gemini-api/docs/pricing)上列着 Gemini 3.8 Flash、3.1 Pro Preview 等型号，没有 Argon 或 Gemini 4 这一行。公告同样没有给出速率限制。

Fairwind 是 Google 面向安全防御方的准入计划，公告还提到名单内的团队拿到的是不带网络安全护栏的 Argon。它的性质和资格门槛可以看「[Gemini 3.8 Flash Cyber 怎么申请 Fairwind：资格、限制与准备清单](https://blog.laozhang.ai/zh/posts/gemini-3-8-flash-cyber-fairwind)」；那篇是为 3.8 Flash Cyber 写的，Argon 的申请步骤 Google 还没有单独公布。

另外两款的细节不在这里展开：Opus 5.5 的计费规则见「[Claude Opus 5.5 价格与用量重置：API 账单怎么算，重置卡怎么用](https://blog.laozhang.ai/zh/posts/claude-opus-5-5-pricing-limit-reset)」，GPT-6.1 Sol 的入口和迁移改动见「[GPT-6.1 Sol 怎么用：价格变化、迁移改动与可用入口](https://blog.laozhang.ai/zh/posts/gpt-6-1-sol)」。

## 牌价：首发期与 Sol 同价，之后与 Opus 同价

Google 给 Argon 定了两个价格。首发价是每百万输入 token $2、输出 $10，缓存输入按输入价打 95% 的折扣，折下来是 $0.10。公告脚注写明，首发期结束后适用 $4／$20。首发期持续多久没有公布，之后缓存折扣是否保留、缓存写入费、批量折扣、长输入是否加价，也都没有公布。

把三家的标准档牌价写成算式，设新输入为 U、缓存读取为 R、输出（含推理 token）为 O，单位都是百万 token：

| 模型与档位 | 费用（美元） |
| --- | --- |
| Gemini 4 Argon 首发期 | 2U + 0.10R + 10O |
| Gemini 4 Argon 首发期后 | 4U + 20O，缓存价未公布 |
| GPT-6.1 Sol，输入不超过 272K | 2U + 0.10R + 10O，缓存写入另计每百万 $2.50 |
| GPT-6.1 Sol，输入超过 272K | 4U + 0.20R + 15O，整个请求都按这一档 |
| Claude Opus 5.5 | 4U + 0.20R + 20O，5 分钟缓存写入另计每百万 $5 |

代入一个例子：一次请求用 10 万新输入、2 万输出，没有缓存。首发期的 Argon 是 0.1 × 2 + 0.02 × 10 = $0.40，GPT-6.1 Sol 同样是 $0.40，Opus 5.5 是 0.1 × 4 + 0.02 × 20 = $0.80；首发期过后，Argon 也变成 $0.80。

也就是说，token 数量相同时，首发期的 Argon 等于 GPT-6.1 Sol、等于 Opus 的一半；首发期一过，它在新输入和输出上就和 Opus 一个价。Opus 的单价在整个 1M 窗口内不变，GPT-6.1 Sol 超过 272K 输入会跳档，Argon 有没有类似的长输入档还不知道。如果你的预算要管到明年，Argon 应该按 $4／$20 来算，$2／$10 只能当作试用期的优惠。

OpenAI 与 Anthropic 的现行单价可在 [GPT-6.1 Sol 型号页](https://developers.openai.com/api/docs/models/gpt-6.1-sol)和 [Claude 价格页](https://platform.claude.com/docs/en/about-claude/pricing)核对。

## 跑完一个任务要花多少

牌价算式有个前提：三款模型消耗的 token 一样多。实际上不会一样，推理 token 的多少差别尤其大。Artificial Analysis 的智能指数（Intelligence Index v4.3.2，由 10 项评测组成）同时公布综合得分和跑完指数的平均单任务成本，正好能看出这一层差别。三款模型都取 high 这一档：

| 模型（high 档） | 综合得分 | 单任务成本 | 每百万 token 输入／输出 |
| --- | --- | --- | --- |
| Gemini 4 Argon | 53 | $1.99 | $2／$10（首发价） |
| Claude Opus 5.5 | 54 | $1.82 | $4／$20 |
| GPT-6.1 Sol | 50 | $0.32 | $2／$10 |

数据出自 [Artificial Analysis 的 Argon 页面](https://artificialanalysis.ai/models/gemini-4-argon)（10 月 1 日）及其 Opus 5.5、GPT-6.1 Sol 的对比页（9 月 30 日）。这个综合分的不确定度大约是 1 分，所以 53 对 54 实际上是平手，50 到 53 的差距也不大。

![同为 high 档时三款模型的综合得分与单任务成本：Gemini 4 Argon 53 分 $1.99，Claude Opus 5.5 54 分 $1.82，GPT-6.1 Sol 50 分 $0.32](https://blog.laozhang.ai/posts/zh/gemini-4-argon-vs-claude-opus-5-5-vs-gpt-6-1-sol/img/score-vs-task-cost.webp)

从这张表能读出三件事：

1. Argon 与 GPT-6.1 Sol 牌价相同，单任务成本却是 1.99 ÷ 0.32 ≈ 6.2 倍。差出来的不是单价，是用掉的 token：Artificial Analysis 记录 Argon 跑完整个指数输出了 1.1 亿 token。
2. Argon 的单价只有 Opus 的一半，单任务成本反而略高（$1.99 对 $1.82）。在这套评测里，半价被更多的 token 抵消了。
3. 这个 $1.99 是按首发价算的。假设 token 用量不变、全部按翻倍后的单价计费，首发期结束后大约是 $4，到时会是 Opus high 档的两倍多。缓存价未公布，这只是一个粗略的推算。

推理强度换一档，位置也会变。Artificial Analysis 目前只发布了 Argon 的 high 档，另外两款各有五档：

| 推理强度 | Opus 5.5 得分／成本 | GPT-6.1 Sol 得分／成本 |
| --- | --- | --- |
| low | 42／$0.55 | 42／$0.13 |
| medium | 51／$1.34 | 48／$0.21 |
| high | 54／$1.82 | 50／$0.32 |
| xhigh | 56／$3.46 | 51／$0.39 |
| max | 58／$5.98 | 52／$0.72 |

GPT-6.1 Sol 开到 max 是 52 分、$0.72，和 Argon high 的 53 分只差 1 分，成本是它的 36%。Opus 开到 max 是 58 分，比 Argon high 高 5 分，但成本是 $5.98。“Opus 58 对 Argon 53”这组常被引用的数字，是 Opus 的 max 档对 Argon 的 high 档，两边不在同一档上，不能直接当作模型差距。

Vals 的结果从另一个方向印证了成本要看任务。[Vals 的 Argon 页面](https://www.vals.ai/models/google_gemini-4-argon)显示，在覆盖金融、编码、法律、税务的 Vals Index 上，Argon 以 68.90% 排在 41 个模型的第一位，每个测试 $15.68；Claude Sonnet 5.5 是 67.04%、$21.34，Opus 5.5 是 66.97%、$32.14。这里 Vals 给 Argon 用的是 $4／$20 的首发期后价格，推理强度同样是 high，所以这是按贵的那个价算出来的，Argon 每个测试的花费仍只有 Opus 的一半左右。据 Kingy AI 的说明，榜上 Opus 与 Sonnet 这两行跑的是 max 档，和 Argon 的 high 档并不对等。但 Vals 也写明，Argon 的成本在长流程代理任务上会明显升高：CUA-bench 每个测试 $193.78，Code Migration 每个测试 $57.82；它在 CUA-bench 上的得分只有 4.83%，8 个模型里排第 7。

GPT-6.1 Sol 在 Vals Index 上的成绩是 61.15%、每个测试 $3.24，这组数字出自 [Kingy AI 对 Vals 榜单的转述](https://kingy.ai/blog/frontier-ai-models-gemini-4-argon-gpt-6-astra-sol-claude/)。按它算，Sol 比 Argon 低约 8 个百分点，成本不到后者的四分之一。

把两家评测合起来看：Argon 和 Opus 5.5 的综合水平接近，谁更省钱取决于评测内容和任务长度；GPT-6.1 Sol 分数低一截，但便宜得多。这些都是评测集上的平均值，换成你自己的任务，需要看的是通过验收的那部分结果各花了多少钱。Opus 与 Sol 两款之间更细的成本账见「[Claude Opus 5.5 对比 GPT-6 Sol 与 6.1 Sol：先看任务，再算合格交付成本](https://blog.laozhang.ai/zh/posts/claude-opus-5-5-vs-gpt-6-sol)」。

## Google 的跑分表该怎么读

Google 公告里的跑分表有四列：Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。表里没有 GPT-6.1 Sol，所以 Argon 与 Sol 的差距无法从这张表得出，只能看前面的第三方数据。

Argon 与 Opus 5.5 都有成绩的 18 项里，Argon 领先 14 项，Opus 领先 4 项。领先的方向很有规律：

| 评测（Google 公告，%） | Argon | Opus 5.5 | 领先方 |
| --- | --- | --- | --- |
| Terminal-bench 4.0 | 57.4 | 66.4 | Opus |
| FrontierSWE v2 | 55.0 | 62.3 | Opus |
| Terminal-Bench Science 0.1 | 57.6 | 63.3 | Opus |
| PostTrainBench | 45.3 | 49.3 | Opus |
| DeepSWE v1.1 | 77.9 | 74.2 | Argon |
| Vibe Code Bench | 91.9 | 90.3 | Argon |
| AutomationBench | 51.3 | 42.5 | Argon |
| Vals Finance Agent v2 | 65.4 | 58.6 | Argon |
| Harvey Legal Agent | 19.6 | 3.8 | Argon |
| GraphWalks 256k–1M | 84.2 | 66.8 | Argon |
| LVBench | 91.7 | 83.7 | Argon |
| LABBench 2 | 88.8 | 73.1 | Argon |
| RiemannBench | 76.0 | 69.6 | Argon |
| Agent's Last Exam | 39.5 | 38.2 | Argon |

Opus 领先的四项是两个终端类评测、FrontierSWE 和归在机器学习工程下的 PostTrainBench；Argon 的优势在金融与法律类知识工作、长上下文（GraphWalks 在 256k 到 1M 区间差 17 个百分点）、LVBench 这样的多模态理解，以及科学与数学类的 LABBench 2 和 RiemannBench。编码这一类两边各有胜负：DeepSWE 和 Vibe Code Bench 是 Argon 高，Terminal-bench 和 FrontierSWE 是 Opus 高，其中 Terminal-bench 差 9 个百分点。

读这张表要记住两点。第一，它是厂商自己跑或自己汇总的成绩，没有独立复现。Kingy AI 读过 Google 的评测方法文件后指出几处设置并不对等，例如 Argon 的 Terminal-Bench Science 用了 6 倍的验证超时，LVBench 上各模型拿到的视频帧数不同；这是 Kingy 一家的解读。第二，独立机构的数字和它大体一致但差距更小：Vals Index 上 Argon 比 Opus 高约 2 个百分点，Artificial Analysis 同档下两者平手。

人工盲评方面，据 Kingy AI 转述，Arena 在 9 月 30 日的文本榜上 Argon High 以 1,525 分排第一，Opus 5.5 High 为 1,504 分，GPT-6.1 Sol 不在那张表里。Arena 反映的是投票者的偏好，不是任务做对了没有。提示注入方面，Google 的原话是 Argon“处于领先”；[VentureBeat 的报道](https://venturebeat.com/technology/google-unveils-gemini-4-argon-retaking-benchmark-lead-over-openai-and-anthropic-but-in-limited-release)转述了公告中 Gray Swan 间接提示注入图表的攻击成功率，Argon 为 0.7%，Opus 5.5 为 1.0%，图中没有 GPT-6.1 Sol。

## 1M 输出上限是怎么回事

Google 在公告里说，Argon 的输出 token 上限从此前的 64K 提高到 1M，理由是让模型有余量深入思考，在一条轨迹里生成几十万 token。Vals 的模型页写的却是“1M 上下文、最大输出 262k”。

两个数字目前无法对上：1M 是 Google 宣布的上限，从措辞看包含推理 token；262k 是 Vals 对它所测端点的标注。公开的 API 文档还不存在，所以不要按“一次能返回 100 万 token 的正文”来设计流程。可以确定的只有一点：这个上限是给长推理留的空间，而三家的推理 token 都算在输出里，前面 Argon 单任务成本偏高正是同一件事的另一面。相比之下，Opus 5.5 和 GPT-6.1 Sol 的最大输出都是 128K，写在各自的官方文档里。

## 现在先用什么，Argon 开放后先测什么

Argon 没有公开日期，手头的项目不必等它。在 Opus 5.5 和 GPT-6.1 Sol 之间，可以按下面的条件分：

- **量大、单个任务出错可以重跑**：先用 GPT-6.1 Sol。high 档每任务 $0.32，开到 max 也只有 $0.72，分数与 Argon high 相差 1 到 3 分。
- **终端里的长流程编码、仓库级改动、机器学习工程任务**：先用 Opus 5.5。这是连 Google 自己的表格都显示 Opus 领先的范围，而且 Opus 今天就能调用。
- **金融、法律文档处理，或几十万 token 以上的长上下文检索**：这是 Argon 数字最好看的范围，也是开放后最值得第一时间试的。在那之前，先用上面两款把流程和验收标准搭起来，到时只需要换模型重跑。
- **只用订阅、不走 API**：Argon 会先给 Google AI Ultra 订阅用户，其余方案的时间未定；眼下可选的仍是 Claude 和 ChatGPT 的付费方案。

如果你打算在 Argon 开放当天就评估它，现在可以准备的是一组自己的任务：20 到 50 个有明确验收标准的真实案例，记录好当前模型在每个案例上的通过情况、输入输出 token 和费用。Argon 上线后按这个顺序看：

1. **先确认合同条件**。模型 ID、速率限制、最大输出、缓存写入和批量价格，这些在公告里都是空白。
2. **用同一档推理强度跑同一批任务**，分别记下通过率和每个通过任务的平均费用，不要只比单次调用的价格。
3. **把费用按 $4／$20 再算一遍**。如果只有在首发价下才划算，那么首发期结束时就得再迁移一次。
4. **单独看长任务**。Vals 的数据提示 Argon 在长流程代理任务上成本上升很快，给单任务设一个输出 token 或费用上限再跑。
5. **留意输出长度**。如果任务需要很长的可见输出，实测能返回多少，不要假定 1M。

Argon 是否值得切换，最终取决于第 2 步和第 3 步的结果：在你的任务上通过率明显更高，并且按 $4／$20 计算仍然不比现有方案贵，才有迁移的理由。只在 OpenAI 自家型号之间比较的话，可以看「[GPT-6.1 Sol、GPT-6 Sol、Astra 怎么选](https://blog.laozhang.ai/zh/posts/gpt-6-1-sol-vs-gpt-6-astra-vs-gpt-6-sol)」；预算更紧、想在 Anthropic 内部降一档，见「[Sonnet 5.5 和 Opus 5.5 怎么选：半价未必更省](https://blog.laozhang.ai/zh/posts/claude-sonnet-5-5-vs-opus-5-5)」。
