Gemini Argon・Opus 5.5・GPT-6.1比較
Gemini 4 Argonは2026年10月1日時点で限定提供です。今使えるOpus 5.5とGPT-6.1 Solでは、同じ推論設定の1課題の費用はSolが約6分の1です。
目次

Googleが2026年9月30日(米国時間)に発表したGemini 4 Argonは、2026年10月1日時点ではFairwindプログラムに参加するセキュリティ防御担当者への限定提供で、一般の開発者がAPIから呼び出すことはできません。モデルIDも一般提供の日付も公表されていません。3つのうち今日プロジェクトに組み込めるのは、Claude Opus 5.5とGPT-6.1 Sol(検索で「GPT 6.1」と書かれているモデル)の2つです。
発表された価格だけを見ると、Argonの導入価格は入力$2・出力$10(100万トークンあたり)で、GPT-6.1 Solと同額、Opus 5.5の半額です。ただし導入期間が終わると$4・$20になり、Opus 5.5と並びます。しかも1課題を終えるのにかかる費用は単価どおりには決まりません。Artificial Analysisが推論の強さ(effort)を3つともhighにそろえて測った結果では、総合スコアと1課題あたりの費用はArgonが53・$1.99、Opus 5.5が54・$1.82、GPT-6.1 Solが50・$0.32でした。単価が同じはずのArgonとSolで、1課題の費用は約6.2倍開いています。
ここから出てくる当面の判断は次のとおりです。費用を抑えたい仕事はGPT-6.1 Solで始め、ターミナル操作を伴う長いコーディング作業のように点数の差が効く仕事はOpus 5.5に回します。Argonは使えるようになってから、自分の課題を同じeffortで流して比べれば間に合います。以下の数値はすべてGoogleの発表か第三者の測定で、誰がどの条件で測ったかを数字ごとに示します。
今日使えるモデルと、まだ使えないモデル
Googleの発表記事は、Argonを「Fairwindプログラムを通じて、信頼できるサイバー防御担当者に順次提供する」と説明しています。開発者・企業・一般ユーザーへの提供は「できるだけ早く」とされ、順番は有料のAPI利用者とGoogle AI Ultraの契約者からです。日付、モデルID、レート制限、コンテキスト長は発表記事に書かれていません。Gemini APIの料金ページにも、2026年10月1日時点でArgonやGemini 4の行はありません。
| Gemini 4 Argon | Claude Opus 5.5 | GPT-6.1 Sol | |
|---|---|---|---|
| 発表・公開日 | 2026年9月30日発表 | 2026年9月22日公開 | 2026年9月29日公開 |
| 今日の提供状況 | Fairwind参加者への限定提供 | Claudeアプリ(Pro・Max・Team・Enterprise)、Claude Code、Claude API、AWS・Google Cloud・Azure | OpenAI API、ChatGPTのWorkとCodex(Plus・Pro・Business・Enterprise・Edu) |
| モデルID | 未公表 | claude-opus-5-5 | gpt-6.1-sol |
| コンテキスト長 | 発表記事に記載なし(評価サイトの表記は1M) | 1M | 1,050,000 |
| 出力上限 | Googleの発表は1M、Valsの表記は262k | 128K | 128,000 |
| 入力・出力の単価(100万トークン) | 導入価格$2・$10、その後$4・$20 | $4・$20 | $2・$10(入力272K超の依頼は$4・$15) |
Opus 5.5の行はAnthropicの2026年9月25日時点、GPT-6.1 Solの行はOpenAIの9月30日時点の公開情報です。GPT-6.1 SolはChatGPTの通常のチャット画面では選べず、FreeとGoのプランも対象外です。ツール呼び出しにはResponses APIが必要になります。細かい移行条件はGPT-6.1 Sol:GPT-6 Solとの違いと移行の注意点にまとめてあります。
Fairwindは、Googleがセキュリティの防御側に限って先行提供するための枠組みです。Googleは、この枠の参加者と社内チームにはArgonをサイバー分野のガードレールなしで提供するとも述べています。どういう組織が対象になるかはGemini 3.8 Flash Cyberの申請条件:Fairwind参加前に確認することで確認できますが、これはGemini 3.8 Flash Cyber向けに書かれた内容で、Argonの申請手順は公開情報に記載がありません。
トークン単価:Solと同額なのは導入価格のあいだだけ
Googleの発表では、Argonの導入価格は入力$2・出力$10で、キャッシュ済み入力は入力単価の95%引き(計算すると$0.10)です。脚注には、導入期間の終了後は入力$4・出力$20が適用されると書かれています。導入期間がいつ終わるかは公表されていません。
3つの定価を、100万トークン単位の式にすると次のようになります。Uは新規の入力、Rはキャッシュからの読み出し、Oは推論分を含む出力です。
| モデルと条件 | 費用の式(ドル) |
|---|---|
| Gemini 4 Argon(導入価格) | 2U + 0.10R + 10O |
| Gemini 4 Argon(導入期間の終了後) | 4U + 20O(キャッシュの単価は未公表) |
| GPT-6.1 Sol(入力272K以下) | 2U + 0.10R + 10O |
| GPT-6.1 Sol(入力272K超) | 4U + 0.20R + 15O |
| Claude Opus 5.5 | 4U + 0.20R + 20O |
キャッシュへの書き込みには別料金があり、GPT-6.1 Solは100万トークンあたり$2.50、Opus 5.5は5分キャッシュで$5です。Argonの書き込み料金は公表されていません。
新規入力10万トークン、出力2万トークンの依頼で計算すると、導入価格のArgonは0.1×2+0.02×10で$0.40、GPT-6.1 Solも$0.40、Opus 5.5は0.1×4+0.02×20で$0.80です。導入期間が終わったArgonは同じ計算で$0.80になり、Opus 5.5と並びます。つまりトークン数が同じなら、導入価格のArgonはSolと同額でOpusの半額、導入期間後のArgonは新規入力と出力についてOpusと同額です。
この比較が成り立つのは、公表済みの範囲に限られます。Argonについては、バッチ処理の割引、長い入力に対する料金区分、導入期間後もキャッシュの95%引きが続くかどうかが、いずれも公表されていません。VentureBeatは導入期間後のキャッシュ単価を$0.20と書いていますが、これは同じ割引率が続くと仮定した場合の数字で、Googleの発表ではありません。予算を組むなら、Argonは$4・$20で見積もっておくほうが安全です。Opus 5.5とGPT-6.1 Solの単価をキャッシュやバッチまで含めて突き合わせたい場合は、Opus 5.5とGPT-6 Sol・6.1 Sol比較:費用差に計算例があります。
1課題あたりの費用は単価どおりにならない
同じ課題を解かせても、モデルによって消費するトークン数が大きく違います。そのため、請求額を決めるのは単価よりも「1課題を終えるまでに何トークン使うか」です。Artificial Analysisは10種類の評価をまとめた総合指数(Intelligence Index v4.3.2)で、スコアと1課題あたりの費用を公開しています。ArgonはHighの設定だけが掲載されているので、ほかの2つもhighにそろえて並べます。
| effortをhighにそろえた比較 | 総合スコア | 1課題あたりの費用 | 費用計算に使われた単価 |
|---|---|---|---|
| Gemini 4 Argon | 53 | $1.99 | $2・$10(導入価格) |
| Claude Opus 5.5 | 54 | $1.82 | $4・$20 |
| GPT-6.1 Sol | 50 | $0.32 | $2・$10 |
Argonの値は2026年10月1日時点、Opus 5.5とGPT-6.1 Solの値は9月30日時点のものです。この指数の誤差はおよそ1ポイントなので、ArgonとOpus 5.5の53対54は実質的に同点、Solとの3〜4ポイント差も大きくはありません。

費用のほうは差がはっきり出ています。
- ArgonはSolの約6.2倍です($1.99÷$0.32)。単価は同じなので、この差は消費したトークン数の差です。
- ArgonはOpus 5.5よりわずかに高くなっています($1.99対$1.82)。Opusの単価はArgonの導入価格の2倍ですが、1課題に使うトークンが少ないぶん、合計では逆転しています。
- GPT-6.1 Solをmaxまで上げた場合は52・$0.72です。Argonのhighと1ポイント差で、費用はその36%です($0.72÷$1.99)。
導入期間が終わったあとの費用も試算できます。Argonのトークンの使い方が変わらず、すべてのトークンが2倍の単価で課金されると仮定すると、1課題あたりの費用はおよそ$4になります。キャッシュの単価が未公表なので、これは上限寄りの概算です。それでも、単価が同じになったOpus 5.5のhigh($1.82)の2倍強という位置関係は読み取れます。
Opus 5.5をmaxで動かすと58・$5.98です。「Opus 58対Argon 53」という並べ方は、OpusのmaxとArgonのhighを比べたもので、effortがそろっていません。
Valsの「1テストあたりの費用」は前提が違う
Vals AIは金融・コーディング・法務・税務の課題をまとめたVals Indexで、Argonを41モデル中1位の68.90%、1テストあたり$15.68と掲載しています。Claude Opus 5.5は66.97%で$32.14、Claude Sonnet 5.5は67.04%で$21.34です。こちらではArgonのほうがOpusの半分以下の費用に見えます。
Artificial Analysisと向きが逆になる理由は、測定の前提にあります。ValsはArgonを導入価格ではなく$4・$20で計算し、effortはhighで実行しています。一方、Kingy AIがまとめたVals側の注記によれば、Opus 5.5とSonnet 5.5はMaxで実行されています。highのArgonとmaxのOpusを比べているので、Opusの費用が高く出るのは当然です。スコアの差も約2ポイントで、誤差の幅と大きくは変わりません。
Valsは、長いエージェント作業でArgonの費用が跳ね上がることも記しています。CUA-benchでは1テスト$193.78、コード移行(Code Migration)では$57.82です。CUA-benchのスコアは4.83%で、8モデル中7位でした。パソコン操作を任せるような長い作業では、導入価格であっても請求額の見通しを立てにくいということです。
GPT-6.1 SolのVals Indexは61.15%、1テスト$3.24です。この数字はKingy AIのまとめがVals Indexの順位表から引用した値で、二次情報です。そのまま受け取れば、Argonより約8ポイント低く、費用は約5分の1です。
ArgonはOpus 5.5より上なのか
Googleの発表記事にある比較表は、ArgonをGPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5と並べたもので、GPT-6.1 Solの列はありません。表は19行あり、長い文脈を扱うGraphWalksが2行に分かれているため、これを1つと数えると18項目になります。Argonが単独1位なのは、18項目と数えれば12項目、19行と数えれば13行で、「18項目中12」と「19項目中13」は同じ表の数え方の違いです。CWE-bench v1はGPT-6 Astraと同点の1位です。
Opus 5.5と直接比べられるのは、Opusにスコアがある18行です。そのうち14行でArgonが上、4行でOpusが上になっています。
| Googleの比較表(%) | Gemini 4 Argon | Claude Opus 5.5 |
|---|---|---|
| Terminal-bench 4.0 | 57.4 | 66.4 |
| FrontierSWE v2 | 55.0 | 62.3 |
| PostTrainBench | 45.3 | 49.3 |
| Terminal-Bench Science 0.1 | 57.6 | 63.3 |
| DeepSWE v1.1 | 77.9 | 74.2 |
| Vibe Code Bench | 91.9 | 90.3 |
| Vals Finance Agent v2 | 65.4 | 58.6 |
| Harvey Legal Agent | 19.6 | 3.8 |
| LABBench 2 | 88.8 | 73.1 |
| GraphWalks 256k〜1M | 84.2 | 66.8 |
| LVBench | 91.7 | 83.7 |

Opusが上回る4行は、ターミナルを操作するエージェント型のコーディング、機械学習モデルの追加学習、科学分野のターミナル作業に集まっています。Argonの差が大きいのは、法務エージェント、LABBench 2、25万トークンを超える長い文脈、動画を扱うLVBenchです。コーディングでもDeepSWEやVibe Code BenchではArgonが上なので、「コーディングはOpus」と一括りにはできず、ターミナル上で長く自走させる使い方かどうかが分かれ目になります。
この表を読むときの注意は2つあります。1つは、これがGoogle自身の発表値で、外部で再現された結果ではないことです。Kingy AIは評価方法の資料を読んだうえで、ArgonのDeepSWEには別の実行環境(mini-swe)が使われていること、Terminal-Bench Scienceでは検証の制限時間が6倍であること、LVBenchでは動画から読み込むフレーム数がモデルごとに違うことを指摘しています。これはKingy AIによる読み取りで、Googleが発表記事の本文で説明している内容ではありません。
もう1つは、第三者の測定では差がずっと小さいことです。先に見たとおり、Artificial Analysisではhigh同士で53対54、Vals Indexでも約2ポイント差で、どちらも誤差の範囲に近い値です。「分野によって得意が分かれ、総合ではほぼ並ぶ」と読むのが、今ある数字にいちばん合っています。
GPT-6.1 SolはGoogleの表に載っていないので、位置づけは第三者の測定から読むしかありません。Artificial Analysisではhighで50、maxで52と、ArgonやOpusのhighより1〜4ポイント低く、費用は数分の1です。最上位の点数を取りにいくモデルではなく、少し下の点数をはるかに安く出すモデルという位置です。OpenAIの3モデルの中でどれを選ぶかはGPT-6.1 Sol・6 Sol・Astra比較:移行の判断で扱っています。
「出力1M」は長い回答が返るという意味ではない
Googleは、Argonの出力トークンの上限を従来の64Kから1Mに広げたと発表しています。ただし説明の文脈は、モデルが1回の実行の中で深く考え、数十万トークンを生成できる余裕を持たせるというものです。つまり1Mには推論に使われるトークンが含まれます。画面に返ってくる回答が100万トークンになるという約束ではありません。
さらに、Valsは評価に使ったArgonについて「コンテキスト1M、最大出力262k」と記載しています。Googleの発表値とValsの表記は食い違ったままで、公開されたAPIの仕様がまだないため、どちらが一般提供時の値になるかは分かりません。長い成果物を一度に書かせる設計を考えているなら、APIの仕様が出るまでは262kより大きい値を前提にしないほうが安全です。
出力はどのモデルでも最も単価が高い部分です。導入価格の$10でも、推論を含めて50万トークンを出力すれば1回で$5、導入期間後の$20なら$10になります(0.5×10、0.5×20)。上限が大きいことは、1回の依頼で使える金額の上限が大きいことでもあります。
今週の選び方と、Argonが開放されたら確かめること
Argonを待つという選択肢は、実際には「Opus 5.5かGPT-6.1 Solで進めながら待つ」しかありません。一般提供の日付が出ていないからです。そのうえで、今週の振り分けは次のように考えられます。
- 費用が先に効く仕事:GPT-6.1 Solから始めます。highで50・$0.32、maxでも52・$0.72で、点数が足りなければeffortを上げる余地があります。大量に回すバッチ処理や、失敗しても再実行で済む作業が当てはまります。
- ターミナルで長く自走させるコーディング:Opus 5.5が向いています。Googleの表ですらTerminal-bench 4.0は66.4対57.4でOpusが上で、Artificial Analysisのhigh同士でも1課題の費用はArgonより低くなっています。プラン側の枠で使う場合はClaude Opus 5.5の料金と上限リセット権:API単価、使える枠、確認手順も確認してください。
- Argonの差が大きい分野の仕事:法務文書のエージェント処理、25万トークンを超える文脈、動画の理解などです。Googleの表では差が大きいものの、発表値の段階なので、今は手元のモデルで進め、後から差し替えられるようにモデル名とeffortを設定値として外に出しておくのが現実的です。
- セキュリティの防御業務:Fairwindの対象になりうる組織だけが、今Argonに触れる可能性があります。
Argonが有料APIに開放されたら、切り替える前に次の順で確かめます。
- 料金ページにArgonの行が出ているか、導入価格がまだ適用されているか、終了日が書かれているか。
- APIの仕様に書かれた出力上限が1Mなのか262kなのか、推論トークンがどう数えられるか。
- キャッシュの書き込み料金、バッチ割引、長い入力の料金区分があるか。
- 自分の仕事を代表する課題をいくつか選び、3つのモデルを同じeffortで流して、成功した件数と消費トークン数を記録する。
- 記録したトークン数に$4・$20を掛けて、導入期間後の1課題あたりの費用を出す。
4と5が最も重要です。Artificial Analysisの数字が示すのは、単価が同じでも1課題の費用が約6倍違うことがあるという事実で、自分の課題でその倍率がいくつになるかは流してみないと分かりません。導入価格のうちに評価を済ませ、導入期間後の単価で採算が合うかどうかまで見てから本番に入れると、価格が切り替わったときに慌てずに済みます。
発表前の段階でGemini 4について何が噂されていたかはGemini 4・GPT-6・Fable 5.2比較:リークから見える実力と代償に残っています。発表後の数字と見比べると、どの予想が当たり、どれが外れたかが分かります。





