Claude Opus 5.5とGPT-6 Solで迷うなら、まずGPT-6 Solを費用の基準として試し、失敗や手戻りが高くつく仕事にはOpus 5.5を同じ条件で当てるのが実務的です。短い入力の標準API単価はSolが半額ですが、独立評価では高い推論設定のOpusが総合指標で上回ります。どちらが自分の仕事を安く終わらせるかは、合格率、再試行、レビュー時間まで測らなければ分かりません。
これは両社のAPIを使った同条件の実測記事ではありません。以下の料金と公開評価は2026年9月23日に確認した情報です。選び方の根拠と、自分の案件で結論を確かめる方法を分けて示します。
どちらを先に試すかは、失敗の重さで決める
日常的なコード修正、テスト追加、定型的な調査など、合格条件が明確で件数の多い仕事は、GPT-6 Solから始めると費用の基準を作りやすくなります。OpenAIはSolを複雑なコーディングとエージェント作業向けに位置付けており、単に軽い仕事専用のモデルではありません。OpenAIの発表とモデル仕様が示すのは製品の設計意図であり、あなたのリポジトリでの合格率ではありません。
一方、設計変更を伴う長い作業、複数の資料を突き合わせる判断、誤りを見逃すと人の確認に時間がかかる仕事では、Claude Opus 5.5を並行して試す価値があります。Anthropicも長時間のエージェント型コーディングと知識業務を主な用途に挙げています。Anthropicの発表にある性能表をそのまま自社の成功率とは見なさず、納品物とレビュー負担で評価します。
選択を変える目安は「高いモデルがより良い文章を出したか」ではなく、合格した成果物を得るまでの総費用を下げたかです。たとえばSolで毎回短時間で直せる失敗なら、Opusの上乗せ費用を回収できないかもしれません。逆に、人が数十分かけて修復する失敗をOpusが減らすなら、トークン単価の差より効果が大きくなり得ます。いずれも自分の業務で確かめる仮説です。
公開スコアから何が分かり、何は分からないか
Artificial AnalysisのOpus 5.5測定とGPT-6 Sol測定では、Intelligence Index v4.3.2の最高推論設定でOpusが58、Solが48です。インデックス内の1課題あたり費用は、それぞれ$5.98と$1.06でした。既定に近いmedium設定ではOpusが51/$1.34、Solが40/$0.25です。
| 同じ評価指標での観測値 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|
| Intelligence Index、最高推論設定 | 58 | 48 |
| 同設定の評価課題あたり費用 | $5.98 | $1.06 |
| Intelligence Index、medium設定 | 51 | 40 |
| 同設定の評価課題あたり費用 | $1.34 | $0.25 |
この指標は複数評価の合成値で、58は「58%の仕事が合格する」という意味ではありません。最高設定のOpus側には既定のfallbackが含まれます。推論設定も費用も変わるため、最高設定とmediumを混ぜて優劣を決めないでください。評価課題の費用は、あなたのAPI請求額や本番の成果物1件あたり費用ではありません。
もう一つ、比較対象の世代を確かめる必要があります。Anthropicの発表にある比較表のSol列はGPT-5.6 Solで、この記事のGPT-6 Solではありません。同表のOpusの数値をGPT-6 Solとの直接対決の結果として引用できません。公開表を見るときはモデル名だけでなく、版、推論設定、評価環境まで確認します。
API単価が半分なら、仕事の費用も半分か
いいえ。同じ課金対象トークン数を使い、キャッシュ、ツール、税などを除いた短文入力のStandard API料金なら、SolはOpusの半額です。これは納品までの費用が半分という意味ではありません。Claudeのモデル料金とOpenAIの料金表で確認できる通常の未キャッシュ料金は次の通りです。
| 直接API、Standard、100万トークンあたり | Claude Opus 5.5 | GPT-6 Sol(入力272K以下) |
|---|---|---|
| 未キャッシュ入力 | $4 | $2 |
| 出力 | $20 | $10 |
| キャッシュ読み出し | $0.20 | $0.20 |
たとえば未キャッシュ入力10万、出力2万トークンを各モデルで同じように課金したと仮定すると、Solは $2 × 0.1 + $10 × 0.02 = $0.40、Opusは $4 × 0.1 + $20 × 0.02 = $0.80 です。これは料金表の演算例です。実際には出力の長さ、推論トークン、再試行、キャッシュ利用、ツール呼び出しが変わります。
キャッシュ読み出しの表示単価が同じでも、書き込み条件は異なります。Claudeの5分キャッシュ書き込みは100万トークンあたり$5、OpenAIのSolはStandardで$2.50です。また、Claudeのfast modeは入力/出力が$8/$40、OpenAIのBatch/FlexはStandardの半額、Fastは2倍です。処理モードを変えた請求を、上のStandard表に混ぜて比較しないでください。Claudeのモデル案内とOpenAIの料金表で利用する経路の価格を見直せます。
Solで入力が272Kを超えると、どこが変わるか
GPT-6 Solは、入力が272Kトークンを超えたリクエスト全体に長文料金が適用されます。Standardの100万トークンあたり、未キャッシュ入力$4、キャッシュ読み出し$0.40、キャッシュ書き込み$5、出力$15です。272Kを超えた部分だけが高くなる方式ではありません。OpenAIのモデル仕様と料金表にある境界です。
例として入力30万・出力2万がすべて通常の未キャッシュ対象なら、Solの概算は $4 × 0.3 + $15 × 0.02 = $1.50 になります。272K以下の単価を誤って当てた $2 × 0.3 + $10 × 0.02 = $0.80 とは大きく違います。どちらもツール費などを含まない例示で、Opusの同じ仕事の実請求との比較ではありません。長い資料を投げる運用なら、入力長の分布を先に記録してください。
両モデルとも約100万トークンのコンテキストと最大128Kの出力枠が案内されています(Solは1,050,000トークン)。枠が大きいことは、長い資料を丸ごと渡すのが常に最安、または内容を確実に使い切れるという保証ではありません。Claudeのモデル仕様とSolのモデル仕様を、実際の入力分布と合わせて見ます。

自分の仕事で「合格した1件」を測る手順
公開指標は候補を絞る材料です。最終判断には、普段の仕事から、簡単に通るものと失敗が高くつくものを両方選び、次の手順で小さな比較をします。数件の結果だけで普遍的な勝率を主張するためではなく、どこで費用と手戻りが生まれるかを見つけるためです。
- 合格条件を先に書く。 コードならテスト結果、要件の充足、レビューで許せない変更を定めます。調査や文書なら、必須の根拠、確認すべき数字、欠落や誤引用の基準を定めます。
- 入力と道具をそろえる。 同じ初期ファイル、参照資料、権限、ツール、時間制限を与えます。モデルIDと推論設定も記録し、片方だけに追加ヒントを与えた試行は別に扱います。
- 最初の回答だけで止めない。 再試行や修正指示、利用トークン、キャッシュ、ツール料金、経過時間、人が確認・修復した時間を仕事単位で記録します。失敗した試行の費用も残します。
- 同じ基準で採点する。 合格した成果物の数と、合格までの総費用を比較します。難しい案件でOpusが救った失敗と、日常案件でSolが十分だった例を分けて見ます。
計算は (全試行のAPI料金+ツール料金+レビュー・修復に使った時間の費用)÷ 合格した成果物数 です。時間を金額に換算しない場合も、API費用/合格件数と人の作業時間/合格件数を並べれば判断しやすくなります。合格が0件なら分母に0を入れて単価を作らず、その条件では採用できない結果として扱います。
たとえば同じ種類の10件を試し、Solが8件合格・全試行のAPI費用$4、Opusが9件合格・$8なら、API費用だけではSolが合格1件あたり$0.50、Opusは約$0.89です。しかしOpusの1件の追加合格で大きな手戻りを避けられるなら、人の時間を加えると判断は変わり得ます。この数字は計算方法を示す仮定で、両モデルの実測ではありません。

使う場所も含めて選ぶ
直接APIで比較するなら、モデルIDは claude-opus-5-5 と gpt-6-sol です。Solは推論強度をnoneからmaxまで選べ、既定はmediumです。組み込みツールを使う構成はResponses APIで確認し、Chat Completionsのfunction callingはnone設定に限るというOpenAIのモデル仕様も実装前に見てください。Opusはadaptive thinkingが常時有効で、既定のeffortはmediumです。Claudeのモデル仕様に沿って設定を記録します。
Claude、Claude Code、ChatGPT Work、Codexなどの定額・製品経路で使う場合は、アカウントやワークスペースでの利用可否、制限、作業環境を別に確認します。Anthropicの提供案内とOpenAIの提供案内は利用経路を示しますが、あなたの契約での表示や残り枠までは証明しません。APIの100万トークン単価を、そのまま月額契約の費用に置き換えないでください。
費用の基準を作るならSolから。難しい仕事の合格率や確認時間が課題ならOpusも同条件で。選ぶ決め手はモデル名や単独のベンチマークではなく、自分の合格条件を満たす成果物にかかった総費用です。



