# Sonnet 5.5とGPT-6 Astra比較：費用と使い分け

> Sonnet 5.5がAstraを上回るのは推論の強さが両方maxのときだけで、単価は5分の1でも、そのmaxでは1課題あたりの費用がSonnetの約2.3倍です。

- URL: https://blog.laozhang.ai/ja/posts/claude-sonnet-5-5-vs-gpt-6-astra
- Published: 2026-09-29
- Updated: 2026-09-29
- Author: LaoZhang AI Team (https://blog.laozhang.ai/ja/about)
- Category: AIモデル
- Tags: Claude Sonnet 5.5, GPT-6 Astra, モデル比較, API料金, 推論の強さ, Claude Code

---
2026年9月28日に公開されたClaude Sonnet 5.5について、「OpenAIの最上位モデルGPT-6 Astraを上回った」「しかも単価は5分の1」という話が広がっています。どちらも数字としては正しいのですが、成り立つ条件がそれぞれ違います。

- 「上回った」の根拠は、Artificial Analysis（以下AA）の総合指数で、推論の強さ（effort）を両方とも`max`にしたときの56対53です。同じeffort同士で並べると`low`〜`high`はAstraが上、`xhigh`は同点で、Sonnet 5.5が上に出るのは`max`だけです。
- 「5分の1」は100万トークンあたりの定価の比です。入力は$2対$10、出力は$10対$50です。ところがSonnet 5.5は`max`でAstraの約7倍の出力トークンを使うため、AAの評価課題1件あたりの費用は$7.60対$3.26となり、Sonnet 5.5のほうが約2.3倍高くつきます。

そのため、Astraの代わりにSonnet 5.5を使って費用を下げられるのは、`high`以下の設定で自分の作業の合格ラインを越えられる場合か、1回の入力が272Kトークンを超える長い依頼が中心の場合です。ターミナル操作やSRE（システム運用）のようなエージェント作業ではAstraが大きく先行する評価もあります。以下の数字は特記がない限り2026年9月29日時点のもので、比較の根拠にするベンチマークはAAとVals AIによる第三者の評価です。

## 「Astra超え」は推論の強さを両方maxにした比較

AAの総合指数（Intelligence Index v4.3.2）は10種類の評価をまとめた指数で、各モデルをeffortの5段階すべてで測っています。

| effort | Sonnet 5.5 指数 | Sonnet 5.5 1課題の費用 | GPT-6 Astra 指数 | GPT-6 Astra 1課題の費用 |
|---|---|---|---|---|
| `low` | 36 | $0.41 | 46 | $0.82 |
| `medium` | 41 | $0.59 | 50 | $1.54 |
| `high` | 47 | $1.08 | 51 | $1.73 |
| `xhigh` | 52 | $2.74 | 52 | $2.31 |
| `max` | 56 | $7.60 | 53 | $3.26 |

出典は[Artificial AnalysisのSonnet 5.5解説記事](https://artificialanalysis.ai/articles/claude-sonnet-5-5)と[GPT-6 Astraのモデルページ](https://artificialanalysis.ai/models/releases/gpt-6-astra)です（2026年9月29日時点）。「1課題の費用」はAAの評価課題1件を解くのにかかった平均費用で、読者自身の作業にかかる費用とは別物です。

この表から読み取れるのは次の3点です。

1. 見出しになった56対53は`max`同士の比較です。その`max`でSonnet 5.5は評価課題1件あたり約19.3万の出力トークンを使っており、AAは「これまで測定した中で最多」「GPT-6 Astra（max）の約7倍」と書いています。単価が5分の1でもトークン量が7倍なら、費用は逆転します。
2. 近いスコアで比べると、Astraのほうが安い組み合わせがあります。Sonnet 5.5の`high`（47点、$1.08）とAstraの`low`（46点、$0.82）、両者52点で並ぶ`xhigh`（$2.74対$2.31）です。AA自身も、Sonnet 5.5は性能と1課題あたり費用の効率線（パレート前線）から外れていて、低いeffortでは同等の性能をより安く出せるAstraやGPT-6 Solの設定がある、と評しています。
3. Sonnet 5.5がはっきり安いのは`low`と`medium`ですが、その段階では指数も40前後にとどまります。

![effortの5段階ごとにSonnet 5.5とGPT-6 AstraのAA総合指数と1課題の費用を並べ、highまではAstraが上、xhighは同点、maxだけSonnet 5.5が上で費用は約2.3倍になることを示す図](https://blog.laozhang.ai/posts/ja/claude-sonnet-5-5-vs-gpt-6-astra/img/effort-index-cost.webp)

既定の設定にも注意が必要です。Sonnet 5.5のAPIでの既定は`high`（AA指数47）ですが、ClaudeのアプリとClaude Codeでは`medium`（同41）で動きます。Astraの既定のeffortはOpenAIの公開ドキュメントに記載がありません。なおAstraは`none`を受け付けず、指定すると400エラーになります。「設定を変えずに比べた」という体験談を読むときは、Sonnet側がどの段階で動いていたかを先に確かめてください。

前提がもう二つあります。effortの段階名は各社が独自に決めたもので、Anthropicの`high`とOpenAIの`high`が同じ計算量を意味するわけではありません。同じ名前同士の比較はあくまで目安です。また、AAはSonnet 5.5をリリース前の環境で評価しており、構造化出力を使うリクエストで回答が劣化する不具合があったこと（公開版では修正済み）と、再評価を予定していることを注記しています。数字は今後動く可能性があります。

## Vals AIでは19項目中13項目でSonnet 5.5が上

[Vals AIの比較ページ](https://www.vals.ai/comparisons/anthropic_claude-sonnet-5-5-vs-openai_gpt-6-astra)は、両モデルとも`max`で共通の19ベンチマークを比べています。Sonnet 5.5が13項目、Astraが6項目で上回りますが、±1標準誤差の範囲が重なる項目が9つあり、Vals自身が「ペアごとの統計的有意差の検定ではない」と断っています。

差の大きい項目と総合指数は次のとおりです（2026年9月29日時点）。

| ベンチマーク | Sonnet 5.5 | GPT-6 Astra | 差 |
|---|---|---|---|
| Terminal-Bench Science | 38.57% | 65.71% | Astraが27.14ポイント上 |
| SRE Bench | 30.15% | 56.87% | Astraが26.72ポイント上 |
| IOI（競技プログラミング） | 83.06% | 100.00% | Astraが16.94ポイント上 |
| CyberBench v1.1 | 59.58% | 41.07% | Sonnet 5.5が18.51ポイント上 |
| Tax Agent Bench | 73.39% | 63.34% | Sonnet 5.5が10.06ポイント上 |
| Legal Research Bench | 48.08% | 39.42% | Sonnet 5.5が8.65ポイント上 |
| Vals Index（総合） | 69.22% | 66.61% | Sonnet 5.5が2.61ポイント上 |

この表には読み方の注意が三つあります。

- **CyberBenchの差はフォールバック込みの数字です。** ValsはSonnet 5.5を、拒否したリクエストをSonnet 5で再試行するサーバー側フォールバック付きで評価しました。フォールバックに頼った課題を失敗扱いにすると、CyberBenchは41.97%、SRE Benchは19.08%、Vals Indexは68.89%まで下がります。セキュリティ分野でのSonnet 5.5単体の優位は、Astraの41.07%とほぼ並ぶ水準まで縮みます。
- **費用が近くても所要時間は大きく違います。** Vals Index全体の実行費用は$20.80対$19.09とほぼ同じですが、所要時間は1時間10分対25分11秒でした。Terminal-Bench 4.0では費用が$19.33対$8.21、時間は2時間6分対42分です。
- **分野ごとの平均では向きが分かれます。** 法務・金融・医療・教育の平均はSonnet 5.5、科学とコーディングの平均はAstraが上です。

## 両社の発表値を横に並べられない理由

Anthropicの発表ページはSonnet 5.5をSonnet 5、Opus 5.5、GPT-6 Solと比べていて、GPT-6 Astraは表にありません。OpenAIのAstraの発表ページにも、Sonnet 5.5やOpus 5.5の列はありません。それぞれ自社の測定環境で出した数字です。

分かりやすい例がTerminal-Bench 4.0です。Anthropicの発表ではSonnet 5.5が70.6%、OpenAIの発表ではAstra（max）が57.9%ですが、この二つを「70.6%対57.9%」と並べると、別々の環境で測った値を比べることになります。第三者の測定では結果の向きすら一致しません。

| 測定 | Sonnet 5.5 | GPT-6 Astra |
|---|---|---|
| AA | 64%（max） | 60%（xhigh） |
| Vals AI | 53.03%（max） | 57.07%（max） |

AAではSonnet 5.5、ValsではAstraが上なので、Terminal-Bench 4.0でどちらが勝つとは言えません。FrontierCodeやOSWorldも、測定環境やバージョン（OSWorldは2.1と2.0）が両社で異なります。

Anthropicが発表でうたう「30%以上高速」「ほとんどの作業で費用が最大30%安い」も、先代のSonnet 5と比べた数字で、Astraとの比較ではありません。しかもAAの測定では、`max`でのSonnet 5.5の1課題あたり費用はSonnet 5（max）より約50%高くなっており、この「最大30%安い」はeffortや作業の内容次第で成り立たないこともあります。

## トークン単価の差を自分の依頼の形で計算する

2026年9月29日時点のAPI定価（100万トークンあたり、米ドル）は次のとおりです。

| 項目 | Claude Sonnet 5.5 | GPT-6 Astra（入力272K以下） | GPT-6 Astra（入力272K超） |
|---|---|---|---|
| 入力 | $2 | $10 | $20 |
| キャッシュ読み出し | $0.20 | $1 | $2 |
| キャッシュ書き込み | $2.50（5分）／$4（1時間） | $12.50 | $25 |
| 出力 | $10 | $50 | $75 |
| Batch | 入力$1／出力$5 | 標準の半額（Flexも同じ） | 標準の半額 |

出典は[Anthropicの料金ページ](https://platform.claude.com/docs/en/about-claude/pricing)と[OpenAIの料金ページ](https://developers.openai.com/api/docs/pricing)です。Sonnet 5.5には100万トークンの範囲内で長文の割増がなく、90万トークンの依頼も9,000トークンの依頼と同じ単価です。Astraは1回の入力が272Kトークンを超えると、その依頼全体が右列の単価になります。ほかに、AstraのFastモードは標準の2倍（遅延の保証なし）、データ所在地を指定する地域処理は10%増、Sonnet 5.5は米国内のみで推論させる指定が1.1倍で、Sonnet 5.5にFastモードはありません。

1回の依頼の費用は「入力トークン数÷100万×入力単価＋出力トークン数÷100万×出力単価」で出せます。キャッシュを使わず、両モデルの課金トークン数が同じだと仮定すると、次のようになります。

| 依頼の形 | Sonnet 5.5 | GPT-6 Astra | 差 |
|---|---|---|---|
| 入力10万＋出力2万トークン | 0.1×$2＋0.02×$10＝$0.40 | 0.1×$10＋0.02×$50＝$2.00 | 5倍 |
| 入力30万＋出力2万トークン | 0.3×$2＋0.02×$10＝$0.80 | 0.3×$20＋0.02×$75＝$7.50 | 約9.4倍 |

これはあくまで仮定の上の計算で、実際の請求額ではありません。実際には、トークナイザーが違うため同じ文章でもトークン数が変わり、推論に使ったトークンは出力として課金され、やり直しの分も加わります。

この計算から、次のような目安が導けます。272K以下の依頼では入力・キャッシュ・出力のどの項目も5倍の差なので、Sonnet 5.5が同じ作業に使う課金トークンがAstraの5倍未満なら安くなり、5倍を超えると逆転します。272K超では入力10倍・出力7.5倍の差になるため、Sonnet 5.5が有利な範囲は広がります。AAの`max`で1課題あたりの費用が逆転したのは、出力トークンが約7倍と、この5倍の線を越えていたからです。

![入力10万＋出力2万トークンでは$0.40対$2.00で差は5倍、入力30万＋出力2万トークンでは$0.80対$7.50で約9.4倍になる試算と、Sonnet 5.5の課金トークンがAstraの5倍未満なら安いという目安をまとめた図](https://blog.laozhang.ai/posts/ja/claude-sonnet-5-5-vs-gpt-6-astra/img/request-cost-gap.webp)

Batchの割引は両社とも半額なので、Batch同士でも比は変わりません。Astraの細かい料金計算は「[GPT-6 Astra API料金：8つの単価と長文・Batch・Fastの計算方法](https://blog.laozhang.ai/ja/posts/gpt-6-astra-api-pricing)」に、Sonnet帯のキャッシュの課金は「[Claude Sonnet 5の値上げは撤回。現在のAPI料金と予算の見直し方](https://blog.laozhang.ai/ja/posts/claude-sonnet-5-pricing)」に詳しい説明があります。Sonnet 5.5の料金はSonnet 5と同じなので、後者の計算がそのまま使えます。

## 同じ単価で比べる相手はGPT-6 Sol

「同じお金を払うならどちらが良いか」を知りたいなら、比べる相手はAstraではなくGPT-6 Solです。GPT-6 Solの定価は入力$2、キャッシュ読み出し$0.20、キャッシュ書き込み$2.50、出力$10（入力272K以下）で、Sonnet 5.5とまったく同じです。Anthropicの発表でもSonnet 5.5の比較相手はGPT-6 Solでした。

違いは272Kを超えたときに出ます。GPT-6 Solはそこで入力$4・出力$15などに上がり、Sonnet 5.5は変わりません。AAは、Sonnet 5.5の`high`がGPT-6 Solとほぼ同じ1課題あたり費用で、指数はわずかに下と評しています。GPT-6 Sol・Luna・Astraの選び分けは「[GPT-6 Sol・Luna・AstraとTerraの違い：API料金と用途から選ぶ](https://blog.laozhang.ai/ja/posts/gpt-6-sol-vs-terra-vs-luna-vs-astra)」、Claudeの上位モデルとの比較は「[Opus 5.5とGPT-6 Sol比較：料金2倍はどこに効くか](https://blog.laozhang.ai/ja/posts/claude-opus-5-5-vs-gpt-6-sol)」が参考になります。

一方、「Astraでないとこなせない作業を、Sonnet 5.5で安く済ませられるか」を知りたいなら、比べる相手はAstraのままです。とにかく最高のスコアが欲しい場合、AAの総合指数で最上位にいるのはOpus 5.5（max）の58点で、Sonnet 5.5（max）はその次です。Claudeの中でさらに上を検討するなら「[Claude Fable 5.1とOpus 5.5を比較：普段はどっちを使うべき？](https://blog.laozhang.ai/ja/posts/claude-fable-5-1-vs-opus-5-5)」も見てください。

## 作業別：Sonnet 5.5を試すか、Astraを続けるか

ここまでの評価を作業の種類ごとに整理すると、次のようになります。いずれも第三者の評価からの見立てなので、最終判断は後述の試験で行ってください。

| 作業の種類 | 先に試す構成 | 根拠 |
|---|---|---|
| 入力が272Kトークンを超える長文の読解・要約・レビュー | Sonnet 5.5（`high`以下から） | 同じトークン数ならAstraの長文単価との差は7.5〜10倍になり、Sonnet側のトークン増を吸収しやすい |
| 短い応答を大量にさばくチャットや分類 | Sonnet 5.5の`low`／`medium` | AAの1課題費用は$0.41／$0.59で、`low`での最初のトークンまでの時間は0.92秒（Astraは2.42秒）。ただしこの段階の指数はAstraの`low`より低い |
| Astraを`low`〜`medium`で使っている汎用作業 | Astraを継続し、Sonnet 5.5の`high`と比べる | AAではAstraの`low`（46点、$0.82）がSonnet 5.5の`high`（47点、$1.08）より安い |
| ターミナル操作、科学計算の手順、SRE・障害対応のエージェント | Astraを継続 | ValsでTerminal-Bench Science（27.14ポイント差）とSRE Bench（26.72ポイント差）がAstraの大差 |
| 法務・税務・金融の調査や文書作業 | Sonnet 5.5の`xhigh`／`max`を試す | ValsでLegal Research、Tax Agent、Finance AgentがSonnet 5.5の上。ただし`max`ではトークン量が増えるため、費用は必ず実測する |
| セキュリティ調査 | Astraを継続するか、Sonnet 5の扱いまで確認 | CyberBenchの優位はフォールバック込み。Claudeのアプリでは、サイバー関連と判定されると会話がSonnet 5に切り替わることがある |
| 長時間の最高難度エージェント作業 | Astraの`xhigh`／`max`を基準に置く | Valsでは同じ`max`で所要時間がおよそ3分の1。AAの`max`では1課題費用もAstraが安い |

サブスクリプションで使っている場合は、API定価の比較はそのまま当てはまりません。ChatGPTでは、Astraを使う「GPT-6 Pro」がChatで使えるのはPro（$100／$200）、Business、Enterpriseのプランで、PlusはChatGPT WorkとCodexでのみAstraを使えます。FreeとGoにAstraはありません。Codexでの利用量は5時間あたりのローカルメッセージ数の目安（Plusで5〜45など）として公開されていて、固定の上限ではありません。Claude側では、Sonnet 5.5はウェブ・モバイル・デスクトップのアプリやClaude Codeで選べますが、どの有料プランに含まれるかは公開情報に記載がありません。

## 乗り換える前に確認すること

### AstraからSonnet 5.5へ移る場合

同じ会社の新旧モデルを入れ替えるのとは違い、APIそのものが変わります。

- **APIの形。** OpenAIのResponses API（またはChat Completions）から、AnthropicのMessages APIへの書き換えになります。Astraでツール呼び出しを使うにはResponses APIが必要なので、既存のコードはResponses前提で書かれていることが多いはずです。ツール定義の書式、キャッシュの仕組み（Anthropicは5分／1時間の書き込みを明示的に指定、Astraは`prompt_cache_options.ttl`で`"30m"`）、トークナイザーも異なります。
- **effortの指定。** Sonnet 5.5では`output_config.effort`、AstraではResponses APIの`reasoning.effort`（Chat Completionsでは`reasoning_effort`）で指定します。段階名は同じでも中身はそろっていないので、Astraで`medium`だったからSonnet 5.5も`medium`、とはなりません。
- **サンプリングパラメータ。** Astraは`none`を持たないため、常に`temperature`や`top_p`を外して使う前提です。これらを使っていないプロンプトは移しやすく、Sonnet 5.5でも既定以外の`temperature`・`top_p`・`top_k`は400エラーになります。
- **OpenAI固有の機能。** Responses APIの組み込みツールや`pro`推論モードに頼っている処理は、Claude側に同じ役割の仕組みがあるかを個別に確かめる必要があります。
- **提供経路。** 両モデルともAmazon Bedrockで使えます（Astraはus-west-2）。アカウントや請求の手間は減らせますが、APIの形の違いはなくなりません。

Astraをこれから使い始める場合の手順は「[GPT-6 Astra APIの始め方：利用権限の確認から最初の応答まで](https://blog.laozhang.ai/ja/posts/gpt-6-astra-api-access)」にあります。Claudeへの接続経路を選び直す場合は「[Claude を安定して使うにはどう選ぶべきか: Anthropic 直結、対応クラウド、それとも laozhang.ai の互換ゲートウェイ？](https://blog.laozhang.ai/ja/posts/claude-gateway-laozhang-ai)」も参考になります。

### Sonnet 5向けのコードをSonnet 5.5に流用する場合

Anthropicの[Sonnet 5.5の変更点](https://platform.claude.com/docs/en/models/sonnet-5-5/whats-new-sonnet-5-5)には、Sonnet 5で動いていたコードが失敗する変更が五つ挙がっています。

1. `thinking: {"type": "disabled"}`と、`budget_tokens`による手動の思考予算は400エラーになります。事前の思考を止めたいときは`thinking: {"type": "between_tools"}`を使いますが、使えるのは`low`・`medium`・`high`だけで、`xhigh`と`max`では400エラーです。
2. `tool_choice`で`any`や`tool`を指定する強制ツール呼び出しは400エラーになります。`auto`のまま`strict: true`を付けるか、構造化出力に移します。
3. 思考ブロックは生成したモデルと会話、アカウントに結び付きます。2026年8月31日以降に作られたアカウントでは、過去の履歴を編集してから思考ブロックを送り返すと、既定で400エラーになります。会話は追記だけで進めてください。
4. Claude APIとGoogle Cloudでは、コンピューター操作ツール`computer_20251124`が受け付けられず、`computer_toolset_20260801`への移行が必要です（Amazon Bedrockでは旧ツールも使えます）。
5. advisorツールで、Opus 4.8、Opus 4.7、Sonnet 5をadvisorに指定すると400エラーになります。

エラーにはならないものの挙動が変わる点もあります。ツール呼び出しの合間に出るテキストが`thinking`ブロックで返るようになり、既定の`display: "omitted"`ではその中身が空になります。ツール呼び出しの間の進捗を画面に流しているアプリは、何のエラーも出ないまま表示が止まるので、`display`を変えるか`between_tools`を使ってください。ほかに、アシスタント応答の先頭を埋めておくプリフィルは400エラー、キャッシュできるプロンプトの最小長は512トークンです。

## 合格した1件あたりの費用で決める

最終的な判断は、自分の作業で「合格した1件あたりの費用」を比べるのが確実です。合格した1件あたりの費用とは、試験全体で実際に課金された金額を、受け入れ基準を満たした件数で割った値です。1件ごとの単価が安くても、やり直しや人の手直しが増えれば意味がないので、この値で比べます。

1. 実際の作業から20〜50件を選び、それぞれに合否の基準を決めます（テストが通る、レビューで修正なしなど）。
2. 両モデルに同じ入力と同じツールを渡し、effortの組み合わせを明示して実行します。まずSonnet 5.5の`high`に対してAstraの`medium`と`high`、次にそれぞれ1段階上げます。
3. 課金されたトークン数（入力、キャッシュ読み出し、キャッシュ書き込み、推論を含む出力）、やり直しの回数、所要時間、人が手直しした時間を記録します。
4. 合格した1件あたりの費用＝課金額の合計÷合格件数、を計算します。たとえば30件で合計$12、合格が24件なら$0.50です。
5. Sonnet 5.5が同じ合格基準を満たし、そのうえでこの値が下がる場合にだけ切り替えます。作業の種類によって結果が分かれたら、種類ごとに振り分けます。

effortの指定は、それぞれ次のように書きます。

```python
# Claude（Messages API）
anthropic_client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=128000,
    output_config={"effort": "high"},
    messages=[{"role": "user", "content": task}],
)

# OpenAI（Responses API）
openai_client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=task,
)
```

Sonnet 5.5では、思考に使ったトークンも`max_tokens`に含まれます。Anthropicはエージェント型のコーディングでは上限の128,000に設定することを勧めているので、高いeffortで試すときは`max_tokens`を小さくしすぎないでください。

## よくある質問

### Sonnet 5.5はGPT-6 Astraより賢いのですか？

条件によります。AAの総合指数では、両方`max`のときにSonnet 5.5が56対53で上ですが、同じeffort同士なら`low`〜`high`はAstraが上、`xhigh`は52点で同点です。Vals AIの19項目の比較（両方`max`）ではSonnet 5.5が13項目で上ですが、ターミナル操作や科学計算のエージェント作業ではAstraが大きく先行しています。

### Sonnet 5.5ならAstraの5分の1の費用で済みますか？

課金トークン数が同じなら、272K以下の依頼で5分の1です。ただしSonnet 5.5は高いeffortでトークンを多く使い、AAの`max`での1課題あたり費用は$7.60対$3.26とAstraより高くなりました。Sonnet 5.5が同じ作業に使うトークンがAstraの5倍未満に収まるかどうかが分かれ目です。

### 同じ値段のモデル同士で比べるなら何と比べればいいですか？

GPT-6 Solです。入力272K以下の定価はSonnet 5.5と同じ入力$2・出力$10で、Anthropic自身も発表でSonnet 5.5をGPT-6 Solと比べています。

### ChatGPTでAstraを使っている場合も同じ判断になりますか？

なりません。ChatGPTやCodexの利用枠はプランごとに決まっていて、API定価から割り出すことはできません。サブスクリプション同士なら、普段の作業をどちらのアプリで進めるか（Claude CodeかCodexか）と、各プランで使える範囲で考えるのが現実的です。
