Gemini 4やClaude Fable 5.2の話題を、正式発表前だからという理由で脇に置くのは早計です。2026年9月18〜20日に出回った先行テストには、実際の出力を見比べられる投稿や、品質と待ち時間の変化を述べた報告があります。
現時点の読み取りとしては、Gemini 4とされるモデルは細部を描き込む視覚的なコード生成でAstraに迫る兆しがあり、次期Fableは高い推論設定での品質向上と、遅さ・費用との引き換えが焦点です。GPT-6 Astraは、公開仕様と料金を基準にして、これらの変化を評価できる側にあります。
この比較は、先行テスターの報告と公開資料に基づくものです。「Gemini 4 Pro」「Fable 5.2」には投稿者による推定名が含まれます。本記事ではGPT-6を公式資料のあるAstraに絞り、各デモで何が良く見えたのか、仕事で使う際にどの条件が効くのかを考えます。当サイトによるAPI実測ではありません。
先行テストから、まず何を期待できるか
3モデルを一列の順位にするより、報告が集中している能力と、そのために払う代償を分けると選び方が見えてきます。
| 候補 | 先行報告から読み取れる強み | 選択を左右する点 |
|---|---|---|
| Gemini 4とされるモデル | コントローラーSVGなど、形状・陰影・細部をまとめる出力がAstraに近い | 長い生成時間、同じ品質を再現できるか、試験時のモデルの正体 |
| 次期Fable、通称Fable 5.2 | 高い推論設定での品質向上、見栄えや場面全体の作り込みへの好評価 | 遅さと費用への指摘。旧モデルからの切り替えが本当に起きたか |
| GPT-6 Astra | コントローラー比較でも高い評価。公開仕様を使って試用条件を組める | 新しい候補より速い・安いとは、これらの投稿だけでは決まらない |
これは下記の投稿を読んだうえでの用途別の整理です。描き込みの多い出力が欲しい仕事ではGeminiや次期Fableの報告が気になります。一方、待ち時間や再試行が日々の作業を止める仕事では、きれいな一例だけで移行を決めず、完了までの時間も合わせて見る必要があります。
Gemini 4のSVGは、Astraとどこまで近いのか
具体的な比較材料は、Luminaが公開したXboxコントローラーのSVG比較です。投稿者は候補を「Gemini 4 Pro」「GPT-6 Astra Pro」と呼び、両方をほぼ完璧と評価しつつ、Astra側のロゴにわずかな違いがあると述べています。
添付画像では、どちらにもコントローラーの本体、操作部、立体感を出す陰影が描かれています。この一例から読み取れるのは、「Gemini側はAstraから大きく引き離されている」という状況ではなく、形を整え、細部を組み合わせる課題では、両者がかなり近い出力を出したということです。ロゴ一つの差はこの課題での形状の再現度を評価する材料になりますが、それだけで複雑な開発全般の順位は決まりません。
もう一つ大事なのは、結果にかかった時間と再現性です。同投稿の引用元では、Arena上の表示名はgemini 3.7 flashで、前夜の生成に約20分かかったとされています。投稿者は翌日に同じような結果を得られなかったとも記しています。細部の充実が本物でも、毎回20分待つのか、同じモデルへ接続できるのかによって、日常の制作に使う価値は変わります。
なお、投稿者は返信でFable 5.2を利用できていないと説明しています。このコントローラー画像を、Gemini・Astra・Fableの3者を同条件で比べた証拠として扱うことはできません。
ほかのデモにも似た傾向があります。9月19日の鈦媒体の報道は、Gemini 4 Proと推測される出力として、SVGの猫、約8分のボクセル製の塔、約10分のH145ヘリコプター、約14分のモノクロのウェブサイトを紹介しています。二次報道という限界はありますが、「一瞬で何でも作る」よりも、「時間をかけて構造や見た目を詰める」方向の期待として読むほうが、示された例に合っています。
このため、凝った一枚のSVGや画面案を作る用途は、公開後に優先して試す価値があります。対して、短い待ち時間で何度も修正する作業や、既存コードの保守まで同じように得意かどうかは、別の課題で確かめたいところです。
次期Fableの評判で重要なのは「よくなったが、遅く高い」
Fable側には、品質と引き換えになるものを明記した報告があります。JAZIIは9月18日の比較投稿で、同じ指示と高い推論設定を使い、次期Fableとみられるモデルの出力をAstraより好ましく評価しました。現在のFableから大きく改善したとする一方、遅く、費用もかかると述べています。
この報告が示すのは、単なる「Fableが勝った」ではありません。難しい課題で一度の出力を仕上げる力が上がるなら、後から人が直す時間を減らせる可能性があります。しかし、返答を待ちながら細かく相談する使い方では、その遅さが作業の負担になるかもしれません。一回の完成度を優先する用途と、短い往復を重ねる用途で評価が分かれる、というのがこの報告から立てられる仮説です。
ここでの「高い」は、投稿者による費用の評価です。新しい価格表や同一トークン数での請求額が示されたわけではないため、Fable 5.2の入力・出力単価へ換算することはできません。また、JAZII自身が続く投稿で、名称は未確定であり、5.2は自分の推測だと明言しています。品質改善の報告は材料として残し、版番号は推定として読むのが適切です。
ロケットとペリカンのデモは、別の比較として読む
Bhavyはロケットのテストで、Fable 5.1やOpus 5から5.2へ切り替わっているという話を見た後、同じ課題を両方へ試したと述べています。出力が大きく改善し、リアルになったという評価です。
ただし、主投稿で比べているのはFable側とOpus側です。返信での「Astraより良い」という評価は、主投稿に同条件のAstraの実行が追加されたことを意味しません。周囲にはリアルさへの異論や、Opusを好む反応もあります。ここからは、動きや見せ方が評価を左右することは読み取れますが、ロケットの物理的な正しさや、大規模開発の完成度まで証明されたわけではありません。
もう少し具体的に画面の違いを見られるのが、Chetasluaによる自転車に乗るペリカンの3枚比較です。画像のラベルは左から「Updated Fable5.1(5.2へルーティング)」「Opus5.2 next」「GPT Astra Max」で、投稿者はすべて最大設定と説明しています。
左と中央は海辺の風景まで広く描き、右のAstraは円形の枠に収めた、より簡潔な構図です。風景の豊かさや一枚絵としての楽しさを求める人が前二者を好むのは理解できます。一方、用途が小さな挿絵なら、構図が整理されているほうが扱いやすいこともあります。正確な指示や全試行が開示されていない以上、描き込みの多さをそのまま指示への忠実さと同一視せず、何を評価しているのかを分けると有用な比較になります。
これらはグラフィックやコード出力のデモです。テキストモデル自体に画像生成機能が備わったという証拠としては扱いません。
リークの得点表より、出力と条件を重く見る理由
Geminiの噂には、派手な得点表も含まれています。前述の鈦媒体の記事は、DeepSWE、Terminal-Bench、HLE、OSWorldなどの高得点をうたう表を紹介する一方で、その表とバックエンド画面の食い違い、Astraの比較値と公式数値の不一致、Google・Arena・評価機関による裏付けの欠如も記しています。
そのため、本記事ではこの表から性能差の割合や総合順位を計算しません。しかし、得点表の問題が、コントローラーの出力差やテスターが感じた品質変化まで消すわけではありません。出所に問題がある数値と、実際に公開された作例は、別々に評価できます。
モデルの裏側が切り替わったという話も同様です。Chetasluaの9月19日の投稿は、Claude CodeのFable、ウェブ版のOpus、ArenaのGeminiを一つの先行提供の動きとしてまとめています。これは当時流通していた説を知る材料ですが、全アカウントで切り替えが起きたことを示す記録ではありません。
別のGemini 3.8 Flash利用者の投稿では、品質が変わり、トークンの生成速度はおよそ半分になった一方で、使用トークンは減ったと報告されています。正式な速度試験ではありませんが、確認すべき点をよく表しています。1秒あたりの生成トークン数が減っても、必要なトークンややり直しが減れば、仕事が終わるまでの時間は必ずしも同じ割合で延びません。
こうした報告を試用につなげるなら、「何トークン生成したか」だけでなく、「何分で使える成果になったか」を見るのが実務的です。生成時間、人の修正時間、失敗した試行をまとめて記録すると、品質向上の代償が許容できるかを判断できます。
Astraを基準に、どの仕事から比較するか
Astraには、試用条件を組み立てるための公式仕様があります。API IDはgpt-6-astra、入力はテキストと画像、出力はテキストです。コンテキスト全体は1,050,000トークン、最大入力は922,000、最大出力は128,000。推論設定はlowからmaxまで用意されています。
直接APIのStandard料金は、入力272,000トークン以下で通常入力100万トークン当たり10ドル、出力50ドルです。272,000トークンを超えるとリクエスト全体に長文脈の単価が適用され、通常入力20ドル、出力75ドルになります。これはChatGPTの月額料金ではありません。キャッシュや追加料金を含む条件は公式料金表とAPI料金の解説を参照してください。

一方、Googleは7月21日にGemini 4の事前学習開始へ言及していますが、9月20日に確認したAPI一覧からGemini 4の正式なモデルIDや料金は確認できません。Anthropicの公式モデル一覧もFable 5.1などを掲載しており、ここから5.2の仕様を確定することはできません。7月の発言で現在の開発段階を決めつけたり、5.1の価格を5.2へ移したりせず、試すときの利用先と設定を記録します。
| 自分の仕事 | 今の材料から立てられる期待 | 次に比べたいこと |
|---|---|---|
| SVGやウェブ画面の初稿 | Gemini 4とされる出力の細部と形状に注目 | 同じ指示で再現できるか、生成と修正に何分かかるか |
| 難しい課題を一度で仕上げたい | 次期Fableの高推論設定での品質改善に注目 | 待ち時間・費用の増加を、人の手直し削減で回収できるか |
| 対話しながら素早く修正したい | 完成度だけでは選べない | 最初の返答と最終完成までの時間を分けて比べる |
| コード保守や日本語の長文書 | 今回の視覚デモでは材料が少ない | 既存テスト、根拠の正しさ、重要条件の取りこぼしで評価する |
Astraを利用できるかは自分のアカウントで確認する必要があります。APIアクセスの確認事項を押さえたうえで、今使っているモデルと同じ作業を試すと、次期モデルが来たときの比較基準も作れます。各社の「high」「max」は同じ計算量を意味しないため、設定名だけをそろえるのではなく、時間や予算の上限も決めておくと比較しやすくなります。

今すぐ公開済みの候補を比べたい場合は、AstraとFable 5.1の比較やGemini 3系の比較も参考になります。先行テストの魅力を追いながら、現在の作業を止めずに評価の準備を進められます。
現時点では、完成度を求めるほど「時間」の比較が重要になる
今回の材料からは、Gemini側の細かな視覚表現、次期Fable側の高い推論設定での改善に、試す理由があります。とくにコントローラーの作例はGeminiとAstraの近さを、Fableの報告は品質向上と遅さの同居を具体的に示しています。
制作物の初稿をじっくり仕上げたいなら、新しいGeminiやFableの続報を追う価値があります。一方、短い応答を何度も必要とする仕事では、見栄えの良い作例だけで置き換えず、待ち時間と再試行も含めて比べたいところです。Astraの優位は無条件の性能一位ということではなく、公開条件を使って自分の仕事で確かめ始められる点にあります。
3モデルの期待は同じではありません。正式発表を待つ間にも、何が改善したと報告され、何を代わりに支払うことになりそうかは整理できます。その判断を、公開後の同条件の試用で更新していくのが、この時点の情報を最も有効に使う方法です。



