Nano Banana 2.1・Pro・GPT Image 2.5の違い:9課題を1回ずつ実測
文字を正確に入れるならProかGPT Image 2.5、速さと公式価格なら2.1。2026年10月8日の1K・各1回の実測で、日本語看板に余計な語を足したのは2.1だけでした。
目次

Nano Banana 2.1、Nano Banana Pro、GPT Image 2.5のどれを使うかは、画像に入れる文字をどこまで正確にしたいかでほぼ決まります。2026年10月8日に同じ8つのプロンプトと同じ編集1件を3モデルに1回ずつ出したところ、看板・ポスター・価格表の文字を指定どおりに描いたのはNano Banana ProとGPT Image 2.5で、Nano Banana 2.1は3件とも指示から少しずれました。日本語の看板では、2.1だけが頼んでいない語を書き足しています。
一方、生成時間は2.1とProが約20秒、GPT Image 2.5は約1分でした。Googleの公式料金では2.1が1K画像1枚$0.0336とProの約4分の1で、図解・商品写真・配置の指示・色替え編集では3モデルの差は小さく出ました。
この結果は1Kで各1回だけ出した画像の比較で、ベンチマークではありません。GPT Image 2.5はOpenAIのAPIに直接つないだものではなく、LaoZhang APIのVIP従量(1回ごとの課金)経由で呼んでいます。
どれを選ぶか:文字はPro、量は2.1、演出はGPT Image 2.5
実測の結果と料金を合わせると、最初に試すモデルは次のようになります。右端の列は、その判断がどの程度の根拠に支えられているかです。
| 用途 | 最初に試すモデル | 実測で見えたこと | 根拠の強さ |
|---|---|---|---|
| 看板・ポスター・価格表など、文字を一字一句合わせる | Nano Banana Pro。費用を抑えるならGPT Image 2.5 | 3件ともProとGPT Image 2.5は指定どおり。2.1は3件とも表記や語が変わった | 各1回・3件のみ |
| 下書きやバリエーションを大量に作る | Nano Banana 2.1 | 9回すべて初回で成功、17〜33秒。Googleの1K単価はProの約4分の1 | 料金は公式価格。速度と成功率は1回ずつ |
| 手順図・インフォグラフィック | Nano Banana 2.1かPro | 3モデルとも5つの手順は正確。GPT Image 2.5は指示にない標語を追加 | 1件+Googleの自社評価 |
| 広告ビジュアル・商品のメイン画像 | GPT Image 2.5 | 3モデルとも写実的で破綻なし。GPT Image 2.5が最も演出が強い | 見た目の評価は主観。Arenaでは首位(暫定) |
| 既存画像の色替えなど部分編集 | どれでも可。変える範囲を具体的に書く | 3モデルとも構図を保った。ふたの内側の扱いだけが分かれた | 1件のみ |
| 簡体字の中国語を入れる | どれを使っても目視確認が必要 | 3モデルとも「单」を日本の字形「単」で描いた | 1件のみ |
Nano Banana Proを文字の第一候補にしたのは、GPT Image 2.5と同じく指定どおりに描けたうえで、生成時間が3分の1ほどで、今回のテストでは一度も失敗しなかったためです。LaoZhang APIで1回ごとに払う場合は、GPT Image 2.5のVIP従量(1回$0.03)が3モデルで最も安く、文字の正確さもProと並びました。待ち時間が気にならない用途ではこちらを先に試す価値があります。
実測の条件:1Kで各1回、GPT Image 2.5はLaoZhangのVIP従量経由
テストは2026年10月8日に、LaoZhang AI編集部がLaoZhang API経由で行いました。条件は次のとおりです。
| モデル | 呼び出したモデルID | 呼び出し方 | 設定 |
|---|---|---|---|
| Nano Banana 2.1 | gemini-nano-banana-2.1 | Gemini形式のgenerateContent | 1:1、imageSize 1K、思考は既定のまま |
| Nano Banana Pro | gemini-3-pro-image | Gemini形式のgenerateContent | 1:1、imageSize 1K |
| GPT Image 2.5 | gpt-image-2.5-sunburst-vip | /v1/images/generationsと/v1/images/edits | 1024×1024、quality high |
課題は次の9つです。8つは画像生成で、最後の1つは2.1が描いた黒いイヤホンケースの写真を3モデルに同じ指示で編集させたものです。
- 英語のコンサートポスター:「MIDNIGHT TRAIN」と「Live at Hall 7 - Nov 14, 2026 - Doors 19:30」
- 「How a bill becomes law in the U.S.」(米国で法案が法律になるまで)の5段階の図解
- 石の上に置いた黒いイヤホンケースの商品写真(文字・ロゴなし)
- 夕暮れの東京の路地。ラーメン店の看板に「本日のおすすめ ラーメン 980円」、入口の横に「OPEN」
- 中国茶館の筆書きメニュー:「今日茶单」「龙井 38元」「普洱 42元」「茉莉花茶 28元」
- 机の左半分に赤いカップ3個、右半分に青いカップ2個を真上から
- 港で網を繕う年配の漁師のポートレート
- 天気アプリの画面:「Lisbon 23°C Sunny」と、Mon〜Friの5日分に23・21・19・22・24
- 編集:ケースの色を光沢のある白に変え、イヤホン・角度・石・光と影はそのまま
各モデル1回ずつで、引き直しや選別はしていません。文字の課題(1、4、5、8)は1字ずつ確認しました。27回の成功分をLaoZhangの定価で数えると、9課題 ×($0.045 + $0.09 + $0.03)=$1.485です。
GPT Image 2.5の接続方式には注意が必要です。LaoZhangでOpenAIへそのまま転送するgpt-image-2.5-sunburstはSora2Officialグループのキーでしか使えず、通常グループのキーでは503「no available channels」が返りました(この失敗は課金されていません)。そのため1回$0.03のVIP従量版gpt-image-2.5-sunburst-vipを使っています。LaoZhangのGPT Image 2.5ドキュメントにあるとおりこれはLaoZhang独自の従量課金の経路で、OpenAIのAPIを直接呼んだ場合と出力が同じとは限りません。
このテストで分からないことも挙げておきます。2Kと4Kの画質、GoogleやOpenAIに直接つないだときの速度、Batch処理、複数の参照画像を使った人物や商品の一貫性、Google検索によるグラウンディング、そして同じプロンプトを何度も出したときのばらつきです。1回だけの結果なので、どの項目も「このモデルは常にこうなる」とは言えません。
画像内の文字の違い:指示からずれたのは3件とも2.1
文字を指定した3つの課題では、Nano Banana ProとGPT Image 2.5が指定どおりの文字を描き、Nano Banana 2.1はどれも語の追加や表記の書き換えをしました。読めない文字や崩れた文字はどのモデルにもなく、差が出たのは「指示どおりか」という点です。

日本語の看板:2.1だけが頼んでいない語を追加
「本日のおすすめ ラーメン 980円」はProとGPT Image 2.5が一字も違えずに描きました。Proは店の軒先の看板に、GPT Image 2.5は店先の電飾看板に入れ、どちらも入口の横に「OPEN」の札を描いています(GPT Image 2.5は縦書き)。GPT Image 2.5は背景に「麺」「やきとり」といった看板も足していますが、指定した看板の文字には影響していません。
Nano Banana 2.1は店先のA型看板に「本日のおすすめ」「ラーメン」「980円」を正しく書いたうえで、その間に「エソープ」のように読める、指示にない文字列を入れました。日本語の文字そのものは整っているため、遠目には気づきにくい種類の誤りです。そのまま広告や店頭用の素材に使うと、意味の通らない語が載ることになります。
英語ポスター:2.1は日付の行を大文字とダッシュに変更
「MIDNIGHT TRAIN」の大見出しは3モデルとも正確でした。違いは2行目で、ProとGPT Image 2.5は「Live at Hall 7 - Nov 14, 2026 - Doors 19:30」を指定どおりに描き、2.1は「LIVE AT HALL 7 — NOV 14, 2026 — DOORS 19:30」と全部大文字にしてハイフンを長いダッシュに変えました。デザインとしては自然ですが、表記を変えてほしくない場面では修正が必要です。
構図にも差がありました。2.1とProはポスターを背景の上に置いた「紙」として描き、GPT Image 2.5は画面いっぱいをポスターにして、線路が奥へ伸びるモチーフまで加えています。3枚の中で最も完成品に近く見えたのはGPT Image 2.5でした。
中国語メニュー:3モデルとも「单」を日本の字形「単」で描いた
価格はProとGPT Image 2.5が「38元」「42元」「28元」と指定どおりで、2.1は龍井茶の価格だけを「三十八元」と漢数字に書き換えました。
見落としやすいのはタイトルです。プロンプトでは簡体字の「今日茶单」と指定しましたが、3モデルとも「単」(日本の字形)で描きました。日本向けの素材なら問題になりませんが、中国大陸向けのメニューや広告では誤字になります。簡体字・繁体字・日本の字形で形が違う漢字を使うときは、どのモデルでも出力を目で確かめる必要があります。
文字の多い課題では、2.1の思考トークンも増えました。ポスターで1,552、日本語看板で1,209、中国語メニューで1,352と、文字のない商品写真(336)の数倍です。Proは同じ課題でも122〜252にとどまりました。2.1は文字の多い画像ほど内部で多く考えていて、それでも指示からのずれが残ったことになります。
図解と天気アプリ画面:内容は正確、差は指示外の追加
図解と画面モックでは、指定した内容は3モデルとも正確でした。差が出たのは、頼んでいない要素をどれだけ足すかです。
米国で法案が法律になるまでの5段階の図解は、3モデルとも事実として正しい順序でした。2.1は「提出→委員会→本会議で審議・採決→もう一方の院へ→大統領」と素直な流れで、Proは上下両院の採決を1段階にまとめ、両院協議会の段階を入れています。GPT Image 2.5は各段階に説明文を付けた最も情報量の多い図でしたが、下部に「A LAW FOR A STRONGER TOMORROW」という、指示にない標語を入れました。社内資料ならそのままでも使えますが、公開する図では余計な文言を消す手間が出ます。
天気アプリの画面では、「Lisbon 23°C Sunny」とMon〜Friの5日分の気温を3モデルとも正しく描きました。そのうえで2.1は空気の質・湿度・風速の行を、Proは体感温度・UV指数・最高最低気温・時間ごとの予報・空気の質などを小さな文字で書き足しています。GPT Image 2.5は指定した要素だけを大きく配置し、追加は最も少なく済みました。アプリのモックアップのように「書いたものだけを載せたい」場面では、GPT Image 2.5が後処理の手間が少なかったことになります。
Googleは2.1の既知の弱点として「1Kでは小さな文字がぼやけることがある」と公表しています。今回の天気画面では2.1の小さな文字も読める状態でしたが、文字の小さい画像を本番に使うなら2Kで出して比べるほうが確実です。
商品写真と人物写真:破綻なし、演出はGPT Image 2.5が強め
文字を含まない3つの課題では、3モデルとも使える画像を返しました。
- 商品写真:3枚とも写実的で、ケースの質感や影も自然です。2.1とProは落ち着いた撮影風、GPT Image 2.5は光の当て方が強く、ケースの形も高級感のある別の形状になりました。
- 漁師のポートレート:3枚とも肌や網の質感が自然です。GPT Image 2.5は夕日を画面に入れた色の濃い仕上がりで、2.1とProはより素直な写真に近い色でした。
- カップの配置:赤3個を左、青2個を右という指定を3モデルとも守りました。Googleは2.1の既知の弱点に左右の取り違えを挙げていますが、今回の1回では起きていません。
広告のメイン画像のように「目を引く1枚」が欲しいならGPT Image 2.5、カタログ写真のように素直な見た目が欲しいなら2.1かProという分け方になります。ただし見た目の好みは主観で、1回ずつの比較では傾向以上のことは言えません。
同じ画像の色替え編集:3モデルとも成功、ふたの内側で差
2.1が描いた黒いイヤホンケースの写真を3モデルに渡し、「ケースを光沢のある白に。それ以外はそのまま」と指示しました。3モデルともケースを白くし、イヤホン、カメラの角度、石の表面、光と影を保っています。
違いはふたの内側です。2.1とProはふたの内側まで白くし、GPT Image 2.5はふたの内側を黒いまま残しました。どちらも「ケースの色」の解釈としてあり得るため、正誤ではなく解釈の差です。実際の商品画像を編集するときは、「ふたの内側も白に」「内側は黒のまま」のように、変える範囲を部品単位で書くと結果がそろいやすくなります。
Googleの自社評価でも、一般的な編集では2.1がProを上回っています(スコア1026対939)。今回の1件ではその差は見えず、3モデルとも実用上の問題はありませんでした。
速度と失敗率:2.1とProは約20秒、GPT Image 2.5は約1分
1枚あたりの所要時間(手元の端末からの実測、各1回)は次のとおりです。
| モデル | 所要時間 | 1回目で成功した割合 |
|---|---|---|
| Nano Banana 2.1 | 17〜33秒 | 9回中9回 |
| Nano Banana Pro | 18〜23秒 | 9回中9回 |
| GPT Image 2.5(VIP従量) | 58〜76秒 | 11回中9回。2回は503「Upstream model service error」で、再試行して成功 |
この時間にはLaoZhangのゲートウェイと通信の時間が含まれ、GoogleやOpenAIに直接つないだときの速度ではありません。それでもGPT Image 2.5は2.1やProのおよそ2〜4倍待つ計算になり、1枚ずつ確認しながら作る作業では差を体感します。大量に並列で回す用途や、ユーザーが画面の前で待つサービスに組み込むなら、2.1かProのほうが扱いやすい結果でした。
2.1で最も時間がかかったのは中国語メニューの33秒でした。思考トークンの量と時間はきれいには比例せず、思考トークンが最も多かった図解(1,704)は22秒で終わっています。
1枚あたりの料金:公式APIとLaoZhang経由で安い順が入れ替わる
料金は、GoogleやOpenAIの公式APIを直接使う場合と、LaoZhang APIで1回ごとに払う場合とで順番が変わります。
| 項目 | Nano Banana 2.1 | Nano Banana Pro | GPT Image 2.5 |
|---|---|---|---|
| 公式API・1K | $0.0336(思考トークンは別) | $0.134 | 約$0.053(1024×1024、high、下の計算) |
| 公式API・2K | $0.0504 | $0.134 | サイズとトークン数で変動 |
| 公式API・4K | $0.113 | $0.24 | サイズとトークン数で変動 |
| LaoZhang API・1回 | $0.045(サイズを問わず) | $0.09 | $0.03(VIP従量) |
| LaoZhang APIで1,000枚 | $45 | $90 | $30 |
Googleの価格はGemini APIの料金ページのStandardの画像出力分で、Batchを使うと半額です。2.1は思考トークンが既定でオンになり、テキストと思考の出力は100万トークンあたり$7.50で別に請求されます。今回いちばん思考トークンが多かった図解(1,704)で計算すると、1,704 × $7.50 ÷ 1,000,000 ≒$0.013で、1K画像と合わせても約$0.047です。それでもProの1K($0.134)の3分の1ほどに収まります。
GPT Image 2.5はOpenAIのAPI料金ページで画像出力100万トークンあたり$30です。今回のVIP従量の応答は、1024×1024・highで毎回1,756の出力画像トークンを報告していました。これをOpenAIの単価に当てはめると、1,756 × $30 ÷ 1,000,000 ≒$0.053です。OpenAIの料金計算ツールでは、1024×1024の1枚は画質lowの$0.0059から最高設定の$0.2107まで幅があります。いずれもOpenAIの見積もりで、請求書の金額ではありません。
まとめると、公式APIで1K画像なら2.1が最も安く、GPT Image 2.5、Proの順です。LaoZhang APIの1回払いではGPT Image 2.5($0.03)、2.1($0.045)、Pro($0.09)の順になり、2.1は4Kでも$0.045のままです。どちらの場合もProは最も高く、文字の正確さや一貫性にその差額を払う価値があるかが判断の分かれ目になります。

LaoZhang APIでは、今回のテストのとおり同じキーで3モデルを呼べるため、自分のプロンプトで同じ比較を再現できます。Proの費用をサブスクリプションや他のサービスと比べたい場合はNano Banana Proの料金をAPI・月額プラン・外部サービス別に計算した記事、2.1と前の世代のサイズ別料金はNano Banana 2 API料金の解説にまとめています。
ArenaのランキングとGoogleの自社評価:総合では2.1がProより上
今回の実測とは別に、公開されている評価が2つあります。どちらも誰が測ったかによって意味が変わるので、分けて読む必要があります。
Arenaの画像生成ランキングは、利用者が2枚の画像を見比べて投票する盲評価です。10月6日更新の時点で、GPT Image 2.5 Sunburstが1425点(±7)で1位、同Flareが1398点で2位、Nano Banana 2.1が1328点(5,312票)で5位、Nano Banana Pro(2K)が1248点で16位でした。GPT Image 2.5の2種とNano Banana 2.1の点数はまだ暫定で、文字の正確さ・料金・編集は評価に含まれていません。見た目の好みでGPT Image 2.5が強いという傾向は、今回のポートレートやポスターの印象とも合っています。
Googleの自社評価(Nano Banana 2.1のモデルカード)では、思考ありの2.1がProを多くの項目で上回っています。総合的な好みで1050対935、インフォグラフィックの事実の正確さで0.521対0.265、一般的な編集で1026対939、複数キャラクターの一貫性で1106対1011、マスク指定の編集で1049対927です。ただしGoogle自身による評価で、独立した検証ではありません。同じモデルカードは、1Kでの小さな文字のぼやけ、マスク編集での指示の一部無視、左右の取り違えを2.1の既知の弱点として挙げています。
「2.1はProを超えた」という評価は、総合点ではこの2つの数字が裏づけています。一方、今回の1Kの実測では、指定した文字を一字一句守る点ではProが上でした。総合力で選ぶなら2.1、文字の正確さを外せないならProという使い分けになります。2.1の公開時期や料金、移行方法はNano Banana 2.1の解説記事で詳しく扱っています。
3モデルの仕様:解像度・アスペクト比・参照画像の上限
画質以外で選択が変わるのは、出力サイズと参照画像の数です。
| 項目 | Nano Banana 2.1 | Nano Banana Pro | GPT Image 2.5 |
|---|---|---|---|
| 出力サイズ | 1K・2K・4K(0.5Kなし) | 1K・2K・4K | 最大3840×2160または2880×2880、任意のサイズを指定可 |
| 形の指定 | 1:8や8:1を含む14種類のアスペクト比 | アスペクト比を選ぶ | 幅と高さを直接指定 |
| 画質の指定 | 解像度で選ぶ | 解像度で選ぶ | qualityをlowからmaxまで選ぶ |
Googleの2モデルは参照画像の上限も違います。2.1は最大14枚(物体10枚・人物4人)、Proは物体6枚・人物5人までです。Google検索によるグラウンディングは、2.1がウェブ検索と画像検索、Proがウェブ検索に対応しています。
人物を5人まで固定したいならPro、物体の参照を多く渡したいなら2.1、横長のバナーや縦長のスクロール画像のような極端な比率なら2.1かGPT Image 2.5が候補です。GPT Image 2.5のSunburstとFlareの選び方はGPT Image 2.5 FlareとSunburstの違い、GPT Image 2から移るかどうかはGPT Image 2.5とGPT Image 2の比較を参照してください。
Nano Banana 2.1・Pro・GPT Image 2.5についての質問
Nano Banana 2.1とNano Banana Proの違いは何ですか?
2.1は速くて安い汎用モデルで、Proは本番素材向けの上位モデルです。Googleの1K画像の単価は2.1が$0.0336、Proが$0.134です。Googleの自社評価では総合的な好みや編集で2.1がProを上回りますが、1Kで各1回出した実測では、看板やポスターの文字を指定どおりに描いたのはProで、2.1は語の追加や表記の書き換えをしました。人物の参照はProが5人まで、2.1が4人までです。
Nano Banana 2.1はProより上ですか?
総合的な評価では上です。Googleの自社評価で2.1がProを上回り、Arenaのランキングでも2.1(5位)がPro(2K版、16位)より上にいます。ただし画像内の文字を一字一句守る点では、今回の実測でProのほうが正確でした。文字が主役の画像ではProを先に試すほうが安全です。
日本語の文字を画像に入れるならどのモデルですか?
Nano Banana ProかGPT Image 2.5です。「本日のおすすめ ラーメン 980円」の看板を1回ずつ描かせたところ、この2つは指定どおりで、2.1は指示にない語を書き足しました。待ち時間を短くしたいならPro(約20秒)、1回の費用を下げたいならLaoZhang APIのVIP従量のGPT Image 2.5($0.03、約1分)です。どのモデルでも、公開前に1字ずつ確認するのが前提です。
GeminiアプリではNano Banana 2.1とProのどちらが使えますか?
Geminiアプリでは、2.1はGoogle AI Pro・Plus・Ultraの有料プラン向けで、無料ユーザーが使えるのはNano Banana 2です。有料プランでは、生成した画像をProで作り直す「Redo with Pro」が使えます。APIと違い、モデルを細かく選んだり枚数あたりの費用を計算したりする使い方には向きません。
GPT Image 2.5はNano Banana 2.1より文字に強いですか?
今回の3つの文字課題(英語ポスター、日本語看板、中国語メニュー)では、GPT Image 2.5はすべて指定どおりで、2.1はすべてどこかが変わりました。その範囲ではGPT Image 2.5のほうが正確です。ただしGPT Image 2.5は図解に指示外の標語を足すことがあり、生成に約1分かかりました。今回のGPT Image 2.5はLaoZhangのVIP従量経由で、OpenAIのAPIに直接つないだ結果ではありません。
参考資料2
本文で参照している外部ページを、登場順に並べています。最終更新日:2026年10月8日。
参考資料2
本文で参照している外部ページを、登場順に並べています。最終更新日:2026年10月8日。





