跳转到主要内容

GPT Image 2.5 Flare、Sunburst 与 GPT Image 2 的区别:继续用还是迁移,怎么换才不改账单

19 分钟阅读API 指南

三款模型的 token 单价完全相同,但同一个 quality 标签对应的输出预算不同:只把 model 换成 2.5 并保留 medium,1024×1024 的输出 token 会从 1,756 降到 439。本文按 OpenAI 官方迁移路径说明何时留在 GPT Image 2、何时先测 Flare 或 Sunburst,以及怎样对齐预算做公平比较。

书桌显示器上的选型示意图:从 gpt-image-2 出发的三条路径,分别指向 gpt-image-2.5-flare、gpt-image-2.5-sunburst 与继续用 gpt-image-2

已经在用 gpt-image-2 且输出合格的流程,先用同样的提示词和参考图测 gpt-image-2.5-flare,目标是保住质量、缩短等待;GPT Image 2 在复杂编辑上达不到要求的,先测 gpt-image-2.5-sunburst 确认质量,再用同一批输入测 Flare;依赖 Batch 半价的流程暂时留在 GPT Image 2。 这是 OpenAI 提示词指南给出的迁移路径,不是本站的测试结论。GPT Image 2.5 提示词指南:选择模型

迁移本身有一个容易被忽略的陷阱:三款模型的 token 单价一模一样,但 quality: "medium" 在 GPT Image 2 和 2.5 上对应的输出预算相差约 4 倍。只改 model 字符串、其他参数原样保留,账单和画面复杂度会一起变化,而错误日志里什么都不会提示。下文先讲清三款模型的官方定位,再讲预算对应关系、现有的速度与画质证据,最后给出可以直接照做的迁移步骤。

先看结论:三种情况分别怎么办

你的现状先测哪款判断标准
GPT Image 2 流程已验证、质量合格,想缩短等待gpt-image-2.5-flare同一批提示词、参考图和尺寸下,质量不掉、响应时间缩短才切换
GPT Image 2 在复杂编辑、细节保留上不达标gpt-image-2.5-sunburst先确认 Sunburst 达标;达标后再用同样输入测 Flare,Flare 也达标且更快就用 Flare
依赖 v1/batch 的离线批量任务继续用 gpt-image-2两款 2.5 型号页目前把 v1/batch 标为不支持,Batch 价格表也只列了 gpt-image-2
新接入,没有历史基线速度优先选 Flare,质量要求苛刻选 Sunburst输出达标后再往低质量档试,看能否进一步降延迟

GPT Image 2 没有被弃用。官方弃用页上,2026 年 10 月 23 日下线的 gpt-image-1 和 2026 年 12 月 1 日下线的 gpt-image-1.5gpt-image-1-minichatgpt-image-latest,推荐替代都是 gpt-image-2gpt-image-2 与两款 2.5 型号都没有弃用条目。OpenAI 弃用页。所以"留在 GPT Image 2"是一个正常选项,不是拖延。

三款模型的官方定位,以及 OpenAI 自己的两种说法

截至 2026 年 9 月 22 日,OpenAI 图片模型只有三个当前型号 ID,都接受文字与图片输入、输出图片,都支持生成、编辑和局部重绘。不带后缀的 gpt-image-2.5 不是模型 ID。

型号 ID当前快照型号页标签官方定位quality 档位
gpt-image-2gpt-image-2-2026-04-21性能 Higher,速度 Medium上一代主力模型,旧模型的官方推荐替代lowmediumhighauto
gpt-image-2.5-flaregpt-image-2.5-flare-2026-09-08速度 Very fast"面向高质量日常生图的最快模型",小模型,速度优先lowmediumhighxhighmaxauto
gpt-image-2.5-sunburstgpt-image-2.5-sunburst-2026-09-08性能 Highest,速度 Medium"生成与编辑能力最强的模型",基础模型,质量优先同 Flare

来源:gpt-image-2 型号页gpt-image-2.5-flare 型号页gpt-image-2.5-sunburst 型号页。标签是 OpenAI 的分类描述,不是测量值。

关于 Flare 相对 GPT Image 2 的画质,OpenAI 自己有两种表述,最好都记住:

  • 提示词指南:Flare "是小模型,为速度优化,画质与 GPT Image 2 相当";Sunburst "是基础模型,为质量优化,画质高于 GPT Image 2";两者"在精确编辑和主体保留上都有改进"。
  • 2026 年 9 月 8 日的发布文:Flare "是多数应用的默认选择,与 GPT‑Image‑2 相比,它能以低 50% 的延迟生成质量更高的图像";Sunburst "为精细创作提供额外一层精度,生成时间更长"。OpenAI 发布说明

"相当"和"更高"之间的差别,OpenAI 没有解释,本站也没有做付费实测来裁决。中文页面里流传的"Flare 速度是 GPT Image 2 的 2 到 4 倍"没有出现在发布文正文里,本文不采用。能拿到的第三方数据在后文单独列出,并注明条件。

单价相同,为什么只换 model 账单就变了

三款模型的 Standard 单价完全一致

计费项gpt-image-2gpt-image-2.5-flaregpt-image-2.5-sunburst
文字输入$5.00 / 百万 token$5.00$5.00
文字输入(缓存命中)$1.25$1.25$1.25
图片输入$8.00$8.00$8.00
图片输入(缓存命中)$2.00$2.00$2.00
图片输出$30.00$30.00$30.00
文字输出不计费不计费不计费

来源:OpenAI 价格页 Standard 标签,2026 年 9 月 22 日读取;两款 2.5 型号页也写明 "Token rates match GPT Image 2"。

如果你在别处看到"GPT Image 2 图片输出 $15/百万、2.5 贵一倍"或者"GPT Image 2 半价",那是把 GPT Image 2 的 Batch 价格(图片输入 $4.00、缓存 $1.00、输出 $15.00、文字输入 $2.50、缓存 $0.625,正好是 Standard 的一半)当成了 Standard 价格。价格页的 Batch 标签只列了 gpt-image-2,两款 2.5 型号页把 v1/batch 标为不支持。今天的状态是"2.5 尚未列出 Batch",不是"永远没有"。

同一个 quality 标签,输出预算不同

真正改变单张费用的是输出 token 数。官方图片生成指南明确写道,模型"可以为同一个 quality 设置消耗不同的 token 数,但共享同一个图片输出 token 单价",并且"相同的 quality 标签不意味着跨模型的图片质量或响应时间相同"。图片生成指南:成本与延迟

下面是官方计算器在 2026 年 9 月 22 日的实时读数(只算输出 token,按 $30/百万折算,不含文字与图片输入,也不含流式 partial images;计算器把 Sunburst 与 Flare 合并为一个选项):

qualityGPT Image 2,1024×1024GPT Image 2.5,1024×1024GPT Image 2,2048×1152GPT Image 2.5,2048×1152
low196 token($0.00588)196($0.00588)157($0.00471)157($0.00471)
medium1,756($0.05268)439($0.01317)1,413($0.04239)367($0.01101)
high7,024($0.21072)1,756($0.05268)5,650($0.16950)1,413($0.04239)
xhigh不提供3,122($0.09366)不提供2,511($0.07533)
max不提供7,024($0.21072)不提供5,650($0.16950)

对应关系一眼可见:2.5 的 high 等于 GPT Image 2 的 medium 预算,2.5 的 max 等于 GPT Image 2 的 high 预算,low 两代相同,2.5 的 mediumxhigh 插在中间。可以把 2.5 的质量阶梯理解为在 GPT Image 2 的三档之间多插了两档,而不是整体上移。

桌面卡片上的阶梯对照图:GPT Image 2 三档与 GPT Image 2.5 五档的输出 token 预算,low 对 low、medium 对 high、high 对 max 以虚线标为预算相同,1024×1024 官方计算器估算

这带来两个实际后果:

  1. 原样保留 quality: "medium" 只换 model,1024×1024 的输出预算从 1,756 token 降到 439 token,单张输出费用从约 $0.053 降到约 $0.013。账单会明显变少,但你其实是在用一个更小的预算生成图片,复杂构图和细节可能一起变简单。这不是模型退步,是设置被悄悄调低了。
  2. 想在等预算下比较,GPT Image 2 medium 应该对 2.5 high,GPT Image 2 high 应该对 2.5 max。Artificial Analysis 榜单把 2.5 max 与 GPT Image 2 high 放在一起比,正是同样的 7,024 token 预算。

计算器给的是估算,auto 无法估算;流式输出每张 partial image 额外计 100 输出 token;编辑请求带参考图时,gpt-image-2 强制按高保真处理图片输入,输入 token 也会更高。实际成本以响应里的 usage 字段为准。需要更细的预算表可以看 GPT Image 2.5 API 价格与按次计费怎么选GPT Image 2 API 价格说明

速度、画质与多轮漂移:现有证据能说明什么

盲测榜单:2.5 领先,但票数还少

Arena(原 lmarena)的两张榜单,页面标注更新于 2026 年 9 月 7 日:

榜单gpt-image-2.5-sunburstgpt-image-2.5-flaregpt-image-2(medium)
文生图1421 ±13(3,149 票,Preliminary)1399 ±13(2,856 票,Preliminary)1381 ±4(78,731 票)
图片编辑1520 ±9(6,704 票,Preliminary)1491 ±9(5,676 票,Preliminary)1461 ±3(235,928 票)

来源:Arena 文生图榜Arena 图片编辑榜。两款 2.5 都标着 Preliminary,票数不到 GPT Image 2 的十分之一;GPT Image 2 的条目是 medium 档,与 2.5 的默认档位不是等预算比较。

Artificial Analysis 的文生图 Elo(盲投):Sunburst max 1197 ±9(13,401 次比较),Flare max 1190 ±9(12,778 次),GPT Image 2 high 1171 ±9(15,176 次)。Artificial Analysis 文生图榜。这组数据是等预算的(都是 7,024 token),Flare 与 Sunburst 的差距在误差范围内;它衡量的是偏好,不是速度或成本。

唯一读到的等预算延迟测试:Tosea 的幻灯片编辑

Tosea.ai 在 2026 年 9 月 9 日发布了自己的测试:用官方 API 的 images/edits 端点,提示词是大纲加 1 到 3 张品牌模板参考图,主矩阵 2048×1152,每个设置 5 页取平均,单次调用、无重试,共 41 次调用全部成功。它从响应的 usage 读到的输出 token 与上表 2048×1152 的官方读数完全一致。Tosea:GPT Image 2.5 完全指南(日文)

在这个条件下,同为 1,413 token 的渲染(GPT Image 2 medium 对 2.5 high):GPT Image 2 平均 37.3 秒,Sunburst 27.7 秒,Flare 19.7 秒,即 Flare 快 47%、Sunburst 快 26%,每页输出费用都约 $0.059。同为 5,650 token 时分别是 82.9、59.8、33.7 秒。三款模型在全部 15 张矩阵幻灯片上的文字和数字都正确,没有出现 2.5 成功而 GPT Image 2 失败的情况。

多轮编辑漂移(连续 1、2、3 次编辑后相对原图的像素变化比例):GPT Image 2 为 5.6%、8.1%、11.4%,Sunburst 为 4.1%、6.8%、9.9%,Flare 为 3.8%、6.7%、9.2%;三款各 9 次编辑全部成功。作者还观察到 2.5 的 auto 在 5 次运行里有 4 次落在 1,413 token 档,有一次是 628。

这些数字的边界很清楚:一个视觉领域(带品牌参考的密集商务幻灯片)、两个分辨率、每格 5 张、无 p95。人像、个人照片的主体保留、透明背景、蒙版局部重绘都没有测。OpenAI 自己也说"一个工作负载上的速度提升不能推出另一个工作负载上的固定提升"。把它当作"2.5 在等预算下确实更快、漂移略小"的一个支持性样本,而不是通用比例。

按官方路径迁移:六步检查清单

以下步骤来自提示词指南"迁移现有工作流"一节,结合前面的预算对应关系补充了具体参数。提示词指南:迁移现有工作流

办公室看板上的六步流程图:从 GPT Image 2 迁移到 2.5 依次为保存基线、选第一个候选、检查完整结果、质量过了再测延迟、一次只调一个设置、灰度上线并保留回退

  1. 保存基线。 收集有代表性的生产提示词与参考图,特别是困难编辑、必须精确的文字、人脸、商品几何形状、透明素材;记录当前的模型、请求参数和结果。
  2. 选第一个候选。 GPT Image 2 已达标就先测 Flare;在复杂任务上不达标就先测 Sunburst。第一轮比较保持提示词、参考图、尺寸、输出格式不变,并且把 quality 显式写出来,按预算对应(GPT Image 2 medium 对 2.5 high),不要沿用 auto 或同名标签。
  3. 检查完整结果。 对比指令遵循、身份与商品保留、文字准确性、不该变的地方有没有变、透明通道是否干净;重复请求看一致性;编辑流程要测完整的连续步骤,不只测单步。
  4. 质量过了再测延迟。 从 Sunburst 起步且达标的,用同一批要求评估 Flare,只有质量仍可接受且延迟改善才切换,否则留 Sunburst。
  5. 一次只调一个设置。 先比较质量档位再改提示词;记录典型响应时间与慢响应、失败、重试和每张合格图片的成本。官方原话是"确认当前价格,而不是假设更快的模型更便宜"。
  6. 按工作流灰度上线。 通过验收后先切一小部分流量,监控同样的指标再扩大;旧模型在受支持期间保留为回退,最好固定到快照 gpt-image-2-2026-04-21

请求层面的改动很小。以编辑请求为例,等预算迁移只需要改两处:

python
from openai import OpenAI client = OpenAI() # 基线:GPT Image 2,medium 档,1024×1024 约 1,756 输出 token baseline = client.images.edit( model="gpt-image-2", image=open("product.png", "rb"), prompt="把背景换成浅灰色摄影棚,商品和标签保持不变", quality="medium", size="1024x1024", ) # 候选:GPT Image 2.5 Flare,high 档,同样约 1,756 输出 token candidate = client.images.edit( model="gpt-image-2.5-flare", image=open("product.png", "rb"), prompt="把背景换成浅灰色摄影棚,商品和标签保持不变", quality="high", size="1024x1024", ) print(baseline.usage, candidate.usage) # 用实际 usage 核对预算是否对齐

几处参数差异需要留意:gpt-image-2 不接受 xhighmax,也不允许传 input_fidelity(它对所有图片输入固定高保真);三款模型的尺寸限制相同(边长为 16 的倍数、长短边比不超过 3:1、总像素 655,360 到 8,294,400,超过 2560×1440 为实验性);透明背景在三款上都要显式传 background: "transparent" 并用 PNG 或 WebP 输出,图片生成指南的 GPT Image 2 参考页把透明背景标为预览功能。走 Responses API 的话,把 2.5 型号写在 image_generation 工具的 model 字段即可,主线模型的 token 会另行计费。图片生成指南

每张合格图片的成本按"计费的全部尝试(输入 + 输出 + partial images + 重试)÷ 被采纳的图片数"计算。举一个假设的例子:如果 Flare high 在你的任务上 10 次采纳 9 次,GPT Image 2 medium 10 次采纳 7 次,即使单次输出费用相同(都约 $0.053),Flare 的每张合格图片成本会低约 22%;反过来采纳率更低的话,账单省下的钱会被重试吃掉。采纳率只能在自己的基线上测出来。

什么时候继续留在 GPT Image 2

  • Batch 是成本主体。 v1/batch 目前只有 gpt-image-2 列出支持,Batch 价格是 Standard 的一半。离线批量任务如果对延迟不敏感,2.5 在 Standard 下的输出预算优势(例如 2.5 high 对 GPT Image 2 medium,同预算)并不能抵消 Batch 的半价,除非你原本就在用 low
  • 已验证的流程没有延迟痛点。 官方路径的前提是"想在保住质量的同时降低延迟"。如果用户不在等图,切换只会带来重新验收的成本。
  • 需要回退目标。 即便决定迁移,灰度期间也要保留 gpt-image-2 的调用路径;它目前没有弃用条目,且是 GPT Image 1 系列的官方推荐替代,短期内不会成为"必须离开"的模型。

尚未接入 GPT Image 2 的读者,可以先看 GPT Image 2 API 接入说明,再决定是否直接从 2.5 起步。

Flare 还是 Sunburst:只需要记住一条顺序

两款 2.5 的差别不是"一个只能生图、一个只能修图",而是速度与质量的取舍:Flare 是速度优先的小模型,Sunburst 是质量优先的基础模型,两者同样支持生成、编辑与透明背景,token 单价相同,计算器里的输出预算也相同。官方给的顺序是:Sunburst 达标后一定要再用同样输入测 Flare,Flare 也达标就用 Flare;Flare 达不到才留 Sunburst。两者在编辑精度、细节保留上的具体比较见 GPT Image 2.5 Flare 与 Sunburst 对比。如果切到 2.5 后画面出现噪点或颗粒感,通常先排查质量档位与输出格式,参见 GPT Image 2.5 噪点与颗粒问题排查

常见问题

GPT Image 2 会下线吗?

截至 2026 年 9 月 22 日不会。OpenAI 弃用页上没有 gpt-image-2 的条目,它反而是 gpt-image-1(2026 年 10 月 23 日下线)与 gpt-image-1.5gpt-image-1-minichatgpt-image-latest(2026 年 12 月 1 日下线)的推荐替代。官方同时建议在旧模型受支持期间把它保留为回退,这意味着"今天没有弃用"不是永久承诺。

GPT Image 2.5 比 GPT Image 2 贵一倍吗?

不是。三款模型的 Standard 单价完全相同,图片输出都是 $30/百万 token。"贵一倍"的说法把 GPT Image 2 的 Batch 价格($15/百万输出)当成了 Standard 价格。真正影响单张费用的是输出 token 数,而 2.5 在同名 quality 下消耗的 token 通常更少:1024×1024 的 medium 是 439 token,GPT Image 2 是 1,756。

只把 model 改成 gpt-image-2.5-flare,其他参数不动,行不行?

请求会成功,但如果 qualitymedium,输出预算会从 1,756 token 降到 439(1024×1024),画面复杂度和费用同时下降;如果是 auto,预算由模型自行决定,Tosea 的测试里 2.5 auto 多数落在相当于 GPT Image 2 medium 的档位。要做公平比较,把 quality 显式改为对应预算的档位(mediumhighhighmax),再看质量和延迟。

能直接用 gpt-image-2.5 作为模型名吗?

官方型号页只列出 gpt-image-2.5-flaregpt-image-2.5-sunburst 两个 ID(各自带 2026-09-08 快照)。Tosea 报告不带后缀的 gpt-image-2.5 会返回"does not exist"错误,这一点来自第三方复现,官方页面没有单独说明。

Arena 的分数可以直接当选型依据吗?

只能当参考。两款 2.5 的条目都标着 Preliminary,票数在 3 千到 7 千之间,GPT Image 2 的条目有 7.9 万到 23.6 万票且是 medium 档;榜单不衡量延迟、成本或你的采纳率。选型仍然要在自己的基线上按等预算比较。

用 Batch 的团队现在该怎么办?

继续用 gpt-image-2 跑 Batch,同时用 Standard 小流量测 2.5 的采纳率和延迟。等 OpenAI 的价格页或型号页列出 2.5 的 Batch 支持后,再用同样的基线重新算每张合格图片的成本。

#GPT Image 2.5#GPT Image 2#Flare#Sunburst#模型迁移#API 成本
分享文章: