跳转到主要内容

Gemini 4 vs GPT-6 vs Fable 5.2:泄露演示透露了哪些实力变化?

16 分钟阅读AI 模型对比

这轮泄露最值得关注的是视觉代码生成:疑似 Gemini 4 的手柄 SVG 已被测试者评价为接近 Astra,疑似新 Fable 则出现更丰富的场景细节,但也有更慢、更贵的反馈。本文逐项分析原帖与演示,区分可期待的进步、测试条件和仍待确认的型号。

Gemini 4、GPT-6 Astra 与 Fable 5.2 的公开资料状态对照

这轮 Gemini 4、GPT-6 和 Fable 5.2 的讨论,已经有值得具体分析的材料。从目前公开的演示看,疑似 Gemini 4 的亮点集中在细致的 SVG 和网页生成;被测试者称为 Fable 5.2 的新模型,则在画面丰富度上得到更积极的评价,也有测试者在高推理对比中更偏好它的输出。GPT-6 Astra 仍是这些比较中规格、价格较清楚的参照。 如果你关心前端原型,这些变化值得跟进;如果你要迁移整个项目或更换长期订阅,演示之外还需要考察返工、等待和实际费用。

本文按 2026 年 9 月 20 日可查到的原帖、附图、媒体报道和官方资料分析,GPT-6 专指 GPT-6 Astra。我们没有调用这三款模型做独立实测。下文的 Gemini 4、Fable 5.2 有一部分是社区对灰测模型的称呼:特别是“Fable 5.2”,测试者本人明确说过这是他的推测名称,而非已确认的命名。这个限制不妨碍分析演示的内容,但会影响结论能推广到哪里。

先给判断:三者各自释放了什么信号

现有材料更像是几次能力变化的近距离观察,而非完整擂台赛。最有参考价值的比较集中在视觉代码输出,关于大型项目维护、长文档准确性或稳定运行的证据明显少得多。

比较维度疑似 Gemini 4GPT-6 Astra疑似 Fable 5.2/下一代 Fable
SVG、页面视觉表现手柄案例中被评价为与 Astra 接近;另有直升机、塔楼、网站演示手柄案例同样细致;另一组图更偏简洁构图出现更丰富的场景、材质与环境细节,部分测试者明显偏好新输出
推理投入与等待个别演示被报告耗时约 8—20 分钟已公开多档推理配置;不同档位不能混作同一成绩有测试者反馈高推理表现更好,但更慢、更贵
目前最值得验证的用途精细图形、网页和前端原型可依据公开 API 文档开展的真实工作任务需要完整场景和较多视觉细节的代码生成任务
现有材料最缺什么后台型号确认、稳定复现与完整任务测试与两款疑似新模型相同条件下的成套结果命名及路由确认、实际时间费用、项目级表现

表中前两行来自下文逐项分析的社区报告;“值得验证的用途”是依据这些案例作出的判断,不是本站实测结论。目前可以说新一轮竞争正给视觉代码生成带来压力,却还不能把这种压力直接换算成全部任务的总排名。

Gemini 4:手柄 SVG 的信号,比泄露跑分表更值得看

最直接的一组材料是 Lumina 发布的 Xbox 手柄 SVG 对比。作者把两位主要候选标为“Gemini 4 Pro”和“GPT-6 Astra Pro”,评价二者都接近完美,并指出 Astra 那幅的标志有一点偏差。实际附图中,两者都有较完整的手柄轮廓、按键和明暗层次,差别不是“一幅能看、一幅完全失败”。

这个例子支持的早期判断是:如果该路由确实属于下一代 Gemini,它在精细 SVG 生成上至少表现出了向 Astra 靠拢的潜力。 标志细节可能影响某一道题的偏好,但不足以推出 Gemini 已在编程上全面领先。SVG 既包含代码组织,也包含对形状、层次和布局的把握;在这种任务中进步,对图标、展示图和前端原型会很有吸引力。

这组演示还有一个会改变使用体验的条件。原帖及引用内容称,该结果来自 Arena 中名为 gemini 3.7 flash 的入口,生成约花了 20 分钟,而作者第二天没能得到相似结果。他还在回复中说明没有 Fable 5.2 的访问权限。因此,它是一次有信息量的 Gemini/Astra 案例,也同时暴露了等待时间和复现问题,并不是三方同场测试。

中文报道中还有更多例子。钛媒体整理的这轮演示包括 SVG 猫、体素塔楼、H145 直升机和黑白网站,报道给出的部分耗时约为 8、10 和 14 分钟。这些项目共同指向一种可能的变化:模型愿意花更多推理时间,把物体部件、空间层次和页面细节做得更完整。对一次性的视觉提案,这种等待可能可以接受;对频繁修改、每轮都要快速反馈的工作,单次精美输出还不够。

同一报道提到的流传跑分表,覆盖软件工程、终端操作、知识推理和计算机操作等项目。不过,报道也指出表格与后台截图不一致,Astra 对照数字与官方信息不吻合,且缺少 Google、Arena 或测评方确认。这张表可以解释为什么市场预期突然升温,却不适合拿来计算 Gemini 4 领先多少。相比之下,能直接看到内容、知道任务是什么的演示,更有助于判断哪些能力值得后续复测。

另一个可能的解释是推理预算或服务配置改变,而不一定是完整换代。一位 Gemini 用户的原始帖子就报告,近期输出质量变化,同时 token 生成速度大约减半、使用的 token 变少。这里没有独立测速,也没有确认后台切换;但它提醒我们,速度、token 数量和最后的完成质量要分别看,不能只凭“更慢、更细致”给模型认定身份。

Fable 5.2:更丰富的输出之外,速度与成本是另一半故事

疑似新 Fable 的讨论,不只是“还没发布”的传闻。JAZII 在 9 月 18 日的测试帖给出了具体比较条件:同一提示词、高推理设置。他认为疑似下一代 Fable 的结果好于 Astra,相对当前 Fable 有明显进步,同时反馈它更慢、也更贵。

这段反馈真正有价值的地方,是把收益和代价放在了一起。如果改进能够复现,对愿意多等一会、换取更少返工的任务,新 Fable 可能更有吸引力;若任务要求快速来回修改,质量提升就要与等待成本一起衡量。目前原帖没有足以计算价差或延迟分布的测量表,所以“更贵”仍是测试者的体验,不能当成正式 API 单价。

作者又在随后的说明中明确表示,名称尚未确认,Fable 5.2 是他的猜测。他说当天开始隐蔽测试,个人并不预期立即推出。我们可以据此讨论“疑似下一代 Fable 的表现”,但不应把他的上线预期改写成确定发布日期。

火箭演示:先看清原帖比较的是谁

Bhavy 的火箭测试帖称,他看到 Fable 5.1/Opus 5 被切换到新模型的说法后,用同一道火箭题做了比较,认为新输出明显更好、更真实。在后续回复里,他又表达了优于 Astra 的看法。

这能支持“有测试者明显偏好疑似新 Fable 的火箭表现”,但原帖主要比较的是 Fable 与 Opus,不能把一条回复扩展为已经完成相同条件的 Fable/Astra 测试。其他读者对真实感也有不同看法,部分更偏好 Opus。

对读者而言,火箭题值得看的是分层、运动和视觉表现是否更贴合需求。即使演示更逼真,也不意味着经过了物理仿真验证,更不能自动证明该模型更擅长修复生产代码。它可以帮助筛选视觉原型候选,不能独自承担项目迁移决策。

鹈鹕骑车:丰富与克制,其实是两种取向

Chetaslua 的三图对比标称三者均使用最高设置,附图标签分别是更新后的 Fable 5.1(称被路由到 5.2)、Opus 的下一版本,以及 GPT Astra Max。图的实际内容是三只骑自行车的鹈鹕。

这里可以直接观察到的区别很具体:左侧与中间的版本都有更完整的海岸场景,右侧 Astra 则采用较简洁的圆形画面。更丰富的背景容易让人第一眼觉得“完成度更高”;但如果任务要的是紧凑图标、徽章或少元素插图,简洁构图也可能更贴合用途。原帖没有完整公开提示词、样本数量和后台信息,因此无法判断哪幅最准确地遵循了原要求。

把它与 JAZII 的反馈放在一起看,可以提出一个值得验证的方向:疑似新 Fable 可能更愿意展开环境和装饰细节,在追求完整场景的任务中更讨喜。反过来,也应测试它是否会在要求克制时加入过多内容。这比只说“画得更多,所以模型更强”更能指导实际使用。这些图形与代码演示同样不能证明底层模型拥有原生图片生成能力。

核验模型演示时分别检查型号身份、测试条件与任务结果

Astra 的参照价值:可以把质量偏好换成可检验的任务

在这些原帖中,Astra 并非始终处于下风:手柄 SVG 得到了与疑似 Gemini 4 相近的评价;鹈鹕图的区别更多是构图丰富度;JAZII 则明确偏好疑似新 Fable 的高推理输出。把三种结果合在一起,较合理的判断是:Astra 正面临特定任务上的竞争,现有材料尚不支持它已被全面替代。

Astra 还有一项实际优势:能按官方模型文档核对精确 ID gpt-6-astra、推理配置与输入输出限制。官方列出总上下文 1,050,000 token、输入最多 922,000、输出最多 128,000,支持文本和图像输入、文本输出。它可以作为当前有明确条件的测试参照,当然仍须确认你的项目有访问权限。

费用也有可查依据:OpenAI 定价页列出的 Standard 短输入费率是每百万 token 输入 10 美元、输出 50 美元;输入超过 272K 后,整次请求的普通输入费率变为 20 美元、输出 75 美元。缓存、处理档位和工具费用另计,详细口径见 Astra API 成本计算。这些是 API 费率,不是 ChatGPT 订阅额度。

Gemini 4 与疑似 Fable 5.2 暂时缺少同等可核实的报价,因此性价比判断应保留为条件句:如果新模型减少的返工足以抵消额外等待和费用,就可能更划算;如果只是首屏更漂亮、后续仍要多轮修复,优势未必能留下来。

传闻该怎样影响今天的选择

如果你主要做视觉网页、SVG 或产品原型,这轮演示已经足以让 Gemini 4 和疑似新 Fable 进入你的重点观察名单。先保存两三项真正困扰你的任务,例如复杂控件的布局、带环境细节的插图、可运行的交互页面。等稳定入口可用后,用相同需求看能否一次生成、是否满足交互要求,以及第二次、第三次还能不能保持表现。

如果你主要做代码维护或长文档工作,眼下最需要补的就是这类任务的证据。漂亮的火箭和海岸场景不能回答回归测试是否通过、文档事实是否准确。你仍可以试用已获访问的 Astra,或参考 Astra 与 Fable 5.1 的已公开条件比较,同时等待新模型在真实项目上的结果。访问方式与权限排查见 Astra API 访问指南

如果你纠结要不要续订,先看现有工具是否还在创造价值,而不是把一次疑似灰测当成已经到手的升级。中文社区已经有人直接提出 Fable 5.2 传闻后的续费问题,这说明泄露正在影响购买判断,但帖子本身并不能保证下一期订阅就会获得新型号。对近期要交付的任务,当前实际可用性比传闻发布日期更有分量;对不着急的视觉实验,可以等更稳定的入口和实际反馈,再决定是否追加投入。

根据现有工具是否够用、任务是否受阻和官方资料是否齐全选择下一步

哪些已经确认,哪些还在等待落地

Google 在 7 月 21 日的官方文章中确认启动 Gemini 4 预训练。这说明研发项目有官方依据,并不表示它到了 9 月仍处在同一阶段。本轮查看的 Gemini API 目录尚未列出 Gemini 4 的正式接口规格。

Anthropic 的模型目录目前列有 Fable 5.1,本轮查阅的新闻页未见 Fable 5.2 公告。社区关于旧入口切换到新模型的说法,能解释这批测试为何集中出现;是否为统一灰度、临时实验或其他配置变化,仍需进一步确认。旧版 Fable 5.1 的价格和跑分也不能直接移到 5.2 名下。

因此,眼下最有价值的结论不是一个总冠军,而是三个可继续验证的方向:疑似 Gemini 4 在精细视觉代码上展现了追赶信号;疑似新 Fable 的丰富输出可能带来质量收益,也可能增加时间与费用;Astra 仍是可按公开条件评估的有力参照。 下一轮证据如果能补上稳定复现、相同预算和真实任务完成情况,才会把“值得期待”推进到“值得迁移”。

#Gemini 4#GPT-6 Astra#Claude Fable 5.2#模型泄露#大模型选型
分享文章: