Gemini 3.8 Flash 已经不是传闻或预览名称。Google 在 2026 年 9 月 2 日正式发布它,Gemini Developer API 的稳定模型 ID 是 gemini-3.8-flash。如果你正在新建 Gemini 应用,它是值得先测的当前 Flash 候选;如果生产环境仍在 3.7,正确动作不是立即全量替换,而是先把它作为可回退的挑战版本。
原因很实际:3.8 与 3.7 当前的每百万 token 标价相同,但 Google 明确提醒,3.8 在复杂任务上可能进行更多推理步骤和工具调用。相同单价不保证相同账单,更不保证你的任务一次就能通过。迁移应同时比较质量、总 token、延迟和失败成本。
另一个容易混淆的名字是 Gemini 3.8 Flash Cyber。它不是普通开发者在模型列表里寻找的另一个公开 ID,而是通过 Fairwind Program 向获批防御机构提供的受限能力。公开 Flash 的迁移和 Cyber 的资格申请,是两件不同的事。
先确认 3.8 的公开合同
截至 2026 年 9 月 3 日,Google 的 Gemini 3.8 Flash 模型页列出的关键边界如下:
| 项目 | Gemini 3.8 Flash |
|---|---|
| 状态与 ID | GA;gemini-3.8-flash |
| 输入 / 最大输出 | 1,048,576 / 65,536 tokens |
| 输入类型 | 文本、图片、视频、音频、PDF |
| 输出类型 | 文本 |
| Thinking | low、medium、high;默认 medium |
| 不支持的档位 | minimal,传入会报错 |
| 内置能力 | 缓存、代码执行、文件搜索、函数调用、搜索/地图 grounding、结构化输出、URL context 等 |
| 需要单独看待 | Computer use 仍标为 Preview;图片生成、音频生成和 Live API 不支持 |
多模态输入不代表能生成图片或音频。若产品需要实时语音、图片输出或其他媒体,应该换到对应的专用模型,而不是期待 3.8 Flash 因为版本号更高就自动覆盖这些能力。
Google 的停用时间表目前没有为 gemini-3.8-flash 或 gemini-3.7-flash 公布 shutdown date。没有日期不等于永不下线,但它说明 3.7 仍是可用的回退项,不必为了避开一个并不存在的当前停用期限仓促迁移。
价格没涨,成本仍可能变化
Gemini Developer API 官方价格页把 3.8 和 3.7 放在相同的发布期费率:
| 计费方式 | 2026 年 12 月 31 日前 | 2027 年 1 月 1 日起 |
|---|---|---|
| Standard 输入 | $0.75 / 1M tokens | $1.50 / 1M tokens |
| Standard 输出 | $3.75 / 1M tokens | $7.50 / 1M tokens |
| Batch / Flex 输入 | $0.375 / 1M tokens | $0.75 / 1M tokens |
| Batch / Flex 输出 | $1.875 / 1M tokens | $3.75 / 1M tokens |
输出价格包含 thinking tokens。缓存存储、Priority、Google Search 或 Maps grounding 还可能产生独立费用。上表是 Gemini Developer API 的美元标价,不是 Vertex、企业合同或第三方网关价格;中国大陆的地区、凭据和结算问题应单独参考 Gemini API 接入与价格指南。
假设一项任务输入 50,000 tokens,最终输出与 thinking 合计 8,000 tokens。按 2026 年底前的 Standard 价格,单次约为:
text(50,000 × $0.75 + 8,000 × $3.75) / 1,000,000 = $0.0675
如果 3.8 为了完成长流程把输出与 thinking 用量提高到 14,000 tokens,同一输入下成本会变为 $0.09。反过来,如果它把原来需要两次重试的任务一次做对,总成本可能更低。真正值得比较的是:
text每个合格结果成本 = 全部请求费用 ÷ 无需返工即可接受的结果数
这比“同价”“更强”或单次响应字数更接近生产账单。
从 3.7 迁移,先分清必须改什么
对于已经正确使用 Gemini 3.7 的应用,最小代码变化通常只是把目标模型改为:
textgemini-3.8-flash
但 Google 的当前迁移清单还要求检查 Gemini 3 的通用约束。逐项审计,而不是假设“只改字符串”必然安全:
- 从生成配置中移除
temperature、top_p和top_k; - 用字符串枚举
thinking_level代替thinking_budget,且不要传minimal; - 移除 Gemini 3 不支持的
candidate_count; - 多轮会话使用服务端
previous_interaction_id,不要预填 model turn; - 检查函数调用的 payload 与 thought signature 是否完整;
- 使用 generateContent API 时,确认每个
FunctionResponse都带call_id和name; - 若工具调用前文本导致
Malformed_Function_Call,按官方 workaround 处理,不要用盲目重试掩盖格式问题。
如果你的 3.7 集成本来就符合这些要求,上面大部分不会产生新 diff。迁移审核仍有价值,因为旧兼容层、历史 prompt 或网关转换可能把已废弃字段悄悄加回来。
把模型名放进一个可配置位置,而不是散落在业务代码中:
bashGEMINI_MODEL=gemini-3.8-flash
同时保留 gemini-3.7-flash 的快速回退值。不要用 gemini-flash-latest 代替可复现测试;会自动漂移的 alias 不适合作为精确验收基线。

用一小段真实流量决定是否扩大
先从最近的成功样本、失败样本和高风险边界中选择一组任务。固定输入、prompt、工具 schema、超时、重试和 thinking_level,让 3.7 与 3.8 接受同一批测试。至少记录:
- 结果是否无需人工修复即可接受;
- 函数调用是否选对工具并给出合法参数;
- 输入、输出和 thinking token;
- 首 token 延迟、总延迟与超时;
- 安全阻断、格式错误和重试次数;
- 每个合格结果的总费用。
影子评估通过后,再给 3.8 一小部分真实流量。适合扩大流量的条件应该可观察,例如“任务通过率不低于当前基线、工具错误不升高、P95 延迟和每个合格结果成本在预算内”。“3.8 看起来更聪明”不是上线条件。
3.8 更适合长周期软件工程、多步 Agent 和复杂专业流程,但不是每项工作都需要它多做推理。简单分类、短摘要或高吞吐转换如果在 3.7 上稳定而便宜,可以继续留在 3.7,或把 3.8 的 thinking_level 调到 low 后重新测量。Google 仍明确支持 3.7,这给了你按任务分流而不是一次性迁移的空间。

Flash Cyber 的门槛在哪里
Google 对 Fairwind Program 的描述很明确:Gemini 3.8 Flash Cyber 由获批伙伴独享,可独立使用或与 CodeMender 配合。Google 优先考虑政府与国家级网络安全机构、关键基础设施运营方、核心技术平台,以及从事防御评测的学术实验室;申请还要经过组织背景和安全记录审查。
获批也不是“拿到一个可分享的高级 Key”。参与组织只能把访问授予内部网络安全、事件响应或渗透测试团队,并需要用户级认证、抗钓鱼 MFA、访问控制与使用记录。获授权的威胁模拟、逆向工程和恶意软件分析可用于防御或学术研究;创建恶意软件等恶意任务仍不允许。伙伴不能共享、转售或重新分发访问。
因此,普通开发者不应把 gemini-3.8-flash-cyber 当作已公布的公共模型 ID,也不应把标准 3.8 Flash 价格直接套给 Cyber。Google 的公开页面没有给出普通 API 目录中的 Cyber ID、通用价格或保证批准时间。没有资格的组织仍可研究 Google 提到的公开模型加 CodeMender 或 AI Threat Defense,但它们的可用性、费用和地区条件需要分别核对。
一个务实的结论
新项目可以先把 gemini-3.8-flash 作为生产候选:它已是 GA,规格清楚,发布期单价与 3.7 相同。现有 3.7 服务则应先完成配置审计、同任务对照、影子评估和小流量灰度;当合格结果、工具可靠性、延迟和总成本都达到门槛,再逐步扩大。
如果 3.8 的额外推理让某些简单任务更慢或更贵,继续保留 3.7 并不落后,而是使用 Google 仍支持的效率选项。若你的真实需求是 Gemini 3.8 Flash Cyber,先判断组织是否符合 Fairwind 的防御职责和治理要求;不符合时,答案不是继续找隐藏 ID,而是选择公开模型与可用的防御工具。



