Gemini Omni 1.1 Flash 已经从“等待官方确认”变成了可调用的开发者模型。对 Gemini Developer API 来说,官方模型 ID 是 gemini-omni-1.1-flash;如果你在 Google Cloud 的 Gemini Enterprise Agent Platform 中工作,文档列出的则是 gemini-omni-1.1-flash-preview。
这两个名字不能混用。Flow 和 Gemini 应用又是另外两种面向订阅用户的产品入口,不需要你填写 API model ID。开始之前,先看自己在哪个界面、要完成哪种任务。
| 你的使用场景 | 正确起点 | 先确认什么 |
|---|---|---|
| 在自己的程序中生成或连续编辑视频 | Gemini API / Google AI Studio | 使用 gemini-omni-1.1-flash,检查付费层与配额 |
| 在 Google Cloud 企业平台中接入 | Enterprise Agent Platform | 使用 Preview ID,并接受对应的 Pre-GA 条款和固定配额 |
| 在可视化工作区中反复制作镜头 | Google Flow | 查看当前账号套餐与模型选择器 |
| 在 Gemini 对话中延展已有镜头 | Gemini 应用 | 查看账号是否出现 scene extension,而不是猜测模型字符串 |

1.1 的价值不只是“能生成 4K”
Google 的发布说明把 1.1 的重点放在可控的视频制作流程上:模型可以分析最多 10 秒的先前上下文,再按 10 秒为单位继续生成,累计延展到 40 秒;可以指定首帧和尾帧,让模型补出中间运动;也可以提供短视频参考,帮助保持动作或角色语境。
360p 草稿与 1080p/4K 输出服务于同一套“先便宜试错、再放大成片”的流程。这里的 1080p 和 4K 是官方文档明确标注的 upscale 选项,不等于模型原生创造了同等分辨率的细节。判断构图时可以先用 360p 或 720p,只有镜头已经值得保留时再放大。
Omni 1.1 更值得关注的能力是对话式编辑。你可以在一次 interaction 的基础上继续提出修改,例如改变光线、替换局部元素或延展结尾,同时要求其他部分保持不变。它适合“生成—判断—局部修改”的过程,而不是每次都从一条超长提示词重新开始。
用 Gemini API 完成第一个视频请求
官方 Gemini Omni API 文档使用 Interactions API。下面的 Python 示例会生成一个 16:9、720p 的视频,并把 SDK 返回的 base64 数据保存为 MP4:
pythonimport base64 from google import genai client = genai.Client() interaction = client.interactions.create( model="gemini-omni-1.1-flash", input=( "一个连续镜头:清晨的纸艺城市逐渐亮起,窗灯依次点亮," "镜头缓慢向前移动,不要对白。" ), response_format={ "type": "video", "aspect_ratio": "16:9", "resolution": "720p", }, ) with open("city.mp4", "wb") as output: output.write(base64.b64decode(interaction.output_video.data))
interaction.output_video 是 SDK 的便捷字段。直接调用 REST 时,视频内容位于响应的 steps 中,不能照搬 SDK 的取值方式。纵向视频可把比例改为 9:16;分辨率还支持 360p、1080p 和 4k。
如果第一轮输出基本正确,后续编辑应保留 interaction,而不是另起一条完全无关的请求。修改指令越聚焦越好,例如“把光线改成日落,其他内容不变”。过度描述容易让模型把本来要保留的部分也重新生成。
40 秒延展有明确边界
“最长 40 秒”指的是累计延展工作流,不是任意提示词一次就会返回一条 40 秒视频。上传视频用于编辑或延展时,输入通常必须不超过 10 秒;延展只能追加在结尾,不能在开头补片段,也不能插入视频中间。
语音也有额外限制。上传的视频如果已经有人说话,目前不能通过延展再为这个人增加新的对白;使用模型之前生成的视频,并通过 previous_interaction_id 继续多轮操作,才有不同的语音延展支持。独立音频参考和 voice editing 也不在当前支持范围内。
视频参考最多可提供 3 个片段,每个最长 3 秒,参考视频里的音频会被忽略。它更适合传递动作、外观或镜头语境,不是跨多个完整视频进行推理的入口。

欧洲用户要先区分“上传素材”和“模型生成素材”
Gemini API 文档对欧洲经济区、瑞士和英国有一条会直接改变操作的限制:目前不能编辑或延展用户上传的视频。对模型自己生成的视频进行延展属于另一种情况,文档表示仍可支持。
同样要注意真实人物、可识别人物和未成年人素材的限制。所有生成视频都会加入不可见的 SynthID,用于来源识别;输入和输出也会经过安全过滤。能够上传文件,不代表每种人物编辑都被允许。
Google 还说明,英语提示词已得到完整支持,其他语言尚未完成同等评估。中文可能可以工作,但质量与服从度不应被当作已经与英语完全等价。遇到复杂镜头失败时,可以先缩小单次修改范围,再决定是否换成更明确的英语镜头指令。
价格不要从旧模型行直接套过来
截至 2026 年 8 月 29 日,Google 的 Gemini Developer API 价格页可读取的 Omni 视频行仍使用旧的 gemini-omni-flash-preview 名称,并给出 720p 约 0.10 美元/秒的等效价格。该行没有清楚标成 1.1,因此只能作为旧版参考,不能当作 Omni 1.1 的已确认报价。
真正估算成本时,应在你实际使用的 API 项目和模型页面核对计费单位、分辨率、失败请求、配额与账单。Cloud Preview 又有自己的消费方式和条款,不能把 Gemini Developer API 的价格自动映射过去。
Google 表示 Omni 1.1 已向 Google AI Plus、Pro 和 Ultra 用户在 Flow 中开放,Gemini 应用中的场景延展也面向这些套餐。即便如此,账号年龄、工作区、地区与分批上线仍可能影响当前界面是否出现功能;以登录后的真实产品状态为准。
怎么判断该走哪条路线
需要把视频生成与连续编辑嵌入自己的产品时,先从 Gemini API 和 gemini-omni-1.1-flash 开始。重视画布式创作、镜头试验和账号内工作流时,Flow 更直接。企业项目只有在 Cloud Preview 的条款、固定配额和生命周期可以接受时,才应使用它的 preview ID。
如果你的任务主要是稳定的视频生成能力与预算比较,而不是多轮对话式编辑,可以继续查看 Veo 3 价格与真实成本。如果卡在 API Key、免费层与付费层边界,先看 Gemini API 免费额度指南。
上线前,至少在配置中保留四项记录:精确模型 ID、所用 Google 产品面、最后核验日期和回退模型。这样可以避免把应用里的 “Omni”、Cloud Preview 和 Developer API 悄悄当成一个永远不变的接口。



