跳转到主要内容

Nano Banana 能生成视频吗:图片转视频的正确路线

Nano Banana 只出图不出视频。图片转视频走 Gemini Omni,即 Gemini 应用的“视频”入口或 API;Veo 3.1 留给首尾帧控制与延长场景。

LaoZhang AI Team发布于更新于 16 分钟阅读
文章目录
Nano Banana 负责生成首帧图片,Gemini Omni 或 Veo 3.1 负责把图片变成视频的两段式路线图

Nano Banana 不能生成视频。不论是 Nano Banana 2、Nano Banana 2 Lite、Nano Banana Pro,还是最早那个 Nano Banana,Google 的 Gemini API 图片文档都只把它们列为图片生成与编辑模型,没有任何"让图片动起来"的功能。

但你想做的事本身是可行的,只是分两步:先用 Nano Banana 出一张满意的图,再把这张图交给 Google 的视频模型。截至 2026 年 9 月 22 日,Google 的视频路线是 Gemini Omni:Gemini 应用里点"菜单 → 视频"就是它,API 里对应 gemini-omni-1.1-flash。Google 自己把它形容为"视频版的 Nano Banana"。Veo 3.1 没有下线,但已经退到第二位,只在你需要精确控制首尾帧、或把生成的视频反复延长时才值得选。

你的目标走哪条路需要什么
手上有一张图,想让它动起来,不想写代码Gemini 应用 → 菜单 → 视频 → 添加图片Google AI 方案订阅、18 岁以上、支持的地区
在自己的程序里批量做图生视频Gemini API gemini-omni-1.1-flash付费层 API key,没有免费额度
需要指定首帧和尾帧、8 秒 4K、或反复延长同一段视频Gemini API Veo 3.1(veo-3.1-generate-preview 等)同上,按秒计费
只需要更好的图,不需要动继续用 Nano Banana不要为静态任务切到视频模型

为什么 Nano Banana 全系列都不出视频

Gemini API 里现在有四个 Nano Banana 模型:gemini-3.1-flash-lite-image(Nano Banana 2 Lite,最快最便宜)、gemini-3.1-flash-image(Nano Banana 2,通用主力)、gemini-3-pro-image(Nano Banana Pro,复杂视觉任务)和旧的 gemini-2.5-flash-image。文档描述的能力全部是图片生成与图片编辑。

容易让人误会的一点是"视频转图片":3.1 Flash 和 Lite 可以把一段视频当作参考输入,生成一张新图。方向是视频进、图片出,和"图片转视频"正好相反。如果一个页面说 Nano Banana 支持"视频生成",它要么把这个功能说反了,要么在后台悄悄调用了别的模型。

Nano Banana 在视频项目里的真正位置是首帧和参考图。角色长相、产品角度、场景光线、画面构图这些东西,在图片层先锁定,比让视频模型一边猜画面一边猜运动要稳得多。这也是 Google Veo 文档里自己给出的示例流程:"第一步用 Nano Banana 2 生成一张图,第二步用 Veo 3.1 基于这张图生成视频。"

不写代码:在 Gemini 应用里把图片变成视频

Gemini 应用里的视频功能现在由 Gemini Omni 驱动。按 Google 的简体中文帮助页,操作路径是:

  1. 打开 gemini.google.com 或 Gemini 手机应用,点左上角的菜单图标,选择视频。
  2. 可以先挑一个模板,也可以直接在文本框里输入你想要的视频描述。
  3. 点添加图片上传你用 Nano Banana 做好的首帧;一次最多 5 张图片和 1 个视频。想要声音,直接在描述里写明。
  4. 点提交。帮助页的原话是"生成视频可能需要几分钟时间"。
  5. 生成后可以继续对话式修改:删掉某个物体、换角色、改镜头角度或场景。满意后选择保存到设备、导出,或直接分享到 YouTube。

上传图片时画幅会跟随图片;纯文字提示默认横屏。Google 产品页说明单次生成的是 10 秒视频,每段视频都带不可见的 SynthID 水印。

使用前提有几条,每一条都直接决定你能不能看到这个入口:

  • 个人账号必须订阅 Google AI 方案。 帮助页原话:"若要通过个人账号使用此功能,你必须订阅 Google AI 方案。"免费账号只有图片生成与编辑。
  • 未满 18 周岁不能用。
  • 上传视频进行编辑在欧洲经济区、瑞士、英国和美国部分州暂不支持;上传图片不受这条限制。
  • "请仅上传你有权使用的照片。"

订阅档位以 Google 美国页面 2026 年 9 月 22 日的显示为准(美元,其他国家的档位和价格可能不同):Google AI Plus 每月 4.99 美元,附带 200 个 Flow 积分并可用 Gemini Omni Flash;Google AI Pro 每月 19.99 美元,1,000 个 Flow 积分;Google AI Ultra 每月 99.99 美元起,10,000 个 Flow 积分,并优先获得包括 Veo 3.1 视频生成在内的高级功能。Google 没有公布任何"每天能生成多少条视频"的数字,页面只写了用量限制按算力计算、可能有速率限制。有人在网上给出具体条数,都不是官方口径。

中国大陆账号能否订阅 Google AI 方案、怎样支付,见Nano Banana 2 订阅多少钱的大陆章节。

在 Gemini 应用里从菜单进入视频功能、上传 Nano Banana 图片并提交生成的操作路径

写代码:API 里默认用 Omni,需要精确控帧再用 Veo 3.1

Google 的 Gemini API 视频概览写得很直接:把 Gemini Omni Flash 作为视频生成的默认模型,Veo 3.1 留给场景延长、指定帧控制这类具体需求。两条路都接受图片输入,区别在接口形态、时长、分辨率和价格。

Gemini Omni:gemini-omni-1.1-flash

按 Omni 文档(2026 年 9 月 17 日更新),图片放在输入列表里就是图生视频;放两张图并描述过渡,就是首帧到尾帧;多放几张则作为角色或元素参考。分辨率 360p、720p(默认)、1080p 和 4K(后两档是放大得到的);画幅 16:9 默认,也支持 9:16;音频默认生成。已生成的视频可以继续延长,每次最多 10 秒,总长 40 秒;上传自己的视频来编辑或延长时,视频不能超过 10 秒。

两条限制值得先看:欧洲经济区、瑞士和英国的用户暂时不能编辑或延长上传的视频;文档明确说只有英文提示被完整评估,"其他语言未经评估,可能可用但结果会有差异"。中文提示词可以试,但出问题先换成英文再判断是不是模型问题。

Omni 用的是新的 interactions 接口,请求结构就是"模型 + 输入列表":

python
from google import genai
import base64

client = genai.Client()

with open("first-frame.jpg", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    input=[
        {"type": "image", "data": image_b64, "mime_type": "image/jpeg"},
        {"type": "text", "text": "镜头缓慢推进,人物转头看向窗外,自然光,带环境音"},
    ],
)

超过 4MB 的视频要在 response_format 里指定 "delivery": "uri",然后轮询文件状态直到 ACTIVE 再下载。多轮编辑通过 previous_interaction_id 引用上一次结果,不必重新上传。完整的参数说明见 Gemini Omni 1.1 Flash 使用指南。

Veo 3.1:需要首尾帧、8 秒 4K 或多次延长时

Veo 文档列出三个预览版模型:veo-3.1-generate-preview、veo-3.1-fast-generate-preview、veo-3.1-lite-generate-preview。时长 4、6、8 秒;720p 默认,1080p 和 4K 只能配 8 秒,Lite 不支持 4K;画幅 16:9 或 9:16;原生生成对话、音效和环境音。最多 3 张参考图(用参考图时必须选 8 秒),支持首帧 + 尾帧插值,生成过的视频可以每次延长 7 秒、最多 20 次(Lite 除外,延长只限 720p)。预览版模型 ID 随时可能变,写进生产代码前要再看一眼文档。

文档自带的示例就是 Nano Banana 出图、Veo 出视频:

python
import time
from google import genai

client = genai.Client()
prompt = "Panning wide shot of a calico kitten sleeping in the sunshine"

# 第一步:用 Nano Banana 2 生成首帧
image = client.models.generate_content(
    model="gemini-3.1-flash-image",
    contents=prompt,
    config={"response_modalities": ["IMAGE"]},
)

# 第二步:把这张图交给 Veo 3.1
operation = client.models.generate_videos(
    model="veo-3.1-generate-preview",
    prompt=prompt,
    image=image.parts[0].as_image(),
)

while not operation.done:
    time.sleep(10)
    operation = client.operations.get(operation)

video = operation.response.generated_videos[0]
client.files.download(file=video.video, destination="output.mp4")

两条 API 路线怎么选

判断条件选 Gemini Omni选 Veo 3.1
默认起点、对话式反复改是否
需要严格的首帧 + 尾帧插值可以(两张图 + 描述过渡)是,专门参数
需要 1080p / 4K 成片放大得到8 秒原生档位(4K 不含 Lite)
需要把一段视频延长到 40 秒以上最长 40 秒每次 7 秒、最多 20 次
预算敏感、先出草稿360p 草稿、720p 约 0.10 美元/秒Lite 720p 0.05 美元/秒
欧洲经济区 / 瑞士 / 英国不能编辑上传的视频文档未列同样限制

Gemini Omni 与 Veo 3.1 两条图生视频 API 路线的模型 ID、时长、分辨率与价格对比

2026 年 9 月的 API 价格与一次成本估算

以下数字是 Gemini API 定价页 在 2026 年 9 月 22 日的显示,单位美元。这些模型都没有免费层,包括 Nano Banana 各型号;想在 API 里免费试视频是不现实的。

模型计费换算
gemini-omni-1.1-flash 视频输出每百万输出 token 17.50 美元Google 给出的换算:720p 约 0.10 美元/秒(5,792 token/秒)
Veo 3.1 Standard(含音频)按秒720p 与 1080p 0.40 美元/秒,4K 0.60 美元/秒
Veo 3.1 Fast(含音频)按秒720p 0.10、1080p 0.12、4K 0.30 美元/秒
Veo 3.1 Lite(含音频)按秒720p 0.05、1080p 0.08 美元/秒
Nano Banana 2 gemini-3.1-flash-image每百万输出 token 60 美元约 0.067 美元/张(1K)
Nano Banana Pro gemini-3-pro-image每百万输出 token 120 美元约 0.134 美元/张(1K 或 2K)

一个算例,纯粹按上表相乘,不代表任何实测账单:做一条 8 秒 720p 短片,先用 Nano Banana 2 出 5 张候选首帧挑一张(5 × 0.067 ≈ 0.34 美元),再用 Omni 生成(8 × 0.10 = 0.80 美元),合计约 1.14 美元;同样的图换 Veo 3.1 Standard 是 8 × 0.40 = 3.20 美元,换 Veo Lite 是 0.40 美元。可以看出首帧那一步几乎不构成成本,真正贵的是视频本身,所以在图片层多试几张、在视频层少试几次,是最省钱的顺序。

如果你做首帧的量比较大,也可以用 laozhang.ai 一把 key 调所有 Nano Banana 型号:其文档页标注 gemini-3-pro-image 0.09 美元/张、gemini-3.1-flash-image 0.055 美元/张、gemini-3.1-flash-lite-image 与 gemini-2.5-flash-image 0.025 美元/张,基址 https://api2.laozhang.ai,同时提供 OpenAI 兼容的 /v1/chat/completions 和 Google 原生的 generateContent 端点,注册入口在 api2.laozhang.ai/register。它的视频接口目前文档里列出的是 Seedance、Sora 2、Wan 这几条(Seedance 接口支持 first_frame / last_frame 角色的图片输入),没有 Veo 3.1 或 Gemini Omni,所以 Google 这两条视频路线仍然要直接走 Gemini API。Veo 的更多价格细节见 Veo 3 价格解析。

"Nano Banana 视频生成器"网站背后是什么

叫"Nano Banana 视频生成器"的网站不是 Google 的产品,它们把"图像转视频""文本转视频""视频转视频"直接挂在 Nano Banana 名下,背后是别家的视频模型。以 nanobanana.io 2026 年 9 月 22 日的文本转视频页为例,页面自称是"新一代 AI 视频模型",但它的模型选择器里列的是 Veo 3.1、Sora 2 / Sora 2 Pro、Kling 2.6 / 3.0、Seedance 2.0 / 2.5、Pixverse V6、Minimax H3,每次生成消耗 5 个积分,默认 6 秒。另外几家同类站点也类似,可选引擎是 Gemini Omni、Seedance、Wan、Veo、Kling、Grok Imagine。

也就是说,这类网站的"Nano Banana 视频"实际上是"用别人的视频模型 + 一个 Nano Banana 的名字"。这不等于它们没用,多引擎切换对不想开好几个账号的人确实方便,但要把它们当成第三方服务商而不是 Google 的官方功能来看,挑的时候看这几点:

  • 页面有没有写清楚每次生成实际调用的模型名,以及积分和模型、时长、分辨率的对应关系。
  • "免费""无水印""无限"有没有说清账号额度和付费边界;只喊口号不写边界的,当作随时会变的促销看待。
  • 生成失败扣不扣费、能不能拿到原始文件、有没有商用授权说明。
  • 输出有没有保留原图、提示词和模型名,方便以后换平台时复现。

如果你要的是多引擎比较而不是 Nano Banana 本身,直接看 AI 图片转视频生成器对比和免费图片转视频 AI会比在套壳站里试更省时间。

先做首帧再出视频:一个可复用的顺序

不论走应用还是 API,顺序都一样:

  1. 先写清楚这条视频要什么:主体、镜头运动、时长、横竖屏、要不要声音、不能出现什么。
  2. 用 Nano Banana 出首帧和参考图。人物短片先锁定长相、服装、表情;商品短片先锁定产品角度、光线和背景。提示词技巧见 Nano Banana 提示词写法。
  3. 挑一到三张最稳的图,交给 Gemini Omni;只有需要尾帧插值、8 秒 4K 或多次延长时才换 Veo 3.1。
  4. 检查输出:人脸和产品有没有漂移、文字有没有乱、动作是否符合描述、音频能不能用。
  5. 画面本身错了回图片层重做首帧;只是运动或节奏不对,留在视频模型里改提示词、时长和镜头。

常见问题

Nano Banana 能直接生成视频吗?

不能。Nano Banana 2、2 Lite、Pro 和旧版都是图片生成与编辑模型,Google 文档没有任何视频输出功能。它能做的是生成首帧和参考图,视频由 Gemini Omni 或 Veo 3.1 生成。

图片怎么变成视频?

不写代码:在 Gemini 应用里点菜单 → 视频 → 添加图片,输入描述后提交,几分钟后得到一段 10 秒视频。写代码:把图片放进 gemini-omni-1.1-flash 的输入列表,或用 Veo 3.1 的 image 参数。

Veo 3.1 是不是被 Gemini Omni 取代了?

Google 的说法是 Gemini Omni 取代了 Gemini 应用里原来的 Veo 3.1,指的是应用入口。API 里 Veo 3.1 的文档在 2026 年 9 月仍在更新,Google AI Ultra 也仍把 Veo 3.1 列为权益。它没有下线,只是从默认变成了按需选项。

用 Nano Banana 做视频免费吗?

应用侧需要订阅 Google AI 方案,免费账号只有图片生成;API 侧 Omni、Veo 和 Nano Banana 都没有免费层。第三方网站的"免费"通常是有限积分。Gemini API 的免费额度覆盖哪些模型,见 Gemini API 免费层说明。

可以用自己的照片吗?

可以,Gemini 应用一次最多 5 张图片和 1 个视频,前提是你有权使用这些照片。上传视频做编辑在欧洲经济区、瑞士、英国和美国部分州暂不支持。

Gemini Omni 和 Veo 3.1 选哪个?

默认 Omni:对话式修改、360p 草稿、720p 约 0.10 美元/秒,还能延长到 40 秒。需要严格首尾帧插值、8 秒原生 1080p/4K,或想按 7 秒一段延长 20 次,再选 Veo 3.1。

图生视频 AI 路线板,显示创作者、品牌编辑、Google 应用、API 和停用风险
AI 视频生成

2026 图生视频 AI 怎么选:先定路线,再选 Runway、Adobe、Veo 或 Kling

已经有图时,先选路线而不是先信品牌。普通创作者先看 Runway,品牌编辑看 Adobe Firefly,Google 应用看 Gemini Omni,API 和参考图控制看 Veo 3.1,多镜头和元素控制看 Kling,快速效果测试看 Pika 或 Vidu;Sora 现在只应当作为停用风险处理。

15 分钟