Nano Banana 能生成视频吗:图片转视频的正确路线
Nano Banana 只出图不出视频。图片转视频走 Gemini Omni,即 Gemini 应用的“视频”入口或 API;Veo 3.1 留给首尾帧控制与延长场景。
文章目录

Nano Banana 不能生成视频。不论是 Nano Banana 2、Nano Banana 2 Lite、Nano Banana Pro,还是最早那个 Nano Banana,Google 的 Gemini API 图片文档都只把它们列为图片生成与编辑模型,没有任何"让图片动起来"的功能。
但你想做的事本身是可行的,只是分两步:先用 Nano Banana 出一张满意的图,再把这张图交给 Google 的视频模型。截至 2026 年 9 月 22 日,Google 的视频路线是 Gemini Omni:Gemini 应用里点"菜单 → 视频"就是它,API 里对应 gemini-omni-1.1-flash。Google 自己把它形容为"视频版的 Nano Banana"。Veo 3.1 没有下线,但已经退到第二位,只在你需要精确控制首尾帧、或把生成的视频反复延长时才值得选。
| 你的目标 | 走哪条路 | 需要什么 |
|---|---|---|
| 手上有一张图,想让它动起来,不想写代码 | Gemini 应用 → 菜单 → 视频 → 添加图片 | Google AI 方案订阅、18 岁以上、支持的地区 |
| 在自己的程序里批量做图生视频 | Gemini API gemini-omni-1.1-flash | 付费层 API key,没有免费额度 |
| 需要指定首帧和尾帧、8 秒 4K、或反复延长同一段视频 | Gemini API Veo 3.1(veo-3.1-generate-preview 等) | 同上,按秒计费 |
| 只需要更好的图,不需要动 | 继续用 Nano Banana | 不要为静态任务切到视频模型 |
为什么 Nano Banana 全系列都不出视频
Gemini API 里现在有四个 Nano Banana 模型:gemini-3.1-flash-lite-image(Nano Banana 2 Lite,最快最便宜)、gemini-3.1-flash-image(Nano Banana 2,通用主力)、gemini-3-pro-image(Nano Banana Pro,复杂视觉任务)和旧的 gemini-2.5-flash-image。文档描述的能力全部是图片生成与图片编辑。
容易让人误会的一点是"视频转图片":3.1 Flash 和 Lite 可以把一段视频当作参考输入,生成一张新图。方向是视频进、图片出,和"图片转视频"正好相反。如果一个页面说 Nano Banana 支持"视频生成",它要么把这个功能说反了,要么在后台悄悄调用了别的模型。
Nano Banana 在视频项目里的真正位置是首帧和参考图。角色长相、产品角度、场景光线、画面构图这些东西,在图片层先锁定,比让视频模型一边猜画面一边猜运动要稳得多。这也是 Google Veo 文档里自己给出的示例流程:"第一步用 Nano Banana 2 生成一张图,第二步用 Veo 3.1 基于这张图生成视频。"
不写代码:在 Gemini 应用里把图片变成视频
Gemini 应用里的视频功能现在由 Gemini Omni 驱动。按 Google 的简体中文帮助页,操作路径是:
- 打开 gemini.google.com 或 Gemini 手机应用,点左上角的菜单图标,选择视频。
- 可以先挑一个模板,也可以直接在文本框里输入你想要的视频描述。
- 点添加图片上传你用 Nano Banana 做好的首帧;一次最多 5 张图片和 1 个视频。想要声音,直接在描述里写明。
- 点提交。帮助页的原话是"生成视频可能需要几分钟时间"。
- 生成后可以继续对话式修改:删掉某个物体、换角色、改镜头角度或场景。满意后选择保存到设备、导出,或直接分享到 YouTube。
上传图片时画幅会跟随图片;纯文字提示默认横屏。Google 产品页说明单次生成的是 10 秒视频,每段视频都带不可见的 SynthID 水印。
使用前提有几条,每一条都直接决定你能不能看到这个入口:
- 个人账号必须订阅 Google AI 方案。 帮助页原话:"若要通过个人账号使用此功能,你必须订阅 Google AI 方案。"免费账号只有图片生成与编辑。
- 未满 18 周岁不能用。
- 上传视频进行编辑在欧洲经济区、瑞士、英国和美国部分州暂不支持;上传图片不受这条限制。
- "请仅上传你有权使用的照片。"
订阅档位以 Google 美国页面 2026 年 9 月 22 日的显示为准(美元,其他国家的档位和价格可能不同):Google AI Plus 每月 4.99 美元,附带 200 个 Flow 积分并可用 Gemini Omni Flash;Google AI Pro 每月 19.99 美元,1,000 个 Flow 积分;Google AI Ultra 每月 99.99 美元起,10,000 个 Flow 积分,并优先获得包括 Veo 3.1 视频生成在内的高级功能。Google 没有公布任何"每天能生成多少条视频"的数字,页面只写了用量限制按算力计算、可能有速率限制。有人在网上给出具体条数,都不是官方口径。
中国大陆账号能否订阅 Google AI 方案、怎样支付,见Nano Banana 2 订阅多少钱的大陆章节。

写代码:API 里默认用 Omni,需要精确控帧再用 Veo 3.1
Google 的 Gemini API 视频概览写得很直接:把 Gemini Omni Flash 作为视频生成的默认模型,Veo 3.1 留给场景延长、指定帧控制这类具体需求。两条路都接受图片输入,区别在接口形态、时长、分辨率和价格。
Gemini Omni:gemini-omni-1.1-flash
按 Omni 文档(2026 年 9 月 17 日更新),图片放在输入列表里就是图生视频;放两张图并描述过渡,就是首帧到尾帧;多放几张则作为角色或元素参考。分辨率 360p、720p(默认)、1080p 和 4K(后两档是放大得到的);画幅 16:9 默认,也支持 9:16;音频默认生成。已生成的视频可以继续延长,每次最多 10 秒,总长 40 秒;上传自己的视频来编辑或延长时,视频不能超过 10 秒。
两条限制值得先看:欧洲经济区、瑞士和英国的用户暂时不能编辑或延长上传的视频;文档明确说只有英文提示被完整评估,"其他语言未经评估,可能可用但结果会有差异"。中文提示词可以试,但出问题先换成英文再判断是不是模型问题。
Omni 用的是新的 interactions 接口,请求结构就是"模型 + 输入列表":
from google import genai
import base64
client = genai.Client()
with open("first-frame.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "image", "data": image_b64, "mime_type": "image/jpeg"},
{"type": "text", "text": "镜头缓慢推进,人物转头看向窗外,自然光,带环境音"},
],
)超过 4MB 的视频要在 response_format 里指定 "delivery": "uri",然后轮询文件状态直到 ACTIVE 再下载。多轮编辑通过 previous_interaction_id 引用上一次结果,不必重新上传。完整的参数说明见 Gemini Omni 1.1 Flash 使用指南。
Veo 3.1:需要首尾帧、8 秒 4K 或多次延长时
Veo 文档列出三个预览版模型:veo-3.1-generate-preview、veo-3.1-fast-generate-preview、veo-3.1-lite-generate-preview。时长 4、6、8 秒;720p 默认,1080p 和 4K 只能配 8 秒,Lite 不支持 4K;画幅 16:9 或 9:16;原生生成对话、音效和环境音。最多 3 张参考图(用参考图时必须选 8 秒),支持首帧 + 尾帧插值,生成过的视频可以每次延长 7 秒、最多 20 次(Lite 除外,延长只限 720p)。预览版模型 ID 随时可能变,写进生产代码前要再看一眼文档。
文档自带的示例就是 Nano Banana 出图、Veo 出视频:
import time
from google import genai
client = genai.Client()
prompt = "Panning wide shot of a calico kitten sleeping in the sunshine"
# 第一步:用 Nano Banana 2 生成首帧
image = client.models.generate_content(
model="gemini-3.1-flash-image",
contents=prompt,
config={"response_modalities": ["IMAGE"]},
)
# 第二步:把这张图交给 Veo 3.1
operation = client.models.generate_videos(
model="veo-3.1-generate-preview",
prompt=prompt,
image=image.parts[0].as_image(),
)
while not operation.done:
time.sleep(10)
operation = client.operations.get(operation)
video = operation.response.generated_videos[0]
client.files.download(file=video.video, destination="output.mp4")两条 API 路线怎么选
| 判断条件 | 选 Gemini Omni | 选 Veo 3.1 |
|---|---|---|
| 默认起点、对话式反复改 | 是 | 否 |
| 需要严格的首帧 + 尾帧插值 | 可以(两张图 + 描述过渡) | 是,专门参数 |
| 需要 1080p / 4K 成片 | 放大得到 | 8 秒原生档位(4K 不含 Lite) |
| 需要把一段视频延长到 40 秒以上 | 最长 40 秒 | 每次 7 秒、最多 20 次 |
| 预算敏感、先出草稿 | 360p 草稿、720p 约 0.10 美元/秒 | Lite 720p 0.05 美元/秒 |
| 欧洲经济区 / 瑞士 / 英国 | 不能编辑上传的视频 | 文档未列同样限制 |

2026 年 9 月的 API 价格与一次成本估算
以下数字是 Gemini API 定价页 在 2026 年 9 月 22 日的显示,单位美元。这些模型都没有免费层,包括 Nano Banana 各型号;想在 API 里免费试视频是不现实的。
| 模型 | 计费 | 换算 |
|---|---|---|
gemini-omni-1.1-flash 视频输出 | 每百万输出 token 17.50 美元 | Google 给出的换算:720p 约 0.10 美元/秒(5,792 token/秒) |
| Veo 3.1 Standard(含音频) | 按秒 | 720p 与 1080p 0.40 美元/秒,4K 0.60 美元/秒 |
| Veo 3.1 Fast(含音频) | 按秒 | 720p 0.10、1080p 0.12、4K 0.30 美元/秒 |
| Veo 3.1 Lite(含音频) | 按秒 | 720p 0.05、1080p 0.08 美元/秒 |
Nano Banana 2 gemini-3.1-flash-image | 每百万输出 token 60 美元 | 约 0.067 美元/张(1K) |
Nano Banana Pro gemini-3-pro-image | 每百万输出 token 120 美元 | 约 0.134 美元/张(1K 或 2K) |
一个算例,纯粹按上表相乘,不代表任何实测账单:做一条 8 秒 720p 短片,先用 Nano Banana 2 出 5 张候选首帧挑一张(5 × 0.067 ≈ 0.34 美元),再用 Omni 生成(8 × 0.10 = 0.80 美元),合计约 1.14 美元;同样的图换 Veo 3.1 Standard 是 8 × 0.40 = 3.20 美元,换 Veo Lite 是 0.40 美元。可以看出首帧那一步几乎不构成成本,真正贵的是视频本身,所以在图片层多试几张、在视频层少试几次,是最省钱的顺序。
如果你做首帧的量比较大,也可以用 laozhang.ai 一把 key 调所有 Nano Banana 型号:其文档页标注 gemini-3-pro-image 0.09 美元/张、gemini-3.1-flash-image 0.055 美元/张、gemini-3.1-flash-lite-image 与 gemini-2.5-flash-image 0.025 美元/张,基址 https://api2.laozhang.ai,同时提供 OpenAI 兼容的 /v1/chat/completions 和 Google 原生的 generateContent 端点,注册入口在 api2.laozhang.ai/register。它的视频接口目前文档里列出的是 Seedance、Sora 2、Wan 这几条(Seedance 接口支持 first_frame / last_frame 角色的图片输入),没有 Veo 3.1 或 Gemini Omni,所以 Google 这两条视频路线仍然要直接走 Gemini API。Veo 的更多价格细节见 Veo 3 价格解析。
"Nano Banana 视频生成器"网站背后是什么
叫"Nano Banana 视频生成器"的网站不是 Google 的产品,它们把"图像转视频""文本转视频""视频转视频"直接挂在 Nano Banana 名下,背后是别家的视频模型。以 nanobanana.io 2026 年 9 月 22 日的文本转视频页为例,页面自称是"新一代 AI 视频模型",但它的模型选择器里列的是 Veo 3.1、Sora 2 / Sora 2 Pro、Kling 2.6 / 3.0、Seedance 2.0 / 2.5、Pixverse V6、Minimax H3,每次生成消耗 5 个积分,默认 6 秒。另外几家同类站点也类似,可选引擎是 Gemini Omni、Seedance、Wan、Veo、Kling、Grok Imagine。
也就是说,这类网站的"Nano Banana 视频"实际上是"用别人的视频模型 + 一个 Nano Banana 的名字"。这不等于它们没用,多引擎切换对不想开好几个账号的人确实方便,但要把它们当成第三方服务商而不是 Google 的官方功能来看,挑的时候看这几点:
- 页面有没有写清楚每次生成实际调用的模型名,以及积分和模型、时长、分辨率的对应关系。
- "免费""无水印""无限"有没有说清账号额度和付费边界;只喊口号不写边界的,当作随时会变的促销看待。
- 生成失败扣不扣费、能不能拿到原始文件、有没有商用授权说明。
- 输出有没有保留原图、提示词和模型名,方便以后换平台时复现。
如果你要的是多引擎比较而不是 Nano Banana 本身,直接看 AI 图片转视频生成器对比和免费图片转视频 AI会比在套壳站里试更省时间。
先做首帧再出视频:一个可复用的顺序
不论走应用还是 API,顺序都一样:
- 先写清楚这条视频要什么:主体、镜头运动、时长、横竖屏、要不要声音、不能出现什么。
- 用 Nano Banana 出首帧和参考图。人物短片先锁定长相、服装、表情;商品短片先锁定产品角度、光线和背景。提示词技巧见 Nano Banana 提示词写法。
- 挑一到三张最稳的图,交给 Gemini Omni;只有需要尾帧插值、8 秒 4K 或多次延长时才换 Veo 3.1。
- 检查输出:人脸和产品有没有漂移、文字有没有乱、动作是否符合描述、音频能不能用。
- 画面本身错了回图片层重做首帧;只是运动或节奏不对,留在视频模型里改提示词、时长和镜头。
常见问题
Nano Banana 能直接生成视频吗?
不能。Nano Banana 2、2 Lite、Pro 和旧版都是图片生成与编辑模型,Google 文档没有任何视频输出功能。它能做的是生成首帧和参考图,视频由 Gemini Omni 或 Veo 3.1 生成。
图片怎么变成视频?
不写代码:在 Gemini 应用里点菜单 → 视频 → 添加图片,输入描述后提交,几分钟后得到一段 10 秒视频。写代码:把图片放进 gemini-omni-1.1-flash 的输入列表,或用 Veo 3.1 的 image 参数。
Veo 3.1 是不是被 Gemini Omni 取代了?
Google 的说法是 Gemini Omni 取代了 Gemini 应用里原来的 Veo 3.1,指的是应用入口。API 里 Veo 3.1 的文档在 2026 年 9 月仍在更新,Google AI Ultra 也仍把 Veo 3.1 列为权益。它没有下线,只是从默认变成了按需选项。
用 Nano Banana 做视频免费吗?
应用侧需要订阅 Google AI 方案,免费账号只有图片生成;API 侧 Omni、Veo 和 Nano Banana 都没有免费层。第三方网站的"免费"通常是有限积分。Gemini API 的免费额度覆盖哪些模型,见 Gemini API 免费层说明。
可以用自己的照片吗?
可以,Gemini 应用一次最多 5 张图片和 1 个视频,前提是你有权使用这些照片。上传视频做编辑在欧洲经济区、瑞士、英国和美国部分州暂不支持。
Gemini Omni 和 Veo 3.1 选哪个?
默认 Omni:对话式修改、360p 草稿、720p 约 0.10 美元/秒,还能延长到 40 秒。需要严格首尾帧插值、8 秒原生 1080p/4K,或想按 7 秒一段延长 20 次,再选 Veo 3.1。





