Gemini Omni 1.1 Flash ya cuenta con un modelo documentado en Gemini API: gemini-omni-1.1-flash. Permite generar vídeo con audio, trabajar con texto, imágenes y vídeo como contexto, y editar resultados mediante una conversación de varios turnos.
Para un usuario en España, sin embargo, la pregunta importante no es solo “¿qué puede hacer?”. También hay que saber qué superficie de Google se está usando y si el material lo ha generado el modelo o lo ha subido el usuario. Esa distinción cambia el identificador, las condiciones y algunas funciones disponibles en el Espacio Económico Europeo.
Elige primero la superficie de acceso
Google ofrece Omni 1.1 en varios productos, pero no son intercambiables:
| Superficie | Identidad o acceso | Consecuencia práctica |
|---|---|---|
| Gemini API y Google AI Studio | gemini-omni-1.1-flash | Ruta documentada con Interactions API |
| Gemini Enterprise Agent Platform | gemini-omni-1.1-flash-preview | Oferta Preview sujeta a condiciones Pre-GA y cuota fija |
| Google Flow | Modelo disponible dentro del producto para planes elegibles | No proporciona un ID que puedas copiar a tu código |
| Aplicación Gemini | Extensión de escenas para cuentas elegibles | La presencia de la función depende de la cuenta y del despliegue |

La presentación oficial de Omni 1.1 indica que Flow está disponible para suscriptores Google AI Plus, Pro y Ultra, y que la extensión de escenas llega a esos planes en Gemini. Comprueba siempre la interfaz de la cuenta concreta: una disponibilidad anunciada globalmente no garantiza que un espacio de trabajo, perfil de edad o despliegue regional ya muestre la opción.
Qué aportan los controles de vídeo
Omni 1.1 está pensado para iterar, no solo para crear un clip desde cero. El manual de Gemini API documenta estas rutas:
- vídeo desde un prompt de texto, con audio generado;
- animación a partir de una imagen;
- edición conversacional de un resultado anterior;
- transición entre un fotograma inicial y uno final;
- uso de referencias de vídeo para conservar movimiento o apariencia;
- ampliación de una escena desde su final.
La ampliación puede analizar hasta 10 segundos de contexto previo y continuar en pasos de 10 segundos hasta alcanzar una duración acumulada de 40 segundos. No significa que cualquier solicitud produzca de una vez un vídeo de 40 segundos. Tampoco permite añadir contenido al principio ni insertar una escena en la mitad: la extensión se añade al final.
Las resoluciones configurables son 360p, 720p, 1080p y 4K; 720p es el valor predeterminado. Google identifica 1080p y 4K como resultados reescalados. Para evitar gasto inútil, tiene sentido probar composición y movimiento en 360p o 720p y reservar el reescalado para las tomas que realmente se van a conservar.
En España, subir un vídeo cambia lo que puedes hacer
La restricción regional más importante es explícita: la documentación indica que la edición o extensión de vídeos subidos por el usuario no está disponible actualmente en el EEE, Suiza ni Reino Unido. Extender un vídeo generado por el propio modelo es un caso distinto y sí está contemplado en las regiones disponibles.
Por eso conviene separar dos flujos:
- Generas un clip con Omni y continúas el mismo trabajo usando el identificador de la interacción anterior.
- Subes un MP4 propio y pides modificarlo o extenderlo.
En España, el primero puede ser viable mientras el segundo esté bloqueado por la limitación regional. No diseñes una función de producto alrededor de la subida y edición de material del usuario hasta verificarla con la cuenta, la región y la documentación actual.

También hay límites que afectan a cualquier mercado. Un vídeo subido para edición o extensión suele tener que durar 10 segundos o menos. No se puede extender un vídeo subido con una persona hablando para añadirle nuevo diálogo; la edición de voz tampoco está soportada. Las referencias admiten como máximo tres clips de hasta tres segundos y se ignora su audio.
Las imágenes con menores y determinadas personas reconocibles tienen restricciones adicionales. Todos los vídeos generados incorporan SynthID invisible, y tanto la entrada como la salida pasan por filtros de seguridad. Que un archivo se pueda seleccionar no equivale a tener permiso o soporte para cualquier edición de una persona real.
Primera llamada con Gemini API
El ejemplo mínimo en Python usa el SDK google-genai, el modelo de Gemini Developer API y una respuesta de vídeo. La clave debe configurarse mediante el mecanismo seguro recomendado por Google, no escribirse dentro del archivo.
pythonimport base64 from google import genai client = genai.Client() result = client.interactions.create( model="gemini-omni-1.1-flash", input=( "Plano continuo de una maqueta de ciudad al amanecer. " "Las luces se encienden una a una. Sin diálogo." ), response_format={ "type": "video", "aspect_ratio": "16:9", "resolution": "720p", }, ) with open("ciudad.mp4", "wb") as archivo: archivo.write(base64.b64decode(result.output_video.data))
output_video es un campo cómodo del SDK. En REST directo, el contenido aparece dentro de steps, por lo que la lectura de la respuesta es diferente. Para formato vertical, cambia la relación a 9:16.
Si el primer resultado necesita una corrección, conserva la interacción y pide un cambio concreto, por ejemplo: “Cambia la luz a última hora de la tarde; conserva todo lo demás”. Las instrucciones de edición simples suelen proteger mejor lo que ya funciona que un prompt completamente reescrito.
No hay que publicar un precio de 1.1 sin comprobar la fila exacta
A 29 de agosto de 2026, la página oficial de precios de Gemini API seguía mostrando una fila legible para el modelo anterior gemini-omni-flash-preview, con un coste efectivo aproximado de 0,10 USD por segundo de vídeo 720p. La fila no identificaba claramente Omni 1.1.
Ese valor sirve para entender el orden de magnitud del preview anterior, pero no como tarifa confirmada de gemini-omni-1.1-flash. Antes de presupuestar, revisa la consola y la página de precios vinculada al modelo exacto. La versión de Cloud tiene además otro ID, otro lifecycle y otra modalidad de consumo, por lo que tampoco debe heredar automáticamente el precio del Developer API.
Decisión rápida antes de empezar
Elige Gemini API cuando necesites incorporar generación y edición conversacional a una aplicación y puedas trabajar dentro de sus límites de región, seguridad y lenguaje. Elige Flow o Gemini cuando el proceso sea manual y dependa de una suscripción. Usa Cloud Preview solo si sus condiciones Pre-GA y su cuota encajan con el proyecto.
Si tu necesidad principal es comparar costes de generación de vídeo más establecidos, consulta el precio real de Veo 3. Si el bloqueo es la clave, el nivel gratuito o la facturación, continúa con la guía de Gemini API gratis.
Antes de poner una integración en producción, guarda el ID exacto, la superficie de Google, la fecha de verificación, la región y una ruta alternativa. Es la forma más sencilla de impedir que una etiqueta de la aplicación, un modelo Preview de Cloud y un modelo de Developer API se conviertan por accidente en una única promesa falsa.



