Gemini Omni 1.1 Flash lleva el video generativo a flujos profesionales
Google lanzó Gemini Omni 1.1 Flash con extensión de escenas, referencias de video, borradores más rápidos y salida 4K. El cambio abre nuevas opciones para producir y automatizar contenido audiovisual.
- Por Emmanuel Araujo
- 4 min de lectura

Google presentó Gemini Omni 1.1 Flash el 27 de agosto y lo habilitó para desarrolladores mediante la API de Gemini en Google AI Studio. La actualización incorpora extensión de escenas de hasta 40 segundos, interpolación entre un fotograma inicial y uno final, referencias de video y escalado a 4K.
El anuncio apunta a convertir la generación audiovisual con IA en una herramienta más controlable para producción, no sólo para experimentar. La disponibilidad y algunas funciones dependen del producto, el plan y la región, por lo que los equipos latinoamericanos deberían comprobar el acceso antes de comprometer entregas.
Qué cambió en Gemini Omni
La extensión de escenas ahora analiza hasta diez segundos del material anterior y permite continuar un clip en incrementos de diez segundos, hasta un máximo acumulado de cuarenta. Según Google, el modelo anterior tomaba como referencia apenas el último segundo, una diferencia que busca mejorar la continuidad visual y narrativa.
También es posible definir el primer y el último fotograma de una toma. Ese control sirve para construir transiciones, movimientos de cámara y bucles con puntos de partida y llegada explícitos, algo especialmente útil en anuncios, piezas para redes, demostraciones de producto y prototipos de motion design.
Para iterar con menor costo, Omni 1.1 ofrece borradores a 360p que, de acuerdo con las pruebas internas publicadas por Google, pueden generarse hasta un 60% más rápido que los videos a 720p y cuestan un tercio. Una vez aprobada la idea, el flujo admite salidas en 1080p o 4K para producción final.
Por qué importa para empresas y agencias
La combinación de borradores económicos y render final de alta resolución cambia el orden de trabajo. Un equipo puede probar encuadres, ritmo y narrativa con archivos livianos, validar con el cliente y recién después invertir en la versión final. Esto puede reducir horas de edición y el costo de descartar conceptos que no funcionan.
Otra novedad es la posibilidad de aportar hasta tres segundos de video como referencia multimodal. Junto con imágenes y texto, ese material ayuda a conservar personajes, acciones o rasgos visuales. Para una marca, el valor está en lograr sin reconstruir cada toma desde cero.
