Google I/O presenta Gemini Omni: genera y edita videos mediante entradas de texto o conversaciones

El 19 de mayo, Google presentó en el Google I/O 2026 la nueva serie de modelos Gemini Omni, diseñados como modelos generativos de medios capaces de «crear cualquier contenido a partir de cualquier tipo de entrada», siendo los videos su principal foco inicial. Gemini Omni combina la capacidad de razonamiento de Gemini con la generación de contenido multimodal, permitiendo utilizar imágenes, audio, videos y texto simultáneamente como referencia para crear videos de alta calidad mediante diálogos naturales; cada instrucción de edición se superpone a la anterior, manteniendo la coherencia de los personajes y respetando las leyes físicas a lo largo de múltiples interacciones. Este modelo cuenta además con una mejora en su modelado físico intuitivo (que abarca gravedad, energía cinética y dinámica de fluidos), así como acceso al vasto conocimiento de Gemini en historia, ciencia y cultura, integrando así la narrativa visual con significados reales. Anteriormente, Nano Banana —lanzado por Google el año pasado— incorporó la inteligencia de Gemini a la generación y edición de imágenes; ahora, Gemini Omni representa su extensión integral al ámbito del video.

El primer modelo de esta serie, Gemini Omni Flash, está disponible desde hoy para usuarios globales suscritos a Google AI Plus, Pro y Ultra, tanto a través de la app de Gemini como de la herramienta de creación de videos Google Flow; también se ofrece gratuitamente en YouTube Shorts y la app YouTube Create, y en las próximas semanas se pondrá a disposición de desarrolladores y empresas mediante API. En el futuro se añadirán las modalidades de salida de imágenes y audio; por el momento, la función de edición de audio permanece en evaluación de seguridad y no está habilitada. En materia de seguridad, todos los videos generados por Omni incorporan automáticamente la marca de agua digital invisible SynthID, verificable en la app de Gemini, Chrome y la búsqueda de Google; además, Google ha lanzado la función «Avatar», que permite crear videos con la propia imagen y voz del usuario, mientras evalúa con cautela la posibilidad de ampliar posteriormente las capacidades de edición de audio.

Blog de Google