Para la mayoría de las empresas, un vídeo de formación de 90 segundos o una explicación del producto nunca ha sido una tarea fácil. Esto significa un informe bien planificado, un equipo de filmación interno o un proveedor externo, filmación, edición y una serie de revisiones. Cambie una línea de texto en pantalla debido a una revisión legal y toda la cadena comienza de nuevo. El costo y los largos plazos de entrega explican por qué muchos videos internos nunca se hacen.
Es esta ecuación la que Google pretende reescribir con Gemini Omni Flash, el primer modelo de su nueva familia «Omni», que ahora se lanza a desarrolladores y clientes empresariales a través de API después de debutar para los consumidores en I/O 2026. Google define la ambición de la familia como crear cualquier cosa «a partir de cualquier entrada», comenzando con video. Pero la interacción del título no es sólo una indicación más precisa de texto a vídeo. Esta es la capacidad de editar un clip completo a través de una conversación.
Cuando se lanzó el modelo en mayo, el análisis de negocios de VentureBeat destacó el problema: sin una API, Omni era una herramienta para consumidores y prosumidores, no una herramienta de producción. Esta implementación de API cambia eso. Pone la edición conversacional frente a los equipos de marketing, aprendizaje y desarrollo que crean la mayor cantidad de videos en una organización.
El discurso: un conjunto de cinco herramientas resumidas en una sola conversación
Hasta ahora, muchos equipos ensamblaban videos de IA de la manera más difícil, ensamblando un LLM para un guión, un modelo de imagen de texto, un modelo de imagen de video, una herramienta de sincronización de labios separada y un generador de voz, cada uno con su propio contrato, facturación y ruta de datos.
El argumento comercial de Omni es la unificación: un modelo que toma texto, imágenes y video y devuelve un clip terminado con audio sincronizado.
Este factor de simplicidad es la parte que quienes toman las decisiones deben considerar primero. Consolidar múltiples herramientas puntuales en un solo modelo significa menos proveedores y un lugar para monitorear los resultados y hacer cumplir las reglas de administración de datos. Para una organización que evitó el vídeo generativo porque no valía la pena reunir las herramientas, la ecuación cambia.
Con la edición conversacional, cada instrucción se basa en la anterior, por lo que un especialista en marketing puede volver a grabar una foto de producto, recortarla o cambiar de vestuario sin regenerarse desde cero y perder las partes que ya funcionaron. Es la diferencia entre reservar una nueva sesión y enviar una nota.
Referencias multimodales y un motor de física para los activos de marca.
Omni admite mucho más que un mensaje de texto. Además de las palabras que describen lo que deseas, puedes proporcionarle varias imágenes de referencia y videoclips existentes, e incorpora esos detalles en el resultado. Dale una fotografía de un objeto en particular, pídele al modelo que coloque ese objeto en una escena y reproducirá el color y la forma aproximada del objeto real en lugar de inventar un reemplazo genérico. Si bien es posible que la coincidencia no sea perfecta en píxeles, es lo suficientemente cercana como para ser reconocible. Este control basado en credenciales es lo que hace que la característica sea comercialmente atractiva: se puede agregar una foto del producto, un logotipo de marca o una ubicación específica como ingrediente en lugar de describirlo en un aviso y lo esperado.
Dos de las cuatro ventajas destacadas por Google tienen que ver directamente con el trabajo en una empresa. El primero es un modelo mundial, la comprensión del sistema del comportamiento de las escenas físicas. Agregue lluvia ligera y charcos a una toma existente y obtendrá reflejos de personas y objetos en el pavimento mojado, el tipo de consistencia física que separa las imágenes reales de los videos obvios de IA.
El segundo es la inserción de texto y logotipo. Muéstrele una escena llena de carteles y podrá pedirle que los reescriba en otro idioma, o para una marca de su elección, e incluso que inserte el logotipo de una empresa. Los resultados no son perfectos: durante las pruebas, el seguimiento de señales en escenas complejas no siempre fue perfecto y parte del texto volvió al idioma original entre fotogramas. Para videos de capacitación que requieren etiquetas en pantalla o comerciales que requieren un logotipo colocado en la escena, esta es una característica que vale la pena observar de cerca y que sirve como recordatorio de que la producción aún requiere revisión humana antes de enviarse.
La API de Interacciones y dónde aún muerden los límites
Debajo del capó, se ejecuta en la nueva API de Interacciones de Google, una interfaz con estado diseñada para tareas de múltiples rondas en lugar de chat abierto. Cada ronda avanza el vídeo anterior y sus referencias, lo que permite que las ediciones se desarrollen de forma coherente. Los desarrolladores pueden encadenar generaciones. Pueden producir un clip, convertir el gato en un gatito puma, cambiar el estilo de un vídeo a retro de 8 bits, luego a acuarela y almacenar cada versión para una rama posterior.
Las limitaciones son reales y merecen ser presupuestadas. Actualmente, los clips están limitados a 10 segundos, según la hoja de modelo publicada por el modelo. Para alargar algo, genera fragmentos y los edita juntos. El metraje cargado también se puede editar, siempre que dure 10 segundos o menos y el usuario posea los derechos. El propio mapa modelo de Google afirma francamente que mantener la coherencia entre las ediciones y representar el texto con precisión siguen siendo cuestiones abiertas.
Barandillas, marca de agua y línea que Google no cruzará
Para un CISO, las demostraciones importan menos que el trabajo de abastecimiento incluido con el modelo. Cada clip de Omni lleva la marca de agua SynthID de Google, Google está ampliando los ID de contenido C2PA en sus herramientas generativas y ha lanzado una API de detección de contenido de IA que señala los medios generados por IA, tanto de Google como de otros proveedores.
Google también trazó una línea deliberadamente. La modelo no tomará una fotografía de una persona ni un clip de audio y no los sincronizará con la voz, una medida explícita para limitar los deepfakes. Sin embargo, será necesario tomar una grabación de alguien hablando y traducirla a otro idioma, una ruta útil para localizar el contenido general de la capacitación. Para las empresas reguladas, estas limitaciones y procedencia inherente son características más que fricciones.
VB Transform · 14-15 de julio · Menlo Park · Inferencia e infraestructura de IA
GM logró un aumento del 300 % en los RP fusionados al renovar la arquitectura del agente. Esto es lo que construyeron.
El lado de la infraestructura de Transform cubre la generación de video en tiempo real, pilas de razonamiento de máquina a máquina y lo que realmente se necesita para ejecutar agentes a escala empresarial.
Ver la agenda completa →
Los números: barato, solo 720p y (preliminarmente) clasificado en primer lugar
El precio ha aterrizado junto con la API y es agresivo. Omni Flash cuesta 0,10 dólares por segundo de vídeo de 720p generado, lo que equivale a aproximadamente un dólar por un clip de diez segundos. Esto coincide con Veo 3.1 Fast a la misma resolución, se ejecuta dos veces más rápido que Veo 3.1 Lite y se reduce a tres cuartos del Veo 3.1 estándar.
|
Por segundo (USD) |
Géminis Omni Flash |
Veo 3.1 Lite |
Veo 3.1 Rápido |
veo 3.1 |
|
720p |
$0.10 |
$0.05 |
$0.10 |
$0.40 |
|
1080p |
n / A |
$0.08 |
$0.12 |
$0.40 |
|
4K |
n / A |
n / A |
$0.30 |
$0.60 |
La tabla también expone la trampa. Omni Flash sólo produce 720p. No hay opción de 1080p o 4K, mientras que los niveles de Veo escalan hasta 4K. Para la formación interna y la mayoría de los vídeos sociales, 720p es adecuado. Para un trabajo de marca premium dirigido a una pantalla grande, ese es un verdadero techo, y es por eso que Veo 3.1 todavía tiene trabajo por hacer.
Los clips tienen una duración de 3 a 10 segundos a 720p nativo, en paisaje (16:9) o retrato (9:16). Como entradas de referencia, el modelo acepta hasta siete imágenes y hasta tres videoclips de tres segundos o menos. Todavía no acepta audio como entrada, aunque genera audio junto con el vídeo que produce. La salida es MP4 estándar y cada clip viene con la marca de agua SynthID y las credenciales C2PA integradas.
En cuanto a la calidad, las primeras señales son fuertes. En el Text-to-Video Arena de LMArena, una tabla de clasificación donde la gente vota sobre los resultados de los modelos competidores, Omni Flash ocupó el puesto número uno con una puntuación de 1.527.
Qué significa esto para los presupuestos y qué falta todavía
Con los precios reales en la mano, la historia de la iteración se vuelve concreta. Cada edición conversacional es una nueva generación por la que pagas, por lo que una sesión de edición intensa todavía suma alrededor de un dólar por cada pase de diez segundos a 720p. Lo que cambia el modelo con estado no es el costo de un cambio, es la cantidad de cambios desperdiciados: debido a que el contexto se traslada de un turno a otro, estas generaciones trabajan para refinar una toma que en su mayoría funciona en lugar de reiniciar desde un mensaje vacío y esperar que el siguiente intento aterrice.
Omni no está solo en este ámbito. Veo 3.1 sigue siendo la opción de producción de Google cuando se necesita una resolución más alta, y los competidores de Bytedance, Alibaba y OpenAI persiguen los mismos presupuestos. Lo que Omni añade es la capacidad de edición en sí: la capacidad de tratar un vídeo como un documento vivo en lugar de una única representación.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.












































































