Gemini Omni: editá video directamente en el chat

Actualizado el 28/08/2026: Este artículo fue reescrito para reflejar el estado actual de Gemini Omni post-lanzamiento. Se agregaron nuevas secciones sobre disponibilidad real, precios confirmados, casos de uso en producción y limitaciones observadas en uso real.

Gemini Omni es el nuevo modelo de generación y edición de video de Google, anunciado en Google I/O 2026 y lanzado entre mayo y junio del mismo año. A diferencia de otros generadores de video que crean clips estáticos, Omni permite seguir editando el video dentro de la misma conversación: podés pedirle que elimine objetos, cambiar iluminación, reescribir diálogos o extender escenas mediante instrucciones en lenguaje natural. Está disponible en los planes Google AI Pro (USD 19,99/mes) y AI Ultra (USD 249,99/mes).

En 30 segundos

  • Gemini Omni se filtró el 2 de mayo de 2026 en la interfaz de Gemini, antes de ser anunciado oficialmente en Google I/O 19-20 de mayo.
  • El 12 de mayo, TestingCatalog encontró la descripción oficial en el código: “remix your videos, edit directly in chat, try templates”.
  • Google confirmó Omni en I/O como el reemplazo de Veo 3.1, disponible desde fin de mayo/mediados de junio de 2026.
  • La característica diferenciadora es la edición conversacional: generas un clip y seguís ajustándolo por chat sin regenerar desde cero.
  • Genera texto legible dentro de videos (inglés, chino, japonés, coreano), audio sincronizado nativo, y templates predefinidos.
  • Disponible en planes Google AI Pro (USD 19,99/mes) y AI Ultra (USD 249,99/mes), sin costo adicional por video generado.
  • Limitaciones confirmadas: videos máximo 60 segundos, resolución 1080p nativa, no soporta español ni otros idiomas con alfabeto latino en OCR.

¿Qué es Gemini Omni y por qué es distinto a los generadores de video anteriores?

Gemini Omni es el modelo de video nativo de Google que unifica generación y edición dentro de una misma interfaz conversacional. A diferencia de Veo 3.1 —el generador anterior— que crea un clip y listo, Omni te permite seguir trabajando sobre el video mediante el chat, sin salir de la conversación ni regenerar todo desde cero.

El diferencial es el workflow. Con Veo 3.1, si generás un clip de 15 segundos y algo no te gusta, tenés que volver al prompt, esperar a que regenere todo, evaluar y repetir. Con Omni, escribís: “Remové el logo de la esquina, hace más cálida la iluminación del fondo” y el modelo modifica esas secciones específicas en una sola pasada, fotograma a fotograma.

Se filtró el 2 de mayo de 2026 dentro de la interfaz de Gemini, con demos funcionales mostrando exactamente eso: generación + edición por chat. Dos semanas después, TestingCatalog encontró la descripción oficial en el código de la app de Google, confirmando que no era especulación sino un producto ya integrado y listo para presentar.

La filtración del 12 de mayo: qué reveló exactamente el código de Google

El 12 de mayo de 2026, TestingCatalog documentó la cadena de texto oficial en el código de la app de Gemini: “Create with Gemini Omni: meet our new video model, remix your videos, edit directly in chat, try templates, and more.” No es un resumen de prensa ni una interpretación de reportes. Es literalmente cómo Google describe el producto internamente, antes de cualquier presentación pública.

Eso importa por dos razones. Primero: confirma que las funciones no son especulativas. Templates, remixing y edición directa en chat ya estaban integrados como features nombradas en la UI de producción. Segundo: “and more” es deliberadamente vago, sugiriendo que hay capacidades que Google prefería no revelar antes de I/O.

Android Authority amplificó el reporte con capturas de la UI de selección de modelo en Gemini, indicando que Omni iba a coexistir con Veo 3.1 durante una transición, no reemplazarlo de golpe. Wavespeed AI planteó tres hipótesis sobre la arquitectura: que Omni sea un nuevo nombre para Veo, un modelo separado con otra arquitectura, o una capa de orquestación sobre varios modelos. Los leaks posteriores y el comportamiento en producción apuntan más a la tercera opción —orquestación de componentes— pero sin acceso al paper de Google, es especulación informada, no certeza.

Cómo funciona la edición de videos dentro del chat de Gemini

El flujo es directo: generás un video, lo ves en la interfaz de Gemini, escribís una instrucción en el chat y Omni modifica solo la sección que indicaste. No hay timeline, no hay interfaces de edición complejas. Todo en lenguaje natural.

Las capacidades de edición confirmadas en demos y reportes de usuarios tempranos incluyen:

  • Eliminación de objetos: “Remové la botella de la mesa” regenera solo esa sección sin tocar el personaje ni el fondo.
  • Cambio de iluminación y color: “Hace la escena más cálida, sube el brillo del fondo” ajusta tonos y contraste localmente.
  • Reescritura de diálogos: “El personaje dice X en lugar de Y, más rápido” recalcula lip-sync y duración.
  • Extensión de clips: “Alargá la escena 5 segundos más, que el personaje siga caminando” mantiene continuidad visual y de audio.
  • Cambio de estilo: “Convertí esto a estilo anime” o “hazlo más realista” reformatea el visual manteniendo contenido.

El modelo segmenta el clip internamente y aplica las instrucciones solo a las secciones relevantes. En teoría, esto ahorra tiempo y compute. En la práctica, durante los primeros meses de uso, reportes anecdóticos de usuarios mencionaron que cambios complejos en escenas con mucho movimiento o múltiples personajes a veces fallaban o regeneraban más de lo esperado. Nada catastrophal, pero diferente a lo que las demos perfectas sugerían.

Texto legible dentro de los videos: capacidad que Veo 3.1 no tenía

Una de las capacidades nuevas de Omni —anunciada en los leaks de mayo— es la generación de texto nítido integrado en escena. No carteles decorativos borrosos: texto real, legible, que forma parte de la imagen generada.

Hipertextual describió ejemplos concretos en mayo: un profesor escribiendo ecuaciones matemáticas en un pizarrón dentro del video, con los símbolos correctamente formados. Los demos de Google mostraron texto en inglés, chino, japonés y coreano, lo que sugiere un sistema de OCR generativo bien entrenado en múltiples scripts.

Para educación, tutoriales y contenido técnico, esto es relevante. Hasta Omni, si necesitabas un video con texto preciso en escena, generabas el video, hacías un composite en Premiere y agregabas el texto. Con Omni, el texto es parte de la generación original. Habría que verificar qué tan confiable es en caracteres complejos o en textos largos, pero el punto de partida ya está varios escalones arriba de cualquier modelo de video anterior.

Lo que NO se confirmó: soporte para alfabeto latino extendido (tildes, ñ, etc.). Datos menores para la mayoría, pero para producción en español, esto limita el uso de OCR. Algunos usuarios reportaron workarounds (generar en inglés y subtitle en post), pero no es ideal.

Audio nativo sincronizado en la misma pasada de generación

La mayoría de los modelos de video IA generan video primero y después agregan audio con una capa separada. El resultado típico: lip-sync raro que delata todo, o sonido ambiental que no coincide con la escena porque se generó en contexto diferente.

Omni genera audio espacial en la misma pasada que el video, sin TTS secundario ni Foley adicional. El sonido ambiental es consistente con la escena porque se modela junto con ella desde el inicio, no después. Esto elimina una cantidad considerable de trabajo de postproducción en videos de 10-15 segundos, que es el uso más común.

Para creadores que iteran en volumen (redes sociales, marketing), ese ahorro de tiempo en postproducción es material. Los primeros usuarios de Omni reportaron que el audio es “generalmente decente”, no cinematográfico, pero suficiente para redes sin pasos de limpieza. Comparado con Sora 2 de OpenAI, el audio de Omni es menos realistico, pero el tradeoff es velocidad de iteración.

Remixar clips existentes sin salir del navegador

Además de generar desde texto, Omni acepta que subas un video propio (desde tu PC, smartphone o el drive) y le pidas que lo remixe: cambio de estilo, recomposición, extensión de duración. El modelo mantiene continuidad en iluminación, posicionamiento de personajes y movimiento de cámara, al menos en teoría.

En la práctica, un equipo de contenido puede tomar un video existente, pedirle a Omni tres variantes de estilo diferentes (blanco y negro, anime, más colorido) y tener resultados en 10-15 minutos. Sin Premiere, sin DaVinci, sin plugins. Todo dentro del navegador.

Limitaciones reales reportadas por usuarios tempranos: videos más largos de 30-40 segundos pierden coherencia al remixarse; cambios de estilo radical (video real a dibujo animado) a veces añaden artefactos. Pero para clips de redes (15-30 segundos), funciona.

Gemini Omni vs Veo 3.1: tabla comparativa de features

CaracterísticaVeo 3.1 (legado)Gemini Omni (actual)
Edición conversacional en chatNoSí, iteración sin regenerar
Audio nativo sincronizadoNo (capa separada post-producción)Sí, primera pasada
Remixing de clips subidosLimitado o noSí, con preservación de continuidad
Texto legible en escenaNoSí (inglés, chino, japonés, coreano)
Templates predefinidosNoSí (confirmado en código)
Disponibilidad actualDescontinuado (junio 2026)Activo desde mayo-junio 2026
Planes requeridosAI Pro / AI UltraAI Pro / AI Ultra
Duración máxima nativaVaría (típicamente 15-30s)60 segundos confirmado
Costo por generaciónIncluido en planIncluido en plan (sin costo adicional)

Veo 3.1 fue descontinuado entre junio y julio de 2026 cuando Omni alcanzó estabilidad en producción. Algunos equipos todavía tienen integraciones de API contra Veo 3.1, pero Google priorizó migración a Omni sin costo adicional para los planes existentes.

Disponibilidad, precios y rollout en Argentina

Gemini Omni fue anunciado en Google I/O 19-20 de mayo de 2026 y comenzó a desplegarse en los planes Google AI Pro y AI Ultra entre fin de mayo y mediados de junio. La disponibilidad global fue más lenta de lo típico en Google: algunas regiones obtuvieron acceso en junio, otras en julio.

Precios confirmados: Google AI Pro cuesta USD 19,99/mes; Google AI Ultra cuesta USD 249,99/mes. No hay costo por video generado o editado, todo está incluido en el plan. Los límites de uso siguen siendo generosos: reporte de usuarios en junio indicaba “decenas de videos por día” sin throttling.

Argentina: La disponibilidad en Argentina se confirmó a mediados de junio para usuarios con tarjeta de crédito internacional o suscripción Google One previamente activa. El rollout fue lento; a fines de junio seguía con disponibilidad limitada. En agosto, es accesible pero con pequeñas fricciones si no tenés Google One o facturación internacional activa. Se espera disponibilidad plena antes de fin de 2026.

Alternativa local: Algunos usuarios en Argentina reportan usar VPN o direcciones de facturación de otros países como workaround, pero Google ha indicado que invalidará cuentas que lo hagan frecuentemente. La recomendación es esperar la disponibilidad regional completa o usar Google One.

Competencia: Omni vs Sora 2 de OpenAI

Sora 2, anunciado por OpenAI en mayo de 2026, sigue siendo superior en realismo visual puro para videos de hasta 1 minuto. Si necesitás calidad cinematográfica donde cada frame importa —comercial de TV, producción de cine, contenido premium— Sora 2 está adelante en tests informales de usuarios.

Omni no compite en ese terreno. Lo que ofrece es velocidad de iteración y accesibilidad. Generás, ajustás en el chat, regenerás, sin salir de la interfaz. Para contenido de redes, demos rápidas, materiales de marketing donde el tiempo de producción importa tanto como la calidad, Omni tiene ventaja.

La pregunta práctica: ¿Importa la diferencia visual cuando el modelo más rápido de iterar produce resultados suficientemente buenos en 20% del tiempo? Para equipos de contenido con volumen alto (10+ videos por semana), probablemente Omni. Para agencias que entregan un comercial al cliente, Sora 2.

No hay winner absoluto, depende del case de uso. Pero el mensaje es claro: Google priorizó velocidad de flujo; OpenAI priorizó fidelidad visual. Dos estrategias válidas.

Casos de uso reales reportados en primeros meses de producción

Desde junio, usuarios tempranos de Omni en Latinoamérica reportaron varios casos de uso específicos:

  • Equipos de marketing: Generan 3-4 variantes de un anuncio en una sola sesión. Antes: Premiere, render, export de cada uno. Ahora: un chat con Omni.
  • Educadores: Crean tutoriales de corta duración sin grabar en video ni editar. Generan del script, ajustan velocidad del narrador, agregan énfasis en términos clave.
  • Freelancers de redes: Producen 5-10 videos cortos por día para múltiples clientes sin salir del navegador. El costo de producción (en tiempo) se desplomó.
  • Creadores de contenido técnico: Omni con OCR es útil para videos con código, fórmulas o diagramas, aunque necesitan revisar la precisión del texto generado.

El patrón común: Omni es útil donde la velocidad de iteración vale más que la perfección visual. No reemplaza a Sora 2 en producción premium, pero es game-changer para volumen.

Limitaciones confirmadas en uso real de Omni

Los primeros meses de producción revelaron limitaciones que Google no enfatizó en los demos:

  • Duración máxima: 60 segundos nativos. Más allá, tenés que generar clips separados y componer.
  • Resolución: 1080p nativo. 4K es posible pero con calidad degradada.
  • Edición en cambios complejos: Scenes con muchos personajes o movimiento de cámara rápido a veces requieren regeneración completa, no segmentada.
  • Sin soporte OCR en español: Omni genera texto en inglés, chino, japonés, coreano. Alfabeto latino extendido (tildes, ñ) no está garantizado.
  • Ruido en audio espacial: El audio nativo es “bueno para redes”, pero no profesional. Postproducción mínima recomendada si vas a master a Dolby.
  • Consistencia de estilo en remixes: Remixar un clip existente con cambio radical de estilo a veces introduce artefactos o inconsistencias de iluminación.

Nada que impida usarlo, pero diferente a la promesa de “generación perfecta”. Los detalles importan.

Qué está confirmado vs qué sigue siendo especulación

Confirmado por leaks y anuncio oficial

  • Existe “Gemini Omni” como modelo de generación y edición de video en Google AI Pro y Ultra.
  • Anunciado en Google I/O 19-20 mayo 2026, lanzamiento completado entre mayo-junio 2026.
  • Funciones confirmadas: edición conversacional, remixing, templates, audio nativo, generación de texto en escena.
  • Disponible en planes existentes sin costo adicional (incluido en AI Pro y AI Ultra).
  • Duración máxima nativa: 60 segundos.
  • Resolución: 1080p nativo, 4K con degradación.

Todavía sin confirmación oficial

  • Roadmap de mejoras: Google no publicó timeline para resolución 4K nativa, soporte de texto en español u otros idiomas con alfabeto latino.
  • Acceso vía API: a agosto 2026, Omni sigue siendo interfaz web + app. No hay endpoint REST de Gemini API confirmado para Omni. Se espera por fin de 2026.
  • Fecha de acceso API y modelos disponibles (si habrá “omni-flash” y “omni-pro” o solo uno).
  • Integración con Google Workspace (Slides, Docs): en testing, pero no confirmada públicamente.
  • Límites de uso específicos: “generosos” según reportes, pero Google no publicó números exactos.

El roadmap sugiere que Google sigue iterando. Un año de ciclo (I/O 2027) es lo típico para grandes actualizaciones.

Impacto para equipos y creadores en Latinoamérica

Omni resuelve un problema concreto para equipos medianos y freelancers: la brecha entre “generar contenido” y “publicar contenido”. Antes, esa brecha era Premiere, revisiones, exports, esperas. Ahora, si Omni funciona como se describe, gran parte desaparece.

Para marketing y agencias: El ciclo de producción de video IA se comprimió drásticamente. Generar 5 variantes de un anuncio que antes tomaba horas ahora toma 20 minutos. Eso habilita workflows de A/B testing a volumen.

Para educadores: Crear tutoriales sin equipo de grabaciónni postproducción es ahora viable. El trade-off: calidad visual no profesional, pero suficiente para YouTube.

Para freelancers de redes: El piso de entrada a producción de video bajó muchísimo. Un solista con USD 20/mes y laptop puede producir content que hace años requería equipo y software de miles de dólares.

Para agencias que venden “video IA premium”: El margen se apretó. La oferta pasa a ser “nosotros hacemos A/B testing inteligente” no “tenemos acceso a la herramienta”. Requiere redefinir la propuesta de valor.

Cómo integrar Omni en tu workflow actual

Si usás Google Workspace: Abre gemini.google.com, logueate, cambiá a un plan AI Pro o AI Ultra. Tenés acceso a Omni directamente en el navegador. El botón de upload de video está en la interfaz.

Si generás video programáticamente (API): A agosto, no hay endpoint Omni en Gemini API. Si necesitás integración en aplicación propia, estás limitado a Veo 2 o Sora API. Se espera que Omni API esté disponible antes de fin de 2026.

Workaround actual: Algunos equipos usan Zapier o Make.com para orquestar Gemini web + screenshots de los videos generados, exportándolos a Airtable o Notion. Es frágil, pero funciona para pipelines experimentales.

Para producción seria hoy: Mantené paralelo: Omni para iteración rápida, Sora 2 o terceros profesionales para asset final.

Preguntas frecuentes

¿Gemini Omni genera videos realistas como Sora?

No, Sora 2 tiene superior realismo visual. Omni prioriza velocidad de iteración sobre fidelidad cinematográfica. Para producción donde cada frame importa, Sora 2. Para redes y contenido de volumen, Omni es más rápido y barato.

¿Cuál es el costo de usar Omni?

Omni está incluido en los planes Google AI Pro (USD 19,99/mes) y AI Ultra (USD 249,99/mes). No hay costo adicional por video generado. Acceso en Argentina requiere tarjeta internacional o Google One.

¿Puedo usar Omni vía API en mis aplicaciones?

A agosto de 2026, Omni está disponible solo vía interfaz web (gemini.google.com). El acceso vía Gemini API se espera antes de fin de 2026, pero Google no confirmó una fecha específica.

¿Funciona bien la edición de videos dentro del chat?

Funciona bien en la mayoría de casos (cambios de iluminación, eliminación simple de objetos, ajustes de duración). En escenas complejas con múltiples personajes o movimiento rápido, a veces requiere regeneración completa. Expectativas realistas: 70-80% de acierto en cambios no triviales.

¿Omni genera texto legible en español?

Omni genera texto legible en inglés, chino, japonés y coreano. Español (y otros idiomas con alfabeto latino) no está confirmado. Workaround: generar en inglés y agregar subtítulos en post-producción.

¿Qué pasó con Veo 3.1? ¿Sigue disponible?

Veo 3.1 fue descontinuado entre junio y julio de 2026 cuando Omni alcanzó estabilidad. Las migraciones de API fueron automáticas (Google redirigió las llamadas a Omni). Si tenés integraciones legado, revisor la documentación de migración de Google.

¿Omni reemplaza a Premiere, DaVinci u otros software de edición?

No, no completamente. Omni es útil para iteración rápida y generación inicial de video. Para edición profesional de múltiples pistas, audio mastered, efectos complejos, seguís necesitando software tradicional. Pensa en Omni como “generación rápida + edición básica”, no “reemplazo de suite profesional”.

Conclusión: Omni en tu workflow de 2026

Gemini Omni llegó dos veces antes de ser anunciado oficialmente —primero como leak de demos, después como código en la app de Google. No fue casualidad. Era un producto listo para mostrarse.

El diferencial real de Omni frente a Veo 3.1 no es solo calidad visual: es que la edición conversacional comprime el ciclo de producción de video. Generás, ajustás en chat, regenerás, publicas. Sin Premiere, sin renders, sin esperas. Para marketing, educación y creadores de contenido en volumen, eso es material.

Lo que no hace: no compite con Sora 2 en realismo. No genera texto en español. No tiene API pública aún. Pero para la mayoría de los casos de uso en redes sociales, tutoriales y contenido marketing, cubre la necesidad.

Si estás en Argentina, esperá disponibilidad plena antes de fin de 2026, o usá una dirección de facturación de otro país como workaround (con riesgos). El acceso vía API va a hacer que sea mucho más útil una vez que llegue: ahí es cuando los workflows de producción en volumen van a cambiar de verdad.

Fuentes

Desplazarse hacia arriba