Gemini Omni ya está aquí: el primer modelo de IA "cualquier entrada" de Google empieza por la generación de vídeo (análisis del lanzamiento 2026)

ImagineToVideo TeamImagineToVideo Team22 may 2026
Gemini Omni ya está aquí: el primer modelo de IA "cualquier entrada" de Google empieza por la genera... - AI Video Guide

Gemini Omni ya está aquí: el primer modelo de IA "cualquier entrada" de Google empieza por la generación de vídeo (análisis del lanzamiento 2026)

Draft — Versión en español Slug: google-gemini-omni-multimodal-ai-video-model Target: equivalente a la versión en inglés Status: first draft, ready for review. Cover: https://cdn.imaginetovideo.com/blog/cover/gemini-omni-flash.png Fuentes primarias: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni/, deepmind.google/models/gemini-omni


El 19 de mayo de 2026, Google DeepMind activó discretamente un modelo que reescribe en silencio cualquier comparativa de "generador de vídeo IA" publicada antes de esta semana. Gemini Omni — y su primera variante lanzada, Gemini Omni Flash — no es un modelo de vídeo pegado a un modelo de chat. Es una única arquitectura que acepta cualquier modalidad de entrada (texto, imagen, vídeo, audio) y genera una modalidad de salida, empezando hoy por el vídeo y añadiendo imagen y audio "con el tiempo".

Koray Kavukcuoglu, CTO de Google DeepMind, lo enmarcó en una frase en el blog del lanzamiento: "Omni is our new model that can create anything from any input" ("Omni es nuestro nuevo modelo que puede crear cualquier cosa a partir de cualquier entrada"). El encuadre importa. Hasta esta semana, el paradigma dominante en IA generativa era la especialización — Sora para vídeo, Imagen para imagen, AudioLM para audio, Gemini para chat. Omni rechaza esa división. Un modelo, todas las modalidades, en ambas direcciones.

Aquí está el panorama completo: qué es real, qué sigue sin confirmarse, qué plataformas lo tienen hoy y qué significa si estás llevando vídeo IA a producción.


¿Qué es Gemini Omni?

Gemini Omni es el nombre de una nueva familia de modelos de Google DeepMind. La variante actualmente disponible es Gemini Omni Flash — la convención de nombres de Google para el nivel optimizado en latencia de una familia Gemini (el mismo sufijo que has visto en Gemini 2.5 Flash, Gemini Nano Flash, etc.). Un nivel Pro o Ultra está implícito en el nombre pero no ha sido anunciado.

La afirmación técnica definitoria está en la tagline oficial: "a model that can create anything from any input — starting with video." Léelo con atención. Hay dos piezas distintas.

Primero, "cualquier cosa a partir de cualquier entrada": Omni acepta texto, imágenes, vídeo y audio (las referencias de voz ya están soportadas, otros tipos de audio "próximamente", según el post de lanzamiento). La entrada multimodal no es nueva — Gemini 1.5 ya aceptaba vídeo y audio como entrada hace dos años.

Segundo, "empezando con vídeo": Omni genera vídeo de forma nativa, hoy. La salida de imagen y audio está marcada explícitamente como capacidades futuras ("in time we will support"). Así que la asimetría en el lanzamiento es real — cualquier entrada entra, vídeo sale. La tagline "anything in, anything out" describe la ambición arquitectónica, no lo que puedes hacer el 22 de mayo de 2026.

El post de lanzamiento de Kavukcuoglu lista las plataformas donde el modelo vive en el lanzamiento:

  • Gemini App — disponible para suscriptores de AI Plus, AI Pro y AI Ultra.
  • Google Flow — la herramienta de producción cinematográfica de Google, donde Omni reemplaza o aumenta el pipeline anterior basado en Veo (el post de lanzamiento no especifica la relación explícitamente).
  • YouTube Shorts — gratis dentro del flujo de creación de Shorts.
  • YouTube Create App — gratis, en la app dedicada al formato corto.
  • API para desarrolladores + empresas — "en las próximas semanas", según el post.

Esa es toda la superficie de distribución actual. No hay endpoint de Gemini Omni Flash en Vertex AI en el lanzamiento, ningún toggle en Google AI Studio y ninguna integración de plataforma terceros — incluyendo, notablemente, ImagineToVideo, donde estamos rastreando de cerca el lanzamiento de la API. Volveremos a ello.


Qué significa hoy realmente "cualquier entrada, cualquier salida"

La forma más limpia de leer Omni es como una matriz. Aquí el estado del día del lanzamiento, extraído directamente de los posts oficiales de Google:

Entrada →TextoImagenVídeoAudio
Salida: Vídeo✅ Activo✅ Activo✅ Activo (edición)✅ Ref. de voz activa, otros "próximamente"
Salida: Imagen🕗 "Con el tiempo"🕗 "Con el tiempo"🕗 "Con el tiempo"🕗 "Con el tiempo"
Salida: Audio🕗 "Con el tiempo"🕗 "Con el tiempo"🕗 "Con el tiempo"🕗 "Con el tiempo"

Así que en el día del lanzamiento, cada celda en la fila "salida de vídeo" está activa o parcialmente activa. Cada otra fila es una promesa. Hasta que Google envíe la salida de imagen y audio, "Omni" en la práctica significa "cualquier entrada → vídeo", lo cual sigue siendo una afirmación significativa — ningún modelo público ha enviado esa matriz exacta antes.

Algunas cosas específicas que Google no divulgó en el lanzamiento y vale la pena señalar:

Longitud de contexto. El post de lanzamiento no indica cuánto puede durar un vídeo de entrada ni cuál es la longitud máxima del prompt. Veo 3 anunció ~8 segundos de salida en su lanzamiento; Sora 2 subió a 25 segundos en el nivel Pro. La duración máxima de clip de Omni y la longitud máxima de entrada están TBD en los materiales públicos.

Benchmarks. No hay benchmarks de calidad publicados, ni ranking ELO, ni cifras de comparación directa frente a Veo, Sora u otro específico en el post de lanzamiento. Google no afirmó que Omni venciera a nadie específico. Es una ausencia notable — históricamente Google envía deltas de benchmark el día del lanzamiento cuando tiene cifras favorables, así que el silencio es sugerente más que concluyente.

Precio por generación. YouTube Shorts es gratis; Gemini App está gated por los niveles de suscripción AI Plus / Pro / Ultra, de la misma forma que Gemini 2.5. No hay costo por crédito por segundo publicado todavía. El precio por generación aparecerá cuando se abra la API.

Resolución y frame rate. No especificado. Veo 3 entrega 1080p nativo / ciertas rutas 4K; Kling 3.0 entrega 4K nativo a 60fps; Sora era sólo 1080p antes de ir offline. El techo de resolución de Omni no está en los materiales del lanzamiento.

Esto es un anuncio de lanzamiento, no una hoja de especificaciones. Trata las cifras anteriores como incógnitas conocidas — se irán rellenando en las próximas semanas a medida que Google despliegue la documentación junto con la API.


Las cinco capacidades demostradas

El post de lanzamiento y la página del modelo en DeepMind demuestran juntos cinco categorías distintas de capacidades. Cada una merece entenderse por separado porque implican flujos de producción diferentes.

1. Edición de vídeo con instrucciones en lenguaje natural. Omni puede tomar un clip de vídeo existente como entrada y modificarlo — cambiar el color de un objeto, intercambiar una acción, alterar la iluminación, cambiar el entorno detrás de un sujeto. La demo en la página de lanzamiento muestra un único clip de origen renderizado en varias variantes visualmente distintas a partir de prompts de texto. La significación arquitectónica es que no necesitas un modelo de inpainting separado, un modelo de relighting separado y un modelo de reemplazo de fondo separado. Un modelo, un prompt, un renderizado.

2. Simulación física como tarea de vídeo. Las demos de Omni incluyen trayectorias de canicas en rieles, dinámica de fluidos y otras interacciones físicas renderizadas como vídeos. Es la misma categoría que Sora 2 y Veo 3 empujaron fuerte — la fidelidad física como eje medible de calidad del modelo. Google no publicó una "puntuación física" numérica pero la selección de demos deja clara la posición.

3. Visualización de conceptos complejos. La página de lanzamiento muestra a Omni renderizando ideas abstractas o difíciles de visualizar — la estructura del alfabeto inglés, secuencias de plegado de proteínas, conceptos matemáticos. Es más cercano a un caso de uso educativo que cinematográfico, y es una categoría que Veo y Sora no han puesto en primer plano.

4. Fusión multimodal de referencias. Puedes alimentar a Omni con una referencia de estilo (una imagen), una referencia de movimiento (un clip de vídeo) y un prompt textual, y la salida mezcla las tres. La transferencia de estilo y la transferencia de movimiento han existido como modelos separados durante años (piensa: AnimateDiff, ControlNet); Omni los colapsa en parámetros de prompt sobre un solo modelo.

5. Generación de vídeo de avatares digitales. Las demos del lanzamiento incluyen salidas estilo avatar — vídeos de personajes que mantienen una identidad consistente a través de los fotogramas. Esto se solapa con la capacidad reference-to-video de Kling V3 Omni y los sujetos con identidad bloqueada de Veo 3, pero el encuadre de Google presenta a Omni como más flexible que ambos: cualquier referencia, cualquier duración, cualquier modalidad.

Para cada una de estas, los ejemplos del lanzamiento son cortos — típicamente unos pocos segundos — y el encuadre de "vídeo promocional" hace difícil saber cómo se ven los modos de fallo en producción. No tomes el reel de demos como garantía. Trátalo como un techo superior de lo que es posible cuando Google cura el prompt y la seed.


Dónde puedes usar Omni ahora mismo

Cuatro superficies, tres modelos de precio, una advertencia consistente ("API en las próximas semanas"). Así hay que pensar cada una:

Gemini App (AI Plus / Pro / Ultra). Es la superficie más profunda para exploración casual. Obtienes la interfaz conversacional completa — texto, imágenes, referencias de voz, refinamiento multi-turno — envuelta alrededor del modelo. AI Plus es el nivel de entrada; AI Ultra es el nivel de producción. Si estás probando lo que Omni puede hacer por tu caso de uso específico, aquí es donde hacerlo.

Google Flow. Flow es la herramienta de producción cinematográfica de Google — el mismo producto donde Veo vivía como generador subyacente. Que Omni reemplace a Veo dentro de Flow (o lo aumente; el post de lanzamiento no es específico) significa que cualquiera con acceso a Flow ya tiene acceso a Omni. La superficie del editor de Flow — timeline, control de escena, consistencia de toma — es más orientada a producción que la interfaz de chat de Gemini App. Para trabajo de formato largo o multi-escena, Flow es el punto de entrada correcto.

YouTube Shorts. Gratis. Esta es la sorpresa — los creadores de YouTube obtienen Omni en el punto de subida, dentro del flujo de creación de Shorts. La UX exacta que Google desplegó aquí no está totalmente documentada en el post de lanzamiento; espera que los prompts de generación, las acciones de remix y los flujos de text-to-Short que anteriormente se enrutaban a través de Dream Screen o un pipeline basado en Veo sean servidos por Omni de ahora en adelante. Para creadores que hacen contenido vertical de 60 segundos, esta es la forma más barata de probar Omni — nada que pagar y sin lista de espera.

YouTube Create App. Gratis. La app móvil dedicada de creación de formato corto de Google, separada de YouTube propiamente dicho. Las funciones de Omni aterrizan aquí en paralelo con Shorts.

API para desarrolladores + empresas. Aún no disponible. El post dice "en las próximas semanas". Si tu pipeline de producción depende de acceso programático — webhooks, generación por lotes, flujos multi-usuario — esperas. Estamos rastreando esto de cerca y actualizaremos nuestro blog en el momento en que el endpoint vaya en vivo.

Una consecuencia práctica de esta distribución: durante las próximas semanas, la única forma de evaluar Omni a escala es a través de superficies interactivas — Gemini App, Flow o YouTube. El benchmarking automatizado, las comparaciones lado a lado contra Kling V3 o Veo 3.1 en prompts idénticos y la integración en producción están todos bloqueados al lanzamiento de la API.


Precios y niveles de acceso

Aquí el panorama de precios del día del lanzamiento, extraído de la documentación de suscripción actualmente publicada por Google y del propio post de lanzamiento:

NivelSuperficieCostoAcceso a Omni
YouTube ShortsCreador de Shorts móvil/webGratisIncluido
YouTube Create AppApp móvilGratisIncluido
Gemini App — AI PlusNivel gratuito de Gemini (limitado por tasa)Precio de entrada varía por regiónLimitado
Gemini App — AI ProNivel de pago de GeminiSuscripción, varía por regiónCompleto
Gemini App — AI UltraNivel superior de GeminiSuscripción premiumCompleto, prioritario
Google FlowEmpaquetado con niveles Gemini selectosVinculado a AI Pro / UltraCompleto
API para desarrolladoresAún no abiertaTBD por generación"Próximas semanas"

Google no ha publicado un costo por crédito por segundo para generaciones de Omni en ninguno de los niveles AI Plus / Pro / Ultra. El modelo de precios del lado de Gemini App está empaquetado en la suscripción, no es medido — así que dentro del tope mensual de tu nivel, generas libremente hasta alcanzar el tope.

Para las superficies gratuitas de YouTube, "gratis" es el titular pero el costo implícito es la superficie creativa restringida: YouTube Shorts es un contenedor sólo vertical de menos de 60 segundos, y la UI de prompts está construida para creadores casuales en lugar de pipelines de producción. Gratis es genial para probar Omni; no es donde lanzarías una campaña de marca.

El precio de la API es la incógnita más importante para cualquiera que construya sobre Omni. El precio orientado a desarrolladores de Google en modelos Gemini anteriores ha sido históricamente competitivo frente a OpenAI y Anthropic por millón de tokens para texto; los precios por generación para vídeo han sido más variables. Vigila las páginas de AI Studio y Vertex AI — ahí aparecerá primero.


Gemini Omni vs Veo 3 vs Sora 2 vs Kling vs Seedance — Dónde está el campo

La pregunta interesante no es "¿Omni es bueno?". Las demos de Google se ven bien. La pregunta interesante es dónde se sitúa Omni en el panorama competitivo en el momento del lanzamiento.

Aquí el campo al 22 de mayo de 2026:

Modelo4K nativoMax fpsAudio nativoEntrada multimodalSalida multimodalEstado API
Gemini Omni FlashNo divulgadoNo divulgadoRef. de voz ✅, otros 🕗✅ (texto, imagen, vídeo, audio)Vídeo ahora, imagen/audio "con el tiempo""Próximas semanas"
Google Veo 3.1✅ Nativo24fpsAudio nativo en algunos nivelesTexto, imagenSólo vídeoActivo (Vertex AI)
OpenAI Sora 2❌ Sólo 1080p—NativoTexto, imagenSólo vídeoOffline desde 2026-03-24
Kling Video 3.0 / Omni✅ 4K nativo60fpsNativo (variante Omni)Texto, imagen, audio (Omni)Sólo vídeoActivo
Seedance 2.0❌ Sólo 1080p—❌ (mudo)Texto, imagenSólo vídeoActivo
Runway Gen-4❌ Sólo 1080p—❌Texto, imagenSólo vídeoActivo

Varias conclusiones no obvias.

La afirmación distintiva de Omni es la matriz, no las puntuaciones por celda. Cada otro modelo en esta lista hace generación de vídeo. Ninguno afirma ser una única arquitectura que, con el tiempo, también generará imagen y audio. Si Google envía el resto de la matriz en la línea de tiempo que sugiere, el argumento de venta de Omni no es "mejor modelo de vídeo" — es "un modelo, todas las modalidades, en ambas direcciones". Es una afirmación estructural, no una de benchmark.

En el eje de salida de vídeo, Veo 3.1 y Kling V3 son los competidores inmediatos. Hoy, si necesitas generar un vídeo, Veo y Kling son maduros y probados en combate. Omni es nuevo, no documentado en resolución y bloqueado detrás de superficies interactivas. Para trabajo de producción este mes, Omni es un rastreador, no una herramienta.

Que Sora 2 esté offline es el elefante en la habitación. OpenAI retiró Sora 2 el 24 de marzo de 2026. El vacío dejado por esa retirada es lo que Google está llenando. La sincronización del lanzamiento no es coincidencia.

El slot 4K-60fps sigue siendo ocupado de forma única. Kling V3 es el único modelo en el mercado público hoy haciendo 3840×2160 nativo a 60fps. El techo de resolución de Omni no ha sido anunciado, así que no sabemos si compite aquí o se sienta en la banda de 1080p. Hasta que Google diga, asume que el modo Kling 4K es el líder en resolución.

La salida de audio nativa es parcial. Las referencias de voz están soportadas en Omni en el lanzamiento — significa que puedes alimentar un clip de voz. La generación completa de audio junto al vídeo parece estar todavía en desarrollo. Kling V3 Omni y Veo 3.1 entregan audio nativo (diálogo, ambiente, cues musicales) en su pipeline de generación hoy. Omni todavía no.

Lectura competitiva para mayo 2026: Omni es la arquitectura más ambiciosa del campo, el producto menos probado y el de pista de API más larga aún por enviar. Si eres una empresa comprando para los próximos 18 meses, Omni es la apuesta. Si envías contenido este mes, Veo o Kling es la respuesta.


Por qué la arquitectura "Omni" realmente importa para la generación de vídeo

Quita la copy de lanzamiento y la verdadera historia es arquitectónica. El modelo mental por defecto para vídeo IA — ensamblar un modelo de vídeo, un modelo de sonido, un upscaler y un modelo de lip-sync en un pipeline — es el único modelo que alguien ha enviado a escala hasta la fecha. El enfoque de pipeline tiene debilidades conocidas: cada etapa es una puerta de calidad, los errores se componen, la deriva de identidad se cuela a través de las etapas, y la sincronización audio-vídeo es difícil porque las dos modalidades se generan independientemente y se alinean en post-producción.

Una arquitectura genuinamente unificada — un modelo que representa internamente imagen, vídeo, texto y audio juntos — esquiva todos esos modos de fallo por construcción. La identidad permanece consistente porque no se entrega entre modelos. El audio y el vídeo permanecen sincronizados porque se decodifican juntos. El estilo permanece coherente a través de los fotogramas porque el espacio latente es compartido. En principio.

Si Omni entrega el principio en producción es la pregunta a la que el 22 de mayo de 2026 no puede responder. Las demos de Google sugieren que sí. La afirmación "starting with video" del post de lanzamiento sugiere que la arquitectura unificada aún no está totalmente expresada a través de todas las modalidades de salida — la están enviando en etapas. La evidencia real vendrá en los próximos dos trimestres a medida que se abra la API, aterricen los benchmarks de terceros y los modos de fallo aparezcan en trabajo de producción.

Hay una pregunta relacionada: si Omni está arquitectónicamente unificado, ¿domina a los modelos especializados en cada modalidad? No necesariamente. Un modelo unificado intercambia anchura por profundidad — cada modalidad recibe presupuesto de representación, ninguna modalidad lo recibe todo. Los modelos especializados como Kling V3 (sólo vídeo, entrenamiento pesado en vídeo, 4K-60fps) pueden continuar superando a Omni en métricas de vídeo crudas por un tiempo. La ventaja de Omni no está en un solo eje; está en la anchura de lo que puedes hacer sin abandonar el modelo.

Para constructores en producción, esa es la pregunta a rastrear: ¿la ventaja arquitectónica de Omni supera la brecha de calidad por modalidad relativa a los especialistas? La respuesta depende totalmente de la carga de trabajo. Para un creador haciendo vídeos cortos con prompts mixtos, referencias y ediciones ad-hoc — Omni gana en comodidad. Para una campaña de marca rodando tomas hero a 4K-60fps para un spot de TV — Kling V3 4K probablemente sigue ganando en las métricas que importan, hasta que Omni alcance en resolución.


Cuándo los desarrolladores conseguirán la API (y qué está observando ImagineToVideo)

El post de lanzamiento se compromete a una API para desarrolladores + empresas "en las próximas semanas". Google no ha publicado fecha, SLA, estructura de precios o URL de documentación. Basándose en el precedente establecido por lanzamientos previos de la familia Gemini — 2.5 Flash, 2.5 Pro, familia Nano — la ventana típica entre "acceso a la App activo" y "endpoint Vertex AI activo" ha sido de cuatro a ocho semanas.

Para nosotros en ImagineToVideo, la sincronización de la API es el factor limitante. Hasta que el endpoint de Gemini Omni sea alcanzable sobre HTTPS con un esquema documentado y un límite de tasa, no podemos integrarlo en la plataforma. Una vez lo sea, nuestra hoja de ruta es directa:

  • Phase 1 (semana 1 de la API): Añadir Gemini Omni Flash como opción de modelo en los flujos text-to-video y reference-to-video. El precio se transferirá uno a uno contra la tarifa de Google más nuestro coste de infraestructura estándar.
  • Phase 2: Sacar a la superficie las capacidades específicas de Omni — fusión multi-referencia, edición intra-clip, entrada de referencia de voz — como controles de primera clase en la UI del generador.
  • Phase 3: Ejecuciones de comparación lado a lado contra Kling V3, Veo 3.1 y Seedance 2.0 en los mismos conjuntos de prompts, con los resultados publicados en este blog por transparencia.

Suscríbete al blog de ImagineToVideo o sigue nuestras actualizaciones — publicaremos la integración el mismo día en que el endpoint de la API de Google se abra. Mientras tanto, si quieres empezar a producir vídeo IA en un modelo probado en combate hoy, empieza con Seedance 2.0 para clips de producto, Kling V3 Omni para trabajo multi-toma cinemático, o el modo Kling 4K para tomas hero de calidad broadcast.


Preguntas frecuentes

¿Qué es Gemini Omni y en qué se diferencia del Gemini normal?

Gemini Omni es una nueva familia de modelos de Google DeepMind, distinta del linaje texto/chat de Gemini. La variante actualmente lanzada es Gemini Omni Flash. La diferencia arquitectónica central es que Omni está construido desde cero para entrada multimodal y salida multimodal — texto, imagen, vídeo y audio en ambas direcciones — mientras que los modelos Gemini anteriores aceptaban entrada multimodal pero estaban especializados a la salida de texto. En el lanzamiento, Omni genera vídeo; la salida de imagen y audio está marcada como capacidades futuras por Google DeepMind.

¿Es gratuito usar Gemini Omni?

Parcialmente. Puedes usar Omni gratis dentro de YouTube Shorts y la app YouTube Create, ambas incluyen el modelo sin coste adicional para creadores. Dentro de Gemini App, Omni está gated detrás de los niveles de suscripción AI Plus, Pro o Ultra. La API independiente para desarrolladores todavía no está disponible; los precios se anunciarán cuando se abra el endpoint.

¿Cuándo estará Gemini Omni disponible en ImagineToVideo?

Estamos rastreando de cerca el lanzamiento de la API para desarrolladores. Google se ha comprometido a "próximas semanas" para la API. Una vez en vivo, nuestro calendario de integración es del orden de días — ya tenemos la infraestructura de la plataforma para añadir nuevos modelos de vídeo, y Omni estará disponible en nuestros flujos text-to-video y reference-to-video poco después de la apertura del endpoint. Suscríbete al blog para el anuncio de integración.

¿En qué se diferencia Gemini Omni de Veo 3?

Veo es la generación anterior de modelo de vídeo de Google y el motor subyacente en Google Flow antes de Omni. Veo acepta entradas de texto e imagen y genera vídeo, incluyendo audio nativo en algunos niveles. La ambición declarada de Omni es más amplia: entrada desde cualquier modalidad, salida hacia cualquier modalidad. En la práctica hoy, ambos generan vídeo, y las diferencias en resolución, frame rate y salida de audio aún se están estableciendo. Dentro de Google Flow específicamente, Omni parece reemplazar o aumentar el rol de Veo — el post de lanzamiento no traza la línea exacta entre ellos.

¿Reemplazará Gemini Omni a Sora?

Sora 2 se desconectó el 24 de marzo de 2026, así que la comparación no es directa. Algunos flujos de producción que usaban Sora 2 antes de su retirada migraron a Kling V3 y Seedance 2.0; Omni es ahora un tercer objetivo de migración para esos flujos. Si Omni se convertirá en el reemplazo de facto depende de cómo aterricen los precios y la calidad de la API en relación con las alternativas existentes.

¿Soporta Gemini Omni prompts en español?

El codificador de texto de Gemini ha soportado español (y docenas de otros idiomas) durante varias generaciones de modelos. El post de lanzamiento no enumera explícitamente qué idiomas soporta la interfaz de prompt para Omni específicamente, pero el linaje arquitectónico sugiere cobertura multilingüe amplia. Prueba en Gemini App con tu idioma específico — es la forma más rápida de confirmarlo.

¿Puedo usar Gemini Omni para trabajo comercial?

Los términos de licencia para las salidas de Omni siguen los términos estándar de la superficie que estás usando. Las salidas de YouTube se rigen por los términos comerciales de YouTube. Las salidas de Gemini App se rigen por los términos AI Plus / Pro / Ultra de Google — que generalmente permiten uso comercial, con las habituales precauciones sobre contenido generado por modelo. Para producción comercial empresarial o de alto volumen, espera la API + nivel empresarial donde los términos se escriben explícitamente para despliegue en producción.

¿Es Gemini Omni lo mismo que Gemini 3?

No. Gemini Omni es su propia familia de modelos con su propia línea de nombres (Flash, con Pro/Ultra implícito pero sin anunciar), paralela al linaje principal de chat de Gemini. Google no ha declarado cómo se relaciona el entrenamiento de Omni con un hipotético Gemini 3, y los materiales del lanzamiento tratan a los dos como líneas de producto separadas.


Conclusión

Gemini Omni es la apuesta arquitectónica más ambiciosa que cualquiera en vídeo IA ha hecho este año. La promesa de un modelo para cada modalidad, en ambas direcciones, es estructuralmente diferente del enfoque de pipeline que definió 2024 y 2025. Si Google envía el resto de la matriz — salida de imagen, salida de audio, contexto más largo — en la línea de tiempo que sugiere, todo el modelo mental de "qué herramienta de vídeo IA uso" se reescribe.

La promesa es la noticia del 19 de mayo de 2026. La prueba es el lanzamiento de la API en "próximas semanas", seguido de meses de benchmarking de terceros. Trata a Omni como un rastreador hoy, no una herramienta. Kling V3, Veo 3.1 y Seedance 2.0 siguen siendo las respuestas correctas para trabajo de producción este mes — están documentados, con precio, integrados y operando a escala.

Para todos los que envían contenido esta semana: sigue usando lo que funciona. Para todos los que están construyendo para los próximos 18 meses: suscríbete a la lista de espera de la API, vigila la documentación de AI Studio y Vertex AI, y planifica un trimestre donde puedas ejecutar benchmarks lado a lado en el momento en que el endpoint se abra.

Si quieres empezar a producir vídeo IA en un modelo probado en combate ahora mismo mientras esperamos Omni:

→ Prueba Seedance 2.0 para clips de producto y referencia rápidos (~1 $ por clip de 5 segundos, 720p)

→ Prueba Kling V3 Omni para trabajo multi-toma cinemático con audio nativo (secuenciación multi-toma, lip-sync)

→ Prueba el modo Kling 4K para tomas hero de calidad broadcast (3840×2160 nativo a 60fps)

Publicaremos la integración de Gemini Omni en ImagineToVideo el mismo día que el endpoint de la API de Google se ponga en vivo. Hasta entonces — mantén un ojo en este blog y sigue enviando contenido.

Artículos relacionados