← Todos los artículos

Gemini Omni Video: lo que puede hacer el modo de vídeo en tiempo real de Google

Gemini Omni Video: lo que puede hacer el modo de vídeo en tiempo real de Google

La versión corta (BLUF)

Gemini Omni es el modo de vídeo en tiempo real de Google: apunta la cámara y el modelo explica, traduce o depura lo que ve en directo. De dónde viene la palabra "Omni", qué hace realmente el modelo con el vídeo y qué debe saber un usuario ruso.

La semana pasada, un colega me envió un vídeo: alguien muestra su guardarropa en una transmisión en vivo mientras Gemini comenta sobre la ropa en tiempo real y sugiere outfits. Primer pensamiento: "otra demostración que nunca funciona en la vida real". Pensándolo bien, después de probarlo: funciona. No perfectamente, pero funciona.

Gemini Omni Live mode: the model watches a camera feed in real time and answers questions about what is in the frame, latency around 300 ms

De dónde viene la palabra "Omni"

"Omni" significa "todo a la vez". Al igual que GPT-4o (omni), Gemini ahora tiene un modo en el que el modelo trabaja con texto, voz, imágenes y vídeo simultáneamente. No uno tras otro. No "enmarcar primero, responder después". Como un arroyo.

Específicamente, Gemini Omni Video puede tomar una señal de cámara en vivo y reaccionar a lo que sucede en tiempo real. Nombra objetos. Leer texto en pantalla. Responda preguntas sobre lo que hay en el marco en este momento.

Técnicamente esta es la API en vivo multimodal. La transmisión de vídeo llega a los servidores de Google, el modelo la procesa y responde con un retraso de 200 a 400 ms. Eso ya se siente como una conversación, no como una solicitud y respuesta.

Lo que realmente hace el modelo con el video

Vale la pena separar tres cosas diferentes:

  • Analizando un video subido– colocas un clip y le pides que describa el metraje o encuentre un momento específico. Esto ya funcionó en 2024.
  • Modo en tiempo real— la modelo mira a través de la cámara contigo. Esto es fundamentalmente diferente.
  • Generación de vídeo— aquí Google lanzó Veo 3 por separado; esa es otra historia y otra herramienta.

En el modo Omni Live, puedes apuntar tu teléfono a un panel eléctrico roto y preguntar "qué pasa", y obtener una respuesta casi al instante, sin esperas de carga. O muestre un plato en un restaurante y conozca sus ingredientes aproximados. O muestre el código en su monitor y obtenga comentarios de inmediato.

Honest comparison for a user in Russia: Gemini Omni Live needs a VPN and a foreign card; NeuralSpace works in rubles without a VPN for analyzing and generating video

Un caso real: depurando código a través de la cámara

Uno de los escenarios más prácticos es transmitir la pantalla mientras se depura. Abra Google AI Studio, active el modo de video, muestre su IDE. Pregunte: "¿por qué es nulo aquí?" — el modelo ve el seguimiento de la pila real y responde al grano.

Trabajé así con un script de Python durante unos veinte minutos. Baja latencia, respuestas puntuales. El único inconveniente: después de 20 minutos, el teléfono empezó a calentarse, así que cambié a una computadora portátil.

También funciona bien con documentos. Coloque una hoja de papel frente a la cámara, haga preguntas: el modelo lee el texto y responde. A veces tropieza con fuentes inusuales, pero la precisión en general es decente.

¿Dónde está el truco?

Déjame ser honesto acerca de lo que es molesto.

Primero: acceso. Gemini 2.0 con Omni Video se encuentra en Google AI Studio y en la aplicación con la suscripción Avanzada. Hay un juicio. Después de eso, pagas. No puedes agregar una tarjeta bancaria rusa. Se necesita una VPN no sólo para registrarse, sino también para que la transmisión se ejecute de manera estable.

Segundo: privacidad. Cuando transmites un vídeo a Google, va a alguna parte. La empresa dice "no lo almacenamos", pero eso es algo que se toma por confianza.

Tercero: límites de sesión. No puedes mirar para siempre; Hay límites en la longitud de la corriente. Y la calidad disminuye notablemente si la conexión es deficiente.

Lo que debe hacer un usuario ruso

Dos caminos.

El primero: VPN + Google AI Studio. Funciona, pero con dolores de cabeza: necesitas una conexión estable, una tarjeta no rusa y, a veces, la sesión simplemente se cae.

El segundo: crear una pila de trabajo a partir de las herramientas disponibles.Espacio neuronalreúne servicios de IA con pago en rublos, sin VPN y sin tarjetas extranjeras. Para vídeo haygeneración de vídeo— no Omni Live, pero sí suficiente para la mayoría de las tareas. Más unchatear con modelos multimodales, trabajo de imagenyherramientas de voz.

Si necesita específicamente "Miro a la cámara y hablo en tiempo real", ningún servicio ruso tiene ese formato todavía. Es genuinamente una innovación de Google. Pero si la tarea es "analizar material de video" o "generar contenido de video", las herramientas domésticas también se encargan de ello y usted puederegistroallí ahora mismo sin una VPN.

Qué elegir depende de la tarea. Y sobre cuánto está dispuesto a jugar con una VPN para una demostración de 20 minutos.

Preguntas frecuentes (FAQ)

P: ¿Cómo obtengo el mejor resultado de la IA?
R: Utilice indicaciones detalladas (descripciones) en inglés; especificar detalles de estilo y escena.

P: ¿Puedo utilizar este contenido comercialmente?
R: Sí, todo el contenido generado te pertenece exclusivamente.