← Todos los artículos

Gemini Omni (también conocido como Google Omni y Veo Omni): vídeos con personajes, voz y 4K

Gemini Omni - generación de vídeo multimodal

Brevemente sobre lo principal (BLUF)

Gemini Omni, Google Omni y Veo Omni son tres nombres de una modelo de video: mantiene un héroe en todos los videos, les da voz y da hasta 4K. Averigüemos qué hay detrás de la palabra "Omni", cuánto cuesta la generación y por dónde empezar.

Este modelo tiene tres nombres y probablemente te hayas encontrado con los tres: Gemini Omni, Google Omni Y Veo Omni. Algunos lo llaman por familia Gemini, otros por línea de video Veo, otros simplemente "omni": estamos hablando de la misma red neuronal para generar video. Ella trabaja para nosotros en Sección "Vídeo", y puedes ejecutarlo sin suscripción, con pago por una generación específica.

¿Qué hay detrás de la palabra "Omni"?

Un modelo de vídeo normal acepta texto o una imagen. Aquí la entrada es mixta: una descripción de texto más hasta siete imágenes, vídeo o audio como contexto adicional. Necesita un video con el espíritu de un cuadro específico y con el tono de una melodía específica; tráigalo todo a la vez, el modelo tendrá en cuenta cada fuente.

Esto cambia la formulación misma del problema. En lugar del párrafo “imagina una casa como esta, la luz así”, muestras una fotografía de la casa y solo describe la acción con palabras. El texto es responsable de la trama, los archivos adjuntos son responsables de la apariencia.

Personajes: un héroe en todos los videos.

El principal problema de los generadores convencionales es que el héroe cambia de vídeo en vídeo. En Gemini Omni hay una pestaña de personaje separada para esto: un héroe se crea una vez, se guarda en tu biblioteca y luego se conecta a cualquier generación con un solo clic. La apariencia se mantiene constante de un video a otro.

Así está montada la serie: un presentador virtual de una columna, una mascota de la marca, un personaje de cuentos infantiles. No es necesario volver a cargar referencias cada vez y esperar que el modelo "recuerde" la cara.

Entrada mixta: texto, imagen y sonido en una generación

Voz: ajustes preestablecidos ya preparados y los tuyos propios

El vídeo puede salir inmediatamente con sonido. Los escenarios tienen un conjunto de voces ya preparadas: masculinas y femeninas, desde suaves altas hasta bajas con ronquera. Eliges una voz, escribes una línea en la descripción y el personaje habla directamente en el cuadro. Si los ajustes preestablecidos no son adecuados, su propia voz se crea en la pestaña de audio basándose en la base: también termina en su biblioteca personal. Esta es una forma de que la marca tenga una voz reconocible detrás de todos sus videos.

Hasta 4K, duración y formato de fotograma

Este es uno de los pocos modelos en el sitio con salida 4K: 720p, 1080p y 4K están disponibles. Duración: 4, 6, 8 o 10 segundos, cuadro horizontal 16:9 o vertical 9:16 para redes sociales. La ruta práctica es sencilla: ejecutar borradores a 720p y una buena opción es reiniciar a 1080p o 4K.

Cuánto cuesta

El precio depende de la duración, la calidad y de si envías un vídeo como entrada, y siempre se muestra en el formulario antes del lanzamiento; verás el importe antes de hacer clic en el botón. No hay suscripción: pagas por un vídeo específico del saldo general, puedes recargarlo con una tarjeta rusa. Un borrador de cuatro segundos a 720p cuesta significativamente menos que uno de diez segundos 4K, por lo que probar una idea es más barato que filmar el final de inmediato.

Por donde empezar

  1. Abierto página modelo y haz el primer video a partir de un texto; de esta manera sentirás cómo ella lee las descripciones.
  2. Agregue una imagen de referencia: deje que las palabras representen la acción y la imagen represente la apariencia de la escena.
  3. Incluye una voz y una línea si alguien habla en el cuadro.
  4. Obtén un personaje permanente cuando necesites una serie de videos con un héroe.

Al describir una escena, mantenga el orden: quién está en el cuadro, qué está haciendo, dónde está sucediendo, cómo se comporta la cámara. Envíe su respuesta en una oración separada. Esta estructura casi siempre produce un vídeo coherente en el primer o segundo intento.

Está buscando un modelo por nombre Google Omni o Veo Omni; esto es lo mismo: Gemini Omni disponible aquí. Cerca, en Sección "Vídeo", hay otros modelos de vídeo si quieres comparar.

Entrada mixta: texto, imagen y sonido en una sola generación
混合输入:在一次生成中使用文本、图像和声音

Preguntas frecuentes (FAQ)

Pregunta: ¿Cómo obtener el mejor resultado de una red neuronal?
Respuesta: Utilice indicaciones detalladas (descripciones) en inglés, establezca el estilo y los detalles de la escena.

Pregunta: ¿Se pueden utilizar estos materiales con fines comerciales?
Respuesta: Sí, el contenido generado es totalmente tuyo.