Escenas de estudio: unión de videos de varias escenas
Escenas de estudio: pestaña de sección "Avatares de vídeo", donde el video se ensambla como un montaje: agrega varias escenas completas (una escena con un avatar parlante, una imagen o un fragmento de video terminado), establece el orden y la configuración general, y la sección los combina en un archivo de video. Esto es conveniente cuando no necesita un video corto de una foto, sino un video completo: un avatar representa el producto, las diapositivas y las imágenes muestran detalles y los clips agregan dinámica. A continuación se detallan las escenas a partir de las cuales se ensambla todo, qué configurar antes del lanzamiento, cómo seguir los pasos y cuánto cuesta. La herramienta se abre en una pestaña. Escenas de estudio.

¿Qué son las escenas de estudio?
Escenas de estudio: un creador de vídeos a partir de fotogramas completados individuales. Cada escena es un fragmento independiente del vídeo futuro: un avatar que habla con voz o audio, una imagen con voz en off o una pausa silenciosa, o un clip terminado. Organiza las escenas en el orden deseado, elige la resolución general y la relación de aspecto y obtiene un único MP4, donde los fragmentos aparecen uno tras otro. Sin edición en un programa de terceros: la sección se encarga de mezclar fotogramas, locuciones y empalmes.
¿De qué escenas está hecho el video?
- El avatar habla. Seleccione un avatar del catálogo, ingrese texto de hasta 5000 caracteres o adjunte una grabación de audio ya preparada, seleccione una voz (puede escucharla antes de iniciar) y, si lo desea, configure un mensaje de movimiento para los avatares fotográficos.
- Imagen. Sube una imagen o pega un enlace. La escena puede tener voz (texto o audio) o puede estar en silencio: luego especificas cuántos segundos dura en la pantalla.
- Acortar. Proporcione un enlace al fragmento de video terminado y, si es necesario, agréguele voz en off o texto.
Puede haber de una a cincuenta escenas en un vídeo. El orden se cambia con un botón, las escenas innecesarias se eliminan: cree exactamente el guión que necesita.
Qué configurar antes del lanzamiento
- Título del vídeo - El pegamento aparecerá debajo en la historia.
- Relación de aspecto: 16:9 para YouTube, 9:16 para Shorts, Reels y TikTok, 1:1 para feed, así como 4:5, 5:4 y automático.
- Permiso: 720p, 1080p o 4K.
- Orden y composición de escenas. — las escenas se mueven hacia arriba, las innecesarias se eliminan.
Cómo montar un vídeo: paso a paso
- Abierto Pestaña "Escenas de estudio" en la sección "Avatares de vídeo" e inicia sesión en tu cuenta.
- Establece el título, la relación de aspecto y la resolución.
- Recopile la primera escena: seleccione su tipo (un avatar parlante, una imagen o un clip) y complete los campos. Para una escena de avatar, seleccione un avatar, una voz e ingrese texto o adjunte audio; para una imagen, cargue un archivo o pegue un enlace; para el clip, inserte un enlace al vídeo.
- Agregue las siguientes escenas usando el botón "Agregar escena" y organícelas en el orden deseado.
- Consulta el precio en tokens: se muestra antes del lanzamiento.
- Haga clic en "Combinar vídeo". El vídeo aparecerá en el bloque “Mis vídeos de estudio” con estado pendiente y se actualizará solo.
- Cuando el vídeo está listo, se reproduce directamente en la tarjeta y se descarga con un solo botón.
¿Cuánto cuesta pegar?
El pago se realiza en tokens, sin suscripción: los nuevos usuarios reciben tokens iniciales al registrarse y luego el saldo se repone con la cantidad requerida. El precio es visible antes del lanzamiento y consta de partes pagas: las escenas con un avatar que habla se cuentan por segundo, la actuación de voz para escenas de texto se cuenta por la duración del discurso; Las imágenes mudas y los clips no se cobran por separado. Lo que se muestra en la interfaz es lo que se cancelará. Si el pegado falla, las fichas se devuelven a la balanza automáticamente.
¿Cuándo será útil?
- Presentación del producto: el avatar habla, y entre sus comentarios hay diapositivas, fotografías y fragmentos de filmaciones.
- Vídeo de entrenamiento: La teoría del presentador se reemplaza por imágenes visuales.
- Promoción del material terminado: Los clips se recopilan en un vídeo con la voz en off del avatar.
- Serie vertical: El mismo escenario en 9:16 para las redes sociales.
- Contenido habitual: un avatar y una estructura de escena probada: publicación rápida de nuevos videos.
¿En qué se diferencia de las pestañas vecinas?
"Avatars and Generation" crea un video a partir de un avatar y texto, "Video Agent" ensambla un video a partir de una descripción de texto de la tarea, HyperFrames genera animaciones HTML y las escenas de Studio son un montaje del director: usted decide qué cuadros y en qué orden se incluirán en el video y cómo sonará cada escena.
Vinculación con otras pestañas
Los materiales de escena son fáciles de sostener. "Mediatek", lea el texto en la pestaña "Voz en off de texto" o en tu propia voz "Clonación de voz", y el video terminado se traduce a otros idiomas en "Traducción de vídeos" y cortar en trozos cortos "Corte de clips".
Preguntas frecuentes
¿Cuántas escenas se pueden combinar en un video?
Del uno al cincuenta. Cada escena es un fotograma completo independiente: un avatar, una imagen o un clip parlante; El orden de las escenas se puede cambiar.
¿En qué se diferencian las escenas de Studio de Avatars y Generation?
En la pestaña "Avatares y generación", obtienes un video de un avatar, una foto y un texto. Las escenas de estudio reúnen un vídeo a partir de varias escenas independientes y le permiten alternar entre un avatar parlante, imágenes y videoclips ya preparados.
¿Cómo se calcula el precio?
El precio es visible antes del lanzamiento: las escenas con un avatar parlante y actuación de voz para escenas de texto se cuentan por segundo; Las imágenes y clips silenciosos no se cobran por separado. Si hay un error, los tokens se devuelven al saldo.
¿Puedo usar mis propios videos, imágenes y audio?
Sí. Las imágenes y los clips se agregan mediante carga o enlace, y puede adjuntar su propio audio a la escena y la imagen del avatar en lugar de síntesis de voz.