Bottom Line Up Front (BLUF): Un mapa de profundidad es una copia en blanco y negro de un cuadro donde el brillo muestra la distancia a la cámara: los objetos cercanos son más claros, el fondo se vuelve negro. Esta herramienta crea uno a partir de su video o imagen de forma gratuita y completamente en su propio dispositivo: el archivo nunca se carga, no se cobran tokens y no hay ningún API de pago detrás. El modelo Depth Anything V2 Small se ejecuta directamente en el navegador, por lo que puede ver el resultado a medida que se realiza y el video terminado se descarga como MP4 o WebM.
Un mapa de profundidad es el mismo cuadro redibujado en tonos de gris según la distancia a la cámara. Cuanto más cerca está un objeto, más claro es el píxel; el fondo se vuelve negro. Sin texturas, sin piel, sin rostros: sólo la geometría y el relieve de la escena.
Lo necesitas en dos casos. En primer lugar, para superar los filtros de generación de vídeo: modelos como Seedance rechazan rostros y fotogramas de película reconocibles, mientras que un mapa de profundidad no tiene nada que comprobar: no hay rostros en él. En segundo lugar, para transferir el movimiento de la cámara: un mapa de profundidad muestra dónde se movió la cámara y cómo estaban los objetos, y el modelo dibuja su propia escena con el mismo movimiento.
La herramienta nunca envía su archivo a nuestro servidor ni al de nadie más. El modelo Depth Anything V2 Small (licencia Apache 2.0) se carga en el navegador una vez y luego se sirve desde la memoria caché, y el cálculo se ejecuta en su tarjeta gráfica a través de WebGPU. Si WebGPU no está disponible, se activa un respaldo de CPU: más lento, pero funciona en todas partes.
Los fotogramas de vídeo se decodifican con WebCodecs, cada uno se convierte en un mapa de profundidad y luego todo se vuelve a ensamblar en un vídeo con la velocidad de fotogramas original y la resolución más alta que su navegador pueda manejar. La salida es MP4 o WebM, cualquiera que sea compatible con su sistema. No se cobran tokens por este modelo: no hay ninguna solicitud paga.
Puedes procesar tanto un vídeo como una sola imagen. Elija un archivo con el botón o arrástrelo directamente a la ventana. Los formatos inusuales como HEIC, AVIF o TIFF se convierten automáticamente; al igual que en el resto del sitio, nada está bloqueado por formato.
Para una imagen, el resultado es PNG en la resolución original; para un vídeo, es un clip con la misma velocidad de fotogramas. La vista previa es visible durante el procesamiento: los fotogramas aparecen cuando están listos, no sólo después de ensamblar el archivo. Un largo plazo puede cancelarse.
De forma predeterminada, el mapa de profundidad es blanco y negro con el primer plano brillante. El interruptor casi oscuro invierte la escala: a veces los pequeños detalles se leen mejor de esa manera. Para mayor claridad, existen mapas de colores, Inferno y Viridis: pintan la distancia como un degradado y te ayudan a ver los planos donde el gris se mezcla.
La resolución apenas afecta la velocidad: el modelo siempre calcula un cuadro a una resolución fija de 518×518, y la resolución solo importa cuando se ensambla el video terminado. La verdadera palanca es el número de fotogramas, por lo que un clip largo en la CPU es lento: un minuto de fuente puede tardar varios minutos.
Necesita un navegador moderno: Chrome o Edge. En una computadora portátil débil, no comience con 4K: comience con un clip corto, verifique el resultado y luego tome un archivo más grande.
Elija marcos con geometría clara: una calle, un interior, una persona en toda su altura. Los cambios bruscos de planos y los movimientos de la cámara se transfieren mejor. Si necesita el mapa para generarlo, hágalo primero y luego introdúzcalo en el modelo junto con su propia descripción de la escena.
Correcto. El modelo y sus pesos se cargan en el navegador y el cálculo se ejecuta en su dispositivo. Los videos e imágenes nunca se envían a ninguna parte y no hay API de pago en este modelo.
Nada. No se cobran tokens por un mapa de profundidad: el trabajo se realiza en su computadora, no en nuestro servidor.
La velocidad depende de la cantidad de fotogramas y de si tienes WebGPU. En la CPU, un clip largo lleva mucho más tiempo; pruebe con un clip corto o una sola imagen.
Sí, la herramienta también acepta imágenes: la salida es PNG con la resolución original.
MP4 (H.264) o WebM, cualquiera que sea compatible con su navegador. Se conserva la velocidad de fotogramas original.