Bottom Line Up Front (BLUF): Una mappa di profondità è una copia in bianco e nero di un fotogramma in cui la luminosità mostra la distanza dalla fotocamera: gli oggetti vicini sono più chiari, lo sfondo sfuma in nero. Questo strumento ne crea uno dal tuo video o dalla tua immagine gratuitamente e interamente sul tuo dispositivo: il file non viene mai caricato, non vengono addebitati token e non c'è alcun API a pagamento dietro di esso. Il modello Depth Anything V2 Small viene eseguito direttamente nel browser, quindi puoi vedere il risultato così come è stato realizzato e il video finito viene scaricato come MP4 o WebM.
Una mappa di profondità è la stessa cornice ridisegnata in sfumature di grigio in base alla distanza dalla fotocamera. Più un oggetto è vicino, più leggero sarà il pixel; lo sfondo diventa nero. Nessuna trama, nessuna pelle, nessun volto: solo la geometria e il rilievo della scena.
Ne hai bisogno in due casi. Innanzitutto, per superare i filtri di generazione video: modelli come Seedance rifiutano volti e fotogrammi riconoscibili, mentre una mappa di profondità non ha nulla da controllare: non ci sono volti al suo interno. In secondo luogo, trasferire il movimento della telecamera: una mappa di profondità mostra dove si è mossa la telecamera e come si trovavano gli oggetti, e il modello disegna la propria scena con lo stesso movimento.
Lo strumento non invia mai il tuo file al nostro server o a quello di chiunque altro. Il modello Depth Anything V2 Small (licenza Apache 2.0) viene caricato nel browser una volta e viene quindi servito dalla cache e il calcolo viene eseguito sulla scheda grafica tramite WebGPU. Se WebGPU non è disponibile, entra in azione un fallback della CPU: più lento, ma funziona ovunque.
I fotogrammi video vengono decodificati con WebCodec, ognuno diventa una mappa di profondità e quindi tutto viene assemblato in un video con la frequenza fotogrammi originale e la risoluzione più alta che il tuo browser può gestire. L'output è MP4 o WebM, a seconda di quale sia supportato dal tuo sistema. Per questo modello non vengono addebitati token: non è prevista alcuna richiesta a pagamento.
È possibile elaborare sia un video che una singola immagine. Scegli un file con il pulsante o trascinalo direttamente nella finestra. I formati insoliti come HEIC, AVIF o TIFF vengono convertiti automaticamente, proprio come altrove nel sito, nulla è bloccato dal formato.
Per un'immagine il risultato è un PNG alla risoluzione originale; per un video si tratta di una clip con lo stesso frame rate. L'anteprima è visibile durante l'elaborazione: i fotogrammi appaiono così come sono pronti, non solo dopo che il file è stato assemblato. Una corsa lunga può essere annullata.
Per impostazione predefinita, la mappa di profondità è in bianco e nero con il primo piano luminoso. L'interruttore quasi scuro capovolge la scala: a volte i piccoli dettagli si leggono meglio in questo modo. Per chiarezza ci sono le mappe di colore, Inferno e Viridis: dipingono la distanza come un gradiente e aiutano a vedere i piani dove il grigio si fonde insieme.
La risoluzione influisce a malapena sulla velocità: il modello calcola sempre un fotogramma a 518×518 fissi e la risoluzione conta solo quando viene assemblato il video finito. La vera leva è il numero di fotogrammi, quindi una clip lunga sulla CPU è lenta: un minuto di sorgente può richiedere diversi minuti.
Hai bisogno di un browser moderno: Chrome o Edge. Su un laptop debole non iniziare con 4K: inizia con una breve clip, controlla il risultato, quindi prendi un file più grande.
Scegli montature con geometrie chiare: una strada, un interno, una persona a tutta altezza. I bruschi cambiamenti di piani e il movimento della telecamera vengono trasferiti meglio. Se hai bisogno della mappa per la generazione, creala prima e poi inseriscila nel modello insieme alla descrizione della scena.
Corretto. Il modello e i suoi pesi vengono caricati nel browser e il calcolo viene eseguito sul tuo dispositivo. Video e immagini non vengono mai inviati da nessuna parte e in questo modello non è previsto il pagamento API.
Niente. Per una mappa di profondità non vengono addebitati token: il lavoro avviene sul tuo computer, non sul nostro server.
La velocità dipende dal numero di frame e dalla presenza o meno di WebGPU. Sulla CPU una clip lunga richiede molto più tempo: prova una clip breve o una singola immagine.
Sì, lo strumento accetta anche immagini: l'output è un PNG alla risoluzione originale.
MP4 (H.264) o WebM, a seconda di quale browser sia supportato. Il frame rate originale viene mantenuto.