← सभी लेख

Seedance 2.5 के लिए गहराई का नक्शा: फेस ब्लॉकिंग को कैसे बायपास करें

फ़्रेम को आधे में विभाजित किया गया है: बाईं ओर एक नियमित वीडियो है, दाईं ओर इसका वास्तविक काला और सफेद गहराई वाला नक्शा है

Seedance 2.5 अगर फ्रेम में कोई पहचानने योग्य चेहरा या किसी और की फिल्म का टुकड़ा हो तो वह काम करने से इंकार कर देता है। इस तरह से कंपनी मशहूर हस्तियों की नकल के खिलाफ लड़ती है, लेकिन बात आम लोगों की आती है: एक मॉडल कभी-कभी आपकी खुद की सेल्फी को भी अस्वीकार कर देती है। एक समाधान है, और यह हैकिंग के बारे में नहीं है। मॉडल आसानी से गहराई के नक्शे से गुजरता है - एक काली और सफेद तस्वीर जहां चमक कैमरे से दूरी दिखाती है। इस पर कोई चेहरे नहीं हैं, केवल दृश्य की ज्यामिति है। नीचे बताया गया है कि ब्राउज़र में ही अपने वीडियो से मुफ्त में ऐसा मानचित्र कैसे बनाया जाए, और यदि पीढ़ी अभी भी गिरती है तो क्या करें।

एक मॉडल किसी सेलिब्रिटी को वहां क्यों देखती है जहां कोई नहीं है?

फ़िल्टर Seedance को चेहरों पर प्रशिक्षित किया जाता है। उनका कार्य सरल है: किसी प्रसिद्ध व्यक्ति की उपस्थिति को नकली होने से रोकना। समस्या यह है कि वे "प्रसिद्धि" को चेहरे की ज्यामिति से परिभाषित करते हैं, न कि क्रेडिट में नाम से। एक जैसी आंख का आकार, एक जैसी ठोड़ी का आकार - और बस, इनकार।

फ़िल्म फ़ुटेज के साथ यह और भी आसान है: कॉपीराइट सुरक्षा वहां काम करती है। मॉडल दृश्य को पहचानता है और इसे पूरी तरह से मिस नहीं करता है, भले ही आप केवल कैमरा मूवमेंट को दोहराना चाहते हों।

परिणाम: दो अलग-अलग निषेध, लेकिन यह एक जैसा दिखता है - एक लाल गलती और समय की बर्बादी।

गहराई का नक्शा: चेहरों के बजाय ज्यामिति

गहराई का नक्शा वही वीडियो है, जिसे केवल ग्रेस्केल में दोबारा बनाया गया है। वस्तु कैमरे के जितनी करीब होगी, पिक्सेल उतना ही चमकीला होगा। पृष्ठभूमि काली हो जाती है, पृष्ठभूमि सफेद हो जाती है। कोई बनावट नहीं, कोई त्वचा नहीं, कोई आंखें नहीं: जो कुछ बचा है वह दृश्य की राहत है।

यह फ़िल्टर के लिए एक प्रमुख बिंदु है. जांचने के लिए कुछ भी नहीं है - कोई चेहरे नहीं हैं। और पीढ़ी के लिए आपकी ज़रूरत की हर चीज़ मौजूद है: वस्तुएँ कहाँ थीं, कैमरा कहाँ जा रहा था, योजना कैसे बदल गई। हम किसी और के फ्रेम की नकल नहीं करते हैं, हम उसकी गति और व्यवस्था लेते हैं, और मॉडल खरोंच से अपनी तस्वीर खुद बनाती है।

सीमा के बारे में ईमानदारी से: यह "सबकुछ बायपास बटन" नहीं है। यदि आप तुरंत सीधे किसी विशिष्ट अभिनेता का चेहरा मांगते हैं, तो फिर से इनकार कर दिया जाएगा। गहराई का नक्शा ज्यामिति और गति की समस्या को हल करता है, व्यक्तित्व प्रतिस्थापन को नहीं।

बाईं ओर मूल वीडियो फ़्रेम है, दाईं ओर इसका गहराई मानचित्र है: चमक कैमरे से वस्तुओं तक की दूरी दिखाती है

वीडियो से गहराई का नक्शा कैसे बनाएं - मुफ़्त और सर्वर पर अपलोड किए बिना

हमारी वेबसाइट पर यह वीडियो अनुभाग में एक अलग मॉडल है: गहराई का नक्शा (मुक्त). यह MiniMax के अंतर्गत मॉडलों की सूची में है। आप एक वीडियो चुनते हैं, एक बटन दबाते हैं, और हर चीज़ की गणना आपके डिवाइस पर की जाती है।

अंदर क्या है: मॉडल Depth Anything V2 Small (लाइसेंस Apache 2.0) सीधे ब्राउज़र में ONNX Runtime Web के माध्यम से चलता है। यदि आपके पास WebGPU है, तो वीडियो कार्ड मायने रखता है, यदि नहीं, तो प्रोसेसर पर बैकअप पथ काम करता है। फ़्रेम को WebCodecs के माध्यम से पार्स किया जाता है, फिर मूल FPS और आपके ब्राउज़र द्वारा संभाले जा सकने वाले अधिकतम रिज़ॉल्यूशन के साथ वीडियो में वापस इकट्ठा किया जाता है।

आउटपुट MP4 या WebM है - जो ब्राउज़र समर्थन करता है। परिणाम का एक पूर्वावलोकन है, एक स्विच "करीब - हल्का / करीब - गहरा" और पैलेट: ग्रे रंग, Inferno, Viridis। प्रसंस्करण प्रगति फ्रेम दर फ्रेम दिखाई देती है; लंबी प्रक्रिया को रद्द किया जा सकता है.

दो चीजें जो सबसे ज्यादा मायने रखती हैं. पहला: फ़ाइल कहीं भी नहीं जाती - न तो हमारे सर्वर पर, न ही किसी और के पास, सारा काम डिवाइस पर होता है। दूसरा: इसके लिए टोकन बट्टे खाते में नहीं डाले जाते; इस मॉडल में कोई सशुल्क एपीआई नहीं है। मॉडल वज़न और इंजन फ़ाइलें ब्राउज़र में कैश की जाती हैं, इसलिए पृष्ठ दूसरी बार तेज़ी से प्रारंभ होता है।

जहां यह असहज होगा. आपको Chrome या Edge चाहिए - WebCodecs हर जगह उपलब्ध नहीं है। प्रोसेसर पर एक लंबा वीडियो तेज़ नहीं माना जाता है: स्रोत सामग्री के एक मिनट में कई मिनट लग सकते हैं। और कमजोर लैपटॉप पर 4K न चलाना बेहतर है - 720p से शुरू करें, परिणाम देखें, फिर रिज़ॉल्यूशन बढ़ाएं।

चरित्र विकास: दो गलतियाँ जो परिणाम को ख़त्म कर देती हैं

उसी वीडियो की दूसरी तकनीक है चरित्र का सही विकास। यह एक ऐसी तस्वीर है जिसमें चेहरा और कपड़े अलग-अलग दिखाए गए हैं। यह इस बात पर निर्भर करता है कि इसे कैसे असेंबल किया गया है कि चेहरा पीढ़ी में तैरता रहेगा या अपनी जगह पर बना रहेगा।

पहली गलती: चेहरा और कपड़े अलग-अलग पैमाने पर खींचे जाते हैं। मॉडल समझ नहीं पाती है कि यह एक ही व्यक्ति है, और खुद ही अनुपात पूरा करना शुरू कर देती है। त्रुटि दो: स्कैन को अलग-अलग लोगों के टुकड़ों से इकट्ठा किया गया है - फिर आउटपुट एक औसत विदेशी चेहरा है, और फ़िल्टर फिर से काम करता है।

कार्य विकल्प एक स्कैन, एक व्यक्ति, दोनों हिस्सों पर समान प्रकाश और कोण है।

यदि पीढ़ी अभी भी किसी पहचानने योग्य व्यक्ति के बारे में त्रुटि के साथ विफल हो जाती है

ऐसा होता है कि गहराई का नक्शा जगह पर है, स्कैन सही ढंग से इकट्ठा किया गया है, लेकिन Seedance अभी भी मना कर देता है। इसका मतलब है कि समस्या चित्रों में से एक में है, और हमें इसे ढूंढने की आवश्यकता है।

विधि सरल है - उन्मूलन की विधि। आप संदर्भों को एक-एक करके हटाएं और फिर से प्रारंभ करें। जैसे ही पीढ़ी बीत जाती है, आखिरी हटाई गई तस्वीर दोष देने लगती है। फिर आप या तो इसका पुनर्निर्माण करें या इसे गहराई मानचित्र से बदलें।

कब का? हाँ। लेकिन बिना अनुमान लगाए: तीन या चार रनों में आप सटीक कारण देख सकते हैं।

और उसी वीडियो से दूसरी तकनीक: दोषी चित्र पर एक नियमित ग्रिड लगाया जाता है - चेहरे पर भी वर्ग। फ़िल्टर पूरा चेहरा देखना बंद कर देता है, लेकिन पीढ़ी-दर-पीढ़ी विशेषताएं पठनीय बनी रहती हैं। ग्रिड को किसी भी संपादक में रखा जाता है या तंत्रिका नेटवर्क को बस "इस तस्वीर पर एक वर्गाकार ग्रिड लगाने" के लिए कहा जाता है।

किसी भी फिल्म से कैमरा मूवमेंट स्थानांतरित करें

यही तकनीक चेहरे को बदले बिना भी काम करती है। आप एक फिल्म से एक फ्रेम लेते हैं, उससे एक गहराई का नक्शा बनाते हैं, इसे अपने प्रॉम्प्ट के साथ मॉडल को देते हैं - और आपको अपना दृश्य उसी कैमरा मूवमेंट के साथ मिलता है: वही दृष्टिकोण, वही मोड़, वही लय।

जब "सिनेमाई" सवारी की आवश्यकता होती है तो ट्रेलर, पैरोडी और विज्ञापन इसी तरह शूट किए जाते हैं, लेकिन क्रेन वाले कैमरामैन के लिए कोई बजट नहीं है।

आगे क्या होगा

क्रम इस प्रकार है: सबसे पहले गहराई का नक्शा - ब्राउज़र में मुफ़्त, बिना किसी फ़ाइल को डाउनलोड किए और बिना टोकन राइट ऑफ किए। फिर पीढ़ी ही - Seedance 2.5 हमारी वेबसाइट पर, एक चरित्र विकास और संदर्भ भी है।

यदि कोई चीज़ पहली बार काम नहीं करती है, तो 3-5 सेकंड की एक छोटी क्लिप से शुरुआत करें। यह कैमरा मूवमेंट और चेहरे का व्यवहार दोनों दिखाता है, और बहुत कम समय और टोकन लेता है।